This is an automated email from the git hooks/post-receive script.

Git pushed a commit to branch master
in repository ffmpeg.

commit f8ca7c8f15375cfee460a28484cf518bbce75ed9
Author:     Andreas Rheinhardt <[email protected]>
AuthorDate: Mon Aug 24 00:36:19 2026 +0200
Commit:     Andreas Rheinhardt <[email protected]>
CommitDate: Thu Aug 27 00:51:10 2026 +0200

    avcodec/x86/h264_deblock: Combine 32,64 code for deblock_h_luma_8
    
    Signed-off-by: Andreas Rheinhardt <[email protected]>
---
 libavcodec/x86/h264_deblock.asm | 221 ++++++++++++++--------------------------
 1 file changed, 79 insertions(+), 142 deletions(-)

diff --git a/libavcodec/x86/h264_deblock.asm b/libavcodec/x86/h264_deblock.asm
index f359b59a36..303b2aed66 100644
--- a/libavcodec/x86/h264_deblock.asm
+++ b/libavcodec/x86/h264_deblock.asm
@@ -206,14 +206,15 @@ cextern pb_3
     mova    %4, %2
 %endmacro
 
-%if ARCH_X86_64
 ;-----------------------------------------------------------------------------
 ; void ff_deblock_v_luma(uint8_t *pix, ptrdiff_t stride, int alpha, int beta,
 ;                        int8_t *tc0)
 ;-----------------------------------------------------------------------------
 %macro DEBLOCK_LUMA 0
-cglobal deblock_v_luma_8, 5,5,10, pix_, stride_, alpha_, beta_, base3_
+cglobal deblock_v_luma_8, 5,5,10, 32*ARCH_X86_32, pix_, stride_, alpha_, 
beta_, base3_
+%if ARCH_X86_64
     movd    m8, [r4] ; tc0
+%endif
     lea     r4, [stride_q*3]
     dec     alpha_d        ; alpha-1
     neg     r4
@@ -226,27 +227,54 @@ cglobal deblock_v_luma_8, 5,5,10, pix_, stride_, alpha_, 
beta_, base3_
     mova    m3, [pix_q + stride_q]   ; q1
     LOAD_MASK r2d, r3d
 
+%if ARCH_X86_64
     punpcklbw m8, m8
+    movdqa  m3, [base3_q] ; p2
     punpcklbw m8, m8 ; tc = 4x tc0[3], 4x tc0[2], 4x tc0[1], 4x tc0[0]
     pcmpeqb m9, m9
     pcmpeqb m9, m8
     pandn   m9, m7
     pand    m8, m9
+%else
+    mov     r3, r4mp
+    pcmpeqb m3, m3
+    movd    m4, [r3] ; tc0
+    punpcklbw m4, m4
+    punpcklbw m4, m4 ; tc = 4x tc0[3], 4x tc0[2], 4x tc0[1], 4x tc0[0]
+    mova   [esp+16], m4 ; tc
+    pcmpgtb m4, m3  ; tc >= 0
+    mova    m3, [base3_q] ; p2
+    pand    m4, m7  ; tc >= 0 && m7
+    mova   [esp], m4 ; mask, i.e. m9
+%endif
 
-    movdqa  m3, [base3_q] ; p2
     DIFF_GT2 m1, m3, m5, m6, m7 ; |p2-p0| > beta-1
+%if ARCH_X86_64
     pand    m6, m9
     psubb   m7, m8, m6
     pand    m6, m8
+%else
+    pand    m6, m4
+    pand    m4, [esp+16] ; tc
+    psubb   m7, m4, m6
+    pand    m6, m4
+%endif
     LUMA_Q1 m0, m3, [base3_q], [base3_q + stride_q], m6, m4
 
     movdqa  m4, [pix_q + 2*stride_q] ; q2
     DIFF_GT2 m2, m4, m5, m6, m3 ; |q2-q0| > beta-1
+%if ARCH_X86_64
     pand    m6, m9
-    pand    m8, m6
     psubb   m7, m6
+    pand    m6, m8
+%else
+    pand    m6, [esp] ; mask
+    mova    m5, [esp+16] ; tc
+    psubb   m7, m6
+    pand    m6, m5
+%endif
     mova    m3, [pix_q + stride_q]
-    LUMA_Q1 m3, m4, [pix_q + 2*stride_q], [pix_q + stride_q], m8, m6
+    LUMA_Q1 m3, m4, [pix_q + 2*stride_q], [pix_q + stride_q], m6, m5
 
     DEBLOCK_P0_Q0
     mova    [base3_q + 2*stride_q], m1
@@ -257,36 +285,61 @@ cglobal deblock_v_luma_8, 5,5,10, pix_, stride_, alpha_, 
beta_, base3_
 ; void ff_deblock_h_luma(uint8_t *pix, ptrdiff_t stride, int alpha, int beta,
 ;                        int8_t *tc0)
 ;-----------------------------------------------------------------------------
-cglobal deblock_h_luma_8, 5,9,8,0x60+16*WIN64
-    INIT_MMX cpuname
-    lea    r8,  [r1+r1*2]
-    lea    r6,  [r0-4]
-    lea    r5,  [r0-4+r8]
-    mov    r7,  r1
+%if ARCH_X86_64
+cglobal deblock_h_luma_8, 5,9,8,0x60+16*WIN64, pix0, stride0, alpha, beta, 
tc0, pix3, pix, stride, stride3
+    lea         stride3q,  [stride0q*3]
+    lea             pixq,  [pix0q-4]
+    mov          strideq,  stride0q
+    lea            pix3q,  [pix0q-4+stride3q]
 %if WIN64
     %define pix_tmp rsp+0x30 ; shadow space + r4
 %else
     %define pix_tmp rsp
+%endif
+%else
+cglobal deblock_h_luma_8, 2,4,8,0x60+12, pix, stride, pix3, stride3
+    lea         stride3q, [strideq*3]
+    sub             pixq, 4
+    lea            pix3q, [pixq+stride3q]
+%define pix_tmp esp+12
+%define stride0q strideq
+%define pix0q pixq
 %endif
 
+    INIT_MMX cpuname
     ; transpose 6x16 -> tmp space
-    TRANSPOSE6x8_MEM  PASS8ROWS(r6, r5, r1, r8), pix_tmp
-    lea    r0, [r6+r1*8]
-    lea    r5, [r5+r1*8]
-    TRANSPOSE6x8_MEM  PASS8ROWS(r0, r5, r1, r8), pix_tmp+8
+    TRANSPOSE6x8_MEM  PASS8ROWS(pixq, pix3q, stride0q, stride3q), pix_tmp
+    lea            pix0q, [pixq+stride0q*8]
+    lea            pix3q, [pix3q+stride0q*8]
+    TRANSPOSE6x8_MEM  PASS8ROWS(pix0q, pix3q, stride0q, stride3q), pix_tmp+8
 
     ; vertical filter
+    lea            pix0q, [pix_tmp+0x30]
+%if ARCH_X86_64
     ; alpha, beta, tc0 are still in r2d, r3d, r4
     ; don't backup r6, r5, r7, r8 because deblock_v_luma_sse2 doesn't use them
-    lea    r0, [pix_tmp+0x30]
-    mov    r1d, 0x10
+    mov         stride0d, 0x10
 %if WIN64
-    mov    [rsp+0x20], r4
+    mov       [rsp+0x20], tc0q
+%endif
+%else
+    PUSH       dword r4m
+    PUSH       dword r3m
+    PUSH       dword r2m
+    PUSH       dword 16
+    PUSH       dword r0
 %endif
     call   deblock_v_luma_8
 
-    add    r6, 2
-    lea    r5, [r6+r8]
+%if ARCH_X86_64
+    add             pixq, 2
+%else
+    mov             pixq, pixm
+    mov          strideq, stridem
+    sub             pixq, 2
+    ADD              esp, 20
+%endif
+    lea            pix3q, [pixq+stride3q]
 
     INIT_XMM cpuname
 
@@ -298,19 +351,19 @@ cglobal deblock_h_luma_8, 5,9,8,0x60+16*WIN64
     punpcklbw         m4, m0, m1
     punpcklbw         m5, m2, m3
 
-    TRANSPOSE8x4B_STORE m4, m5, PASS8ROWS(r6, r5, r7, r8)
+    TRANSPOSE8x4B_STORE m4, m5, PASS8ROWS(pixq, pix3q, strideq, stride3q)
 
-    lea    r6, [r6+r7*8]
+    lea             pixq, [pixq+strideq*8]
     punpckhbw         m0, m1
-    lea    r5, [r5+r7*8]
+    lea            pix3q, [pix3q+strideq*8]
     punpckhbw         m2, m3
 
-    TRANSPOSE8x4B_STORE m0, m2, PASS8ROWS(r6, r5, r7, r8)
+    TRANSPOSE8x4B_STORE m0, m2, PASS8ROWS(pixq, pix3q, strideq, stride3q)
     RET
 %endmacro
 
 %macro DEBLOCK_H_LUMA_MBAFF 0
-
+%if ARCH_X86_64
 cglobal deblock_h_luma_mbaff_8, 5, 9, 10, 8*16, pix_, stride_, alpha_, beta_, 
tc0_, base3_, stride3_
     dec    alpha_d
     dec    beta_d
@@ -391,7 +444,7 @@ cglobal deblock_h_luma_mbaff_8, 5, 9, 10, 8*16, pix_, 
stride_, alpha_, beta_, tc
     movq [base3_q + 4*stride_q - 4], m7
 
 RET
-
+%endif ; ARCH_X86_64
 %endmacro
 
 INIT_XMM sse2
@@ -404,122 +457,6 @@ DEBLOCK_H_LUMA_MBAFF
 DEBLOCK_LUMA
 %endif
 
-%else
-
-%macro DEBLOCK_LUMA 1
-;-----------------------------------------------------------------------------
-; void ff_deblock_v_luma(uint8_t *pix, ptrdiff_t stride, int alpha, int beta,
-;                        int8_t *tc0)
-;-----------------------------------------------------------------------------
-cglobal deblock_v_luma_8, 5,5,8,2*%1
-    lea     r4, [r1*3]
-    dec     r2     ; alpha-1
-    neg     r4
-    dec     r3     ; beta-1
-    add     r4, r0 ; pix-3*stride
-
-    mova    m0, [r4+r1]   ; p1
-    mova    m1, [r4+2*r1] ; p0
-    mova    m2, [r0]      ; q0
-    mova    m3, [r0+r1]   ; q1
-    LOAD_MASK r2, r3
-
-    mov     r3, r4mp
-    pcmpeqb m3, m3
-    movd    m4, [r3] ; tc0
-    punpcklbw m4, m4
-    punpcklbw m4, m4 ; tc = 4x tc0[3], 4x tc0[2], 4x tc0[1], 4x tc0[0]
-    mova   [esp+%1], m4 ; tc
-    pcmpgtb m4, m3
-    mova    m3, [r4] ; p2
-    pand    m4, m7
-    mova   [esp], m4 ; mask
-
-    DIFF_GT2 m1, m3, m5, m6, m7 ; |p2-p0| > beta-1
-    pand    m6, m4
-    pand    m4, [esp+%1] ; tc
-    psubb   m7, m4, m6
-    pand    m6, m4
-    LUMA_Q1 m0, m3, [r4], [r4+r1], m6, m4
-
-    mova    m4, [r0+2*r1] ; q2
-    DIFF_GT2 m2, m4, m5, m6, m3 ; |q2-q0| > beta-1
-    pand    m6, [esp] ; mask
-    mova    m5, [esp+%1] ; tc
-    psubb   m7, m6
-    pand    m5, m6
-    mova    m3, [r0+r1]
-    LUMA_Q1 m3, m4, [r0+2*r1], [r0+r1], m5, m6
-
-    DEBLOCK_P0_Q0
-    mova    [r4+2*r1], m1
-    mova    [r0], m2
-    RET
-
-;-----------------------------------------------------------------------------
-; void ff_deblock_h_luma(uint8_t *pix, ptrdiff_t stride, int alpha, int beta,
-;                        int8_t *tc0)
-;-----------------------------------------------------------------------------
-cglobal deblock_h_luma_8, 0,5,8,0x60+12
-    INIT_MMX cpuname
-    mov    r0, r0mp
-    mov    r3, r1m
-    lea    r4, [r3*3]
-    sub    r0, 4
-    lea    r1, [r0+r4]
-%define pix_tmp esp+12
-
-    ; transpose 6x16 -> tmp space
-    TRANSPOSE6x8_MEM  PASS8ROWS(r0, r1, r3, r4), pix_tmp
-    lea    r0, [r0+r3*8]
-    lea    r1, [r1+r3*8]
-    TRANSPOSE6x8_MEM  PASS8ROWS(r0, r1, r3, r4), pix_tmp+8
-
-    ; vertical filter
-    lea    r0, [pix_tmp+0x30]
-    PUSH   dword r4m
-    PUSH   dword r3m
-    PUSH   dword r2m
-    PUSH   dword 16
-    PUSH   dword r0
-    call   deblock_v_luma_8
-    ADD    esp, 20
-
-    INIT_XMM cpuname
-
-    ; transpose 16x4 (only the middle 4 rows were changed by the filter)
-    mova       m0, [pix_tmp+0x10]
-    ; the two middle rows are still in the proper registers
-    mova       m3, [pix_tmp+0x40]
-
-    mov        r0, r0mp
-    punpcklbw  m4, m0, m1
-    sub        r0, 2
-    punpcklbw  m5, m2, m3
-    lea        r1, [r0+r4]
-
-    TRANSPOSE8x4B_STORE m4, m5, PASS8ROWS(r0, r1, r3, r4)
-
-    punpckhbw   m0, m1
-    lea    r0, [r0+r3*8]
-    punpckhbw   m2, m3
-    lea    r1, [r1+r3*8]
-
-    TRANSPOSE8x4B_STORE m0, m2, PASS8ROWS(r0, r1, r3, r4)
-
-    RET
-%endmacro ; DEBLOCK_LUMA
-
-INIT_XMM sse2
-DEBLOCK_LUMA 16
-%if HAVE_AVX_EXTERNAL
-INIT_XMM avx
-DEBLOCK_LUMA 16
-%endif
-
-%endif ; ARCH
-
-
 
 %macro LUMA_INTRA_P012 4 ; p0..p3 in memory
 %if ARCH_X86_64

-- 
To stop receiving notification emails like this one, please contact
[email protected].
_______________________________________________
ffmpeg-cvslog mailing list -- [email protected]
To unsubscribe send an email to [email protected]

Reply via email to