Hi,

I only have a couple nit-picks.

On 04/08/2012 09:00 PM, Kieran Kunhya wrote:

> +%macro VECTOR_FMUL 0
> +cglobal vector_fmul, 4,4,2, dst, src0, src1, len
> +%if ARCH_X86_64
> +    movsxd    lenq, lend
> +%endif
> +    lea       lenq, [lenq*4 - 2*mmsize]
> +
> +.loop


You might want to test putting ALIGN 16 before .loop to see if it
improves the speed. It may or may not...

> +    mova      m0,   [src0q + lenq]
> +    mova      m1,   [src0q + lenq + mmsize]
> +    mulps     m0, m0, [src1q + lenq]
> +    mulps     m1, m1, [src1q + lenq + mmsize]
> +    mova      [dstq + lenq], m0
> +    mova      [dstq + lenq + mmsize], m1
> +
> +    sub       lenq, 2*mmsize
> +    jge .loop
> +%if mmsize == 32
> +    vzeroupper
> +    RET
> +%endif
> +    REP_RET


REP_RET can go under %else since it isn't needed in the avx version

other than that, LGTM.

-Justin
_______________________________________________
libav-devel mailing list
[email protected]
https://lists.libav.org/mailman/listinfo/libav-devel

Reply via email to