Hi, I only have a couple nit-picks.
On 04/08/2012 09:00 PM, Kieran Kunhya wrote: > +%macro VECTOR_FMUL 0 > +cglobal vector_fmul, 4,4,2, dst, src0, src1, len > +%if ARCH_X86_64 > + movsxd lenq, lend > +%endif > + lea lenq, [lenq*4 - 2*mmsize] > + > +.loop You might want to test putting ALIGN 16 before .loop to see if it improves the speed. It may or may not... > + mova m0, [src0q + lenq] > + mova m1, [src0q + lenq + mmsize] > + mulps m0, m0, [src1q + lenq] > + mulps m1, m1, [src1q + lenq + mmsize] > + mova [dstq + lenq], m0 > + mova [dstq + lenq + mmsize], m1 > + > + sub lenq, 2*mmsize > + jge .loop > +%if mmsize == 32 > + vzeroupper > + RET > +%endif > + REP_RET REP_RET can go under %else since it isn't needed in the avx version other than that, LGTM. -Justin _______________________________________________ libav-devel mailing list [email protected] https://lists.libav.org/mailman/listinfo/libav-devel
