libavcodec.hg: x86/dsputil

comparison x86/dsputil_mmx.c @ 10644:5da7180afadf libavcodec

refactor and optimize scalarproduct 29-105% faster apply_filter, 6-90% faster ape decoding on core2 (Any x86 other than core2 probably gets much less, since this is mostly due to ssse3 cachesplit avoidance and I haven't written the full gamut of other cachesplit modes.) 9-123% faster ape decoding on G4.

author	lorenm
date	Sat, 05 Dec 2009 15:09:10 +0000
parents	66242b8fbd32
children	6f958f237d7d

comparison

equal deleted inserted replaced

-:7f6911429cdc
+:5da7180afadf
 #if HAVE_YASM
 void ff_float_to_int16_interleave6_sse(int16_t *dst, const float **src, int len);
 void ff_float_to_int16_interleave6_3dnow(int16_t *dst, const float **src, int len);
 void ff_float_to_int16_interleave6_3dn2(int16_t *dst, const float **src, int len);
-void ff_add_int16_mmx2(int16_t * v1, int16_t * v2, int order);
+int32_t ff_scalarproduct_int16_mmx2(int16_t *v1, int16_t *v2, int order, int shift);
-void ff_add_int16_sse2(int16_t * v1, int16_t * v2, int order);
+int32_t ff_scalarproduct_int16_sse2(int16_t *v1, int16_t *v2, int order, int shift);
-void ff_sub_int16_mmx2(int16_t * v1, int16_t * v2, int order);
+int32_t ff_scalarproduct_and_madd_int16_mmx2(int16_t *v1, int16_t *v2, int16_t *v3, int order, int mul);
-void ff_sub_int16_sse2(int16_t * v1, int16_t * v2, int order);
+int32_t ff_scalarproduct_and_madd_int16_sse2(int16_t *v1, int16_t *v2, int16_t *v3, int order, int mul);
-int32_t ff_scalarproduct_int16_mmx2(int16_t * v1, int16_t * v2, int order, int shift);
+int32_t ff_scalarproduct_and_madd_int16_ssse3(int16_t *v1, int16_t *v2, int16_t *v3, int order, int mul);
-int32_t ff_scalarproduct_int16_sse2(int16_t * v1, int16_t * v2, int order, int shift);
 void ff_add_hfyu_median_prediction_mmx2(uint8_t *dst, const uint8_t *top, const uint8_t *diff, int w, int *left, int *left_top);
 int  ff_add_hfyu_left_prediction_ssse3(uint8_t *dst, const uint8_t *src, int w, int left);
 int  ff_add_hfyu_left_prediction_sse4(uint8_t *dst, const uint8_t *src, int w, int left);
 void ff_x264_deblock_v_luma_sse2(uint8_t *pix, int stride, int alpha, int beta, int8_t *tc0);
 void ff_x264_deblock_h_luma_sse2(uint8_t *pix, int stride, int alpha, int beta, int8_t *tc0);
 c->float_to_int16_interleave = float_to_int16_interleave_3dn2;
 }
 }
 if(mm_flags & FF_MM_MMX2){
 #if HAVE_YASM
-c->add_int16 = ff_add_int16_mmx2;
-c->sub_int16 = ff_sub_int16_mmx2;
 c->scalarproduct_int16 = ff_scalarproduct_int16_mmx2;
+c->scalarproduct_and_madd_int16 = ff_scalarproduct_and_madd_int16_mmx2;
 #endif
 }
 if(mm_flags & FF_MM_SSE){
 c->vorbis_inverse_coupling = vorbis_inverse_coupling_sse;
 c->ac3_downmix = ac3_downmix_sse;
 if(mm_flags & FF_MM_SSE2){
 c->int32_to_float_fmul_scalar = int32_to_float_fmul_scalar_sse2;
 c->float_to_int16 = float_to_int16_sse2;
 c->float_to_int16_interleave = float_to_int16_interleave_sse2;
 #if HAVE_YASM
-c->add_int16 = ff_add_int16_sse2;
-c->sub_int16 = ff_sub_int16_sse2;
 c->scalarproduct_int16 = ff_scalarproduct_int16_sse2;
+c->scalarproduct_and_madd_int16 = ff_scalarproduct_and_madd_int16_sse2;
 #endif
 }
+if((mm_flags & FF_MM_SSSE3) && !(mm_flags & (FF_MM_SSE42|FF_MM_3DNOW)) && HAVE_YASM) // cachesplit
+c->scalarproduct_and_madd_int16 = ff_scalarproduct_and_madd_int16_ssse3;
 }
 if (CONFIG_ENCODERS)
 dsputilenc_init_mmx(c, avctx);

Mercurial > libavcodec.hg

comparison x86/dsputil_mmx.c @ 10644:5da7180afadf libavcodec