libavcodec.hg: i386/mpegvideo

comparison i386/mpegvideo_mmx.c @ 2293:15cfba1b97b5 libavcodec

adapting existing mmx/mmx2/sse/3dnow optimizations so they work on x86_64 patch by (Aurelien Jacobs <aurel at gnuage dot org>)

author	michael
date	Mon, 11 Oct 2004 02:19:29 +0000
parents	f65d87bfdd5a
children	ef2149182f1c

comparison

equal deleted inserted replaced

-:8556f080fcc2
+:15cfba1b97b5
 */
 #include "../dsputil.h"
 #include "../mpegvideo.h"
 #include "../avcodec.h"
+#include "mmx.h"
 extern uint8_t zigzag_direct_noperm[64];
 extern uint16_t inv_zigzag_direct16[64];
 static const unsigned long long int mm_wabs __attribute__ ((aligned(8))) = 0xffffffffffffffffULL;
 static void dct_unquantize_h263_intra_mmx(MpegEncContext *s,
 DCTELEM *block, int n, int qscale)
 {
-int level, qmul, qadd, nCoeffs;
+long level, qmul, qadd, nCoeffs;
 qmul = qscale << 1;
 assert(s->block_last_index[n]>=0 || s->h263_aic);
 		"pandn %%mm3, %%mm1		\n\t"
 		"movq %%mm0, (%0, %3)		\n\t"
 		"movq %%mm1, 8(%0, %3)		\n\t"
-		"addl $16, %3			\n\t"
+		"add $16, %3			\n\t"
 		"jng 1b				\n\t"
 		::"r" (block+nCoeffs), "g"(qmul), "g" (qadd), "r" (2*(-nCoeffs))
 		: "memory"
 	);
 block[0]= level;
 static void dct_unquantize_h263_inter_mmx(MpegEncContext *s,
 DCTELEM *block, int n, int qscale)
 {
-int qmul, qadd, nCoeffs;
+long qmul, qadd, nCoeffs;
 qmul = qscale << 1;
 qadd = (qscale - 1) | 1;
 assert(s->block_last_index[n]>=0 || s->h263_aic);
 		"pandn %%mm3, %%mm1		\n\t"
 		"movq %%mm0, (%0, %3)		\n\t"
 		"movq %%mm1, 8(%0, %3)		\n\t"
-		"addl $16, %3			\n\t"
+		"add $16, %3			\n\t"
 		"jng 1b				\n\t"
 		::"r" (block+nCoeffs), "g"(qmul), "g" (qadd), "r" (2*(-nCoeffs))
 		: "memory"
 	);
 }
 high3 += tlow1
 */
 static void dct_unquantize_mpeg1_intra_mmx(MpegEncContext *s,
 DCTELEM *block, int n, int qscale)
 {
-int nCoeffs;
+long nCoeffs;
 const uint16_t *quant_matrix;
 int block0;
 assert(s->block_last_index[n]>=0);
 		"pcmpeqw %%mm7, %%mm7		\n\t"
 		"psrlw $15, %%mm7		\n\t"
 		"movd %2, %%mm6			\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
-"movl %3, %%eax			\n\t"
+		"mov %3, %%"REG_a"		\n\t"
 		".balign 16\n\t"
 		"1:				\n\t"
-		"movq (%0, %%eax), %%mm0	\n\t"
+		"movq (%0, %%"REG_a"), %%mm0	\n\t"
-		"movq 8(%0, %%eax), %%mm1	\n\t"
+		"movq 8(%0, %%"REG_a"), %%mm1	\n\t"
-		"movq (%1, %%eax), %%mm4	\n\t"
+		"movq (%1, %%"REG_a"), %%mm4	\n\t"
-		"movq 8(%1, %%eax), %%mm5	\n\t"
+		"movq 8(%1, %%"REG_a"), %%mm5	\n\t"
 		"pmullw %%mm6, %%mm4		\n\t" // q=qscale*quant_matrix[i]
 		"pmullw %%mm6, %%mm5		\n\t" // q=qscale*quant_matrix[i]
 		"pxor %%mm2, %%mm2		\n\t"
 		"pxor %%mm3, %%mm3		\n\t"
 		"pcmpgtw %%mm0, %%mm2		\n\t" // block[i] < 0 ? -1 : 0
 		"psubw %%mm3, %%mm1		\n\t" // abs(block[i])
 		"pmullw %%mm4, %%mm0		\n\t" // abs(block[i])*q
 		"pmullw %%mm5, %%mm1		\n\t" // abs(block[i])*q
 		"pxor %%mm4, %%mm4		\n\t"
 		"pxor %%mm5, %%mm5		\n\t" // FIXME slow
-		"pcmpeqw (%0, %%eax), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw (%0, %%"REG_a"), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
-		"pcmpeqw 8(%0, %%eax), %%mm5	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw 8(%0, %%"REG_a"), %%mm5\n\t" // block[i] == 0 ? -1 : 0
 		"psraw $3, %%mm0		\n\t"
 		"psraw $3, %%mm1		\n\t"
 		"psubw %%mm7, %%mm0		\n\t"
 		"psubw %%mm7, %%mm1		\n\t"
 		"por %%mm7, %%mm0		\n\t"
 		"pxor %%mm3, %%mm1		\n\t"
 		"psubw %%mm2, %%mm0		\n\t"
 		"psubw %%mm3, %%mm1		\n\t"
 		"pandn %%mm0, %%mm4		\n\t"
 		"pandn %%mm1, %%mm5		\n\t"
-		"movq %%mm4, (%0, %%eax)	\n\t"
+		"movq %%mm4, (%0, %%"REG_a")	\n\t"
-		"movq %%mm5, 8(%0, %%eax)	\n\t"
+		"movq %%mm5, 8(%0, %%"REG_a")	\n\t"
-		"addl $16, %%eax		\n\t"
+		"add $16, %%"REG_a"		\n\t"
 		"js 1b				\n\t"
 		::"r" (block+nCoeffs), "r"(quant_matrix+nCoeffs), "g" (qscale), "g" (-2*nCoeffs)
-		: "%eax", "memory"
+		: "%"REG_a, "memory"
 	);
 block[0]= block0;
 }
 static void dct_unquantize_mpeg1_inter_mmx(MpegEncContext *s,
 DCTELEM *block, int n, int qscale)
 {
-int nCoeffs;
+long nCoeffs;
 const uint16_t *quant_matrix;
 assert(s->block_last_index[n]>=0);
 nCoeffs= s->intra_scantable.raster_end[ s->block_last_index[n] ]+1;
 		"pcmpeqw %%mm7, %%mm7		\n\t"
 		"psrlw $15, %%mm7		\n\t"
 		"movd %2, %%mm6			\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
-"movl %3, %%eax			\n\t"
+		"mov %3, %%"REG_a"		\n\t"
 		".balign 16\n\t"
 		"1:				\n\t"
-		"movq (%0, %%eax), %%mm0	\n\t"
+		"movq (%0, %%"REG_a"), %%mm0	\n\t"
-		"movq 8(%0, %%eax), %%mm1	\n\t"
+		"movq 8(%0, %%"REG_a"), %%mm1	\n\t"
-		"movq (%1, %%eax), %%mm4	\n\t"
+		"movq (%1, %%"REG_a"), %%mm4	\n\t"
-		"movq 8(%1, %%eax), %%mm5	\n\t"
+		"movq 8(%1, %%"REG_a"), %%mm5	\n\t"
 		"pmullw %%mm6, %%mm4		\n\t" // q=qscale*quant_matrix[i]
 		"pmullw %%mm6, %%mm5		\n\t" // q=qscale*quant_matrix[i]
 		"pxor %%mm2, %%mm2		\n\t"
 		"pxor %%mm3, %%mm3		\n\t"
 		"pcmpgtw %%mm0, %%mm2		\n\t" // block[i] < 0 ? -1 : 0
 		"paddw %%mm7, %%mm1		\n\t" // abs(block[i])*2 + 1
 		"pmullw %%mm4, %%mm0		\n\t" // (abs(block[i])*2 + 1)*q
 		"pmullw %%mm5, %%mm1		\n\t" // (abs(block[i])*2 + 1)*q
 		"pxor %%mm4, %%mm4		\n\t"
 		"pxor %%mm5, %%mm5		\n\t" // FIXME slow
-		"pcmpeqw (%0, %%eax), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw (%0, %%"REG_a"), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
-		"pcmpeqw 8(%0, %%eax), %%mm5	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw 8(%0, %%"REG_a"), %%mm5\n\t" // block[i] == 0 ? -1 : 0
 		"psraw $4, %%mm0		\n\t"
 		"psraw $4, %%mm1		\n\t"
 		"psubw %%mm7, %%mm0		\n\t"
 		"psubw %%mm7, %%mm1		\n\t"
 		"por %%mm7, %%mm0		\n\t"
 		"pxor %%mm3, %%mm1		\n\t"
 		"psubw %%mm2, %%mm0		\n\t"
 		"psubw %%mm3, %%mm1		\n\t"
 		"pandn %%mm0, %%mm4		\n\t"
 		"pandn %%mm1, %%mm5		\n\t"
-		"movq %%mm4, (%0, %%eax)	\n\t"
+		"movq %%mm4, (%0, %%"REG_a")	\n\t"
-		"movq %%mm5, 8(%0, %%eax)	\n\t"
+		"movq %%mm5, 8(%0, %%"REG_a")	\n\t"
-		"addl $16, %%eax		\n\t"
+		"add $16, %%"REG_a"		\n\t"
 		"js 1b				\n\t"
 		::"r" (block+nCoeffs), "r"(quant_matrix+nCoeffs), "g" (qscale), "g" (-2*nCoeffs)
-		: "%eax", "memory"
+		: "%"REG_a, "memory"
 	);
 }
 static void dct_unquantize_mpeg2_intra_mmx(MpegEncContext *s,
 DCTELEM *block, int n, int qscale)
 {
-int nCoeffs;
+long nCoeffs;
 const uint16_t *quant_matrix;
 int block0;
 assert(s->block_last_index[n]>=0);
 		"pcmpeqw %%mm7, %%mm7		\n\t"
 		"psrlw $15, %%mm7		\n\t"
 		"movd %2, %%mm6			\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
-"movl %3, %%eax			\n\t"
+		"mov %3, %%"REG_a"		\n\t"
 		".balign 16\n\t"
 		"1:				\n\t"
-		"movq (%0, %%eax), %%mm0	\n\t"
+		"movq (%0, %%"REG_a"), %%mm0	\n\t"
-		"movq 8(%0, %%eax), %%mm1	\n\t"
+		"movq 8(%0, %%"REG_a"), %%mm1	\n\t"
-		"movq (%1, %%eax), %%mm4	\n\t"
+		"movq (%1, %%"REG_a"), %%mm4	\n\t"
-		"movq 8(%1, %%eax), %%mm5	\n\t"
+		"movq 8(%1, %%"REG_a"), %%mm5	\n\t"
 		"pmullw %%mm6, %%mm4		\n\t" // q=qscale*quant_matrix[i]
 		"pmullw %%mm6, %%mm5		\n\t" // q=qscale*quant_matrix[i]
 		"pxor %%mm2, %%mm2		\n\t"
 		"pxor %%mm3, %%mm3		\n\t"
 		"pcmpgtw %%mm0, %%mm2		\n\t" // block[i] < 0 ? -1 : 0
 		"psubw %%mm3, %%mm1		\n\t" // abs(block[i])
 		"pmullw %%mm4, %%mm0		\n\t" // abs(block[i])*q
 		"pmullw %%mm5, %%mm1		\n\t" // abs(block[i])*q
 		"pxor %%mm4, %%mm4		\n\t"
 		"pxor %%mm5, %%mm5		\n\t" // FIXME slow
-		"pcmpeqw (%0, %%eax), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw (%0, %%"REG_a"), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
-		"pcmpeqw 8(%0, %%eax), %%mm5	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw 8(%0, %%"REG_a"), %%mm5\n\t" // block[i] == 0 ? -1 : 0
 		"psraw $3, %%mm0		\n\t"
 		"psraw $3, %%mm1		\n\t"
 		"pxor %%mm2, %%mm0		\n\t"
 		"pxor %%mm3, %%mm1		\n\t"
 		"psubw %%mm2, %%mm0		\n\t"
 		"psubw %%mm3, %%mm1		\n\t"
 		"pandn %%mm0, %%mm4		\n\t"
 		"pandn %%mm1, %%mm5		\n\t"
-		"movq %%mm4, (%0, %%eax)	\n\t"
+		"movq %%mm4, (%0, %%"REG_a")	\n\t"
-		"movq %%mm5, 8(%0, %%eax)	\n\t"
+		"movq %%mm5, 8(%0, %%"REG_a")	\n\t"
-		"addl $16, %%eax		\n\t"
+		"add $16, %%"REG_a"		\n\t"
 		"jng 1b				\n\t"
 		::"r" (block+nCoeffs), "r"(quant_matrix+nCoeffs), "g" (qscale), "g" (-2*nCoeffs)
-		: "%eax", "memory"
+		: "%"REG_a, "memory"
 	);
 block[0]= block0;
 //Note, we dont do mismatch control for intra as errors cannot accumulate
 }
 static void dct_unquantize_mpeg2_inter_mmx(MpegEncContext *s,
 DCTELEM *block, int n, int qscale)
 {
-int nCoeffs;
+long nCoeffs;
 const uint16_t *quant_matrix;
 assert(s->block_last_index[n]>=0);
 if(s->alternate_scan) nCoeffs= 63; //FIXME
 		"pcmpeqw %%mm7, %%mm7		\n\t"
 "psrlq $48, %%mm7		\n\t"
 		"movd %2, %%mm6			\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
 		"packssdw %%mm6, %%mm6		\n\t"
-"movl %3, %%eax			\n\t"
+		"mov %3, %%"REG_a"		\n\t"
 		".balign 16\n\t"
 		"1:				\n\t"
-		"movq (%0, %%eax), %%mm0	\n\t"
+		"movq (%0, %%"REG_a"), %%mm0	\n\t"
-		"movq 8(%0, %%eax), %%mm1	\n\t"
+		"movq 8(%0, %%"REG_a"), %%mm1	\n\t"
-		"movq (%1, %%eax), %%mm4	\n\t"
+		"movq (%1, %%"REG_a"), %%mm4	\n\t"
-		"movq 8(%1, %%eax), %%mm5	\n\t"
+		"movq 8(%1, %%"REG_a"), %%mm5	\n\t"
 		"pmullw %%mm6, %%mm4		\n\t" // q=qscale*quant_matrix[i]
 		"pmullw %%mm6, %%mm5		\n\t" // q=qscale*quant_matrix[i]
 		"pxor %%mm2, %%mm2		\n\t"
 		"pxor %%mm3, %%mm3		\n\t"
 		"pcmpgtw %%mm0, %%mm2		\n\t" // block[i] < 0 ? -1 : 0
 		"pmullw %%mm5, %%mm1		\n\t" // abs(block[i])*2*q
 		"paddw %%mm4, %%mm0		\n\t" // (abs(block[i])*2 + 1)*q
 		"paddw %%mm5, %%mm1		\n\t" // (abs(block[i])*2 + 1)*q
 		"pxor %%mm4, %%mm4		\n\t"
 		"pxor %%mm5, %%mm5		\n\t" // FIXME slow
-		"pcmpeqw (%0, %%eax), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw (%0, %%"REG_a"), %%mm4	\n\t" // block[i] == 0 ? -1 : 0
-		"pcmpeqw 8(%0, %%eax), %%mm5	\n\t" // block[i] == 0 ? -1 : 0
+		"pcmpeqw 8(%0, %%"REG_a"), %%mm5\n\t" // block[i] == 0 ? -1 : 0
 		"psrlw $4, %%mm0		\n\t"
 		"psrlw $4, %%mm1		\n\t"
 		"pxor %%mm2, %%mm0		\n\t"
 		"pxor %%mm3, %%mm1		\n\t"
 		"psubw %%mm2, %%mm0		\n\t"
 		"psubw %%mm3, %%mm1		\n\t"
 		"pandn %%mm0, %%mm4		\n\t"
 		"pandn %%mm1, %%mm5		\n\t"
 "pxor %%mm4, %%mm7		\n\t"
 "pxor %%mm5, %%mm7		\n\t"
-		"movq %%mm4, (%0, %%eax)	\n\t"
+		"movq %%mm4, (%0, %%"REG_a")	\n\t"
-		"movq %%mm5, 8(%0, %%eax)	\n\t"
+		"movq %%mm5, 8(%0, %%"REG_a")	\n\t"
-		"addl $16, %%eax		\n\t"
+		"add $16, %%"REG_a"		\n\t"
 		"jng 1b				\n\t"
 "movd 124(%0, %3), %%mm0	\n\t"
 "movq %%mm7, %%mm6		\n\t"
 "psrlq $32, %%mm7		\n\t"
 "pxor %%mm6, %%mm7		\n\t"
 "psrlq $15, %%mm7		\n\t"
 "pxor %%mm7, %%mm0		\n\t"
 "movd %%mm0, 124(%0, %3)	\n\t"
 		::"r" (block+nCoeffs), "r"(quant_matrix+nCoeffs), "g" (qscale), "r" (-2*nCoeffs)
-		: "%eax", "memory"
+		: "%"REG_a, "memory"
 	);
 }
 /* draw the edges of width 'w' of an image of size width, height
 this mmx version can only handle w==8 || w==16 */
 		"movq -8(%0, %2), %%mm1		\n\t"
 		"punpckhbw %%mm1, %%mm1		\n\t"
 		"punpckhwd %%mm1, %%mm1		\n\t"
 		"punpckhdq %%mm1, %%mm1		\n\t"
 		"movq %%mm1, (%0, %2)		\n\t"
-		"addl %1, %0			\n\t"
+		"add %1, %0			\n\t"
-		"cmpl %3, %0			\n\t"
+		"cmp %3, %0			\n\t"
 		" jb 1b				\n\t"
 		: "+r" (ptr)
-		: "r" (wrap), "r" (width), "r" (ptr + wrap*height)
+		: "r" ((long)wrap), "r" ((long)width), "r" (ptr + wrap*height)
 	);
 }
 else
 {
 	asm volatile(
 		"punpckhbw %%mm1, %%mm1		\n\t"
 		"punpckhwd %%mm1, %%mm1		\n\t"
 		"punpckhdq %%mm1, %%mm1		\n\t"
 		"movq %%mm1, (%0, %2)		\n\t"
 		"movq %%mm1, 8(%0, %2)		\n\t"
-		"addl %1, %0			\n\t"
+		"add %1, %0			\n\t"
-		"cmpl %3, %0			\n\t"
+		"cmp %3, %0			\n\t"
 		" jb 1b				\n\t"
 		: "+r" (ptr)
-		: "r" (wrap), "r" (width), "r" (ptr + wrap*height)
+		: "r" ((long)wrap), "r" ((long)width), "r" (ptr + wrap*height)
 	);
 }
 for(i=0;i<w;i+=4) {
 /* top and bottom (and hopefully also the corners) */
 		"movq (%1, %0), %%mm0		\n\t"
 		"movq %%mm0, (%0)		\n\t"
 		"movq %%mm0, (%0, %2)		\n\t"
 		"movq %%mm0, (%0, %2, 2)	\n\t"
 		"movq %%mm0, (%0, %3)		\n\t"
-		"addl $8, %0			\n\t"
+		"add $8, %0			\n\t"
-		"cmpl %4, %0			\n\t"
+		"cmp %4, %0			\n\t"
 		" jb 1b				\n\t"
 		: "+r" (ptr)
-		: "r" ((int)buf - (int)ptr - w), "r" (-wrap), "r" (-wrap*3), "r" (ptr+width+2*w)
+		: "r" ((long)buf - (long)ptr - w), "r" ((long)-wrap), "r" ((long)-wrap*3), "r" (ptr+width+2*w)
 	);
 	ptr= last_line + (i + 1) * wrap - w;
 	asm volatile(
 		"1:				\n\t"
 		"movq (%1, %0), %%mm0		\n\t"
 		"movq %%mm0, (%0)		\n\t"
 		"movq %%mm0, (%0, %2)		\n\t"
 		"movq %%mm0, (%0, %2, 2)	\n\t"
 		"movq %%mm0, (%0, %3)		\n\t"
-		"addl $8, %0			\n\t"
+		"add $8, %0			\n\t"
-		"cmpl %4, %0			\n\t"
+		"cmp %4, %0			\n\t"
 		" jb 1b				\n\t"
 		: "+r" (ptr)
-		: "r" ((int)last_line - (int)ptr - w), "r" (wrap), "r" (wrap*3), "r" (ptr+width+2*w)
+		: "r" ((long)last_line - (long)ptr - w), "r" ((long)wrap), "r" ((long)wrap*3), "r" (ptr+width+2*w)
 	);
 }
 }
 static void  denoise_dct_mmx(MpegEncContext *s, DCTELEM *block){
 "paddd 24(%1), %%mm3		\n\t"
 "movq %%mm4, (%1)		\n\t"
 "movq %%mm2, 8(%1)		\n\t"
 "movq %%mm5, 16(%1)		\n\t"
 "movq %%mm3, 24(%1)		\n\t"
-"addl $16, %0			\n\t"
+"add $16, %0			\n\t"
-"addl $32, %1			\n\t"
+"add $32, %1			\n\t"
-"addl $16, %2			\n\t"
+"add $16, %2			\n\t"
-"cmpl %3, %0			\n\t"
+"cmp %3, %0			\n\t"
 " jb 1b			\n\t"
 : "+r" (block), "+r" (sum), "+r" (offset)
 : "r"(block+64)
 );
 }
 "paddd 48(%1), %%xmm0		\n\t"
 "movdqa %%xmm4, (%1)		\n\t"
 "movdqa %%xmm6, 16(%1)		\n\t"
 "movdqa %%xmm5, 32(%1)		\n\t"
 "movdqa %%xmm0, 48(%1)		\n\t"
-"addl $32, %0			\n\t"
+"add $32, %0			\n\t"
-"addl $64, %1			\n\t"
+"add $64, %1			\n\t"
-"addl $32, %2			\n\t"
+"add $32, %2			\n\t"
-"cmpl %3, %0			\n\t"
+"cmp %3, %0			\n\t"
 " jb 1b			\n\t"
 : "+r" (block), "+r" (sum), "+r" (offset)
 : "r"(block+64)
 );
 }

Mercurial > libavcodec.hg

comparison i386/mpegvideo_mmx.c @ 2293:15cfba1b97b5 libavcodec