libavcodec.hg: arm/h264dsp

annotate arm/h264dsp_neon.S @ 10174:89cd870ca180 libavcodec

Add two more sizes to ff_sine_windows[] and also pad it with NULLs so that FF_ELEMS(ff_sine_windows[x]) == 1 << x. Fix issue 1384.

author	vitor
date	Tue, 15 Sep 2009 16:18:16 +0000
parents	f5ffd813dc7f
children	be725249ea67

rev	line source
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	1 /*
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	2 * Copyright (c) 2008 Mans Rullgard <mans@mansr.com>
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	3 *
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	4 * This file is part of FFmpeg.
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	5 *
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	6 * FFmpeg is free software; you can redistribute it and/or
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	7 * modify it under the terms of the GNU Lesser General Public
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	8 * License as published by the Free Software Foundation; either
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	9 * version 2.1 of the License, or (at your option) any later version.
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	10 *
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	11 * FFmpeg is distributed in the hope that it will be useful,
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	12 * but WITHOUT ANY WARRANTY; without even the implied warranty of
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	13 * MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE. See the GNU
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	14 * Lesser General Public License for more details.
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	15 *
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	16 * You should have received a copy of the GNU Lesser General Public
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	17 * License along with FFmpeg; if not, write to the Free Software
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	18 * Foundation, Inc., 51 Franklin Street, Fifth Floor, Boston, MA 02110-1301 USA
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	19 */
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	20
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	21 #include "asm.S"
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	22
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	23 .fpu neon
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	24
8338 b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	25 .macro transpose_8x8 r0 r1 r2 r3 r4 r5 r6 r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	26 vtrn.32 \r0, \r4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	27 vtrn.32 \r1, \r5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	28 vtrn.32 \r2, \r6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	29 vtrn.32 \r3, \r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	30 vtrn.16 \r0, \r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	31 vtrn.16 \r1, \r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	32 vtrn.16 \r4, \r6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	33 vtrn.16 \r5, \r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	34 vtrn.8 \r0, \r1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	35 vtrn.8 \r2, \r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	36 vtrn.8 \r4, \r5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	37 vtrn.8 \r6, \r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	38 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	39
9864 f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	40 .macro transpose_4x4 r0 r1 r2 r3
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	41 vtrn.16 \r0, \r2
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	42 vtrn.16 \r1, \r3
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	43 vtrn.8 \r0, \r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	44 vtrn.8 \r2, \r3
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	45 .endm
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	46
8338 b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	47 .macro swap4 r0 r1 r2 r3 r4 r5 r6 r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	48 vswp \r0, \r4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	49 vswp \r1, \r5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	50 vswp \r2, \r6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	51 vswp \r3, \r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	52 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	53
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	54 .macro transpose16_4x4 r0 r1 r2 r3 r4 r5 r6 r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	55 vtrn.32 \r0, \r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	56 vtrn.32 \r1, \r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	57 vtrn.32 \r4, \r6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	58 vtrn.32 \r5, \r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	59 vtrn.16 \r0, \r1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	60 vtrn.16 \r2, \r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	61 vtrn.16 \r4, \r5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	62 vtrn.16 \r6, \r7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	63 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	64
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	65 /* chroma_mc8(uint8_t dst, uint8_t src, int stride, int h, int x, int y) */
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	66 .macro h264_chroma_mc8 type
8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	67 function ff_\type\()_h264_chroma_mc8_neon, export=1
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	68 push {r4-r7, lr}
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	69 ldrd r4, [sp, #20]
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	70 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	71 mov lr, r0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	72 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	73 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	74 pld [r1, r2]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	75
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	76 muls r7, r4, r5
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	77 rsb r6, r7, r5, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	78 rsb ip, r7, r4, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	79 sub r4, r7, r4, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	80 sub r4, r4, r5, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	81 add r4, r4, #64
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	82
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	83 beq 2f
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	84
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	85 add r5, r1, r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	86
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	87 vdup.8 d0, r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	88 lsl r4, r2, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	89 vdup.8 d1, ip
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	90 vld1.64 {d4, d5}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	91 vdup.8 d2, r6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	92 vld1.64 {d6, d7}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	93 vdup.8 d3, r7
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	94
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	95 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	96 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	97
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	98 1: pld [r5]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	99 vmull.u8 q8, d4, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	100 vmlal.u8 q8, d5, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	101 vld1.64 {d4, d5}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	102 vmlal.u8 q8, d6, d2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	103 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	104 vmlal.u8 q8, d7, d3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	105 vmull.u8 q9, d6, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	106 subs r3, r3, #2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	107 vmlal.u8 q9, d7, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	108 vmlal.u8 q9, d4, d2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	109 vmlal.u8 q9, d5, d3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	110 vrshrn.u16 d16, q8, #6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	111 vld1.64 {d6, d7}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	112 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	113 vrshrn.u16 d17, q9, #6
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	114 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	115 vld1.64 {d20}, [lr,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	116 vld1.64 {d21}, [lr,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	117 vrhadd.u8 q8, q8, q10
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	118 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	119 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	120 vst1.64 {d16}, [r0,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	121 vst1.64 {d17}, [r0,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	122 bgt 1b
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	123
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	124 pop {r4-r7, pc}
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	125
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	126 2: tst r6, r6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	127 add ip, ip, r6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	128 vdup.8 d0, r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	129 vdup.8 d1, ip
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	130
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	131 beq 4f
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	132
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	133 add r5, r1, r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	134 lsl r4, r2, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	135 vld1.64 {d4}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	136 vld1.64 {d6}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	137
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	138 3: pld [r5]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	139 vmull.u8 q8, d4, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	140 vmlal.u8 q8, d6, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	141 vld1.64 {d4}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	142 vmull.u8 q9, d6, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	143 vmlal.u8 q9, d4, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	144 vld1.64 {d6}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	145 vrshrn.u16 d16, q8, #6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	146 vrshrn.u16 d17, q9, #6
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	147 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	148 vld1.64 {d20}, [lr,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	149 vld1.64 {d21}, [lr,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	150 vrhadd.u8 q8, q8, q10
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	151 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	152 subs r3, r3, #2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	153 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	154 vst1.64 {d16}, [r0,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	155 vst1.64 {d17}, [r0,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	156 bgt 3b
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	157
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	158 pop {r4-r7, pc}
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	159
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	160 4: vld1.64 {d4, d5}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	161 vld1.64 {d6, d7}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	162 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	163 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	164
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	165 5: pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	166 subs r3, r3, #2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	167 vmull.u8 q8, d4, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	168 vmlal.u8 q8, d5, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	169 vld1.64 {d4, d5}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	170 vmull.u8 q9, d6, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	171 vmlal.u8 q9, d7, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	172 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	173 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	174 vrshrn.u16 d16, q8, #6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	175 vrshrn.u16 d17, q9, #6
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	176 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	177 vld1.64 {d20}, [lr,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	178 vld1.64 {d21}, [lr,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	179 vrhadd.u8 q8, q8, q10
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	180 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	181 vld1.64 {d6, d7}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	182 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	183 vst1.64 {d16}, [r0,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	184 vst1.64 {d17}, [r0,:64], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	185 bgt 5b
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	186
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	187 pop {r4-r7, pc}
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	188 .endfunc
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	189 .endm
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	190
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	191 /* chroma_mc4(uint8_t dst, uint8_t src, int stride, int h, int x, int y) */
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	192 .macro h264_chroma_mc4 type
8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	193 function ff_\type\()_h264_chroma_mc4_neon, export=1
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	194 push {r4-r7, lr}
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	195 ldrd r4, [sp, #20]
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	196 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	197 mov lr, r0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	198 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	199 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	200 pld [r1, r2]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	201
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	202 muls r7, r4, r5
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	203 rsb r6, r7, r5, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	204 rsb ip, r7, r4, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	205 sub r4, r7, r4, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	206 sub r4, r4, r5, lsl #3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	207 add r4, r4, #64
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	208
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	209 beq 2f
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	210
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	211 add r5, r1, r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	212
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	213 vdup.8 d0, r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	214 lsl r4, r2, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	215 vdup.8 d1, ip
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	216 vld1.64 {d4}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	217 vdup.8 d2, r6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	218 vld1.64 {d6}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	219 vdup.8 d3, r7
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	220
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	221 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	222 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	223 vtrn.32 d4, d5
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	224 vtrn.32 d6, d7
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	225
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	226 vtrn.32 d0, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	227 vtrn.32 d2, d3
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	228
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	229 1: pld [r5]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	230 vmull.u8 q8, d4, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	231 vmlal.u8 q8, d6, d2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	232 vld1.64 {d4}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	233 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	234 vtrn.32 d4, d5
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	235 vmull.u8 q9, d6, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	236 vmlal.u8 q9, d4, d2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	237 vld1.64 {d6}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	238 vadd.i16 d16, d16, d17
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	239 vadd.i16 d17, d18, d19
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	240 vrshrn.u16 d16, q8, #6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	241 subs r3, r3, #2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	242 pld [r1]
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	243 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	244 vld1.32 {d20[0]}, [lr,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	245 vld1.32 {d20[1]}, [lr,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	246 vrhadd.u8 d16, d16, d20
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	247 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	248 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	249 vtrn.32 d6, d7
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	250 vst1.32 {d16[0]}, [r0,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	251 vst1.32 {d16[1]}, [r0,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	252 bgt 1b
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	253
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	254 pop {r4-r7, pc}
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	255
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	256 2: tst r6, r6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	257 add ip, ip, r6
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	258 vdup.8 d0, r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	259 vdup.8 d1, ip
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	260 vtrn.32 d0, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	261
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	262 beq 4f
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	263
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	264 vext.32 d1, d0, d1, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	265 add r5, r1, r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	266 lsl r4, r2, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	267 vld1.32 {d4[0]}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	268 vld1.32 {d4[1]}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	269
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	270 3: pld [r5]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	271 vmull.u8 q8, d4, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	272 vld1.32 {d4[0]}, [r1], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	273 vmull.u8 q9, d4, d1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	274 vld1.32 {d4[1]}, [r5], r4
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	275 vadd.i16 d16, d16, d17
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	276 vadd.i16 d17, d18, d19
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	277 vrshrn.u16 d16, q8, #6
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	278 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	279 vld1.32 {d20[0]}, [lr,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	280 vld1.32 {d20[1]}, [lr,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	281 vrhadd.u8 d16, d16, d20
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	282 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	283 subs r3, r3, #2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	284 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	285 vst1.32 {d16[0]}, [r0,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	286 vst1.32 {d16[1]}, [r0,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	287 bgt 3b
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	288
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	289 pop {r4-r7, pc}
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	290
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	291 4: vld1.64 {d4}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	292 vld1.64 {d6}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	293 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	294 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	295 vtrn.32 d4, d5
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	296 vtrn.32 d6, d7
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	297
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	298 5: vmull.u8 q8, d4, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	299 vmull.u8 q9, d6, d0
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	300 subs r3, r3, #2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	301 vld1.64 {d4}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	302 vext.8 d5, d4, d5, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	303 vtrn.32 d4, d5
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	304 vadd.i16 d16, d16, d17
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	305 vadd.i16 d17, d18, d19
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	306 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	307 vrshrn.u16 d16, q8, #6
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	308 .ifc \type,avg
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	309 vld1.32 {d20[0]}, [lr,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	310 vld1.32 {d20[1]}, [lr,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	311 vrhadd.u8 d16, d16, d20
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	312 .endif
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	313 vld1.64 {d6}, [r1], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	314 vext.8 d7, d6, d7, #1
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	315 vtrn.32 d6, d7
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	316 pld [r1]
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	317 vst1.32 {d16[0]}, [r0,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	318 vst1.32 {d16[1]}, [r0,:32], r2
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	319 bgt 5b
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	320
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	321 pop {r4-r7, pc}
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	322 .endfunc
8336 c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	323 .endm
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	324
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	325 .text
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	326 .align
c8401acb05d1 ARM: NEON optimised {put,avg}_h264_chroma_mc[48] mru parents: diff changeset	327
8626 8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	328 h264_chroma_mc8 put
8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	329 h264_chroma_mc8 avg
8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	330 h264_chroma_mc4 put
8d425ee85ddb ARM: simplify ff_put/avg_h264_chroma_mc4/8_neon definitions, no code change mru parents: 8359 diff changeset	331 h264_chroma_mc4 avg
8337 d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	332
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	333 /* H.264 loop filter */
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	334
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	335 .macro h264_loop_filter_start
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	336 ldr ip, [sp]
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	337 tst r2, r2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	338 ldr ip, [ip]
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	339 tstne r3, r3
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	340 vmov.32 d24[0], ip
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	341 and ip, ip, ip, lsl #16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	342 bxeq lr
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	343 ands ip, ip, ip, lsl #8
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	344 bxlt lr
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	345 .endm
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	346
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	347 .macro align_push_regs
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	348 and ip, sp, #15
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	349 add ip, ip, #32
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	350 sub sp, sp, ip
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	351 vst1.64 {d12-d15}, [sp,:128]
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	352 sub sp, sp, #32
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	353 vst1.64 {d8-d11}, [sp,:128]
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	354 .endm
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	355
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	356 .macro align_pop_regs
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	357 vld1.64 {d8-d11}, [sp,:128]!
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	358 vld1.64 {d12-d15}, [sp,:128], ip
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	359 .endm
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	360
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	361 .macro h264_loop_filter_luma
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	362 vdup.8 q11, r2 @ alpha
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	363 vmovl.u8 q12, d24
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	364 vabd.u8 q6, q8, q0 @ abs(p0 - q0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	365 vmovl.u16 q12, d24
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	366 vabd.u8 q14, q9, q8 @ abs(p1 - p0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	367 vsli.16 q12, q12, #8
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	368 vabd.u8 q15, q1, q0 @ abs(q1 - q0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	369 vsli.32 q12, q12, #16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	370 vclt.u8 q6, q6, q11 @ < alpha
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	371 vdup.8 q11, r3 @ beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	372 vclt.s8 q7, q12, #0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	373 vclt.u8 q14, q14, q11 @ < beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	374 vclt.u8 q15, q15, q11 @ < beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	375 vbic q6, q6, q7
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	376 vabd.u8 q4, q10, q8 @ abs(p2 - p0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	377 vand q6, q6, q14
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	378 vabd.u8 q5, q2, q0 @ abs(q2 - q0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	379 vclt.u8 q4, q4, q11 @ < beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	380 vand q6, q6, q15
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	381 vclt.u8 q5, q5, q11 @ < beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	382 vand q4, q4, q6
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	383 vand q5, q5, q6
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	384 vand q12, q12, q6
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	385 vrhadd.u8 q14, q8, q0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	386 vsub.i8 q6, q12, q4
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	387 vqadd.u8 q7, q9, q12
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	388 vhadd.u8 q10, q10, q14
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	389 vsub.i8 q6, q6, q5
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	390 vhadd.u8 q14, q2, q14
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	391 vmin.u8 q7, q7, q10
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	392 vqsub.u8 q11, q9, q12
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	393 vqadd.u8 q2, q1, q12
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	394 vmax.u8 q7, q7, q11
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	395 vqsub.u8 q11, q1, q12
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	396 vmin.u8 q14, q2, q14
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	397 vmovl.u8 q2, d0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	398 vmax.u8 q14, q14, q11
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	399 vmovl.u8 q10, d1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	400 vsubw.u8 q2, q2, d16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	401 vsubw.u8 q10, q10, d17
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	402 vshl.i16 q2, q2, #2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	403 vshl.i16 q10, q10, #2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	404 vaddw.u8 q2, q2, d18
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	405 vaddw.u8 q10, q10, d19
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	406 vsubw.u8 q2, q2, d2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	407 vsubw.u8 q10, q10, d3
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	408 vrshrn.i16 d4, q2, #3
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	409 vrshrn.i16 d5, q10, #3
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	410 vbsl q4, q7, q9
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	411 vbsl q5, q14, q1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	412 vneg.s8 q7, q6
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	413 vmovl.u8 q14, d16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	414 vmin.s8 q2, q2, q6
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	415 vmovl.u8 q6, d17
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	416 vmax.s8 q2, q2, q7
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	417 vmovl.u8 q11, d0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	418 vmovl.u8 q12, d1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	419 vaddw.s8 q14, q14, d4
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	420 vaddw.s8 q6, q6, d5
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	421 vsubw.s8 q11, q11, d4
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	422 vsubw.s8 q12, q12, d5
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	423 vqmovun.s16 d16, q14
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	424 vqmovun.s16 d17, q6
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	425 vqmovun.s16 d0, q11
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	426 vqmovun.s16 d1, q12
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	427 .endm
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	428
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	429 function ff_h264_v_loop_filter_luma_neon, export=1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	430 h264_loop_filter_start
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	431
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	432 vld1.64 {d0, d1}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	433 vld1.64 {d2, d3}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	434 vld1.64 {d4, d5}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	435 sub r0, r0, r1, lsl #2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	436 sub r0, r0, r1, lsl #1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	437 vld1.64 {d20,d21}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	438 vld1.64 {d18,d19}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	439 vld1.64 {d16,d17}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	440
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	441 align_push_regs
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	442
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	443 h264_loop_filter_luma
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	444
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	445 sub r0, r0, r1, lsl #1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	446 vst1.64 {d8, d9}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	447 vst1.64 {d16,d17}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	448 vst1.64 {d0, d1}, [r0,:128], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	449 vst1.64 {d10,d11}, [r0,:128]
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	450
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	451 align_pop_regs
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	452 bx lr
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	453 .endfunc
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	454
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	455 function ff_h264_h_loop_filter_luma_neon, export=1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	456 h264_loop_filter_start
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	457
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	458 sub r0, r0, #4
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	459 vld1.64 {d6}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	460 vld1.64 {d20}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	461 vld1.64 {d18}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	462 vld1.64 {d16}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	463 vld1.64 {d0}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	464 vld1.64 {d2}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	465 vld1.64 {d4}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	466 vld1.64 {d26}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	467 vld1.64 {d7}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	468 vld1.64 {d21}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	469 vld1.64 {d19}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	470 vld1.64 {d17}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	471 vld1.64 {d1}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	472 vld1.64 {d3}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	473 vld1.64 {d5}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	474 vld1.64 {d27}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	475
8338 b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	476 transpose_8x8 q3, q10, q9, q8, q0, q1, q2, q13
8337 d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	477
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	478 align_push_regs
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	479
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	480 h264_loop_filter_luma
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	481
9864 f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	482 transpose_4x4 q4, q8, q0, q5
8337 d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	483
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	484 sub r0, r0, r1, lsl #4
9864 f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	485 add r0, r0, #2
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	486 vst1.32 {d8[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	487 vst1.32 {d16[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	488 vst1.32 {d0[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	489 vst1.32 {d10[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	490 vst1.32 {d8[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	491 vst1.32 {d16[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	492 vst1.32 {d0[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	493 vst1.32 {d10[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	494 vst1.32 {d9[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	495 vst1.32 {d17[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	496 vst1.32 {d1[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	497 vst1.32 {d11[0]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	498 vst1.32 {d9[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	499 vst1.32 {d17[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	500 vst1.32 {d1[1]}, [r0], r1
f5ffd813dc7f ARM: slightly faster NEON H264 horizontal loop filter mru parents: 9072 diff changeset	501 vst1.32 {d11[1]}, [r0], r1
8337 d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	502
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	503 align_pop_regs
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	504 bx lr
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	505 .endfunc
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	506
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	507 .macro h264_loop_filter_chroma
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	508 vdup.8 d22, r2 @ alpha
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	509 vmovl.u8 q12, d24
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	510 vabd.u8 d26, d16, d0 @ abs(p0 - q0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	511 vmovl.u8 q2, d0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	512 vabd.u8 d28, d18, d16 @ abs(p1 - p0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	513 vsubw.u8 q2, q2, d16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	514 vsli.16 d24, d24, #8
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	515 vshl.i16 q2, q2, #2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	516 vabd.u8 d30, d2, d0 @ abs(q1 - q0)
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	517 vaddw.u8 q2, q2, d18
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	518 vclt.u8 d26, d26, d22 @ < alpha
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	519 vsubw.u8 q2, q2, d2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	520 vdup.8 d22, r3 @ beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	521 vclt.s8 d25, d24, #0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	522 vrshrn.i16 d4, q2, #3
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	523 vclt.u8 d28, d28, d22 @ < beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	524 vbic d26, d26, d25
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	525 vclt.u8 d30, d30, d22 @ < beta
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	526 vand d26, d26, d28
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	527 vneg.s8 d25, d24
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	528 vand d26, d26, d30
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	529 vmin.s8 d4, d4, d24
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	530 vmovl.u8 q14, d16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	531 vand d4, d4, d26
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	532 vmax.s8 d4, d4, d25
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	533 vmovl.u8 q11, d0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	534 vaddw.s8 q14, q14, d4
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	535 vsubw.s8 q11, q11, d4
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	536 vqmovun.s16 d16, q14
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	537 vqmovun.s16 d0, q11
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	538 .endm
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	539
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	540 function ff_h264_v_loop_filter_chroma_neon, export=1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	541 h264_loop_filter_start
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	542
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	543 sub r0, r0, r1, lsl #1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	544 vld1.64 {d18}, [r0,:64], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	545 vld1.64 {d16}, [r0,:64], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	546 vld1.64 {d0}, [r0,:64], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	547 vld1.64 {d2}, [r0,:64]
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	548
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	549 h264_loop_filter_chroma
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	550
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	551 sub r0, r0, r1, lsl #1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	552 vst1.64 {d16}, [r0,:64], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	553 vst1.64 {d0}, [r0,:64], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	554
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	555 bx lr
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	556 .endfunc
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	557
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	558 function ff_h264_h_loop_filter_chroma_neon, export=1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	559 h264_loop_filter_start
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	560
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	561 sub r0, r0, #2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	562 vld1.32 {d18[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	563 vld1.32 {d16[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	564 vld1.32 {d0[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	565 vld1.32 {d2[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	566 vld1.32 {d18[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	567 vld1.32 {d16[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	568 vld1.32 {d0[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	569 vld1.32 {d2[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	570
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	571 vtrn.16 d18, d0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	572 vtrn.16 d16, d2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	573 vtrn.8 d18, d16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	574 vtrn.8 d0, d2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	575
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	576 h264_loop_filter_chroma
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	577
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	578 vtrn.16 d18, d0
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	579 vtrn.16 d16, d2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	580 vtrn.8 d18, d16
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	581 vtrn.8 d0, d2
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	582
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	583 sub r0, r0, r1, lsl #3
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	584 vst1.32 {d18[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	585 vst1.32 {d16[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	586 vst1.32 {d0[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	587 vst1.32 {d2[0]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	588 vst1.32 {d18[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	589 vst1.32 {d16[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	590 vst1.32 {d0[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	591 vst1.32 {d2[1]}, [r0], r1
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	592
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	593 bx lr
d43b7f4c5c1c ARM: NEON optimised H.264 loop filter mru parents: 8336 diff changeset	594 .endfunc
8338 b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	595
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	596 /* H.264 qpel MC */
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	597
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	598 .macro lowpass_const r
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	599 movw \r, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	600 movt \r, #20
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	601 vmov.32 d6[0], \r
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	602 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	603
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	604 .macro lowpass_8 r0, r1, r2, r3, d0, d1, narrow=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	605 .if \narrow
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	606 t0 .req q0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	607 t1 .req q8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	608 .else
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	609 t0 .req \d0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	610 t1 .req \d1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	611 .endif
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	612 vext.8 d2, \r0, \r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	613 vext.8 d3, \r0, \r1, #3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	614 vaddl.u8 q1, d2, d3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	615 vext.8 d4, \r0, \r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	616 vext.8 d5, \r0, \r1, #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	617 vaddl.u8 q2, d4, d5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	618 vext.8 d30, \r0, \r1, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	619 vaddl.u8 t0, \r0, d30
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	620 vext.8 d18, \r2, \r3, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	621 vmla.i16 t0, q1, d6[1]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	622 vext.8 d19, \r2, \r3, #3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	623 vaddl.u8 q9, d18, d19
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	624 vext.8 d20, \r2, \r3, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	625 vmls.i16 t0, q2, d6[0]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	626 vext.8 d21, \r2, \r3, #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	627 vaddl.u8 q10, d20, d21
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	628 vext.8 d31, \r2, \r3, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	629 vaddl.u8 t1, \r2, d31
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	630 vmla.i16 t1, q9, d6[1]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	631 vmls.i16 t1, q10, d6[0]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	632 .if \narrow
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	633 vqrshrun.s16 \d0, t0, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	634 vqrshrun.s16 \d1, t1, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	635 .endif
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	636 .unreq t0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	637 .unreq t1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	638 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	639
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	640 .macro lowpass_8_1 r0, r1, d0, narrow=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	641 .if \narrow
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	642 t0 .req q0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	643 .else
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	644 t0 .req \d0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	645 .endif
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	646 vext.8 d2, \r0, \r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	647 vext.8 d3, \r0, \r1, #3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	648 vaddl.u8 q1, d2, d3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	649 vext.8 d4, \r0, \r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	650 vext.8 d5, \r0, \r1, #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	651 vaddl.u8 q2, d4, d5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	652 vext.8 d30, \r0, \r1, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	653 vaddl.u8 t0, \r0, d30
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	654 vmla.i16 t0, q1, d6[1]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	655 vmls.i16 t0, q2, d6[0]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	656 .if \narrow
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	657 vqrshrun.s16 \d0, t0, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	658 .endif
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	659 .unreq t0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	660 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	661
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	662 .macro lowpass_8.16 r0, r1, l0, h0, l1, h1, d
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	663 vext.16 q1, \r0, \r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	664 vext.16 q0, \r0, \r1, #3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	665 vaddl.s16 q9, d2, d0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	666 vext.16 q2, \r0, \r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	667 vaddl.s16 q1, d3, d1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	668 vext.16 q3, \r0, \r1, #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	669 vaddl.s16 q10, d4, d6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	670 vext.16 \r1, \r0, \r1, #5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	671 vaddl.s16 q2, d5, d7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	672 vaddl.s16 q0, \h0, \h1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	673 vaddl.s16 q8, \l0, \l1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	674
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	675 vshl.i32 q3, q9, #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	676 vshl.i32 q9, q9, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	677 vshl.i32 q15, q10, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	678 vadd.i32 q9, q9, q3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	679 vadd.i32 q10, q10, q15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	680
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	681 vshl.i32 q3, q1, #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	682 vshl.i32 q1, q1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	683 vshl.i32 q15, q2, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	684 vadd.i32 q1, q1, q3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	685 vadd.i32 q2, q2, q15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	686
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	687 vadd.i32 q9, q9, q8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	688 vsub.i32 q9, q9, q10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	689
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	690 vadd.i32 q1, q1, q0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	691 vsub.i32 q1, q1, q2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	692
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	693 vrshrn.s32 d18, q9, #10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	694 vrshrn.s32 d19, q1, #10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	695
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	696 vqmovun.s16 \d, q9
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	697 .endm
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	698
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	699 function put_h264_qpel16_h_lowpass_neon_packed
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	700 mov r4, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	701 mov ip, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	702 mov r3, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	703 bl put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	704 sub r1, r1, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	705 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	706 mov ip, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	707 mov lr, r4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	708 b put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	709 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	710
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	711 function put_h264_qpel16_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	712 push {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	713 mov ip, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	714 bl put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	715 sub r0, r0, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	716 sub r1, r1, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	717 add r0, r0, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	718 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	719 mov ip, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	720 pop {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	721 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	722
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	723 function put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	724 1: vld1.64 {d0, d1}, [r1], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	725 vld1.64 {d16,d17}, [r1], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	726 subs ip, ip, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	727 lowpass_8 d0, d1, d16, d17, d0, d16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	728 vst1.64 {d0}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	729 vst1.64 {d16}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	730 bne 1b
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	731 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	732 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	733
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	734 function put_h264_qpel16_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	735 push {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	736 mov ip, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	737 bl put_h264_qpel8_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	738 sub r0, r0, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	739 sub r1, r1, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	740 sub r3, r3, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	741 add r0, r0, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	742 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	743 add r3, r3, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	744 mov ip, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	745 pop {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	746 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	747
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	748 function put_h264_qpel8_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	749 1: vld1.64 {d0, d1}, [r1], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	750 vld1.64 {d16,d17}, [r1], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	751 vld1.64 {d28}, [r3], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	752 vld1.64 {d29}, [r3], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	753 subs ip, ip, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	754 lowpass_8 d0, d1, d16, d17, d0, d1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	755 vrhadd.u8 q0, q0, q14
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	756 vst1.64 {d0}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	757 vst1.64 {d1}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	758 bne 1b
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	759 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	760 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	761
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	762 function put_h264_qpel16_v_lowpass_neon_packed
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	763 mov r4, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	764 mov r2, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	765 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	766 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	767 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	768 sub r1, r1, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	769 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	770 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	771 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	772 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	773 mov lr, r4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	774 b put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	775 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	776
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	777 function put_h264_qpel16_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	778 mov r4, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	779 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	780 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	781 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	782 sub r0, r0, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	783 add r0, r0, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	784 sub r1, r1, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	785 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	786 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	787 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	788 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	789 mov lr, r4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	790 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	791
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	792 function put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	793 vld1.64 {d8}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	794 vld1.64 {d10}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	795 vld1.64 {d12}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	796 vld1.64 {d14}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	797 vld1.64 {d22}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	798 vld1.64 {d24}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	799 vld1.64 {d26}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	800 vld1.64 {d28}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	801 vld1.64 {d9}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	802 vld1.64 {d11}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	803 vld1.64 {d13}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	804 vld1.64 {d15}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	805 vld1.64 {d23}, [r1]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	806
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	807 transpose_8x8 q4, q5, q6, q7, q11, q12, q13, q14
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	808 lowpass_8 d8, d9, d10, d11, d8, d10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	809 lowpass_8 d12, d13, d14, d15, d12, d14
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	810 lowpass_8 d22, d23, d24, d25, d22, d24
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	811 lowpass_8 d26, d27, d28, d29, d26, d28
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	812 transpose_8x8 d8, d10, d12, d14, d22, d24, d26, d28
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	813
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	814 vst1.64 {d8}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	815 vst1.64 {d10}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	816 vst1.64 {d12}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	817 vst1.64 {d14}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	818 vst1.64 {d22}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	819 vst1.64 {d24}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	820 vst1.64 {d26}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	821 vst1.64 {d28}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	822
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	823 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	824 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	825
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	826 function put_h264_qpel16_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	827 mov r4, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	828 bl put_h264_qpel8_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	829 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	830 bl put_h264_qpel8_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	831 sub r0, r0, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	832 sub ip, ip, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	833 add r0, r0, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	834 add ip, ip, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	835 sub r1, r1, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	836 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	837 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	838 bl put_h264_qpel8_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	839 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	840 mov lr, r4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	841 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	842
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	843 function put_h264_qpel8_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	844 vld1.64 {d8}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	845 vld1.64 {d10}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	846 vld1.64 {d12}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	847 vld1.64 {d14}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	848 vld1.64 {d22}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	849 vld1.64 {d24}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	850 vld1.64 {d26}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	851 vld1.64 {d28}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	852 vld1.64 {d9}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	853 vld1.64 {d11}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	854 vld1.64 {d13}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	855 vld1.64 {d15}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	856 vld1.64 {d23}, [r1]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	857
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	858 transpose_8x8 q4, q5, q6, q7, q11, q12, q13, q14
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	859 lowpass_8 d8, d9, d10, d11, d8, d9
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	860 lowpass_8 d12, d13, d14, d15, d12, d13
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	861 lowpass_8 d22, d23, d24, d25, d22, d23
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	862 lowpass_8 d26, d27, d28, d29, d26, d27
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	863 transpose_8x8 d8, d9, d12, d13, d22, d23, d26, d27
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	864
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	865 vld1.64 {d0}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	866 vld1.64 {d1}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	867 vld1.64 {d2}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	868 vld1.64 {d3}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	869 vld1.64 {d4}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	870 vrhadd.u8 q0, q0, q4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	871 vld1.64 {d5}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	872 vrhadd.u8 q1, q1, q6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	873 vld1.64 {d10}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	874 vrhadd.u8 q2, q2, q11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	875 vld1.64 {d11}, [ip], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	876
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	877 vst1.64 {d0}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	878 vst1.64 {d1}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	879 vrhadd.u8 q5, q5, q13
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	880 vst1.64 {d2}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	881 vst1.64 {d3}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	882 vst1.64 {d4}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	883 vst1.64 {d5}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	884 vst1.64 {d10}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	885 vst1.64 {d11}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	886
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	887 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	888 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	889
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	890 function put_h264_qpel8_hv_lowpass_neon_top
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	891 lowpass_const ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	892 mov ip, #12
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	893 1: vld1.64 {d0, d1}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	894 vld1.64 {d16,d17}, [r1], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	895 subs ip, ip, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	896 lowpass_8 d0, d1, d16, d17, q11, q12, narrow=0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	897 vst1.64 {d22-d25}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	898 bne 1b
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	899
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	900 vld1.64 {d0, d1}, [r1]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	901 lowpass_8_1 d0, d1, q12, narrow=0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	902
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	903 mov ip, #-16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	904 add r4, r4, ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	905 vld1.64 {d30,d31}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	906 vld1.64 {d20,d21}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	907 vld1.64 {d18,d19}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	908 vld1.64 {d16,d17}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	909 vld1.64 {d14,d15}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	910 vld1.64 {d12,d13}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	911 vld1.64 {d10,d11}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	912 vld1.64 {d8, d9}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	913 vld1.64 {d6, d7}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	914 vld1.64 {d4, d5}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	915 vld1.64 {d2, d3}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	916 vld1.64 {d0, d1}, [r4,:128]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	917
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	918 swap4 d1, d3, d5, d7, d8, d10, d12, d14
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	919 transpose16_4x4 q0, q1, q2, q3, q4, q5, q6, q7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	920
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	921 swap4 d17, d19, d21, d31, d24, d26, d28, d22
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	922 transpose16_4x4 q8, q9, q10, q15, q12, q13, q14, q11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	923
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	924 vst1.64 {d30,d31}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	925 vst1.64 {d6, d7}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	926 vst1.64 {d20,d21}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	927 vst1.64 {d4, d5}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	928 vst1.64 {d18,d19}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	929 vst1.64 {d2, d3}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	930 vst1.64 {d16,d17}, [r4,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	931 vst1.64 {d0, d1}, [r4,:128]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	932
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	933 lowpass_8.16 q4, q12, d8, d9, d24, d25, d8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	934 lowpass_8.16 q5, q13, d10, d11, d26, d27, d9
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	935 lowpass_8.16 q6, q14, d12, d13, d28, d29, d10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	936 lowpass_8.16 q7, q11, d14, d15, d22, d23, d11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	937
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	938 vld1.64 {d16,d17}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	939 vld1.64 {d30,d31}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	940 lowpass_8.16 q8, q15, d16, d17, d30, d31, d12
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	941 vld1.64 {d16,d17}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	942 vld1.64 {d30,d31}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	943 lowpass_8.16 q8, q15, d16, d17, d30, d31, d13
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	944 vld1.64 {d16,d17}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	945 vld1.64 {d30,d31}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	946 lowpass_8.16 q8, q15, d16, d17, d30, d31, d14
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	947 vld1.64 {d16,d17}, [r4,:128], ip
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	948 vld1.64 {d30,d31}, [r4,:128]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	949 lowpass_8.16 q8, q15, d16, d17, d30, d31, d15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	950
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	951 transpose_8x8 d12, d13, d14, d15, d8, d9, d10, d11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	952
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	953 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	954 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	955
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	956 function put_h264_qpel8_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	957 mov r10, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	958 bl put_h264_qpel8_hv_lowpass_neon_top
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	959 vst1.64 {d12}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	960 vst1.64 {d13}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	961 vst1.64 {d14}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	962 vst1.64 {d15}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	963 vst1.64 {d8}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	964 vst1.64 {d9}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	965 vst1.64 {d10}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	966 vst1.64 {d11}, [r0,:64], r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	967
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	968 mov lr, r10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	969 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	970 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	971
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	972 function put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	973 mov r10, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	974 bl put_h264_qpel8_hv_lowpass_neon_top
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	975
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	976 vld1.64 {d0, d1}, [r2,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	977 vld1.64 {d2, d3}, [r2,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	978 vrhadd.u8 q0, q0, q6
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	979 vld1.64 {d4, d5}, [r2,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	980 vrhadd.u8 q1, q1, q7
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	981 vld1.64 {d6, d7}, [r2,:128]!
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	982 vrhadd.u8 q2, q2, q4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	983
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	984 vst1.64 {d0}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	985 vrhadd.u8 q3, q3, q5
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	986 vst1.64 {d1}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	987 vst1.64 {d2}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	988 vst1.64 {d3}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	989 vst1.64 {d4}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	990 vst1.64 {d5}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	991 vst1.64 {d6}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	992 vst1.64 {d7}, [r0,:64], r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	993
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	994 mov lr, r10
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	995 bx lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	996 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	997
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	998 function put_h264_qpel16_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	999 mov r9, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1000 bl put_h264_qpel8_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1001 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1002 bl put_h264_qpel8_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1003 sub r1, r1, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1004 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1005 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1006 sub r0, r0, r2, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1007 add r0, r0, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1008 bl put_h264_qpel8_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1009 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1010 mov lr, r9
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1011 b put_h264_qpel8_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1012 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1013
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1014 function put_h264_qpel16_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1015 mov r9, lr
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1016 sub r2, r4, #256
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1017 bl put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1018 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1019 bl put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1020 sub r1, r1, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1021 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1022 add r1, r1, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1023 sub r0, r0, r3, lsl #4
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1024 add r0, r0, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1025 bl put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1026 sub r1, r1, r3, lsl #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1027 mov lr, r9
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1028 b put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1029 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1030
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1031 function ff_put_h264_qpel8_mc10_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1032 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1033 mov r3, r1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1034 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1035 mov ip, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1036 b put_h264_qpel8_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1037 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1038
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1039 function ff_put_h264_qpel8_mc20_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1040 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1041 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1042 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1043 mov ip, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1044 b put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1045 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1046
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1047 function ff_put_h264_qpel8_mc30_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1048 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1049 add r3, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1050 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1051 mov ip, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1052 b put_h264_qpel8_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1053 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1054
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1055 function ff_put_h264_qpel8_mc01_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1056 push {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1057 mov ip, r1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1058 put_h264_qpel8_mc01:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1059 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1060 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1061 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1062 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1063 bl put_h264_qpel8_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1064 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1065 pop {pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1066 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1067
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1068 function ff_put_h264_qpel8_mc11_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1069 push {r0, r1, r2, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1070 put_h264_qpel8_mc11:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1071 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1072 sub sp, sp, #64
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1073 mov r0, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1074 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1075 mov r3, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1076 mov ip, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1077 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1078 bl put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1079 ldrd r0, [sp, #128]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1080 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1081 add ip, sp, #64
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1082 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1083 mov r2, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1084 bl put_h264_qpel8_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1085 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1086 add sp, sp, #76
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1087 pop {pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1088 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1089
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1090 function ff_put_h264_qpel8_mc21_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1091 push {r0, r1, r4, r10, r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1092 put_h264_qpel8_mc21:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1093 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1094 mov r11, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1095 bic sp, sp, #15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1096 sub sp, sp, #(88+1612)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1097 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1098 mov r3, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1099 mov r0, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1100 mov ip, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1101 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1102 bl put_h264_qpel8_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1103 mov r4, r0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1104 ldrd r0, [r11]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1105 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1106 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1107 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1108 sub r2, r4, #64
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1109 bl put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1110 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1111 add sp, r11, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1112 pop {r4, r10, r11, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1113 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1114
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1115 function ff_put_h264_qpel8_mc31_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1116 add r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1117 push {r0, r1, r2, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1118 sub r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1119 b put_h264_qpel8_mc11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1120 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1121
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1122 function ff_put_h264_qpel8_mc02_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1123 push {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1124 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1125 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1126 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1127 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1128 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1129 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1130 pop {pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1131 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1132
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1133 function ff_put_h264_qpel8_mc12_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1134 push {r0, r1, r4, r10, r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1135 put_h264_qpel8_mc12:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1136 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1137 mov r11, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1138 bic sp, sp, #15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1139 sub sp, sp, #(88+1612)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1140 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1141 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1142 mov r2, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1143 mov r0, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1144 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1145 bl put_h264_qpel8_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1146 mov r4, r0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1147 ldrd r0, [r11]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1148 sub r1, r1, r3, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1149 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1150 sub r2, r4, #64
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1151 bl put_h264_qpel8_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1152 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1153 add sp, r11, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1154 pop {r4, r10, r11, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1155 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1156
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1157 function ff_put_h264_qpel8_mc22_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1158 push {r4, r10, r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1159 mov r11, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1160 bic sp, sp, #15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1161 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1162 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1163 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1164 sub sp, sp, #(16*12)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1165 mov r4, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1166 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1167 bl put_h264_qpel8_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1168 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1169 mov sp, r11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1170 pop {r4, r10, r11, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1171 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1172
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1173 function ff_put_h264_qpel8_mc32_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1174 push {r0, r1, r4, r10, r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1175 add r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1176 b put_h264_qpel8_mc12
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1177 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1178
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1179 function ff_put_h264_qpel8_mc03_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1180 push {lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1181 add ip, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1182 b put_h264_qpel8_mc01
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1183 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1184
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1185 function ff_put_h264_qpel8_mc13_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1186 push {r0, r1, r2, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1187 add r1, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1188 b put_h264_qpel8_mc11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1189 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1190
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1191 function ff_put_h264_qpel8_mc23_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1192 push {r0, r1, r4, r10, r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1193 add r1, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1194 b put_h264_qpel8_mc21
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1195 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1196
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1197 function ff_put_h264_qpel8_mc33_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1198 add r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1199 push {r0, r1, r2, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1200 add r1, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1201 sub r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1202 b put_h264_qpel8_mc11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1203 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1204
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1205 function ff_put_h264_qpel16_mc10_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1206 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1207 mov r3, r1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1208 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1209 b put_h264_qpel16_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1210 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1211
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1212 function ff_put_h264_qpel16_mc20_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1213 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1214 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1215 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1216 b put_h264_qpel16_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1217 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1218
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1219 function ff_put_h264_qpel16_mc30_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1220 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1221 add r3, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1222 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1223 b put_h264_qpel16_h_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1224 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1225
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1226 function ff_put_h264_qpel16_mc01_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1227 push {r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1228 mov ip, r1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1229 put_h264_qpel16_mc01:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1230 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1231 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1232 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1233 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1234 bl put_h264_qpel16_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1235 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1236 pop {r4, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1237 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1238
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1239 function ff_put_h264_qpel16_mc11_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1240 push {r0, r1, r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1241 put_h264_qpel16_mc11:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1242 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1243 sub sp, sp, #256
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1244 mov r0, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1245 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1246 mov r3, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1247 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1248 bl put_h264_qpel16_h_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1249 add r0, sp, #256
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1250 ldrd r0, [r0, #64]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1251 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1252 add ip, sp, #64
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1253 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1254 mov r2, #16
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1255 bl put_h264_qpel16_v_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1256 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1257 add sp, sp, #(256+8)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1258 pop {r4, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1259 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1260
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1261 function ff_put_h264_qpel16_mc21_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1262 push {r0, r1, r4-r5, r9-r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1263 put_h264_qpel16_mc21:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1264 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1265 mov r11, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1266 bic sp, sp, #15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1267 sub sp, sp, #(1616+1612)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1268 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1269 mov r0, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1270 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1271 bl put_h264_qpel16_h_lowpass_neon_packed
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1272 mov r4, r0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1273 ldrd r0, [r11]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1274 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1275 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1276 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1277 bl put_h264_qpel16_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1278 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1279 add sp, r11, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1280 pop {r4-r5, r9-r11, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1281 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1282
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1283 function ff_put_h264_qpel16_mc31_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1284 add r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1285 push {r0, r1, r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1286 sub r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1287 b put_h264_qpel16_mc11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1288 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1289
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1290 function ff_put_h264_qpel16_mc02_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1291 push {r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1292 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1293 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1294 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1295 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1296 bl put_h264_qpel16_v_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1297 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1298 pop {r4, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1299 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1300
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1301 function ff_put_h264_qpel16_mc12_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1302 push {r0, r1, r4-r5, r9-r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1303 put_h264_qpel16_mc12:
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1304 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1305 mov r11, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1306 bic sp, sp, #15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1307 sub sp, sp, #(1616+1612)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1308 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1309 mov r0, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1310 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1311 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1312 bl put_h264_qpel16_v_lowpass_neon_packed
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1313 mov r4, r0
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1314 ldrd r0, [r11]
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1315 sub r1, r1, r3, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1316 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1317 mov r2, r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1318 bl put_h264_qpel16_hv_lowpass_l2_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1319 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1320 add sp, r11, #8
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1321 pop {r4-r5, r9-r11, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1322 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1323
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1324 function ff_put_h264_qpel16_mc22_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1325 push {r4, r9-r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1326 lowpass_const r3
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1327 mov r11, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1328 bic sp, sp, #15
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1329 sub r1, r1, r2, lsl #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1330 sub r1, r1, #2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1331 mov r3, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1332 sub sp, sp, #(16*12)
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1333 mov r4, sp
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1334 vpush {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1335 bl put_h264_qpel16_hv_lowpass_neon
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1336 vpop {d8-d15}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1337 mov sp, r11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1338 pop {r4, r9-r11, pc}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1339 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1340
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1341 function ff_put_h264_qpel16_mc32_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1342 push {r0, r1, r4-r5, r9-r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1343 add r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1344 b put_h264_qpel16_mc12
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1345 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1346
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1347 function ff_put_h264_qpel16_mc03_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1348 push {r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1349 add ip, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1350 b put_h264_qpel16_mc01
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1351 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1352
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1353 function ff_put_h264_qpel16_mc13_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1354 push {r0, r1, r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1355 add r1, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1356 b put_h264_qpel16_mc11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1357 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1358
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1359 function ff_put_h264_qpel16_mc23_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1360 push {r0, r1, r4-r5, r9-r11, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1361 add r1, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1362 b put_h264_qpel16_mc21
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1363 .endfunc
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1364
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1365 function ff_put_h264_qpel16_mc33_neon, export=1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1366 add r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1367 push {r0, r1, r4, lr}
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1368 add r1, r1, r2
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1369 sub r1, r1, #1
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1370 b put_h264_qpel16_mc11
b294a0d5bc50 ARM: NEON optimised H.264 8x8 and 16x16 qpel MC mru parents: 8337 diff changeset	1371 .endfunc
8663 23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1372
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1373 @ Biweighted prediction
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1374
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1375 .macro biweight_16 macs, macd
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1376 vdup.8 d0, r4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1377 vdup.8 d1, r5
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1378 vmov q2, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1379 vmov q3, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1380 1: subs ip, ip, #2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1381 vld1.8 {d20-d21},[r0,:128], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1382 \macd q2, d0, d20
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1383 pld [r0]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1384 \macd q3, d0, d21
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1385 vld1.8 {d22-d23},[r1,:128], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1386 \macs q2, d1, d22
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1387 pld [r1]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1388 \macs q3, d1, d23
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1389 vmov q12, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1390 vld1.8 {d28-d29},[r0,:128], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1391 vmov q13, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1392 \macd q12, d0, d28
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1393 pld [r0]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1394 \macd q13, d0, d29
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1395 vld1.8 {d30-d31},[r1,:128], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1396 \macs q12, d1, d30
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1397 pld [r1]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1398 \macs q13, d1, d31
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1399 vshl.s16 q2, q2, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1400 vshl.s16 q3, q3, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1401 vqmovun.s16 d4, q2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1402 vqmovun.s16 d5, q3
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1403 vshl.s16 q12, q12, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1404 vshl.s16 q13, q13, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1405 vqmovun.s16 d24, q12
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1406 vqmovun.s16 d25, q13
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1407 vmov q3, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1408 vst1.8 {d4- d5}, [r6,:128], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1409 vmov q2, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1410 vst1.8 {d24-d25},[r6,:128], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1411 bne 1b
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1412 pop {r4-r6, pc}
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1413 .endm
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1414
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1415 .macro biweight_8 macs, macd
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1416 vdup.8 d0, r4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1417 vdup.8 d1, r5
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1418 vmov q1, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1419 vmov q10, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1420 1: subs ip, ip, #2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1421 vld1.8 {d4},[r0,:64], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1422 \macd q1, d0, d4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1423 pld [r0]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1424 vld1.8 {d5},[r1,:64], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1425 \macs q1, d1, d5
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1426 pld [r1]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1427 vld1.8 {d6},[r0,:64], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1428 \macd q10, d0, d6
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1429 pld [r0]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1430 vld1.8 {d7},[r1,:64], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1431 \macs q10, d1, d7
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1432 pld [r1]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1433 vshl.s16 q1, q1, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1434 vqmovun.s16 d2, q1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1435 vshl.s16 q10, q10, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1436 vqmovun.s16 d4, q10
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1437 vmov q10, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1438 vst1.8 {d2},[r6,:64], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1439 vmov q1, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1440 vst1.8 {d4},[r6,:64], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1441 bne 1b
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1442 pop {r4-r6, pc}
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1443 .endm
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1444
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1445 .macro biweight_4 macs, macd
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1446 vdup.8 d0, r4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1447 vdup.8 d1, r5
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1448 vmov q1, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1449 vmov q10, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1450 1: subs ip, ip, #4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1451 vld1.32 {d4[0]},[r0,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1452 vld1.32 {d4[1]},[r0,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1453 \macd q1, d0, d4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1454 pld [r0]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1455 vld1.32 {d5[0]},[r1,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1456 vld1.32 {d5[1]},[r1,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1457 \macs q1, d1, d5
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1458 pld [r1]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1459 blt 2f
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1460 vld1.32 {d6[0]},[r0,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1461 vld1.32 {d6[1]},[r0,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1462 \macd q10, d0, d6
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1463 pld [r0]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1464 vld1.32 {d7[0]},[r1,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1465 vld1.32 {d7[1]},[r1,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1466 \macs q10, d1, d7
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1467 pld [r1]
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1468 vshl.s16 q1, q1, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1469 vqmovun.s16 d2, q1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1470 vshl.s16 q10, q10, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1471 vqmovun.s16 d4, q10
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1472 vmov q10, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1473 vst1.32 {d2[0]},[r6,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1474 vst1.32 {d2[1]},[r6,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1475 vmov q1, q8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1476 vst1.32 {d4[0]},[r6,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1477 vst1.32 {d4[1]},[r6,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1478 bne 1b
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1479 pop {r4-r6, pc}
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1480 2: vshl.s16 q1, q1, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1481 vqmovun.s16 d2, q1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1482 vst1.32 {d2[0]},[r6,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1483 vst1.32 {d2[1]},[r6,:32], r2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1484 pop {r4-r6, pc}
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1485 .endm
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1486
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1487 .macro biweight_func w
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1488 function biweight_h264_pixels_\w\()_neon
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1489 push {r4-r6, lr}
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1490 add r4, sp, #16
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1491 ldm r4, {r4-r6}
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1492 lsr lr, r4, #31
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1493 add r6, r6, #1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1494 eors lr, lr, r5, lsr #30
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1495 orr r6, r6, #1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1496 vdup.16 q9, r3
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1497 lsl r6, r6, r3
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1498 vmvn q9, q9
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1499 vdup.16 q8, r6
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1500 mov r6, r0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1501 beq 10f
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1502 subs lr, lr, #1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1503 beq 20f
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1504 subs lr, lr, #1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1505 beq 30f
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1506 b 40f
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1507 10: biweight_\w vmlal.u8, vmlal.u8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1508 20: rsb r4, r4, #0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1509 biweight_\w vmlal.u8, vmlsl.u8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1510 30: rsb r4, r4, #0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1511 rsb r5, r5, #0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1512 biweight_\w vmlsl.u8, vmlsl.u8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1513 40: rsb r5, r5, #0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1514 biweight_\w vmlsl.u8, vmlal.u8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1515 .endfunc
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1516 .endm
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1517
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1518 .macro biweight_entry w, h, b=1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1519 function ff_biweight_h264_pixels_\w\()x\h\()_neon, export=1
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1520 mov ip, #\h
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1521 .if \b
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1522 b biweight_h264_pixels_\w\()_neon
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1523 .endif
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1524 .endfunc
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1525 .endm
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1526
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1527 biweight_entry 16, 8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1528 biweight_entry 16, 16, b=0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1529 biweight_func 16
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1530
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1531 biweight_entry 8, 16
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1532 biweight_entry 8, 4
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1533 biweight_entry 8, 8, b=0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1534 biweight_func 8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1535
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1536 biweight_entry 4, 8
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1537 biweight_entry 4, 2
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1538 biweight_entry 4, 4, b=0
23f7711e777e ARM: NEON optimised H.264 biweighted prediction mru parents: 8626 diff changeset	1539 biweight_func 4
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1540
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1541 @ Weighted prediction
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1542
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1543 .macro weight_16 add
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1544 vdup.8 d0, r3
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1545 1: subs ip, ip, #2
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1546 vld1.8 {d20-d21},[r0,:128], r1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1547 vmull.u8 q2, d0, d20
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1548 pld [r0]
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1549 vmull.u8 q3, d0, d21
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1550 vld1.8 {d28-d29},[r0,:128], r1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1551 vmull.u8 q12, d0, d28
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1552 pld [r0]
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1553 vmull.u8 q13, d0, d29
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1554 \add q2, q8, q2
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1555 vrshl.s16 q2, q2, q9
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1556 \add q3, q8, q3
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1557 vrshl.s16 q3, q3, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1558 vqmovun.s16 d4, q2
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1559 vqmovun.s16 d5, q3
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1560 \add q12, q8, q12
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1561 vrshl.s16 q12, q12, q9
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1562 \add q13, q8, q13
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1563 vrshl.s16 q13, q13, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1564 vqmovun.s16 d24, q12
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1565 vqmovun.s16 d25, q13
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1566 vst1.8 {d4- d5}, [r4,:128], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1567 vst1.8 {d24-d25},[r4,:128], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1568 bne 1b
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1569 pop {r4, pc}
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1570 .endm
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1571
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1572 .macro weight_8 add
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1573 vdup.8 d0, r3
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1574 1: subs ip, ip, #2
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1575 vld1.8 {d4},[r0,:64], r1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1576 vmull.u8 q1, d0, d4
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1577 pld [r0]
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1578 vld1.8 {d6},[r0,:64], r1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1579 vmull.u8 q10, d0, d6
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1580 \add q1, q8, q1
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1581 pld [r0]
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1582 vrshl.s16 q1, q1, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1583 vqmovun.s16 d2, q1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1584 \add q10, q8, q10
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1585 vrshl.s16 q10, q10, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1586 vqmovun.s16 d4, q10
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1587 vst1.8 {d2},[r4,:64], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1588 vst1.8 {d4},[r4,:64], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1589 bne 1b
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1590 pop {r4, pc}
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1591 .endm
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1592
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1593 .macro weight_4 add
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1594 vdup.8 d0, r3
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1595 vmov q1, q8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1596 vmov q10, q8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1597 1: subs ip, ip, #4
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1598 vld1.32 {d4[0]},[r0,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1599 vld1.32 {d4[1]},[r0,:32], r1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1600 vmull.u8 q1, d0, d4
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1601 pld [r0]
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1602 blt 2f
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1603 vld1.32 {d6[0]},[r0,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1604 vld1.32 {d6[1]},[r0,:32], r1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1605 vmull.u8 q10, d0, d6
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1606 pld [r0]
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1607 \add q1, q8, q1
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1608 vrshl.s16 q1, q1, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1609 vqmovun.s16 d2, q1
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1610 \add q10, q8, q10
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1611 vrshl.s16 q10, q10, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1612 vqmovun.s16 d4, q10
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1613 vmov q10, q8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1614 vst1.32 {d2[0]},[r4,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1615 vst1.32 {d2[1]},[r4,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1616 vmov q1, q8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1617 vst1.32 {d4[0]},[r4,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1618 vst1.32 {d4[1]},[r4,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1619 bne 1b
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1620 pop {r4, pc}
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1621 2: \add q1, q8, q1
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1622 vrshl.s16 q1, q1, q9
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1623 vqmovun.s16 d2, q1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1624 vst1.32 {d2[0]},[r4,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1625 vst1.32 {d2[1]},[r4,:32], r1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1626 pop {r4, pc}
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1627 .endm
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1628
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1629 .macro weight_func w
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1630 function weight_h264_pixels_\w\()_neon
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1631 push {r4, lr}
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1632 ldr r4, [sp, #8]
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1633 cmp r2, #1
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1634 lsl r4, r4, r2
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1635 vdup.16 q8, r4
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1636 mov r4, r0
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1637 ble 20f
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1638 rsb lr, r2, #1
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1639 vdup.16 q9, lr
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1640 cmp r3, #0
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1641 blt 10f
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1642 weight_\w vhadd.s16
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1643 10: rsb r3, r3, #0
9072 d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1644 weight_\w vhsub.s16
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1645 20: rsb lr, r2, #0
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1646 vdup.16 q9, lr
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1647 cmp r3, #0
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1648 blt 10f
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1649 weight_\w vadd.s16
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1650 10: rsb r3, r3, #0
d56b711c6c5d ARM: fix corner-case overflow in H.264 weighted prediction mru parents: 8664 diff changeset	1651 weight_\w vsub.s16
8664 882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1652 .endfunc
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1653 .endm
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1654
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1655 .macro weight_entry w, h, b=1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1656 function ff_weight_h264_pixels_\w\()x\h\()_neon, export=1
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1657 mov ip, #\h
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1658 .if \b
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1659 b weight_h264_pixels_\w\()_neon
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1660 .endif
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1661 .endfunc
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1662 .endm
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1663
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1664 weight_entry 16, 8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1665 weight_entry 16, 16, b=0
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1666 weight_func 16
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1667
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1668 weight_entry 8, 16
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1669 weight_entry 8, 4
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1670 weight_entry 8, 8, b=0
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1671 weight_func 8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1672
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1673 weight_entry 4, 8
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1674 weight_entry 4, 2
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1675 weight_entry 4, 4, b=0
882c351e69c2 ARM: NEON optimised H.264 weighted prediction mru parents: 8663 diff changeset	1676 weight_func 4

Mercurial > libavcodec.hg

annotate arm/h264dsp_neon.S @ 10174:89cd870ca180 libavcodec