---
 libswscale/bfin/internal_bfin.S |  968 +++++++++++++++++++-------------------
 libswscale/bfin/swscale_bfin.c  |   48 +-
 libswscale/bfin/yuv2rgb_bfin.c  |   91 ++--
 3 files changed, 556 insertions(+), 551 deletions(-)

diff --git a/libswscale/bfin/internal_bfin.S b/libswscale/bfin/internal_bfin.S
index 9f985e7..1f46cb5 100644
--- a/libswscale/bfin/internal_bfin.S
+++ b/libswscale/bfin/internal_bfin.S
@@ -30,11 +30,11 @@ and converts it to RGB565. R:5 bits, G:6 bits, B:5 bits.. 
packed into shorts.
 
 The following calculation is used for the conversion:
 
-  r = clipz((y-oy)*cy  + crv*(v-128))
-  g = clipz((y-oy)*cy  + cgv*(v-128) + cgu*(u-128))
-  b = clipz((y-oy)*cy  + cbu*(u-128))
+  r = clipz((y - oy) * cy  + crv * (v - 128))
+  g = clipz((y - oy) * cy  + cgv * (v - 128) + cgu * (u - 128))
+  b = clipz((y - oy) * cy  + cbu * (u - 128))
 
-y,u,v are prescaled by a factor of 4 i.e. left-shifted to gain precision.
+y, u, v are prescaled by a factor of 4 i.e. left-shifted to gain precision.
 
 
 New factorization to eliminate the truncation error which was
@@ -47,7 +47,7 @@ occurring due to the byteop3p.
 2) Scale operands up by a factor of 4 not 8 because Blackfin
    multiplies include a shift.
 
-3) Compute into the accumulators cy*yx0, cy*yx1.
+3) Compute into the accumulators cy * yx0, cy * yx1.
 
 4) Compute each of the linear equations:
      r = clipz((y - oy) * cy  + crv * (v - 128))
@@ -73,7 +73,7 @@ occurring due to the byteop3p.
 
 Where coeffs have the following layout in memory.
 
-uint32_t oy,oc,zero,cy,crv,rmask,cbu,bmask,cgu,cgv;
+uint32_t oy, oc, zero, cy, crv, rmask, cbu, bmask, cgu, cgv;
 
 coeffs is a pointer to oy.
 
@@ -101,359 +101,359 @@ to do with the memory system.
 #endif
 #define MEM mL1
 
-#define DEFUN(fname,where,interface) \
-        .section where;              \
-        .global _ff_bfin_ ## fname;  \
-        .type _ff_bfin_ ## fname, STT_FUNC; \
-        .align 8;                    \
-        _ff_bfin_ ## fname
+#define DEFUN(fname, where, interface)  \
+    .section where;                     \
+    .global _ff_bfin_ ## fname;         \
+    .type _ff_bfin_ ## fname, STT_FUNC; \
+    .align 8;                           \
+    _ff_bfin_ ## fname
 
-#define DEFUN_END(fname) \
-        .size _ff_bfin_ ## fname, . - _ff_bfin_ ## fname
+#define DEFUN_END(fname)                \
+    .size _ff_bfin_ ## fname, . - _ff_bfin_ ## fname
 
 
 .text
 
-#define COEFF_LEN        11*4
-#define COEFF_REL_CY_OFF 4*4
+#define COEFF_LEN        11 * 4
+#define COEFF_REL_CY_OFF  4 * 4
 
 #define ARG_OUT   20
 #define ARG_W     24
 #define ARG_COEFF 28
 
-DEFUN(yuv2rgb565_line,MEM,
-   (uint8_t *Y, uint8_t *U, uint8_t *V, int *out, int dW, uint32_t *coeffs)):
-        link 0;
-        [--sp] = (r7:4);
-        p1 = [fp+ARG_OUT];
-        r3 = [fp+ARG_W];
-
-        i0 = r0;
-        i2 = r1;
-        i3 = r2;
-
-        r0 = [fp+ARG_COEFF];
-        i1 = r0;
-        b1 = i1;
-        l1 = COEFF_LEN;
-        m0 = COEFF_REL_CY_OFF;
-        p0 = r3;
-
-        r0   = [i0++];         // 2Y
-        r1.l = w[i2++];        // 2u
-        r1.h = w[i3++];        // 2v
-        p0 = p0>>2;
-
-        lsetup (.L0565, .L1565) lc0 = p0;
-
-        /*
-           uint32_t oy,oc,zero,cy,crv,rmask,cbu,bmask,cgu,cgv
-           r0 -- used to load 4ys
-           r1 -- used to load 2us,2vs
-           r4 -- y3,y2
-           r5 -- y1,y0
-           r6 -- u1,u0
-           r7 -- v1,v0
-        */
-                                                              r2=[i1++]; // oy
+DEFUN(yuv2rgb565_line, MEM,
+      (uint8_t *Y, uint8_t *U, uint8_t *V, int *out, int dW, uint32_t 
*coeffs)):
+    link 0;
+    [--sp] = (r7:4);
+    p1 = [fp + ARG_OUT];
+    r3 = [fp + ARG_W];
+
+    i0 = r0;
+    i2 = r1;
+    i3 = r2;
+
+    r0 = [fp + ARG_COEFF];
+    i1 = r0;
+    b1 = i1;
+    l1 = COEFF_LEN;
+    m0 = COEFF_REL_CY_OFF;
+    p0 = r3;
+
+    r0   =  [i0++];        // 2Y
+    r1.l = w[i2++];        // 2u
+    r1.h = w[i3++];        // 2v
+    p0   = p0 >> 2;
+
+    lsetup (.L0565, .L1565) lc0 = p0;
+
+    /*
+       uint32_t oy, oc, zero, cy, crv, rmask, cbu, bmask, cgu, cgv
+       r0 -- used to load 4ys
+       r1 -- used to load 2us, 2vs
+       r4 -- y3, y2
+       r5 -- y1, y0
+       r6 -- u1, u0
+       r7 -- v1, v0
+    */
+    r2 = [i1++]; // oy
 .L0565:
-        /*
-        rrrrrrrr gggggggg bbbbbbbb
-         5432109876543210
-                    bbbbb >>3
-              gggggggg    <<3
-         rrrrrrrr         <<8
-         rrrrrggggggbbbbb
-        */
-        (r4,r5) = byteop16m (r1:0, r3:2)                   || r3=[i1++]; // oc
-        (r7,r6) = byteop16m (r1:0, r3:2) (r);
-        r5 = r5 << 2 (v);                                                // 
y1,y0
-        r4 = r4 << 2 (v);                                                // 
y3,y2
-        r6 = r6 << 2 (v)                                   || r0=[i1++]; // 
u1,u0, r0=zero
-        r7 = r7 << 2 (v)                                   || r1=[i1++]; // 
v1,v0  r1=cy
-        /* Y' = y*cy */
-        a1 = r1.h*r5.h, a0 = r1.l*r5.l                     || r1=[i1++]; // crv
-
-        /* R = Y+ crv*(Cr-128) */
-        r2.h = (a1 += r1.h*r7.l), r2.l = (a0 += r1.l*r7.l);
-                a1 -= r1.h*r7.l,          a0 -= r1.l*r7.l  || r5=[i1++]; // 
rmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cbu
-        r2 = r2 >> 3 (v);
-        r3 = r2 & r5;
-
-        /* B = Y+ cbu*(Cb-128) */
-        r2.h = (a1 += r1.h*r6.l), r2.l = (a0 += r1.l*r6.l);
-                a1 -= r1.h*r6.l,          a0 -= r1.l*r6.l  || r5=[i1++]; // 
bmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cgu
-        r2 = r2 << 8 (v);
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-
-        /* G = Y+ cgu*(Cb-128)+cgv*(Cr-128) */
-                a1 += r1.h*r6.l,          a0 += r1.l*r6.l  || r1=[i1++]; // cgv
-        r2.h = (a1 += r1.h*r7.l), r2.l = (a0 += r1.l*r7.l);
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r5=[i1++m0]; // 
gmask
-        r2 = r2 << 3 (v);
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-        [p1++]=r3                                          || r1=[i1++]; // cy
-
-        /* Y' = y*cy */
-
-        a1 = r1.h*r4.h, a0 = r1.l*r4.l                     || r1=[i1++]; // crv
-
-        /* R = Y+ crv*(Cr-128) */
-        r2.h = (a1 += r1.h*r7.h), r2.l = (a0 += r1.l*r7.h);
-                a1 -= r1.h*r7.h,          a0 -= r1.l*r7.h  || r5=[i1++]; // 
rmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cbu
-        r2 = r2 >> 3 (v);
-        r3 = r2 & r5;
-
-        /* B = Y+ cbu*(Cb-128) */
-        r2.h = (a1 += r1.h*r6.h), r2.l = (a0 += r1.l*r6.h);
-                a1 -= r1.h*r6.h,          a0 -= r1.l*r6.h  || r5=[i1++]; // 
bmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cgu
-        r2 = r2 << 8 (v);
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-
-        /* G = Y+ cgu*(Cb-128)+cgv*(Cr-128) */
-                a1 += r1.h*r6.h,          a0 += r1.l*r6.h  || r1=[i1++]; // cgv
-        r2.h = (a1 += r1.h*r7.h), r2.l = (a0 += r1.l*r7.h) || r5=[i1++]; // 
gmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r0   =  [i0++];  
      // 2Y
-        r2 = r2 << 3 (v)                                   || r1.l = w[i2++];  
      // 2u
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-        [p1++]=r3                                          || r1.h = w[i3++];  
      // 2v
-.L1565:                                                       r2=[i1++]; // oy
-
-        l1 = 0;
-
-        (r7:4) = [sp++];
-        unlink;
-        rts;
+    /*
+    rrrrrrrr gggggggg bbbbbbbb
+     5432109876543210
+                bbbbb >> 3
+          gggggggg    << 3
+     rrrrrrrr         << 8
+     rrrrrggggggbbbbb
+    */
+    (r4, r5) = byteop16m (r1:0, r3:2)                  || r3 = [i1++]; // oc
+    (r7, r6) = byteop16m3C (r1:0, r3:2) (r);
+    r5 = r5 << 2 (v);                                                  // y1, 
y0
+    r4 = r4 << 2 (v);                                                  // y3, 
y2
+    r6 = r6 << 2 (v)                                   || r0 = [i1++]; // u1, 
u0, r0 = zero
+    r7 = r7 << 2 (v)                                   || r1 = [i1++]; // v1, 
v0, r1 = cy
+    /* Y' = y * cy */
+    a1 = r1.h * r5.h, a0 = r1.l * r5.l                 || r1 = [i1++]; // crv
+
+    /* R = Y + crv * (Cr - 128) */
+    r2.h = (a1 += r1.h * r7.l), r2.l = (a0 += r1.l * r7.l);
+            a1 -= r1.h * r7.l,          a0 -= r1.l * r7.l  || r5 = [i1++]; // 
rmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cbu
+    r2 = r2 >> 3 (v);
+    r3 = r2 & r5;
+
+    /* B = Y + cbu * (Cb - 128) */
+    r2.h = (a1 += r1.h * r6.l), r2.l = (a0 += r1.l * r6.l);
+            a1 -= r1.h * r6.l,          a0 -= r1.l * r6.l  || r5 = [i1++]; // 
bmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cgu
+    r2 = r2 << 8 (v);
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+
+    /* G = Y + cgu * (Cb - 128) + cgv * (Cr - 128) */
+            a1 += r1.h * r6.l,          a0 += r1.l * r6.l  || r1 = [i1++]; // 
cgv
+    r2.h = (a1 += r1.h * r7.l), r2.l = (a0 += r1.l * r7.l);
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r5 = [i1++m0]; 
// gmask
+    r2 = r2 << 3 (v);
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+    [p1++] = r3                                            || r1 = [i1++]; // 
cy
+
+    /* Y' = y * cy */
+
+    a1 = r1.h * r4.h, a0 = r1.l * r4.l                     || r1 = [i1++]; // 
crv
+
+    /* R = Y + crv * (Cr - 128) */
+    r2.h = (a1 += r1.h * r7.h), r2.l = (a0 += r1.l * r7.h);
+            a1 -= r1.h * r7.h,          a0 -= r1.l * r7.h  || r5 = [i1++]; // 
rmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cbu
+    r2 = r2 >> 3 (v);
+    r3 = r2 & r5;
+
+    /* B = Y + cbu * (Cb - 128) */
+    r2.h = (a1 += r1.h * r6.h), r2.l = (a0 += r1.l * r6.h);
+            a1 -= r1.h * r6.h,          a0 -= r1.l * r6.h  || r5 = [i1++]; // 
bmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cgu
+    r2 = r2 << 8 (v);
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+
+    /* G = Y + cgu * (Cb - 128) + cgv * (Cr - 128) */
+            a1 += r1.h * r6.h,          a0 += r1.l * r6.h  || r1 = [i1++]; // 
cgv
+    r2.h = (a1 += r1.h * r7.h), r2.l = (a0 += r1.l * r7.h) || r5 = [i1++]; // 
gmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r0   =  [i0++]; 
// 2Y
+    r2 = r2 << 3 (v)                                       || r1.l = w[i2++]; 
// 2u
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+    [p1++] = r3                                            || r1.h = w[i3++]; 
// 2v
+.L1565:                                                         r2 = [i1++];  
// oy
+
+    l1 = 0;
+
+    (r7:4) = [sp++];
+    unlink;
+    rts;
 DEFUN_END(yuv2rgb565_line)
 
-DEFUN(yuv2rgb555_line,MEM,
-   (uint8_t *Y, uint8_t *U, uint8_t *V, int *out, int dW, uint32_t *coeffs)):
-        link 0;
-        [--sp] = (r7:4);
-        p1 = [fp+ARG_OUT];
-        r3 = [fp+ARG_W];
-
-        i0 = r0;
-        i2 = r1;
-        i3 = r2;
-
-        r0 = [fp+ARG_COEFF];
-        i1 = r0;
-        b1 = i1;
-        l1 = COEFF_LEN;
-        m0 = COEFF_REL_CY_OFF;
-        p0 = r3;
-
-        r0   = [i0++];         // 2Y
-        r1.l = w[i2++];        // 2u
-        r1.h = w[i3++];        // 2v
-        p0 = p0>>2;
-
-        lsetup (.L0555, .L1555) lc0 = p0;
-
-        /*
-           uint32_t oy,oc,zero,cy,crv,rmask,cbu,bmask,cgu,cgv
-           r0 -- used to load 4ys
-           r1 -- used to load 2us,2vs
-           r4 -- y3,y2
-           r5 -- y1,y0
-           r6 -- u1,u0
-           r7 -- v1,v0
-        */
-                                                              r2=[i1++]; // oy
+DEFUN(yuv2rgb555_line, MEM,
+      (uint8_t *Y, uint8_t *U, uint8_t *V, int *out, int dW, uint32_t 
*coeffs)):
+    link 0;
+    [--sp] = (r7:4);
+    p1 = [fp + ARG_OUT];
+    r3 = [fp + ARG_W];
+
+    i0 = r0;
+    i2 = r1;
+    i3 = r2;
+
+    r0 = [fp + ARG_COEFF];
+    i1 = r0;
+    b1 = i1;
+    l1 = COEFF_LEN;
+    m0 = COEFF_REL_CY_OFF;
+    p0 = r3;
+
+    r0   = [i0++];         // 2Y
+    r1.l = w[i2++];        // 2u
+    r1.h = w[i3++];        // 2v
+    p0 = p0 >> 2;
+
+    lsetup (.L0555, .L1555) lc0 = p0;
+
+    /*
+       uint32_t oy, oc, zero, cy, crv, rmask, cbu, bmask, cgu, cgv
+       r0 -- used to load 4ys
+       r1 -- used to load 2us, 2vs
+       r4 -- y3, y2
+       r5 -- y1, y0
+       r6 -- u1, u0
+       r7 -- v1, v0
+    */
+                                                          r2 = [i1++]; // oy
 .L0555:
-        /*
-        rrrrrrrr gggggggg bbbbbbbb
-         5432109876543210
-                    bbbbb >>3
-               gggggggg   <<2
-          rrrrrrrr        <<7
-         xrrrrrgggggbbbbb
-        */
-
-        (r4,r5) = byteop16m (r1:0, r3:2)                   || r3=[i1++]; // oc
-        (r7,r6) = byteop16m (r1:0, r3:2) (r);
-        r5 = r5 << 2 (v);                                                // 
y1,y0
-        r4 = r4 << 2 (v);                                                // 
y3,y2
-        r6 = r6 << 2 (v)                                   || r0=[i1++]; // 
u1,u0, r0=zero
-        r7 = r7 << 2 (v)                                   || r1=[i1++]; // 
v1,v0  r1=cy
-        /* Y' = y*cy */
-        a1 = r1.h*r5.h, a0 = r1.l*r5.l                     || r1=[i1++]; // crv
-
-        /* R = Y+ crv*(Cr-128) */
-        r2.h = (a1 += r1.h*r7.l), r2.l = (a0 += r1.l*r7.l);
-                a1 -= r1.h*r7.l,          a0 -= r1.l*r7.l  || r5=[i1++]; // 
rmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cbu
-        r2 = r2 >> 3 (v);
-        r3 = r2 & r5;
-
-        /* B = Y+ cbu*(Cb-128) */
-        r2.h = (a1 += r1.h*r6.l), r2.l = (a0 += r1.l*r6.l);
-                a1 -= r1.h*r6.l,          a0 -= r1.l*r6.l  || r5=[i1++]; // 
bmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cgu
-        r2 = r2 << 7 (v);
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-
-        /* G = Y+ cgu*(Cb-128)+cgv*(Cr-128) */
-                a1 += r1.h*r6.l,          a0 += r1.l*r6.l  || r1=[i1++]; // cgv
-        r2.h = (a1 += r1.h*r7.l), r2.l = (a0 += r1.l*r7.l);
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r5=[i1++m0]; // 
gmask
-        r2 = r2 << 2 (v);
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-        [p1++]=r3                                          || r1=[i1++]; // cy
-
-        /* Y' = y*cy */
-
-        a1 = r1.h*r4.h, a0 = r1.l*r4.l                     || r1=[i1++]; // crv
-
-        /* R = Y+ crv*(Cr-128) */
-        r2.h = (a1 += r1.h*r7.h), r2.l = (a0 += r1.l*r7.h);
-                a1 -= r1.h*r7.h,          a0 -= r1.l*r7.h  || r5=[i1++]; // 
rmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cbu
-        r2 = r2 >> 3 (v);
-        r3 = r2 & r5;
-
-        /* B = Y+ cbu*(Cb-128) */
-        r2.h = (a1 += r1.h*r6.h), r2.l = (a0 += r1.l*r6.h);
-                a1 -= r1.h*r6.h,          a0 -= r1.l*r6.h  || r5=[i1++]; // 
bmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cgu
-        r2 = r2 << 7 (v);
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-
-        /* G = Y+ cgu*(Cb-128)+cgv*(Cr-128) */
-                a1 += r1.h*r6.h,          a0 += r1.l*r6.h  || r1=[i1++]; // cgv
-        r2.h = (a1 += r1.h*r7.h), r2.l = (a0 += r1.l*r7.h) || r5=[i1++]; // 
gmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r0=[i0++];     
// 4Y
-        r2 = r2 << 2 (v)                                   || r1.l=w[i2++];  
// 2u
-        r2 = r2 & r5;
-        r3 = r3 | r2;
-        [p1++]=r3                                          || r1.h=w[i3++]; // 
2v
-
-.L1555:                                                       r2=[i1++]; // oy
-
-        l1 = 0;
-
-        (r7:4) = [sp++];
-        unlink;
-        rts;
+    /*
+    rrrrrrrr gggggggg bbbbbbbb
+     5432109876543210
+                bbbbb >> 3
+           gggggggg   << 2
+      rrrrrrrr        << 7
+     xrrrrrgggggbbbbb
+    */
+
+    (r4, r5) = byteop16m (r1:0, r3:2)                  || r3 = [i1++]; // oc
+    (r7, r6) = byteop16m (r1:0, r3:2) (r);
+    r5 = r5 << 2 (v);                                                  // y1, 
y0
+    r4 = r4 << 2 (v);                                                  // y3, 
y2
+    r6 = r6 << 2 (v)                                   || r0 = [i1++]; // u1, 
u0, r0 = zero
+    r7 = r7 << 2 (v)                                   || r1 = [i1++]; // v1, 
v0  r1 = cy
+    /* Y' = y * cy */
+    a1 = r1.h * r5.h, a0 = r1.l * r5.l                 || r1 = [i1++]; // crv
+
+    /* R = Y + crv * (Cr - 128) */
+    r2.h = (a1 += r1.h * r7.l), r2.l = (a0 += r1.l * r7.l);
+            a1 -= r1.h * r7.l,          a0 -= r1.l * r7.l  || r5 = [i1++]; // 
rmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cbu
+    r2 = r2 >> 3 (v);
+    r3 = r2 & r5;
+
+    /* B = Y + cbu * (Cb - 128) */
+    r2.h = (a1 += r1.h * r6.l), r2.l = (a0 += r1.l * r6.l);
+            a1 -= r1.h * r6.l,          a0 -= r1.l * r6.l  || r5 = [i1++]; // 
bmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cgu
+    r2 = r2 << 7 (v);
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+
+    /* G = Y + cgu * (Cb - 128) + cgv * (Cr - 128) */
+            a1 += r1.h * r6.l,          a0 += r1.l * r6.l  || r1 = [i1++]; // 
cgv
+    r2.h = (a1 += r1.h * r7.l), r2.l = (a0 += r1.l * r7.l);
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r5 = [i1++m0]; 
// gmask
+    r2 = r2 << 2 (v);
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+    [p1++] = r3                                            || r1 = [i1++]; // 
cy
+
+    /* Y' = y * cy */
+
+    a1 = r1.h * r4.h, a0 = r1.l * r4.l                     || r1 = [i1++]; // 
crv
+
+    /* R = Y + crv * (Cr - 128) */
+    r2.h = (a1 += r1.h * r7.h), r2.l = (a0 += r1.l * r7.h);
+            a1 -= r1.h * r7.h,          a0 -= r1.l * r7.h  || r5 = [i1++]; // 
rmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cbu
+    r2 = r2 >> 3 (v);
+    r3 = r2 & r5;
+
+    /* B = Y + cbu * (Cb - 128) */
+    r2.h = (a1 += r1.h * r6.h), r2.l = (a0 += r1.l * r6.h);
+            a1 -= r1.h * r6.h,          a0 -= r1.l * r6.h  || r5 = [i1++]; // 
bmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r1 = [i1++]; // 
cgu
+    r2 = r2 << 7 (v);
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+
+    /* G = Y + cgu * (Cb - 128) + cgv * (Cr - 128) */
+            a1 += r1.h * r6.h,          a0 += r1.l * r6.h  || r1 = [i1++]; // 
cgv
+    r2.h = (a1 += r1.h * r7.h), r2.l = (a0 += r1.l * r7.h) || r5 = [i1++]; // 
gmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                          || r0 = [i0++];    
// 4Y
+    r2 = r2 << 2 (v)                                       || r1.l = w[i2++]; 
// 2u
+    r2 = r2 & r5;
+    r3 = r3 | r2;
+    [p1++] = r3                                            || r1.h = w[i3++]; 
// 2v
+
+.L1555:                                                         r2 = [i1++];  
// oy
+
+    l1 = 0;
+
+    (r7:4) = [sp++];
+    unlink;
+    rts;
 DEFUN_END(yuv2rgb555_line)
 
-DEFUN(yuv2rgb24_line,MEM,
+DEFUN(yuv2rgb24_line, MEM,
    (uint8_t *Y, uint8_t *U, uint8_t *V, int *out, int dW, uint32_t *coeffs)):
-        link 0;
-        [--sp] = (r7:4);
-        p1 = [fp+ARG_OUT];
-        r3 = [fp+ARG_W];
-        p2 = p1;
-        p2 += 3;
-
-        i0 = r0;
-        i2 = r1;
-        i3 = r2;
-
-        r0 = [fp+ARG_COEFF]; // coeff buffer
-        i1 = r0;
-        b1 = i1;
-        l1 = COEFF_LEN;
-        m0 = COEFF_REL_CY_OFF;
-        p0 = r3;
-
-        r0   = [i0++];         // 2Y
-        r1.l = w[i2++];        // 2u
-        r1.h = w[i3++];        // 2v
-        p0 = p0>>2;
-
-        lsetup (.L0888, .L1888) lc0 = p0;
-
-        /*
-           uint32_t oy,oc,zero,cy,crv,rmask,cbu,bmask,cgu,cgv
-           r0 -- used to load 4ys
-           r1 -- used to load 2us,2vs
-           r4 -- y3,y2
-           r5 -- y1,y0
-           r6 -- u1,u0
-           r7 -- v1,v0
-        */
-                                                              r2=[i1++]; // oy
+    link 0;
+    [--sp] = (r7:4);
+    p1 = [fp + ARG_OUT];
+    r3 = [fp + ARG_W];
+    p2 = p1;
+    p2 += 3;
+
+    i0 = r0;
+    i2 = r1;
+    i3 = r2;
+
+    r0 = [fp + ARG_COEFF]; // coeff buffer
+    i1 = r0;
+    b1 = i1;
+    l1 = COEFF_LEN;
+    m0 = COEFF_REL_CY_OFF;
+    p0 = r3;
+
+    r0   = [i0++];         // 2Y
+    r1.l = w[i2++];        // 2u
+    r1.h = w[i3++];        // 2v
+    p0   = p0 >> 2;
+
+    lsetup (.L0888, .L1888) lc0 = p0;
+
+    /*
+       uint32_t oy, oc, zero, cy, crv, rmask, cbu, bmask, cgu, cgv
+       r0 -- used to load 4ys
+       r1 -- used to load 2us, 2vs
+       r4 -- y3, y2
+       r5 -- y1, y0
+       r6 -- u1, u0
+       r7 -- v1, v0
+    */
+                                                          r2 = [i1++]; // oy
 .L0888:
-        (r4,r5) = byteop16m (r1:0, r3:2)                   || r3=[i1++]; // oc
-        (r7,r6) = byteop16m (r1:0, r3:2) (r);
-        r5 = r5 << 2 (v);               // y1,y0
-        r4 = r4 << 2 (v);               // y3,y2
-        r6 = r6 << 2 (v) || r0=[i1++];  // u1,u0, r0=zero
-        r7 = r7 << 2 (v) || r1=[i1++];  // v1,v0  r1=cy
-
-        /* Y' = y*cy */
-        a1 = r1.h*r5.h, a0 = r1.l*r5.l                     || r1=[i1++]; // crv
-
-        /* R = Y+ crv*(Cr-128) */
-        r2.h = (a1 += r1.h*r7.l), r2.l = (a0 += r1.l*r7.l);
-                a1 -= r1.h*r7.l,          a0 -= r1.l*r7.l  || r5=[i1++]; // 
rmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cbu
-        r2=r2>>16 || B[p1++]=r2;
-                     B[p2++]=r2;
-
-        /* B = Y+ cbu*(Cb-128) */
-        r2.h = (a1 += r1.h*r6.l), r2.l = (a0 += r1.l*r6.l);
-                a1 -= r1.h*r6.l,          a0 -= r1.l*r6.l  || r5=[i1++]; // 
bmask
-        r3 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cgu
-
-        /* G = Y+ cgu*(Cb-128)+cgv*(Cr-128) */
-                a1 += r1.h*r6.l,          a0 += r1.l*r6.l  || r1=[i1++]; // cgv
-        r2.h = (a1 += r1.h*r7.l), r2.l = (a0 += r1.l*r7.l);
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r5=[i1++m0]; // 
gmask, oy,cy,zero
-
-        r2=r2>>16 || B[p1++]=r2;
-                     B[p2++]=r2;
-
-        r3=r3>>16 || B[p1++]=r3;
-                     B[p2++]=r3                            || r1=[i1++]; // cy
-
-        p1+=3;
-        p2+=3;
-        /* Y' = y*cy */
-        a1 = r1.h*r4.h, a0 = r1.l*r4.l                     || r1=[i1++]; // crv
-
-        /* R = Y+ crv*(Cr-128) */
-        r2.h = (a1 += r1.h*r7.h), r2.l = (a0 += r1.l*r7.h);
-                a1 -= r1.h*r7.h,          a0 -= r1.l*r7.h  || r5=[i1++]; // 
rmask
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cbu
-        r2=r2>>16 || B[p1++]=r2;
-        B[p2++]=r2;
-
-        /* B = Y+ cbu*(Cb-128) */
-        r2.h = (a1 += r1.h*r6.h), r2.l = (a0 += r1.l*r6.h);
-                a1 -= r1.h*r6.h,          a0 -= r1.l*r6.h  || r5=[i1++]; // 
bmask
-        r3 = byteop3p(r3:2, r1:0)(LO)                      || r1=[i1++]; // cgu
-
-        /* G = Y+ cgu*(Cb-128)+cgv*(Cr-128) */
-                a1 += r1.h*r6.h,          a0 += r1.l*r6.h  || r1=[i1++]; // cgv
-        r2.h = (a1 += r1.h*r7.h), r2.l = (a0 += r1.l*r7.h);
-        r2 = byteop3p(r3:2, r1:0)(LO)                      || r5=[i1++]; // 
gmask
-        r2=r2>>16 || B[p1++]=r2 || r0 = [i0++];    // 4y
-                     B[p2++]=r2 || r1.l = w[i2++]; // 2u
-        r3=r3>>16 || B[p1++]=r3 || r1.h = w[i3++]; // 2v
-                     B[p2++]=r3 || r2=[i1++];      // oy
-
-        p1+=3;
-.L1888: p2+=3;
-
-        l1 = 0;
-
-        (r7:4) = [sp++];
-        unlink;
-        rts;
+    (r4, r5) = byteop16m (r1:0, r3:2)                     || r3 = [i1++]; // oc
+    (r7, r6) = byteop16m (r1:0, r3:2) (r);
+    r5 = r5 << 2 (v);                 // y1, y0
+    r4 = r4 << 2 (v);                 // y3, y2
+    r6 = r6 << 2 (v) || r0 = [i1++];  // u1, u0, r0 = zero
+    r7 = r7 << 2 (v) || r1 = [i1++];  // v1, v0  r1 = cy
+
+    /* Y' = y * cy */
+    a1 = r1.h * r5.h, a0 = r1.l * r5.l                    || r1 = [i1++]; // 
crv
+
+    /* R = Y + crv * (Cr - 128) */
+    r2.h = (a1 += r1.h * r7.l), r2.l = (a0 += r1.l * r7.l);
+            a1 -= r1.h * r7.l,          a0 -= r1.l * r7.l || r5 = [i1++]; // 
rmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                         || r1 = [i1++]; // 
cbu
+    r2 = r2 >> 16 || B[p1++] = r2;
+                     B[p2++] = r2;
+
+    /* B = Y + cbu * (Cb - 128) */
+    r2.h = (a1 += r1.h * r6.l), r2.l = (a0 += r1.l * r6.l);
+            a1 -= r1.h * r6.l,          a0 -= r1.l * r6.l || r5 = [i1++]; // 
bmask
+    r3 = byteop3p(r3:2, r1:0)(LO)                         || r1 = [i1++]; // 
cgu
+
+    /* G = Y + cgu * (Cb - 128) + cgv * (Cr - 128) */
+            a1 += r1.h * r6.l,          a0 += r1.l * r6.l || r1 = [i1++]; // 
cgv
+    r2.h = (a1 += r1.h * r7.l), r2.l = (a0 += r1.l * r7.l);
+    r2 = byteop3p(r3:2, r1:0)(LO)                         || r5 = [i1++m0]; // 
gmask, oy, cy, zero
+
+    r2 = r2 >> 16 || B[p1++] = r2;
+                     B[p2++] = r2;
+
+    r3 = r3 >> 16 || B[p1++] = r3;
+                     B[p2++] = r3                         || r1 = [i1++]; // cy
+
+    p1 += 3;
+    p2 += 3;
+    /* Y' = y * cy */
+    a1 = r1.h * r4.h, a0 = r1.l * r4.l                    || r1 = [i1++]; // 
crv
+
+    /* R = Y + crv * (Cr - 128) */
+    r2.h = (a1 += r1.h * r7.h), r2.l = (a0 += r1.l * r7.h);
+            a1 -= r1.h * r7.h,          a0 -= r1.l * r7.h || r5 = [i1++]; // 
rmask
+    r2 = byteop3p(r3:2, r1:0)(LO)                         || r1 = [i1++]; // 
cbu
+    r2 = r2 >> 16 || B[p1++] = r2;
+    B[p2++] = r2;
+
+    /* B = Y + cbu * (Cb - 128) */
+    r2.h = (a1 += r1.h * r6.h), r2.l = (a0 += r1.l * r6.h);
+            a1 -= r1.h * r6.h,          a0 -= r1.l * r6.h || r5 = [i1++]; // 
bmask
+    r3 = byteop3p(r3:2, r1:0)(LO)                         || r1 = [i1++]; // 
cgu
+
+    /* G = Y + cgu * (Cb - 128) + cgv * (Cr - 128) */
+            a1 += r1.h * r6.h,          a0 += r1.l * r6.h || r1 = [i1++]; // 
cgv
+    r2.h = (a1 += r1.h * r7.h), r2.l = (a0 += r1.l * r7.h);
+    r2 = byteop3p(r3:2, r1:0)(LO)                         || r5 = [i1++]; // 
gmask
+    r2 = r2 >> 16 || B[p1++] = r2 || r0   =  [i0++]; // 4y
+                     B[p2++] = r2 || r1.l = w[i2++]; // 2u
+    r3 = r3 >> 16 || B[p1++] = r3 || r1.h = w[i3++]; // 2v
+                     B[p2++] = r3 || r2   =  [i1++]; // oy
+
+    p1 += 3;
+.L1888: p2 += 3;
+
+    l1 = 0;
+
+    (r7:4) = [sp++];
+    unlink;
+    rts;
 DEFUN_END(yuv2rgb24_line)
 
 
@@ -465,149 +465,149 @@ DEFUN_END(yuv2rgb24_line)
 #define ARG_chromStride 36
 #define ARG_srcStride   40
 
-DEFUN(uyvytoyv12, mL3,  (const uint8_t *src, uint8_t *ydst, uint8_t *udst, 
uint8_t *vdst,
-                         int width, int height,
-                         int lumStride, int chromStride, int srcStride)):
-        link 0;
-        [--sp] = (r7:4,p5:4);
-
-        p0 = r1;       // Y top even
-
-        i2 = r2; // *u
-        r2 = [fp + ARG_vdst];
-        i3 = r2; // *v
-
-        r1 = [fp + ARG_srcStride];
-        r2 = r0 + r1;
-        i0 = r0;  // uyvy_T even
-        i1 = r2;  // uyvy_B odd
-
-        p2 = [fp + ARG_lumStride];
-        p1 = p0 + p2;  // Y bot odd
-
-        p5 = [fp + ARG_width];
-        p4 = [fp + ARG_height];
-        r0 = p5;
-        p4 = p4 >> 1;
-        p5 = p5 >> 2;
-
-        r2 = r0 << 1;
-        r1 = r1 << 1;
-        r1 = r1 - r2;  // srcStride + (srcStride - 2*width)
-        r1 += -8;  // i0,i1 is pre read need to correct
-        m0 = r1;
-
-        r2 = [fp + ARG_chromStride];
-        r0 = r0 >> 1;
-        r2 = r2 - r0;
-        m1 = r2;
-
-        /*   I0,I1 - src input line pointers
-         *   p0,p1 - luma output line pointers
-         *   I2    - dstU
-         *   I3    - dstV
-         */
-
-        lsetup (0f, 1f) lc1 = p4;   // H/2
-0:        r0 = [i0++] || r2 = [i1++];
-          r1 = [i0++] || r3 = [i1++];
-          r4 = byteop1p(r1:0, r3:2);
-          r5 = byteop1p(r1:0, r3:2) (r);
-          lsetup (2f, 3f) lc0 = p5; // W/4
-2:          r0 = r0 >> 8(v);
-            r1 = r1 >> 8(v);
-            r2 = r2 >> 8(v);
-            r3 = r3 >> 8(v);
-            r0 = bytepack(r0, r1);
-            r2 = bytepack(r2, r3)         ||  [p0++] = r0;    // yyyy
-            r6 = pack(r5.l, r4.l)         ||  [p1++] = r2;    // yyyy
-            r7 = pack(r5.h, r4.h)         ||  r0 = [i0++] || r2 = [i1++];
-            r6 = bytepack(r6, r7)         ||  r1 = [i0++] || r3 = [i1++];
-            r4 = byteop1p(r1:0, r3:2)     ||  w[i2++] = r6.l; // uu
-3:          r5 = byteop1p(r1:0, r3:2) (r) ||  w[i3++] = r6.h; // vv
-
-          i0 += m0;
-          i1 += m0;
-          i2 += m1;
-          i3 += m1;
-          p0 = p0 + p2;
-1:        p1 = p1 + p2;
-
-        (r7:4,p5:4) = [sp++];
-        unlink;
-        rts;
+DEFUN(uyvytoyv12, mL3, (const uint8_t *src, uint8_t *ydst, uint8_t *udst,
+                        uint8_t *vdst, int width, int height,
+                        int lumStride, int chromStride, int srcStride)):
+    link 0;
+    [--sp] = (r7:4, p5:4);
+
+    p0 = r1;       // Y top even
+
+    i2 = r2; // *u
+    r2 = [fp + ARG_vdst];
+    i3 = r2; // *v
+
+    r1 = [fp + ARG_srcStride];
+    r2 = r0 + r1;
+    i0 = r0;  // uyvy_T even
+    i1 = r2;  // uyvy_B odd
+
+    p2 = [fp + ARG_lumStride];
+    p1 = p0 + p2;  // Y bot odd
+
+    p5 = [fp + ARG_width];
+    p4 = [fp + ARG_height];
+    r0 = p5;
+    p4 = p4 >> 1;
+    p5 = p5 >> 2;
+
+    r2 = r0 << 1;
+    r1 = r1 << 1;
+    r1 = r1 - r2;  // srcStride + (srcStride - 2 * width)
+    r1 += -8;      // i0, i1 is pre read need to correct
+    m0 = r1;
+
+    r2 = [fp + ARG_chromStride];
+    r0 = r0 >> 1;
+    r2 = r2 - r0;
+    m1 = r2;
+
+    /* I0, I1 - src input line pointers
+     * p0, p1 - luma output line pointers
+     * I2     - dstU
+     * I3     - dstV
+     */
+
+    lsetup (0f, 1f) lc1 = p4;   // H/2
+0:    r0 = [i0++] || r2 = [i1++];
+      r1 = [i0++] || r3 = [i1++];
+      r4 = byteop1p(r1:0, r3:2);
+      r5 = byteop1p(r1:0, r3:2) (r);
+      lsetup (2f, 3f) lc0 = p5; // W/4
+2:    r0 = r0 >> 8(v);
+      r1 = r1 >> 8(v);
+      r2 = r2 >> 8(v);
+      r3 = r3 >> 8(v);
+      r0 = bytepack(r0, r1);
+      r2 = bytepack(r2, r3)         ||  [p0++] = r0;    // yyyy
+      r6 = pack(r5.l, r4.l)         ||  [p1++] = r2;    // yyyy
+      r7 = pack(r5.h, r4.h)         ||  r0 = [i0++] || r2 = [i1++];
+      r6 = bytepack(r6, r7)         ||  r1 = [i0++] || r3 = [i1++];
+      r4 = byteop1p(r1:0, r3:2)     ||  w[i2++] = r6.l; // uu
+3:    r5 = byteop1p(r1:0, r3:2) (r) ||  w[i3++] = r6.h; // vv
+
+      i0 += m0;
+      i1 += m0;
+      i2 += m1;
+      i3 += m1;
+      p0 = p0 + p2;
+1:    p1 = p1 + p2;
+
+    (r7:4, p5:4) = [sp++];
+    unlink;
+    rts;
 DEFUN_END(uyvytoyv12)
 
-DEFUN(yuyvtoyv12, mL3,  (const uint8_t *src, uint8_t *ydst, uint8_t *udst, 
uint8_t *vdst,
-                         int width, int height,
-                         int lumStride, int chromStride, int srcStride)):
-        link 0;
-        [--sp] = (r7:4,p5:4);
-
-        p0 = r1;       // Y top even
-
-        i2 = r2; // *u
-        r2 = [fp + ARG_vdst];
-        i3 = r2; // *v
-
-        r1 = [fp + ARG_srcStride];
-        r2 = r0 + r1;
-
-        i0 = r0;  // uyvy_T even
-        i1 = r2;  // uyvy_B odd
-
-        p2 = [fp + ARG_lumStride];
-        p1 = p0 + p2;  // Y bot odd
-
-        p5 = [fp + ARG_width];
-        p4 = [fp + ARG_height];
-        r0 = p5;
-        p4 = p4 >> 1;
-        p5 = p5 >> 2;
-
-        r2 = r0 << 1;
-        r1 = r1 << 1;
-        r1 = r1 - r2;  // srcStride + (srcStride - 2*width)
-        r1 += -8;  // i0,i1 is pre read need to correct
-        m0 = r1;
-
-        r2 = [fp + ARG_chromStride];
-        r0 = r0 >> 1;
-        r2 = r2 - r0;
-        m1 = r2;
-
-        /*   I0,I1 - src input line pointers
-         *   p0,p1 - luma output line pointers
-         *   I2    - dstU
-         *   I3    - dstV
-         */
-
-        lsetup (0f, 1f) lc1 = p4;   // H/2
-0:        r0 = [i0++] || r2 = [i1++];
-          r1 = [i0++] || r3 = [i1++];
-          r4 = bytepack(r0, r1);
-          r5 = bytepack(r2, r3);
-          lsetup (2f, 3f) lc0 = p5; // W/4
-2:          r0 = r0 >> 8(v) || [p0++] = r4;  // yyyy-even
-            r1 = r1 >> 8(v) || [p1++] = r5;  // yyyy-odd
-            r2 = r2 >> 8(v);
-            r3 = r3 >> 8(v);
-            r4 = byteop1p(r1:0, r3:2);
-            r5 = byteop1p(r1:0, r3:2) (r);
-            r6 = pack(r5.l, r4.l);
-            r7 = pack(r5.h, r4.h)         ||  r0 = [i0++] || r2 = [i1++];
-            r6 = bytepack(r6, r7)         ||  r1 = [i0++] || r3 = [i1++];
-            r4 = bytepack(r0, r1)         ||  w[i2++] = r6.l; // uu
-3:          r5 = bytepack(r2, r3)         ||  w[i3++] = r6.h; // vv
-
-          i0 += m0;
-          i1 += m0;
-          i2 += m1;
-          i3 += m1;
-          p0 = p0 + p2;
-1:        p1 = p1 + p2;
-
-        (r7:4,p5:4) = [sp++];
-        unlink;
-        rts;
+DEFUN(yuyvtoyv12, mL3, (const uint8_t *src, uint8_t *ydst, uint8_t *udst,
+                        uint8_t *vdst, int width, int height,
+                        int lumStride, int chromStride, int srcStride)):
+    link 0;
+    [--sp] = (r7:4, p5:4);
+
+    p0 = r1;       // Y top even
+
+    i2 = r2; // *u
+    r2 = [fp + ARG_vdst];
+    i3 = r2; // *v
+
+    r1 = [fp + ARG_srcStride];
+    r2 = r0 + r1;
+
+    i0 = r0;  // uyvy_T even
+    i1 = r2;  // uyvy_B odd
+
+    p2 = [fp + ARG_lumStride];
+    p1 = p0 + p2;  // Y bot odd
+
+    p5 = [fp + ARG_width];
+    p4 = [fp + ARG_height];
+    r0 = p5;
+    p4 = p4 >> 1;
+    p5 = p5 >> 2;
+
+    r2 = r0 << 1;
+    r1 = r1 << 1;
+    r1 = r1 - r2;  // srcStride + (srcStride - 2 * width)
+    r1 += -8;      // i0, i1 is pre read need to correct
+    m0 = r1;
+
+    r2 = [fp + ARG_chromStride];
+    r0 = r0 >> 1;
+    r2 = r2 - r0;
+    m1 = r2;
+
+    /* I0, I1 - src input line pointers
+     * p0, p1 - luma output line pointers
+     * I2     - dstU
+     * I3     - dstV
+     */
+
+    lsetup (0f, 1f) lc1 = p4;   // H/2
+0:    r0 = [i0++] || r2 = [i1++];
+      r1 = [i0++] || r3 = [i1++];
+      r4 = bytepack(r0, r1);
+      r5 = bytepack(r2, r3);
+      lsetup (2f, 3f) lc0 = p5; // W/4
+2:      r0 = r0 >> 8(v) || [p0++] = r4;  // yyyy-even
+        r1 = r1 >> 8(v) || [p1++] = r5;  // yyyy-odd
+        r2 = r2 >> 8(v);
+        r3 = r3 >> 8(v);
+        r4 = byteop1p(r1:0, r3:2);
+        r5 = byteop1p(r1:0, r3:2) (r);
+        r6 = pack(r5.l, r4.l);
+        r7 = pack(r5.h, r4.h)         ||  r0 = [i0++] || r2 = [i1++];
+        r6 = bytepack(r6, r7)         ||  r1 = [i0++] || r3 = [i1++];
+        r4 = bytepack(r0, r1)         ||  w[i2++] = r6.l; // uu
+3:      r5 = bytepack(r2, r3)         ||  w[i3++] = r6.h; // vv
+
+      i0 += m0;
+      i1 += m0;
+      i2 += m1;
+      i3 += m1;
+      p0  = p0 + p2;
+1:    p1  = p1 + p2;
+
+    (r7:4, p5:4) = [sp++];
+    unlink;
+    rts;
 DEFUN_END(yuyvtoyv12)
diff --git a/libswscale/bfin/swscale_bfin.c b/libswscale/bfin/swscale_bfin.c
index 0c5f004..f9eba1e 100644
--- a/libswscale/bfin/swscale_bfin.c
+++ b/libswscale/bfin/swscale_bfin.c
@@ -27,32 +27,34 @@
 #include <assert.h>
 #include "config.h"
 #include <unistd.h>
+
 #include "libswscale/rgb2rgb.h"
 #include "libswscale/swscale.h"
 #include "libswscale/swscale_internal.h"
 
 #if defined (__FDPIC__) && CONFIG_SRAM
-#define L1CODE __attribute__ ((l1_text))
+#define L1CODE __attribute__((l1_text))
 #else
 #define L1CODE
 #endif
 
-int ff_bfin_uyvytoyv12(const uint8_t *src, uint8_t *ydst, uint8_t *udst, 
uint8_t *vdst,
-                       int width, int height,
+int ff_bfin_uyvytoyv12(const uint8_t *src, uint8_t *ydst, uint8_t *udst,
+                       uint8_t *vdst, int width, int height,
                        int lumStride, int chromStride, int srcStride) L1CODE;
 
-int ff_bfin_yuyvtoyv12(const uint8_t *src, uint8_t *ydst, uint8_t *udst, 
uint8_t *vdst,
-                       int width, int height,
+int ff_bfin_yuyvtoyv12(const uint8_t *src, uint8_t *ydst, uint8_t *udst,
+                       uint8_t *vdst, int width, int height,
                        int lumStride, int chromStride, int srcStride) L1CODE;
 
-static int uyvytoyv12_unscaled(SwsContext *c, uint8_t* src[], int srcStride[], 
int srcSliceY,
-                               int srcSliceH, uint8_t* dst[], int dstStride[])
+static int uyvytoyv12_unscaled(SwsContext *c, uint8_t *src[], int srcStride[],
+                               int srcSliceY, int srcSliceH, uint8_t *dst[],
+                               int dstStride[])
 {
-    uint8_t *dsty = dst[0] + dstStride[0]*srcSliceY;
-    uint8_t *dstu = dst[1] + dstStride[1]*srcSliceY/2;
-    uint8_t *dstv = dst[2] + dstStride[2]*srcSliceY/2;
-    uint8_t *ip   = src[0] + srcStride[0]*srcSliceY;
-    int w         = dstStride[0];
+    uint8_t *dsty = dst[0] + dstStride[0] * srcSliceY;
+    uint8_t *dstu = dst[1] + dstStride[1] * srcSliceY / 2;
+    uint8_t *dstv = dst[2] + dstStride[2] * srcSliceY / 2;
+    uint8_t *ip   = src[0] + srcStride[0] * srcSliceY;
+    int w = dstStride[0];
 
     ff_bfin_uyvytoyv12(ip, dsty, dstu, dstv, w, srcSliceH,
                        dstStride[0], dstStride[1], srcStride[0]);
@@ -60,14 +62,15 @@ static int uyvytoyv12_unscaled(SwsContext *c, uint8_t* 
src[], int srcStride[], i
     return srcSliceH;
 }
 
-static int yuyvtoyv12_unscaled(SwsContext *c, uint8_t* src[], int srcStride[], 
int srcSliceY,
-                               int srcSliceH, uint8_t* dst[], int dstStride[])
+static int yuyvtoyv12_unscaled(SwsContext *c, uint8_t *src[], int srcStride[],
+                               int srcSliceY, int srcSliceH, uint8_t *dst[],
+                               int dstStride[])
 {
-    uint8_t *dsty = dst[0] + dstStride[0]*srcSliceY;
-    uint8_t *dstu = dst[1] + dstStride[1]*srcSliceY/2;
-    uint8_t *dstv = dst[2] + dstStride[2]*srcSliceY/2;
-    uint8_t *ip   = src[0] + srcStride[0]*srcSliceY;
-    int w         = dstStride[0];
+    uint8_t *dsty = dst[0] + dstStride[0] * srcSliceY;
+    uint8_t *dstu = dst[1] + dstStride[1] * srcSliceY / 2;
+    uint8_t *dstv = dst[2] + dstStride[2] * srcSliceY / 2;
+    uint8_t *ip   = src[0] + srcStride[0] * srcSliceY;
+    int w = dstStride[0];
 
     ff_bfin_yuyvtoyv12(ip, dsty, dstu, dstv, w, srcSliceH,
                        dstStride[0], dstStride[1], srcStride[0]);
@@ -75,15 +78,16 @@ static int yuyvtoyv12_unscaled(SwsContext *c, uint8_t* 
src[], int srcStride[], i
     return srcSliceH;
 }
 
-
 void ff_bfin_get_unscaled_swscale(SwsContext *c)
 {
     if (c->dstFormat == PIX_FMT_YUV420P && c->srcFormat == PIX_FMT_UYVY422) {
-        av_log (NULL, AV_LOG_VERBOSE, "selecting Blackfin optimized 
uyvytoyv12_unscaled\n");
+        av_log(NULL, AV_LOG_VERBOSE,
+               "selecting Blackfin optimized uyvytoyv12_unscaled\n");
         c->swScale = uyvytoyv12_unscaled;
     }
     if (c->dstFormat == PIX_FMT_YUV420P && c->srcFormat == PIX_FMT_YUYV422) {
-        av_log (NULL, AV_LOG_VERBOSE, "selecting Blackfin optimized 
yuyvtoyv12_unscaled\n");
+        av_log(NULL, AV_LOG_VERBOSE,
+               "selecting Blackfin optimized yuyvtoyv12_unscaled\n");
         c->swScale = yuyvtoyv12_unscaled;
     }
 }
diff --git a/libswscale/bfin/yuv2rgb_bfin.c b/libswscale/bfin/yuv2rgb_bfin.c
index 68af522..91a7aee 100644
--- a/libswscale/bfin/yuv2rgb_bfin.c
+++ b/libswscale/bfin/yuv2rgb_bfin.c
@@ -26,14 +26,15 @@
 #include <string.h>
 #include <inttypes.h>
 #include <assert.h>
-#include "config.h"
 #include <unistd.h>
+
+#include "config.h"
 #include "libswscale/rgb2rgb.h"
 #include "libswscale/swscale.h"
 #include "libswscale/swscale_internal.h"
 
 #if defined(__FDPIC__) && CONFIG_SRAM
-#define L1CODE __attribute__ ((l1_text))
+#define L1CODE __attribute__((l1_text))
 #else
 #define L1CODE
 #endif
@@ -47,21 +48,20 @@ void ff_bfin_yuv2rgb565_line(uint8_t *Y, uint8_t *U, 
uint8_t *V, uint8_t *out,
 void ff_bfin_yuv2rgb24_line(uint8_t *Y, uint8_t *U, uint8_t *V, uint8_t *out,
                             int w, uint32_t *coeffs) L1CODE;
 
-typedef void (* ltransform)(uint8_t *Y, uint8_t *U, uint8_t *V, uint8_t *out,
-                            int w, uint32_t *coeffs);
-
+typedef void (*ltransform)(uint8_t *Y, uint8_t *U, uint8_t *V, uint8_t *out,
+                           int w, uint32_t *coeffs);
 
 static void bfin_prepare_coefficients(SwsContext *c, int rgb, int masks)
 {
     int oy;
-    oy      = c->yOffset&0xffff;
-    oy      = oy >> 3; // keep everything U8.0 for offset calculation
+    oy = c->yOffset & 0xffff;
+    oy = oy >> 3;      // keep everything U8.0 for offset calculation
 
-    c->oc   = 128*0x01010101U;
-    c->oy   =  oy*0x01010101U;
+    c->oc = 128 * 0x01010101U;
+    c->oy = oy * 0x01010101U;
 
     /* copy 64bit vector coeffs down to 32bit vector coeffs */
-    c->cy  = c->yCoeff;
+    c->cy   = c->yCoeff;
     c->zero = 0;
 
     if (rgb) {
@@ -76,7 +76,6 @@ static void bfin_prepare_coefficients(SwsContext *c, int rgb, 
int masks)
         c->cgv = c->ugCoeff;
     }
 
-
     if (masks == 555) {
         c->rmask = 0x001f * 0x00010001U;
         c->gmask = 0x03e0 * 0x00010001U;
@@ -88,27 +87,25 @@ static void bfin_prepare_coefficients(SwsContext *c, int 
rgb, int masks)
     }
 }
 
-static int core_yuv420_rgb(SwsContext *c,
-                           uint8_t **in, int *instrides,
-                           int srcSliceY, int srcSliceH,
-                           uint8_t **oplanes, int *outstrides,
-                           ltransform lcscf, int rgb, int masks)
+static int core_yuv420_rgb(SwsContext *c, uint8_t **in, int *instrides,
+                           int srcSliceY, int srcSliceH, uint8_t **oplanes,
+                           int *outstrides, ltransform lcscf,
+                           int rgb, int masks)
 {
-    uint8_t *py,*pu,*pv,*op;
+    uint8_t *py, *pu, *pv, *op;
     int w  = instrides[0];
-    int h2 = srcSliceH>>1;
+    int h2 = srcSliceH >> 1;
     int i;
 
     bfin_prepare_coefficients(c, rgb, masks);
 
     py = in[0];
-    pu = in[1+(1^rgb)];
-    pv = in[1+(0^rgb)];
-
-    op = oplanes[0] + srcSliceY*outstrides[0];
+    pu = in[1 + (1 ^ rgb)];
+    pv = in[1 + (0 ^ rgb)];
 
-    for (i=0;i<h2;i++) {
+    op = oplanes[0] + srcSliceY * outstrides[0];
 
+    for (i = 0; i < h2; i++) {
         lcscf(py, pu, pv, op, w, &c->oy);
 
         py += instrides[0];
@@ -125,9 +122,7 @@ static int core_yuv420_rgb(SwsContext *c,
     return srcSliceH;
 }
 
-
-static int bfin_yuv420_rgb555(SwsContext *c,
-                              uint8_t **in, int *instrides,
+static int bfin_yuv420_rgb555(SwsContext *c, uint8_t **in, int *instrides,
                               int srcSliceY, int srcSliceH,
                               uint8_t **oplanes, int *outstrides)
 {
@@ -135,8 +130,7 @@ static int bfin_yuv420_rgb555(SwsContext *c,
                            outstrides, ff_bfin_yuv2rgb555_line, 1, 555);
 }
 
-static int bfin_yuv420_bgr555(SwsContext *c,
-                              uint8_t **in, int *instrides,
+static int bfin_yuv420_bgr555(SwsContext *c, uint8_t **in, int *instrides,
                               int srcSliceY, int srcSliceH,
                               uint8_t **oplanes, int *outstrides)
 {
@@ -144,8 +138,7 @@ static int bfin_yuv420_bgr555(SwsContext *c,
                            outstrides, ff_bfin_yuv2rgb555_line, 0, 555);
 }
 
-static int bfin_yuv420_rgb24(SwsContext *c,
-                             uint8_t **in, int *instrides,
+static int bfin_yuv420_rgb24(SwsContext *c, uint8_t **in, int *instrides,
                              int srcSliceY, int srcSliceH,
                              uint8_t **oplanes, int *outstrides)
 {
@@ -153,8 +146,7 @@ static int bfin_yuv420_rgb24(SwsContext *c,
                            outstrides, ff_bfin_yuv2rgb24_line, 1, 888);
 }
 
-static int bfin_yuv420_bgr24(SwsContext *c,
-                             uint8_t **in, int *instrides,
+static int bfin_yuv420_bgr24(SwsContext *c, uint8_t **in, int *instrides,
                              int srcSliceY, int srcSliceH,
                              uint8_t **oplanes, int *outstrides)
 {
@@ -162,8 +154,7 @@ static int bfin_yuv420_bgr24(SwsContext *c,
                            outstrides, ff_bfin_yuv2rgb24_line, 0, 888);
 }
 
-static int bfin_yuv420_rgb565(SwsContext *c,
-                              uint8_t **in, int *instrides,
+static int bfin_yuv420_rgb565(SwsContext *c, uint8_t **in, int *instrides,
                               int srcSliceY, int srcSliceH,
                               uint8_t **oplanes, int *outstrides)
 {
@@ -171,8 +162,7 @@ static int bfin_yuv420_rgb565(SwsContext *c,
                            outstrides, ff_bfin_yuv2rgb565_line, 1, 565);
 }
 
-static int bfin_yuv420_bgr565(SwsContext *c,
-                              uint8_t **in, int *instrides,
+static int bfin_yuv420_bgr565(SwsContext *c, uint8_t **in, int *instrides,
                               int srcSliceY, int srcSliceH,
                               uint8_t **oplanes, int *outstrides)
 {
@@ -180,24 +170,35 @@ static int bfin_yuv420_bgr565(SwsContext *c,
                            outstrides, ff_bfin_yuv2rgb565_line, 0, 565);
 }
 
-
 SwsFunc ff_yuv2rgb_get_func_ptr_bfin(SwsContext *c)
 {
     SwsFunc f;
 
-    switch(c->dstFormat) {
-    case PIX_FMT_RGB555: f = bfin_yuv420_rgb555; break;
-    case PIX_FMT_BGR555: f = bfin_yuv420_bgr555; break;
-    case PIX_FMT_RGB565: f = bfin_yuv420_rgb565; break;
-    case PIX_FMT_BGR565: f = bfin_yuv420_bgr565; break;
-    case PIX_FMT_RGB24:  f = bfin_yuv420_rgb24;  break;
-    case PIX_FMT_BGR24:  f = bfin_yuv420_bgr24;  break;
+    switch (c->dstFormat) {
+    case PIX_FMT_RGB555:
+        f = bfin_yuv420_rgb555;
+        break;
+    case PIX_FMT_BGR555:
+        f = bfin_yuv420_bgr555;
+        break;
+    case PIX_FMT_RGB565:
+        f = bfin_yuv420_rgb565;
+        break;
+    case PIX_FMT_BGR565:
+        f = bfin_yuv420_bgr565;
+        break;
+    case PIX_FMT_RGB24:
+        f = bfin_yuv420_rgb24;
+        break;
+    case PIX_FMT_BGR24:
+        f = bfin_yuv420_bgr24;
+        break;
     default:
         return 0;
     }
 
     av_log(c, AV_LOG_INFO, "BlackFin accelerated color space converter %s\n",
-           sws_format_name (c->dstFormat));
+           sws_format_name(c->dstFormat));
 
     return f;
 }
-- 
1.7.1

_______________________________________________
libav-devel mailing list
[email protected]
https://lists.libav.org/mailman/listinfo/libav-devel

Reply via email to