SSE 比常规函数慢得多答案

【问题标题】：SSE much slower than regular functionSSE 比常规函数慢得多
【发布时间】：2012-04-11 08:23:42
【问题描述】：

我正在使用 SSE 制作 Julia 集可视化。这是我的代码类和运算符

class vec4 {
    public:
        inline vec4(void) {}
        inline vec4(__m128 val) :v(val) {}

        __m128 v;

        inline void operator=(float *a) {v=_mm_load_ps(a);}
        inline vec4(float *a) {(*this)=a;} 
        inline vec4(float a) {(*this)=a;}

        inline void operator=(float a) {v=_mm_load1_ps(&a);}

};

inline vec4 operator+(const vec4 &a,const vec4 &b) { return _mm_add_ps(a.v,b.v); }
inline vec4 operator-(const vec4 &a,const vec4 &b) { return _mm_sub_ps(a.v,b.v); }
inline vec4 operator*(const vec4 &a,const vec4 &b) { return _mm_mul_ps(a.v,b.v); }
inline vec4 operator/(const vec4 &a,const vec4 &b) { return _mm_div_ps(a.v,b.v); }
inline vec4 operator++(const vec4 &a)
{
    __declspec(align(16)) float b[4]={1.0f,1.0f,1.0f,1.0f};
    vec4 B(b);
    return _mm_add_ps(a.v,B.v); 
}

函数本身：

vec4 TWO(2.0f);
vec4 FOUR(4.0f);
vec4 ZER(0.0f);

vec4 CR(cR);
vec4 CI(cI);

for (int i=0; i<320; i++) //H
{
    float *pr = (float*) _aligned_malloc(4 * sizeof(float), 16); //dynamic

    __declspec(align(16)) float pi=i*ratioY + startY;

    for (int j=0; j<420; j+=4) //W
    {

        pr[0]=j*ratioX + startX;
        for(int x=1;x<4;x++)
        {
            pr[x]=pr[x-1]+ratioX;
        }

        vec4 ZR(pr);
        vec4 ZI(pi);

        __declspec(align(16)) float color[4]={0.0f,0.0f,0.0f,0.0f};

        vec4 COLOR(color);
        vec4 COUNT(0.0f);

        __m128 MASK=ZER.v;

        int _count;
        enum {max_count=100};
        for (_count=0;_count<=max_count;_count++) 
        {

            vec4 tZR=ZR*ZR-ZI*ZI+CR;
            vec4 tZI=TWO*ZR*ZI+CI;
            vec4 LEN=tZR*tZR+tZI*tZI;

            __m128 MASKOLD=MASK;
            MASK=_mm_cmplt_ps(LEN.v,FOUR.v);

            ZR=_mm_or_ps(_mm_and_ps(MASK,tZR.v),_mm_andnot_ps(MASK,ZR.v));
            ZI=_mm_or_ps(_mm_and_ps(MASK,tZI.v),_mm_andnot_ps(MASK,ZI.v));

            __m128 CHECKNOTEQL=_mm_cmpneq_ps(MASK,MASKOLD);    
            COLOR=_mm_or_ps(_mm_and_ps(CHECKNOTEQL,COUNT.v),_mm_andnot_ps(CHECKNOTEQL,COLOR.v));

            COUNT=COUNT++;
            operations+=17;

            if (_mm_movemask_ps((LEN-FOUR).v)==0) break; 
        }
        _mm_store_ps(color,COLOR.v);

SSE 需要 553k 次操作（mull、add、if）并且需要大约 320 毫秒才能完成任务另一方面，常规函数需要 1428k 操作但只需要 ~90ms 来计算？我使用了 vs2010 性能分析器，似乎所有的数学运算符都运行得很慢。我做错了什么？

【问题讨论】：

您可能需要仔细检查您的内联运算符函数实际上是否正在被内联。我之前做过类似的事情，结果发现即使使用inline 声明，VS 也拒绝内联函数。所以我最终需要使用__forceinline。
如果您发布一个完全独立的示例来显示这种差异，它也可能会有所帮助。您显示的代码不能自行编译。
我不确定 SIMD 是否适合此算法，因为每个点需要执行的迭代次数可能不同。 GPU 可能会更好，甚至可以通过 cpu 内核并行化。
上面我第二个神秘主义者的评论。需要提供两种实现（SSE 和非 SSE）的独立示例，以真正确定问题所在。另外，您使用的是什么优化级别？在低优化级别，编译器可能会做一些愚蠢的事情，尤其是在内部循环中生成的所有临时 vec4 变量。

标签： c++ visual-studio-2010 windows-forms-designer sse

【解决方案1】：

您遇到的问题是 SSE 内在函数执行的内存操作比非 SSE 版本多得多。使用你的矢量类我写了这个：

int main (int argc, char *argv [])
{
  vec4 a (static_cast <float> (argc));
  cout << "argc = " << argc << endl;
  a=++a;
  cout << "a = (" << a.v.m128_f32 [0] << ", " << a.v.m128_f32 [1] << ", " << a.v.m128_f32 [2] << ", " << a.v.m128_f32 [3] << ", " << ")" << endl;
}

在发布版本中产生了以下操作（我已对其进行了编辑以仅显示 SSE）：

fild        dword ptr [ebp+8] // load argc into FPU
fstp        dword ptr [esp+10h] // save argc as a float

movss       xmm0,dword ptr [esp+10h] // load argc into SSE
shufps      xmm0,xmm0,0 // copy argc to all values in SSE register
movaps      xmmword ptr [esp+20h],xmm0 // save to stack frame

fld1 // load 1 into FPU
fst         dword ptr [esp+20h] 
fst         dword ptr [esp+28h] 
fst         dword ptr [esp+30h] 
fstp        dword ptr [esp+38h] // create a (1,1,1,1) vector
movaps      xmm0,xmmword ptr [esp+2Ch] // load above vector into SSE
addps       xmm0,xmmword ptr [esp+1Ch] // add to vector a
movaps      xmmword ptr [esp+38h],xmm0 // save back to a

注意：地址是相对于 ESP 的，有一些推送解释了相同值的偏移量的奇怪变化。

现在，将代码与此版本进行比较：

int main (int argc, char *argv [])
{
  float a[4];
  for (int i = 0 ; i < 4 ; ++i)
  {
    a [i] = static_cast <float> (argc + i);
  }
  cout << "argc = " << argc << endl;
  for (int i = 0 ; i < 4 ; ++i)
  {
    a [i] += 1.0f;
  }
  cout << "a = (" << a [0] << ", " << a [1] << ", " << a [2] << ", " << a [3] << ", " << ")" << endl;
}

编译器为上面创建了这段代码（再次编辑并带有奇怪的偏移量）

fild        dword ptr [argc] // converting argc to floating point values
fstp        dword ptr [esp+8] 
fild        dword ptr [esp+4] // the argc+i is done in the integer unit
fstp        dword ptr [esp+0Ch] 
fild        dword ptr [esp+8] 
fstp        dword ptr [esp+18h]
fild        dword ptr [esp+10h]
fstp        dword ptr [esp+24h] // array a now initialised

fld         dword ptr [esp+8] // load a[0]
fld1 // load 1 into FPU
fadd        st(1),st // increment a[0]
fxch        st(1)
fstp        dword ptr [esp+14h] // save a[0]
fld         dword ptr [esp+1Ch] // load a[1]
fadd        st,st(1) // increment a[1]
fstp        dword ptr [esp+24h] // save a[1]
fld         dword ptr [esp+28h] // load a[2]
fadd        st,st(1) // increment a[2]
fstp        dword ptr [esp+28h]  // save a[2]
fadd        dword ptr [esp+2Ch] // increment a[3]
fstp        dword ptr [esp+2Ch] // save a[3]

在内存访问方面，增量要求：

SSE                  FPU
4xfloat write        1xfloat read
1xsse read           1xfloat write
1xsse read+add       1xfloat read
1xsse write          1xfloat write
                     1xfloat read
                     1xfloat write
                     1xfloat read
                     1xfloat write

total
8 float reads        4 float reads
8 float writes       4 float writes

这表明 SSE 使用的内存带宽是 FPU 版本的两倍，内存带宽是主要瓶颈。

如果您想认真地最大化 SSE，那么您需要在单个 SSE 汇编程序函数中编写整个算法，这样您就可以尽可能地消除内存读/写。使用内在函数并不是优化的理想解决方案。

【讨论】：

忘了说：上面的汇编是VS2005生成的。

【解决方案2】：

这是另一个例子（Mandelbrot Sets），它与我的 Julia 集合算法的实现方式几乎相同 http://pastebin.com/J90paPVC 基于 http://www.iquilezles.org/www/articles/sse/sse.htm。同样的故事 FPU>SSE 我什至跳过了一些不相关的操作。任何想法如何正确地做到这一点？

【讨论】：

问题在于算法对不同输入的行为不同，这与 SSE 所做的相反 - SIMD = 单指令多数据，算法对不同输入的行为必须相同。
我能够“修复”这个问题，但是我不明白为什么会这样！而不是在 vs 中调试，我已经从中实现了程序，然后运行 exe。出乎意料的是，SSE 开始工作的速度比 nonSSE 快 3 倍。有谁知道编译器在处理 sse 代码时会优化什么？