【发布时间】:2017-01-23 10:02:49
【问题描述】:
为什么编译器不优化下面代码示例中来自Iterator::Incr 的内联代码的寄存器使用? (Visual Studio 2015,/O2 优化设置)
当我使用本文底部显示的 C++ 代码并引用迭代器时,Iterator::Incr 方法 内联 在 Interpolator::InterpolateFast 内。然而,生成的汇编代码显示 memory 访问Iterator::_rem,尽管这个类成员变量可以放置在 register 内以提高效率。
$LL2@Interpolat:
00020 41 01 19 add DWORD PTR [r9], ebx ; memory access to Iterator::_rem (slow)
00023 4d 63 01 movsxd r8, DWORD PTR [r9]
...
0003e 75 e0 jne SHORT $LL2@Interpolat
当我编译复制迭代器的快速版本时,汇编代码将Iterator::_rem 放在处理器寄存器中,并且只使用一个内存访问数组元素本身。
$LL2@Interpolat:
; 699 : _rem += _incr;
00011 45 03 c2 add r8d, r10d ; Iterator::_rem placed inside registers (fast)
...
当使用对 Iterator 类的引用时,编译器似乎会假定该类已被修改或访问 InterpolateFast(例如,由并发线程),因此避免了寄存器优化。
如何在不复制迭代器的情况下使用处理器寄存器优化内联方法?
typedef unsigned int BYTE;
class Iterator
{
public:
Iterator() {}
Iterator (const Iterator& it) :
_rem (it._rem), _incr (it._incr) {}
inline int Incr (const BYTE* &pSrc)
{
_rem += _incr;
pSrc += _rem >> 16;
return _rem;
}
private:
int _rem;
int _incr;
friend class Interpolator;
};
class Interpolator
{
public:
Interpolator (BYTE* p) : _p (p) {}
int InterpolateFast (int len)
{
int sum = 0;
const BYTE *p = _p;
Iterator& it (_it); // slow version, memory accesses to it._rem
// Iterator it (_it); // fast version, registers optimized
while (len--)
{
int rem = it.Incr (p);
sum += p[0] * rem;
}
return sum;
}
private:
Iterator _it;
const BYTE* _p;
};
int main()
{
BYTE arr[1000];
Interpolator ip (arr);
volatile int sum = ip.InterpolateFast (1000);
return 0;
}
(请注意,本文的代码已被简化,没有有意义的功能。)
【问题讨论】:
-
无法编译。你能发布一个 MCVE 吗?
-
它看起来像一个指针别名问题 - 我不知道 M$ 编译器选项,但对我来说,但尝试 /Oa 或 /Ow 看看它是否有助于“慢”版本。如果是,那么可能是通过代码修改。
-
@RichardHodges:我更新了示例。
-
@Anty:MS VC++ 编译器 (VS2015) 似乎不支持编译器选项 /Oa /Ow(“忽略未知选项”)。我正在为没有 .NET 的 x64 非托管 C++ 进行编译。
标签: c++ optimization visual-studio-2015