【发布时间】:2023-03-03 09:35:01
【问题描述】:
我的代码
我正在编写一个在学术项目中使用此功能的简单代码:
void calculateDistanceMatrix(const float data[M][N],
float distance[M][N]) {
float sum = 0.0;
for(int i = 0; i < M; i++) {
for(int j = i+1; j < M; j++) {
for(int k = 0; k < N; w++) {
sum += (data[i][k] - data[j][k]) *
(data[i][k] - data[j][k]);
}
distance[i][j] = sum;
distance[j][i] = sum;
distance[i][i] = 0.0;
sum = 0.0;
}
}
}
我的目标架构
我的代码应该只对“数据”执行这个简单的矩阵运算,并用结果填充“距离”矩阵。然而,在我的学术项目中,我对编译器如何为我正在使用的 ARM 架构优化这些向量操作感兴趣。编译的命令行包含以下内容:
arm-none-eabi-gcc <flags> <my_sources> -mcpu=cortex-a9 -mfpu=vfpv3 -mfloat-abi=hard <more_flags>
我的程序旨在在嵌入式 Xilinx Zynq-7000 器件中运行,其架构包括针对向量运算的 NEON 优化指令集(在this nice presentation 中描述)
我的问题
我必须在有和没有编译器优化的情况下跟踪“calculateDistanceMatrix”函数中向量操作的执行性能。我注意到汇编输出包括用于向量加载和存储操作的共享 NEON 和 VFP 指令(详见ARM's Assembler Reference for Version 5.0):
ecf37a01 vldmia r3!, {s15}
ecf26a01 vldmia r2!, {s13}
e1530000 cmp r3, r0
ee777ae6 vsub.f32 s15, s15, s13
ee077aa7 vmla.f32 s14, s15, s15
1afffff9 bne 68 <calculateDistanceMatrix+0x48>
eca17a01 vstmia r1!, {s14}
我找不到编译此代码的方法,以便不使用这些优化指令。
您知道任何可以避免这些指令的编译配置或代码技巧吗?感谢您对此问题的任何帮助。
【问题讨论】:
-
gcc.gnu.org/onlinedocs/gcc/ARM-Options.html -
+nofp的东西? -
我没有看到这些“-march”选项,谢谢@EugeneSh。 !但是,我无法使它们工作……在以某种方式编辑我的编译命令行后,“-march=...+nofp”和“-mcpu=...+nofp”都与我项目中的其他库一起失败。我想我将不得不花一些时间来隔离它并重试这个编译。我的另一个赌注是编译指示“#pragma GCC target ("armv7+nofp")”,但它对程序集也没有影响。
-
也许,如果您在提出问题之前进行了一些研究,您就不会将标量浮点运算误认为向量运算。下次尝试阅读架构参考手册条目以获取说明。
-
你应该对所有对象使用相同的 arch/cpu/fp 选项,因为它会改变 ABI
-
您可以尝试不同的优化级别,例如
-Os,-O1。我相信使用-O0 -g进行调试是正常的
标签: c gcc arm compiler-optimization eabi