【发布时间】:2010-12-06 08:54:23
【问题描述】:
对 ARM11MP Vfpu 进行编程,我查看了文档并担心在执行 4 分量点积(作为 4x4 矩阵乘法的一部分)时以下内容会严重停滞
fmuls s0, s0, s4
fmacs s0, s1, s5
fmacs s0, s2, s6
fmacs s0, s3, s7
累加步骤会在这里产生停顿吗?如果是这样,我将不得不真正改变一些东西,因为我只能使用 32 个单个寄存器,然后按原样使用 9 个。此外,我可以设置向量寄存器以在 1 条指令中执行此操作,但我想知道这 3 个指令周期是否值得,因为我必须几乎立即取消设置它才能存储回内存,除非我溢出到 ARM 寄存器.在没有我的真实 SO 帐户的情况下在家发帖...
【问题讨论】:
-
您是否担心
s1和s5的乘法直到上一次添加到s0完成后才能开始? -
正确,或 s2,s6 与 s0 累加或...
标签: performance assembly arm