【发布时间】:2012-09-02 03:01:35
【问题描述】:
我正在编写一个循环中涉及一些障碍的 OpenCL 内核。我已经在 CPU(8 核 FX8150)上测试了内核,结果显示这些障碍将运行速度降低了 50~100 倍(我通过使用多线程 + CyclicBarrier 在 Java 上重新实现内核进一步验证了这一点) .我怀疑原因是屏障基本上阻止了 CPU 利用乱序执行,所以我有点担心我是否会在 GPU 上观察到同样幅度的速度下降。我检查了一些官方文件并搜索了一下,但关于这个主题的信息很少。
【问题讨论】:
-
当然有。您应该通过代码异构地拆分耗时的 fpu 计算,以便它可以进行整数计算。同时做漂浮
-
@tuğrulbüyükışık 谢谢。你能指点我一份证实这一点的官方文件(供参考)吗?
标签: parallel-processing cpu gpu