【发布时间】:2022-11-04 20:29:52
【问题描述】:
我有兴趣估计使用 Intel VTune 在 GPU 上执行的算法或函数的数据传输(以字节为单位)。例如,如果我的算法计算两个向量之间的乘法,每个向量有 10 个浮点元素,卸载后的结果将是:10+10 个浮点元素发送到 GPU,结果 1 被发回,所以我们有 84 个字节总共(21 * 4)。请记住,我对估计感兴趣,而不是 GPU 上的实际结果,因为我没有可用的。
使用 Intel Advisor 可以做到这一点,它被称为“重复使用的估计数据传输”,正如我在以下屏幕中所附的那样: Intel Advisor Data estimation result example
在英特尔 VTune 中,我发现的唯一方法是通过“内存访问”分析,但它将结果表示为加载和存储的数量,并且可能使用硬件计数器,因此如果由于巨大的数据结构导致主内存有多个读数,它们将被考虑在内并且不返回字节数。 Intel VTune Memory access analysis results example
有没有办法使用英特尔 VTune 执行类似的分析?谢谢
【问题讨论】:
标签: memory gpu intel-vtune offloading