【发布时间】:2015-05-16 18:42:32
【问题描述】:
我在同时执行两个内核时尝试使用 nvprof 读取性能计数器。
nvprof --concurrent-kernels on --events fb_subp0_write_sectors ./myprogram
但是,通过这样做,内核执行似乎是序列化的。我想要的正是它们在同时运行时的表现。
当内核同时运行时,是否可以读取性能计数器?我不一定需要每个内核的性能,聚合数据非常好。
我在具有计算 3.5 的 Kepler gpu 上运行。
【问题讨论】: