【问题标题】:Reading event counters with concurrent exection读取并发执行的事件计数器
【发布时间】:2015-05-16 18:42:32
【问题描述】:

我在同时执行两个内核时尝试使用 nvprof 读取性能计数器。

nvprof --concurrent-kernels on --events fb_subp0_write_sectors ./myprogram

但是,通过这样做,内核执行似乎是序列化的。我想要的正是它们在同时运行时的表现。

当内核同时运行时,是否可以读取性能计数器?我不一定需要每个内核的性能,聚合数据非常好。

我在具有计算 3.5 的 Kepler gpu 上运行。

【问题讨论】:

    标签: cuda profiling nvidia


    【解决方案1】:

    没有。 nvprof v7.5 及更早版本不支持以有助于调查并发内核性能的方式收集性能计数器。我建议您通过 NVIDIA 开发者计划提交功能请求。这在团队任务列表中。客户反馈有助于将功能上移。

    【讨论】:

    • 这就是我的猜测。 Cupti 怎么样?
    • CUPTI 有一种模式可以让您从 CPU 读取计数器值。您可以读取事件的频率相当低,并且值不会绑定到并发内核周围的时间范围。
    猜你喜欢
    • 2020-03-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-07-01
    • 2019-11-23
    相关资源
    最近更新 更多