【发布时间】:2012-04-30 20:08:06
【问题描述】:
我有几个关于 cuda 调度系统的问题。
A.当我使用例如 foo>() 函数时,卡内部实际发生了什么?我知道每个 SM 从上层接收一个要调度的块,每个 SM 负责调度其传入的 BLOCK,但它是哪一部分呢?例如,如果我有 8 个 SM,当每个 SM 包含 8 个小 CPU 时,上层是否负责调度剩余的 255*255 - (8 * 8) 个线程?
B. 可以定义的最大线程数限制是多少?我的意思是foo<<<X, Y>>>(); x,y =?
C.关于最后一个例子,一个块内可以有多少个线程?我们可以说我们拥有的块/线程越多,执行速度就越快吗?
感谢您的帮助
【问题讨论】:
标签: cuda