【发布时间】:2015-07-25 15:06:46
【问题描述】:
我是 GPU 和并行编程的新手。 我想在不同的数据上并行执行一个函数说'A',比如x1,x2,x3 .... 'A' 调用函数 'cublas_sgemm' 。
那么我是否需要关心 cublas_sgemm 的实现?
【问题讨论】:
-
听起来您想从自定义 CUDA 内核中调用
cublas_sgemm,对吧?为什么不想使用主机 API? -
简单来说,我想在不同的数据上同时调用cublas_sgemm。那么如何知道优化性能时可以调用的 cublas_sgemm 实例的最佳数量(假设我知道矩阵的最大维数)?
-
GPU 内核设计为超额订阅。它是性能所必需的。如果您有任务要在最短的时间内完成,请尽快启动所有并行操作。