【发布时间】:2012-12-13 14:11:25
【问题描述】:
我目前正在实现一种算法,该算法在小矩阵和向量上分配线性代数。代码很快,但我想知道在 gpgpu 而不是 cpu 上实现它是否有意义。
我能够将大部分矩阵和向量存储在 gpu 内存中作为预处理步骤,并配置乘法算法,这些算法在 gpu 上当然要快得多。
但现在我的真正问题是, 如何确定从 cpu 调用 gpu 的开销?我失去了多少周期才能执行我的代码之类的东西?
我希望有人能提供一些意见?
【问题讨论】:
标签: c++ opencl linear-algebra gpgpu