【发布时间】:2011-06-29 01:36:50
【问题描述】:
我通过使用一维数据类型并将其包装成行和列,在 C++ 中实现了一个矩阵数据类型。现在,我希望有可能从此时开始创建方形/块状子矩阵,并且我想在内存中进行。
问题是我希望这些子矩阵中的一些可以转移到 GPU 内存中,并且可以在那里并行处理它们。例如,这对矩阵乘法很有用。由于这些子矩阵在主内存中没有对齐,如果不创建单独的副本,将它们作为一个单元复制到设备内存看起来是不可能的?我希望将此直接 GPU 子矩阵复制映射到 CPU 原始矩阵以进行更新和提高效率。我事先不知道确切的分区。
有人知道我怎样才能实现它吗?
提醒一下,矩阵需要按块划分,而不是按行划分,这在 C/C++ 中相对容易。
【问题讨论】: