【发布时间】:2013-01-31 20:11:28
【问题描述】:
我有一个计算能力为 1.3 的 GPU。根据文档,当相同半扭曲的线程根据字长从相同的 32-64 或 128 字节内存段访问字节时,这些内存访问会合并为一个。
但是,在使用 cudaMallocPitch() 分配的二维数组的情况下,当同一个 half-warp 的线程访问连续字节时,是否保证这些字节驻留在同一个内存段?
CUDA coalesced access to global memory 有一个类似的问题,但不包括计算能力 1.3 GPU 和 2D 数组。
【问题讨论】:
标签: c optimization cuda