特别声明: 设备GTX1050Ti, 计算能力6.1.代码附在后面;

缓存加载:

(1)Pascal架构,启用L1缓存,-Xptxas -dlcm=ca 。即采用128字节内存事务。

  采用不同的偏移量,以实现非对齐访问。命令行为:“nvprof --metircs gld_efficiency test.exe N” (N为偏移量)。采用批处理,计算0-255的偏移量的全局内存加载效率,统计结果如下:偏移量每隔4,跳变一次。

CUDA-全局内存读取-实验(缓存+非缓存-Pascal架构-sm6.1)

非缓存加载:

(1)Pascal架构,禁用L1缓存,-Xptxas -dlcm=cg 。即采用32字节内存事务。

  采用不同的偏移量,以实现非对齐访问。命令行为:“nvprof --metircs gld_efficiency test.exe N” (N为偏移量)。采用批处理,计算0-255的偏移量的全局内存加载效率,统计结果如下:偏移量每隔8,跳变一次。

CUDA-全局内存读取-实验(缓存+非缓存-Pascal架构-sm6.1)

计算性能对比:

CUDA-全局内存读取-实验(缓存+非缓存-Pascal架构-sm6.1)


相关文章:

  • 2021-11-17
  • 2022-01-06
  • 2021-04-12
  • 2021-12-08
  • 2021-12-23
  • 2021-08-26
  • 2022-12-23
猜你喜欢
  • 2021-10-10
  • 2021-09-03
  • 2022-01-16
  • 2022-02-19
  • 2021-07-21
  • 2021-08-19
  • 2021-04-14
相关资源
相似解决方案