CUDA 没有提供涵盖任意结构原子更新的通用原子方法。一些可能性:
-
因为您特别想更新两个相邻的 32 位项目,您可以使用通用的 64 位原子操作,它是here 描述的变体。
-
另一种选择是您已经提到的,基本上是实现critical section。
-
最后,另一种可能的方法可能是parallel reduction,尽管这并不完全类似于原子使用
根据上面的建议 1,这里是对代码 from this answer 的修改,它可能表明您可以如何使用 64 位原子:
$ cat t56.cu
#include <stdio.h>
#define DSIZE 512
#define nTPB 256
#define cudaCheckErrors(msg) \
do { \
cudaError_t __err = cudaGetLastError(); \
if (__err != cudaSuccess) { \
fprintf(stderr, "Fatal error: %s (%s at %s:%d)\n", \
msg, cudaGetErrorString(__err), \
__FILE__, __LINE__); \
fprintf(stderr, "*** FAILED - ABORTING\n"); \
exit(1); \
} \
} while (0)
typedef union {
float floats[2];
unsigned long long int ulong; // for atomic update
} my_atomics;
__device__ my_atomics test;
__device__ unsigned long long int my_atomicAdd_2floats(unsigned long long int* address, float val0, float val1)
{
my_atomics loctest;
unsigned long long old = *address;
do {
loctest.ulong = old;
my_atomics loc;
loc.floats[0] = val0 + loctest.floats[0];
loc.floats[1] = val1 + loctest.floats[1];
old = atomicCAS(address, loctest.ulong, loc.ulong);}
while (old != loctest.ulong);
return old;
}
__global__ void min_test(const float* data)
{
int idx = (blockDim.x * blockIdx.x) + threadIdx.x;
if (idx < DSIZE)
my_atomicAdd_2floats(&(test.ulong), data[idx], (float)idx);
}
int main() {
float *d_data, *h_data;
my_atomics my_init;
my_init.floats[0] = 0.0f;
my_init.floats[1] = 0.0f;
h_data = (float *)malloc(DSIZE * sizeof(float));
if (h_data == 0) {printf("malloc fail\n"); return 1;}
cudaMalloc((void **)&d_data, DSIZE * sizeof(float));
cudaCheckErrors("cm1 fail");
for (int i = 0; i < DSIZE; i++) h_data[i] = 1.0f;
cudaMemcpy(d_data, h_data, DSIZE*sizeof(float), cudaMemcpyHostToDevice);
cudaCheckErrors("cmcp1 fail");
cudaMemcpyToSymbol(test, &(my_init.ulong), sizeof(unsigned long long int));
cudaCheckErrors("cmcp2 fail");
min_test<<<(DSIZE+nTPB-1)/nTPB, nTPB>>>(d_data);
cudaDeviceSynchronize();
cudaCheckErrors("kernel fail");
cudaMemcpyFromSymbol(&(my_init.ulong), test, sizeof(unsigned long long int));
cudaCheckErrors("cmcp3 fail");
printf("device float0 result = %f\n", my_init.floats[0]);
printf("device float1 result = %f\n", my_init.floats[1]);
float host_val0 = 0.0f;
float host_val1 = 0.0f;
for (int i=0; i<DSIZE; i++) {
host_val0 += h_data[i];
host_val1 += (float)(i);}
printf("host float0 result = %f\n", host_val0);
printf("host float1 result = %f\n", host_val1);
return 0;
}
$ nvcc -arch=sm_35 -o t56 t56.cu -Wno-deprecated-gpu-targets
$ cuda-memcheck ./t56
========= CUDA-MEMCHECK
device float0 result = 512.000000
device float1 result = 130816.000000
host float0 result = 512.000000
host float1 result = 130816.000000
========= ERROR SUMMARY: 0 errors
$
我不保证上述代码没有缺陷。我建议在使用前仔细测试。