【问题标题】:Copy unmanaged System.IntPtr byte vector into GPU row of 2D device byte array将非托管 System.IntPtr 字节向量复制到 2D 设备字节数组的 GPU 行
【发布时间】:2014-12-25 17:09:04
【问题描述】:

我正在使用 C# 和 CUDAfy.net(是的,这个问题在带有指针的直接 C 中更容易,但考虑到更大的系统,我有使用这种方法的原因)。

我有一个视频图像采集卡,它以 30 FPS 的速度收集字节 [1024 x 1024] 图像数据。每 33.3 毫秒,它填充一个循环缓冲区中的一个槽,并返回一个 System.IntPtr,它指向 *byte 的非托管 1D 向量;循环缓冲区有 15 个插槽。

在 GPU 设备 (Tesla K40) 上,我想要一个全局 2D 阵列,该阵列被组织为密集的 2D 阵列。也就是说,我想要类似循环队列的东西,但在 GPU 上组织为密集的 2D 数组。

byte[15, 1024*1024] rawdata; 
// if CUDAfy.NET supported jagged arrays I could use byte[15][1024*1024 but it does not

如何每 33 毫秒填写不同的行?我是否使用类似的东西:

gpu.CopyToDevice<byte>(inputPtr, 0, rawdata, offset, length) // length = 1024*1024
//offset is computed by  rowID*(1024*1024) where rowID wraps to 0 via modulo 15.
// inputPrt is the System.Inptr that points to the buffer in the circular queue (un-managed)?
// rawdata is a device buffer allocated gpu.Allocate<byte>(1024*1024);

在我的内核头文件中是:

[Cudafy]
public static void filter(GThread thread, byte[,] rawdata, int frameSize, byte[] result)

我确实尝试了一些类似的方法。但是 CudaFy 中没有 API 模式用于:

GPGPU.CopyToDevice(T) Method (IntPtr, Int32, T[,], Int32, Int32, Int32)

所以我使用 gpu.Cast 函数将 2D 设备数组更改为 1D。

我尝试了下面的代码,但我得到了 CUDA.net 异常:ErrorLaunchFailed

仅供参考:当我尝试 CUDA 模拟器时,它在 CopyToDevice 上中止 声称数据不是主机分配的

public static byte[] process(System.IntPtr data, int slot)
{
    Stopwatch watch = new Stopwatch();
    watch.Start();
    byte[] output = new byte[FrameSize];
    int offset = slot*FrameSize;
    gpu.Lock();
    byte[] rawdata = gpu.Cast<byte>(grawdata, FrameSize); // What is the size supposed to be? Documentation lacking
    gpu.CopyToDevice<byte>(data, 0, rawdata, offset, FrameSize * frameCount);
    byte[] goutput = gpu.Allocate<byte>(output);
    gpu.Launch(height, width).filter(rawdata, FrameSize, goutput);
    runTime = watch.Elapsed.ToString();
    gpu.CopyFromDevice(goutput, output);
    gpu.Free(goutput);
    gpu.Synchronize();
    gpu.Unlock();
    watch.Stop();
    totalRunTime = watch.Elapsed.ToString();
    return output;
}

【问题讨论】:

  • 很难理解您的问题是什么,能否请您改写或补充细节?如果您关心的是指针算法,那对我来说似乎是正确的。
  • 我更新了今天的故事。
  • 问题中提到的“CUDA模拟器”是什么?
  • CUDAfy.NET 具有基于 CPU 的仿真模式,您可以使用它来调试内核,而无需使用 NSight 工具。它对这类高级调试很有用。
  • 数据不是主机分配的,通​​常是指在需要时没有主机固定内存。您可以查看cudafy.codeplex.com/discussions/352698 上的倒数第二个帖子,了解他们如何为异步副本做到这一点。我不确定您需要主机固定代码的确切位置或原因,但这似乎是模拟器的问题。您是否从内核调用中收到启动错误?如果您注释掉该行,您是否没有错误?

标签: c# cuda cudafy.net


【解决方案1】:

我现在提出这个“解决方案”,或者: 1. 只在本机模式下运行程序(而不是在仿真模式下)。 2. 不要自己处理固定内存分配。

现在似乎有一个悬而未决的问题。但这仅在仿真模式下发生

见:https://cudafy.codeplex.com/workitem/636

【讨论】:

  • 我不使用仿真。我只是想出于调试目的对其进行测试。但正如我上面所说,我已经解决了我的问题。
【解决方案2】:

如果我正确理解您的问题,我认为您希望将从循环缓冲区获得的
byte* 转换为要发送到
的多维 byte 数组 显卡 API。

            int slots = 15;
            int rows = 1024;
            int columns = 1024;

//Try this
            for (int currentSlot = 0; currentSlot < slots; currentSlot++)
            {
                IntPtr intPtrToUnManagedMemory = CopyContextFrom(currentSlot);
                // use Marshal.Copy ?  
                byte[] byteData = CopyIntPtrToByteArray(intPtrToUnManagedMemory); 

                int offset =0;
                for (int m = 0; m < rows; m++)
                    for (int n = 0; n < columns; n++)
                    {
                        //then send this to your GPU method
                        rawForGpu[m, n] = ReadByteValue(IntPtr: intPtrToUnManagedMemory, 
                                                        offset++);
                    }
            }

//or try this
            for (int currentSlot = 0; currentSlot < slots; currentSlot++)
            {
                IntPtr intPtrToUnManagedMemory = CopyContextFrom(currentSlot);

                // use Marshal.Copy ?
                byte[] byteData = CopyIntPtrToByteArray(intPtrToUnManagedMemory); 

                byte[,] rawForGpu = ConvertTo2DArray(byteData, rows, columns);
            }
        }

        private static byte[,] ConvertTo2DArray(byte[] byteArr, int rows, int columns)
        {
            byte[,] data = new byte[rows, columns];
            int totalElements = rows * columns;
            //Convert 1D to 2D rows, colums
            return data;
        }

        private static IntPtr CopyContextFrom(int slotNumber)
        {
            //code that return byte* from circular buffer.
            return IntPtr.Zero;
        }

【讨论】:

  • 正如我所说,这是我的一个愚蠢的错误。我一周前修好了。
【解决方案3】:

您应该考虑使用内置的 GPGPU Async 功能,以便以一种非常有效的方式将数据从主机/设备移动到主机/设备并使用gpuKern.LaunchAsync(...)

查看http://www.codeproject.com/Articles/276993/Base-Encoding-on-a-GPU 了解使用此功能的有效方法。另一个很好的例子可以在 CudafyExamples 项目中找到,寻找 PinnedAsyncIO.cs。完成您所描述的一切所需的一切。

这是在 Cudafy.Host 项目的CudaGPU.cs 中,它与您正在寻找的方法相匹配(只是它是异步的):

public void CopyToDeviceAsync<T>(IntPtr hostArray, int hostOffset, DevicePtrEx devArray,
                                  int devOffset, int count, int streamId = 0) where T : struct;
public void CopyToDeviceAsync<T>(IntPtr hostArray, int hostOffset, T[, ,] devArray,
                                 int devOffset, int count, int streamId = 0) where T : struct;
public void CopyToDeviceAsync<T>(IntPtr hostArray, int hostOffset, T[,] devArray,
                                  int devOffset, int count, int streamId = 0) where T : struct;
public void CopyToDeviceAsync<T>(IntPtr hostArray, int hostOffset, T[] devArray,
                                  int devOffset, int count, int streamId = 0) where T : struct;

【讨论】:

    猜你喜欢
    • 2011-11-23
    • 1970-01-01
    • 1970-01-01
    • 2020-12-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-03-19
    相关资源
    最近更新 更多