c++ - 从 cuda 3D 内存复制到线性内存 : copied data is not where I expected-6ren

c++ - 从 cuda 3D 内存复制到线性内存 : copied data is not where I expected

转载作者：行者123 更新时间：2023-11-30 01:59:31

这是我的问题:

我的设备上有一个 float3 的 3D 数组:

int size[3] = {416,464,512};
cudaExtent extent = make_cudaExtent(size[0]*sizeof(float3),size[1],size[2]);
cudaPitchedPtr renderedVolume;
int ret = cudaMalloc3D(&renderedVolume, extent);
size_t pitch = renderedVolume.pitch; //pitch = 5,120
size_t slicePitch = pitch * size[1]; //slicePitch = 2,375,680

然后我使用它并使其充满出色的数据。

之后我希望将它复制到我主机上的一维线性内存中:

float *host_memory = (float*)malloc(size[0]*size[1]*size[2]*sizeof(float3));
cudaMemcpy3DParms p = {0};
p.srcPtr = renderedVolume;
p.dstPtr = make_cudaPitchedPtr(host_memory,size[0]*sizeof(float3),size[0],size[1]); 
p.extent = make_cudaExtent(size[0]*sizeof(float3),size[1],size[2]);
p.srcPos = make_cudaPos(0,0,0);
p.dstPos = make_cudaPos(0,0,0);
p.kind=cudaMemcpyDeviceToHost;
cudaMemcpy3D(&p);

我正在将 host_memory 中的结果与我最初写入 tu renderedVolume (my_data) 的数据以及我在 3Dmemory 中读取的数据进行比较>，逐片:

float* test1 = (float*)malloc(size[0]*size[1]*sizeof(float3));
cudaMemcpy(test1, myData, size[0]*size[1]*sizeof(float3) , cudaMemcpyDeviceToHost);
float* test2 = (float*)malloc(size[0]*size[1]*sizeof(float3));
cudaMemcpy(test2,(char*)renderedVolume.ptr + slicePitch * i,size[0]*size[1]*sizeof(float3), cudaMemcpyDeviceToHost);

问题:

第一个切片 (i=0) 没问题，我在 host_memory、test1 和 test2 中有相同的数据。
在第二个切片中，我在 test1 和 test2 中有相同的数据。但是，我应该在 host_memory+579072 中找到此数据(=每个切片的 float 数，以及目标倾斜指针的 heigth*pitch)我在 host_memory+577504 中找到了它。它偏离了 1568 字节，这与我所知道的没有任何关系，这就是为什么如果你们中的任何人知道我的代码中可能存在什么问题，我将不胜感激？

最佳答案

这是为从未回答列表中删除此问题而提供的迟到答案。

下面，我提供了一个完整的代码来展示如何分配 3D内存 cudaMalloc3D , 移动主机分配1D内存到3D设备内存 cudaMemcpy3D ，对 3D 执行一些操作设备数据由 test_kernel_3D __global__函数并移动 3D结果数据返回1D主机内存，又是cudaMemcpy3D .

__global__函数 test_kernel_3D对 3D 的每个元素进行平方设备内存。特别是，2D 的每个线程网格负责执行 for沿着“深度”维度循环。

#include<stdio.h>
#include<cuda.h>
#include<cuda_runtime.h>
#include<device_launch_parameters.h>
#include<conio.h>

#define BLOCKSIZE_x 16
#define BLOCKSIZE_y 16

#define N 128
#define M 64
#define W 16

/*****************/
/* CUDA MEMCHECK */
/*****************/
#define gpuErrchk(ans) { gpuAssert((ans), __FILE__, __LINE__); }
inline void gpuAssert(cudaError_t code, char *file, int line, bool abort=true)
{
    if (code != cudaSuccess) 
    {
        fprintf(stderr,"GPUassert: %s %s %d\n", cudaGetErrorString(code), file, line);
        if (abort) { getch(); exit(code); }
    }
}

/*******************/
/* iDivUp FUNCTION */
/*******************/
int iDivUp(int a, int b){ return ((a % b) != 0) ? (a / b + 1) : (a / b); }

/******************/
/* TEST KERNEL 3D */
/******************/
__global__ void test_kernel_3D(cudaPitchedPtr devPitchedPtr)
{
    int tidx =  blockIdx.x*blockDim.x+threadIdx.x;
    int tidy =  blockIdx.y*blockDim.y+threadIdx.y;

    char* devPtr = (char*) devPitchedPtr.ptr;
    size_t pitch = devPitchedPtr.pitch;
    size_t slicePitch = pitch * N;

    for (int w = 0; w < W; w++) {
        char* slice = devPtr + w * slicePitch;
        float* row = (float*)(slice + tidy * pitch);
        row[tidx] = row[tidx] * row[tidx];
    }
}

/********/
/* MAIN */
/********/
int main()
{
    float a[N][M][W];

    for (int i=0; i<N; i++)
        for (int j=0; j<M; j++) 
            for (int w=0; w<W; w++) {
                a[i][j][w] = 3.f;
                //printf("row %i column %i depth %i value %f \n",i,j,w,a[i][j][w]);
            }

    // --- 3D pitched allocation and host->device memcopy
    cudaExtent extent = make_cudaExtent(M * sizeof(float), N, W);

    cudaPitchedPtr devPitchedPtr;
    gpuErrchk(cudaMalloc3D(&devPitchedPtr, extent));

    cudaMemcpy3DParms p = { 0 };
    p.srcPtr.ptr = a;
    p.srcPtr.pitch = M * sizeof(float);
    p.srcPtr.xsize = M;
    p.srcPtr.ysize = N;
    p.dstPtr.ptr = devPitchedPtr.ptr;
    p.dstPtr.pitch = devPitchedPtr.pitch;
    p.dstPtr.xsize = M;
    p.dstPtr.ysize = N;
    p.extent.width = M * sizeof(float);
    p.extent.height = N;
    p.extent.depth = W;
    p.kind = cudaMemcpyHostToDevice;
    gpuErrchk(cudaMemcpy3D(&p));

    dim3 GridSize(iDivUp(M,BLOCKSIZE_x),iDivUp(N,BLOCKSIZE_y));
    dim3 BlockSize(BLOCKSIZE_y,BLOCKSIZE_x);
    test_kernel_3D<<<GridSize,BlockSize>>>(devPitchedPtr);
    gpuErrchk(cudaPeekAtLastError());
    gpuErrchk(cudaDeviceSynchronize());

    p.srcPtr.ptr = devPitchedPtr.ptr;
    p.srcPtr.pitch = devPitchedPtr.pitch;
    p.dstPtr.ptr = a;
    p.dstPtr.pitch = M * sizeof(float); 
    p.kind = cudaMemcpyDeviceToHost;
    gpuErrchk(cudaMemcpy3D(&p));

    for (int i=0; i<N; i++) 
        for (int j=0; j<M; j++) 
            for (int w=0; w<W; w++)
                printf("row %i column %i depth %i value %f\n",i,j,w,a[i][j][w]);

    getch();
    return 0;
}

关于c++ - 从 cuda 3D 内存复制到线性内存 : copied data is not where I expected，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/16107480/

文章推荐： c++ - 为什么 Visual Studio 2012 中的 locals 和 autos 窗口为空？

文章推荐： java - OpenJ9 是否支持 sun.misc.Contished 注释？

文章推荐： android - 同时连接到局域网和互联网？

opengl - 线性/非线性纹理映射扭曲的四边形
在我的 previous question ，已经确定，当纹理四边形时，面部被分解为三角形，纹理坐标以仿射方式插值。不幸的是，我不知道如何解决这个问题。 provided link很有用，但没有达到
Qt运动(线性)模糊
是否有简单的解决方案可以在 Qt 中为图像添加运动模糊？还没有找到任何关于模糊的好教程。我需要一些非常简单的东西，我可以理解，如果我可以改变模糊角度，那就太好了。最佳答案 Qt 没有运动模糊过滤器。
javascript - 线性+阈值统一尺度
我想构建一个有点复杂的轴，它可以处理线性数据到像素位置，直到某个值，在该值中所有内容都被归入一个类别，因此具有相同的数据到像素值。例如，考虑具有以下刻度线的 y 轴: 0%, 10%, 20%, 30
android - 线性、可滚动布局中的基线约束
我需要确保两个 View 元素彼此相邻且垂直高度相同。我会使用基线约束来做到这一点，但目前我正在使用线性、可滚动的布局( ScrollView 中的线性布局)，当我点击一个元素时，它不允许我从中获取基
regex - 如何在非贪婪的正则表达式中避免(线性)回溯？
考虑正则表达式 ".*?\s*$" 和一个不以空格结尾的字符串。示例 " a" .最后\s永远无法匹配 a这就是为什么匹配器迭代: \s\s\s\s\s - fails .\s\s\
approximation - 插值建议(线性，三次？)
Closed. This question needs to be more focused。它当前不接受答案。想要改善这个问题吗？更新问题，使它仅关注editing this post的一个问题。
assembly - 线性、物理、逻辑和虚拟内存地址有什么区别？
我正在尝试阅读英特尔软件开发人员手册以了解操作系统的工作原理，这四个寻址术语让我感到困惑。以上是我的理解，如有不对请指正。线性地址 : 对一个孤立的程序来说，似乎是一长串以地址0开头的内存。该程序的
javascript - 检查数字表达式(线性)是否有效？
有很多方法可以使用正则表达式并相应地使用匹配/测试匹配来检查字符串是否有效。我正在检查包含字母(a-b)、运算符(+、-、/、*)、仅特殊字符(如(')'、'(')和数字(0-9)的表达式是否有效我
r - 线性 SVM 和提取权重
我正在使用 iris 数据集在 R 中练习 SVM，我想从我的模型中获取特征权重/系数，但我想我可能误解了一些东西，因为我的输出给了我 32 个支持向量。假设我要分析四个变量，我会得到四个。我知道在使
r - 线性 SVM 和提取权重
我正在使用 iris 数据集在 R 中练习 SVM，我想从我的模型中获取特征权重/系数，但我想我可能误解了一些东西，因为我的输出给了我 32 个支持向量。假设我要分析四个变量，我会得到四个。我知道在使
java - 如何在android中滑动布局(线性/相对..)
如何向左或向右滑动线性布局。在该线性布局中，默认情况下我有一个不可见的删除按钮，还有一些其他小部件，它们都是可见状态，当向左滑动线性布局时，我需要使其可见的删除按钮，当向右滑动时，我需要隐藏该删除按钮
r - 线性 SVM 中的错误预测
我正在编写一个 R 脚本，运行时会给出因变量的预测值。我的所有变量都被分类(如图所示)并分配了一个编号，总类数为101。(每个类是歌曲名称)。所以我有一个训练数据集，其中包含 {(2,5,6,1)8
java - 线性 RGB 空间中的仿射变换
如果源栅格位于 linear RGB color space使用以下 Java 代码进行转换，应用过滤器时(最后一行)会引发 java.awt.image.ImagingOpException: Un
ios - UIVIew animateWithDuration 线性？
我想为我的多个 UIImageView 设置动画，使其从 A 点线性移动到 B 点。我正在使用 options:UIViewAnimationOptionCurveLinear - Apple 文档
css - 线性，右渐变到透明渐变，底部有额外渐变
我第一次无法使用 CSS3 创建好看的渐变效果。右侧应该有从黑色到透明的渐变透明渐变。底部是页脚，所以它需要在底部另外淡化为透明。如果可能的话，一个例子: 页面的背景是一张图片，所以不可能有非透明淡
c++ - 线性(超定)代数方程的解
我有一组线性代数方程，Ax=By。其中A是36x20的矩阵，x是20x1的 vector ，B是36x13，y是13x1。排名(A)=20。因为系统是超定的，所以最小二乘解是可能的，即； x = (
Python 将每月值插入每日值(线性): Pandas
我有一个带有年月数据列(yyyymm)的 Pandas 数据框。我计划将数据插入每日和每周值。下面是我的 df。 df: 201301 201302 201303
python - 线性 N 次等式问题的最小二乘法
假设我想找到2条任意高维直线的“交点”。这两条线实际上不会相交，但我仍然想找到最相交的点(即尽可能靠近所有线的点)。假设这些线有方向向量A、B和初始点C、D，我可以通过简单地设置一个线性最小二乘问题
java - 线性 "smoothed"函数使用查找表
如果我想编写一个函数(可能也是一个类)，它从不可变的查找表(调用构造函数时固定)返回线性“平滑”数据，如下所示: 例如func(5.0) == 0.5。存储查找表的最佳方式是什么？我正在考虑使用两
python - 线性 X 对数刻度
给定一条线 X像素长如: 0-------|---V---|-------|-------|-------max 如果0 <= V <= max , 线性刻度 V位置将是 X/max*V像素。如何计

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

c++ - 从 cuda 3D 内存复制到线性内存 : copied data is not where I expected