c++ - 经过这么多循环后，cuda 计算给出了 nan-6ren

c++ - 经过这么多循环后，cuda 计算给出了 nan

转载作者：行者123 更新时间：2023-11-30 05:16:18

这是我第一次使用 cuda。我正在 NxNxN 网格 (N=128) 上运行一些涉及 cufft 和两个简单内核的计算。它似乎工作正常，直到 4040 和 4050 循环之间的某个时间，我的网格点的值变成了 nan。在较小的网格上，它可以在失败之前完成更多的循环。这让我觉得某处存在内存泄漏。我尝试运行 cuda-memcheck 但它没有返回任何错误。你能发现任何可能导致这种情况的问题吗？我已将代码减少到最低限度，但它仍然很长，我很抱歉。感谢您的帮助。

#define _USE_MATH_DEFINES
#include <iostream>
#include <math.h>
#include <cstdlib>

#include <cuda_runtime.h>
#include <cufft.h>
#include <cufftXt.h>
using namespace std;

__global__ void Cube (cufftComplex *data, cufftComplex *data3, int n) {

    int i = blockIdx.x * blockDim.x + threadIdx.x;

    if (i<n){
        data3[i].x = pow(data[i].x, 3);
        data3[i].y = 0;
    }
    __syncthreads();
}

__global__ void Spectral (cufftComplex *data, cufftComplex *data3, float *w, float *v, int n) {

    int i = blockIdx.x * blockDim.x + threadIdx.x;   

    if (i<n){
        data[i].x = (w[i] * data[i].x + data3[i].x * v[i]) / n;
        data[i].y = 0;
    }
    __syncthreads();
}

float ran();

int main (int argc, char **argv) {
    float QQ, C;

    float tmax = 5000;
    int N = 128;
    int n = N*N*N;
    float dn = M_PI/8;
    float dt = .075;
    float psi0 = -0.175;
    float r = -0.1;

    tmax *= dt;

    //setup cuda complex arrays
    int mem_size = sizeof(cufftComplex)*n;  
    int float_mem_size = sizeof(float)*n;

    cufftComplex *h_data = (cufftComplex*)malloc(mem_size);
    cufftComplex *d_data;
    cudaMalloc((void**)&d_data, mem_size);

    cufftComplex *h_data3 = (cufftComplex*)malloc(mem_size);
    cufftComplex *d_data3;
    cudaMalloc((void**)&d_data3, mem_size);

    float * h_w = (float*)malloc(float_mem_size);   
    float *d_w;
    cudaMalloc(&d_w, float_mem_size);

    float * h_v = (float*)malloc(float_mem_size);
    float *d_v;
    cudaMalloc(&d_v, float_mem_size);

    for (int i=0; i<n; i++){
    h_data[i].x = psi0 + r * ran();
    h_data[i].y = 0;
    }

    int nx, ny, nz;
    float B = -4 * M_PI * M_PI / ( pow((N*dn),2));
    for (int i=0; i<n; i++){
    nx = (i % N);
        ny = (i / N) % N;
        nz = i / (N * N);

        if (nx > (N / 2)) {
            nx = (N - nx);
        }
        if (ny > (N / 2)) {
            ny = (N - ny);
        }
        if (nz > (N / 2)) {
            nz = (N - nz);
        }

    QQ = B * (pow(nx, 2.0) + pow(ny, 2.0) + pow(nz, 2.0));
    C = -r - 2.0 * QQ - pow(QQ, 2.0);

    h_w[i] = exp(QQ * (1.0 - C) * dt);
    h_v[i] = (h_w[i] - 1.0) / (1.0 - C);

    }

    cudaMemcpy(d_w, h_w, float_mem_size, cudaMemcpyHostToDevice);
    cudaMemcpy(d_v, h_v, float_mem_size, cudaMemcpyHostToDevice);
    cudaMemcpy(d_data, h_data, mem_size, cudaMemcpyHostToDevice);

    cufftHandle plan;
    cufftPlan3d(&plan, N, N, N, CUFFT_C2C); 

    int maxThreads=(N>1024)?1024:N;
    int threadsPerBlock = maxThreads;
    int numBlocks = n/maxThreads;    

    for (float t = 0; t < tmax; t += dt) {

    Cube <<<numBlocks, threadsPerBlock>>> (d_data, d_data3, n);
    cudaDeviceSynchronize();

    cufftExecC2C(plan, d_data3, d_data3, CUFFT_FORWARD);
    cudaDeviceSynchronize();

    cufftExecC2C(plan, d_data, d_data, CUFFT_FORWARD);
    cudaDeviceSynchronize();

    Spectral <<<numBlocks, threadsPerBlock>>> (d_data, d_data3, d_w, d_v, n);
    cudaDeviceSynchronize();

    cufftExecC2C(plan, d_data, d_data, CUFFT_INVERSE);
    cudaDeviceSynchronize();

}

    //check output (should be a number)
    cudaMemcpy(h_data, d_data, mem_size, cudaMemcpyDeviceToHost);
    cout <<h_data[0].x <<endl;

    //clean up
    cufftDestroy(plan);
    cudaFree(d_data);
    cudaFree(d_data3);
    cudaFree(d_w);
    cudaFree(d_v);
    free(h_w);
    free(h_v);
    free(h_data);
    free(h_data3);

    return 0;
}

float ran(){    //random in range [-1,1]
    float u= float (rand())/(RAND_MAX);
    //return round(u);
    return 2*u-1;
}

最佳答案

到目前为止，这是我对您的代码进行的检测。当我在 my_assert 中启用设备断言时，它表明 nan5 点的 d_data3 输入失败(即它是 nan)。这表明 cufftExecC2C 对 d_data3 的调用立即产生了 nan 数据。如果输入无效，我相信 FFT 会产生超出范围的结果。

代码被检测以允许您转储数据并查看它。您将必须修改 dump_data 以显示您希望看到的任何内容。

当我运行下面的代码时，它最终会打印出:

4850.14
4851.14
4852.14
4853.14
4854.14
4855.14
4856.14
4857.14
4858.14
4859.14
4860.14
d_data3 output nan check failed
$

因此 nan 首先出现在迭代 4860 上，并且 d_data3 输入检查没有失败，因此 nan 出现在 d_data3 作为循环迭代 4860 中 FFT 运算的结果。您需要研究输入和输出数据，看看是否可以确定原因。 Cube 内核中的 d_data3 数据可能有一些修改导致了此问题。例如，由于您在重复对数据进行立方化，在某些时候它会超出 float 范围似乎不是很合理吗？

这是我的检测代码:

#include <iostream>
#include <math.h>
#include <cstdlib>

#include <cuda_runtime.h>
#include <cufft.h>
#include <cufftXt.h>
#include <assert.h>
#include <stdio.h>
using namespace std;

__host__ __device__ void my_assert(bool cond){

  //assert(cond);

}

__global__ void Cube (cufftComplex *data, cufftComplex *data3, int n) {

    int i = blockIdx.x * blockDim.x + threadIdx.x;

    if (i<n){
        float temp = data[i].x;
        if (isnan(temp)) {printf("nan1: %d\n", i); my_assert(0);}
        data3[i].x = pow(data[i].x, 3);
        if (isnan(data3[i].x)) {printf("nan2: %d %f\n", i, data[i].x); my_assert(0);}
        data3[i].y = 0;
    }
    __syncthreads();
}

__global__ void Spectral (cufftComplex *data, cufftComplex *data3, float *w, float *v, int n) {

    int i = blockIdx.x * blockDim.x + threadIdx.x;

    if (i<n){
        float temp1 = w[i];
        if (isnan(temp1)) {printf("nan3: %d\n", i); my_assert(0);}
        float temp2 = data[i].x;
        if (isnan(temp2)) {printf("nan4: %d\n", i); my_assert(0);}
        float temp3 = data3[i].x;
        if (isnan(temp3)) {printf("nan5: %d\n", i); my_assert(0);}
        float temp4 = v[i];
        if (isnan(temp4)) {printf("nan6: %d\n", i); my_assert(0);}

        data[i].x = (w[i] * data[i].x + data3[i].x * v[i]) / n;
        if (isnan(data[i].x)) {printf("nan7: %d, %f, %f, %f, %f, %d\n",i, temp1, temp2, temp3, temp4, n); my_assert(0);}
        data[i].y = 0;
    }
    __syncthreads();
}


__global__  void nan_kernel(cufftComplex *d, int len, bool *res){
  int idx=threadIdx.x+blockDim.x*blockIdx.x;
  if (idx < len)
    if (isnan(d[idx].x) || isnan(d[idx].y)) *res = true;
}
bool *d_nan;

bool checknan(cufftComplex *d, int len){
  bool h_nan = false;
  cudaMemcpy(d_nan, &h_nan, sizeof(bool), cudaMemcpyHostToDevice);
  nan_kernel<<<(len/1024)+1, 1024>>>(d, len, d_nan);
  cudaMemcpy(&h_nan, d_nan, sizeof(bool), cudaMemcpyDeviceToHost);
  return h_nan;
}

void dump_data(cufftComplex *d1, cufftComplex *d2, int len)
{
 // add code here to spit out the data however you would like to see it
 // perhaps to a file
 std::cout << "input:         output: " << std::endl;
 for (int i = 0; i < len; i++)
   std::cout << d1[i].x << "," << d1[i].y << "  " << d2[i].x << "," << d2[i].y << std::endl;

};

float ran();

int main (int argc, char **argv) {
    float QQ, C;

    float tmax = 5000;
    int N = 128;
    int n = N*N*N;
    float dn = M_PI/8;
    float dt = .075;
    float psi0 = -0.175;
    float r = -0.1;

    tmax *= dt;

    //setup cuda complex arrays
    int mem_size = sizeof(cufftComplex)*n;
    int float_mem_size = sizeof(float)*n;

    cufftComplex *h_data = (cufftComplex*)malloc(mem_size);
    cufftComplex *d_data;
    cudaMalloc((void**)&d_data, mem_size);

    cufftComplex *h_data3 = (cufftComplex*)malloc(mem_size);
    cufftComplex *d_data3;
    cudaMalloc((void**)&d_data3, mem_size);

    float * h_w = (float*)malloc(float_mem_size);
    float *d_w;
    cudaMalloc(&d_w, float_mem_size);

    float * h_v = (float*)malloc(float_mem_size);
    float *d_v;
    cudaMalloc(&d_v, float_mem_size);

    for (int i=0; i<n; i++){
      h_data[i].x = psi0 + r * ran();
      h_data[i].y = 0;
    }

    int nx, ny, nz;
    float B = -4 * M_PI * M_PI / ( pow((N*dn),2));
    for (int i=0; i<n; i++){
        nx = (i % N);
        ny = (i / N) % N;
        nz = i / (N * N);

        if (nx > (N / 2)) {
            nx = (N - nx);
        }
        if (ny > (N / 2)) {
            ny = (N - ny);
        }
        if (nz > (N / 2)) {
            nz = (N - nz);
        }

        QQ = B * (pow(nx, 2.0) + pow(ny, 2.0) + pow(nz, 2.0));
        C = -r - 2.0 * QQ - pow(QQ, 2.0);

        h_w[i] = exp(QQ * (1.0 - C) * dt);
        h_v[i] = (h_w[i] - 1.0) / (1.0 - C);

    }

    cudaMemcpy(d_w, h_w, float_mem_size, cudaMemcpyHostToDevice);
    cudaMemcpy(d_v, h_v, float_mem_size, cudaMemcpyHostToDevice);
    cudaMemcpy(d_data, h_data, mem_size, cudaMemcpyHostToDevice);

    cufftHandle plan;
    cufftPlan3d(&plan, N, N, N, CUFFT_C2C);

    int maxThreads=(N>1024)?1024:N;
    int threadsPerBlock = maxThreads;
    int numBlocks = n/maxThreads;
    cufftResult res;
    cudaMalloc(&d_nan, sizeof(bool));
    cufftComplex *i3, *o3;
    i3 = (cufftComplex *)malloc(mem_size);
    o3 = (cufftComplex *)malloc(mem_size);
    std::cout << "start loop" << std::endl;
    for (float t = 0; t < tmax; t += dt) {
      std::cout << t/dt << std::endl;
      Cube <<<numBlocks, threadsPerBlock>>> (d_data, d_data3, n);
      cudaDeviceSynchronize();
      cudaMemcpy(i3, d_data3, mem_size, cudaMemcpyDeviceToHost);
      if (checknan(d_data3, n)) {std::cout << "d_data3 input nan check failed" << std::endl; return -1;}
      res = cufftExecC2C(plan, d_data3, d_data3, CUFFT_FORWARD);
      if (res != CUFFT_SUCCESS) {std::cout << "cufft1 error: " << (int)res << " , " << t/dt << std::endl; return 1;}
      cudaDeviceSynchronize();
      if (checknan(d_data3, n)) {std::cout << "d_data3 output nan check failed" << std::endl; cudaMemcpy(o3, d_data3, mem_size, cudaMemcpyDeviceToHost); dump_data(i3, o3, n); return -1;}

      res = cufftExecC2C(plan, d_data, d_data, CUFFT_FORWARD);
      if (res != CUFFT_SUCCESS) {std::cout << "cufft2 error: " << (int)res << " , " << t/dt << std::endl; return 1;}
      cudaDeviceSynchronize();

      Spectral <<<numBlocks, threadsPerBlock>>> (d_data, d_data3, d_w, d_v, n);
      cudaDeviceSynchronize();

      res = cufftExecC2C(plan, d_data, d_data, CUFFT_INVERSE);
      if (res != CUFFT_SUCCESS) {std::cout << "cufft3 error: " << (int)res << " , " << t/dt << std::endl; return 1;}
      cudaDeviceSynchronize();
    }

    //check output (should be a number)
    cudaMemcpy(h_data, d_data, mem_size, cudaMemcpyDeviceToHost);
    cout <<h_data[0].x <<endl;
    cudaError_t cres = cudaGetLastError();
    if (cres != cudaSuccess) std::cout << "cuda error: " << cudaGetErrorString(cres) << std::endl;
    //clean up
    cufftDestroy(plan);
    cudaFree(d_data);
    cudaFree(d_data3);
    cudaFree(d_w);
    cudaFree(d_v);
    free(h_w);
    free(h_v);
    free(h_data);
    free(h_data3);

    return 0;
}

float ran(){    //random in range [-1,1]
    float u= float (rand())/(RAND_MAX);
    //return round(u);
    return 2*u-1;
}

编辑:在 dump_data 中添加一些打印输出代码后(参见上面的修改)我看到了这个:

...
4859.14
4860.14
d_data3 output nan check failed
input:         output:
3.37127e+19,0  nan,nan
3.21072e+19,0  nan,nan
2.76453e+19,0  nan,nan
2.13248e+19,0  nan,nan
1.44669e+19,0  nan,nan
8.37214e+18,0  nan,nan
3.93645e+18,0  nan,nan
1.35501e+18,0  nan,nan
2.55741e+17,0  nan,nan
5.96468e+15,0  nan,nan
-1.36656e+16,0  nan,nan
-2.33688e+17,0  nan,nan
-8.37407e+17,0  nan,nan
-1.79915e+18,0  nan,nan
-2.96302e+18,0  nan,nan
-4.11485e+18,0  nan,nan
-5.03876e+18,0  nan,nan
-5.57617e+18,0  nan,nan
-5.65307e+18,0  nan,nan
-5.28957e+18,0  nan,nan
-4.5872e+18,0  nan,nan
-3.68309e+18,0  nan,nan
...

我不是 FFT 专家，但如果您使用 float 精度对充满大值的大型数组执行 FFT，可能会发生溢出。如果您只需要进行 5000 次迭代，而您在 4860 次时失败了，那么如果您将所有数据类型从 float 更改为 double，您可能会到达那里，但我不确定您在这里所做的事情的数字意义。

最后，请注意 cufft和 fftw执行非标准化变换。这可能在您的数据集中看似数量级的增长中发挥了作用。正如我已经说过的，我不熟悉您要在此处实现的算术或算法。

关于c++ - 经过这么多循环后，cuda 计算给出了 nan，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/42727720/

文章推荐： c++ - 从配置文件 qsetting 中删除键/值对

文章推荐：未收到 Facebook 应用程序的 Facebook 开发者邀请

文章推荐：没有确认就点赞？

文章推荐： Facebook 如何使用 Graph API 获取实际照片 URL？

C++ 双重释放或损坏(出)
我在使用带有 vector STL 的迭代器时遇到了这个错误。代码:- #include #include void print_vec(std::vector vec) { auto
JAVA : regarding System. 出
JAVA:两个引用“p”&&“pp”之间有区别吗？ PrintStream p = new PrintStream(System.out); p.println("lol");
git - 如何使用git从master分支中 pull 出？
我尝试从主分支中拉出，但收到错误消息: $ git --no-optional-locks -c color.branch=false -c color.diff=false -c color.sta
c - 随机双自由或腐败(出)C
我面临着一个让我抓狂的问题! 我有一个函数，这个: void load_weapons3(t_env *e, char *name, int x, t_weapon *w) { char
c++ - 双自由或腐败(出) - C++
我正在尝试使用 CUDA 中的最小值、最大值、总和和平均值实现并行归约。这是我目前的主要代码片段。 int main() { const auto count = 8; const
c++ - 双重自由或腐败(出)C++
我知道 double free 或 corruption 错误通常是对 big 3 的违规，但在这种情况下，我找不到违规发生的地方。我有一个复制构造函数、析构函数和赋值运算符，适用于任何处理指针的东西
c - 焦点和焦点入(出)事件信号之间的区别
GTK+ 中的“focus”和“focus-in(out)-event”信号有什么区别？哪个先发射？它们与键盘(TAB)和鼠标点击有什么关系。他们互相依赖吗？我问这个是因为我想在顶层窗口中跟踪当前聚
c - 双自由或腐败(出)fclose
*** glibc detected *** /home/ghoshs/workspace/Simulator/Debug/Simulator: double free or corruption (
c++ - 我怎么知道双重释放或损坏(出)错误是从哪里来的？
#include #include #include #include using namespace std; #define MAX_WEIGHT 1000000 class Set {
Git 从错误的分支中 pull 出
我在服务器上有两个分支一个叫 R2 的分支和一个叫 DEV 的分支我无意中登录了错误的服务器，进入了存储库并执行了GIT pull 源开发但是存储库在 R2 上。所以我意识到我的错误然后尝试通过做一个
java - Gremlin:从给定顶点查找所有下游(出)路径
我有一个包含循环的大约 1000 个顶点和 3000 个边的有向图。我试图从给定的顶点找到所有下游(出)路径。使用以下 Gremlin 查询时 g.V(45712).repeat(out().si
delphi - 如何使用手势识别缩放方向(进/出)并应用缩放效果？
使用 Delphi XE 2 我试图确定缩放方向以将缩放效果应用于图像(TImage)，但没有找到执行此操作的函数，并且图像的 OnGesture 事件中的 EventInfo 属性没有此信息. 我见
c - 如何克服c中的双重释放或损坏(出)中止(核心转储)
我正在尝试创建一个 Zoom_image 函数，它使用离散傅里叶变换来缩放灰度图像。如果图像大小小于或等于 4*4 但大小增加，我包含的代码可以工作。它给出“双重释放或损坏(出)中止(核心转储)”错误
c - 双重释放或损坏(出)中止(核心转储)
当我执行 popAll 函数时，出现以下错误: 双重释放或腐败(出)中止(核心转储) 我想我已经将错误来源缩小到了这个函数。 IntegerStack 是我制作的一个简单的 ADT，其中包含一个名为
iOS:在滚动进/出 View 时更改图像位置
我有网络开发背景，我正在尝试创建类似于 this technique 的东西适用于 iOS(使用 Cocoa/Obj C)。我在谷歌搜索资源时遇到了很多困难，因为 iOS 中的“视差”往往指的是 iO
php - 使用(出)Solr 进行分面搜索
我想实现一个 faceted search对于我的一个项目。我正在使用 PHP5、Mysql 和 Symfony 1.4。显然社区指向Apache Solr这似乎正是我想要完成的。问题是该网站将在不
Git:强制从特定分支 pull 出(并防止覆盖)
我知道有 questions floating around当您没有提供明确的分支名称时，关于来自特定分支的 git pull，但是我想知道即使用户确实指定了不同的分支，是否也可以强制 pull 分支
Git 推送提示非快进，即使远程已被 pull 出
我正在尝试将我的更改推送到 NAS 上的存储库。它以我无法理解的方式失败。 documentation声明默认情况下 push 仅适用于快进更新。很公平。所以我做了一个 git pull(我的 Rem
java - 一致性缓存 | ConcurrentHashMap 入，HashMap 出
我刚开始使用 Oracle 的 Coherence 缓存，我注意到这一点:如果我在缓存中放入一个 ConcurrentHashMap 对象，当我检索它时，我可以看到它被转换为一个普通的 HashMap
c++ - Sqlite3 和 pthread，双重释放或损坏(出)
我尝试创建一个连接到数据库的线程，从那里获取一些数据并打印到控制台。问题是当该线程完成时抛出异常: 双重免费或腐败(出局)中止(核心转储) 我尝试使用 sqlite3 和 pthread，但这两个并不

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

c++ - 经过这么多循环后，cuda 计算给出了 nan