cuda - CUDA 内核中主机浮点常量的使用-6ren

cuda - CUDA 内核中主机浮点常量的使用

转载作者：行者123 更新时间：2023-12-05 07:57:37

26

4

我正在使用 CUDA 5.0。我注意到编译器将允许我在内核中使用主机声明的 int 常量。但是，它拒绝编译任何使用主机声明的 float 常量的内核。有谁知道这种看似差异的原因？

例如，下面的代码可以正常运行，但如果内核中的最后一行未被注释，它将无法编译。

#include <cstdio>
#include <cuda_runtime.h>

static int   __constant__ DEV_INT_CONSTANT   = 1;
static float __constant__ DEV_FLOAT_CONSTANT = 2.0f;

static int   const        HST_INT_CONSTANT   = 3;
static float const        HST_FLOAT_CONSTANT = 4.0f;

__global__ void uselessKernel(float * val)
{
    *val = 0.0f;

    // Use device int and float constants
    *val += DEV_INT_CONSTANT;
    *val += DEV_FLOAT_CONSTANT;

    // Use host int and float constants
    *val += HST_INT_CONSTANT;
    //*val += HST_FLOAT_CONSTANT; // won't compile if uncommented
}

int main(void)
{
    float * d_val;
    cudaMalloc((void **)&d_val, sizeof(float));

    uselessKernel<<<1, 1>>>(d_val);

    cudaFree(d_val);
}

最佳答案

在设备代码中添加一个常量数字是可以的，但在设备代码中添加一个存储在主机内存中的数字是不行的。

当从未引用该变量的地址时，编译器/优化器可以将代码中对 static const int 的每个引用替换为值 3。在这种情况下，它类似于 #define HST_INT_CONSTANT 3，并且没有为该变量分配主机内存。

但是对于float var，即使是static const float，主机内存总是被分配的。由于内核无法直接访问主机内存，因此不会编译带有 static const float 的代码。

对于 C/C++，int 可以比 float 更积极地优化。

你的代码在注释打开时运行，我认为这可以看作是 CUDA C 的一个错误。 static const int 是主机端的东西，设备不应该直接访问它。

关于cuda - CUDA 内核中主机浮点常量的使用，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/26443857/

26

4

0

文章推荐： c# - 将 DataTableReader 转换为 SqlDataReader

文章推荐：正则表达式条件替换

文章推荐： ruby-on-rails - AWS/S3 存储和带宽的详细账单信息

c - 错误 "invalid types ' 浮点 [100][浮点 ]' for array subscript"
这个问题已经有答案了: Invalid types 'double [100][double]' for array subscript (3 个回答) 已关闭 6 年前。我已复制下面的整个代码并在
math - 浮点;除法与乘法
您有 2 个功能； f(x)= x(((x+1)^(1/2))-(x^(1/2))) g(x)= x/(((x+1)^(1/2))+(x^(1/2))) 哪个更准确？旁注:如果你能解释为什么，
java - 浮点 - NaN
我正在从事一个关于java的研究项目，其中必须完成一些艰难的计算。然而，我已经完成了大部分工作，但停留在某个点上。我必须计算以下内容: (2.1-2.3) raised to power 0.3. 但
c - 浮点 while 循环
int main() { float x = 50; float y = 1/x; float result = y * x; float test = 41;
c++ - 浮点/整数类型转换的可靠溢出检测
有没有安全的方法来可靠地确定整数类型 T可以存储浮点整数值 f (所以 f == floor(f) )没有任何溢出？请记住，不能保证浮点类型 F与 IEC 559 (IEEE 754) 兼容，并且有
c++ - 浮点，相等比较是否足以防止被零除？
// value will always be in the range of [0.0 - maximum] float obtainRatio(float value, float maximum
c++ - 浮点 == 可以吗？
就在今天，我遇到了我们正在使用的第三方软件，在他们的示例代码中，有以下内容: // Defined in somewhere.h static const double BAR = 3.14; //
jQuery 浮点 : clear graph
是否有推荐的方法来清除 jQuery Flot 图表？我在 API 引用中找不到任何内容。最佳答案 “清除”是指“破坏整个图表”还是只是清除数据？要核对整个图表:$('#canvas_id').e
c - 对单精度(浮点)值求和时的错误传播
我正在学习单精度并想了解错误传播。根据this nice website ，加法是一个危险的操作。所以我编写了一个小的 C 程序来测试错误累积的速度。我不完全确定这是否是一种有效的测试方法。如果是，
WHERE 子句中的 SQL Server 浮点
我正在尝试查询数据库，我需要获取权重等于 60.5 的客户列表。问题是 60.5 是一个实数，我以前从未在 where 子句中使用实数查询过数据库。我已经尝试过这个: SELECT Name FRO
java - 浮点 setter 设置任意分数
这是我的“ProjectEntity”类中的代码部分(我在其中使用 hibernate 进行 SQL 调用) @Column(name = "BUDGET") private float budget
haskell - 浮点 SMT 逻辑比实际逻辑慢吗？
我用 Haskell 编写了一个应用程序，它调用 Z3 求解器来解决一些复杂公式的约束。感谢 Haskell，我可以快速切换正在使用的数据类型。当使用 SBV 的 AlgReal 类型进行计算时，我
c - C中大写和小写双(浮点)类型说明符的区别
在 C 中 double/float 有一个集合类型说明符:%f %F %g %G %e %E .有什么区别吗 %f和 %F , %g和 %G , %e和 %E ? 根据 printf和 scanf输
java - 大量(浮点)值的最佳数据结构
我正在开发一个适用于 Android 的可视化应用程序(包括运行 Android 2.2 的旧设备)。我的应用程序的输入模型包含一个区域，该区域通常由数万个顶点组成。典型模型有 50000-1000
java - (浮点)NAN 是否有一个普遍接受的值
关闭。这个问题需要多问focused 。目前不接受答案。想要改进此问题吗？更新问题，使其仅关注一个问题 editing this post . 已关闭 6 年前。 Improve this ques
c - 如何检查输入是数字(浮点)还是某个字符？
我被要求编写一个程序来查找我大学中两个输入的总和，因此我应该首先检查输入是否有效。例如，如果我输入 2534.11s35，程序应该检测到它不是该程序的有效输入，因为输入中存在 s。最佳答案 to
c - 浮点 Fastpow OpenCL
我正在尝试降低 FPGA 的逻辑利用率，但在网上找不到任何好的 float fastpow。我所说的“好”是指充分减少所使用的逻辑。如果我使用双版本我几乎没有什么改进。如果我使用其他依赖日志的 flo
c++ - 浮点/ double 的字符数据
我有一个 128 字节的内存位置。我尝试用从 1...127 开始的数据填充内存。我需要编写一个代码来获取两个参数，如偏移量、数据类型。根据参数，我需要将内存中的数据转换为提到的特定数据类型。举个
c++ - 可测试的无效浮点值。 (浮点 NULL)
我希望能够做到以下几点: float func() { if( error ) return InvalidFloatingPointValue; else return 0.0f;
c++ - 浮点，我可以信任多少小于/大于比较？
假设我有两个 float ，我想比较它们。如果一个大于另一个，程序应该采用一个 fork。如果情况正好相反，它应该走另一条路。并且它应该做同样的事情，如果被比较的值在一个仍然应该使它比较真实的方向上被

首页

博学

6Ren·AI

商城

cuda - CUDA 内核中主机浮点常量的使用