cuda - Nvidia 的 nvprof 输出为 FLOPS-6ren

cuda - Nvidia 的 nvprof 输出为 FLOPS

转载作者：行者123 更新时间：2023-12-03 02:55:25

27

4

我看到 nvprof 可以分析内核中的 flop 数量(使用如下参数)。另外，当我浏览文档时(此处http://docs.nvidia.com/cuda ...它说 flop_count_sp 是“非谓词线程执行的单精度浮点运算的数量(加法、乘法、乘法累加和特殊)。每个乘法-累加操作为计数贡献 2。”

但是，当我运行时， flop_count_sp 的结果(应该是 flop_count_sp_add + flop_count_sp_mul + flop_count_sp_special + 2 * flop_count_sp_fma) 我发现它在求和中不包括 flop_count_sp_special 的值。

你能建议我应该使用什么吗？我应该将此值添加到 flop_count_sp 的总和中，还是应该考虑该公式不包含 flop_count_sp_special 的值？

您能告诉我这些特殊操作是什么吗？

我正在使用以下命令行:

nvprof --metrics flops_sp --metrics flops_sp_add --metrics flops_sp_mul --metrics flops_sp_fma --metrics flops_sp_special myKernel args

其中myKernel是我的CUDA内核的名称，它有一些由args给出的输入参数。

例如，我的 nvprof 输出的一部分如下所示:

 ==20549== Profiling result:
 ==20549== Metric result:
 Invocations                               Metric Name                        Metric Description         Min         Max         Avg
 Device "Tesla K40c (0)"
    Kernel: mykernel(float*, int, int, float*, int, float*, int*)
           2                             flop_count_sp  Floating Point Operations(Single Precisi       70888       70888       70888
           2                         flop_count_sp_add  Floating Point Operations(Single Precisi       14465       14465       14465
           2                         flop_count_sp_mul  Floating Point Operation(Single Precisio       14465       14465       14465
           2                         flop_count_sp_fma  Floating Point Operations(Single Precisi       20979       20979       20979
           2                     flop_count_sp_special  Floating Point Operations(Single Precisi       87637       87637       87637

最佳答案

“特殊”操作列在 Programming Guide 的算术吞吐量表中。，它们是:倒数、recip sqrt、log、exp、sin、cos。请注意，这些版本不如默认版本精确(但速度更快)，您必须选择使用内部函数或编译器标志 (-use_fast_math)。

尽管文档中有说明，但特殊操作似乎并未包含在 flop_count_sp 总数中。这是当前版本(8.0)中的一个错误，我已经提交了一个错误，因此应该在未来的版本中修复它(因此本段将在某个时候过时)。

关于cuda - Nvidia 的 nvprof 输出为 FLOPS，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44388623/

27

4

0

文章推荐： java - 来自 Java 代码的 Microsoft SSAS OLAP 连接

文章推荐： c# - 使用 EPPlus 和 Linq 从 Excel 获取单元格值

文章推荐： java - 如何删除旧的 JPanel 并添加新的 JPanel？

文章推荐： perl - CPAN Perl 模块安装程序找不到 tar 文件

c - FLOPS 什么是真正的 FLOP
我来自这个线程:FLOPS Intel core and testing it with C (innerproduct) 当我开始编写简单的测试脚本时，我想到了几个问题。为什么是 float ？我
c++ - 如何测量 FLOPS
我如何测量 FLOPS或 IOPS ？如果我测量普通浮点加法/乘法的时间，它是否等同于 FLOPS？最佳答案 FLOPS 是每秒的浮点运算。要测量 FLOPS，您首先需要执行此类操作的代码。如果你有
c++ - 理论和实践矩阵乘法 FLOP
我的系统: 系统规范:Intel core2duo E4500 3700g内存二级缓存2M x64 fedora 17 我如何测量 flops/mflops 好吧，我使用 papi 库(读取硬件性能计
GPU FLOPS 和 FPS
我正在对一个 GPU(无法透露是哪个)进行建模以估计 OpenCL 和 OpenGL 应用程序的性能，该模型可以合理地估计正在执行的应用程序/内核/代码的 FLOPS 有没有办法从FLOPS，还是对帧
python - Tensorflow 卷积层中的 FLOP
我想知道 Tensorflow 卷积层中浮点运算的数量。当我等待这个功能在 TF 2.x 上发布时，我在 TF 1.x 上进行了尝试，结果我不明白它是如何计算的，其中之一非常糟糕令人印象深刻(检查第
c++ - 超过理论峰值 FLOPS 基准
为了测量 CPU 的峰值 FLOPS 性能，我编写了一个小的 C++ 程序。但是测量结果给我的结果比我的 CPU 的理论峰值 FLOPS 大。怎么了？这是我写的代码: #include #incl
algorithm - FFT 有多少 FLOPS？
我想知道快速傅里叶变换 (FFT) 执行了多少 FLOPS。所以，如果我有一个 1 维数组，包含 N 个 float ，我想计算这组数字的 FFT，有多少 FLOPS 需要执行吗？我知道这取决于所
c++ - 为什么经常用 FLOPS 来比较数学库？
数学库经常根据 FLOPS 进行比较。当我看到 FLOPS 与大小的关系图以及几个不同数学库的点集时，向我传达了什么信息？如果比较相同算法的两个实现或两个不同硬件上的相同软件，FLOPS 作为性能衡
c++ - 计算 FLOPS(每秒浮点运算)
如何计算应用程序的 FLOPS？如果我有执行指令的总数，我可以将它除以执行时间。但是，如何统计执行的指令数呢？我的问题很笼统，非常感谢任何语言的回答。但我希望为我的应用程序找到一个由 C/C++ 和
python - tanh 需要多少个 FLOP？
我想计算 LeNet-5 ( paper) 的每一层需要多少触发器。一些论文总共给出了其他架构的 FLOPs(1，2，3)但是，这些论文没有详细说明如何计算 FLOPs 的数量，我不知道有多少 FLO
python - TensorFlow:有没有办法测量模型的 FLOPS？
我能得到的最接近的例子是在这个问题中找到的:https://github.com/tensorflow/tensorflow/issues/899 使用这个最小的可重现代码: import tenso
opencl - 如何计算 GPGPU 硬件中的峰值 FLOPS？
我想计算图形硬件的理论峰值性能。嗯，其实我想了解一下计算。以 AMD Radeon HD 6670 为例:AMD Accelerated Parallel Processing Programmin
performance - 什么是 FLOP/s？它是衡量性能的一个很好的指标吗？
我被要求测量一个在多 CPU 系统上求解微分方程的 Fortran 程序的性能。我的雇主坚持要求我测量 FLOP/s(每秒 float 操作)并将结果与基准进行比较( LINPACK )，但我不相
c# - 如何测量我的 C# 应用程序使用的 FLOPS？
Microsoft's Parallel Programming whitepaper描述了在各种 FLOPS 阈值下最优的情况，并且 FLOPS 率是关于何时应使用特定实现的决策点。如何测量应用程
performance - 什么是 FLOP/s？它是衡量性能的一个很好的指标吗？
我被要求测量一个在多 CPU 系统上求解微分方程的 Fortran 程序的性能。我的雇主坚持要求我测量 FLOP/s(每秒 float 操作)并将结果与基准进行比较( LINPACK )，但我不相
c++ - FLOPS/IOPS 是如何计算的，它的用途是什么？
我一直在关注 OpenCL 的一些教程，很多时候人们用 FLOPS 来说话.维基百科确实解释了公式，但没有说明它的实际含义？例如，1光年= 9.4605284 × 10^15米，其实就是光在一年中行进
algorithm - 可以给我们最大 'flip-flop' 总和的子列表数组是什么？
我的问题是我得到了一个长度为 l 的数组。假设这是我的数组:[1,5,4,2,9,3,6] 我们称它为 A。这个数组可以有多个子数组，子数组的节点彼此相邻。所以我们可以有 [1,5,4] 或 [2
c - 确定我们的 ASM 程序的 FLOPS
我们必须实现一个 ASM 程序来乘以坐标方案格式 (COOS) 以及压缩行格式 (CSR) 的稀疏矩阵。现在我们已经实现了所有这些算法，我们想知道与通常的矩阵乘法相比，它们的性能要高多少。我们已经实现
go - 在 Go 中测量 FLOPS
我想编写一个 go 程序来对我的 CPU 进行基准测试并计算出我的笔记本电脑的 GFLOPS。 func benchmarkFlopTime(){ num_operations := int(
c++ - 如何达到每个周期 4 FLOP 的理论最大值？
如何在现代 x86-64 Intel CPU 上实现每周期 4 次浮点运算( double )的理论峰值性能？据我了解，SSE 需要三个周期add mul 的五个周期在大多数现代 Intel CPU

首页

博学

6Ren·AI

商城

cuda - Nvidia 的 nvprof 输出为 FLOPS