cuda - 了解 CUDA 分析器输出 (nvprof)-6ren

cuda - 了解 CUDA 分析器输出 (nvprof)

转载作者：行者123 更新时间：2023-12-04 19:58:55

25

4

我只是在查看以下输出并试图将我的思想围绕在数字上:

==2906== Profiling result:
Time(%)      Time     Calls       Avg       Min       Max  Name
 23.04%  10.9573s     16436  666.67us  64.996us  1.5927ms  sgemm_sm35_ldg_tn_32x16x64x8x16
 22.28%  10.5968s     14088  752.18us  612.13us  1.6235ms  sgemm_sm_heavy_nt_ldg
 18.09%  8.60573s     14088  610.86us  513.05us  1.2504ms  sgemm_sm35_ldg_nn_128x8x128x16x16
 16.48%  7.84050s     68092  115.15us  1.8240us  503.00us  void axpy_kernel_val<float, int=0>(cublasAxpyParamsVal<float>)
...
  0.25%  117.53ms      4744  24.773us     896ns  11.803ms  [CUDA memcpy HtoD]
  0.23%  107.32ms     37582  2.8550us  1.8880us  8.9556ms  [CUDA memcpy DtoH]

...

==2906== API calls:
Time(%)      Time     Calls       Avg       Min       Max  Name
 83.47%  41.8256s     42326  988.18us  16.923us  13.332ms  cudaMemcpy
  9.27%  4.64747s    326372  14.239us  10.846us  11.601ms  cudaLaunch
  1.49%  745.12ms   1502720     495ns     379ns  1.7092ms  cudaSetupArgument
  1.37%  688.09ms      4702  146.34us     879ns  615.09ms  cudaFree
...

在优化内存访问时，在比较不同的实现时，我真正需要查看哪些数字？它首先看起来像 memcpy只需要 117.53+107.32ms (双向)，但是有这个 API 调用 cudaMemcpy : 41.8256s ，这是更多。此外，min/avg/max 列不会在上输出块和下输出块之间相加。

为什么会有差异，对我优化内存传输很重要的“真实”数字是多少？

编辑 :第二个问题是:有没有办法找出谁在打电话，例如 axpy_kernel_val (以及多少次)？

最佳答案

的区别总时间是因为工作是异步启动到 GPU 的。如果您有一个长时间运行的内核或一组内核没有与主机显式同步，请通过调用 cudaMemcpy 跟踪它们。 , cudaMemcpy调用将在内核完成执行之前启动。 API 调用的总时间是从启动到完成的那一刻，因此会与执行内核重叠。如果您通过 NVIDIA Visual Profiler 运行输出(nvprof -o xxx ./myApp，然后将 xxx 导入 nvvp)，您可以非常清楚地看到这一点。

区别是分钟时间 是由于启动开销。虽然 API 分析考虑了所有的启动开销，但内核时序只包含其中的一小部分。正如您在此处看到的那样，启动开销可能约为 10-20us。

一般来说，API 调用部分让你知道 CPU 在做什么，而分析结果告诉你 GPU 在做什么。在这种情况下，我认为您没有充分利用 CPU，可以说是 cudaMemcpy过早启动，浪费了 CPU 周期。然而，在实践中，通常很难或不可能从这些备用周期中获得任何有用的东西。

关于cuda - 了解 CUDA 分析器输出 (nvprof)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/30371030/

25

4

0

文章推荐： spring-security - 元数据刷新死锁(spring-security-saml)

文章推荐： scalaz.Equal 用于路径依赖类型

文章推荐： email - pear 邮件， "unable to set sender"

Scala 分析器？
我最近开始使用 Scala 编程。我正在寻找免费的 Scala 分析器。从该语言的官方网站阅读后，我找到了 YourKit ，但该程序不是免费的。谷歌搜索“scala profiler”没有给我任何
JavaScript 分析器
是否有一个程序可以让我获得有关脚本的详细信息:具体来说，我希望能够跟踪其内存占用情况并查看内存中有多少对象。 Firebug 有一个分析器，似乎可以提供计时信息，但我对内存管理更感兴趣。最佳答案 G
erlang - Erlang的探查器/分析器？
Erlang 有没有好的代码分析器/分析器？我需要一些可以为我的代码构建调用图的东西。最佳答案对于静态代码分析，您有 Xref和 Dialyzer ，对于分析，您可以使用 cprof、fprof
用于解决性能问题的 Java 分析器
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的，因为
javascript - webkit 分析器
什么是“self”和“total”列？ “总计”列加起来不等于 100%(高得多)，看起来像 self 一样。我怀疑 self 是非累积的，而 total 是。因此，如果 methodA 调用 met
具有火焰图输出的 java 分析器
在 Perl 中，有一个非常好的分析器，称为 NYTProf。在其报告中包含 flame graph ，这样就很容易找到程序的瓶颈是否有一个等效的 java profiler 可以生成相同的报告？
显示程序特定部分的调用路径的 C++ 分析器
我想知道是否有办法在c++程序中查看特定部分的调用路径。我在开源代码中工作，其中包含许多库。我尝试按照最终在模板中的路径中的代码进行操作。那么，是否有这样的库或分析器来显示代码特定部分的调用路径？谢
显示每个请求统计信息和程序流的 Java 分析器
我正在寻找支持每个请求分析统计的分析器，最好是沿着程序流(而不是通常的线程调用堆栈)。所以基本上是每个请求的探查器调用堆栈 + 顺序调用 View ，如下所示: doGet
PhpStorm Symfony 分析器
如何让 symfony profiler 在 phpstorm 中工作？它应该在状态栏中，但是当我打开那个窗口时，它总是说:“这里什么都没有”。缓存目录在配置中正确定义，symfony 插件本身工作正
unix - Unix 中的日志解析器/分析器
人们在 Unix 中用来解析/分析日志文件的流行工具是什么？进行计数，查找唯一性，选择/复制具有特定模式的特定行。请提供一些工具或一些关键字。因为我相信以前肯定有类似的问题，但我对关键字一无所知。谢谢
php - 如何在生产环境中访问 Doctrine 分析器？
我设置了一个过滤器来计算执行的查询数量，并在超过某个限制时将一些内容写入我的数据库。它在我的开发环境中运行良好，但是当我在生产环境中测试它时，我的数据库不再返回分析器。我认为这是一个为开发环境启用数
Flash/Actionscript CPU 分析器
你找到这样的工具并成功使用了吗？最佳答案我也在寻找 AS 的分析器，但我想要一个与 FlashDevelop 和 Flex SDK 配合使用的免费软件/开源解决方案。我没有找到。所以我写了一个简单
sonarqube - 扩展 Sonarqube 分析器
我需要扩展 SonarQube，以便我可以向其中添加新的分析器。我尝试使用 xpath 为 java 文件添加新规则。我想知道如何在 SonarQube 中添加新语言的代码分析器，例如对于 .meta
elasticsearch - Elasticsearch.net索引设置+分析器
我可以在C#(嵌套)中使用elasticsearch 2.3.0版本我想将分析与索引一起使用，但是索引设置不会改变，我也不知道为什么。这是我的代码: private void b
wireshark - 如何向wireshark添加自定义协议(protocol)分析器？
我有一个正在wireshark中查看的自定义协议(protocol)。我认为如果wireshark可以帮我剖析它，这样我就不必解码十六进制了，这会很有用。尽管我在程序日志中执行此操作，但wiresha
ElasticSearch 和 Porterstem 分析器
我正在考虑使用 Elasticsearch 来提供我们网站的搜索功能。我一直在试验它，但无法启用 Porterstem 分析器(以便搜索战斗匹配战斗和战斗)。这是我输入的摘要。 curl
java - 运行 java 分析器
我正在尝试运行一个基于java的java分析器来找出我的专用机器上的java应用程序的资源消耗情况。我尝试使用的分析器称为 Warmroast。运行时出现以下错误。 java -jar warmro
java - 如何测试 Lucene 分析器？
我没有从我的分析器获得预期结果，并且想测试标记化过程。此问题的答案:How to use a Lucene Analyzer to tokenize a String? List result =
java - 扩展 Lucene 分析器
我在 Lucene 中有特殊的分析需求，但我想继续使用 StandardAnalyzer 机制的部分内容。特别是，我想要字符串 “-苹果--胡萝卜-番茄？” 被标记为: “-苹果-”2.“-胡萝卜-
java - 推荐一个好的 JSF 分析器
有什么好的 JSF 分析器推荐吗？我正在使用 Tomcat 6 JSF2、 hibernate 和 Spring 最佳答案如果您使用的是 Eclipse 或 Netbeans 之类的 IDE，那么

首页

博学

6Ren·AI

商城

cuda - 了解 CUDA 分析器输出 (nvprof)