windows - 为什么 OpenGL 和 CUDA 上下文内存贪婪？-6ren

windows - 为什么 OpenGL 和 CUDA 上下文内存贪婪？

转载作者：行者123 更新时间：2023-12-03 11:05:25

25

4

我开发的软件通常包括 OpenGL 和 Nvidia CUDA SDK。最近，我也开始寻找优化运行时内存占用的方法。我注意到以下内容(调试和发布版本仅相差 4-7 Mb):
应用程序启动 - 小于 1 MB 全部的
OpenGL 4.5 上下文创建(+ GLEW 加载程序初始化)- 45 MB 全部的
CUDA 8.0 上下文(驱动 API)创建 114 MB 全部的。
如果我在“ headless ”模式下创建 OpenGL 上下文，则 GL 上下文会少用 3 Mb，这可能会用于默认帧缓冲区分配。这是有道理的，因为窗口大小是 640x360。
所以在 OpenGL 和 CUDA 上下文启动后，进程已经消耗了 114 MB .
现在，我对在 GL 和 CUDA 上下文创建期间发生在幕后的操作系统特定的东西没有深入的了解，但是 GL 的 45 Mb 和 CUDA 的 68 对我来说似乎很多。我知道通常有几兆字节用于系统帧缓冲区、函数指针(可能大部分分配发生在驱动程序端)。但是仅使用“空”上下文达到 100 Mb 以上看起来太多了。
我想知道:

为什么 GL/CUDA 上下文创建会消耗如此大量的内存？

有没有办法优化它？

被测系统设置:
Windows 10 64 位。 NVIDIA GTX 960 GPU(驱动程序版本:388.31)。 8 Gb 内存。 Visual Studio 2015，64 位 C++ 控制台项目。
我使用 Visual Studio 内置的诊断工具 -> 进程内存部分测量内存消耗。
更新
按照 datenwolf 的建议，我尝试了 Process Explorer。这是我得到的屏幕截图(底部标记为黄色的我的过程):

我将不胜感激有关该信息的一些解释。我总是在“VS 诊断工具”窗口中查看“私有(private)字节”。但在这里我还看到“工作集”、“WS Private”等。哪一个正确显示了我的进程当前使用了多少内存？ 281,320K 看起来太多了，因为正如我上面所说，启动时的进程什么都不做，而是创建 CUDA 和 OpenGL 上下文。

最佳答案

部分答案:这是一个特定于操作系统的问题；在 Linux 上，CUDA 占用 9.3 MB。

我在 GNU/Linux 上使用 CUDA(不是 OpenGL):

CUDA 版本:10.2.89

操作系统发行版:Devuan GNU/Linux Beowulf (~= Debian Buster without systemd)

内核:Linux 5.2.0

处理器:英特尔 x86_64

为了检查 CUDA 在创建上下文时使用了多少内存，我运行了以下 C 程序(它还检查了上下文销毁后会发生什么):

#include <stdio.h>
#include <cuda.h>
#include <malloc.h>
#include <stdlib.h>

static void print_allocation_stats(const char* s)
{
    printf("%s:\n", s);
    printf("--------------------------------------------------\n");
    malloc_stats();
    printf("--------------------------------------------------\n\n");
}

int main()
{
    display_mallinfo("Initially");

    int status = cuInit(0);
    if (status != 0 ) { return EXIT_FAILURE; }
    print_allocation_stats("After CUDA driver initialization");

    int device_id = 0;
    unsigned flags = 0;
    CUcontext context_id;
    status = cuCtxCreate(&context_id, flags, device_id);
    if (status != CUDA_SUCCESS ) { return EXIT_FAILURE; }
    print_allocation_stats("After context creation");

    status = cuCtxDestroy(context_id);
    if (status != CUDA_SUCCESS ) { return EXIT_FAILURE; }
    print_allocation_stats("After context destruction");
    return EXIT_SUCCESS;
}

(请注意，这使用了一个 glibc 特定的函数，而不是在标准库中。)
总结结果并剪掉不相关的部分:

程序中的点
总字节数
正在使用
最大 MMAP 区域
最大 MMAP 字节

最初
135168
1632
0
0

CUDA驱动初始化后
552960
439120
2
307200

上下文创建后
9314304
6858208
8
6643712

上下文破坏后
7016448
580688
8
6643712

所以 CUDA 以 开头0.5 MB 并在分配上下文后占用 9.3 MB (在销毁上下文时返回到 7.0 MB)。 9 MB 仍然是很多内存，因为没有做任何事情；但是 - 也许其中一些是全零，或未初始化，或写时复制，在这种情况下它并没有真正占用那么多内存。
在 CUDA 8 和 CUDA 10 驱动程序发布之间的两年内，内存使用可能会显着提高，但我对此表示怀疑。所以 - 看起来你的问题是 Windows 特定的。
另外，我应该提到我没有创建 OpenGL 上下文 - 这是 OP 问题的另一部分；所以我还没有估计需要多少内存。 OP 提出了总和是否大于其部分的问题，即如果还存在 OpenGL 上下文，CUDA 上下文是否会占用更多内存；相信不应该是这样，但欢迎读者尝试举报……

关于windows - 为什么 OpenGL 和 CUDA 上下文内存贪婪？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/47462886/

25

4

0

文章推荐： windows - 在 Windows 中将 sonatype nexus 作为服务安装

opengl - OpenGL/OpenGLES 中的帧缓冲区纹理行为
在 OpenGL/ES 中，在实现渲染到纹理功能时，您必须小心，不要引起反馈循环(从正在写入的同一纹理中读取像素)。由于显而易见的原因，当您读取和写入纹理的相同像素时，行为是未定义的。但是，如果您正在
opengl - OpenGL 3、OpenGL 4 实现中的已知错误
正如我们最终都知道的那样，规范是一回事，实现是另一回事。大多数错误是我们自己造成的，但有时情况并非如此。我相信列出以下内容会很有用: GPU 驱动程序中当前已知的与最新版本的 OpenGL 和 GL
opengl - 如何在 OpenGL ES/OpenGL 中创建透明玻璃杯？
很难说出这里问的是什么。这个问题是模棱两可的、模糊的、不完整的、过于宽泛的或修辞的，无法以目前的形式得到合理的回答。为了帮助澄清这个问题以便可以重新打开它，visit the help center
opengl - 我想知道如何实现 OpenGL 驱动程序来学习 opengl 内部结构？
我正在学习 OpenGL，非常想知道与显卡的交互如何。我觉得了解它是如何在图形驱动程序中实现的，会让我了解 opengl 的完整内部结构(通过这个我可以知道哪些阶段/因素影响我对 opengl 性能
opengl - 大于窗口大小的渲染缓冲区 - OpenGL
我正在尝试绘制到大于屏幕尺寸(即 320x480)的渲染缓冲区 (512x512)。执行 glReadPixels 后，图像看起来是正确的，除非图像的尺寸超过屏幕尺寸——在本例中，超过 320 水平
opengl - OpenGL 中的背景图像
我正在 Windows 中制作一个 3D 小行星游戏(使用 OpenGL 和 GLUT)，您可以在其中穿过一堆障碍物在太空中移动并生存下来。我正在寻找一种方法来针对无聊的 bg 颜色选项设置图像背景。
opengl - OpenGL 纹理的纵横比会影响性能吗？
如果我想要一个包含 100 个 10*10 像素 Sprite 的 Sprite 表，是否可以将它们全部排成一排来制作 1,000*10 像素纹理？还是 GPU 对不那么窄的纹理表现更好？这对性能有什
opengl - OpenGL 中的广告牌效果
这个问题在这里已经有了答案: Rendering 2D sprites in a 3D world? (7 个答案) 关闭 6 年前。我如何概念化让图像始终面对相机。我尝试将三角函数与 arcta
opengl - 我如何增加缓冲区 OpenGL？
是否可以在 OpenGL 中增加缓冲区？假设我想使用实例化渲染。每次在世界上生成一个新对象时，我都必须用实例化数据更新缓冲区。在这种情况下，我有一个 3 个 float 的缓冲区 std::v
opengl - OpenGL 中的多边形
有人可以向我解释为什么下面的代码没有绘制任何东西，但如果我使用 GL_LINE_LOOP 它确实形成了一个闭环吗？ glBegin(GL_POLYGON); for(int i = 0; i <= N
opengl - opengl 中的渲染目标是什么？
正如标题所说，OpenGL 中的渲染目标是什么？我对 OpenGL 很陌生，我看到的所有网站都让我很困惑。它只是一个缓冲区，我在其中放置稍后将用于渲染的东西吗？如果您能提供一个很好的引用来阅读它，
opengl - OpenGL 是否钳制每个纹理阶段的输出？
当使用 OpenGL 1.4 固定功能多纹理时，每个纹理阶段的输出在传递到下一个阶段之前是否都固定在 [0, 1]？ spec说(第 153 页): If the value of TEXTURE_E
opengl - openGL ES和OpenGL函数的区别
我比较了 2 个函数 openGL ES 和 openGL gvec4 texelFetchOffset(gsampler2DArray sampler, ivec3 P, int lod, ivec
opengl - OpenGL 中的门户效果
关闭。这个问题是off-topic .它目前不接受答案。想改进这个问题吗？ Update the question所以它是on-topic用于堆栈溢出。关闭 10 年前。 Improve thi
opengl - OpenGL 绘图库
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。想改进这个问题？将问题更新为 on-topic对于堆栈溢出。 6年前关闭。 Improve this qu
opengl - opengl 函数会导致主线程卡住吗？
那么当你调用opengl函数时，比如glDraw或者gLBufferData，是否会导致程序线程停止等待GL完成调用呢？如果不是，那么 GL 如何处理调用像 glDraw 这样的重要函数，然后立即更
opengl - OpenGL 上的级联阴影贴图纹理访问错误
我正在尝试实现级联阴影贴图，当我想访问我的视锥体的每个分区的相应深度纹理时，我遇到了一个错误。更具体地说，当我想选择正确的阴影纹理时会出现我的问题，如果我尝试下面的代码，我会得到一个像 this 中
opengl - OpenGL ES和OpenGL兼容的着色器
我想为OpenGL ES和OpenGL(Windows)使用相同的着色器源。为此，我想定义自定义数据类型并仅使用OpenGL ES函数。一种方法是定义: #define highp #define
opengl - OpenGL 中的立方体映射
我尝试用 6 个位图映射立方体以实现天空盒效果。我的问题是一个纹理映射到立方体的每个面。我已经检查了 gDEBugger，在立方体纹理内存中我只有一个图像(因为我尝试加载六个图像)。代码准备纹理:
opengl - OpenGL 中的深度偏移
在 OpenGL 中偏移深度的最佳方法是什么？我目前每个多边形都有索引顶点属性，我将其传递给 OpenGL 中的顶点着色器。我的目标是在深度上偏移多边形，其中最高索引始终位于较低索引的前面。我目前有这

首页

博学

6Ren·AI

商城

windows - 为什么 OpenGL 和 CUDA 上下文内存贪婪？