c# - 使用 64 位进程读取文本文件非常慢-6ren

c# - 使用 64 位进程读取文本文件非常慢

转载作者：太空狗更新时间：2023-10-30 00:50:15

25

4

我正在将文本文件 (.itf) 与文件夹中的一些逻辑合并。当我将它编译为 32 位(控制台应用程序，.Net 4.6)时，一切正常，除了如果文件夹中有大量数据，我会得到 outofmemory 异常。将其编译为 64 位可以解决该问题，但与 32 位进程相比，它的运行速度非常慢(慢 15 倍以上)。

我用 BufferedStream 和 ReadAllLines 试过了，但两者的表现都很差。探查器告诉我这些方法使用了 99% 的时间。我不知道问题是...

代码如下:

private static void readData(Dictionary<string, Topic> topics)
{
    foreach (string file in Directory.EnumerateFiles(Path, "*.itf"))
    {
        Topic currentTopic = null;
        Table currentTable = null;
        Object currentObject = null;
        using (var fs = File.Open(file, FileMode.Open))
        {
            using (var bs = new BufferedStream(fs))
            {
                using (var sr = new StreamReader(bs, Encoding.Default))
                {
                    string line;
                    while ((line = sr.ReadLine()) != null)
                    {
                        if (line.IndexOf("ETOP") > -1)
                        {
                            currentTopic = null;
                        }
                        else if (line.IndexOf("ETAB") > -1)
                        {
                            currentTable = null;
                        }
                        else if (line.IndexOf("ELIN") > -1)
                        {
                            currentObject = null;
                        }
                        else if (line.IndexOf("MTID") > -1)
                        {
                            MTID = line.Replace("MTID ", "");
                        }
                        else if (line.IndexOf("MODL") > -1)
                        {
                            MODL = line.Replace("MODL ", "");
                        }
                        else if (line.IndexOf("TOPI") > -1)
                        {
                            var name = line.Replace("TOPI ", "");
                            if (topics.ContainsKey(name))
                            {
                                currentTopic = topics[name];
                            }
                            else
                            {
                                var topic = new Topic(name);
                                currentTopic = topic;
                                topics.Add(name, topic);
                            }
                        }
                        else if (line.IndexOf("TABL") > -1)
                        {
                            var name = line.Replace("TABL ", "");
                            if (currentTopic.Tables.ContainsKey(name))
                            {
                                currentTable = currentTopic.Tables[name];
                            }
                            else
                            {
                                var table = new Table(name);
                                currentTable = table;
                                currentTopic.Tables.Add(name, table);
                            }
                        }
                        else if (line.IndexOf("OBJE") > -1)
                        {
                            if (currentTable.Name != "Metadata" || currentTable.Objects.Count == 0)
                            {
                                var shortLine = line.Replace("OBJE ", "");
                                var obje = new Object(shortLine.Substring(shortLine.IndexOf(" ")));
                                currentObject = obje;
                                currentTable.Objects.Add(obje);
                            }
                        }
                        else if (currentTopic != null && currentTable != null && currentObject != null)
                        {
                            currentObject.Data.Add(line);
                        }
                    }
                }
            }
        }
    }
}

最佳答案

你的程序最大的问题是，当你让它在 64 位模式下运行时，它可以读取更多的文件。这很好，64 位进程的地址空间是 32 位进程的一千倍，用完它的可能性极小。

但您不会获得多一千倍的 RAM。

工作中“天下没有免费的午餐”的普遍原则。在这样的程序中，拥有足够的 RAM 非常重要。首先，它由文件系统缓存使用。使它看起来就像从磁盘读取文件的神奇操作系统功能非常便宜。它根本不是您在程序中可以做的最慢的事情之一，但它非常善于隐藏它。当您多次运行您的程序时，您将调用它。第二次和随后的时间，您根本不会从磁盘读取数据。这是一个非常危险的特性，当您测试您的程序时很难避免，您会得到非常关于它的效率的不切实际的假设。

64 位进程的问题在于它很容易使文件系统缓存失效。由于您可以读取更多文件，从而使缓存不堪重负。并删除旧文件数据。现在你第二次运行你的程序时，它不会再快了。您读取的文件将不再在缓存中，但必须从磁盘中读取。您现在将看到程序的真实性能，它在生产中的表现方式。这是一件好事，即使你不太喜欢它:)

RAM 的次要问题是较小的一个，如果您分配大量内存来存储文件数据，那么您将迫使操作系统寻找 RAM 来存储它。这可能会导致大量硬页面错误，当它必须取消映射另一个进程或您的进程使用的内存以释放您需要的 RAM 时，就会发生这种情况。一个称为“抖动”的通用问题。您可以在任务管理器中看到页面错误，使用“查看”>“选择列”来添加它。

鉴于文件系统缓存最有可能是速度下降的原因，您可以做的一个简单测试是重启您的机器，以确保缓存不会有任何文件数据，然后运行 32 位版本。预测它也会很慢并且 BufferedStream 和 ReadAllLines 是瓶颈。就像他们应该的那样。

最后一点，即使您的程序与模式不匹配，您也不能对 .NET 4.6 性能问题做出强有力的假设。直到 this very nasty bug得到修复。

关于c# - 使用 64 位进程读取文本文件非常慢，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/32861459/

25

4

0

文章推荐： c# - System.Progress 错误的调用顺序

文章推荐： Python svgwrite 模块背景色

文章推荐： python - PyQt:如何自定义 QComboBox 项目外观

文章推荐： c# - 从立即窗口执行方法

linux - 如何通过 STIME 终止 linux 进程(悬空 svnserve 进程)
我是 Linux 的新手，并且继承了保持我们的单一 Linux 服务器运行的职责。这是我们的SVN服务器，所以比较重要。原来在我之前维护它的人有一个 cron 任务，当有太多 svnserve 进程
Nodejs极简入门教程（三）：进程
Node 虽然自身存在多个线程，但是运行在 v8 上的 JavaScript 是单线程的。Node 的 child_process 模块用于创建子进程，我们可以通过子进程充分利用 CPU。范例：
ubuntu - Jenkins 进程
Jenkins 有这么多进程处于事件状态是否正常？我检查了我的设置，我只配置了 2 个“执行者”... htop http://d.pr/i/RZzG+ 最佳答案您不仅要限制 Master 中的执
带管道的 Scala 进程
我正在尝试在 scala 中运行这样的 bash 命令: cat "example file.txt" | grep abc Scala 有一个特殊的流程管道语法，所以这是我的第一个方法: val f
循环和文件输出中的 Java 进程
很难说出这里要问什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或夸夸其谈，无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开，visit the help center . 关闭 1
multithreading - 进程、线程和并发编程
我需要一些帮助来理解并发编程的基础知识。事实上，我读得越多，就越感到困惑。因此，我理解进程是顺序执行的程序的一个实例，并且它可以由一个或多个线程组成。在单核CPU中，一次只能执行一个线程，而在多核CP
testing - 在集成测试期间如何运行服务器(进程)？
我的问题是在上一次集成测试后服务器进程没有关闭。在integration.rs中，我有: lazy_static! { static ref SERVER: Arc> = {
Scala 进程 - 捕获标准输出和退出代码
我正在使用 Scala scala.sys.process图书馆。我知道我可以用 ! 捕获退出代码和输出 !!但是如果我想同时捕获两者呢？我看过这个答案 https://stackoverflow
c++ - 使用共享库同步两个C++进程
我正在开发一个C++类(MyClass.cpp)，将其编译为动态共享库(MyClass.so)。同一台Linux计算机上运行的两个不同应用程序将使用此共享库。它们是两个不同的应用程序。它不是多线程
c - 查找UDP数据包的源IP/进程
我在我的 C 程序中使用 recvfrom() 从多个客户端接收 UDP 数据包，这些客户端可以使用自定义用户名登录。一旦他们登录，我希望他们的用户名与唯一的客户端进程配对，这样服务器就可以通过数据包
C、进程、fork
如何更改程序，以便函数 function_delayed_1 和 function_delayed_2 仅同时执行一次: int main(int argc, char *argv[]) {
c - 操作系统 - 进程
考虑这两个程序: //in #define MAX 50 int main(int argc, char* argv[]) { int *count; int fd=shm
linux - 如何同时打开三个终端(进程)
请告诉我如何一次打开三个终端，这样我的项目就可以轻松执行，而不必打开三个终端三次然后运行三个exe文件。请问我们如何通过脚本来做到这一点，即打开三个终端并执行三个 exe 文件。最佳答案在后台运行
远程计算机上的 C# 进程
我编写了一个监控服务来跟踪一组进程，并在服务行为异常、内存使用率高、超出 CPU 运行时间等时发出通知。这在我的本地计算机上运行良好，但我需要它指向远程机器并获取这些机器上的进程信息。我的方法，在
c# - 进程、线程和线程池
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。想改进这个问题？将问题更新为 on-topic对于堆栈溢出。 8年前关闭。 Improve this qu
c# - 后台线程/进程
我有一个允许用户上传文件的应用程序。上传完成后，必须在服务器上完成许多处理步骤(解压、存储、验证等...)，因此稍后会在一切完成后通过电子邮件通知用户。我见过很多示例，其中 System.Compo
linux - 什么时候将虚拟地址分配给程序/进程？
这个问题对很多人来说可能听起来很愚蠢，但我想对这个话题有一个清晰的理解。例如:当我们在 linux(ubuntu, x86) 上构建一个 C 程序时，它会在成功编译和链接过程后生成 a.out。 a.
java - 在linux中如何识别一个进程是java还是c或c++进程？
ps -eaf | grep java 命令在这里不是识别进程是否是 java 进程的解决方案，因为执行此命令后我的许多 java 进程未在输出中列出。最佳答案简答(希望有人写一个更全面的): 获
内核与系统中的 Windows 进程
我有几个与内核态和用户态的 Windows 进程相关的问题。如果我有一个 hello world 应用程序和一个暴露新系统调用 foo() 的 hello world 驱动程序，我很好奇在内核模式下
具有不受信任完整性级别的 Windows 进程
我找不到很多关于 Windows 中不受信任的完整性级别的信息，对此有一些疑问: 是否有不受信任的完整性级别进程可以创建命名对象的地方？ (互斥锁、事件等) 不受信任的完整性级别进程是否应该能够打开一

首页

博学

6Ren·AI

商城

c# - 使用 64 位进程读取文本文件非常慢