c# - 读取大型文本文件(超过 400 万行)并在 .NET 中解析每一行-6ren

c# - 读取大型文本文件(超过 400 万行)并在 .NET 中解析每一行

转载作者：太空宇宙更新时间：2023-11-03 18:55:32

25

4

我每个月的每一天都有一个日志文件。这些文件是纯文本，每行都有一些信息，如下面的代码片段:

1?2017-06-01T00:00:00^148^3
2?myVar1^3454.33
2?myVar2^35
2?myVar3^0
1?2017-06-01T00:00:03^148^3
...

为了处理和显示这些数据，我正在开发一个 WPF 应用程序来读取这些 txt 文件、解析行并将这些数据保存在 SQLite 数据库中。然后，我允许用户进行一些基本的数学运算，例如子集的 AVG。

由于这些文件太大(每个文件超过 300mb 和 400 万行)，我正在努力解决 ProcessLine 方法中的内存使用问题(据我所知，读取部分还可以现在)。该方法永远不会完成，应用程序会自行进入中断模式。

我的代码:

private bool ParseContent(string filePath)
    {
        if (string.IsNullOrEmpty(FilePath) || !File.Exists(FilePath))
            return false;

        string logEntryDateTimeTemp = string.Empty;

        string [] AllLines = new string[5000000]; //only allocate memory here
        AllLines = File.ReadAllLines(filePath);
        Parallel.For(0, AllLines.Length, x =>
        {
            ProcessLine(AllLines[x], ref logEntryDateTimeTemp);
        });

        return true;
    }

    void ProcessLine(string line, ref string logEntryDateTimeTemp)
    {
        if (string.IsNullOrEmpty(line))
            return;

        var logFields = line.Split(_delimiterChars);

        switch (logFields[0])
        {
            case "1":
                logEntryDateTimeTemp = logFields[1];
                break;
            case "2":
                LogEntries.Add(new LogEntry
                {
                    Id = ItemsCount + 1,
                    CurrentDateTime = logEntryDateTimeTemp,
                    TagAddress = logFields[1],
                    TagValue = Convert.ToDecimal(logFields[2])
                });

                ItemsCount++;
                break;
            default:
                break;
        }
    }

有更好的方法吗？

OBS:我还测试了另外两种读取文件的方法，它们是:

        #region StreamReader
        //using (StreamReader sr = File.OpenText(filePath))
        //{
        //    string line = String.Empty;
        //    while ((line = sr.ReadLine()) != null)
        //    {
        //        if (string.IsNullOrEmpty(line))
        //            break;

        //        var logFields = line.Split(_delimiterChars);

        //        switch (logFields[0])
        //        {
        //            case "1":
        //                logEntryDateTimeTemp = logFields[1];
        //                break;
        //            case "2":
        //                LogEntries.Add(new LogEntry
        //                {
        //                    Id = ItemsCount + 1,
        //                    CurrentDateTime = logEntryDateTimeTemp,
        //                    TagAddress = logFields[1],
        //                    TagValue = Convert.ToDecimal(logFields[2])
        //                });

        //                ItemsCount++;
        //                break;
        //            default:
        //                break;
        //        }
        //    }
        //}
        #endregion

        #region ReadLines
        //var lines = File.ReadLines(filePath, Encoding.UTF8);

        //foreach (var line in lines)
        //{
        //    if (string.IsNullOrEmpty(line))
        //        break;      

        //    var logFields = line.Split(_delimiterChars);

        //    switch (logFields[0])
        //    {
        //        case "1":
        //            logEntryDateTimeTemp = logFields[1];
        //            break;
        //        case "2":
        //            LogEntries.Add(new LogEntry
        //            {
        //                Id = ItemsCount + 1,
        //                CurrentDateTime = logEntryDateTimeTemp,
        //                TagAddress = logFields[1],
        //                TagValue = Convert.ToDecimal(logFields[2])                          
        //            });

        //            ItemsCount++;
        //            break;
        //        default:
        //            break;
        //    }             
        //}
        #endregion

OBS2:我使用的是Visual Studio 2017，当应用程序运行在debug模式时，应用程序突然进入break模式，Output窗口的信息如下:

The CLR has been unable to transition from COM context 0xb545a8 to COM context 0xb544f0 for 60 seconds. The thread that owns the destination context/apartment is most likely either doing a non pumping wait or processing a very long running operation without pumping Windows messages. This situation generally has a negative performance impact and may even lead to the application becoming non responsive or memory usage accumulating continually over time. To avoid this problem, all single threaded apartment (STA) threads should use pumping wait primitives (such as CoWaitForMultipleHandles) and routinely pump messages during long running operations.

最佳答案

尝试使用 StreamReader 而不是一次将整个文件加载到内存中:

using (System.IO.StreamReader sr = new System.IO.StreamReader(filePath))
{
    string line;
    while ((line = sr.ReadLine()) != null)
    {
        //..
    }
}

关于c# - 读取大型文本文件(超过 400 万行)并在 .NET 中解析每一行，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/46407477/

25

4

0

文章推荐： html - 手机横屏时出现黑 block

文章推荐： python - 在装饰器中调用具有较少主机的结构嵌套方法

文章推荐： CSS3 隐藏跨度过渡

python - pyparsing 不适用于 Windows 文本文件，但适用于 Linux 文本文件
我有一个简单的 pyparsing 构造，用于提取日志消息的部分内容。看起来像这样 log_line = 时间戳 + task_info + Suppress(LineEnd()) 此结构可以很好地解
python字典函数，文本文件
我想定义一个函数 scaryDict()，它接受一个参数(textfile)并返回 textfile 中的单词按字母顺序排列，基本上生成字典但不打印任何一个或两个字母的单词。这是我目前所拥有的……不
java - 文本文件+JNLP
我正在尝试弄清楚如何包含对外部数据文件(文本形式)的引用，我希望通过 Web Start (JNLP) 与我的应用程序一起分发该文件。筛选 JNLP 结构的文档，我发现您可以包含对 JAR、nativ
Java 导出 - 文本文件
我尝试将 Java 程序从 Eclipse 导出到 .jar 文件，但遇到了问题。它运行良好，但由于某种原因它没有找到它应该从中获取数据的文本文件。如果有人能帮忙解决这个问题，我将非常感激。最佳答案
Java - 文本文件 - 在某些字符串之间读取
在过去的 20 个小时里，我试图解决以下问题，所以在开始考虑跳出窗外之前我想，我最好在这里寻求帮助: I have a text file with following content: ID 1 T
notepad++ - 如何删除重复行(文本文件)？
今天我试图删除一个简单文本文件中的重复行，例如: input (list.txt): hello hello try output (list.txt): try 我尝试使用 Notepad++ 删除
java - 系统找不到指定的路径-文本文件
我将一个文本文件添加到我的项目中，如下路径所示: Myproject/WebPages/stopwords.txt 图片: http://s7.postimg.org/w65vc3lx7/Untitl
C++ 替换字符串中的单词(文本文件)
所以我在我的程序上工作，现在我无法找到解决方案。我需要在 fext 文件中替换更多的符号，目前程序只将“TIT”替换为代码“*245$a”，如果我想用同样的方式替换其他字母，程序不会改变。有人知道如何
C++ 文本文件 I/O
这是一个非常简单的问题，但无论我看哪里，我都会得到不同的答案(这是因为它在 c++0x 中已经改变还是将要改变？): 在 C++ 中，我如何从一个文本文件中读取两个数字并将它们输出到另一个文本文件中？
C++ 文本文件，汉字
我有一个 C++ 项目应该添加到每一行的开头和到每一行的末尾。这适用于普通英文文本，但我有一个中文文本文件，我想这样做，但它不起作用。我通常使用 .txt 文件，但为此我必须使用 .rtf 来保存中
无法加载 C++ 文本文件
所以我的驱动看起来像这样: #include "problem2.h" #include "problem1.h" #include "problem3.h" #include #include
c++ - 包括静态数据/文本文件
我有一个包含字符串标识符的 ascii 数字文本文件(>50k 行)，可以将其视为数据 vector 的集合。根据用户输入，应用程序在运行时只需要这些数据 vector 之一。据我所知，我有 3 个
c# - 餐厅系统数据库/文本文件
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。要求提供代码的问题必须表现出对所解决问题的最低限度理解。包括尝试过的解决方案、为什么它们不起作用，以及预
c# - 合并两个字符串(文本文件)
这个问题在这里已经有了答案: 关闭 12 年前。 Possible Duplicate: Any decent text diff/merge engine for .NET ? 我有两个文本文件，
Android append 文本文件
我正在尝试将对话选择器中的唤醒时间和 sleep 时间记录到这样的文本文件中，但是对方法 commitToFile2 的调用不会 append 文本文件“savedData.txt”。我知道这段代码
Android webview 下载数据/文本文件
我开发了一个 android webview 并尝试在单击 webview 中的链接时下载生成的数据:文本文件。 webView.setDownloadListener(new Downloa
ffmpeg 图像列表(文本文件)到带有叠加水印的视频
我在一个文本文件中有 250 张图像/天 4000*3000 像素。 file '/home/user/camdata/nonseqdata.jpg' file '/home/user/camdata
php - 将配置(文本文件)转换为多维数组
我曾多次尝试将此配置文件转换为多维数组，这意味着我必须读取 config.txt 文件，然后必须将其转换为多维数组。我需要帮助或一些建议。配置文件: id=www session.timeout=1
sublimetext3 - 使用命令行在行号处打开 sublime 文本文件
我正在尝试使用 sublime text 3 打开文件，我想用光标在具体行号处打开它。我一直在查subl --help但我找不到混凝土线的选择。因此我只是使用:subl filename 有没有办法
delphi - 如何快速显示大 (GB) 文本文件？
我想在我的应用程序中快速显示一个大文本文件的内容，而不是将整个文件加载到内存中。其他人是怎么做的？ Total Commander是一个很棒的工具，它有一个很棒的内部查看器可以做到这一点。无论文件有

首页

博学

6Ren·AI

商城

c# - 读取大型文本文件(超过 400 万行)并在 .NET 中解析每一行