- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
在 C++ 中逐行处理来自文件的数据的最有效(不易出错/通常“正确”)方式是什么(如果存在)?也就是说,在移动到下一个之前,一次只会使用文件中的一行来执行一些冗长的计算。我考虑过以下选项,但无法决定哪一个更合适。
目前我正在做类似的事情(打开,做所有事情,最后关闭):
string line;
fstream myfile;
int numlines = 1000;
myfile.open("myfile.csv");
for(int i = 0; i < numlines; i++){
getline(myfile, line);
// do something using read data
};
myfile.close();
读取数据后立即打开和关闭(不会对速度造成太大影响,因为计算时间比数据导入时间长得多):
string line;
fstream myfile;
int numlines = 1000;
for(int i = 0; i < numlines; i++){
myfile.open("myfile.csv");
for(int j = 0; j < i+1; j++)
getline(myfile, line);
myfile.close();
// do something using read data
};
一次读取所有数据(需要存储在 ~30x1000 二维数组中,因为 line
被逗号分割成数组):
string line;
fstream myfile;
int numlines = 1000;
double data[numlines][30];
myfile.open("myfile.csv");
for(int i = 0; i < numlines; i++){
getline(myfile, line);
// split by comma, store in data[][]
}
myfile.close();
for(int i = 0; i < numlines; i++){
// do something using data[i][]
};
这里是否有任何陷阱或上述任何解决方案是否有效?我在想也许将文件保持在打开状态几个小时不是一个好主意(也许吧?),但是在内存中保持一个大的双二维数组听起来也不对...
最佳答案
如果可以,请使用 1。如果必须,请使用 3。永远不要使用 2。
为什么?选项 1 仅将存储用于单行缓冲区。它只遍历文件一次。由于打开的文件通常不是昂贵的资源,因此它很可能是最便宜和最简单的。
但是,选项 1 并不总是足够的。有时您需要以随机顺序处理行。这是选项 3 最好的地方。在这种情况下,如果有足够的内存,最简单的方法就是读取整个文件并将内容提取到内存中。在许多情况下,字符串数组就足够了。在你的行中,这些行似乎包含 double 的文本表示。因此,在您阅读时提取这些内容是合适的。通常,您希望以存储和/或访问高效的形式进行提取。
如果文件太大,内存放不下,则必须使用随机文件访问(C++ 中的fseek
或seek
)。对于文本行,通读它以找到行开始的偏移量。将这些存储在数组中以用作行索引。通过使用适当的索引条目查找行开始来访问行。然后阅读下一个换行符。索引将为每行 8 个字节加上单行的缓冲区。如果文件真的很大,那么您可以将索引存储在一个文件中,并且每行访问查找两次。最好将索引和数据放在不同的磁盘驱动器上以减少寻道时间。消除索引的另一种选择是要求所有行具有相同的长度,因此算术足以找到任何行。
只有当您在处理一行时维护一个打开的文件会带来过高的成本时,选项 2 才有意义。实际上永远不会是这种情况。您的代码将必须读取 O(n^2) 个单位的数据以获取 n 个单位的文件。随着问题变得越来越大,对性能非常不利。由于文件 IO 通常是程序的瓶颈,这确实非常糟糕。
此外,文件打开和关闭是相当昂贵的操作,不能随意进行。我曾经在一个大型仿真系统上工作,并被要求看看我是否可以加快速度。事实上,考虑到它正在做的事情,它似乎过分缓慢。经过几个星期的逆向工程代码后,我终于发现在事件循环中每次迭代都会打开一个跟踪文件进行追加和关闭一次。我将打开和关闭移到循环外(在循环内添加一个偶尔的刷新来替换),哇哦!模拟速度提高了 20 倍或更多。至少可以说客户很高兴。
关于c++ - 在 C++ 中逐行使用来自 csv 的数据的有效方法,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/16410689/
我正在使用 python 加密一些文件,但我在逐 block 读取文件时遇到问题。 有时不会返回最后一个 block 的所有数据。 当文件长度为 307200 字节时,我没有问题。当它的长度为 279
我正在使用 WebRTC 将文件发送到连接的对等方,并且我正在以块的形式发送文件。但是,我无法弄清楚如何让对等方在文件逐块流入时保存/下载文件。 我在网上找到的所有例子都推荐做这样的事情: // se
我用 Tiled 做了一张 map 。它的每一 block 图 block 都尺寸为 32x32 像素,我的主要角色 Sprite 也是。 在我的类(class) Player.cpp 中,我有一些计
我见过一些单页网站,您可以逐 block 滚动,因此您没有无限滚动。 你逐 block 移动。 是否有提供此功能的任何脚本或其他东西? 最佳答案 我自己从未使用过它,所以我无法在代码方面为您提供帮助,
这是一个逐 block 反转文件内容的程序。 #include #include #define BS 12 void reverse(char * buffer, int size) { c
在下面的代码中,有没有办法避免 if 语句? s = 13; /*Total size*/ b = 5; /*Block size*/ x = 0; b1 = b; while(x s)
我正在尝试分割输入图像并逐个对其进行模糊处理,但毕竟对相邻图 block 调用 cv::blur 我得到了边界像素,这与我有一次将 cv::blur 集体应用于整个图像。 Mat upper(im,
我想逐个读取文件。该文件被分成几部分,存储在不同类型的媒体上。我目前所做的是调用文件的每个单独部分,然后将其合并回原始文件。 问题是我需要等到所有 block 都到达后才能播放/打开文件。是否可以在
我有一个包含客户和日期列表的 JSON 文件。 文件看起来像这样: { "Customers": [ { "Customer": "Customer Name Here", "Company"
我的邮件目标是从连接到HTTP服务器的TCP套接字读取数据,然后解析 HTTP响应块(传输编码:分块)-服务器在同一连接上每30秒发送一个块 我附上了我的代码。看起来io.Copy读取第一个块,然后等
我认为自己是一位经验丰富的 numpy 用户,但我无法找到以下问题的解决方案。假设有以下数组: # sorted array of times t = numpy.cumsum(numpy.rando
当我将文件添加到暂存区时,我可以 $ git add my_file -p 然后选择我要暂存的 block 。 有没有办法 merge/挑选一个提交并逐 block 应用它的差异? 谢谢 最佳答案 我
我有一个 mongodb 查询,它获取大约 50,000 个大文档。 这对我的 RAM 来说太多了,因此计算机速度变慢了。 现在我想逐 block 迭代 mongodb 结果。 我想获取前 1000
我不会为 AES 或其他加密打开此线程,因为这是我要用来加密 AES 和其他加密的 key 的内容。我从 StackOverflow 和其他一些网站收集了一些代码,并对其进行了编辑以适合我的程序,但是
我在做一些后台工作时尝试收集所有系统统计数据。例如,我使用以下命令来收集 IO 统计信息: iostat -xty 5 此脚本用于每 5 秒收集一次 I/O 统计信息。所以我的日志会包含很多数据 bl
我需要 php 脚本,用于从 url 到服务器的可恢复文件下载。它应该能够开始下载,然后在捕捉时(30 秒 - 5 分钟)恢复,依此类推,直到完成整个文件。 perl 中有类似的东西 http://c
是否有标准的 Linux 命令可用于逐 block 读取文件?例如,我有一个大小为 6kB 的文件。我想读取/打印第一个 1kB,然后是第二个 1kB ...似乎 cat/head/tail 在这种情
我正在处理大量文件,我想逐 block 处理这些文件,假设在每批处理中,我想分别处理每 50 个文件。 如何使用 Spark Structured Streaming 来实现? 我看到 Jacek L
我正在处理大量文件,我想逐 block 处理这些文件,假设在每批处理中,我想分别处理每 50 个文件。 如何使用 Spark Structured Streaming 来实现? 我看到 Jacek L
我想知道:逐 block 读取 jp2 并将数据存储在缓冲区对象中的预期方法是什么? 现在我正在做类似的事情。 /* note I already created stream and configu
我是一名优秀的程序员,十分优秀!