gpt4 book ai didi

arrays - 在 MATLAB matfile 中使用非零值预分配大型数组

转载 作者:太空宇宙 更新时间:2023-11-03 19:45:38 24 4
gpt4 key购买 nike

我需要将一个太大而无法放入内存的数组写入 .mat 二进制文件。这可以通过 matfile 来完成命令,它允许随机访问光盘上的 .mat 文件。

我正在尝试在此文件中预分配数组,以及 MathWorks blog 推荐的方法是

matObj = matfile('myBigData.mat','Writable',true); 
matObj.X(10000,10000) = 0;

这行得通,但给我留下了大量的零 - 这是有风险的,因为我将填充它的一些真实值也可能为零。对于较小的阵列,我通常会这样做

smallarray = nan(20,20);

但是如果我对大数组尝试这种方法,我会得到一个“内存不足”的错误;大概是 nan() 函数首先在内存中生成大量 NaN

我怎样才能用非零值预分配一个大数组?

最佳答案

我发现 sclarke81 和 Sam Robert 的答案实际上都不起作用,而且我怀疑预分配的概念是否适用于 matfile。下面报告的结果是在 i7-3770 CPU @ 3.4 GHz 上获得的,主内存为 16.8 GB,在 Linux 3.16 上运行 Matlab R2013a。

代码

mf = matfile(fn, 'Writable', true);
mf.x(5000, 200000) = 0;
clear mf

理论上在磁盘上“分配”8 GB 内存,初始化为 0。但是,生成的文件大小为 4726 字节,并且该过程耗时不到 0.01 秒。我可以将尺寸增加 10 倍或 100 倍,但没有太大变化。奇怪的。顺便说一句,末尾的 clear 用于确保文件由 Matlab 写入和关闭。

通常我们希望将初始化预分配给 NaN 而不是 0。以收到的方式执行此操作

mf = matfile(fn, 'Writable', true);
mf.x = nan(5000, 200000);
clear mf

耗时 11 秒,生成一个 57 MB 的文件。但是正如OP指出的那样,这种方法没有意义,因为它首先在内存中生成8 GB的整个矩阵,然后将其写出,这违背了matfile的目的。如果矩阵适合内存,则首先没有理由在处理数据时将数据保存在文件中。

Sam Roberts 提议首先分配/初始化为 0,然后将值更改为 NaN:

mf = matfile(fn, 'Writable', true);
mf.x(5000, 200000) = 0;
mf.x = mf.x * nan;
clear mf

这需要 16 秒,生成的文件大小相同。然而,这并不比上面的简单方法更好,因为在第三行,整个矩阵被读入内存,与内存中的标量 NaN 相乘,然后再次写出,导致峰值内存消耗为 8 GB。 (这不仅与 documentation 中解释的 matfile 变量的语义一致,而且我还检查了内存使用监视器。)

sclarke81 建议用这种方式避免在内存中生成矩阵:

mf = matfile(fn, 'Writable', true);
mf.x(1 : 5000, 1 : 200000) = nan;
clear mf

这个想法可能是在内存中只生成一个标量 NaN,然后​​将其复制到磁盘矩阵的每个元素中。然而,事实并非如此。事实上,这种方法似乎在峰值时消耗了大约 8.38 GB 的内存,比原始方法多 12%!

现在更多关于使用 matfile 进行预分配的优点。如果不预分配,而是用 NaN 逐行填充数组

mf = matfile(fn, 'Writable', true);
for i = 1 : 5000
mf.x(i, 1 : 200000) = nan(1, 200000);
end
clear mf

这需要 27 秒。 但是,如果预分配初始化为 0,然后按行用 NaN 覆盖

mf = matfile(fn, 'Writable', true);
mf.x(5000, 200000) = 0;
for i = 1 : 5000
mf.x(i, 1 : 200000) = nan(1, 200000);
end
clear mf

它需要很长时间:当我在 45 分钟后中止它时,该过程只完成了大约 3%,推断总运行时间约为一天!

matlab.io.MatFile 的行为是黑暗而神秘的,目前看来,只有广泛测试才能找到使用该工具的有效方法。但是,当涉及到 matfile 时,人们可能会得出这样的结论:预分配不是一个好主意。

关于arrays - 在 MATLAB matfile 中使用非零值预分配大型数组,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/26139832/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com