- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
在我的项目中,我们需要读取一个非常大的文件,其中每一行都有由特殊字符(“|”)分隔的标识符。不幸的是,我无法使用并行性,因为有必要在一行的最后一个字符与下一行的第一个字符之间进行验证,以决定是否提取它。无论如何,要求非常简单:将行分成标记,分析它们并仅将其中一些存储在内存中。代码很简单,如下所示:
final LineIterator iterator = FileUtils.lineIterator(file)
while(iterator.hasNext()){
final String[] tokens = iterator.nextLine().split("\\|");
//process
}
但是这一小段代码效率非常非常低。 split() 方法生成了太多未收集的临时对象(这里有最好的解释: http://chrononsystems.com/blog/hidden-evils-of-javas-stringsplit-and-stringr 。
出于比较目的:5MB 文件在文件处理结束时使用了大约 35MB 内存。
我测试了一些替代方案,例如:
但它们似乎都不够高效。使用 JProfiler,我可以看到临时对象使用的内存量过高(使用了 35 mb,但有效对象实际上只使用了 15 mb)。
然后我决定做一个简单的测试:读取 50,000 行后,显式调用 System.gc()。然后,在进程结束时,内存使用量从 35 mb 减少到 16 mb。我测试了很多很多次,但总是得到相同的结果。
我知道调用 System.gc () 是一种不好的做法(如 Why is it bad practice to call System.gc()? 中所示)。但是,在 split() 方法可以被调用数百万次的情况下,是否还有其他替代方案?
[更新]我仅使用 5 mb 文件用于测试目的,但系统应该处理更大的文件(500Mb ~ 1Gb)
最佳答案
这里要说的第一件也是最重要的事情是,不要担心。 JVM 消耗了 35MB 的 RAM,因为它的配置表明这个量足够低。当其高效的GC算法决定时间时,它会将所有这些对象扫走,没问题。
如果您确实愿意,您可以使用内存管理选项调用 Java(例如 java -Xmxn=...
)——我建议除非您运行的系统非常有限,否则不值得这样做硬件。
但是,如果您确实想避免每次处理一行时都分配 String
数组,有很多方法可以做到这一点。
一种方法是使用StringTokenizer
:
StringTokenizer st = new StringTokenizer(line,"|");
while (st.hasMoreElements()) {
process(st.nextElement());
}
您还可以避免一次消耗一行。将文件作为流获取,使用 StreamTokenizer
,并以这种方式一次使用一个 token 。
阅读 Scanner
、BufferedInputStream
、Reader
的 API 文档——这方面有很多选择,因为你正在做一些基本的东西。
但是,这些都不会导致 Java 更快或更积极地进行 GC。如果 JRE 不认为自己内存不足,它就不会收集任何垃圾。
尝试写这样的东西:
public static void main(String[] args) {
Random r = new Random();
Integer x;
while(true) {
x = Integer.valueof(r.nextInt());
}
}
运行它并在运行时观察 JVM 的堆大小(如果使用量增长太快而无法看到,请 hibernate )。每次循环时,Java 都会创建一个 Integer 类型的“临时对象”。所有这些都保留在堆中,直到 GC 决定需要清除它们。您会发现,只有达到一定级别,它才会执行此操作。但当它达到这个水平时,它将很好地确保永远不会超过其限制。
关于java - String.split() 临时对象和垃圾收集,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/37007189/
引用网址 http://hi.baidu.com/quiteuniverse/blog/item/9f3f043d46ad1e07bba16716.html 以下函数调用方式:&nbs
我什至不确定如何描述我正在尝试做的事情,因为我对 cookie 了解不多,但就这样吧。 是否可以使用PHP从浏览器缓存中收集一个cookie(或cookie文件),将其保存到数据库中,然后清除缓存并重
我正在使用 Room(v. 2.2.1)和协程支持(v. 1.3.2)并进行以下设置 @Entity(tableName = "simple_table") data class SimpleEnti
我正在尝试编写一个基于时间运算符收集/累积值的规则。 rule "Zone6 Overlap" when $i1 : Instance ($e1 : event == " Vel : 20.9
我有一个简单的 BST,定义了节点结构: struct node { int key_value; struct node *left; struct node *right; }; ty
我有这个对象: public class MenuPriceByDay implements Serializable { private BigDecimal avgPrice; p
我正在开发一个应用程序,需要访问给定传感器的“最后 5 秒有值(value)的数据”。我的计划是以某种方式存储这些数据,然后当我请求数据时,它将返回最近 5 秒内获得的所有数据。鉴于以下情况,我不确定
在 Ruby 中,您可以对数组使用 map/collect 方法来修改它: a = [ "a", "b", "c", "d" ] a.collect! {|x| x + "!" } a
我即将开始实时收集大量数字数据(对于那些感兴趣的人,各种股票和 future 的出价/要价/最后或“磁带”)。稍后将检索数据以进行分析和模拟。这一点都不难,但我想高效地做到这一点,这会带来很多问题。我
我提出这个问题是为了寻求有关如何设计系统的实用建议。 像 amazon.com 和 pandora 这样的网站拥有并维护着庞大的数据集来运行他们的核心业务。例如,亚马逊(以及所有其他主要电子商务网站)
假设我们有一个数据数组和另一个带索引的数组。 data = [1, 2, 3, 4, 5, 7] index = [5, 1, 4, 0, 2, 3] 我们想从 index 的 data 元素创建一个
好的,我已经阅读了几个关于它的主题,但现在就开始吧。假设我有一个应用程序,基本上我会时不时地点击一个按钮,几分钟内会发生很多事情,然后它可能会再闲置一个小时,或者可能只是 1 分钟。难道不是在整个结束
我有一个数据框,例如 Seq Chrm start end length score 0 A C1 1 50 49 12 1 B
我正在考虑在 Object[] 数组中收集泛型方法的所有方法参数以进行记录。我知道使用方面可以更好地实现这一点,但是我不允许使用它,并且如果可能的话我正在寻找一种基于纯反射的方法 为了澄清, 假设一个
快速提问: 如果 Socket 对象(及其本地缓存的 InputStream 和 OutputStream 对象)超出范围并被垃圾收集,连接是否在 JVM 中保持打开状态? (即,不会在监听服务器上抛
是否有用于收集 facebook 公共(public)数据作为实时提要的 API。我阅读了关于用于收集数据的公共(public)提要 API,但我现在不能申请,而且它不是免费的,还有 Open str
摘要 :我使用自定义收集器收集给定搜索的所有命中的文档 ID(它使用 ID 填充 BitSet)。根据我的需要,搜索和获取文档 ID 的速度非常快,但是当涉及到从磁盘实际获取文档时,事情变得非常缓慢。
我正在寻找一种方法来从自定义 Gradle 插件收集给定项目的所有依赖约束(通过常规 platform 和/或 enforcedPlatform 和/或“手动”强制执行)。 在 Maven 世界中,您
我有一个 CSV 格式的用户列表,但我需要按广告中的名称从每个用户收集 SamAccount 属性。 CSV 模型 脚本 Get-ADObject -Filter 'ObjectClass -eq "
我得到了一个非常大的列表,其中包含大约 200 个带有文本和图像的项目。 ng-repeat 是一种缓慢渲染的方式。它尝试过这个 solution 。效果很好。但不适合重复收集。 我的网络服务返回此:
我是一名优秀的程序员,十分优秀!