- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我有一个 2.6 GB 的文本文件,其中包含一个数据库表的转储,我正试图将它拉入一个逻辑结构中,以便所有字段都可以是唯一的。我用来执行此操作的代码在这里:
class Targetfile
include Enumerable
attr_accessor :inputfile, :headers, :input_array
def initialize(file)
@input_array = false
@inputfile = File.open(file, 'r')
@x = @inputfile.each.count
end
def get_headers
@y = 1
@inputfile.rewind
@input_array = Array.new
@headers = @inputfile.first.chomp.split(/\t/)
@inputfile.each do |line|
print "\n#{@y} / #{@x}"
@y+=1
self.assign_row(line)
end
end
def assign_row(line)
row_array = line.chomp.encode!('UTF-8', 'UTF-8', :invalid => :replace).split(/\t/)
@input_array << Hash[ @headers.zip(row_array) ]
end
def send_build
@input_array || self.get_headers
end
def each
self.send_build.each {|row| yield row}
end
end
类已成功初始化,剩下一个 Targetfile 类对象。
问题是,当我调用 get_headers
方法将文件转换为哈希数组时,速度立即开始变慢。
直到项目编号 80,000 左右,我才注意到这一点,但后来很明显,文件的每 3-4,000 行就会出现某种暂停。这种停顿,每次发生,都需要稍微长一点的时间,直到第 100 万行,它花费的时间超过 30 秒。
出于实际目的,我可以将文件切碎以避免出现此问题,然后将生成的列表和唯一的 -that- 结合起来以获得我的最终输出。
然而,从好奇的角度来看,我并不满意。
谁能告诉我为什么会出现这种停顿,为什么会变长,以及是否有任何方法可以优雅地避免它?实际上,我只是想知道它是什么以及它为什么会发生,因为现在我已经注意到它,我在我运行的许多其他 Ruby 脚本中都看到了它,无论是在这台计算机上还是在其他计算机上。
最佳答案
我建议在 DBM 中执行此操作,而不是 Ruby 或任何其他语言。 DBM 可以非常快速地告诉您字段的唯一值,尤其是当它已经被索引时。
尝试用任何语言来做到这一点都是在为通用计算设计的东西中复制数据库的基本功能。
相反,将 Ruby 与 ORM(如 Sequel 或 Active Record)一起使用,并向数据库发出查询并让它返回您想知道的内容。不要遍历每一行,那太疯狂了,要求它为您提供独特的值(value)并从那里开始。
我不会责怪 Ruby,因为在给定相同主机和 RAM 的情况下,任何其他语言都会出现同样的问题。 C/C++ 可能会通过生成更紧凑的代码来延迟不可避免的事情,但是您的开发时间会大大减慢,尤其是当您学习 C 等未知语言时。意外错误的风险会增加,因为您必须做更多的内务管理和防御工作编程比你在 Ruby、Python 或 Perl 中做的要好。
将每个工具用于其设计目的,您将取得领先。
查看您的代码,您可能可以通过不尝试将每一行都保留在内存中来提高通过完整运行的机会。你说你试图确定唯一性,所以只保留你感兴趣的唯一列值,你可以使用 Ruby 的 Set 类轻松地做到这一点。您可以将要确定唯一性的每个事物的值放在上面,遍历文件,Set 将只保留唯一值。
关于ruby - 为什么我的 Ruby 脚本会随着时间的推移变慢?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/18795325/
我有 powershell 脚本。通过调度程序,我运行 bat 文件,该文件运行 PS1 文件。 BAT文件 Powershell.exe -executionpolicy remotesigned
什么更快? 或者 $.getScript('../js/SOME.js', function (){ ... // with $.ajaxSetup({ cache: true });
需要bash脚本来显示文件 #!/bin/bash my_ls() { # save current directory then cd to "$1" pushd "$1" >/dev/nu
我有一个输入 csv 文件,实际上我需要在输入文件中选择第 2 列和第 3 列值,并且需要转换两个值的时区(从 PT 到 CT),转换后我需要替换转换后的时区值到文件。 注意: 所有输入日期值都在太平
我正在使用/etc/init.d/httpd 作为 init.d 脚本的模板。我了解文件中发生的所有内容,但以下行除外: LANG=$HTTPD_LANG daemon --pidfile=${pid
我有以下选择: python runscript.py -O start -a "-a "\"-o \\\"-f/dev/sda1 -b256k -Q8\\\" -l test -p maim\""
我对 shell 脚本完全陌生,但我需要编写一个 shell 脚本来检查文件是否存在,然后移动到另一个位置 这是我写的: 一旦设备崩溃,我就会在/storage/sdcard1/1 中收集日志 #!/
我正在使用 bash 脚本从文本文件中读取数据。 数据: 04:31 Alex M.O.R.P.H. & Natalie Gioia - My Heaven http://goo.gl/rMOa2q
这是单击按钮时运行的 javascript 的结尾 xmlObj.open ('GET', /ajax.php, true); xmlObj.send (''); } 所以这会执行根目录中的php脚本
关闭。这个问题需要debugging details .它目前不接受答案。 编辑问题以包含 desired behavior, a specific problem or error, and th
我需要将文件转换为可读流以通过 api 上传,有一个使用 fs.createReadStream 的 Node js 示例。任何人都可以告诉我上述声明的 python 等价物是什么? 例子 const
我有一个 shell 脚本 cron,它从同一目录调用 python 脚本,但是当这个 cron 执行时,我没有从我的 python 脚本中获得预期的输出,当我手动执行它时,我的 python 脚本的
如何使 XMLHttpRequest (ajax) 调用的 php 脚本安全。 我的意思是,不让 PHP 文件通过直接 url 运行,只能通过脚本从我的页面调用(我不想向未登录的用户显示数据库结果,并
我正在尝试添加以下内容 我正在使用经典的 asp。但我不断收到的错误是“一个脚本 block 不能放在另一个脚本 block 内。”我尝试了此处的 document.write 技术:Javasc
如何从另一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本?如果我了解 include 在做什么,我认为 include 不会起作用;因为我正在运行的每个文件都会重新声明一些相同的函数等。我想
我想创建具有动态内容的网页。我有一个 HTML 页面,我想从中调用一个 lua 脚本 如何调用 lua 脚本? ? ? 从中检索数据?我可以做类似的事情吗: int xx = 0; xx
我删除了我的第一个问题,并重新编写了更多细节和附加 jSfiddle domos。 我有一个脚本,它运行查询并返回数据,然后填充表。表中的行自动循环滚动。所有这些工作正常,并通过使用以下代码完成。然而
我尝试使用 amp 脚本,但收到此错误: “[amp-script] 脚本哈希未找到。amp-script[script="hello-world"].js 必须在元[name="amp-script
我有一个读取输入的 Shell 脚本 #!/bin/bash echo "Type the year that you want to check (4 digits), followed by [E
我正在从 nodejs 调用 Lua 脚本。我想传递一个数组作为参数。我在 Lua 中解析该数组时遇到问题。 下面是一个例子: var script = 'local actorlist = ARGV
我是一名优秀的程序员,十分优秀!