- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个奇怪的问题。根据像this这样的帖子我希望 IDLE 比在命令行上运行我的代码慢。然而,我看到完全相反的情况。
该程序比较两个文件并将匹配行配对在一起并将所有匹配项写入新文件。我认为它类似于 SQL 中的连接。但我需要忽略没有匹配项的行。以下是程序功能的概述:
程序似乎在尝试访问非常大的字典时卡住了。在 IDLE 下运行大约需要 2-3 分钟,但 1 小时后程序仍未在命令行上完成。当我访问 write_file 时,它的写入速度非常慢。
这是第一个文件的一些简化数据,其中数据由制表符分隔,数字是键,值是信息:
20\tinfo_first_file_20\n
18\tinfo_first_file_18\n
这是第二个文件的示例:
20\tinfo_second_file_20\n
30\tinfo_second_file_20\n
这是正在写入的文件的示例:
20\tinfo_first_file_20\t20\tinfo_second_file_20\n
函数
def pairer(file_1, file_2, write_file):
wf = open(write_file, 'w')
f1 = open(file_1, 'r')
line = f1.readline()
d = {}
while line != "":
key, value = line.strip('\n').split('\t')
d[key] = value
line = f1.readline()
f2 = open(file_2, 'r')
line_2 = f2.readline()
while line_2 != "":
key, value = line_2.strip('\n').split('\t')
if key in d.keys():
to_write = key +'\t' + d[key] + '\t' + key +'\t'+ value + '\n'
wf.write(to_write)
line_2 = f2.readline()
我如何在 IDLE 中运行代码
if __name__=="__main__":
pairer('file/location/of/file_1', 'file/location/of/file_2', 'file/location/of/write_file')
我如何在终端中运行代码
if __name__=="__main__":
parser = argparse.ArgumentParser()
parser.add_argument('file_1', action="store")
parser.add_argument('file_2', action="store")
parser.add_argument('write_file', action="store")
results = parser.parse_args()
pairer(results.file_1, results.file_2, results.write_file)
所有代码都是实际代码的简化。我希望我包含的内容足以让别人给我指出正确的方向,但不要太多,所以我要切中要点。我是编程新手,所以这可能是一个明显的问题,但我还没有找到任何东西。
使用终端时是否有字典的最大大小?它的存储方式是否不同,最终会耗尽我的内存力?
我有一台 Mac OSX 10.8。 Tkinter 已更新。我正在使用 python2.7。提前致谢。
编辑:
在程序到达这一点之前,它确实有大约 30 分钟的其他分析要做。但它只在这里失败。不确定这是否相关。另一部分只是将每个 ~30kb 的大文件分成 22 个较小的文件。这里不涉及字典,速度也差不多。所以我可以在更小的层面上处理数据。
编辑 2:
使用终端时内存清除是否不同?
我还注意到另一件事:当我查看 Activity Monitor 应用程序时,当我在 IDLE 中运行代码时,它似乎使用了更多的 CPU。我看起来它使用了不止一个处理器,但这没有意义。因为我的代码不是为并行运行而编写的。另外,当我在空闲状态下运行时,计算机会发出更多噪音。不是很定量,而是观察。
最佳答案
一个 1kb 的文件听起来很小,但这里有一些可能会解决问题的提示,因为这个问题有点含糊:
使用 argparse 意味着在命令行中你需要这样的东西:
python prog.py --file_1 file --file_2 file --write_file output
我不确定这是否是您想要的。您可以保持简单并执行以下操作:
if __name__ == '__main__':
file_1 = sys.argv[1]
file_2 = sys.argv[2]
write_file = sys.argv[3]
pairer(file_1, file_2, write_file)
你可以这样调用它:
python prog.py file_1 file_2 write_file
此外,这主要是一个样式问题,但我会稍微修改配对器 - 在文件上使用 for 循环,并且不要创建 keys() 列表。
def pairer(file_1, file_2, write_file):
d = {}
# using 'with' prevents lost resources!
with open(file_1, 'r') as f1:
for line in f1:
# no arguments in strip clears all whitespace
key, value = line.strip().split('\t')
d[key] = value
f2 = open(file_2, 'r')
line_2 = f2.readline()
with open(file_2, 'r') as f2, open(write_file, 'w') as wf:
key, value = line_2.strip().split('\t')
# don't do 'if key in d.keys()' because .keys() constructs a list of keys
# the in operator checks the key directly, which is O(1) instead of O(n)
# this should give you a pretty big speed boost
if key in d:
# this is probably a trivial speed difference, but you could try it this way:
to_write = '\t'.join([key, d[key], key, value + '\n'])
wf.write(to_write)
关于python - IDLE 和命令行之间的性能差异。 IDLE 表现更好的地方,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/17073692/
据我所知,根本不为元素呈现 HTML,或添加 display:none,似乎具有完全相同的行为:两者都使元素消失并且不与 HTML 交互。 我正在尝试禁用和隐藏一个复选框。所以HTML的总量很小;我无
我刚刚读了Android Architecture Tutorial: Developing an App with a Background Service (using IPC) .基本上是 让服
我有两个查询具有相同的结果,现在我想知道哪个查询更优化? 在选择中: select t1.*, sum(t2.value) as total_votes from table1 t1 left joi
有人告诉我,对于 I/O 绑定(bind)的应用程序,非阻塞 I/O 会更好。对于 CPU 密集型应用程序,阻塞 I/O 会好得多。我找不到这种说法的原因。试过谷歌,但很少有文章只是触及这个话题而没有
我有一个算法可以在数字列表中寻找好的对。一个好的配对被认为是索引 i 小于 j 且 arr[i] 1: # Finding the mid of the array
我有一个算法可以在数字列表中寻找好的对。一个好的配对被认为是索引 i 小于 j 且 arr[i] 1: # Finding the mid of the array
我从 API 收到一个 json,我需要解析并修改一个属性值。问题是,我收到的 json 数据的嵌套结构不一致,我无法控制它。 这将禁止我指定在特定深度(如 parsedJson.children[0
我有 451 个城市的坐标。现在我想计算每个城市之间的距离,然后根据该距离对一些结果进行排序。现在我有两个选择: 我可以运行一个循环来计算每个可能的城市组合的距离并将它们存储到一个表中,这将产生大约
对于返回相同结果的不同查询,我有两个查询计划我想知道是否有人可以告诉我哪个“更好”,以及为什么。 SELECT * FROM bids order by (select ranking from us
关闭。这个问题需要更多focused .它目前不接受答案。 想改进这个问题吗? 更新问题,使其只关注一个问题 editing this post . 关闭 7 年前。 Improve this qu
我有一个二维数组。我需要尽可能快地对其执行一些操作(函数每秒将被调用十几次,所以让它变得高效会很好)。 现在,假设我想获取元素 A[i][j],简单地使用 A[i][j] 在速度上有什么不同吗和 *(
在声明或使用字符串的代码中,我通常会看到开发人员这样声明它: string randomString = @"C:\Random\RandomFolder\ThisFile.xml"; 代替: str
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Why don't CSS resets use '*' to cover all elements? 我正
如果我有一个包含许多重复项的 python 列表,并且我想遍历每个项目,而不是重复项,最好使用一个集合(如 set(mylist),或者找到另一种方法来创建没有重复的列表?我想只是循环遍历列表并检查重
在阅读常量接口(interface)反模式时,我发现没有实例的最终常量类比常量接口(interface)更好。 请解释一下怎么做? public interface ConstIfc { publ
我正在查看我继承的一些旧代码,我真的不喜欢某些地方的风格。我真的不喜欢它的外观的一件事是: bool func() { bool ret = true; ret &= test1();
关闭。这个问题是opinion-based 。目前不接受答案。 想要改进这个问题吗?更新问题,以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
我经常发现自己试图使用 boost/QT 信号解耦对象。实现这一点的简单方法是针对我要通信的每个具体类型,创建一个新的信号和插槽签名并连接所有相关对象。这导致了访问者模式,理想情况下我想发出一个访问者
我正在 https://docs.oracle.com/javase/tutorial/java/javaOO/lambdaexpressions.html 上阅读有关 lambda 的内容 在方法
public List getInts() { List xs = new ArrayList(); xs.add(1); // return Collections.unmo
我是一名优秀的程序员,十分优秀!