gpt4 book ai didi

python - 如何编写一个简单的 Python 解析脚本?

转载 作者:太空宇宙 更新时间:2023-11-03 17:58:58 24 4
gpt4 key购买 nike

我所做的大部分工作都涉及编写简单的解析脚本,从一个文件中读取搜索词并逐行搜索另一个文件。找到搜索词后,该行(有时是下一行)将被写入另一个输出文件。我使用的代码是初级的并且可能很粗糙。

#!/usr/bin/env python

data = open("data.txt", "r")
search_terms = ids.read().splitlines()
data.close()
db = open("db.txt", "r")

output = open("output.txt", "w")

for term in search_terms:
for line in db:
if line.find(term) > -1:
next_line = db.next()
output.write(">" + head + "\n" + next_line)
print("Found %s" % term)

这里有一些问题。首先,我不认为逐行搜索是最有效和最快的,但我对此不太确定。其次,我经常遇到光标放置问题,并且当找到搜索词时光标不会重置到文件的开头。第三,虽然我通常确信所有术语都可以在数据库中找到,但很少有时候我不能确定,所以每当它迭代整个数据库并且可以时,我想写入另一个文件找到这个词。我尝试添加一个片段来计算数据库的行数,因此如果 find() 函数到达最后一行并且未找到该术语,那么它会输出到另一个“未找到”文件,但我还没有无法让我的 elif 和 else 循环正确。

总的来说,我只是想要任何可以使此类脚本更加高效和健壮的提示或更正。

谢谢。

最佳答案

除非它是一个非常大的文件,否则为什么不逐行迭代呢?如果输入文件的大小是计算机可用资源(内存)的重要部分,那么您可能需要研究缓冲输入和计算机正在执行的其他更低级的抽象。但是,如果您在相对现代的机器上谈论几百 MB 或更少,请让计算机进行计算;)

您可能想立即养成使用内置上下文管理器with的习惯。例如,在您的代码片段中,您没有调用 output.close()

with open('data.txt', 'r') as f_in:
search_terms = f_in.read().splitlines()

现在 search_terms 是一个列表的句柄,该列表将 data.txt 中的每一行作为字符串(但删除了换行符)。由于 withdata.txt 已关闭。

事实上,我也会使用 db.txt 文件来实现这一点。

with open('db.txt', 'r') as f_in:
lines = f_in.read().splitlines()

上下文管理器很酷。

顺便说一句,您现在可以打开目标文件,并在其始终打开的情况下进行解析和结果跟踪,但我喜欢尽可能长时间地关闭尽可能多的文件。

我建议在循环外部设置最大的对象,我猜它是 db.txt 内容。最外面的循环通常只迭代一次,所以最好把最大的东西放在那里。

results = []
for i, line in enumerate(lines):
for term in search_terms:
if term in line:
# Use something not likely to appear in your line as a separator
# for these "second lines". I used three pipe characters, but
# you could just as easily use something even more random
results.append('{}|||{}'.format(line, lines[i+1]))

if results:
with open('output.txt', 'w') as f_out:
for result in results:
# Don't forget to replace your custom field separator
f_out.write('> {}\n'.format(result.replace('|||', '\n')))
else:
with open('no_results.txt', 'w') as f_out:
# This will write an empty file to disk
pass

这种方法的好处是 db.txt 中的每一行都会针对 search_terms 中的每个 search_term 检查一次。然而,缺点是任何行都会为其包含的每个搜索词进行记录,即,如果其中包含三个搜索词,则该行将在您的 output.txt 中出现三次。

所有文件都神奇地关闭了。

上下文管理器很酷。

祝你好运!

关于python - 如何编写一个简单的 Python 解析脚本?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/28032026/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com