- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我所做的大部分工作都涉及编写简单的解析脚本,从一个文件中读取搜索词并逐行搜索另一个文件。找到搜索词后,该行(有时是下一行)将被写入另一个输出文件。我使用的代码是初级的并且可能很粗糙。
#!/usr/bin/env python
data = open("data.txt", "r")
search_terms = ids.read().splitlines()
data.close()
db = open("db.txt", "r")
output = open("output.txt", "w")
for term in search_terms:
for line in db:
if line.find(term) > -1:
next_line = db.next()
output.write(">" + head + "\n" + next_line)
print("Found %s" % term)
这里有一些问题。首先,我不认为逐行搜索是最有效和最快的,但我对此不太确定。其次,我经常遇到光标放置问题,并且当找到搜索词时光标不会重置到文件的开头。第三,虽然我通常确信所有术语都可以在数据库中找到,但很少有时候我不能确定,所以每当它迭代整个数据库并且可以时,我想写入另一个文件找到这个词。我尝试添加一个片段来计算数据库的行数,因此如果 find() 函数到达最后一行并且未找到该术语,那么它会输出到另一个“未找到”文件,但我还没有无法让我的 elif 和 else 循环正确。
总的来说,我只是想要任何可以使此类脚本更加高效和健壮的提示或更正。
谢谢。
最佳答案
除非它是一个非常大的文件,否则为什么不逐行迭代呢?如果输入文件的大小是计算机可用资源(内存)的重要部分,那么您可能需要研究缓冲输入和计算机正在执行的其他更低级的抽象。但是,如果您在相对现代的机器上谈论几百 MB 或更少,请让计算机进行计算;)
您可能想立即养成使用内置上下文管理器with
的习惯。例如,在您的代码片段中,您没有调用 output.close()
。
with open('data.txt', 'r') as f_in:
search_terms = f_in.read().splitlines()
现在 search_terms
是一个列表的句柄,该列表将 data.txt
中的每一行作为字符串(但删除了换行符)。由于 with
,data.txt
已关闭。
事实上,我也会使用 db.txt
文件来实现这一点。
with open('db.txt', 'r') as f_in:
lines = f_in.read().splitlines()
上下文管理器很酷。
顺便说一句,您现在可以打开目标文件,并在其始终打开的情况下进行解析和结果跟踪,但我喜欢尽可能长时间地关闭尽可能多的文件。
我建议在循环外部设置最大的对象,我猜它是 db.txt 内容。最外面的循环通常只迭代一次,所以最好把最大的东西放在那里。
results = []
for i, line in enumerate(lines):
for term in search_terms:
if term in line:
# Use something not likely to appear in your line as a separator
# for these "second lines". I used three pipe characters, but
# you could just as easily use something even more random
results.append('{}|||{}'.format(line, lines[i+1]))
if results:
with open('output.txt', 'w') as f_out:
for result in results:
# Don't forget to replace your custom field separator
f_out.write('> {}\n'.format(result.replace('|||', '\n')))
else:
with open('no_results.txt', 'w') as f_out:
# This will write an empty file to disk
pass
这种方法的好处是 db.txt
中的每一行都会针对 search_terms
中的每个 search_term 检查一次。然而,缺点是任何行都会为其包含的每个搜索词进行记录,即,如果其中包含三个搜索词,则该行将在您的 output.txt
中出现三次。
所有文件都神奇地关闭了。
上下文管理器很酷。
祝你好运!
关于python - 如何编写一个简单的 Python 解析脚本?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/28032026/
我只想从客户端向服务器发送数组 adc_array=[w, x, y, z]。下面是客户端代码,而我的服务器是在只接受 json 的 python 中。编译代码时我没有收到任何错误,但收到 2 条警告
我是 lua 和 Node js 的新手,我正在尝试将我正在开发的移动应用程序连接到服务器。问题是它连接到服务器,但我尝试传递的数据丢失或无法到达服务器。对我正在做的事情有什么问题有什么想法吗? th
我在这个页面上工作 http://www.haskell.org/haskellwiki/99_questions/Solutions/4 我理解每个函数的含义,看到一个函数可以像这样以多种方式定义,
我目前正在尝试将数据写入 excel 以生成报告。我可以将数据写入 csv 文件,但它不会按照我想要的顺序出现在 excel 中。我需要数据在每列的最佳和最差适应性下打印,而不是全部打印在平均值下。这
所以,我正在做一个项目,现在我有一个问题,所以我想得到你的帮助:) 首先,我已经知道如何编写和读取 .txt 文件,但我想要的不仅仅是 x.hasNext()。 我想知道如何像 .ini 那样编写、读
我正在尝试编写一个函数,该函数将返回作为输入给出的任何数字的阶乘。现在,我的代码绝对是一团糟。请帮忙。 function factorialize(num) { for (var i=num, i
这个问题已经有答案了: Check variable equality against a list of values (16 个回答) 已关闭 4 年前。 有没有一种简洁或更好的方法来编写这个条件
我对 VR 完全陌生,正在 AFrame 中为一个类(class)项目开发 VR 太空射击游戏,并且想知道 AFrame 中是否有 TDD 的任何文档/标准。有人能指出我正确的方向吗? 最佳答案 几乎
我正在尝试创建一个 for 循环,它将重现以下功能代码块,但以一种更具吸引力的方式。这是与 Soundcould 小部件 API 实现一起使用的 here on stackoverflow $(doc
我有一个非常令人困惑的问题。我正在尝试更改属性文件中的属性,但它只是没有更改... 这是代码: package config; import java.io.FileNotFoundException
我对 VR 完全陌生,正在 AFrame 中为一个类(class)项目开发 VR 太空射击游戏,并且想知道 AFrame 中是否有 TDD 的任何文档/标准。有人能指出我正确的方向吗? 最佳答案 几乎
我正在开发一个用户模式(Ring3)代码级调试器。它还应支持.NET可执行文件的本机(x86)调试。基本上,我需要执行以下操作: 1).NET在隐身模式下加载某些模块,而没有LOAD_DLL_DEBU
我有一个列表,我知道有些项目是不必要打印的,我正在尝试通过 if 语句来做到这一点...但是它变得非常复杂,所以有没有什么方法可以在 if 语句中包含多个索引而无需打印重写整个声明。 看起来像这样的东
我很好奇以不同方式编写 if 语句是否会影响程序的速度和效率。所以,例如写一个这样的: bool isActive = true; bool isResponding = false; if (isA
我在搜索网站的源代码时找到了一种以另一种方式(我认为)编写 if 语句的方法。 代替: if(a)b; 或: a?b:''; 我读了: !a||b; 第三种方式和前两种方式一样吗?如果是,为什么我们要
我的数据采用以下格式(HashMap的列表) {TeamName=India, Name=Sachin, Score=170} {TeamName=India, Name=Sehwag, Score=
我目前正在完成 More JOIN operations sqlzoo 的教程,遇到了下面的代码作为#12 的答案: SELECT yr,COUNT(title) FROM movie JOIN ca
我正试图找到一种更好的方法来编写这段代码: def down_up(array, player) 7.downto(3).each do |row| 8.times do |col
出于某种原因,我的缓冲区中充满了乱码,我不确定为什么。我什至用十六进制编辑器检查了我的文件,以验证我的字符是否以 2 字节的 unicode 格式保存。我不确定出了什么问题。 [打开文件] fseek
阅读编码恐怖片时,我刚刚又遇到了 FizzBuzz。 原帖在这里:Coding Horror: Why Can't Programmers.. Program? 对于那些不知道的人:FizzBu
我是一名优秀的程序员,十分优秀!