python - 如何在 python 中将文本文件分段？-6ren

python - 如何在 python 中将文本文件分段？

转载作者：行者123 更新时间：2023-12-01 07:15:51

25

4

我有一个文本文件:

000140.psd

1) You've heard of slow food. 

nsubj(heard-3, You-1)
aux(heard-3, 've-2)
root(ROOT-0, heard-3)
case(food-6, of-4)
amod(food-6, slow-5) s1
nmod:of(heard-3, food-6) t1

2) This is slow denim. 

nsubj(denim-4, This-1)
cop(denim-4, is-2)
amod(denim-4, slow-3) s1
root(ROOT-0, denim-4) t1

我想运行一个循环来查看每个段落中包含 s1 (或 s2、s3 等)的所有行。我希望能够为每个段落创建两个列表。第一个列表将包含其中包含“s#”的行，另一个列表将包含所有行。这样我就可以创建“规则”来确定哪些行应标记为“t#”，在本例中给出了 t1，但我想在尚未标记的情况下确定 t#。有没有办法为每个段落制作 2 个不同的列表，以便我可以自动进行比较？

我已经尝试过:

lexxe = open('000140.ant')
for line in lexxe:
    line = line.rstrip()
    if re.search('s[0-9]$', line):
        source.append(line)
print(source)

但这只给了我一个包含 s + 数字的所有行的列表。

最佳答案

您需要首先将文本拆分为段落，然后进行您想要执行的处理:

将文件读入字符串:

lexxe = open('000140.ant').read()

然后使用正则表达式将其分成段落:

paragraphs = re.sub(r'(\n\d\))', r'|\1', lexxe).split('|')

这将在每个新行上分割，后跟一个数字和一个右括号。我必须采取解决方法，使用 | 字符，这样段落的开头就不会被消耗。如果您在文本中的任何位置使用 |，这将不起作用，但您可以选择不同的字符。

您可以使用列表理解按段落找到 s# 行:

source = [[l.rstrip() for l in p.split('\n') if re.search(r's\d$', l.rstrip())] for p in paragraphs]

所以你最终会得到:

> paragraphs
['\n000140.psd\n', "\n1) You've heard of slow food. \n\nnsubj(heard-3, You-1)\naux(heard-3, 've-2)\nroot(ROOT-0, heard-3)\ncase(food-6, of-4)\namod(food-6, slow-5) s1\nnmod:of(heard-3, food-6) t1\n", '\n2) This is slow denim. \n\nnsubj(denim-4, This-1)\ncop(denim-4, is-2)\namod(denim-4, slow-3) s1\nroot(ROOT-0, denim-4) t1\n']

您可以将其分成几行:

paragraph_lines = [p.split('\n') for p in paragraphs]

给你:

> paragraph_lines
[['', '000140.psd', ''], ['', "1) You've heard of slow food. ", '', 'nsubj(heard-3, You-1)', "aux(heard-3, 've-2)", 'root(ROOT-0, heard-3)', 'case(food-6, of-4)', 'amod(food-6, slow-5) s1', 'nmod:of(heard-3, food-6) t1', ''], ['', '2) This is slow denim. ', '', 'nsubj(denim-4, This-1)', 'cop(denim-4, is-2)', 'amod(denim-4, slow-3) s1', 'root(ROOT-0, denim-4) t1', '']]

并且源将是:

> source
[[], ['amod(food-6, slow-5) s1'], ['amod(denim-4, slow-3) s1']]

请记住，您将把标题 (000140.psd) 作为段落，但您只需执行 paragraphs = paragraphs[1:] 即可获得摆脱它

关于python - 如何在 python 中将文本文件分段？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/57962716/

25

4

0

文章推荐： Java:使用 BufferedInputStream、BufferedOutputStream 下载问题

文章推荐： python - 将一个图像粘贴到另一个图像上

c# - 在C#中将 'var'的值初始化为null
这个问题在这里已经有了答案: How to initialize var? (11 个答案) 关闭 8 年前。我想给一个变量赋初值 null，并在下一个 if-else block 中赋值，但是编
javascript - 如何在 Babel 中将 * 导出为命名空间？
我正在使用 TypeScript 3.8 编写 JS 和 TS 混合的代码。我写了以下行: export * as Easing from './easing'; 应该是 fair game在 Typ
r - 在 R 中将 "/"更改为 "\"
我需要将 R 代码中的“/”更改为“\”。我有这样的事情: tmp <- paste(getwd(),"tmp.xls",sep="/") 所以我的 tmp是 c:/Study/tmp.xls 我希望
在 R 中将 cumsum 值重置为零
我有个问题。例如我有这个: id truth count 1 1 1 2 1 2 3 0 0 4 1 1 5 1 2 6 1
php - 在 Redbean 中将 IN 与其他条件一起使用
我正在尝试使用“IN”和“=”来查找一些 bean。我目前正在使用此代码: $ids = array(1,2,3,4); $user = 1; $things = R::find( 'thing'
在 Xcode 中将 iPhone 应用程序部署到别人的手机上
是否可以在 Xcode 中部署到其他人的手机上？我没有 iPhone，但我想测试我在 friend 手机上制作的应用程序。在我支付 99 美元之前，我想确保这不会造成麻烦。谢谢。最佳答案不会有任
不能在 C 中将 sscanf() 用于字符数组
我试图得到一个非常大的数字(超过 unsigned long long int )。所以我把它作为一个字符串，然后一个数字一个数字地转换成整数并使用它。 #include #include int
在 Rust 中将 C 指针转换为结构
我在 Rust 中有 C 语言库的绑定(bind)，但它们并不完整。在 C 代码中，我定义了一个简化的宏，如下所示: #define MY_MACROS1(PTR) (((my_struct1
javascript - 如何在 animate 中将 "+="赋值运算符与变量一起使用？
我正在努力解决这个问题。 http://jsfiddle.net/yhcqfy44/ 动画应该自动相对于滚动到顶部每次出现滚动条时的高度。我已经写了这个，但没有运气: var hheight =
在 Elixir 中将 JSON 字符串解析为整数
我正在处理一个将数字作为字符串返回的 JSON API。例如 "12" ，但是，该字段值也可以是非数字的，例如:"-" . 我已将 JSON 数据解析为映射，我想将此字段提取为 elixir 中的整数
c# - 在C#中将.wav文件转换为.aiff
我正在尝试编写一个类，将.wav文件转换为.aiff文件作为项目的一部分。我遇到了几个库Alvas.Audio(http://alvas.net/alvas.audio,overview.aspx)
在 Lucene 中将 n 个单词表达式索引为单个术语
我想在 Lucene 中将像“New York”这样的“复合词”索引为单个术语，而不是像“new”、“york”那样。这样，如果有人搜索“new place”，则包含“new york”的文档将不会匹
clojure - 在 clojure 中将 "or"操作定义为宏而不是简单地定义为函数有什么好处？
我希望这个解释能让我更好地了解使用宏的优点。最佳答案在函数中，所有参数在调用之前都会被评估。这意味着 or 作为函数不能是惰性的，而宏可以将 or 重写为 if 语句，该语句仅在以下情况下计算分
xslt - 不要在 XSLT 中将 > 转换为 >
我有一些看起来像这样的 XML foo ]]> (注意 > 登录 "> foo")和 XSLT 样式表当我运行xsltproc stylesheet.xs
kotlin - 如何在 Kotlin 中将 Any 转换到列表？
当我尝试将 Any 转换为 List 时，如下面的示例所示，我得到“Unchecked cast: Any!”到列表'警告。有没有解决此类问题的方法？ val x: List = objectOfTy
python - 在 Python 中将 & 转换为 &
我正在使用 Python 开发一个简单的爬虫。目的是创建一个 sitemap.xml。(你可以在这里找到真正的 alpha 版本:http://code.google.com/p/sitemappy/
excel - 在 VBScript 中将 IF 语句拆分为多行
我想知道在 VBScript 中是否可以在多行中中断 If 语句。喜欢: If (UCase(Trim(objSheet.Cells(i, a).Value)) = "YES") Or _ (UCas
java - 在 Java 中将 For 转换为 do while
for (String item : someList) { System.out.println(item); } 使用“do while”是否等效？谢谢。最佳答案如果列表为空，f
c - 在 C 中将 ","分隔列表拆分为数组的最佳方法是什么？
这个问题已经有答案了: 已关闭10 年前。 Possible Duplicate: Split string with delimiters in C 在 C 中将“，”分隔的列表拆分为数组的最佳方法
在 C 中将 char 数组转换为整数数组
我有一个如下所示的字符数组: [0, 10, 20, 30, 670] 如何将此字符串转换为整数数组？这是我的数组 int i=0; size_t dim = 1; char* array = (c

首页

博学

6Ren·AI

商城

python - 如何在 python 中将文本文件分段？