- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个文本文件,其中包含以下几行,我想将它们分成每个句子的列表,一个句子是 1-5,另一个句子是 1-8,依此类推,每个句子之间有空格。例如,一个句子列表应该是['Den', 'allmänna','pensionen', 'är', 'av'],即1-5
from collections import defaultdict
out = defaultdict(list) # Initialize dictionary for output
key = 0 # Initialize key
for idx, word, _ in container: # Unpack sublists
if int(idx) == 1: # Check if we are at start of new sentence
key += 1 # Increment key for new sentence
out[key].append(word) # Add word to list
How to slice numbered lists into sublists
代码运行良好,但是当我尝试直接从测试文件将其应用到分割行时,我得到ValueError 表示有太多值无法解压。该文件总共包含 87 行。我想使用上面的代码,但不知道如何解决 ValueError。
1 Den DT DT UTR|SIN|DEF 3 DT _ _ _ _ P108_1:1
2 allmänna JJ JJ POS|UTR/NEU|SIN|DEF|NOM 3 AT _ _ _ _ P108_1:2
3 pensionen NN NN UTR|SIN|DEF|NOM 4 SS _ _ _ _ P108_1:3
4 är VB VB PRS|AKT 0 ROOT _ _ _ _ P108_1:4
5 av PP PP 4 SP _ _
1 Folkpensionen NN NN UTR|SIN|DEF|NOM 2 OO _ _ _ _ P108_2:1
2 får VB VB PRS|AKT 0 ROOT _ _ _ _ P108_2:2
3 man PN PN UTR|SIN|IND|SUB 2 SS _ _ _ _ P108_2:3
4 oberoende PC PC PRS|UTR/NEU|SIN/PLU|IND/DEF|NOM 2 AA _ _ _ _ P108_2:4
5 av PP PP 4 HD _ _
6 tidigare JJ JJ KOM|UTR/NEU|SIN/PLU|IND/DEF|NOM 7 DT _ _ _ _ P108_2:6
7 arbetsinkomst NN NN UTR|SIN|IND|NOM 4 PA _ _ _ _ P108_2:7
8 . MAD MAD 2 IP _ _
最佳答案
使用itertools.groupby
并使用str.isspace
对项目进行分组:
from itertools import groupby
with open('abc1') as f:
for k, g in groupby(f, str.isspace):
if not k:
sentence = [x.split(None, 2)[1] for x in g]
print sentence
输出:
['Den', 'allm\xc3\xa4nna', 'pensionen', '\xc3\xa4r', 'av']
['Folkpensionen', 'f\xc3\xa5r', 'man', 'oberoende', 'av', 'tidigare', 'arbetsinkomst', '.']
关于python - 将大文本文件拆分为句子,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/21261218/
我有一个数组列表: ArrayList allText = new ArrayList(); 其内容是这样的: [Alabama - Montgomery, Alaska - Juneau, Ariz
我有一个 timestamp 格式的开始和结束时间。我想将它们分成多个时间段,例如 1 小时。 $t1 = strtotime('2010-05-06 12:00:00'); $t2 = strtot
我需要将 span10 分成 3 列,但我无法将它们排列起来。我应该在 span10 中添加一个 span12 还是使用 offset 还是??
我有一个时间序列。我想从早上 8 点到第二天早上 7:59 分成 24 小时的区 block 。我知道如何按日期分组,但我尝试过使用 TimeGroupers 和 DateOffsets 处理这个 8
我收到“街道号码邮政编码城市”形式的地址(作为字符串)。我想要做的是将街道和号码与邮政编码和城市分开。通常你可以按空格分割。但有些街道名称中也有空格,例如:“Emile Van Ermengemlaa
我有一个用户列表。其中一些用户处于第一状态,而其他用户处于第二状态。所以我想要的是将这个列表显示为首先,它按排序顺序显示存在 = 1 的用户,然后按排序顺序显示存在 = 2 的用户。这里的排序是根据用
我感觉我搜索了整个网络,但找不到一种方法将不同高度的 div 很好地划分为 3 列,就像 http://www.ing.nl 上那样 headertekst headerteksttesth
Bootstrap 3 按钮下拉菜单出现问题。你可以在这里看到我的两个例子: http://www.bootply.com/W1dLusilMk http://www.bootply.com/GGBv
我在 php 中执行以下操作 foreach($QuestionAsekd as $k => $v){ $grp_name = $v['NAME']; $groupValues[$gr
我找到了一种用pandas解析html的绝妙方法。我的数据格式有点奇怪(见下文)。我想将这些数据拆分为 2 个单独的数据帧。 注意每个单元格如何由,分隔...是否有任何真正有效的方法来分割所有这些单元
HTML 看起来像这样,但我不允许对其进行更改。我只能编写 CSS 将其变成 2 列。 Povezave www.behance.net www.kiberpipa.org www.o
假设我有以下数据框“A” utilization utilization_billable service 1
我需要将 2 个文本框拉伸(stretch)到 100% 的浏览器宽度,以及一个提交按钮。所有三个都应该在一行中,我试图拉伸(stretch)它但它没有发生......有什么想法吗? 代码: .sea
我是一名优秀的程序员,十分优秀!