gpt4 book ai didi

python - 使用 spaCy 去除标点符号;属性错误

转载 作者:太空宇宙 更新时间:2023-11-03 13:31:07 24 4
gpt4 key购买 nike

目前我正在使用以下代码使用 spaCy 对某些文本数据进行词形还原和计算 TF-IDF 值:

lemma = []

for doc in nlp.pipe(df['col'].astype('unicode').values, batch_size=9844,
n_threads=3):
if doc.is_parsed:
lemma.append([n.lemma_ for n in doc if not n.lemma_.is_punct | n.lemma_ != "-PRON-"])
else:
lemma.append(None)

df['lemma_col'] = lemma

vect = sklearn.feature_extraction.text.TfidfVectorizer()
lemmas = df['lemma_col'].apply(lambda x: ' '.join(x))
vect = sklearn.feature_extraction.text.TfidfVectorizer()
features = vect.fit_transform(lemmas)

feature_names = vect.get_feature_names()
dense = features.todense()
denselist = dense.tolist()

df = pd.DataFrame(denselist, columns=feature_names)
df = pd.DataFrame(denselist, columns=feature_names)
lemmas = pd.concat([lemmas, df])
df= pd.concat([df, lemmas])

我需要删除专有名词、标点符号和停用词,但在我当前的代码中执行此操作时遇到了一些问题。我读过一些 documentationother resources ,但现在遇到错误:

---------------------------------------------------------------------------
AttributeError Traceback (most recent call last)
<ipython-input-21-e924639f7822> in <module>()
7 if doc.is_parsed:
8 tokens.append([n.text for n in doc])
----> 9 lemma.append([n.lemma_ for n in doc if not n.lemma_.is_punct or n.lemma_ != "-PRON-"])
10 pos.append([n.pos_ for n in doc])
11 else:

<ipython-input-21-e924639f7822> in <listcomp>(.0)
7 if doc.is_parsed:
8 tokens.append([n.text for n in doc])
----> 9 lemma.append([n.lemma_ for n in doc if not n.lemma_.is_punct or n.lemma_ != "-PRON-"])
10 pos.append([n.pos_ for n in doc])
11 else:

AttributeError: 'str' object has no attribute 'is_punct'

有没有一种更简单的方法可以将这些内容从文本中删除,而无需彻底改变我的方法?

完整代码可用here .

最佳答案

据我所知,这里的主要问题实际上很简单:n.lemma_ 返回一个字符串,而不是 Token 对象。所以它没有 is_punct 属性。我认为您在这里寻找的是 n.is_punct(token 是否为标点符号)。

如果您想更优雅地执行此操作,请查看 spaCy 的新 custom processing pipeline components (需要 v2.0+)。这使您可以将逻辑包装在一个函数中,当您在文本上调用 nlp() 时该函数会自动运行。您甚至可以更进一步,添加 custom attribute到您的 Doc – 例如,doc._.my_stripped_docdoc._.pd_columns 或其他内容。这里的优势是您可以继续使用 spaCy 的高性能内置数据结构,如 Doc(及其 View TokenSpan)作为您的应用程序的“单一事实来源”。这样,不会丢失任何信息,您将始终保留对原始文档的引用——这对于调试也非常有用。

关于python - 使用 spaCy 去除标点符号;属性错误,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47144311/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com