python - 使用 NLTK ieer 或 conll2000 语料库训练 NER 语料库-6ren

python - 使用 NLTK ieer 或 conll2000 语料库训练 NER 语料库

转载作者：太空宇宙更新时间：2023-11-03 15:21:37

24

4

我一直在尝试为特定领域和新实体训练命名实体识别模型。似乎没有一个完整的适合此的管道，并且需要使用不同的包。

我想给NLTK一个机会。我的问题是，如何训练 NLTK NER 使用 ieer 语料库对新实体进行分类和匹配？

我当然会提供 IOB 格式的训练数据，例如:

We PRP B-NP
saw VBD O
the DT B-NP
yellow JJ I-NP
dog NN I-NP

我想我必须自己标记 token 。

当我有这种格式的文本文件时，下一步该怎么做？使用 ieer 语料库或更好的语料库 conll2000 训练数据的步骤是什么？

我知道那里有一些文档，但我不清楚在标记训练语料库后该怎么做。

我想要使用 NLTK，因为我想使用 relextract() 函数。

请大家多多指教。

谢谢

最佳答案

nltk 提供您需要的一切。阅读 nltk 书的第 6 章，关于 Learning to Classify Text 。它为您提供了一个有效的分类示例。然后学习 Chapter 7 中的第 2 节和第 3 节，它向您展示了如何使用 IOB 文本并编写分块分类器。尽管示例应用程序不是命名实体识别，但代码示例几乎不需要任何更改即可工作(当然，您需要自定义功能函数才能获得不错的性能。)

您还可以使用 nltk 的标记器(或其他标记器)将 POS 标记添加到您的语料库，或者您可以捕获机会尝试在没有词性标记的数据上训练分类器(仅是 IOB 命名实体)类别)。我的猜测是，词性标记将提高性能，如果在训练数据上使用与评估(以及最终生产使用)相同的词性标记器，实际上效果会更好。

关于python - 使用 NLTK ieer 或 conll2000 语料库训练 NER 语料库，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/43489724/

24

4

0

文章推荐： python - 强制页面在新窗口中打开 selenium-web-driver python

文章推荐： c# - MongoDb 更新错误 : Maximum serialization depth exceeded

文章推荐： c# - 从文件 UWP (C#) 中读取 JSON

文章推荐： python - 带有 docker 的 Django 不运行自定义应用程序的迁移

r - txt : corpus() only works on character, 语料库、语料库、data.frame、kwic对象读取中文出错
我尝试使用R，jiebaR和语料库为中文语音生成词云并获取词频，但无法制作语料库。这是我的代码: library(jiebaR) library(stringr) library(corpus) cu
R 提取字符串/文档/语料库
我试图在 R 中做一些词干化，但它似乎只适用于单个文档。我的最终目标是一个术语文档矩阵，它显示文档中每个术语的频率。下面是一个例子: require(RWeka) require(tm) requi
nlp - Wordnet(词义注释)语料库
我一直在利用许多不同的语料库进行自然语言处理，并且我一直在寻找使用 Wordnet Word Senses 注释的语料库。我知道可能没有一个包含这些信息的大语料库，因为语料库需要手动构建，但必须有一
python - 导入和使用 NLTK 语料库
请，请，请帮助。我有一个文件夹，里面装满了我想使用 NLTK 进行分析的文本文件。我如何将其导入为语料库，然后在其上运行 NLTK 命令？我已经将下面的代码放在一起，但它给了我这个错误: ra
python - 编辑 NLTK 语料库
除了nltk自带的语料库之外，我想用自己的遵循相同词性规则的语料库来训练它。如何找到它正在使用的语料库，以及如何添加我自己的语料库(另外，不是作为替代)？编辑:这是我当前使用的代码: inpy =
python - nltk 语料库 tweeter_sample 按类别
我想使用 tweeter_sample 语料库训练 nltk，但当我尝试按类别加载示例时出现错误。首先我尝试这样: from nltk.corpus import twitter_samples d
python - nltk 语料库 tweeter_sample 按类别
我想使用 tweeter_sample 语料库训练 nltk，但当我尝试按类别加载示例时出现错误。首先我尝试这样: from nltk.corpus import twitter_samples d
python - 从大文本文件中过滤停用词(使用包 : nltk. 语料库)
我正在尝试对大型文本文件中最常用的词进行排名 - - 爱丽丝梦游仙境(公共(public)领域)。这是爱丽丝梦游仙境 Dropbox和 Pastebin .它按预期运行，有 1818 个“the”实例
python - 将 Lilypond 文件导入本地 music21 语料库
我希望对一些本地 Lilypond (.ly) 文件进行语料库研究，但我无法将它们导入本地 music21 语料库。我只能假设答案在 music21.converter 上页面，但我似乎无法解开它。
nlp - 是否可以将单词附加到现有的 OpenNLP POS 语料库/模型？
有没有办法训练现有的 Apache OpenNLP POS Tagger 模型？我需要为特定于我的应用程序的模型添加更多专有名词。当我尝试使用以下命令时: opennlp POSTaggerTrain
python - 在 python 中创建一个 "virtual"语料库
我需要从一个巨大的数据帧(或任何与 r 数据帧等效的 python)创建一个语料库，方法是将它分成与用户名一样多的数据帧。例如，我从这样的数据框开始: username search_term
python - 使用 NLTK 导入外部树库式 BLLIP 语料库
我已经下载了 BLLIP语料库并想将其导入 NLTK。问题的答案中描述了我发现的一种方法 How to read corpus of parsed sentences using NLTK in py
r - 如何从具有多列文本的 data.frame 创建 quanteda 语料库？
假设我有以下内容: x10 = data.frame(id = c(1,2,3),vars =c('top','down','top'), text1=c('this is text','s
r - 如何制作 1 亿条推文的 R tm 语料库？
我想使用 R 的分布式计算 tm 包(称为 tm.plugin.dc)制作一个包含 1 亿条推文的文本语料库。这些推文存储在我笔记本电脑上的一个大型 MySQL 表中。我的笔记本电脑很旧，所以我使用的
installation - 以编程方式安装 NLTK 语料库/模型，即无需 GUI 下载器？
我的项目使用NLTK。如何列出项目的语料库和模型要求以便自动安装它们？我不想点击 nltk.download() GUI，一一安装软件包。此外，有什么方法可以卡住相同的需求列表(例如pip free
pytorch - 如何将 .txt 文件(语料库)读入 pytorch 中的 torchtext？
如何在pytorrch中读入.txt文件(语料库)到torchtext？我只看到 data.Dataset 的示例数据集和 data.TabularData 的 csv、json 和 tsv。 ht
machine-learning - 如何在 python crfsuite 中使用 Conll 2003 语料库
我已经下载了 Conll 2003 语料库(“eng.train”)。我想用它来使用 python crfsuite 训练来提取实体。但我不知道如何加载这个文件进行训练。我找到了这个示例，但它不适用
python - 使用 NLTK ieer 或 conll2000 语料库训练 NER 语料库
我一直在尝试为特定领域和新实体训练命名实体识别模型。似乎没有一个完整的适合此的管道，并且需要使用不同的包。我想给NLTK一个机会。我的问题是，如何训练 NLTK NER 使用 ieer 语料库对新实
python - 无法在 AWS EMR 上下载 nltk 语料库，对已关闭文件进行 I/O 操作
使用 JupyterLab 打开我的 EMR 集群后。我无法使用 nltk.download() 下载额外的语料库。代码 nltk.download('wordnet') 错误 I/O operat
NLP:构建(小型)语料库，或 "Where to get lots of not-too-specialized English-language text files?"
有没有人建议在哪里可以找到用于小型语料库的日常英语文本的文件或集合？我一直在使用 Gutenberg Project 书籍作为工作原型(prototype)，并希望融入更多现代语言。一个 recent

首页

博学

6Ren·AI

商城

python - 使用 NLTK ieer 或 conll2000 语料库训练 NER 语料库