java - 如何为 OpenNLP 准备训练数据以对包含多个单词的标记进行标记？-6ren

java - 如何为 OpenNLP 准备训练数据以对包含多个单词的标记进行标记？

转载作者：塔克拉玛干更新时间：2023-11-02 20:22:43

26

4

在某些语言中(例如:越南语)，某些词汇表由多个单词组成。这样一来，一些包含多个单词的标记可以被标记化，而不仅仅是使用空格。

我有以下输入:

Người dân địa phương đã nhiều lần báo Điện lực Bến Tre nhưng chưa được giải quyết .

预期输出:

["Người dân", "địa phương",  "đã", "nhiều", "lần", "báo", "Điện lực",  "Bến Tre", "nhưng", "chưa", "được", "giải quyết"]

训练数据我有_连接需要粘在一起的词:

Người_dân địa_phương đã nhiều lần báo Điện_lực Bến_Tre nhưng chưa được giải_quyết .

这是我用来训练的命令行

opennlp TokenizerTrainer -model "model/vi-token.bin" -alphaNumOpt 1 -lang "vi" -data "data/merge_vlsp_removehtml" -encoding "UTF-8" -params param/wordseg.param

带参数

Iterations=1000

但是，输出无法连接一个标记中的多个单词，而是用空格分隔。

命令我运行以获得输出

opennlp TokenizerME model/vi-token.bin < sample/sample_text > sample/sample_text.out

我应该如何处理我们的配置参数的训练数据来训练每个标记有多个单词的分词器？

最佳答案

与其使用下划线进行训练，不如使用标签。 OpenNLP 使用标签作为训练的引用。按照 NER 的说明进行操作并训练您的分词器。

opennlp 提供了“TokenizerTrainer”工具来训练数据。 OpenNLP 格式每行包含一个句子。您还可以指定由空格或特殊标记分隔的标记。

可以关注this出于各种目的在 opennlp 中抢先一步的博客。该帖子将向您展示如何创建训练文件和构建新模型。

您可以使用 modelbuilder addon 轻松创建自己的训练数据集并遵循这里提到的一些规则来训练创造一个好的NER model .

您可以使用模型构建器插件找到一些帮助 here .

基本上，您将所有信息放在一个文本文件中，而将 NER 实体放在另一个文件中。该插件搜索特定实体并将其替换为所需的标签。因此产生标记数据。这个工具一定非常容易使用!

另外，关注mr. markg's回答以了解如何自行创建新模型。这将帮助您构建自己的模型，这些模型可以针对您的应用程序进行定制。

希望这对您有所帮助!

关于java - 如何为 OpenNLP 准备训练数据以对包含多个单词的标记进行标记？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/51376469/

26

4

0

文章推荐： ios - 在后台线程中恢复 NSManagedObject 关系

文章推荐： iphone - iPhone 读取视频帧时出现内存问题

文章推荐： java - 为什么 BufferedReader 的默认 char 缓冲区大小是 8192？

opennlp - 如何为 opennlp 解析器创建我们自己的训练数据
我是 opennlp 的新手，需要帮助来自定义解析器我使用了带有预训练模型 en-pos-maxtent.bin 的 opennlp 解析器，用相应的语音部分标记新的原始英语句子，现在我想自定义标签
opennlp - 使用 openNLP 识别命名实体(默认模型)
谁能指出 openNLP NameFinder 模块使用的算法？代码很复杂，而且文档很少，并且作为一个黑盒(提供默认模型)使用它给我的印象是它主要是启发式的。以下是输入和输出的一些示例: 输入:
opennlp - 使用 OpenNLP POSTagger 时配置文件数据流的格式无效
我收到无效格式异常。我看到有人建议从 en-pos-maxent.bin 文件中删除 tags.tagdict 文件，但我不知道该怎么做。谁能给我解释一下 ava.io.FileInputSt
opennlp - 使用 OpenNLP POSTagger 时，Profile 数据流的格式无效
我收到无效格式异常。我看到有人建议从 en-pos-maxent.bin 文件中删除 tags.tagdict 文件，但我不知道该怎么做。谁能给我解释一下吗 ava.io.FileInputS
java - Apache OpenNLP : java. io.FileInputStream 无法转换为 opennlp.tools.util.InputStreamFactory
我正在尝试使用 Apache OpenNLP 1.7 构建自定义 NER。来自可用文档 Here ，我开发了如下代码 import java.io.BufferedOutputStream; impo
OpenNLP 和同义词数据库
我们有组织名称同义词的数据库(例如 BT 是 British Telecom。我们使用 OpenNLP 从文本块中提取实体和关键字。有没有办法告诉 OpenNLP 使用我们的数据库数据(例如，如果它找
nlp - OpenNLP:无法识别外国名称
我刚开始使用 openNLP 来识别名称。我正在使用开放 NLP 附带的模型 (en-ner-person.bin)。我注意到虽然它可以识别我们、英国和欧洲的名字，但它无法识别印度或日本的名字。我的问
nlp - OpenNLP 词形还原示例
有谁知道我在哪里可以找到如何在 OpenNLP 库中使用 SimpleLemmatizer() 类的示例，以及在哪里可以找到示例英语词典？文档中似乎缺少它。最佳答案您可以从这里下载字典 - en-
java - OpenNLP 的解析器标签
有没有关于 OpenNLP 中解析器标签含义的文档？我知道 POS 标签类型遵循 TreeBank 约定，但不幸的是我没有找到有关解析器标签的任何信息，例如“SBAR”等。该文档是否存在于某处还是我
java - OpenNLP 创建注释器
我以前用过Stanford CoreNLP，这次想研究一下OpenNLP。是否可以创建自己的注释器？例如，我想分析文本并仅挑选颜色或飞机名称。斯坦福 NER 让我创建自己的 NER 模型来实现此目的
java - 自定义模型训练 opennlp
您好，已经引用过 this , this , this和 this但仍然发现构建自定义名称查找器模型很困难..这是代码: public class CustomClassifierTrainer {
java - OpenNLP 提取语法
我目前正在浏览 opennlp 源代码，试图找到/理解它们用于分块的语法。这不是最简单的任务之一。我开始研究 chunkermodel 和相关的类，但还没有走得太远...... 有人搜过这个吗？如果有
java - OpenNLP - 对字符串数组进行标记
我正在尝试使用 OpenNLP 标记器对文本文件进行标记。我所做的，我读取 .txt 文件并将其存储在列表中，想要迭代每一行，标记该行并将标记化的行写入新文件。行中: tokens[i] = tok
java - opennlp 上的嵌套标签
嘿，我正在尝试为 opennlp 制作训练数据来检测句子中的位置名称。我陷入了这样的困境: North Manchester Hospital 我确实需要检测这两个对象，医院名称和城市名称。我
java - OpenNLP 语句训练示例
我正在尝试使用官方 OpenNLP 网站手册示例来训练新模型，示例如下: Charset charset = Charset.forName("UTF-8"); ObjectStrea
java - 参数个数必须始终为偶数 : opennlp
我一直在尝试使用命令行界面来训练我的模型，如下所示: opennlp TokenNameFinderTrainer -model en-ner-pincode.bin -iterations 500
java - OpenNLP 模型构建器插件无法继续
我正在使用 OpenNLP 的模型构建器插件来创建更好的 NER 模型。据此post ，我使用了markg发布的代码: public class ModelBuilderAddonUse { pr
java - OpenNLP 有词干分析器吗？
我正在做一个项目，我正在使用 OpenNLP 的一些功能。我需要的一个功能是词干分析器。我用谷歌搜索了一下，发现据说它在 opennlp.tools.stemmer 包中有一个 Porter 词干分析
java - 使用多个模型进行实体提取——OpenNLP
我有两个模型文件:1)en-politicians-ner.bin 2)en-engineers-ner.bin 现在，有没有办法将这两个模型添加到一个单个 NameFinderME 对象中。使用这两
java - 如何检测多组词 OpenNLP
我正在使用 Java OpenNLP 进行 NER，但我不确定如何使用我训练过的自定义模型来检测多个单词(例如 New York、Bruno Mars、Hong Kong)。我的训练数据确实涵盖了多

首页

博学

6Ren·AI

商城

java - 如何为 OpenNLP 准备训练数据以对包含多个单词的标记进行标记？