- Java 双重比较
- java - 比较器与 Apache BeanComparator
- Objective-C 完成 block 导致额外的方法调用?
- database - RESTful URI 是否应该公开数据库主键?
我正在尝试使用 Apache OpenNLP 1.7 构建自定义 NER。来自可用文档 Here ,我开发了如下代码
import java.io.BufferedOutputStream;
import java.io.FileInputStream;
import java.io.FileOutputStream;
import java.io.IOException;
import java.nio.charset.Charset;
import opennlp.tools.namefind.NameFinderME;
import opennlp.tools.namefind.NameSample;
import opennlp.tools.namefind.NameSampleDataStream;
import opennlp.tools.namefind.TokenNameFinderFactory;
import opennlp.tools.namefind.TokenNameFinderModel;
import opennlp.tools.util.ObjectStream;
import opennlp.tools.util.PlainTextByLineStream;
import opennlp.tools.util.TrainingParameters;
public class PersonClassifierTrainer {
static String modelFile = "/opt/NLP/data/en-ner-customperson.bin";
public static void main(String[] args) throws IOException {
Charset charset = Charset.forName("UTF-8");
**ObjectStream<String> lineStream = new PlainTextByLineStream(new FileInputStream("/opt/NLP/data/person.train"), charset);**
ObjectStream<NameSample> sampleStream = new NameSampleDataStream(lineStream);
TokenNameFinderModel model;
TokenNameFinderFactory nameFinderFactory = null;
try {
model = NameFinderME.train("en", "person", sampleStream, TrainingParameters.defaultParams(),
nameFinderFactory);
} finally {
sampleStream.close();
}
BufferedOutputStream modelOut = null;
try {
modelOut = new BufferedOutputStream(new FileOutputStream(modelFile));
model.serialize(modelOut);
} finally {
if (modelOut != null)
modelOut.close();
}
}
}
上面突出显示的代码显示 - 'Cast argument 'file' to 'insputstreamfactory'
我不得不强制转换它,否则它会显示错误。
现在,当我运行我的代码时,出现以下错误
java.io.FileInputStream cannot be cast to opennlp.tools.util.InputStreamFactory
这里有什么遗漏吗?
编辑 1:Person.train 文件有这个数据
<START:person> Hardik <END> is a software Professional.<START:person> Hardik works at company<END> and <START:person> is part of development team<END>. <START:person> Hardik<END> lives in New York
<START:person> Hardik<END> loves R statistical software
<START:person> Hardik<END> is a student at ISB
<START:person> Hardik<END> loves nature
Edit2:我现在遇到空指针异常,有什么帮助吗?
最佳答案
您需要一个 InputStreamFactory
实例,它将检索您的 InputStream
。此外,TokenNameFinderFactory
不能为 null
。
public class PersonClassifierTrainer {
static String modelFile = "/opt/NLP/data/en-ner-customperson.bin";
public static void main(String[] args) throws IOException {
InputStreamFactory isf = new InputStreamFactory() {
public InputStream createInputStream() throws IOException {
return new FileInputStream("/opt/NLP/data/person.train");
}
};
Charset charset = Charset.forName("UTF-8");
ObjectStream<String> lineStream = new PlainTextByLineStream(isf, charset);
ObjectStream<NameSample> sampleStream = new NameSampleDataStream(lineStream);
TokenNameFinderModel model;
TokenNameFinderFactory nameFinderFactory = new TokenNameFinderFactory();
try {
model = NameFinderME.train("en", "person", sampleStream, TrainingParameters.defaultParams(),
nameFinderFactory);
} finally {
sampleStream.close();
}
BufferedOutputStream modelOut = null;
try {
modelOut = new BufferedOutputStream(new FileOutputStream(modelFile));
model.serialize(modelOut);
} finally {
if (modelOut != null)
modelOut.close();
}
}
}
编辑 1:Person.train 文件有这个数据
<START:person> Hardik <END> is a software Professional.<START:person> Hardik works at company<END> and <START:person> is part of development team<END>. <START:person> Hardik<END> lives in New York
<START:person> Hardik<END> loves R statistical software
<START:person> Hardik<END> is a student at ISB
<START:person> Hardik<END> loves nature
关于java - Apache OpenNLP : java. io.FileInputStream 无法转换为 opennlp.tools.util.InputStreamFactory,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/41699913/
我是 opennlp 的新手,需要帮助来自定义解析器 我使用了带有预训练模型 en-pos-maxtent.bin 的 opennlp 解析器,用相应的语音部分标记新的原始英语句子,现在我想自定义标签
谁能指出 openNLP NameFinder 模块使用的算法? 代码很复杂,而且文档很少,并且作为一个黑盒(提供默认模型)使用它给我的印象是它主要是启发式的。 以下是输入和输出的一些示例: 输入:
我收到无效格式异常。我看到有人建议从 en-pos-maxent.bin 文件中删除 tags.tagdict 文件,但我不知道该怎么做。谁能给我解释一下 ava.io.FileInputSt
我收到无效格式异常。我看到有人建议从 en-pos-maxent.bin 文件中删除 tags.tagdict 文件,但我不知道该怎么做。谁能给我解释一下吗 ava.io.FileInputS
我正在尝试使用 Apache OpenNLP 1.7 构建自定义 NER。来自可用文档 Here ,我开发了如下代码 import java.io.BufferedOutputStream; impo
我们有组织名称同义词的数据库(例如 BT 是 British Telecom。我们使用 OpenNLP 从文本块中提取实体和关键字。有没有办法告诉 OpenNLP 使用我们的数据库数据(例如,如果它找
我刚开始使用 openNLP 来识别名称。我正在使用开放 NLP 附带的模型 (en-ner-person.bin)。我注意到虽然它可以识别我们、英国和欧洲的名字,但它无法识别印度或日本的名字。我的问
有谁知道我在哪里可以找到如何在 OpenNLP 库中使用 SimpleLemmatizer() 类的示例,以及在哪里可以找到示例英语词典?文档中似乎缺少它。 最佳答案 您可以从这里下载字典 - en-
有没有关于 OpenNLP 中解析器标签含义的文档?我知道 POS 标签类型遵循 TreeBank 约定,但不幸的是我没有找到有关解析器标签的任何信息,例如“SBAR”等。 该文档是否存在于某处还是我
我以前用过Stanford CoreNLP,这次想研究一下OpenNLP。是否可以创建自己的注释器?例如,我想分析文本并仅挑选颜色或飞机名称。 斯坦福 NER 让我创建自己的 NER 模型来实现此目的
您好,已经引用过 this , this , this和 this但仍然发现构建自定义名称查找器模型很困难..这是代码: public class CustomClassifierTrainer {
我目前正在浏览 opennlp 源代码,试图找到/理解它们用于分块的语法。这不是最简单的任务之一。我开始研究 chunkermodel 和相关的类,但还没有走得太远...... 有人搜过这个吗?如果有
我正在尝试使用 OpenNLP 标记器对文本文件进行标记。我所做的,我读取 .txt 文件并将其存储在列表中,想要迭代每一行,标记该行并将标记化的行写入新文件。 行中: tokens[i] = tok
嘿,我正在尝试为 opennlp 制作训练数据来检测句子中的位置名称。我陷入了这样的困境: North Manchester Hospital 我确实需要检测这两个对象,医院名称和城市名称。我
我正在尝试使用官方 OpenNLP 网站手册示例来训练新模型,示例如下: Charset charset = Charset.forName("UTF-8"); ObjectStrea
我一直在尝试使用命令行界面来训练我的模型,如下所示: opennlp TokenNameFinderTrainer -model en-ner-pincode.bin -iterations 500
我正在使用 OpenNLP 的模型构建器插件来创建更好的 NER 模型。据此post ,我使用了markg发布的代码: public class ModelBuilderAddonUse { pr
我正在做一个项目,我正在使用 OpenNLP 的一些功能。我需要的一个功能是词干分析器。我用谷歌搜索了一下,发现据说它在 opennlp.tools.stemmer 包中有一个 Porter 词干分析
我有两个模型文件:1)en-politicians-ner.bin 2)en-engineers-ner.bin 现在,有没有办法将这两个模型添加到一个单个 NameFinderME 对象中。使用这两
我正在使用 Java OpenNLP 进行 NER,但我不确定如何使用我训练过的自定义模型来检测多个单词(例如 New York、Bruno Mars、Hong Kong)。 我的训练数据确实涵盖了多
我是一名优秀的程序员,十分优秀!