nlp - 斯坦福 NLP CoreNLP 不对中文进行句子分割-6ren

nlp - 斯坦福 NLP CoreNLP 不对中文进行句子分割

转载作者：行者123 更新时间：2023-12-01 22:29:40

24

4

我的环境:

CoreNLP 3.5.1
stanford-chinese-corenlp-2015-01-30-models
中文默认属性文件:StanfordCoreNLP-chinese.properties
- 注释器 = 分段、ssplit

<小时/>

我的测试文本是“这是第一个句子。这是第二个句子。”我从

得到句子

val sentences = annotation.get(classOf[SentencesAnnotation])
for (sent <- sentences) {
  count+=1
  println("sentence{$count} = " + sent.get(classOf[TextAnnotation]))
}

它总是将整个测试文本打印为一个句子，而不是预期的两个句子:

sentence1 = 這是第一個句子。這是第二個句子。

预期是:

expected sentence1 = 這是第一個句子。
expected sentence2 = 這是第二個句子。

<小时/>

如果我添加更多属性，即使结果相同:

ssplit.eolonly = false
ssplit.isOneSentence = false
ssplit.newlineIsSentenceBreak = always
ssplit.boundaryTokenRegex = [.]|[!?]+|[。]|[！？]+

<小时/>

CoreNLP 日志是

Registering annotator segment with class edu.stanford.nlp.pipeline.ChineseSegmenterAnnotator
Adding annotator segment
Loading Segmentation Model [edu/stanford/nlp/models/segmenter/chinese/ctb.gz]...Loading classifier from edu/stanford/nlp/models/segmenter/chinese/ctb.gz ... Loading Chinese dictionaries from 1 files:
  edu/stanford/nlp/models/segmenter/chinese/dict-chris6.ser.gz

loading dictionaries from edu/stanford/nlp/models/segmenter/chinese/dict-chris6.ser.gz...Done. Unique words in ChineseDictionary is: 423200
done [56.9 sec].
done. Time elapsed: 57041 ms
Adding annotator ssplit
Adding Segmentation annotation...output: [null, null, null, null, null, null, null, null, null, null, null, null, null, null, null, null]
INFO: TagAffixDetector: useChPos=false | useCTBChar2=true | usePKChar2=false
INFO: TagAffixDetector: building TagAffixDetector from edu/stanford/nlp/models/segmenter/chinese/dict/character_list and edu/stanford/nlp/models/segmenter/chinese/dict/in.ctb
Loading character dictionary file from edu/stanford/nlp/models/segmenter/chinese/dict/character_list
Loading affix dictionary from edu/stanford/nlp/models/segmenter/chinese/dict/in.ctb
這是第一個句子。這是第二個句子。
--->
[這是, 第一, 個, 句子, 。, 這是, 第二, 個, 句子, 。]
done. Time elapsed: 419 ms

我曾经见过someone得到以下日志(CoreNLP 3.5.0)；但奇怪的是我没有这个日志:

Adding annotator ssplit edu.stanford.nlp.pipeline.AnnotatorImplementations:ssplit.boundaryTokenRegex=[.]|[!?]+|[。]|[！？]+

<小时/>

有什么问题吗？有解决方法吗？如果无法解析，我可以自己拆分它，但我不知道如何将我的拆分集成到 CoreNLP 管道中。

最佳答案

好的，我解决了这个问题。

自己定义 ssplit 注释器。

为了方便起见，我在这里对参数进行了硬编码，尽管正确的方法应该解析 Prop 。

class MyWordsToSentencesAnnotator extends WordsToSentencesAnnotator(
  true,
  "[.]|[!?]+|[。]|[！？]+",
  null,
  null,
  "never") {
  def this(name: String, props: Properties) { this() }
}

并在属性文件中指定类。

customAnnotatorClass.myssplit = ...

<小时/>

显然，我猜默认的 CoreNLP Pipeline 设置或代码有错误？

关于nlp - 斯坦福 NLP CoreNLP 不对中文进行句子分割，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/29542569/

24

4

0

文章推荐： java - 我们必须关闭 session 对象吗？

文章推荐： java - 将词频添加到哈希表

nlp - 阿拉伯语词形还原和斯坦福 NLP
我尝试进行词形还原，即识别动词的词形和可能的阿拉伯语词根，例如: يتصل ==> lemma(动词的不定式)==> اتصل ==> root(三字根/Jidr thoulathi) ==> و ص
nlp - NLP 停用词列表
在执行 NLP 或 IR/IE 相关任务时，是否有人们通常用来删除标点符号和关闭类别词(例如 he, she, it)的停用词列表？我一直在尝试使用 gibbs 抽样来进行词义消歧的主题建模，并且它
nlp - NLP:找到单词之间语义相似性的简便方法好吗？
我不知道StackOverflow是否涵盖NLP，所以我来试试。我有兴趣从特定 Realm 中找到两个词的语义相关性，即“图像质量”和“噪声”。我正在做一些研究，以确定相机的评论对于相机的特定属性是
nlp - NLP:有效比较和识别文本之间趋势的方法
是否有算法或方法可以评估文本项之间的共同趋势/主题？例如，假设有四个数据点(文本条目): “我发现学校今天压力很大” “物理测试非常容易。” “我的物理测试根本没有挑战” “每个人都提早离开了，因为
nlp - NLP 中专有名词识别策略
我有兴趣了解有关 Natural Language Processing 的更多信息(NLP)并且我很好奇目前是否有任何不基于字典识别的策略来识别文本中的专有名词？另外，任何人都可以解释或链接到解释当
nlp - NLP 中词汇特征和正字法特征的区别？
特征用于模型训练和测试。自然语言处理中的词汇特征和正字法特征有什么区别？例子首选。最佳答案我不知道这样的区别，大多数时候当人们谈论词汇特征时，他们谈论的是使用这个词本身，而不是仅使用其他特征，即它
nlp - 为什么我们在 NLP 任务中进行填充？
在 NLP 任务中，人们用 SOC(句子开头)和 EOC(句子结尾)注释句子是很常见的。他们为什么这样做？这是一个任务相关的表现吗？例如，您在 NER 问题中进行填充的原因与您在翻译问题中进行填充的
nlp - 最佳 NLP 文本编辑器
我一直在研究 NLP 并使用 notepad++ 来处理文本文件。这很好，在某些情况下，但问题是无法使用包含大量文本的大型文件进行锻炼。 VIM 不支持 UTF-8。哪一个是最好的支持 unicode
nlp - 使用(NLP)门工具命名实体
关闭。这个问题需要更多focused .它目前不接受答案。想改善这个问题吗？更新问题，使其仅关注一个问题 editing this post . 3年前关闭。 Improve this questi
nlp - 具有共同语义意义的斯坦福 NLP 解析器和习语
我在 Stanford CoreNLP demo page 中解析了以下句子和 Stanford parser demo page .尽管两者都会导致可以暗示目的语义的解析(相应地取决于 advcl
nlp - 语义网和 NLP 的区别？
语义网和自然语言处理之间究竟有什么区别？语义网是自然语言处理的一部分吗？最佳答案这是两个独立的学科领域，但它们在某些地方确实重叠。因为文档，无论其格式如何，都是由异构语法和语义组成的，所以目标是
nlp - 使用 NLP 技术从非结构化文本创建简单的概念图
我需要解析非结构化文本并将相关概念转换为格式，以便所有三元组可以合并形成一个图。例如如果我有 2 个句子，比如 A improves B 和 B improves C，我应该能够创建一个像这样的图 A
nlp - GATE 如何将本体用于 NLP？
使用 GATE 时，本体在自然语言处理中的作用是什么？据我了解，在较高层次上，本体允许对由类、它们的实例、这些实例的属性以及域中类之间的关系组成的域进行建模。但是，在使用 GATE 时创建自定义本
nlp - 如何开始使用 NLP 进行文本摘要项目？
我最后一年的工程项目要求我使用 Java 或 Python 构建一个应用程序，该应用程序使用自然语言处理来总结文本文档。我什至如何开始编写这样的应用程序？根据一些研究，我刚刚注意到基于提取的摘要对我
nlp - 使用斯坦福 NLP 检测语言
我想知道是否可以使用 Stanford CoreNLP检测一个句子是用哪种语言写的？如果是这样，这些算法的精确度如何？最佳答案几乎可以肯定，此时斯坦福 COreNLP 中没有语言识别。 “几乎”
stanford-nlp - 如何在商业上使用斯坦福 NLP？
我在一家制造可以与 child 交谈的玩具车的公司工作。我们想使用斯坦福核心 NLP 作为解析器。但是，它以 GPL 许可:他们不允许在商业上使用 NLP。我可以从斯坦福 NLP 小组购买其他许可证吗
nlp - 如何使用 NLP 库从句子中提取谓词和主语？
我想使用 Natural Language Processing Libraries 从句子中找到谓词和主语.这种技术在NLP的世界里有什么名字吗？或者有没有办法做到这一点？ Example : He
nlp - 使用 NLP 的实体识别和情感分析
所以，这个问题可能有点幼稚，但我认为询问 Stackoverflow 的友好人士不会有什么坏处。我现在的公司已经使用第三方 API 进行 NLP 一段时间了。我们基本上对一个字符串进行 URL 编码
nlp - 使用 NLP 进行句子压缩
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 3年前关闭。 Improve thi
nlp - 斯坦福 NLP 解析树格式
这可能是一个愚蠢的问题，但是如何迭代解析树作为 NLP 解析器(如斯坦福 NLP)的输出？它都是嵌套的括号，既不是 array 也不是 dictionary 或我使用过的任何其他集合类型。 (ROOT

首页

博学

6Ren·AI

商城

nlp - 斯坦福 NLP CoreNLP 不对中文进行句子分割