- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我需要从文本中分割单词。有时连字符的单词不带连字符,撇号的单词不带撇号。也有类似的问题,例如相同单词的不同拼写问题(例如:颜色、颜色),或单个单词之间有空格(例如:up to、upto、blankspace、blank space)。我需要将这些变体分组为一个单一的表示并将其插入到集合/哈希图或其他地方。没有重音字符的重音字符也可能存在问题(尽管我还没有遇到过)。目前并在任何空格字符和每个非字母数字处剪切单词,然后对它们进行词干处理,并省略停用词。
这些索引稍后将用于文档相似性检查和搜索等。有什么建议可以解决这些问题吗?我想到了一个将扫描的单词与单词列表匹配的想法,但问题是专有名词和非字典单词将被省略。
信息:我的代码是 Java
最佳答案
我认为你应该应用多种技术。
1)对于常见的拼写变体,我会使用基于字典的方法。由于它们很常见,我不会担心丢失非字典单词。那应该解决颜色/颜色问题。
2) 对于拼写错误和其他非标准拼写变体,您可以应用 Metaphone (http://en.wikipedia.org/wiki/Metaphone) 算法将标记转换为其英语发音的表示。相似的变体听起来很相似,因此您可以将它们相互匹配(例如,Jon 到 John)。您还可以在查询期间使用基于编辑距离的匹配算法来匹配非常相似的标记,只有一对并列的字符或一个字符被丢弃(例如,Huseyin 与 Housein)。
3) 对于撇号和中间有连字符的复合词,您可以存储这两种变体。例如,“John's”将被索引为“John s”和“Johns”。 “空白空间”可以转换为(或连同存储)“空白空间”和“空白空间”。
4)对于中间没有任何连字符的复合词,您可以使用外部库,例如 Solr 的 HyphenationCompoundWordTokenFilterFactory 类(http://lucene.apache.org/solr/api/org/apache/solr/analysis/HyphenationCompoundWordTokenFilterFactory.html) .虽然它可以使用字典,但它不是必须的。它的目标是处理在德语和类似语言中经常遇到的复合词。我认为没有理由不能将其应用于英语(您需要提供英语词典和连字规则文件)。
实际上,最后一点提出了一个重要的问题。我认为您无法从头开始构建自己的搜索库。如果这是真的,为什么不使用 Lucene(或基于 Lucene 的 Solr),这是一个基于 Java 的搜索库,它已经拥有处理这些问题的方法和方法?例如,注入(inject)技术允许您在文档的同一位置同时索引颜色和颜色;因此,无论您搜索“有色汽车”还是“有色汽车”(假设您处理词干)都无关紧要。有一些过滤器可以进行语音索引(http://lucene.apache.org/solr/api/org/apache/solr/analysis/PhoneticFilterFactory.html)。甚至还有一个 FuzzyQuery 组件,它允许您允许一定数量的编辑距离来匹配相似的术语(http://lucene.apache.org/core/old_versioned_docs/versions/3_2_0/api/all/org/apache/lucene/搜索/FuzzyQuery.html)
您还需要决定在什么时候处理这些问题:一种极端的方法是在索引期间对这些术语的所有可能变体进行索引,并按原样使用查询。这将使您的查询处理轻松,但会花费您更大的索引(因为您需要存储所有变体)。另一个极端是按原样索引文档并在搜索期间扩展查询。这将允许您以更繁重的查询处理为代价来保持索引精简。语音索引需要您在索引期间处理文档和搜索期间的查询。模糊匹配仅在搜索期间可行,因为您可能无法将所有术语的所有编辑变体存储在索引中。
关于text-processing - 分割单词,并从文本中对带连字符和撇号的单词进行分组,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/9293687/
我目前正在创建一个正则表达式来拆分所有匹配以下格式的字符串:&[text(text - text text) !text]。这里的文本实际上可以是任何字符。并且间距很重要。文本将如图所示列出。 我已经
这个问题在这里已经有了答案: Remove duplicate commas and extra commas at start/end with RegExp in Javascript, and
我有以下代码。 from xml.dom.minidom import Document doc = Document() root = doc.createElement('root') doc.a
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Find text string in jQuery and make it bold 如何使用 jQuer
我使用 libmagic 在我的元素的 Web 界面中获取文件的 MIME 类型。我在 css 和 js 文件上得到文本/纯 mime 类型。 例如 chromium 显示以下警告: Resource
起初我必须阅读很多教程,但我仍然不知道我做错了什么...... 我想内联使用 4 个 div。在我想放置的那些 div 中:文本、图像、文本、文本。我希望中间文本自动设置为最大宽度。 我写了一个简单的
我想替换所有出现的 [b: "text"]至text使用 JavaScript 和 RegEx。目前我知道如何替换 [b: ""]至使用'/\[b: ""\]/g'但我不知道如果 " 之间有文本该怎么
这可能是一个幼稚的问题,但我想知道是否有比使用 text() 更好的方法将文本添加到绘图中。注意,我也在使用 layout()以及。具体来说,我有一个情节的一部分,我想在其中添加一些带有标题的文本,然
我必须反复从 latex 源粘贴代码,因此每次都必须做很多查找和替换操作('“a'=>'ä','” o'=>'ö',...) 。 有没有一种方法可以存储这些搜索和替换规则,例如,我可以通过一次按键执行
当我在Sublime Text 3代码屏幕中编写代码时,它连续地向右滑动,如图所示。我该怎么办? 请注意第10行。 最佳答案 如果您只想为当前 View (正在编辑的当前文件)激活自动换行,只需vie
是否有可能更改 sublime text 中的默认字体目录?我只想使用可移植 sublime 文本存储在我的 pendrive 上的字体,这样我就不必在我使用可移植 sublime 文本的每台机器上安
我是 Android 开发的新手,我有一个愚蠢的问题。如何将“文本字段”框放在一行中的文本旁边。 例子: Please Enter the number: [ ] 关于 "t
我想自动将“我的文本”更改为“我的文本”,因为这是用德语写的正确方式。引号可以在文本中的任何位置。 有没有一种简单的方法可以实现这一点? 解决方案应该检查第一个字符,最后一个字符,比如“this”,或
我想知道是否有特殊的语法来绑定(bind)与现有文本连接的文本。 像这样。 显然,这行不通。 什么是最佳实践? 使用 SL4。 最佳答案 使用StringFormat在 Binding 上。 WPF
我认为它应该打印“真实文本”,因为它相当于 true console.log('true text' || true ? 'text' : 'text1'); 但是,输出是“文本”;抱歉,如果是愚蠢的
有没有办法通过 css 打破文本,以便中间有一个“空白”?目前我正在通过手工打破文本来解决这个问题 -但这是愚蠢的。我知道有一个函数可以让文本在另一个 div 中结束和开始,但 IE 不支持它。 文本
我想为我的Tcl/Tk工具实现一个效果:在text控件中,根据具体情况,希望高亮一些线条的背景色,其他线条正常透明.有可能吗? 我尝试了一些选项,例如:-highlightbackground 、-i
我正在尝试解析原始维基百科文章内容,例如the article on Sweden ,使用re.sub()。但是,我在尝试替换 {{some text}} block 时遇到了问题,因为它们可以包含更
我试图先删除 ComboBox 中的所有内容。然后在其前面添加文本,但保留了一些旧文本。有没有办法重置或清除 ComboBox?或者我怎样才能最好地实现这一目标? public void GetBad
我知道我们应该创建 Example对象并将其传递给 nlp.update() 方法。根据 docs 中的示例, 我们有 for raw_text, entity_offsets in train_da
我是一名优秀的程序员,十分优秀!