solr - 如何使 Solr 拼写检查器更正拉丁语和西里尔语单词？-6ren

solr - 如何使 Solr 拼写检查器更正拉丁语和西里尔语单词？

转载作者：行者123 更新时间：2023-12-04 12:54:23

我允许用户用拉丁字母输入俄语单词。如果用户在拉丁字母中拼错了俄语单词，我希望 Solr 拼写检查器用西里尔字母建议正确的单词(索引中的俄语单词是西里尔字母)。但是，如果用户拼错的不是俄语单词(例如品牌名称)，则应使用拉丁字母进行更正(索引中的俄语单词不是拉丁语)。

例如，tilevizor smasung应该固定为 телевизор samsung
现在我使用以下配置:

<fieldType name="spell_ru" class="solr.TextField" positionIncrementGap="100" omitNorms="true">
    <analyzer type="query">
        <tokenizer class="solr.StandardTokenizerFactory"/>
        <filter class="solr.LowerCaseFilterFactory"/>
        <filter class="solr.ICUTransformFilterFactory" id="Any-Cyrillic; NFD; [^\p{Alnum}] Remove" />
    </analyzer>
    <analyzer type="index">
        <tokenizer class="solr.StandardTokenizerFactory"/>
        <filter class="solr.LowerCaseFilterFactory"/>
        <filter class="solr.LengthFilterFactory" min="3" max="256" />
    </analyzer>
</fieldType>

它将查询转换为西里尔字母，因此俄语单词更正有效。但拉丁语没有。 ( tilevizor 到 телевизор 有效，但 smasung 到 samsung 无效)。

任何想法，我怎样才能让拼写检查器纠正西里尔字母和拉丁语单词？

最佳答案

我认为，可以在这里提供帮助的解决方案是 Beider-Morse 语音匹配 (BMPM)

Beider-Morse Phonetic Matching (BMPM) is a "soundalike" tool that lets you search using a new phonetic matching system.

因此，例如单词 'tilevizor' 和 'телевизор' 听起来很像，我们会得到匹配。可以调整的是语音匹配算法。 Solr 是 supporting其中有很多，我不确定哪一个会表现得更好:DoubleMetaphone、Metaphone、Soundex、RefinedSoundex、Caverphone (v2.0)、ColognePhonetic 或 Nysiis。

另外，我想更新 solr.ICUTransformFilterFactory与 id="Russian-Latin/BGN" ，它可以更好地将俄语符号转换为拉丁语符号。

    <fieldType name="spell_ru" class="solr.TextField" positionIncrementGap="100" omitNorms="true">
        <analyzer type="query">
            <tokenizer class="solr.StandardTokenizerFactory"/>
            <filter class="solr.LowerCaseFilterFactory"/>
            <filter class="solr.ICUTransformFilterFactory" id="Russian-Latin/BGN"/>
            <filter class="solr.PhoneticFilterFactory" encoder="Caverphone"/>
        </analyzer>
        <analyzer type="index">
            <tokenizer class="solr.StandardTokenizerFactory"/>
            <filter class="solr.LowerCaseFilterFactory"/>
            <filter class="solr.ICUTransformFilterFactory" id="Russian-Latin/BGN"/>
            <filter class="solr.PhoneticFilterFactory" encoder="Caverphone"/>
        </analyzer>
    </fieldType>

上面的 fieldType 在很多情况下都可以解决问题，例如

q=title:tilevizor
SolrDocument{title=телевизор samsung, _version_=1583123812650582016}
SolrDocument{title=televizor самсунг, _version_=1583123812667359232}

q=title:тилевизор
SolrDocument{title=телевизор samsung, _version_=1583123812650582016}
SolrDocument{title=televizor самсунг, _version_=1583123812667359232}

q=title:smasung
SolrDocument{title=телевизор samsung, _version_=1583123812650582016}
SolrDocument{title=televizor самсунг, _version_=1583123812667359232}
SolrDocument{title=гэлакси samsung, _version_=1583123812684136448}
SolrDocument{title=galaxy самсунг, _version_=1583123812684136449}

我创建了以下测试类 here ，随意玩这个。

关于solr - 如何使 Solr 拼写检查器更正拉丁语和西里尔语单词？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/20350714/

文章推荐： php - SSH 到动态远程服务器并运行命令 - Laravel 5.8

文章推荐： coding-style - 评论横幅/标题最佳实践/示例？

java - 使用 icu4j 格式化数字(拼写)
我想通过用语言环境拼写数字来本地化数字，最后使用了 ICU4J。我在许多地区都取得了成功，但似乎没有在格鲁吉亚、土耳其或阿拉伯语等地区完成。 ULocale locale = new ULocale(
swagger - 为定义的 Swagger 路由提供备用(国际)拼写
我正在研究具有端点的 swagger API 规范: /authorizations 我也想为这个端点定义一个替代拼写(授权)。这可能吗？或者我是否需要为每个拼写定义一个单独的路由？ /authori
swagger - 为定义的 Swagger 路由提供备用(国际)拼写
我正在研究具有端点的 swagger API 规范: /authorizations 我也想为这个端点定义一个替代拼写(授权)。这可能吗？或者我是否需要为每个拼写定义一个单独的路由？ /authori
yahoo-boss-api - 如何在 Yahoo BOSS 上获得更好的建议(拼写)？
我使用 Yahoo BOSS 的时间很短。这是一个简单的搜索 API，但拼写建议支持确实不那么强大。周围的人是否有任何关于在 BOSS 上获得更好的拼写建议的想法。最佳答案不幸的是，甚至在几年后，
c++ - 从 C/C++ 程序调用 OpenOffice 拼写/语法检查
问题如下:我正在编写一个强力解密器来破解一些 super secret 代码(这是一场竞赛，而不是犯罪)，结果证明这是不可能的:树中的节点太多需要被搜查。为了克服这个问题，我认为检查中间“解决方案”以
c# - 通过 C# 访问 Google 拼写/建议 API
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

solr - 如何使 Solr 拼写检查器更正拉丁语和西里尔语单词？