solr - 使用空格、连字符、大小写和标点符号的各种组合进行搜索-6ren

solr - 使用空格、连字符、大小写和标点符号的各种组合进行搜索

转载作者：行者123 更新时间：2023-12-02 05:09:43

32

4

我的架构:

<fieldType name="text" class="solr.TextField" positionIncrementGap="100">
  <analyzer>
    <tokenizer class="solr.WhitespaceTokenizerFactory"/>
    <filter class="solr.StopFilterFactory"
            ignoreCase="true"
            words="stopwords.txt"
            enablePositionIncrements="true"
            />
    <filter class="solr.WordDelimiterFilterFactory"
            generateWordParts="1" generateNumberParts="1"
            catenateWords="1" catenateNumbers="1" catenateAll="0"
            splitOnCaseChange="1" splitOnNumerics="0"/>
    <filter class="solr.LowerCaseFilterFactory"/>
    <filter class="solr.SnowballPorterFilterFactory" language="English"
            protected="protwords.txt"/>
  </analyzer>
</fieldType>

我想要的组合:

"Walmart", "WalMart", "Wal Mart", "Wal-Mart", "Wal-mart"

给定这些字符串中的任何一个，我想找到另一个。

因此，共有 25 种这样的组合，如下所示:

(第一列表示搜索的输入文本，第二列表示预期匹配)

(Walmart,Walmart)
(Walmart,WalMart)
(Walmart,Wal Mart)
(Walmart,Wal-Mart)
(Walmart,Wal-mart)
(WalMart,Walmart)
(WalMart,WalMart)
(WalMart,Wal Mart)
(WalMart,Wal-Mart)
(WalMart,Wal-mart)
(Wal Mart,Walmart)
(Wal Mart,WalMart)
(Wal Mart,Wal Mart)
(Wal Mart,Wal-Mart)
(Wal Mart,Wal-mart)
(Wal-Mart,Walmart)
(Wal-Mart,WalMart)
(Wal-Mart,Wal Mart)
(Wal-Mart,Wal-Mart)
(Wal-Mart,Wal-mart)
(Wal-mart,Walmart)
(Wal-mart,WalMart)
(Wal-mart,Wal Mart)
(Wal-mart,Wal-Mart)
(Wal-mart,Wal-mart)

我的架构的当前限制:

1. "Wal-Mart" -> "Walmart",
2. "Wal Mart" -> "Walmart",
3. "Walmart"  -> "Wal Mart",
4. "Wal-mart" -> "Walmart",
5. "WalMart"  -> "Walmart"

分析器截图:

Analyzer screenshot using initial schema

我尝试了各种过滤器组合来尝试解决这些限制，因此我被以下提供的解决方案迷惑了:Solr - case-insensitive search do not work

虽然它似乎克服了我所面临的限制之一(参见 #5 WalMart -> Walmart)，但它总体上比我之前的情况更糟糕。现在它不适用于以下情况:

(Wal Mart,WalMart), 
(Wal-Mart,WalMart), 
(Wal-mart,WalMart), 
(WalMart,Wal Mart)
besides cases 1 to 4 as mentioned above

架构更改后的分析器: enter image description here

问题:

为什么“WalMart”与我的初始架构不匹配“Walmart”？Solr 分析器清楚地向我显示，它在索引时间内生成了 3 个 token :wal、mart、walmart。在查询期间:它生成了 1 个 token :walmart(虽然不清楚为什么它只生成 1 个 token )，但我无法理解为什么它不匹配，因为 walmart > 包含在查询和索引标记中。
我在这里提到的问题只是一个单一的用例。还有更稍微复杂的，例如:

Words with apostrophes: "Mc Donalds", "Mc Donald's", "McDonald's", "Mc donalds", "Mc donald's", "Mcdonald's"

Words with different punctuations: "Mc-Donald Engineering Company, Inc."

一般来说，针对这种需求对模式进行建模的最佳方法是什么？ NGram ？在不同字段(以不同格式)索引相同数据并使用 copyField 指令( https://wiki.apache.org/solr/SchemaXml#Indexing_same_data_in_multiple_fields )？这对性能有何影响？

编辑:我的 Solr 模式中的默认运算符是 AND。我无法将其更改为 OR。

最佳答案

我们将连字符连接的单词视为一种特殊情况，并编写了一个自定义分析器，用于在索引时创建此 token 的三个版本，因此在您的情况下，wal-mart 将变为 walmart、wal mart 和 wal-mart。每个同义词都是使用自定义 SynonymFilter 编写的，该过滤器最初改编自 Lucene in Action 书中的示例。 SynonymFilter 位于空白分词器和小写分词器之间。

在搜索时，三个版本中的任何一个都会与索引中的同义词之一匹配。

关于solr - 使用空格、连字符、大小写和标点符号的各种组合进行搜索，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/29783237/

32

4

0

文章推荐： java - 我的Java服务器的相对路径

文章推荐：供多个开发人员共享 iOS Xcode 项目文件

文章推荐： r - 在 R 中为多个因子列创建频率表

文章推荐： R:从向量中提取非重复值(不保留重复值)

java - 正则表达式 30 个数字 + 空格 + 连字符 + 空格 1 个数字
我有这个代码来查找这个模式:201409250200131738007947036000 - 1，在文本内 final String patternStr = "(\\d{
正则表达式删除方括号/空格
我正在尝试使用正则表达式清除一些用户输入，以删除 [ 和 ] 并删除任何大于 1 个空格的空格。但我似乎无法实现我想要的效果。这是我第一次使用正则表达式，所以我对如何写出来有点困惑。 (preg_re
Java正则表达式匹配单词+空格
我正在尝试构建这个简单的正则表达式来匹配 Java 中的单词+空格，但我在尝试解决它时感到困惑。该网站上有很多类似的示例，但答案大多给出了正则表达式本身，而没有解释它是如何构造的。我正在寻找的是形成
Python删除行之间的输入/空格
好吧，我已经阅读了很多建议如何消除多余空间的帖子，但无论出于何种原因，我似乎无法将这些建议应用到我的系统中，所以我在这里寻求您的帮助。这些是我代码的最后几行: for line in rli
javascript - 如何删除某些空的新行/空格
所以我正在我的测试存储上学习网页抓取，但我不确定如何正确地从“sizes”数组中删除空的新行。 const $ = cheerio.load(body) $('div.lis
javascript - 输入表单中不允许有空白字符/空格
这个问题已经有答案了: How to prevent invalid characters from being typed into input fields (8 个回答) 已关闭 9 年前。是
java - 忽略空格、空格
有人知道如何让扫描仪忽略空间吗？我想输入名字和第二个名字，但扫描仪不让我输入，我想保存全名 String name; System.out.print("Enter name: "); name =
VIM:空格/制表符缩进
这个问题在这里已经有了答案: Make Vim show ALL white spaces as a character (23 个回答) 关闭 8 年前。 VIM(使用 Solarized Dar
java - 流标记器、空格
我想使用 StreamTokenizer 从 java 文件中提取名称。我已将空格设置为逗号 inputTokenizer.whitespaceChars(',', ','); 但是，
Java:读取txt文件并将其保存在字符串数组中但不带反斜杠(空格)？
我正在使用此代码逐行读取 txt 文件。 // Open the file that is the first command line parameter FileInputStream fstre
Java 正则表达式 - 空格
我似乎无法弄清楚我需要的正则表达式。这就是我想要实现的目标: {ANY CHAR} + @javax.persistence.Column(name = "{ANY 30 CHARS}") + {AN
StyleCop 和 = 空格
我正在运行 StyleCop(顺便说一句，如果你想提供高质量的代码，我完全推荐它)... 我有这条线 [System.Xml.Serialization.XmlRootAttribute(Namesp
PhpStorm 在每次保存时删除制表符/空格
我刚刚更新到 PhpStorm 2016，我突然注意到，每次我按 Ctrl + S 保存文件时，它都会删除我在测试这段代码后按下以继续编写的空格/制表符。请帮忙，这对我来说很烦人，因为我在每一行代码
c - 输入名称(空格)
关闭。此题需要details or clarity 。目前不接受答案。想要改进这个问题吗？通过 editing this post 添加详细信息并澄清问题. 已关闭 7 年前。 Improve th
c - 删除c程序中的制表符/空格
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。要求提供代码的问题必须表现出对所解决问题的最低限度的了解。包括尝试的解决方案、为什么它们不起作用以及预期结果
路径中的 C# 空格
我已经看过几十个关于这个主题的问题和答案，但我仍然无法解决我的问题。我在我的代码中使用了一个外部 ffmpeg 转换器，我将文件路径作为参数传递，如下所示: OutputPackage oo = c
c - 空格、特殊字符和转义序列
谁能详细解释一下它们是什么以及它们之间的区别。提前致谢。最佳答案转义序列是代表其他内容的字符序列。例如(“\n” = 新行，“\?” = 问号等)。有关更详细的列表，请检查:https://en.
javascript - 从数组中删除换行符/空格
我无法从我的 javascript 文本中删除换行符。这是我正在处理的数据示例: 0: "Christian Pulisic" 1: "↵" 2: "From Wikipedia, the free
java - 从字符串Java的开头和结尾删除新行/空格
我有一个问题 - 我似乎无法从字符串的开头/结尾删除新行/空格。我在正则表达式的开头和结尾使用 \s ，甚至在获取字符串后使用 .trim() ，但无济于事。 public void extractI
用于超链接的变量中的 PHP 空格
我是 php 的新手，我正在尝试将一系列变量添加到 html 超链接中。但是，任何返回空格的变量都会弄乱超链接。 Grants Test

首页

博学

6Ren·AI

商城

solr - 使用空格、连字符、大小写和标点符号的各种组合进行搜索