Solr 语音匹配与实际文本字段-6ren

Solr 语音匹配与实际文本字段

转载作者：行者123 更新时间：2023-12-04 02:40:43

29

4

我对 solr 结果有疑问，我想我应该在这里寻求建议。

我通过包含 <filter class="solr.PhoneticFilterFactory" encoder="RefinedSoundex" inject="true"/> 启用了语音匹配在查询和索引级别，也有编码器 DoubleMetaphone作为变体。

这里的问题是 solr 只返回语音匹配的结果，而忽略了通配符匹配或几乎完全匹配的搜索短语匹配。

例子:

在我的索引中，当我搜索 name:mod 时，我有一个包含名为“名称”的字段和值为“Modenine”的文档，我得到一个“Modenine”，这没问题，

但是当我使用 name:mode 进行搜索时, 注意额外的 'e' , 它返回 'Something Foul Mouth'这是因为，mouth语音匹配mode ，我不介意结果是“口臭”，但我也想看到自 mode 以来的“Modenine”是实际的搜索词。

我想到的最快的解决方案是在索引期间将语音代码添加到索引中，然后使用 dismax 对结果进行排名，例如使用 ^2.0 提供分数。

我有以下内容:字段声明

<field name="phoneticName" type="phonetics" indexed="true" stored="true"/>
<field name="name" type="phonetics" indexed="true" stored="true"/>

用于语音的 FieldType

<fieldType name="phonetics" class="solr.TextField" positionIncrementGap="100" multiValued="true">
    <analyzer type="index"> 
        <filter class="solr.LowerCaseFilterFactory"/>
        <tokenizer class="solr.WhitespaceTokenizerFactory"/>
        <filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt" />
        <filter class="solr.PhoneticFilterFactory" encoder="RefinedSoundex" inject="true"/>
    </analyzer>
    <analyzer type="query">             
        <tokenizer class="solr.WhitespaceTokenizerFactory"/>        
        <filter class="solr.LowerCaseFilterFactory"/>
        <filter class="solr.PhoneticFilterFactory" encoder="RefinedSoundex" inject="true"/>
        <filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt" />       
        <filter class="solr.RemoveDuplicatesTokenFilterFactory"/>               
    </analyzer>
</fieldType>

但是重新索引后，phoneticName 字段只有 name 字段的准确值，它没有存储我要搜索的拼音代码。

我找到了这个 solr-boosting-down-phonetic-variations但没有太多细节。

谢谢

最佳答案

当我输入 mod 作为查询时，我终于让它工作了，我得到了大约 5 个相关结果，包括 modenine。我如何做到这一点是通过使用 Ngram 过滤器，这不是我刚刚发现的东西，事实上，我从一开始就将 Ngram 过滤器添加到 schema.xml 中的过滤器列表中，但从未真正按预期工作。

错误是我在 index 和 query 级别/阶段都应用了 NgramFilter。Ngram 应该只在 index 阶段添加，在查询阶段删除 Ngram 文件管理器后，我得到了所需的结果。

请参阅下面的配置，注意我是如何添加的:solr.RemoveDuplicatesTokenFilterFactory 以从 NGramFilterFactory 过滤器中删除可能的重复项。

<fieldType name="phonetics" class="solr.TextField" positionIncrementGap="100" multiValued="true">
    <analyzer type="index">         
        <filter class="solr.TrimFilterFactory"/>        
        <filter class="solr.NGramFilterFactory" minGramSize="2" maxGramSize="1000" />
        <filter class="solr.EdgeNGramFilterFactory" minGramSize="2" maxGramSize="1000"  />
        <filter class="solr.WordDelimiterFilterFactory" splitOnCaseChange="1" splitOnNumerics="0" 
        generateWordParts="1" stemEnglishPossessive="0" generateNumberParts="0"
        catenateWords="1" catenateNumbers="0" catenateAll="0" preserveOriginal="1"/>
        <filter class="solr.LowerCaseFilterFactory"/>
        <tokenizer class="solr.WhitespaceTokenizerFactory"/>        
        <filter class="solr.DoubleMetaphoneFilterFactory" inject="true"/>
        <filter class="solr.RemoveDuplicatesTokenFilterFactory"/>
    </analyzer>
    <analyzer type="query">     
        <filter class="solr.TrimFilterFactory"/>        
        <filter class="solr.WordDelimiterFilterFactory" splitOnCaseChange="1" splitOnNumerics="0" 
        generateWordParts="1" stemEnglishPossessive="0" generateNumberParts="0"
        catenateWords="1" catenateNumbers="0" catenateAll="0" preserveOriginal="1"/>        
        <tokenizer class="solr.WhitespaceTokenizerFactory"/>        
        <filter class="solr.LowerCaseFilterFactory"/>       
        <filter class="solr.DoubleMetaphoneFilterFactory" inject="true"/>
    </analyzer>
</fieldType>

干杯

巴巴吉德

关于Solr 语音匹配与实际文本字段，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/20003225/

29

4

0

文章推荐： .net - 删除所有附件

文章推荐： vim - 使用参数时语法检查不起作用

文章推荐： prolog - 有人可以逐步描述这个 Prolog 代码吗？

ios - 更改iOS应用中使用按钮播放的“语音”
我有一个说一些短语的音板应用程序，但是现在我希望能够从男声/女声中改变出来，问题是我不知道该怎么做。任何帮助，将不胜感激。我正在使用AVFoundation/AVAudioPlayer播放声音。谢
audio - 语音/音乐分类
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题，以便用事实和引用来回答。关闭 4 年前。
android - 如何在android中连续录制后台音频/语音？
因为我想在后台录制音频，所以我使用了服务..但是我无法在服务中录制音频。我在 Activity 中尝试了相同的代码，它对我有用。但是如何在输入语音/语音时在后台进行录音，这意味着如果有语音输入就应该
c# - 语音/语音转文本
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题，以便用事实和引用来回答。关闭 6 年前。
audio - 用于从音频流中提取单词(语音)的库？
我有一个音频流，我会从中提取单词(语音)。因此，例如使用 audio.wav 我会得到 001.wav、002.wav、003.wav 等，其中每个 XXX.wav 是一个词。我正在寻找一个库或程序
macos - NSSpeechSynthesizer 语音/语言关系
不幸的是，我只能说四种语言，那么如果我知道文本的语言，我如何知道我必须使用哪种 OS X 语音？我在Apple的文档中找不到任何有关它的信息。至少有一张有语音/语言的 table 吗？最佳答案您可
cmd - 来自命令行的 ms 语音
有没有办法从命令行使用 MS Speech 实用程序？我可以在 Mac 上完成，但在 Windows XP 上找不到任何引用。最佳答案我在这个主题上的 2 美分，命令行单行: 在 Win 上使用
javascript - 语音 channel 不设防
所以我开始了我的不和谐机器人的音乐部分。现在，正如我在上一个问题中所做的那样，这里只是音乐命令的片段:Pastebin #1 在显示 if (msg.member.voiceConnection ==
java - 如何在java中听(语音)文本
有谁知道有什么好的 API 或库可以听(语音)文本。我尝试听三种语言的(语音)文本，我想知道最好从哪里开始以及如何开始。我可以对所有三种语言使用通用语音吗？我将使用 eclipse 和 java 作为
c# - 语音 session ——如何让更多人参与进来？
首先，我只是一个爱好者，如果这是一个愚蠢的问题或者我太天真了，我很抱歉。 (这也意味着我买不起昂贵的库) 情况是这样的:我正在使用 C#.NET 构建一个简单的语音聊天应用程序(类似于 Ventril
c - 语音 ip 的服务类型字段集
我正在制作一个模块，可以生成和传输语音 IP 数据包。我知道我必须为服务类型字段设置一些值。这个值是多少？最佳答案该值应该是x。关于c - 语音 ip 的服务类型字段集，我们在Stack Ove
c++ - 文字转语音 SAPI 语音
有人能帮帮我吗？我使用 SAPI 语音文本，但我不能设置女声，这是代码，它用男声说话，但我想改变它，我想要女声 #include "stdafx.h" using namespace std; voi
java - 基于命令(语音)识别的项目
我正在寻找一种方法来为一个项目在 Java 中识别预注册的语音命令，但我还没有想出一个好的方法，我研究了快速傅里叶和处理 wave 文件的不同方法，但我无法决定我应该如何实现它。这个想法很简单，
android - 西类牙语语音(语音)识别
我在 android 的语音识别 API 工作。我是 Speech Recognition Api 的新手，我的要求是西类牙语语音，并从 Android 的语音识别 API 中获得西类牙语的最佳匹配
Java - 将效果应用于 MaryTTS 语音
我在 Java 中使用一组名为(MaryTTS[实际上还有更多])的库来将 text to speech 转换为该目的，使用以下代码: public class TextToSpeech {
javascript - webRTC 音频/语音
我正在尝试使用webRTC和php作为服务器端来实现单向语音传输。查看samples ，我无法理解webRTC机制。在我看来，流程应该是这样的: 调用者和接收者在服务器上注册接收者监听来电调用
c++ - Windows 语音 C++
我的名字是 Joey，我想知道是否有一种在 C++ 中使用语音的方法，如果有人可以给我指出引用资料和书籍，非常感谢...... 最佳答案你应该看看 Windows Text-To-Speech AP
c++ - 从零开始构建 IP 语音
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu
Java 语音 API 空响应
我正在使用 Java 语音识别 API - Jarvis，位于 https://github.com/lkuza2/java-speech-api 但是，当我运行应用程序时，出现错误:服务器返回 HT
c# - 如何将阿拉伯文本转换为 SAMPA 语音？
我们正在做一个需要讲阿拉伯语的项目，我们找到了一个开源工具，Mbrola project , 可以做到这一点。但是，我还需要一些方法将阿拉伯语文本转换为 SAMPA 语音。那么有人可以帮助我将阿拉伯

首页

博学

6Ren·AI

商城

Solr 语音匹配与实际文本字段