python - ElasticSearch term suggest on analyzed field 不返回任何建议-6ren

python - ElasticSearch term suggest on analyzed field 不返回任何建议

转载作者：行者123 更新时间：2023-11-28 19:23:38

27

4

我想使用 ElasticSearch 术语建议功能来更正拼写(您是说...？)。这里是官方documentation :

这是我的(简化为基础)方案:

{
    "settings": {
        "analysis": {
            "filter": {
                "en_stop_filter": { "type": "stop", "stopwords": ["_english_"] },
                "en_stem_filter": { "type": "stemmer", "name": "minimal_english" },
                "de_stop_filter": { "type": "stop", "stopwords": ["_german_"] },
                "de_stem_filter": { "type": "stemmer", "name": "minimal_german" }
            },
            "analyzer": {
                "en_analyzer": { "type": "custom", "tokenizer": "icu_tokenizer", "filter": ["icu_folding", "icu_normalizer", "en_stop_filter", "en_stem_filter"] },
                "de_analyzer": { "type": "custom", "tokenizer": "icu_tokenizer", "filter": ["icu_folding", "icu_normalizer", "de_stop_filter", "de_stem_filter"] }
            }
        }
    },
    "mappings": {
        "blog": {
            "_analyzer": { "path": "my_analyzer", "index": "no" },
            "properties": {
                "title": { "type": "string" },
                "my_analyzer": { "type": "string", "index": "no" }
            }
        },
        "photo": {
            "properties": {
                "tags_en": { "type": "string", "analyzer": "en_analyzer", "index_name": "tag_en" }
                "tags_de": { "type": "string", "analyzer": "de_analyzer", "index_name": "tag_de" }
            }
        }
    }
}

这就是通过 Python/Django 为 a) 我们的博客编制索引的数据:

data = ''
for i, p in enumerate(BlogPost.objects.all()):
    data += '{"index": {"_id": "%s"}}\n' % p.pk
    data += json.dumps({ "my_analyzer": p.language+"_analyzer", "title": p.title })+'\n'
resp = requests.put(ELASTICSEARCH_URL+'blog/_bulk', data=data)

我正在根据每篇博文的语言(p.language = 'de' 或 'en')设置分析器，德语或英语。

我能够(通过 Python)搜索这个索引，并且我确实得到了这些参数返回的拼写建议:

{
  "query": {
    "query_string": {
      "query": q,
      "analyzer": "en_analyzer"
    }
  },
  "suggest": {
    "my_suggestion": {
      "text": q,
      "term": {
        "size": 1,
        "field": "title"
      }
    }
  }
}

然而，我真正需要的是搜索我们的照片方案的拼写建议，它由这个索引(Python/Django):

for p in Photo.objects.all():
    data += '{"index": {"_id": "%s"}}\n' % p.pk
    data += json.dumps({
        "tags_cs": p.tags_en,
        "tags_de": p.tags_de
    })+'\n'
resp = requests.put(ELASTICSEARCH_URL+'photo/_bulk', data=data)

p.tags_en 和 p.tags_de 可以作为逗号分隔的标签字符串或实际的字符串列表进行索引。两者都适用于 ElasticSearch，它似乎对这个问题没有影响。

搜索照片有效，无论是英语还是德语，但没有返回任何拼写建议:

{
  "query": {
    "query_string": {
      "query": q,
      "fields": [
        "tags_en"
      ],
      "analyzer": "en_analyzer"
    }
  },
  "suggest": {
    "my_suggestion": {
      "text": q,
      "term": {
        "size": 1,
        "field": "tags_en"
      }
    }
  }
}

如果我为建议词定义一个分析器，这没有什么区别，如下所示:

{
  "query": {
    "query_string": {
      "query": q,
      "fields": [
        "tags_en"
      ],
      "analyzer": "en_analyzer"
    }
  },
  "suggest": {
    "my_suggestion": {
      "text": q,
      "term": {
        "size": 1,
        "field": "tags_en",
        "analyzer": "en_analyzer"
      }
    }
  }
}

请注意博客文章和照片分析的区别:我们的博客文章每篇文章使用一种语言进行分析。通过方案中的 my_analyzer 字段。然而，我们的照片是按场分析的。我们确实有 20 种语言(这里只显示了两种语言以使代码尽可能小)并且每个标记字段都进行了相应的分析。如果我删除这种类型的照片分析，我也会在那里得到建议，但我们确实需要基于现场的分析器。

所以这个问题一定与分析器有关，但我完全被困住了。有什么想法吗？

最佳答案

一个可行的解决方案/变通方法是简单地在方案中包含一个未分析的字段，并仅匹配该字段的术语建议。它对我们有用，但是没有这些额外数据应该是可能的。

关于python - ElasticSearch term suggest on analyzed field 不返回任何建议，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/18647236/

27

4

0

文章推荐： python - Tkinter:从 Entry 小部件获取数据

文章推荐： javascript - 在 Javascript 中从图像中获取名称

文章推荐： javascript - 通过删除一个参数及其值来清理 URL

文章推荐： HTML 在方形网格图片中指定分隔线间隙测量

.NET 开发人员开始社交网站，建议？
我是一个相对较新的程序员； CS 学士学位，大学毕业大约 2 年，主要使用 C# 中的 .NET。我对 SQL 交互/脚本编写相当流利，并且对 ASP.NET 做了一些工作(主要是维护现有站点)。我
opencv - 动态视频流分析 - 建议？
我计划开发一个简单的解决方案，使我能够即时执行非常基本的视频流分析。我以前从未做过类似的事情，因此这是一个非常笼统和开放的问题。主要重点是检查流是否正常运行，例如 - 卡住帧、黑屏以及音频是否存在。同
关于大型项目的版本控制和避免包含表达式的版本的 Maven 建议
我正在考虑重组一个大型 Maven 项目...... 我们当前结构的基本概述: build [MVN plugins, third party dependency management]:5.1
sql - 查询调优 - 建议
我需要有关附加查询的建议。该查询执行了一个多小时，并根据解释计划进行了全表扫描。我对查询调优还很陌生，希望得到一些建议。首先，为什么我要进行全表扫描，即使我使用的所有列都在其上创建了索引。其次，有
mysql - 一个疯狂的数据库结构 - 建议
我正在做一个项目，我需要在 4 个模型之间创建三个多对多关系。这是它的过程: 常见问题类别可以有许多常见问题子类别，反之亦然。常见问题组可以有许多常见问题的子类别，反之亦然。常见问题可以有许多常见
embedded - 小型嵌入式合成语音库/建议
对于代码大小比语音质量更重要的 PIC 和/或 ARM 嵌入式系统，是否有任何易于使用的免费或廉价的语音合成库？现在似乎 1 meg 的封装被认为是“紧凑的”，但很多微 Controller 都比它小
具有多个有效负载的 Solr 建议
我们正在使用 Solr 建议器功能进行 businessName 查找。当用户输入查询以及匹配的名称时，我们希望 solr 发送来自个人资料的其他属性，如 id、地址、城市、州、国家等字段。我尝试使
Delphi:建议，构建用户界面的想法
我正在构建一个用户界面。我的计划将包括 4 个主要部分: 1) 顶部菜单 - TMainMenu。一个窗口的顶部 2) 主菜单 - TTreeView。一个窗口的左边。 TreeView的每一项=对应
sharepoint - 需要技术推荐/建议
我的公司需要一个任务管理系统来处理从“为X购买一台计算机”到“将一个人转移到另一个国家”这样简单的场景。简单的场景是由一个人处理的单个任务，而更大的任务可以分解为在工作流程中委派给多个人的多个子任务。
marklogic - 内存使用规划 - 建议？
MarkLogic 服务器的林大小与实际内存的建议比率是多少？例如，我目前有一个 190GB 的数据库，并且该数据库随着时间的推移而不断增长。由于数据库会不断增长，我最终需要对该数据库进行集群。因此，
audio - 关于如何解码数据包的线索，建议
去年我收到了一个礼物，它是一个索尼 CMT700Ni 音频站，支持 wifi。它还具有类似于广播的功能，称为“PartyStreaming”。我目前正在挖掘内部，探索它，所以也许我可以结束拥有自己的“
nlp - 如何选择特征选择算法？ - 建议
有没有我可以阅读的研究论文/书籍可以告诉我针对手头的问题哪种特征选择算法最有效。我试图简单地将 Twitter 消息识别为 pos/neg(首先)。我从基于频率的特征选择开始(从 NLTK 书开始)
.net - 需要技术推荐/建议
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的，
java - jUnit - 建议
我正在浏览 stackoverflow 以查找有关使用 jUnit 进行测试的常见建议，但仍然有几个问题。我知道，如果要测试的方法很复杂，最好的方法是将其分成小的单独部分并测试每个部分。但问题是 -
Java Collection 建议
我有一个方法如下 public List> categorize(List customClass){ List> returnValue = new ArrayList<>();
svn - 需要关于使用分支和合并回主干的帮助/建议
我的问题是，当按照下面的程序合并时，在最佳实践场景中，“将分支折叠回主干”程序的最后一步是正确的方法吗？我已经使用 svn 很多年了。在我的个人项目中，我总是毫不犹豫地在主干上愉快地进行修改，并且在
iphone - UINavigationController 建议
我读过 UINavigationController当您想从 n 个屏幕跳转到第一个屏幕时，这是最佳选择。这样做需要以下代码: NSMutableArray *array=[[NSMutableArr
java - 文件输入帮助/建议
我有一个文件输入类。它在构造函数中有一个字符串参数来加载提供的文件名。但是，如果文件不存在，它就会退出。如果文件不存在，我希望它输出一条消息 - 但不确定如何...... 这是类(class): pu
flash - 交互式世界地图 - 建议？
我希望创建一个“您访问过的国家/地区” map - 就像您可能在 Facebook、TravelAdvisor 和诸如此类的网站上看到的那样。我尝试过不同的闪光灯套件，但它们并不像我希望的那样先进。
Perl 建议 - 接收文件并更改内容
我需要一些关于如何处理我想用 Perl 编写的脚本的建议。基本上我有一个看起来像这样的文件: id: 1 Relationship: "" name: shelby pet: 1

首页

博学

6Ren·AI

商城

python - ElasticSearch term suggest on analyzed field 不返回任何建议