elasticsearch - 如何使较短(较近)的 token 匹配更相关？ (edge

elasticsearch - 如何使较短(较近)的 token 匹配更相关？ (edge_ngram)

转载作者：行者123 更新时间：2023-12-03 00:44:26

我使用用于自动完成的edge_ngram标记生成器的结果很奇怪。我试图弄清楚如何使我的结果更相关。我从elasticsearch文档中复制了example。
我有以下说明的文档:

“苹果，生的，没有皮肤”

“苹果，生的，金黄色的美味，有皮”

“辣椒的APPLEBEE'S”

“婴儿食品，水果，苹果酱，初中”

如果我搜索 apple，则“APPLEBEE'S，chili”的得分要高于“无皮苹果”
如果我搜索 apples，则“婴儿食品，水果，苹果酱，初中”的得分要高于“苹果，生的，金黄的，有皮的苹果”
在这两种情况下，我都希望对更相关的更近/更短匹配具有更高的分数(即，当我搜索apple或apples时，包含单词apples的结果应比APPLEBEE'S或applesauce更高的分数。
我的设置是:

{
  "settings": {
    "analysis": {
      "analyzer": {
        "autocomplete": {
          "tokenizer": "autocomplete",
          "filter": [
            "lowercase",
            "asciifolding"
          ]
        },
        "autocomplete_search": {
          "tokenizer": "lowercase"
        }
      },
      "tokenizer": {
        "autocomplete": {
          "type": "edge_ngram",
          "min_gram": 2,
          "max_gram": 20,
          "token_chars": [
            "letter"
          ]
        }
      }
    }
  },
  "mappings": {
    "properties": {
      "description": {
        "type": "text",
        "analyzer": "autocomplete",
        "search_analyzer": "autocomplete_search"
      }
    }
  }
}

查询:

"query": {
    "match": {
      "description": {
          "query": "apple", 
          "operator": "and"
        }
    }
}

如何使相关性更高的得分更高？

最佳答案

由于新的BM25算法(用于评分)中称为(dl)的匹配字段的长度而导致发生此问题，您可以轻松地在查询中使用explain param来详细了解它

http://{{hostname}}:{{port}}//_search?explain=true

由于 APPLEBEE'S, chili的长度最短，因此得分更高，这是此文档的tf得分

 {
                                    "value": 0.5344296,
                                    "description": "tf, computed as freq / (freq + k1 * (1 - b + b * dl / avgdl)) from:",
                                    "details": [
                                        {
                                            "value": 1.0,
                                            "description": "freq, occurrences of term within document",
                                            "details": []
                                        },
                                        {
                                            "value": 1.2,
                                            "description": "k1, term saturation parameter",
                                            "details": []
                                        },
                                        {
                                            "value": 0.75,
                                            "description": "b, length normalization parameter",
                                            "details": []
                                        },
                                        {
                                            "value": 11.0,
                                            "description": "dl, length of field", ---> note this
                                            "details": []
                                        },
                                        {
                                            "value": 17.333334,
                                            "description": "avgdl, average length of field",
                                            "details": []
                                        }
                                    ]
                                }

解决方案
您需要创建另一个使用 english分析器的字段，如 multi-fields示例所示，以下是完整示例
索引示例

{
    "settings": {
        "analysis": {
            "analyzer": {
                "autocomplete": {
                    "tokenizer": "autocomplete",
                    "filter": [
                        "lowercase",
                        "asciifolding"
                    ]
                },
                "autocomplete_search": {
                    "tokenizer": "lowercase"
                }
            },
            "tokenizer": {
                "autocomplete": {
                    "type": "edge_ngram",
                    "min_gram": 2,
                    "max_gram": 20,
                    "token_chars": [
                        "letter"
                    ]
                }
            }
        }
    },
    "mappings": {
        "properties": {
            "name": {
                "type": "text",
                "analyzer": "autocomplete",
                "search_analyzer": "autocomplete_search",
                "fields": {
                    "english": {
                        "type": "text",
                        "analyzer": "english"
                    }
                }
            }
        }
    }
}
}

并索引您的样本文档

{
    "name" : "Apples, raw, without skin"
}
{
    "name" : "APPLEBEE'S, chili"
}
{
    "name" : "Babyfood, fruit, applesauce, junior"
}
{
    "name" : "Apples, raw, golden delicious, with skin"
}

并搜索查询

{
    "query": {
        "bool": {
            "should": [
                {
                    "multi_match": {
                        "query": "apple",
                        "fields": [
                            "name.english",
                            "name"
                        ]
                    }
                }
            ]
        }
    }
}

和搜索结果，请注意包含apple的文档的得分更高

 "hits": [
            {
                "_index": "edgelow",
                "_type": "_doc",
                "_id": "1",
                "_score": 0.6747451,
                "_source": {
                    "name": "Apples, raw, without skin"
                }
            },
            {
                "_index": "edgelow",
                "_type": "_doc",
                "_id": "4",
                "_score": 0.60996956,
                "_source": {
                    "name": "Apples, raw, golden delicious, with skin"
                }
            },
            {
                "_index": "edgelow",
                "_type": "_doc",
                "_id": "2",
                "_score": 0.12822598,
                "_source": {
                    "name": "APPLEBEE'S, chili"
                }
            },
            {
                "_index": "edgelow",
                "_type": "_doc",
                "_id": "3",
                "_score": 0.09446116,
                "_source": {
                    "name": "Babyfood, fruit, applesauce, junior"
                }
            }
        ]

关于elasticsearch - 如何使较短(较近)的 token 匹配更相关？ (edge_ngram)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/64530450/

文章推荐： csv - 将CSV数据上传到elasticsearch而无需logstash

文章推荐： powershell - 将 'az vm run-command' 与 .ps1 文件一起使用

文章推荐： vba - 存储数据但不以预期格式输出

文章推荐： ruby-on-rails - rails 3 :group => :field sorted by created_at desc

Delphi:快速(更)宽字符串连接
我有一个功能是转换 ADO Recordset 进入html: class function RecordsetToHtml(const rs: _Recordset): WideString; 该函
php - 在网络应用程序中收集熵以创建(更)安全的随机数
经过几天的研究和讨论，我想出了这种方法来收集访客的熵(你可以看到我的研究历史here) 当用户访问时，我运行此代码: $entropy=sha1(microtime().$pepper.$_SERVE
java - 一种更快(更)的方法来查找与列表中的模式匹配的内容
给定一个无序列表 List ，我需要查找是否存在 String与提供的字符串匹配。所以，我循环 for (String k : keys) { if (Utils.keysM
python - 更 retrofit 饰器内的实例属性
我已经搜索过这个问题，但没有找到我正在寻找的答案。基本上，我想将类构造函数包装在 try/except 子句中，以便它忽略构造函数内特定类型的错误(但无论如何都会记录并打印它们)。我发现做到这一点的
java - 我如何(更)轻松地比较两组数字？
我有一组三个数字，我想将一组数字与另一组数字进行比较。即，第一组中的每个数字小于另一组中的至少一个数字。需要注意的是，第一组中的下一个数字必须小于第二组中的不同数字(即，{6,1,6} 对 {8,8,
seo - 更 SEO 友好的头
关闭。这个问题是off-topic .它目前不接受答案。想改进这个问题吗？ Update the question所以它是on-topic用于堆栈溢出。关闭 9 年前。 Improve this
java - 企业应用程序的瘦(更)独立客户端
首先介绍一下背景: 我正在开发一个带有 EJB 模块和应用程序客户端模块的企业应用程序 (ear)。我还使用 hibernate JPA 来实现持久性，并使用 swingx 来实现 GUI。这些是唯一
eclipse - 让 Eclipse 更 slim
我正在尝试在我的上网本上运行 Eclipse 以便能够为 Android 进行开发。您可能已经猜到了，Eclipse 非常慢，并且不容易有效地开发。我正在使用 Linux Ubuntu 并且我还有
python - 执行以下枚举的更整洁、更 pythonic 的方法是什么？
for row, instrument in enumerate(instruments): for col, value in enumerate(instrument):
python - 什么是更简单、更 pythonic 的表达以下内容的方式？
return not a and not b ^ 我如何以更好的格式表达它最佳答案 DeMorgan's Law ，也许？ return not (a or b) 我认为在这一点上已经足够简单了
css - 有没有办法使用 CSS 使字体很棒的图标看起来更薄/更 slim ？
我正在尝试让 Font Awesome 图标看起来更 slim https://jsfiddle.net/cliffeee/7L6ehw9r/1/ . 我尝试使用“-webkit-text-strok
python - 更 Pythonic 的方式 - Pandas 数据帧操作
假设我有一个名为 vals 的数据框，如下所示: id…………日期…………min_date…… .........最大日期 1…………2016/01/01…………2017/01/01…………2018/
syntax - 是否有比 `None` 更 Pythonic 的方式更改为 `[]`
是否有更 Pythonic 的方式来做到这一点？: if self.name2info[name]['prereqs'] is None: se
c++ - 是否有(更)合理的方法来确定 ostream 所针对的终端的宽度？
我有一个函数可以将一些文本打印到它接收到的 ostream&。如果 ostream 以终端为目标，我想让它适应终端宽度，否则默认为某个值。我现在做的是: 从 ostream 中获取一个 ofstre
java - 是抛出异常还是返回 null 更 Java-thonic？
这个问题在这里已经有了答案: Should a retrieval method return 'null' or throw an exception when it can't produce
python - 编写 if 语句的更短、更 Pythonic 的方式
我有这个 bc = 'off' if c.page == 'blog': bc = 'on' print(bc) 有没有更 Pythonic(和/或更短)的方式在 Python 中编写？最佳
python - 什么是更快、更 Pythonic 的方式来读取 CSV 并从中制作数据框？
输入:一个包含 50,000 行的 CSV；每行包含 910 列值 0/1。输出:运行我的 CNN 的数据框。我编写了一个逐行读取 CSV 的代码。对于每一行，我将数据分成两部分，称为神经元(90
python - with block 或 close() 更 Pythonic 吗？
据我所知，with block 会在您退出 block 后自动调用 close()，并且它通常用于确保不会忘记关闭一个文件。好像没有技术上的区别 with open(file, 'r+') as f
c# - 无法识别 Entity Framework 更 retrofit 配模型
我有一个使用 Entity Framework V6.1.1 的 MVC 5 网站。 Entity Framework DbContext 类和模型最初都在网站项目中。这个项目有 3 个 DbCont
swift - 通过移走 TableView 使 ViewController 更 slim
我是编程新手，在尝试通过将 tableView 和关联 View 的创建移动到单独的类并将委托(delegate)和数据源从 VC 移动到单独的类来精简我的 ViewController 时遇到了一些

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

elasticsearch - 如何使较短(较近)的 token 匹配更相关？ (edge_ngram)