- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个 Elasticsearch 索引,其中包含一些数据。我实现了 did-you-mean
功能,因此当用户写错拼写的内容时,它可以收到包含正确单词的建议。
我使用短语 suggester 是因为我需要对短语的建议,例如名称,问题是索引中不存在某些建议。
例子:
document in the index: coding like a master
search: Codning like a boss
suggestion: <em>coding</em> like a boss
search result: not found
我的问题是,我的索引中没有匹配指定建议的短语,所以它向我推荐不存在的短语,因此会给我一个未找到的搜索。
我能用它做什么? phrase suggester 不应该为索引中实际存在的短语提供建议吗?
这里我会留下相应的查询、映射和设置,以备不时之需。
设置和映射
{
"settings": {
"index": {
"number_of_shards": 3,
"number_of_replicas": 1,
"search.slowlog.threshold.fetch.warn": "2s",
"index.analysis.analyzer.default.filter.0": "standard",
"index.analysis.analyzer.default.tokenizer": "standard",
"index.analysis.analyzer.default.filter.1": "lowercase",
"index.analysis.analyzer.default.filter.2": "asciifolding",
"index.priority": 3,
"analysis": {
"analyzer": {
"suggests_analyzer": {
"tokenizer": "lowercase",
"filter": [
"lowercase",
"asciifolding",
"shingle_filter"
],
"type": "custom"
}
},
"filter": {
"shingle_filter": {
"min_shingle_size": 2,
"max_shingle_size": 3,
"type": "shingle"
}
}
}
}
},
"mappings": {
"my_type": {
"properties": {
"suggest_field": {
"analyzer": "suggests_analyzer",
"type": "string"
}
}
}
}
}
查询
{
"DidYouMean": {
"text": "Codning like a boss",
"phrase": {
"field": "suggest_field",
"size": 1,
"gram_size": 1,
"confidence": 2.0
}
}
}
感谢您的帮助。
最佳答案
这实际上是意料之中的。如果您使用 analyze api 分析文档,您将更好地了解正在发生的事情。
GET suggest_index/_analyze?text=coding like a master&analyzer=suggests_analyzer
这是输出
{
"tokens": [
{
"token": "coding",
"start_offset": 0,
"end_offset": 6,
"type": "word",
"position": 1
},
{
"token": "coding like",
"start_offset": 0,
"end_offset": 11,
"type": "shingle",
"position": 1
},
{
"token": "coding like a",
"start_offset": 0,
"end_offset": 13,
"type": "shingle",
"position": 1
},
{
"token": "like",
"start_offset": 7,
"end_offset": 11,
"type": "word",
"position": 2
},
{
"token": "like a",
"start_offset": 7,
"end_offset": 13,
"type": "shingle",
"position": 2
},
{
"token": "like a master",
"start_offset": 7,
"end_offset": 20,
"type": "shingle",
"position": 2
},
{
"token": "a",
"start_offset": 12,
"end_offset": 13,
"type": "word",
"position": 3
},
{
"token": "a master",
"start_offset": 12,
"end_offset": 20,
"type": "shingle",
"position": 3
},
{
"token": "master",
"start_offset": 14,
"end_offset": 20,
"type": "word",
"position": 4
}
]
}
如您所见,为文本生成了一个标记“编码”,因此它在您的索引中。它不向您建议不在索引中的内容。如果您严格想要短语搜索,那么您可能需要考虑使用 keyword tokenizer .例如,如果您将映射更改为类似
{
"settings": {
"index": {
"analysis": {
"analyzer": {
"suggests_analyzer": {
"tokenizer": "lowercase",
"filter": [
"lowercase",
"asciifolding",
"shingle_filter"
],
"type": "custom"
},
"raw_analyzer": {
"tokenizer": "keyword",
"filter": [
"lowercase",
"asciifolding"
]
}
},
"filter": {
"shingle_filter": {
"min_shingle_size": 2,
"max_shingle_size": 3,
"type": "shingle"
}
}
}
}
},
"mappings": {
"my_type": {
"properties": {
"suggest_field": {
"analyzer": "suggests_analyzer",
"type": "string",
"fields": {
"raw": {
"analyzer": "raw_analyzer",
"type": "string"
}
}
}
}
}
}
}
那么这个查询会给你预期的结果
{
"DidYouMean": {
"text": "codning lke a master",
"phrase": {
"field": "suggest_field.raw",
"size": 1,
"gram_size": 1
}
}
}
它不会显示任何“像老板一样编码”。
编辑 1
2) 根据您的评论以及在我自己的数据集上运行一些短语建议,我觉得更好的方法是使用 collate
选项 phrase suggester
提供这样我们就可以根据 query
检查每个建议,并且仅当它要从索引中取回任何文档时才返回建议。我还在映射中添加了 词干分析器
以仅考虑词根。我正在使用 light_english
因为它不那么激进。 More在那上面。
映射的分析器部分现在看起来像这样
"analysis": {
"analyzer": {
"suggests_analyzer": {
"tokenizer": "standard",
"filter": [
"lowercase",
"english_possessive_stemmer",
"light_english_stemmer",
"asciifolding",
"shingle_filter"
],
"type": "custom"
}
},
"filter": {
"light_english_stemmer": {
"type": "stemmer",
"language": "light_english"
},
"english_possessive_stemmer": {
"type": "stemmer",
"language": "possessive_english"
},
"shingle_filter": {
"min_shingle_size": 2,
"max_shingle_size": 4,
"type": "shingle"
}
}
}
现在这个查询会给你想要的结果。
{
"suggest" : {
"text" : "appel on the tabel",
"simple_phrase" : {
"phrase" : {
"field" : "suggest_field",
"size" : 5,
"collate": {
"query": {
"inline" : {
"match_phrase": {
"{{field_name}}" : "{{suggestion}}"
}
}
},
"params": {"field_name" : "suggest_field"},
"prune": false
}
}
}
},
"size": 0
}
这会让你回到 table 上的苹果这里使用了 match_phrase
查询,它将根据索引运行每个建议的短语。您可以设置 "prune": true
并查看所有建议的结果,而不管是否匹配。您可能需要考虑使用 stop
过滤器来避免停用词。
希望这对您有所帮助!
关于Elasticsearch phrase suggester 向我建议我的索引中不存在的建议,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/34819812/
SELECT *, `o_cheque_request.member_id`, `o_cheque_request.wallet_id` FROM `o_cheque_request`, `o_mem
根据某一条件从数据库表中查询 『有』与『没有』,只有两种状态,那为什么在写SQL的时候,还要**SELECT count(*)**呢? 无论是刚入道的程序员新星,还是精湛沙场多年的程序员老白,都是一如
我试图找出一个文件是否存在,如果存在,验证css样式是否已经存在,如果不存在,将它们写在文件末尾... 我已经完成了这一切,但分 3 个步骤: 该文件是否存在? FileInfo fi= new Fi
我们正在开发即时消息传递应用程序,并且需要在用户的化身上用绿点显示用户 friend 的“状态”。 “状态”远远超出了“my_app_is_opened_and_on_focus”,这意味着(我猜可能
模式 Movie(title, year, director, budget, earnings) Actor(stagename, realname, birthyear) ActedIn(stag
我有一个正在尝试创建的 MySQL 触发器,但无法获得正确的语法。 触发器应该遍历一组关键字并将其与插入数据库的新帖子的标题进行匹配。如果找到匹配项,它应该将新帖子分配给该存储桶并更新存储桶的关键字集
我有 3 个表......用户、更新和碰撞。 我想向发出 api 请求的用户返回最新订单的 feed 更新,并提供显示 feed 中每个状态所需的所有数据。我还需要包括更新是否已被发出 api 请求的
我正在尝试呈现一个带有 UIView 的 UIViewController。 以下是我在 viewDidLoad 方法中尝试的代码。 //create the view controller UIVi
我正在努力弄清楚如何在不对 mysql 进行两次调用的情况下从一个表中检查两件事。 我有一个 Members 表。我想测试MemberID 列中是否存在某个值,以及PhoneNumber 列中是否存在
以下代码给出了一个没有 Do Compile 错误的循环: Loop Sheets("Snap").Rows(1).AutoFilter Field:=5, Criteria1:=List
是否可以通过检查“dig”的输出来检查域名的存在? 在绑定(bind)源中,我发现了这些常量: 0 DNS_R_NOEROR 1 DNS_R_FORMERR 2 DNS_R_SERVFAIL 3 DN
Controller 有问题 我在 Windows 上使用服务器,一切正常,但在互联网上我试图访问页面 social_apartament/beauty_life/并且找不到该页面,代码错误 404这
/** This is struct S. */ struct S(T) { static if(isFloatingPoint!T) { /// This version works
JVM 类型删除如何帮助 Clojure?没有它,Clojure 还能存在吗?如果 JVM 有具体化的类型会发生什么?也就是说,Clojure 将如何改变? 最佳答案 Clojure 根本不会有太大变
许多论文等提到对“system()”的调用是不安全且不可移植的。我不反对他们的论点。 不过,我注意到许多 Unix 实用程序都有一个等效的 C 库。如果没有,源可用于各种这些工具。 虽然许多论文和此类
在我的 Node js 应用程序中,我有一个用户登录 api。上面我在服务器端代码中创建了一个名为 customerid 的变量。现在,当用户身份验证成功时。我将他的 userid 值存储在我的 cu
我有一个工作资源管理器组,由 Ubuntu 14.04 虚拟机、网络接口(interface)、公共(public) IP 地址和存储帐户组成。我已经从这组资源中创建了一个模板。 当我尝试部署这组资源
我有一个函数createminor4(arr,锦标赛)它基本上将arr分成4组,每组8人,然后将它们一次交换到tourney 1组。从那里它插入四个{},其中有 4 个带有空数组的键。 我已经在 Ch
我有一个图表,其中有两个图例。我需要更改其中一个图例的点的大小。 我需要更改图例中“市场类型”的项目符号大小。我使用示例 here但不适用于我的图表。 我的代码如下: k <- ggplot(subs
我有 fiddle here展示我正在尝试做的事情。 我有一个动态生成的表,因此列可以按用户选择的任何顺序显示。因此,我尝试获取两个特定 header 的索引,以便可以将 CSS 类添加到这两列以供稍
我是一名优秀的程序员,十分优秀!