- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我必须实现一个容错的搜索功能。
目前,我有以下情况:
模型:
class Tag(models.Model):
name = models.CharField(max_length=255)
class Illustration(models.Model):
name = models.CharField(max_length=255)
tags = models.ManyToManyField(Tag)
查询:
queryset.annotate(similarity=TrigramSimilarity('name', fulltext) + TrigramSimilarity('tags__name', fulltext))
示例数据:
插图:
ID | Name | Tags |
---|--------|-------------------|
1 | "Dog" | "Animal", "Brown" |
2 | "Cat" | "Animals" |
插图有标签:
ID_Illustration | ID_Tag |
----------------|--------|
1 | 1 |
1 | 2 |
2 | 3 |
标签:
ID_Tag | Name |
-------|----------|
1 | Animal |
2 | Brown |
3 | Animals |
当我使用"Animal"
运行查询时,"Dog"
的相似度应该高于"Cat"
,因为这是一个完美的匹配。
不幸的是,这两个标签以某种方式被考虑在一起。
目前,它看起来像是将标签连接成一个字符串,然后检查相似性:
TrigramSimilarity("Animal Brown", "Animal") => X
但我想以一种在Illustration
实例名称及其标签之间获得最高相似度的方式对其进行调整:
Max([
TrigramSimilarity('Name', "Animal"),
TrigramSimilarity("Tag_1", "Animal"),
TrigramSimilarity("Tag_2", "Animal"),
]) => X
Edit1:我正在尝试查询所有插图,其中标题或其中一个标签的相似度大于 X。
Edit2:附加示例:
fulltext = 'Animal'
TrigramSimilarity('Animal Brown', fulltext) => x TrigramSimilarity('Animals', fulltext) => y
Where x < y
But what I want is actually
TrigramSimilarity(Max(['Animal', 'Brown]), fulltext) => x (Similarity to Animal) TrigramSimilarity('Animals', fulltext) => y
Where x > y
最佳答案
你不能分解 tags__name
(至少我不知道办法)。
根据您的示例,我可以假设 2 种可能的解决方案(第一种解决方案并非严格使用 Django):
不是所有的东西都需要严格通过Django
我们拥有 Python 的强大功能,所以让我们使用它们吧:
让我们先编写查询:
from difflib import SequenceMatcher
from django.db.models import Q
def create_query(fulltext):
illustration_names = Illustration.objects.values_list('name', flat=True)
tag_names = Tag.objects.values_list('name', flat=True)
query = []
for name in illustration_names:
score = SequenceMatcher(None, name, fulltext).ratio()
if score == 1:
# Perfect Match for name
return [Q(name=name)]
if score >= THRESHOLD:
query.append(Q(name=name))
for name in tag_names:
score = SequenceMatcher(None, name, fulltext).ratio()
if score == 1:
# Perfect Match for name
return [Q(tags__name=name)]
if score >= THRESHOLD:
query.append(Q(tags__name=name))
return query
然后创建您的查询集:
from functools import reduce # Needed only in python 3
from operator import or_
queryset = Illustration.objects.filter(reduce(or_, create_query(fulltext)))
解码以上内容:
我们正在检查每个 Illustration
和 Tag
反对我们的名字fulltext
我们正在用相似度通过 THRESHOLD
的每个名称编写一个查询.
SequenceMatcher
方法比较序列并返回比率 0 < ratio < 1
其中 0 表示不匹配,1 表示完美匹配。检查此答案以获取另一个用法示例:Find the similarity percent between two strings (注意:还有其他字符串比较模块,找一个适合你的)Q()
Django 对象,允许创建复杂的查询(有关链接文档的更多信息)。operator
和 reduce
我们转换 Q()
的列表OR 分隔查询参数的对象:Q(name=name_1) | Q(name=name_2) | ... | Q(tag_name=tag_name_1) | ...
注意:您需要定义一个可接受的 THRESHOLD
.
正如您可以想象的那样,这会有点慢,但是当您需要进行“模糊”搜索时,这是可以预料的。
(Django 之道:)
使用具有高相似度阈值的查询并按此相似率对查询集进行排序:
queryset.annotate(
similarity=Greatest(
TrigramSimilarity('name', fulltext),
TrigramSimilarity('tags__name', fulltext)
)).filter(similarity__gte=threshold).order_by('-similarity')
解码以上内容:
Greatest()
接受表达式或模型字段的聚合(不要与 Django 方法 aggregate
混淆)并返回最大项。TrigramSimilarity(word, search)
返回 0 到 1 之间的比率。比率越接近 1,word
越相似是search
..filter(similarity__gte=threshold)
, 将过滤低于 threshold
的相似度.0 < threshold < 1
.您可以将阈值设置为 0.6
这是相当高的(考虑默认值是 0.3
)。 您可以利用它来调整您的表现。similarity
对查询集进行排序降序排列。关于python - 来自 ManyToManyField 的 Django 最大相似度(TrigramSimilarity),我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/48603190/
“用 Haskell 进行函数式思考”中的练习之一是使用融合定律使程序更加高效。我在尝试复制答案时遇到了一些麻烦。 部分计算要求您将 maximum (xs++ map (x+) xs) 转换为 ma
我正在尝试获得 R 中最大/最小的可表示数字。 输入“.Machine”后 我有: $double.xmin [1] 2.225074e-308 $double.xmax [1] 1.797693e+
有没有办法更改浏览器验证消息 请检查所附图片。 我目前正在使用 wooCommerce 目前它显示小于或等于 X 个数字,我想更改为请求超过 X 个项目的报价。 请多多指教 最佳答案 您需要使用oni
我正在尝试将解决方案从 Excel 求解器复制到 R 中,但不知道从哪里开始。 问题: 每小时选择 5 个选项(5 行),以最大化“分数”的总和,而无需在多个小时内选择同一组 2 次。 换句话说: 最
Haskell 中是否有这样的功能: max_of_type :: (Num a) => a 所以: max_of_type :: Int == 2 ^ 31 - 1 // for example,
我有这两个表示时间范围(秒)的输入字段,我需要这样设置,以便“from/min”字段不能高于“to/max”,反之亦然。 到目前为止我得到了这个: jQuery(document).ready(fun
我有一个看起来像这样的表: http://sqlfiddle.com/#!9/152d2/1/0 CREATE TABLE Table1 ( id int, value decimal(10,
我会尝试尽可能简单地解释它: 首先是一些带有虚拟数据的数据库结构。 结构 tb_spec_fk feature value ----------------- 1 1 1
我有两个表。 表 1: +---------+---------+ | Lead_ID | Deal_ID | +---------+---------+ | 2323 | null |
我的数据库中有一个字段可以包含数字,例如8.00 或范围编号,例如8.00 - 10.00。 如果您将每个数字作为单独的数字,我需要从表中获取 MIN() 和 MAX()。例如当范围为 8.00 -
max(float('nan'), 1) 计算结果为 nan max(1, float('nan')) 计算结果为 1 这是预期的行为吗? 感谢您的回答。 max 在 iterable 为空时引发异常
我想问一下如何在 CSS 中创建一个页脚栏,它具有最小宽度(比如 650 像素),并且会根据窗口大小进行拉伸(stretch),但仅限于某个点(比如 1024 像素)。 我的意思是当窗口大小为例如 1
我尝试调整表格列宽(下一个链接上的“作者”列 http://deploy.jtalks.org/jcommune/branches/1?lang=en)。我已将最小/最大属性添加到 .author-c
在 C# 中,是否有用于将最小值和最大值存储为 double 值的内置类? 此处列出的要点 http://msdn.microsoft.com/en-us/library/system.windows
问题: 每个任务队列是否可以每秒处理超过 500 个任务? 每个 GAE 应用是否可以每秒处理超过 50,000 个任务? 详细信息: Task queue quota文档说: Push Queue
我想知道是否允许最大或最小堆树具有重复值?我试图仅通过在线资源查找与此相关的信息,但一直没有成功。 最佳答案 是的,他们可以。您可以在“算法简介”(Charles E. Leiserson、Cliff
首先,我是 .NET 开发人员,喜欢 C# 中的 LINQ 和扩展方法。 但是当我编写脚本时,我需要相当于 Enumerable extension methods 的东西 任何人都可以给我任何建议/
这是一个检查最大 malloc 大小的简单程序: #include std::size_t maxDataSize = 2097152000; //2000mb void MallocTest(vo
我想找到我的数据的最小值和最大值。 我的数据文件: 1 2 4 5 -3 -13 112 -3 55 42 42 而我的脚本: {min=max=$1} {if ($1max) {max=$1}
我想查询我的Elastic-Search以获取仅具有正值的最低价格价格。我的价格也可以为零和-1;所以我不希望我的最小聚合返回0或-1。我知道我应该向查询(或过滤器)添加脚本,但是我不知道如何。我当前
我是一名优秀的程序员,十分优秀!