python - python 中搜索字符串和字符串列表之间最高百分比 Levenshtein 距离的最快方法是什么？-6ren

python - python 中搜索字符串和字符串列表之间最高百分比 Levenshtein 距离的最快方法是什么？

转载作者：行者123 更新时间：2023-12-01 21:46:08

26

4

我正在编写一个程序，将较小的游戏标题列表与许多游戏的主列表进行比较，以查看较小列表中的哪些游戏与主列表中的游戏标题比其他游戏更匹配。为了做到这一点，我一直在检查较小列表中的每个游戏与主列表中的每个游戏之间的 Levenshtein 距离(以百分比形式)，并取所有这些值中的最大值(最大百分比越低，游戏必须越独特)同时使用 difflib 和 fuzzywuzzy 模块。我遇到的问题是，使用 process.extractOne() 或 difflib.get_close_matches() 的典型搜索每场比赛大约需要 5 秒以上(38000+主列表中的字符串)，我有大约 4500 个游戏要搜索(5 * 4500 大约是 6 小时 15 分钟，我没有时间)。

希望找到一种更好更快的搜索字符串列表的方法，我想问一下在 python 中搜索字符串和字符串列表之间最高百分比 Levenshtein 距离的最快方法是什么。如果没有比使用上述两个函数或编写其他循环代码更好的方法，请说出来。

我在搜索最大距离时具体使用的两个函数是:

metric = process.extractOne(name, master_names)[1] / 100
metric = fuzz.ratio(name, difflib.get_close_matches(name, master_names, 1, 0)[0]) / 100

最佳答案

通过实验和进一步研究，我发现检查 Levenshtein 比率的最快方法是通过 python-Levenshtein 库本身。与使用 fuzzywuzzy 或 difflib 中的任何函数相比，函数 Levenshtein.ratio() 明显更快(对于一个游戏，整个搜索平均只需要 0.05 秒)，可能是因为它的简单性和 C 实现。我在 for 循环中使用此函数迭代主列表中的每个名称以获得最佳答案:

from Levenshtein import ratio

metric = 0
for master_name in master_names:
    new_metric = ratio(name, master_name)
    if (new_metric > metric):
        metric = new_metric

总而言之，我要说的是，在字符串和字符串列表之间搜索最大百分比编辑距离的最快方法是遍历字符串列表，使用 Levenshtein.ratio() 来获取每个字符串与第一个字符串的比率，然后在每次迭代中检查最高值比率。

关于python - python 中搜索字符串和字符串列表之间最高百分比 Levenshtein 距离的最快方法是什么？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/60472100/

26

4

0

文章推荐： node.js - 从 Firebase 实时数据库中删除多条记录 - Nodejs

Java - 最高、最低和平均水平
我刚刚开始学习，我的一项练习需要帮助。我需要最终用户输入每个月的降雨量。然后我需要输出平均降雨量、最高月份和最低月份以及降雨量高于平均水平的月份。我一直在最高和最低中得到相同的数字，我不知道为什么
Javascript Div 最高
我试图让一排 div 都与最高的那个的高度相匹配，所以它们看起来是统一的。我已经阅读了很多这方面的资料，但似乎找不到任何适用于跨浏览器的解决方案。我目前使用的脚本是: var maxHei
javascript - 获取数组中出现次数相同(最高)的所有元素
我有一个像 [1,4,3,1,6,5,1,4,4] 的数组这里最高元素频率是 3 ，我需要从数组中选择频率为 3 的所有元素，如上例中的 [1,4] 。我已经尝试过这个 var count = {
sorting - 最高 awk 结果被计数条件截断
我有一个学生记录列表，grades ，我想按 GPA 排序，返回前 5 个结果。由于某种原因count awk '{ if (count awk '{ if (count<=8) print $3,
php - 有没有办法检查结果是表中的最后一个(最高 ID)？
我有一个用于显示博客文章的页面。在页面的开头，我使用以下 SQL 获取数据: SELECT posts.*, count(comments.post_id) as number_of_comments
mysql - 从另一个表创建一个包含计数/最高/最低的表
我有一张 table 城市 |状态|比赛|值(value) 可以有多个相同城市/州/种族和不同值的记录。我想创建一个新表，其中每个城市|州|种族有一条记录与计数(原始表中包含城市/州/种族的记录
java - 查找输入数组元素的平均/最高/最低等级
我是一名初级 Java 程序员(例如 0 级...)。我正在做这个项目，但我已经被难住了好几天了。我可能还有很多我没有注意到的小错误。项目是这样的: 要求用户输入从 0.00 到 100.00 的一
Python - 计算不同组中的范围(最高 - 最低)
我已经对我的数据进行了分组。现在，我要做的是每周从“高”列中选择最高值，并从“低”列中选择最低值，然后使用最高值减去最低值得到范围。但是代码总是错误的。有人对我有想法吗？这是我的 DataFrame
java - 最高 "Valued"回文
所以几个月前我在参加编程面试时，由于某种原因这个问题让我绊倒了。我可以想到几个解决方案，但其中大多数似乎效率极低。虽然多年来我一直以某种身份进行编程，但我目前正在大学攻读 CS 学位，所以我的引用点可
sql - 最高/最低 pl/sql
我已经制定了一个程序来显示给定日期的特定时间的最高和最低流行项目。该过程没有错误或异常，并且一切正常。如您所见，为了显示 Items 的第一条记录，查询重复了两次，但唯一的区别在于顺序(ASC 和 D
jquery - 将同级 DIV 设置为相等高度(最高)
我正在尝试将配对的 div 设置为相同的高度。 Some text Some text Some textSome textSome textSome textSome text Som
r - 查找向量或列中第二(第三...)最高/最低值的最快方法
R 提供了最大值和最小值，但除了对整个向量进行排序然后从此向量中选取值 x 之外，我没有看到一种真正快速的方法来查找顺序中的另一个值。例如，是否有更快的方法来获取第二高值？最佳答案使用sort(
Linux 最高 CPU 使用率——总是相同的值
这是我的命令: top -b -n 1 | head -3 | tail -n 1 | awk '{ print $2 }' 我运行一个 bash 脚本来获取这些详细信息(还有平均负载和内存消耗)并将
java - 使用 findKth 查找最低、最高、中位数和平均分
对于这个计划，我的目标是...使用 findKth 查找最高分、最低分、中位数和平均分用户必须输入数字(输入-1以停止扫描)，但他们不知道有多少个以及是否已排序但是，我在尝试执行此操作时遇到了一些问题
html - 最高 Z-index 但无法点击图像 href
我正在创建这个网站: https://www.melkerhei.be/smeltkroes/index.html 左上角的标志应该是可以点击的。这是代码:
linux - 了解 Linux 最高 CPU 利用率输出
关闭。这个问题是off-topic .它目前不接受答案。想改进这个问题吗？ Update the question所以它是on-topic用于堆栈溢出。关闭 9 年前。 Improve this
php - MYSQL:GET DISTINCT $col1 最高 $col2
我的 table 是这样的: name | var ---------------- Joe | 3 Liz | 1 Liz | 4 Joe | 2 Peter
javascript - 最高 promise .catch 不会在返回的子 promise 拒绝时触发
我有这个: function sayHello() { return new Promise( resolve => { throw new Error('reject');
html - 没有固定高度的水平滚动 div，所有包含的 div 最高 child 的高度
JSFiddle:Example 我正在寻找一种方法来使容器 div 的高度等于其最高的子级。每个其他子项的大小都应调整为容器的高度。如果子元素超出其宽度，我还需要容器水平滚动。到目前为止，我已
python - 从 tf-idf 稀疏矩阵中获取顶部词(最高 tf-idf 值)
我有一个大小为 208 的列表(208 个句子数组)，它看起来像: all_words = [["this is a sentence ... "] , [" another one hello bo

首页

博学

6Ren·AI

商城

python - python 中搜索字符串和字符串列表之间最高百分比 Levenshtein 距离的最快方法是什么？