algorithm - 更好地设计我当前的算法

转载作者：塔克拉玛干更新时间：2023-11-03 02:56:00

27

4

我正在设计一种算法来比较两个对象，我有一个公式，但我不知道它是否尽可能好。

本质上，我是在比较两个游戏之间的比喻来说明它们有多么相似:

$divisor = ((count($similar_concepts) - $iterator) + ($total - $iterator) + ($iterator));
echo "<BR> Value: ".($iterator / $divisor);

但是，那是不可读的，所以这是这样的:

 SimilarTropes/( (OriginalTropes - SimilarTropes) + (NewTropes - SimilarTropes) + (SimilarTropes) )

我只是对结果不完全满意，这里有一个例子:

Similarities: 47
NewTropes: 107
OriginalTropes: 156
Answer: 0.21759259259259

我不喜欢这些结果，因为我觉得这些数字应该产生更高的相似度。

我希望能在这里提供一些意见，如果我走错了地方，至少可以提供一些关于我应该去哪里的指导。

非常感谢!

最佳答案

数学翻译

让我(尝试)将您所拥有的转化为更数学的公式。从那里应该更容易。

OriginalTropes是某个游戏中比喻的数量，称之为A .然后 NewTropes是来自其他游戏的比喻，称之为B .然后 Similarities只是A的交集和 B .那么你的公式是:

|Intersect(A, B)| / ((|A| - |Intersect(A, B)|) + (|B| - |Intersect(A, B)|) + |Intersect(A, B)|)

化简，我们有:

|Intersect(A, B)| / (|A| + |B| - |Intersect(A, B)|)

换句话说，您是说相似度是共同项目数除以项目总数减去共同项目数之间的比率。

现在让我们来看一些特殊情况。取A = B .然后我们有:

|Intersect(A, B)| = |A| = |B| .那么你的公式是:

|A| / (|A| + |A| - |A|) = 1

限制

现在假设集合 A和 B大小相等。但是，他们只有一半的项目是共同的。换句话说，

|A| = |B| = 2 |Intersect(A, B)|

那么你的相似度分数是:

1/2 |A| / (2|A| - 1/2|A|) = 1/3

理想情况下，这应该是 1/2 , 不是 1/3 .如果你考虑任何集合，你会得到类似的东西 |A| = |B| = n在哪里|Intersect(A, B)| = n * p对于 0 <= p <= 1 .

一般来说，对于上述形式的集合，您的相似度算法最终会低估两个集合之间的相似度。这看起来有点像下图中的紫色曲线。蓝色曲线是余弦相似度给出的结果。因此，如果 50% 是常见的且大小相等，则两组的相似度为 0.5 .同样，如果它们有 90% 的共同点，那么它的相似度为 0.9 .

enter image description here

余弦相似度

您可能希望得到与两组之间的角度类似的东西。考虑元素的总集合，Intersect(A, B)并定义 N = |Intersect(A, B)| .让a和 b成为N A 的尺寸表示和 B ，其中每个元素的值为 1如果存在于原始集中或0如果没有。

然后你使用角度的余弦作为:

Cos(theta) = Dot(a, b) / (||a|| * ||b||)

请注意符号 ||a||指的是欧氏长度，而不是集合的大小。这可能比您之前使用的具有更好的特性。

例子

这是一个例子。比方说:

 A = { "Big Swords", "Male Hero", "No Cars" }
 B = { "Male Hero", "Trains", "No Dragons" }

然后是完整的 distinct 集，Union(A, B)给出为:

Union(A, B) = { "Big Swords", "Male Hero", "No Cars", "Trains", "No Dragons" }

这意味着N = |Union(A, B) = 5 .棘手的一方变成了如何适本地索引每一个。您实际上可以使用字典加计数器来索引元素。我会把这个留给你试试。现在，我们将使用 Union(A, B) 的顺序。 .然后 a和 b给出如下:

a = { 1, 1, 1, 0, 0 }
b = { 0, 1, 0, 1, 1 ]

此时它成为标准数学:

Dot(a, b) = 1
|a| = sqrt(3)
|b| = sqrt(3)
Similarity = 1 / 3

实现示例

public double Compare(IEnumerable<String> A, IEnumerable<String> B)
{
    // Form the intersection between A and B
    var C = A.Intersect(B);

    // a and b are N (C.Length) dimensional bi-valued (0 or 1) vectors
    var a = new List<int>(C.Length);
    var b = new List<int>(C.Length);

    var map = new Dictionary<String, int>();

    // Map from the original key to an index in the intersection
    for (int i = 0; i < C.Length; i++)
    {
        var key = C[i];
        map[key] = i;
    }

    // Set the 1's in the N-dimensional representation of A
    foreach (var element in A)
    {
        var i = map[element];
        a[i] = 1;
    }

    // And do the same for B
    foreach (var element in B)
    {
        var i = map[element];
        b[i] = 1;
    }

    int dot = 0;

    // Easy part :) Standard vector dot product
    for (int i = 0; i < C.Length; i++)
        dot += a[i] * b[i];

    // It suffices to take the length because the euclidean norm
    // of a and b are, respectively, the length of A and B
    return dot / Math.Sqrt((double) A.Length * B.Length);
}

关于algorithm - 更好地设计我当前的算法，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/11304012/

27

4

0

文章推荐： algorithm - 动态规划帮助LISA-SPOJ

文章推荐： java - 聚合异常

文章推荐： java - 程序设计 - 按功能打包还是按层打包或两者兼而有之？

文章推荐： algorithm - 最接近原点的二维坐标

当前 = 当前 * 10 + (c - '0' );
我试图通过这段代码读取未知数量的整数: while (1) { int c = getchar (); if (c == EOF) break;
javascript - 当前、上个月和下个月的日历显示在日期选择器中
我正试图找到一个类似于谷歌分析日期选择器的日期选择器: 知道 jQuery 是否提供了类似的东西吗？最佳答案这个 Twitter Bootstrap 风格的日期范围选择器非常接近。 https:/
Javascript 当前 url
我正在使用 javascript。如何获取当前 URL 的路径并将其分配给我的代码？这是我的代码: $(document).ready(function() { $(".share").hides
bash - 如何获取(当前)儒略日数？
如何获得今天的Julian day number (JDN)相等的？或任何日期？我看了又看，但只发现了一些产生“year-dayOfYear”的函数，而不是:2457854。最佳答案在 bash
udp - 当前 udp 数据包队列长度
我有相当简单的 UDP 服务器写在 c 上。有时我需要知道在套接字中排队的所有 udp 数据包(字节)的当前长度。据我了解，getsockopt 没有得到这样的信息。欢迎使用 Linux 和 F
tinymce - 当前 TinyMCE 中的填充插件
我一直在寻找几个小时来找到一个可以在图像中添加诸如“填充:5px”之类的东西的插件。每个人都通过纯 html 做到这一点吗？我们的客户需要一种方法来简单地使用按钮或右键单击上下文菜单来添加它。有什么建
tcl - 当前 TCL 脚本的完整路径
是否有可能获得当前正在执行的 TCL 脚本的完整路径？在 PHP 中，它将是:__FILE__ 最佳答案根据“当前正在执行的 TCL 脚本”的含义，您实际上可能会寻找 info script ，甚
NHibernate 当前 session 上下文问题
我最近从直接使用 ISession 转向了包装的 ISession，即工作单元类型模式。我曾经使用 SQL Lite(内存中)对此进行测试。我有一个简单的帮助器类，它配置我的 SessionFact
webstorm - 当前 JavaScript 版本不支持解构赋值
我按照步骤操作 here在 WebStorm 中配置代码完成和其他内容，但我仍然收到以下语法错误。我该如何解决这个问题？最佳答案通过相应地将“JavaScript 语言版本”(Settings/
TFS 当前 Sprint URL
我可以为我团队的 TFS 当前 Sprint 任务板添加书签吗？我们有两周的冲刺，因此 URL 每两周更改一次。默认 URL 的形式为: http://[Server]/tfs/[Project]/
svn - 当前 Subversion 修订命令
是否有 Subversion 命令可以显示当前版本号？在svn checkout之后，我想启动一个脚本并需要变量中的修订号。如果有像 svn info get_revision_number 这样的
javascript - componentWillRecieveProps 当前 props
我正在编写表单的一个组件首次安装组件时，sources={{}} ，一本空字典。由于该组件包装了现有的 Javascript 库，因此我正在实现一个自定义比较函数。为了让这个 diffing 函数
javascript - 当前 UTC 时间独立于系统时钟吗？
无论系统时间设置为多少以及机器所在的时区，我都需要正确的 UTC 时间。 (即使我必须打电话到互联网才能同步......) 是否有一些库或其他方法可以优雅地做到这一点？最佳答案如果您想获得准确可靠
javascript - 当前 Ajax 请求的最佳实践
我一边编码，一边拿出一些我和 friend 建立的旧网站来重新开始工作。我已经有一段时间没有做过任何 AJAX 了，当我试图找出我的代码失败的地方时，我发现没有显示很多资源。我猜这是因为我使用的是旧方
arm - 当前 CPU 上的分支预测有多普遍？
由于对性能的巨大影响，我从不怀疑我现在的桌面CPU是否有分支预测。当然可以。但各种 ARM 产品又如何呢？ iPhone或Android手机有分支预测吗？较旧的任天堂 DS？基于 PowerPC 的
java - 当前 token 的生命周期
我有一个具有以下有效负载的 JWT: { "id": "394a71988caa6cc30601e43f5b6569d52cd7f6df", "jti": "394a71988caa6cc30
java - JSP 当前 URL
从其他一些帖子中，我能够通过以下方式获取当前 URI: 但是以下方法不起作用: 我很好奇为什么上面的方法不起作用，以及如何将当前 URI 分配给字符串。最佳答案每the javadocs ，g
ios - 当前 View 中单元格的快速高度
我在表格 View 中有几个单元格。现在在任何给定的时间点，我想计算 View 中单元格的当前高度，即如果它是 View 的 3/4，它应该返回 (cellheight)*3/4 高度。我通过以下方
php - 这个登录脚本是否良好/当前/安全？
这是网站的身份验证脚本。这安全吗？是最近的节目吗？它已经过时了吗？是否有“更好更安全的方法”我很新，但我没有看到太多地方使用 header 授权。如有任何帮助，我们将不胜感激!这是我制作的第一个登录
python - 当前 URL 与这些中的任何一个都不匹配
我已经在其他 stackoverflow 线程上检查过这个错误，但在我的代码中没有发现任何错误。也许我累了，但我觉得还好。网站.urls.py: from django.conf.urls impo

首页

博学

6Ren·AI

商城

algorithm - 更好地设计我当前的算法

数学翻译

限制

余弦相似度

例子

实现示例