- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
举个例子,假设我有一个非常简单的数据集。我得到了一个包含三列的 csv:user_id、book_id、评分。评分可以是 0-5 之间的任意数字,其中 0 表示用户未对该书进行评分。
假设我随机选择三个用户,然后得到这些特征/评分向量。
马丁:<3,3,5,1,2,3,2,2,5>
雅各布:<3,3,5,0,0,0,0,0,0>
授予:<1,1,1,2,2,2,2,2,2>
相似度计算:
+--------------+---------+---------+---------+
| |玛杰 |晨光 | J&G |
+--------------+---------+---------+---------+
|欧几里得| 6.85 | 5.91 | 5.91 6.92 | 6.92
+--------------+---------+---------+---------+
|余弦| .69 | .83 | .32 |
+--------------+---------+---------+---------+
现在,我对相似性的期望是马丁和雅各布是最相似的。我预料到会出现这样的情况,因为他们对他们所评分的书的评分完全相同。但我们最终发现马丁和格兰特最相似。
我在数学上理解我们如何得出这个结论,但我不明白如果发生这种类型的事情,我如何能够依赖余弦角距离或欧几里德距离作为计算相似度的方法。马丁和格兰特比马丁和雅各布更相似的解释是什么?
我的一个想法是只计算欧几里德距离,但忽略一位用户尚未对这本书进行评分的所有书籍。
然后我就得到了这个
+--------------+---------+---------+---------+
| |玛杰 |晨光 | J&G |
+--------------+---------+---------+---------+
|欧几里得| 0 | 5.91 | 5.91 6.92 | 6.92
+--------------+---------+---------+---------+
|余弦| .69 | .83 | .32 |
+--------------+---------+---------+---------+
当然,现在我的欧几里得距离为 0,这符合我对推荐系统的期望。我看到很多教程和讲座使用余弦角距离来忽略未评级的书籍,而不是使用欧几里德距离来忽略它们,所以我相信这通常是行不通的。
编辑:
为了进行一点实验,我将 Jacob 的特征向量调整为更加相似:
雅各布:<3,3,5,1,2,3,2,0,0>
当我和 Martin 计算余弦角距离时,我仍然只得到 0.82!仍然不如马丁和格兰特相似,但通过检查,我认为这两个人非常相似。
有人可以帮助解释我的想法错误在哪里,并可能建议另一种相似性度量吗?
最佳答案
正如您自己所指出的,欧几里德和余弦角是基于距离的。例如,3 和 5 之间的距离比 3 和 0 之间的距离小得多,雅各布的评分中有多个零,因此雅各布和马丁之间不会有太多相似之处。您的示例的主要问题是您假设 0 表示没有评级,实际上这两个公式将其解释为评级 0(这是可能的最低评级)如果您跳过零评级并仅在评级上比较用户他们的共同点比 Marin 和 Jacob 的相似度为 1!
关于machine-learning - 正确解释余弦角距离相似度和欧氏距离相似度,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/32935917/
我有一个例程,它将接受 union 参数 d、theta、a 和 alpha 作为输入,并将生成相应的 4x4 齐次矩阵作为输出。我已经测试了我的矩阵乘法,它确实工作正常。我将从输入中得到 5 个矩阵
我有以下代码使用预先计算的内存表执行 Sin/Cos 函数。在下面的例子中,表格有 1024*128 个项目,涵盖了从 0 到 2pi 的所有 Sin/Cos 值。我知道我可以使用 Sin/Cos 对
问题是不言自明的。我看过几个 pi 的例子,但没有看到 trigo 函数。也许可以使用泰勒级数 as done here但我不完全确定如何在 python 中实现它。特别是如何存储这么多数字。我应该提
我开始学习 Python 中的数学模块,并试图围绕 Python 中的正弦、余弦和正切的三角函数。 我花了一些时间学习更多关于三角学的知识,并了解了直角三角形的基本公式是如何工作的: 正弦函数: si
我一个月前才开始学习这门 C++ 类(class)。现在我被分配去写一个程序来计算这个。我不知道我做错了什么。 #include #include float gatherl1(); float
这个问题在这里已经有了答案: Python cos(90) and cos(270) not 0 (3 个答案) 关闭 9 年前。 有没有办法获得角度(以弧度为单位)的精确正切/余弦/正弦? mat
这个问题在这里已经有了答案: Java Math.cos(Math.toRadians()) returns weird values (4 个答案) 关闭 10 年前。 我正在编写一个程序,我必须
我做了一个简单的计算器作为我的第一个android程序,现在我想给它添加trigonometry,log等函数。在 C 中,我们必须包含 math library 才能这样做,我似乎无法弄清楚你是如何
我正面临 objective-c 中 cos 函数的奇怪问题。我安装了带有 iOS 4.3 SDK 的 xcode 4.1.1。 我正在计算一个数的余弦值: y= cos(x*M_PI/180) 这将
尝试将以下 php 方法转换为在 .less 样式表中使用: 在 Less 中,如何在不使用特定语言的 cos()/sin() 函数的情况下实现正弦/余弦方法? .rotate(@deg) {
可以使用 iPhone 3GS 或 Pandora 的人请测试我刚刚编写的以下组装程序吗? 它应该在 NEON 矢量 FPU 上非常快速地计算正弦和余弦。我知道它编译得很好,但没有足够的硬件我无法测试
我为泰勒级数编写了以下函数来计算余弦。 double cosine(int x) { x %= 360; // make it less than 360 double rad = x
我是一名优秀的程序员,十分优秀!