python - 使用具有余弦相似度的 K 均值

python - 使用具有余弦相似度的 K 均值 - Python

转载作者：行者123 更新时间：2023-12-04 11:11:48

26

4

我正在尝试实现 Kmeans python中的算法将使用cosine distance而不是欧几里得距离作为距离度量。
我知道使用不同的距离函数可能是致命的，应该小心使用。使用余弦距离作为度量迫使我改变平均函数(根据余弦距离的平均值必须是归一化向量的逐个元素平均值)。
我见过this手动覆盖 sklearn 的距离函数的优雅解决方案，我想使用相同的技术来覆盖代码的平均部分，但我找不到它。
有谁知道怎么做？
距离度量不满足三角不等式有多重要？
如果有人知道我使用余弦度量或满足距离和平均函数的 kmeans 的不同有效实现，那也将非常有帮助。

非常感谢!

编辑:
使用角距离而不是余弦距离后，代码看起来像这样:

def KMeans_cosine_fit(sparse_data, nclust = 10, njobs=-1, randomstate=None):
    # Manually override euclidean
    def euc_dist(X, Y = None, Y_norm_squared = None, squared = False):
        #return pairwise_distances(X, Y, metric = 'cosine', n_jobs = 10)
        return np.arccos(cosine_similarity(X, Y))/np.pi
    k_means_.euclidean_distances = euc_dist
    kmeans = k_means_.KMeans(n_clusters = nclust, n_jobs = njobs, random_state = randomstate)
    _ = kmeans.fit(sparse_data)
    return kmeans

我注意到(通过数学计算)如果向量被归一化，则标准平均值适用于角度度量。据我了解，必须改 _mini_batch_step()在 k_means_.py .但是这个功能很复杂，我不明白怎么做。

有谁知道替代解决方案？
或者，有谁知道我如何用一个总是强制质心归一化的函数来编辑这个函数？

最佳答案

所以事实证明，您可以将 X 归一化为单位长度，并正常使用 K 均值。原因是如果 X1 和 X2 是单位向量，看下面的等式，最后一行括号内的项是余弦距离。

因此，在使用 k-means 方面，只需执行以下操作:

length = np.sqrt((X**2).sum(axis=1))[:,None]
X = X / length

kmeans = KMeans(n_clusters=10, random_state=0).fit(X)

如果您需要质心和距离矩阵，请执行以下操作:

len_ = np.sqrt(np.square(kmeans.cluster_centers_).sum(axis=1)[:,None])
centers = kmeans.cluster_centers_ / len_
dist = 1 - np.dot(centers, X.T) # K x N matrix of cosine distances

笔记:

刚刚意识到您正在尝试最小化集群的平均向量与其组成部分之间的距离。当您简单地平均向量时，平均向量的长度小于 1。但在实践中，仍然值得运行正常的 sklearn 算法并检查均值向量的长度。在我的情况下，平均向量接近单位长度(平均约为 0.9，但这取决于数据的密度)。
TLDR:使用 spherecluster @σηγ 指出的包。

关于python - 使用具有余弦相似度的 K 均值 - Python，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/46409846/

26

4

0

文章推荐： amazon-web-services - 如何修复漂移的 AWS CloudFormation 堆栈？

文章推荐： google-apps-script - 带有自定义用户代理字符串的 UrlFetch？

文章推荐： visual-studio-code - VSCode : clear integrated terminal when debug starts

文章推荐： haskell - 使 Applicative 成为 Monad 所需的 'minimum' 是什么？

c++ - 余弦/正弦矩阵数学
我有一个例程，它将接受 union 参数 d、theta、a 和 alpha 作为输入，并将生成相应的 4x4 齐次矩阵作为输出。我已经测试了我的矩阵乘法，它确实工作正常。我将从输入中得到 5 个矩阵
c# - 使用预计算平移数组的快速正弦/余弦
我有以下代码使用预先计算的内存表执行 Sin/Cos 函数。在下面的例子中，表格有 1024*128 个项目，涵盖了从 0 到 2pi 的所有 Sin/Cos 值。我知道我可以使用 Sin/Cos 对
Python:计算精度高达100万位的正弦/余弦
问题是不言自明的。我看过几个 pi 的例子，但没有看到 trigo 函数。也许可以使用泰勒级数 as done here但我不完全确定如何在 python 中实现它。特别是如何存储这么多数字。我应该提
python - Python中正弦、余弦、正切函数的问题
我开始学习 Python 中的数学模块，并试图围绕 Python 中的正弦、余弦和正切的三角函数。我花了一些时间学习更多关于三角学的知识，并了解了直角三角形的基本公式是如何工作的: 正弦函数: si
C++(函数、余弦)没有给出正确答案
我一个月前才开始学习这门 C++ 类(class)。现在我被分配去写一个程序来计算这个。我不知道我做错了什么。 #include #include float gatherl1(); float
python - 各种角度的精确正弦/余弦/正切
这个问题在这里已经有了答案: Python cos(90) and cos(270) not 0 (3 个答案) 关闭 9 年前。有没有办法获得角度(以弧度为单位)的精确正切/余弦/正弦？ mat
c++ - 正弦、余弦、弧度和旋转
这个问题在这里已经有了答案: Java Math.cos(Math.toRadians()) returns weird values (4 个答案) 关闭 10 年前。我正在编写一个程序，我必须
java - 如何在android studio中使用正弦、余弦、对数函数
我做了一个简单的计算器作为我的第一个android程序，现在我想给它添加trigonometry，log等函数。在 C 中，我们必须包含 math library 才能这样做，我似乎无法弄清楚你是如何
objective-c - Objective-C 余弦
我正面临 objective-c 中 cos 函数的奇怪问题。我安装了带有 iOS 4.3 SDK 的 xcode 4.1.1。我正在计算一个数的余弦值: y= cos(x*M_PI/180) 这将
css - 如何在 Less 中计算正弦、余弦？
尝试将以下 php 方法转换为在 .less 样式表中使用: 在 Less 中，如何在不使用特定语言的 cos()/sin() 函数的情况下实现正弦/余弦方法？ .rotate(@deg) {
performance - ARMv7+NEON : looking for testers… 的快速正弦/余弦
可以使用 iPhone 3GS 或 Pandora 的人请测试我刚刚编写的以下组装程序吗？它应该在 NEON 矢量 FPU 上非常快速地计算正弦和余弦。我知道它编译得很好，但没有足够的硬件我无法测试
c - 泰勒级数计算余弦(余弦(90)的输出为-0.000)
我为泰勒级数编写了以下函数来计算余弦。 double cosine(int x) { x %= 360; // make it less than 360 double rad = x

首页

博学

6Ren·AI

商城

python - 使用具有余弦相似度的 K 均值 - Python