gpt4 book ai didi

correlation - 斯 PIL 曼等级与缺失值的相关性?

转载 作者:行者123 更新时间:2023-12-04 03:07:06 26 4
gpt4 key购买 nike

我有两个按出现次数排序的单词列表

排序是通过计算在不同时间点采样的两个文件中的每个单词生成的。

我想计算 spearman 以查看在第二个文件中找到第一个文件的顺序。

例如:

文件 a:1) 是 2) 去了 3) 工作

文件 b:1) 是 2) 工作 3) 去了

因为排序不同,我不会得到 1.0 的分数,但是一个表明这两个样本相当相似的分数

我的问题现在是缺失值。文件 B 中可能不存在文件 A 的单词。在这种情况下,我可以使用 spearman 等级吗?或者是另一种更适合的相关性度量?

最佳答案

在排名方面,在您的应用程序中,您不需要缺失值。当一个词在一个文件中出现但在另一个文件中没有出现时,您可以给它在另一个文件中的最后排名(或多个缺失值的最后排名相同)。

但是,我不确定许多缺失值(许多并列最后排名)对 Spearman 值的影响。您可能会考虑对原始相对频率使用标准相关/回归,而不是 Spearman 系数。

例子...

假设文件 x 有 m=113 个字,文件 y 有 n=234。我们可以像这样创建一个相对词频表:
word x y

is 5/113 23/234
the 4/113 45/234
a 4/113 17/234
farnarkling 1/113 0/234
elbow 0/113 2/234
...
===============================
TOTAL 113/113 234/234

然后你会计算:
word x y u=x*y v=x*x

is 5/113 23/234 115/26442 25/12769
the 4/113 45/234 180/26442 16/12769
a 4/113 17/234 68/26442 16/12769
farnarkling 1/113 0/234 0/26442 1/12769
elbow 0/113 2/234 0/26442 0/12769
...
========================================================
TOTAL 113/113 234/234 s=(sum of u) t=(sum of v)

您的答案由 s/t 给出。接近 m/n 的值意味着良好的对应关系。

一些可能有用的链接是:

https://statistics.laerd.com/statistical-guides/spearmans-rank-order-correlation-statistical-guide.php

http://en.wikipedia.org/wiki/Simple_linear_regression

关于correlation - 斯 PIL 曼等级与缺失值的相关性?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/26323239/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com