python - 为什么 Pandas 和 Numpy 对与 NaN 的成对相关产生不同的结果？-6ren

python - 为什么 Pandas 和 Numpy 对与 NaN 的成对相关产生不同的结果？

转载作者：太空宇宙更新时间：2023-11-03 11:24:54

25

4

我正在尝试为我正在构建的模型创建一个成对相关表，并且我的数据集中有一些 numpy.nan 值 (NAN)。出于某种原因，当我使用 np.corrcoef() 执行相关时，我得到的结果与使用 pd.df.corr() 不同:

例如:

dataset = np.array([[1,np.nan,np.nan,1,1],[1,np.nan,np.nan,3000,1]])
pandas_data = pd.DataFrame(dataset.transpose())

print np.corrcoef(dataset)

我得到:

[[ nan  nan]
[ nan  nan]]

但是使用 pandas 数据框我得到了一个结果:

print pandas_data.corr()

    0   1
0 NaN NaN
1 NaN   1

他们处理 NaN 的方式是否存在根本差异，或者我遗漏了什么？ (另外，如果我有不同的值，为什么我的相关性是 1？)谢谢

最佳答案

NumPy 的默认行为是传播 NaN。也就是说，它对整个数组执行计算，每次将某些内容添加到 NaN(或乘以等)时，结果都是 NaN。这是合理的:如果 a = 5 且 b = NaN，则 a + b 应该是 NaN。因此，包含至少一个 NaN 的数组的方差为 NaN，该数组与任何其他数组的相关性也是如此。

pandas 面向原始数据的特性导致了不同的设计决策:它试图从不完整的数据中提取尽可能多的信息。特别是，corr 方法(和 documented)被设计为排除 NaN。

要在 NumPy 中重现 pandas 行为，请使用如下所示的 bool 掩码 valid:它要求列中没有 NaN 值。

dataset = np.array([[1, 2, 3, 4, np.nan], [1, 0, np.nan, 8, 9]])

valid = ~np.isnan(dataset).any(axis=0)
numpy_corr = np.corrcoef(dataset[:, valid])

pandas_data = pd.DataFrame(dataset.transpose())    
pandas_corr = pandas_data.corr()

两种关联方法现在返回相同的结果:

  [[ 1.        ,  0.90112711],
   [ 0.90112711,  1.        ]])

对角线元素表示数组与其自身的相关性，它始终为 1(理论上；实际上它在机器精度内为 1)。

关于python - 为什么 Pandas 和 Numpy 对与 NaN 的成对相关产生不同的结果？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/35933201/

25

4

0

文章推荐： mysql - 如何在 MySQL 上查找到 "opposite"的记录？

文章推荐： mysql - 当字段 Y 在表中更新时，用当前时间戳更新字段 X

文章推荐： mysql - 在关系数据库中保存属性的良好做法

sql - 获取值的所有排列 - 成对
我有 X 个值通过 CSV 传递到表中 - 因此我将 99315,99316,99223 并将它们拆分到单列临时表中 - CSV 中的每个值都放入一行。我需要做的是获得成对的值的每个排列 -所以 -
Javascript - 在单个数组中生成元素的所有组合(成对)
我已经看到了几个关于如何生成数组中元素的所有可能组合的类似问题。但是我很难弄清楚如何编写一个只输出对组合的算法。任何建议将不胜感激! 从以下数组开始(有 N 个元素): var array = ["a
php - Symfony2 Doctrine - WHERE IN 成对
基本上我想做这样的查询: SELECT * FROM `table` WHERE (`c1`,`c2`) in (('a','b'),('c','d')) 我尝试了一些方法，但找不到任何关于如何实现的
c++ - 成对 vector - 逗号操作数的左侧无效
我声明了一个 vector 对: vector > args; 然后我想像这样将一对插入 vector : args.push_back((1,-1)); 它告诉我逗号的左边操作数没有作用。我哪里出
c++ - 成对 vector 的大小
我正在用给定的对填充 vector 的邻接列表: vector> adj[1000]; 我正在对列表进行深度优先搜索，但遇到了一些奇怪的行为。第一个 print 语句打印一些值，这意味着我在 adj[
mysql select 从一个特定行插入两个值，并从某个随机行中插入两个值(成对)
这个问题Mysql Select some random rows and plus one specific row非常接近我想要的，只是我不知道如何将 ORDER BY 应用于我的情况。当有人接
r - 我如何 'efficiently' 在大型文本语料库中用另一个(成对)替换字符串向量
我在字符串向量中有大量文本(大约 700.000 个字符串)。我正在尝试替换语料库中的特定单词/短语。也就是说，我有一个包含 app 40.000 个短语的向量和一个相应的替换向量。我正在寻找解决问
R - 找到第 2 组(成对)的簇
我正在寻找一种方法来找到第 2 组(对)的集群。有没有一种简单的方法可以做到这一点？想象一下，我有某种数据想要匹配 x和 y ，喜欢 library(cluster) set.seed(1) d
java - 用正则表达式中的另一组字符(成对)替换一组字符 : "&", "&" "<"、 "<"等
我必须正确编码 5 个 XML 保留字符(& "和 ')，如下所示: "&", "&" "", ">" "\"", """ "\'", "'" 我可以一一做，
jquery - 背景图像应该使用 css 成对 Angular 线
我正在处理我的作品集。我在正文中有图像我希望图像应该只使用 css/css3/Jquery 对 Angular 线而不是通过 photoshop 编辑我已经尝试对正文使用变换旋转。但我没有得到结果。
java - Pairs 的数据结构，其中每个值(成对)映射到其他值？
我带着类似的问题又回来了。是否有可以返回其特定合作伙伴的数据类型？例如: ExampleType test = new ExampleType(); test.put("hello","hi"); 如
r - 在表格中呈现 Tukey HSD 成对 p 值
我正在对我的数据运行事后 Tukey HSD，该数据有 10 个因子级别。该表很大，我希望在成对的表中向读者展示 p 值，将 45 行表留给附录。这是一个示例数据集: set.seed(42) x
r - 在表格中呈现 Tukey HSD 成对 p 值
我正在对我的数据运行事后 Tukey HSD，该数据有 10 个因子级别。该表很大，我希望在成对的表中向读者展示 p 值，将 45 行表留给附录。这是一个示例数据集: set.seed(42) x
c++ - 与 lambda 成对 vector 的 lower_bound
我想根据 std::pair 的 std::vector 找到 std::lower_bound second 元素与 lambda。 std::vector > vec; vec.resize(5
python - python 以这种方式(成对)处理 locals() 的原因是什么？
得到这个简单的python代码，和re.compile实例一样匹配。我注意到，即使我使用的是完全相同的值，它也会创建两个实例，并相应地重复它们。我想知道是否有人可以说出这种行为的原因，为什么要创建
c++ - 在 C++ 中存储一组坐标集(成对 vector 的 vector ？)
首先，我是 C++ 的新手，所以我可能不得不深入研究伪代码和/或 Python 来解释我正在尝试做的事情... 我正在尝试为动画的每一帧存储多个 Sprite 的 X 和 Y 坐标对。我设想这类似于以
c++ - 成对 vector 和包含两个元素的结构 vector 的内存布局差异 - C++/STL
test1和test2在内存中的布局是否相同？ std::vector > test1; std::vector test2; 其中 mystruct 定义为: struct mystru
c++ - std::vector emplace 和 std::vector emplace 成对
我有这个代码: std::vector> vec; vec.emplace_back("a", 1); //success vec.emplace(vec.end(), "b", 2); //comp
R ggplot2 : boxplots with significance level (more than 2 groups: kruskal. 测试和 wilcox.test 成对)和多个方面
跟进 this question ，我正在尝试制作箱线图和成对比较以再次显示显着性水平(仅针对重要的成对)，但这次我有超过 2 个组要比较和更复杂的方面。我将在此处使用 iris 数据集进行说明。检
c++ - 成对 vector : first pair values are non-sorted and second pair values are sorted: how to find a sorted value when having the non-sorted one
我有一个 vector 对，如下所示。第一对值未排序，第二对值已排序(从零开始)。我可能想通过实现 std::vector 和 std::pair 来存储数据。当我有第一对值(未排序)时，找到相应的第

首页

博学

6Ren·AI

商城

python - 为什么 Pandas 和 Numpy 对与 NaN 的成对相关产生不同的结果？