apache-spark - 如何获得pyspark数据帧的相关矩阵？-6ren

apache-spark - 如何获得pyspark数据帧的相关矩阵？

转载作者：行者123 更新时间：2023-12-03 09:23:48

24

4

我有一个很大的 pyspark 数据框。我想得到它的相关矩阵。我知道如何使用 Pandas 数据框获取它。但是我的数据太大而无法转换为 Pandas 。所以我需要用 pyspark 数据框得到结果。我搜索了其他类似的问题，答案对我不起作用。
有谁能够帮助我？谢谢!

数据示例:
data example

最佳答案

欢迎来到 SO!

示例数据

我准备了一些虚拟数据以便于复制(也许下次你也可以提供一些易于复制的数据;-)):

data = pd.DataFrame(np.random.random((10, 5)), 
                   columns=["x{}".format(x) for x in range(5)])
df = spark.createDataFrame(data)

df.show()

这是数据:

+-------------------+-------------------+-------------------+-------------------+--------------------+
|                 x0|                 x1|                 x2|                 x3|                  x4|
+-------------------+-------------------+-------------------+-------------------+--------------------+
| 0.9965335347601945|0.09311299224360992| 0.9273393764180728| 0.8523333283310564|  0.5040716744686445|
| 0.2341313103221958| 0.9356109544246494| 0.6377089480113576| 0.8129047787928055| 0.22215891357547046|
| 0.6310473705907303| 0.2040705293700683|0.17329601185489396| 0.9062007987480959| 0.44105687572209895|
|0.27711903958232764| 0.9434521502343274| 0.9300724702792151| 0.9916836130997986|  0.6869145183972896|
| 0.8247010263098201| 0.6029990758603708|0.07266306799434707| 0.6808038838294564| 0.27937146479120245|
| 0.7786370627473335|0.17583334607075107| 0.8467715537463528|   0.67702427694934|  0.8976402177586831|
|0.40620117097757724| 0.5080531043890719| 0.3722402520743703|0.14555317396545808|  0.7954133091360741|
|0.20876805543974553| 0.9755867281355178| 0.7570617946515066| 0.6974893162590945|0.054708580878511825|
|0.47979629269402546| 0.1851379589735923| 0.4786682088989791| 0.6809358266732168|  0.8829180507209633|
| 0.1122983875801804|0.45310988757198734| 0.4713203140134805|0.45333792855503807|  0.9189083355172629|
+-------------------+-------------------+-------------------+-------------------+--------------------+

解决方案

ml 子包 pyspark.ml.stat 中有相关函数。但是，它要求您提供 Vector 类型的列。因此，您需要首先使用 VectorAssembler 将列转换为向量列，然后应用相关性:

from pyspark.ml.stat import Correlation
from pyspark.ml.feature import VectorAssembler

# convert to vector column first
vector_col = "corr_features"
assembler = VectorAssembler(inputCols=df.columns, outputCol=vector_col)
df_vector = assembler.transform(df).select(vector_col)

# get correlation matrix
matrix = Correlation.corr(df_vector, vector_col)

如果您想将结果作为 numpy 数组(在您的驱动程序上)，您可以使用以下命令:

matrix.collect()[0]["pearson({})".format(vector_col)].values

array([ 1.        , -0.66882741, -0.06459055,  0.21802534,  0.00113399,
       -0.66882741,  1.        ,  0.14854203,  0.09711389, -0.5408654 ,
       -0.06459055,  0.14854203,  1.        ,  0.33513733,  0.09001684,
        0.21802534,  0.09711389,  0.33513733,  1.        , -0.37871581,
        0.00113399, -0.5408654 ,  0.09001684, -0.37871581,  1.        ])

关于apache-spark - 如何获得pyspark数据帧的相关矩阵？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/52214404/

24

4

0

文章推荐： react-native - ScrollView 可以由 maxHeight 限制吗？

文章推荐： ruby-on-rails - 如何在 Rails 引擎上使用拐点

文章推荐： unit-testing - 无法模拟 native 模块

文章推荐： wpf - 根据最大按钮的内容均匀大小的按钮

mysql 'as' 相关
第一段代码工作正常，并给出了我需要的结果。我现在想做的是让它在 'as num' 上返回 3 个数字值对于“as num”上的 3 个不同值，对于同一列上的 3 个不同位置 SELEC
algorithm - 具有三个变量的数学函数(相关)
我想分析一些数据以编写定价算法。以下日期可用: 我需要三个变量/维度的函数/相关因子，它显示三个维度(pers_capacity、卧室数量、浴室数量)增长时中位数(价格)的变化。例如Y(#pers_c
后台崩溃 - Sprite-Kit 相关
正如标题所说 - 我的 Sprite Kit 游戏时不时地在后台崩溃，总是出现此错误 - Exception Type: EXC_BAD_ACCESS (SIGSEGV) Exception Sub
php - 相关(别名)模型上的Phalcon验证消息
假设我尝试保存以下数据，并且Songs模型的name属性上设置了Phalcon \ Mvc \ Model \ Validator \ PresenceOf验证器 // Get an existing
c# - 相关 if 条件由 && 运算符控制
我有一个 if 控件，如下所示； if (Directory.Exists(System.IO.Path.Combine(systemPath, "Reports", companyName))
javascript - Jscript ReadLine() 相关
有人可以告诉我我们使用 ReadLine() 从文件 (.txt) 中读取特定行吗？现在我想读取文件的全部内容(不仅仅是第一行)。为此我需要使用什么方法。我用谷歌搜索了很多，但找不到解决方案。我的代
fpga - 语言如何与 FPGA 相关？
我相信在大学时我用从 C 派生的语言为 FPGA 编写了一个程序。我了解 VHDL 和 verilog 等语言。但是，我不明白的是程序员在使用哪个方面有多少选择？它依赖于FPGA吗？我将使用 Xili
c# - 相关 if 条件由 && 运算符控制
我有一个 if 控件，如下所示； if (Directory.Exists(System.IO.Path.Combine(systemPath, "Reports", companyName))
javascript - 为图像对象设置源 - Dashcode 相关
如何在运行时更改 Dashcode (Javascript) 中图像对象的源？我试过: var image = document.getElementById("image").object;ima
c++ - 相关 C++ 类中多态性的最佳实践？
我有几个相互关联的类，它们将被多种不同的算法使用例子: struct B; struct A { B* parent; }; struct B { std::vector child
mysql - 与 mySQL 相关
我正在开发一个网站，用户在客户收到的表中输入金额，如果任何客户没有提供分期付款(金额)，则用户不会在表中输入任何金额，并且用户希望获取违约者的信息客户以10天为基础。所以我的问题是应该定义什么表和属性
mysql - 从之前的重力形式条目中选择一个值(SQL 相关)
我试图从上一个条目中选择一个值，并每次将该数字加一。我让它工作到选择当前条目值(默认 1000)并递增 1 并重新插入该值(因此每次最终都是 1001)。我需要它来选择该字段的最后一个条目，这样它将变
mysql - 如何从表中选择一行并从另一个(相关)表中选择多行
我不擅长“制作”查询。假设这是我的数据库: artist pics ------------------- -
PHP:长轮询和 Comet 相关
最近，我要为我的网站做一个即时通知系统。我听说 COMET 在这种情况下必不可少。我已经搜索 PHP 和 Comet 一段时间了，但是，我发现的指南和文章似乎只是循环中的 ajax 请求。例如，有一
ios - 为什么这行不通？ ( SpriteKit 相关)
我正在开发一款 iOS 游戏，我希望 clown 在场景外生成，然后向下移动。我的想法是全部创建它们，并将它们以 360 像素的距离放置在不可见的场景中。像这样: SKSpriteNode *clo
Mysql Group by 子句与聚合结果上的 where 相关
我有以下子订单表。 mysql> select * from suborder; +-------------+------------------+ | order_state | bookin
java - 什么时候编码与 Java 相关？
这可能是一个有点初学者的问题，但考虑到在 Java 中调试编码是相当相关的:什么时候编码与 String 对象相关？假设我有一个要保存到文件中的字符串对象。 String 对象本身是否使用某种我应该
c++ - 如何管理对象之间的一对多关系？ ( move 相关)
首先我想说我是 CPP 的新手(我从 cpp11 开始):)考虑以下实体:学生(名字+姓氏)和组(描述+更多学生)。我在 C++ 中创建了以下 2 个类: class Student { privat
javascript - 无法调用函数/AJAX 相关
我正在尝试在单击该复选框时同步更新我的数据库。我决定使用 aJax，但它似乎无法识别 ajax。代码:将成为 Switch_Active(this.id) 函数的元素 ... Deactivat
jQuery - 单击并添加类触发另一个(相关)单击？
我正在创建一个菜单。菜单如下。 $('.category').mouseover(function() { $(this).removeClass('category').addClass('cate

首页

博学

6Ren·AI

商城

apache-spark - 如何获得pyspark数据帧的相关矩阵？