pyspark - 计算从列表 pyspark 引用的列的乘积-6ren

pyspark - 计算从列表 pyspark 引用的列的乘积

转载作者：行者123 更新时间：2023-12-05 01:52:23

27

4

我有一个循环生成多个因子表的输出并将列名存储在列表中:

| id | f_1a | f_2a |
|:---|:----:|:-----|
|1   |1.2   |0.95  |
|2   |0.7   |0.87  |
|3   |1.2   |1.4   |

col_lst = ['f1_a','f2_a']

| id | f_1b | f_2b | f_3b |
|:---|:----:|:-----|:-----|
|1   |1.6   |1.2   | 0.98 |
|2   |0.9   |0.65  | 1.7  |
|3   |1.1   |1.33  | 1.4  |

col_lst = ['f1_b','f2_b','f_3b']

我很难用 Pyspark 找出一个代码，该代码允许我创建一个新列，其中包含每个表中列出的列的乘积，这样:

| id | f_1a | f_2a | f_a |
|:---|:----:|:-----|:----|
|1   |1.2   |0.95  |1.14 |
|2   |0.7   |0.87  |0.61 |
|3   |1.2   |1.4   |1.68 |

| id | f_1b | f_2b | f_3b | f_b  |
|:---|:----:|:-----|:-----|:-----|
|1   |1.6   |1.2   | 0.98 | 1.88 |
|2   |0.9   |0.65  | 1.7  | 1    |
|3   |1.1   |1.33  | 1.4  | 2.05 |

任何帮助将不胜感激

最佳答案

使用 reduce 应用一致函数，逐行乘以列值。

 df=spark.createDataFrame([(1   ,1.6   ,1.2   , 0.98)  , 
(2   ,0.9   ,0.65  , 1.7 )  , 
(3   ,1.1   ,1.33  , 1.4) ] , 

('id' , 'f_1b' , 'f_2b' , 'f_3b' ))
df.show()

解决方案

 df.withColumn('f_b', reduce(lambda a,b: round(a*b,2),[F.col(c) for c in  df.drop('id').columns])).show()

结果

+---+----+----+----+----+
| id|f_1b|f_2b|f_3b| f_b|
+---+----+----+----+----+
|  1| 1.6| 1.2|0.98|1.88|
|  2| 0.9|0.65| 1.7| 1.0|
|  3| 1.1|1.33| 1.4|2.04|
+---+----+----+----+----+

关于pyspark - 计算从列表 pyspark 引用的列的乘积，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/71599753/

27

4

0

文章推荐： c# - DbContext 更新与 EntityState 修改

文章推荐： R 将列按行转换为 JSON

文章推荐： python - 不需要输入的字典中的所有键

文章推荐： css - 使用样式化组件比对组件使用 css 类有什么好处

三维向量的 Matlab 乘积
我希望我的问题有一个非常简单的解决方案。我只是找不到它: 假设您有两个向量(一个是列向量，一个是行向量)A、B: A = [1,2,3] B = [4;5;6] 如果我们按如下方式将它们相乘，我们会得
c# - List中元组的聚合、求和、乘积
我有一个 Tuple 的列表: "dog", 25 "cat", 5 "cat", 7 "rat", 4 "dog", 10 我需要的 Linq 查询规则必须满足以下条件:我需要按字符串值对元组进行分
一定范围内整数的 Python numpy 乘积
给定 2 个不同的 NDarray，A 和 B，形状相同但尺寸任意，我如何获得 NDarray C，其中 C 是 A 和 B(含)范围内所有整数的乘积。我的意思是A是起始数组，B是结束数组，我想要数
computer-science - 逻辑和/算术/乘积
假设我需要为某些输入构建一个真值表，它要求我提供逻辑和、算术和和逻辑乘积。它们之间有什么区别？最佳答案逻辑和 - 一种计算机加法，当一个或两个输入变量为 1 时，结果为 1；当输入变量均为 0 时
C:矩阵 vector 乘积，两个双数相乘给出错误的符号
我正在尝试执行一个简单的矩阵乘法 vector 乘法，但出于某种原因，我在几次乘法的结果中得到了错误的符号。我不知道为什么会这样，任何指针将不胜感激。这是我的全部代码，即矩阵 * vector 函数
c++ - 矩阵 vector 乘积 CUDA 性能
我在上一个主题中找到了一些关于 cuda 矩阵 vector 积的代码: Matrix-vector multiplication in CUDA: benchmarking & performanc
javascript - (Javascript) 从用户取三个整数显示总和、平均值、乘积、最小值和最大值
我遇到的第一个问题是显示三个数字中的最小和最大。出现两个单独的警报 - 第一个警报说第二大数字是最大的(因为它还没有考虑第三个数字)，第二个警报正确地指出三个中最大的数字是最大的.不确定为什么会这样—
python - 如何在 numpy 中获得逐元素矩阵乘法(Hadamard 乘积)？
我有两个矩阵 a = np.matrix([[1,2], [3,4]]) b = np.matrix([[5,6], [7,8]]) 我想得到元素乘积，[[1*5,2*6], [3*7,4*8]]，等
c++ - 矩阵每一列的 eigen3 arraywise 矩阵 vector 乘积
我有一个数组和一个 vector : ArrayXd m1(3, 1337); ArrayXd v1(1, 1337); ArrayXd result(3, 1337); 现在我想将 m1 的每一行与
python - 沿指定轴的两个 3D 矩阵之间的 np.dot 乘积
我有两个 3D 矩阵: a = np.random.normal(size=[3,2,5]) b = np.random.normal(size=[5,2,3]) 我想要每个切片分别沿 2 轴和 0
c++ - 具有特征库的 MatrixFree-Matrix(和 Vector)乘积
我正在创建一个 C++ 软件，我需要一个包装器，它基于 Eigen 库，实现类似于官方网页中解释的运算符* https://eigen.tuxfamily.org/dox/group__Matrixf
python - 使用 np.tensordot 的矩阵的 Khatri 乘积
我正在尝试将张量 (m, n, o) 分解为矩阵 A(m, r)、B (n, r) 和 C (k, r)。这被称为 PARAFAC 分解。 Tensorly已经做了这种分解。一个重要的步骤是将 A、
c++ - 矩阵 vector 乘积，如 Eigen 中的乘法
我目前正面临这个问题。我有两个矩阵 MatrixXf答: 0.5 0.5 0.5 0.50.694496 0.548501 0.680067 0.7171110
python - 具有多列的 list 和 df 之间的 Itertools 乘积
我有以下 df: df = pd.DataFrame({'A': ['foo', 'bar', 'dex', 'tru'], 'B': ['abc', 'def'
python - 使用 Python 的 3 个矩阵的 Kronecker 乘积
假设我们有 2 个 2X2 numpy 数组: X=np.array([[0,1],[1,0]]) 和 I=np.array([[1,0],[0,1]]) 考虑一下克罗内克产品 XX=X^X 我让符号
c++ - Eigen c++ 中 VectorXcd 的 .dot() 乘积
我想弄清楚这是 Eigen 中的错误还是我做错了什么。我只想要两个复数 vector [1，i] 和 [1，-i] 的点积。答案是 1*1 + i*(-i) = 2。但是 Eigen 给出的答案是零。
c - 如何编写一个程序，使用 scanf() 读取 2 个 float ，包括总和、差值、乘积、除法和平均值？
我的 C 代码有问题。我所做的就是这样: #include int main() { float zahlen[2]; for (int i = 0; i < 2; i++) {
c++ - 对于给定的数字 N，我如何找到 x，(x 和 x 的因子数)= N 的 S.T 乘积？
为了找到数字的因数，我正在使用函数 void primeFactors(int n) # include # include # include # include using namespa

首页

博学

6Ren·AI

商城

pyspark - 计算从列表 pyspark 引用的列的乘积