scala - 编写 spark UDF(而不是将 UDF 作为一个)时是否会降低性能？-6ren

scala - 编写 spark UDF(而不是将 UDF 作为一个)时是否会降低性能？

转载作者：行者123 更新时间：2023-12-01 09:04:09

27

4

我想知道编写 spark udf 是否会降低性能。一般来说，我更喜欢组合做一件事的小函数……

这是一个简单的例子，给定一个 DataFrame df:

def inc = udf( (i: Double) => i + 1)
def double = udf( (i: Double) => i * 2)
df.withColumn("r", double(inc($"c")))

相对

def incAndDouble = udf( (i: Double) => (i + 1) * 2)
df.withColumn("r", incAndDouble($"c")

从我所见，这个简单示例的性能是相同的。

你能解释一下为什么吗？ Spark 在幕后如何运作？

它总是真的吗？

[更新]

当可以进行巧妙的组合(不仅仅是简单的函数组合)时，我可能会有一个反例，如下例所示

def filter = udf((s: Seq[String]) => s.startsWith("A"))
def size = udf((s: Seq[String]) => s.size)

val filterAndSize = udf((s: Seq[String]) => s.count(_.startsWith("A")))

所以，我猜 filterAndSize 更可取，因为它会避免一些中间集合实例化。

最佳答案

TL;博士 可能会有一些性能下降或惩罚，但可以忽略不计。

Can you explain why ?

用“explain”看到您的问题非常有趣，这正是用于查看在 Spark SQL 的掩护下发生的事情以及它如何执行查询的方法的名称:)

所以，使用 Dataset.explain甚至更详细的版本 Dataset.explain(extended = true)查看所有优化(以及可能的性能下降)。

def inc = udf( (i: Double) => i + 1)
def double = udf( (i: Double) => i * 2)

val df = Seq(1,2,3).toDF("c")
val q = df.withColumn("r", double(inc($"c")))

由两个 UDF 组成的计划如下所示。

scala> q.explain(extended = true)
== Parsed Logical Plan ==
'Project [c#3, UDF(UDF('c)) AS r#10]
+- AnalysisBarrier Project [value#1 AS c#3]

== Analyzed Logical Plan ==
c: int, r: double
Project [c#3, if (isnull(if (isnull(cast(c#3 as double))) null else UDF(cast(c#3 as double)))) null else UDF(if (isnull(cast(c#3 as double))) null else UDF(cast(c#3 as double))) AS r#10]
+- Project [value#1 AS c#3]
   +- LocalRelation [value#1]

== Optimized Logical Plan ==
LocalRelation [c#3, r#10]

== Physical Plan ==
LocalTableScan [c#3, r#10]

让我们看看计划如何使用一个 UDF，它是两个 UDF 的组合。

def incAndDouble = udf( (i: Double) => (i + 1) * 2)
val q = df.withColumn("r", incAndDouble($"c"))
scala> q.explain(extended = true)
== Parsed Logical Plan ==
'Project [c#3, UDF('c) AS r#16]
+- AnalysisBarrier Project [value#1 AS c#3]

== Analyzed Logical Plan ==
c: int, r: double
Project [c#3, if (isnull(cast(c#3 as double))) null else UDF(cast(c#3 as double)) AS r#16]
+- Project [value#1 AS c#3]
   +- LocalRelation [value#1]

== Optimized Logical Plan ==
LocalRelation [c#3, r#16]

== Physical Plan ==
LocalTableScan [c#3, r#16]

在这种特殊情况下，没有区别，因为查询中的物理计划相同，即 LocalTableScan .

它可能与其他数据源(如文件或 JDBC)不同，但我个人的建议是开发尽可能小的 UDF，因为它们是 Spark 优化器的黑盒。

Is it always true ?

不，完全不是，因为它在很大程度上取决于您在 UDF 中所做的事情(但这与是否首先编写 UDF 有更多关系)。

在以下 UDF 是谓词的情况下(即返回 bool 值):

def filter = udf((s: Seq[String]) => s.startsWith("A"))

Spark 可以优化 UDF 的使用(如果它是不是 UDF 而是一个简单的 filter 操作)并将其下推到数据源以加载更少的数据。这可能会对性能产生巨大影响。

关于scala - 编写 spark UDF(而不是将 UDF 作为一个)时是否会降低性能？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/47702789/

27

4

0

文章推荐： python - reshape dask 数组(从 dask 数据框列获得)

文章推荐： python - 比较列表中的项目并选择最大的

文章推荐： regex - sed 中 [ ] 内的 anchor

c - 如何从客户端(用 C 编写)接收 int 数组到服务器(用 python 编写)
我只想从客户端向服务器发送数组 adc_array=[w, x, y, z]。下面是客户端代码，而我的服务器是在只接受 json 的 python 中。编译代码时我没有收到任何错误，但收到 2 条警告
node.js - 如何连接我的移动应用程序(用 lua 编写)和我的服务器(用 node.js 编写)？
我是 lua 和 Node js 的新手，我正在尝试将我正在开发的移动应用程序连接到服务器。问题是它连接到服务器，但我尝试传递的数据丢失或无法到达服务器。对我正在做的事情有什么问题有什么想法吗？ th
Haskell 编写 myLength
我在这个页面上工作 http://www.haskell.org/haskellwiki/99_questions/Solutions/4 我理解每个函数的含义，看到一个函数可以像这样以多种方式定义，
Java CSV 编写
我目前正在尝试将数据写入 excel 以生成报告。我可以将数据写入 csv 文件，但它不会按照我想要的顺序出现在 excel 中。我需要数据在每列的最佳和最差适应性下打印，而不是全部打印在平均值下。这
Java - 编写、读取和修改带参数的字符串
所以，我正在做一个项目，现在我有一个问题，所以我想得到你的帮助:) 首先，我已经知道如何编写和读取 .txt 文件，但我想要的不仅仅是 x.hasNext()。我想知道如何像 .ini 那样编写、读
javascript - 编写 For 循环来计算阶乘
我正在尝试编写一个函数，该函数将返回作为输入给出的任何数字的阶乘。现在，我的代码绝对是一团糟。请帮忙。 function factorialize(num) { for (var i=num, i
Javascript，编写 if 条件的更好方法
这个问题已经有答案了: Check variable equality against a list of values (16 个回答) 已关闭 4 年前。有没有一种简洁或更好的方法来编写这个条件
aframe - 编写 A 型框架的测试规范
我对 VR 完全陌生，正在 AFrame 中为一个类(class)项目开发 VR 太空射击游戏，并且想知道 AFrame 中是否有 TDD 的任何文档/标准。有人能指出我正确的方向吗？最佳答案几乎
javascript - 编写 for 循环以使用数组创建多个方法
我正在尝试创建一个 for 循环，它将重现以下功能代码块，但以一种更具吸引力的方式。这是与 Soundcould 小部件 API 实现一起使用的 here on stackoverflow $(doc
Java 编写/编辑属性文件
我有一个非常令人困惑的问题。我正在尝试更改属性文件中的属性，但它只是没有更改... 这是代码: package config; import java.io.FileNotFoundException
aframe - 编写 A 型框架的测试规范
我对 VR 完全陌生，正在 AFrame 中为一个类(class)项目开发 VR 太空射击游戏，并且想知道 AFrame 中是否有 TDD 的任何文档/标准。有人能指出我正确的方向吗？最佳答案几乎
.net - 编写.NET互操作调试器
我正在开发一个用户模式(Ring3)代码级调试器。它还应支持.NET可执行文件的本机(x86)调试。基本上，我需要执行以下操作: 1).NET在隐身模式下加载某些模块，而没有LOAD_DLL_DEBU
python - 编写 if 语句以避免某些列表项的更好方法是什么？
我有一个列表，我知道有些项目是不必要打印的，我正在尝试通过 if 语句来做到这一点...但是它变得非常复杂，所以有没有什么方法可以在 if 语句中包含多个索引而无需打印重写整个声明。看起来像这样的东
c# - 编写 if 语句是否会以不同方式影响程序的速度和效率？
我很好奇以不同方式编写 if 语句是否会影响程序的速度和效率。所以，例如写一个这样的: bool isActive = true; bool isResponding = false; if (isA
javascript - 编写 if 语句的新方法
我在搜索网站的源代码时找到了一种以另一种方式(我认为)编写 if 语句的方法。代替: if(a)b; 或: a?b:''; 我读了: !a||b; 第三种方式和前两种方式一样吗？如果是，为什么我们要
Java + 编写 XML
我的数据采用以下格式(HashMap的列表) {TeamName=India, Name=Sachin, Score=170} {TeamName=India, Name=Sehwag, Score=
mysql - 编写 HAVING 条件的最有效方法
我目前正在完成 More JOIN operations sqlzoo 的教程，遇到了下面的代码作为#12 的答案: SELECT yr,COUNT(title) FROM movie JOIN ca
ruby - 编写 && 检查列表的更好方法？
我正试图找到一种更好的方法来编写这段代码: def down_up(array, player) 7.downto(3).each do |row| 8.times do |col
由 C++ 编写
出于某种原因，我的缓冲区中充满了乱码，我不确定为什么。我什至用十六进制编辑器检查了我的文件，以验证我的字符是否以 2 字节的 unicode 格式保存。我不确定出了什么问题。 [打开文件] fseek
c# - 编写 FizzBuzz
阅读编码恐怖片时，我刚刚又遇到了 FizzBuzz。原帖在这里:Coding Horror: Why Can't Programmers.. Program? 对于那些不知道的人:FizzBu

首页

博学

6Ren·AI

商城

scala - 编写 spark UDF(而不是将 UDF 作为一个)时是否会降低性能？