python - 用户定义的函数破坏了 pyspark 数据帧-6ren

python - 用户定义的函数破坏了 pyspark 数据帧

转载作者：太空宇宙更新时间：2023-11-03 11:26:09

24

4

我的spark版本是1.3，我用的是pyspark

我有一个名为 df 的大型数据框。

from pyspark import SQLContext
sqlContext = SQLContext(sc)
df = sqlContext.parquetFile("events.parquet")

然后我选择数据框的几列并尝试计算行数。这很好用。

df3 = df.select("start", "end", "mrt")
print(type(df3))
print(df3.count())

然后我应用一个用户定义的函数将其中一列从字符串转换为数字，这也可以正常工作

from pyspark.sql.functions import UserDefinedFunction
from pyspark.sql.types import LongType
CtI = UserDefinedFunction(lambda i: int(i), LongType())
df4 = df2.withColumn("mrt-2", CtI(df2.mrt))

但是，如果我尝试计算行数，我会得到一个异常，即使类型显示它是一个数据框，就像 df3 一样。

print(type(df4))
print(df4.count())

我的错误:

---------------------------------------------------------------------------
Py4JJavaError                             Traceback (most recent call last)
<ipython-input-10-53941e183807> in <module>()
      8 df4 = df2.withColumn("mrt-2", CtI(df2.mrt))
      9 print(type(df4))
---> 10 print(df4.count())
     11 df3 = df4.select("start", "end", "mrt-2").withColumnRenamed("mrt-2", "mrt")

/data/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/lib/spark/python/pyspark/sql/dataframe.py in count(self)
    299         2L
    300         """
--> 301         return self._jdf.count()
    302 
    303     def collect(self):

/data/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/lib/spark/python/lib/py4j-0.8.2.1-src.zip/py4j/java_gateway.py in __call__(self, *args)
    536         answer = self.gateway_client.send_command(command)
    537         return_value = get_return_value(answer, self.gateway_client,
--> 538                 self.target_id, self.name)
    539 
    540         for temp_arg in temp_args:

/data/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/lib/spark/python/lib/py4j-0.8.2.1-src.zip/py4j/protocol.py in get_return_value(answer, gateway_client, target_id, name)
    298                 raise Py4JJavaError(
    299                     'An error occurred while calling {0}{1}{2}.\n'.
--> 300                     format(target_id, '.', name), value)
    301             else:
    302                 raise Py4JError(

Py4JJavaError: An error occurred while calling o152.count.
: org.apache.spark.SparkException: Job aborted due to stage failure: Task 1379 in stage 12.0 failed 4 times, most recent failure: Lost task 1379.3 in stage 12.0 (TID 27021, va1ccogbds01.lab.ctllabs.io): org.apache.spark.api.python.PythonException: Traceback (most recent call last):
  File "/data/0/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/jars/spark-assembly-1.3.0-cdh5.4.7-hadoop2.6.0-cdh5.4.7.jar/pyspark/worker.py", line 101, in main
    process()
  File "/data/0/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/jars/spark-assembly-1.3.0-cdh5.4.7-hadoop2.6.0-cdh5.4.7.jar/pyspark/worker.py", line 96, in process
    serializer.dump_stream(func(split_index, iterator), outfile)
  File "/data/0/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/jars/spark-assembly-1.3.0-cdh5.4.7-hadoop2.6.0-cdh5.4.7.jar/pyspark/serializers.py", line 236, in dump_stream
    vs = list(itertools.islice(iterator, batch))
  File "/data/cloudera/parcels/CDH-5.4.7-1.cdh5.4.7.p0.3/lib/spark/python/pyspark/sql/functions.py", line 119, in <lambda>
  File "<ipython-input-10-53941e183807>", line 7, in <lambda>
TypeError: int() argument must be a string or a number, not 'NoneType'

at org.apache.spark.api.python.PythonRDD$$anon$1.read(PythonRDD.scala:135)
at org.apache.spark.api.python.PythonRDD$$anon$1.next(PythonRDD.scala:98)
at org.apache.spark.api.python.PythonRDD$$anon$1.next(PythonRDD.scala:94)
at org.apache.spark.InterruptibleIterator.next(InterruptibleIterator.scala:43)
at scala.collection.Iterator$$anon$13.hasNext(Iterator.scala:371)
at scala.collection.Iterator$$anon$11.hasNext(Iterator.scala:327)
at org.apache.spark.rdd.RDD$$anonfun$zip$1$$anon$1.hasNext(RDD.scala:743)
at scala.collection.Iterator$$anon$11.hasNext(Iterator.scala:327)
at scala.collection.Iterator$$anon$11.hasNext(Iterator.scala:327)
at org.apache.spark.sql.execution.Aggregate$$anonfun$execute$1$$anonfun$6.apply(Aggregate.scala:127)
at org.apache.spark.sql.execution.Aggregate$$anonfun$execute$1$$anonfun$6.apply(Aggregate.scala:124)
at org.apache.spark.rdd.RDD$$anonfun$14.apply(RDD.scala:634)
at org.apache.spark.rdd.RDD$$anonfun$14.apply(RDD.scala:634)
at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:35)
at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:277)
at org.apache.spark.rdd.RDD.iterator(RDD.scala:244)
at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:35)
at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:277)
at org.apache.spark.rdd.RDD.iterator(RDD.scala:244)
at org.apache.spark.scheduler.ShuffleMapTask.runTask(ShuffleMapTask.scala:68)
at org.apache.spark.scheduler.ShuffleMapTask.runTask(ShuffleMapTask.scala:41)
at org.apache.spark.scheduler.Task.run(Task.scala:64)
at org.apache.spark.executor.Executor$TaskRunner.run(Executor.scala:203)
at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1145)
at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:615)
at java.lang.Thread.run(Thread.java:745)

Driver stacktrace:
at org.apache.spark.scheduler.DAGScheduler.org$apache$spark$scheduler$DAGScheduler$$failJobAndIndependentStages(DAGScheduler.scala:1210)
at org.apache.spark.scheduler.DAGScheduler$$anonfun$abortStage$1.apply(DAGScheduler.scala:1199)
at org.apache.spark.scheduler.DAGScheduler$$anonfun$abortStage$1.apply(DAGScheduler.scala:1198)
at scala.collection.mutable.ResizableArray$class.foreach(ResizableArray.scala:59)
at scala.collection.mutable.ArrayBuffer.foreach(ArrayBuffer.scala:47)
at org.apache.spark.scheduler.DAGScheduler.abortStage(DAGScheduler.scala:1198)
at org.apache.spark.scheduler.DAGScheduler$$anonfun$handleTaskSetFailed$1.apply(DAGScheduler.scala:693)
at org.apache.spark.scheduler.DAGScheduler$$anonfun$handleTaskSetFailed$1.apply(DAGScheduler.scala:693)
at scala.Option.foreach(Option.scala:236)
at org.apache.spark.scheduler.DAGScheduler.handleTaskSetFailed(DAGScheduler.scala:693)
at org.apache.spark.scheduler.DAGSchedulerEventProcessLoop.onReceive(DAGScheduler.scala:1400)
at org.apache.spark.scheduler.DAGSchedulerEventProcessLoop.onReceive(DAGScheduler.scala:1361)
at org.apache.spark.util.EventLoop$$anon$1.run(EventLoop.scala:48)
---------------------------------------------------------------------------

我是否正确使用了用户定义的函数？知道为什么数据框函数对数据框不起作用吗？

最佳答案

从堆栈跟踪来看，您的列似乎包含一个 None 值，它破坏了 int 转换；您可以尝试将 lambda 函数更改为 lambda i: int(i) if i else None，以处理这种情况。

请注意，仅仅因为 df2.withColumn("mrt-2", CtI(df2.mrt)) 没有抛出错误并不意味着您的代码没问题:Spark 具有惰性评估，因此它不会真正尝试运行您的代码，直到您调用 count、collect 或类似的东西。

关于python - 用户定义的函数破坏了 pyspark 数据帧，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/33355850/

24

4

0

文章推荐： mysql - 如果最后一行的值正确则运行查询

文章推荐： python - 我应该预分配一个 numpy 数组吗？

文章推荐： android - 呈现问题 : Android Studio 1. 2.1.1 和 Gradle 1.2.3

文章推荐： python - 将数据框汇总到字典中

canvas - 破坏 Canvas
我正在尝试完成撤消/重做。我正在使用loadFromJSON(...)从我存储在数组中的 Canvas 状态重新构建 Canvas 。基本上，我的想法是破坏现有的 Canvas 并重新构建 Canva
JavaScript iframe 破坏
在某些情况下，我有一个在 iframe 中打开的网页。当它被加载到那个 iframe 中时，我需要它将窗口位置设置为资源以下载文件(所有这些都是为了更新 GreaseMonkey 脚本......所有
android - 破坏 Intent ？
当我创建 Intent 时: Intent in = new Intent(this, myclass.class); this.startActivity(in); 我创建了一个新的 Intent
php - 破坏 Wordpress 网站的简码
我正在我本地版本的 Wordpress 网站上为 Wordpress 创建新的短代码。在 functions.php 中，我添加了例如: function shortTest() { re
javascript - 破坏 JavaScript 代码的特殊字符
我正在为机械网站制作 JavaScript 闪卡游戏。因为我想将方程写在卡片上，所以我需要使用 delta(Δ) 符号。一张卡片可能有:一侧是“功率方程”，另一侧是“P=W/Δt”。如果卡片从第一面
javascript - addClass 破坏 JS
我编写了以下代码: document.addEventListener("DOMContentLoaded", ()=>{ let menu = document.querySelector(
javascript - 破坏 Chrome 缓存以进行浏览器同步重新加载
我的浏览器同步工作正常，但我仍然很难处理之前的 html 的缓存。即使选中了 Chrome 的“禁用缓存”，甚至在隐身模式下也是如此! 要加载页面更改，我总是必须“清除缓存并硬重新加载”。我想知道，
extjs - 破坏 ExtJS 中的上下文菜单？
我注意到每次打开和关闭(通过单击菜单项或单击菜单外的某个区域)时，上下文菜单 ( Ext.menu.Menu ) s 不会从 DOM 中删除，它们只是以某种方式变得不可见。如何改变这个？最佳答案
coq - 破坏 coq 中依赖记录的相等性
给定依赖记录类型: Record FinPath : Type := mkPath { fp_head : S i; fp_tail
teamcity - 破坏 Teamcity 中构建的电子邮件用户
在 Husdon/Jenkins 中，我可以在构建被破坏时设置通知，以向进行破坏构建的 checkin 的用户发送电子邮件。如何在 Teamcity 中执行此操作？我知道个人用户可以通过 Teamc
extjs - 破坏 ExtJS 中的上下文菜单？
我注意到每次打开和关闭(通过单击菜单项或单击菜单外的某个区域)时，上下文菜单 ( Ext.menu.Menu ) s 不会从 DOM 中删除，它们只是以某种方式变得不可见。如何改变这个？最佳答案
django html2text anchor 破坏
使用 MIMEMultipart('alternative') 发送 html 和 pain-text 时将 html 转换为文本时，html 的 anchor 换行 http://127.0.0.
java - 破坏 Activity 导致服务丢失数据
每当我的应用程序最小化时，我都会启动一个服务，该服务向我的 HTTP 服务器发送拉取请求以检查通知，当应用程序恢复时，服务将被终止(以及计划的可运行项)。一切正常，直到我决定终止该应用程序(将其从正在
jQuery Mobile 破坏 OmniAuth
我意识到该框架处于 alpha 阶段，但正在实现 jQuery Mobile破坏了我的omniauth 身份验证。当我尝试登录时，一旦我尝试点击/auth/twitter Controller ，jQ
jquery 破坏 Angular 指令
我对 Angular 比较陌生，经过几个小时的调试，我发现添加 jquery 时存在一些不兼容性。该指令在没有 jquery 的情况下工作正常，但在使用 jquery 时会中断:/ 这是一个 plnk
JQuery .trigger ('submit' )破坏
我发现，因为我正在处理的所有表单都有一个包含“name =“submit””属性的提交按钮，所以当我单击应该触发表单提交的链接时，触发器提交会中断. 有谁知道我该如何解决这个问题。下面的 JQuer
Javascript 破坏 CSS 悬停
我遇到了一个问题:/我得到了一个 CSS 东西，它使悬停时背景位置发生变化。但是当我在 javascript 中运行一个改变悬停的函数后，CSS 停止工作。这是函数: function tree()
javascript - qooxdoo 破坏，处置
谁能给出一个完整的例子来说明 qooxdoo 1.6 中的 dispose 和 destruct 是如何工作的？，我在 qooxdoo 演示或文档中找不到任何好的示例。谢谢你的建议。最佳答案处
java - JFormattedTextField 破坏 DocumentFilter
我对 JFormattedTextField 有疑问(我将它用作我们所有文本字段的基类)。今天我尝试向该字段的文档添加一个文档过滤器，它工作得很好，但前提是它没有设置格式化程序工厂。问题是，当设置
javascript - 破坏 JavaScript 函数
我有一个点击事件 $('#ship_Move').click(function (event) { event.stopPropagation();

首页

博学

6Ren·AI

商城

python - 用户定义的函数破坏了 pyspark 数据帧