apache-spark - Spark 。约 1 亿行。大小超过 Integer.MAX

apache-spark - Spark 。约 1 亿行。大小超过 Integer.MAX_VALUE？

转载作者：行者123 更新时间：2023-12-04 05:11:13

24

4

(这是在小型三机 Amazon EMR 集群上运行的 Spark 2.0)

我有一个 PySpark 作业将一些大文本文件加载到 Spark RDD 中，执行 count() 后成功返回 158,598,155。

然后该作业将每一行解析为一个 pyspark.sql.Row 实例，构建一个 DataFrame，并进行另一次计数。 DataFrame 上的第二个 count() 导致 Spark 内部代码异常 Size exceeds Integer.MAX_VALUE。这适用于较小的数据量。有人可以解释为什么/如何发生这种情况吗？

org.apache.spark.SparkException: Job aborted due to stage failure: Task 22 in stage 1.0 failed 4 times, most recent failure: Lost task 22.3 in stage 1.0 (TID 77, ip-172-31-97-24.us-west-2.compute.internal): java.lang.IllegalArgumentException: Size exceeds Integer.MAX_VALUE
    at sun.nio.ch.FileChannelImpl.map(FileChannelImpl.java:869)
    at org.apache.spark.storage.DiskStore$$anonfun$getBytes$2.apply(DiskStore.scala:103)
    at org.apache.spark.storage.DiskStore$$anonfun$getBytes$2.apply(DiskStore.scala:91)
    at org.apache.spark.util.Utils$.tryWithSafeFinally(Utils.scala:1287)
    at org.apache.spark.storage.DiskStore.getBytes(DiskStore.scala:105)
    at org.apache.spark.storage.BlockManager.getLocalValues(BlockManager.scala:439)
    at org.apache.spark.storage.BlockManager.get(BlockManager.scala:604)
    at org.apache.spark.storage.BlockManager.getOrElseUpdate(BlockManager.scala:661)
    at org.apache.spark.rdd.RDD.getOrCompute(RDD.scala:330)
    at org.apache.spark.rdd.RDD.iterator(RDD.scala:281)
    at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:38)
    at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:319)
    at org.apache.spark.rdd.RDD.iterator(RDD.scala:283)
    at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:38)
    at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:319)
    at org.apache.spark.rdd.RDD.iterator(RDD.scala:283)
    at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:38)
    at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:319)
    at org.apache.spark.rdd.RDD.iterator(RDD.scala:283)
    at org.apache.spark.scheduler.ShuffleMapTask.runTask(ShuffleMapTask.scala:79)
    at org.apache.spark.scheduler.ShuffleMapTask.runTask(ShuffleMapTask.scala:47)
    at org.apache.spark.scheduler.Task.run(Task.scala:85)
    at org.apache.spark.executor.Executor$TaskRunner.run(Executor.scala:274)
    at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1142)
    at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:617)
    at java.lang.Thread.run(Thread.java:745)

PySpark 代码:

raw_rdd = spark_context.textFile(full_source_path)

# DEBUG: This call to count() is expensive
# This count succeeds and returns 158,598,155
logger.info("raw_rdd count = %d", raw_rdd.count())
logger.info("completed getting raw_rdd count!!!!!!!")

row_rdd = raw_rdd.map(row_parse_function).filter(bool)
data_frame = spark_sql_context.createDataFrame(row_rdd, MySchemaStructType)

data_frame.cache()
# This will trigger the Spark internal error
logger.info("row count = %d", data_frame.count())

最佳答案

错误不是来自 data_frame.count() 本身，而是因为通过 row_parse_function 解析行会产生一些不符合指定整数类型的整数在 MySchemaStructType 中。

尝试将架构中的整数类型增加到 pyspark.sql.types.LongType() 或者让 spark 通过省略架构来推断类型(但这会减慢评估速度)。

关于apache-spark - Spark 。约 1 亿行。大小超过 Integer.MAX_VALUE？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/38961545/

24

4

0

文章推荐： vb.net - 是否可以在VB.NET中获得引用方法？

文章推荐： ruby-on-rails - 如何在MVC下创建简洁，RESTful向导？

文章推荐： linux-kernel - Linux 'socketcall'系统调用实现

文章推荐： apache-spark - 带有点 '.' 的数据框的 pyspark 访问列

超过 Youtube 视频上传限制
我使用这个 cmd 应用程序 https://github.com/tokland/youtube-upload 上传 50 个视频后，我收到此错误: [RequestError] Server re
超过 Docker 最大深度
尝试将 docker 容器提交到镜像时出现错误: [root@dockerregistry /]# docker commit da4180ab1536 dockerregistry:5000/myi
c - 优先规则==超过=
我只是想知道这样做会更好吗: if((fd = open(filename, O_RDWR)) == -1) { fprintf(stderr, "open [ %s ]\n", strerror(e
elasticsearch - 低磁盘水印 [??%] 超过
我在我的开发机器(单个笔记本)中使用 Elasticsearch 1.4.4。一切都设置为默认值，因为我从未更改过任何设置。当我启动它时，我通常会收到以下消息: [2015-10-27 09:38:
超过 MySQL 锁等待超时
我收到错误 Lock wait timeout exceeded;尝试重新启动事务。这是什么原因，如何解决？仅供引用:MySQL 配置文件中的 innodb_lock_wait_timeout = 1
超过 2 列的松弛 block
我对 Slack 中的 block 功能有疑问。有人设法构建 3 列而不是 2 列吗？我凭直觉尝试了以下代码，但它不起作用: { "blocks": [ {
html - 固定尺寸 DIV 超过
div 中的内容超过由 css 决定的固定大小。 #fixeddiv { position: fixed; margin: auto; max-height: 300px
android - 超过 EditText 限制时提醒用户
我想将 EditText 字段限制为 150 个字符，我可以很容易地做到这一点。但是，当用户试图超过该限制时，我还需要通过键入(即第 151 个字符)或粘贴超过 150 个字符来提醒用户。解决这个问
FFmpeg 超过 1000 帧重复且输入高度不匹配
我目前正在使用此代码并排记录两个窗口: ffmpeg -f gdigrab -framerate 30 -i title="" -f gdigrab -framerate 30 -i title=""
excel - 超过 64 个嵌套限制的复杂替换
我在几个包含长字符串的单元格上使用嵌套的 SUBSTITUE 函数，并定期更新 SUBSTITUE fx，这导致我将其复制并粘贴到所有需要它的单元格中。问题是，我的 SUBSTITUTE 列表会随着时
css - 超过 div 大小的图像
我创建了一个标题 div，如下所示:
adsense - 超过 9 个就看不到谷歌广告
Here is the demo link 您怎么看，页面中只有 8 个广告可见，但我有 14 个广告。我已阅读有关广告限制的信息 here但不明白是不是我的情况？有人可以给我确切的答案，为什么我看不
c - 超过 50 万个元素的快速排序崩溃
我的非常简单的算法 - C 中的快速排序有问题。它非常有效(随机化大约 0.1 秒并检查列表是否已排序)但是当我想要对超过 500k 的元素进行排序时它会崩溃。不幸的是，我需要对它们进行更多排序，因为
c++ - 超过 Hackerrank 的时间限制
我成功解决了一个关于 Hackerrank 的问题，它通过了所有测试用例，但我得到了一个错误，超过了时间限制。我猜如果我优化我的代码它会工作，但我想不出任何方法来使我的代码更有效率。问题是: 对大小
vim - 超过 1 个字符的环绕视觉文本
你会如何用包围下面的文字3 个反引号 ```使用 tpope 的 Vim Surround . 我所能做的就是 1 个反引号使用 S`在视觉模式下: 最佳答案这不是你问的，但这可以在没有环绕的情
elasticsearch - 超过 SwifType 速率限制
我目前有一个模拟账户。我正在尝试为我的雇主使用 SwifType 制作 POC。我们有一个非常大的数据库，每 1 小时索引一次，并创建一个 JSON 文件。我认为与 Elastic 的集成将非常容易，
c# - 超过 SMTP 限制发送电子邮件
我为一个大约有 100 到 120 名成员的小型组织维护网站。每个月，我们都会发送一封电子邮件，通知我们的成员我们将在即将举行的 session 中讨论的主题。我正在尝试使用我们的网站为我们提供一
vba - 超过 255 个字符的数组公式
这个问题已经有答案了: How to automatically input an array formula as string with more than 255 characters in l
java - 超过 FileSizeMax 时取消文件上传
我有一个在 JBoss 6.1 中运行的 JSF 应用程序，它使用内部Tomcat Servlet 容器。我已经通过apache commons文件上传实现了上传。我想防止上传过大的文件并设置了属性
mysql - 超过 PyMYSQL 锁等待超时
当我尝试在 PyMySQL 上执行查询时，出现以下错误: pymysql.err.InternalError: (1205, 'Lock wait timeout exceeded; try rest

首页

博学

6Ren·AI

商城

apache-spark - Spark 。约 1 亿行。大小超过 Integer.MAX_VALUE？