java - Spark 工作之间的巨大时间差距-6ren

java - Spark 工作之间的巨大时间差距

转载作者：行者123 更新时间：2023-12-05 06:59:32

28

4

我创建并保留了一个 df1，然后我在上面执行以下操作:

df1.persist (From the Storage Tab in spark UI it says it is 3Gb)

df2=df1.groupby(col1).pivot(col2) (This is a df with 4.827 columns and 40107 rows)
df2.collect
df3=df1.groupby(col2).pivot(col1) (This is a df with 40.107 columns and 4.827 rows)

-----it hangs here for almost 2 hours-----

df4 = (..Imputer or na.fill on df3..)
df5 = (..VectorAssembler on df4..)
(..PCA on df5..)
df1.unpersist

我有一个包含 16 个节点的集群(每个节点有 1 个 worker 和 1 个具有 4 个内核和 24Gb Ram 的执行器)和一个 master(有 15Gb 的 Ram)。 spark.shuffle.partitions 也是 192。它挂起 2 小时，没有任何反应。 Spark UI 中没有任何 Activity 。为什么它挂了这么久？是 DagScheduler 吗？我怎样才能检查它？如果您需要更多信息，请告诉我。

----编辑1----

在等待将近两个小时后，它继续进行，然后最终失败。以下是 Spark UI 中的阶段和执行器选项卡:

此外，在工作节点的 stderr 文件中，它说:

OpenJDK 64-Bit Server VM warning: INFO: os::commit_memory(0x00000003fe900000, 6434586624, 0) failed; error='Cannot allocate memory' (errno=12)

此外，似乎在 stderr 和 stdout 旁边的文件夹中生成了一个名为“hs_err_pid11877”的文件，内容如下:

There is insufficient memory for the Java Runtime Environment to continue.Native memory allocation (mmap) failed to map 6434586624 bytes for committing reserved memory.Possible reasons:The system is out of physical RAM or swap spaceThe process is running with CompressedOops enabled, and the Java Heap may be blocking the growth of the native heapPossible solutions:Reduce memory load on the systemIncrease physical memory or swap spaceCheck if swap backing store is fullDecrease Java heap size (-Xmx/-Xms)Decrease number of Java threadsDecrease Java thread stack sizes (-Xss)Set larger code cache with -XX:ReservedCodeCacheSize=JVM is running with Zero Based Compressed Oops mode in which the Java heap isplaced in the first 32GB address space. The Java Heap base address is themaximum limit for the native heap growth. Please use -XX:HeapBaseMinAddressto set the Java Heap base and to place the Java Heap above 32GB virtual address.This output file may be truncated or incomplete.Out of Memory Error (os_linux.cpp:2792), pid=11877, tid=0x00007f237c1f8700JRE version: OpenJDK Runtime Environment (8.0_265-b01) (build 1.8.0_265-8u265-b01-0ubuntu2~18.04-b01)Java VM: OpenJDK 64-Bit Server VM (25.265-b01 mixed mode linux-amd64 compressed oops)Failed to write core dump. Core dumps have been disabled. To enable core dumping, try "ulimit -c unlimited" before starting Java again

...以及它失败的任务的其他信息，GC信息等。

----编辑2----

这是最后一个枢轴的任务部分(阶段图片中 ID 为 16 的阶段).. 就在悬挂之前。似乎所有 192 个分区都有相当多的数据，从 15 到 20MB。

最佳答案

Spark 中的

pivot 生成一个额外的 Stage 来获取枢轴值，这发生在水下并且可能需要一些时间并且取决于您的资源分配方式等。

关于java - Spark 工作之间的巨大时间差距，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/64403440/

28

4

0

文章推荐：带伺服控制的 ESP32-cam 将无法工作。开发环境

文章推荐： python - 如何在 python 中以两位数 (00.00.00) 获取小时格式？

文章推荐： javascript - Json 对象在 IE11 中无法正确获取

文章推荐： laravel - 我正在尝试使用关系获取名称

mysql - 如何获取每个日期的最小(时间)和最大(时间)
您好，我是使用 xampp 的 PHPmyadmin 新手，没有 MYSQL 背景。当我喜欢研究它是如何工作的时，我的脑海中浮现出一个想法，它让我一周都无法休眠，因为我似乎无法弄清楚如何使用 MIN(
pointers - 时间.时间 : pointer or value
Go docs say (强调): Programs using times should typically store and pass them as values, not pointers.
MySQL:查找在一个日期(时间)有条目但在另一个日期(时间)没有条目的用户行
我有一组用户在 8 月 1 日有一个条目。我想找到在 8 月 1 日有条目但在 8 月 2 日没有做任何事情的用户。现在是 10 月，所以事件已经过去很久了。我有限的知识说: SELECT * F
json - 时间 JSON 编码为 0 时间
我有以下代码，主要编码和取消编码时间结构。这是代码 package main import ( "fmt" "time" "encoding/json" ) type chec
cpu - 用户 CPU 时间 vs 系统 CPU 时间？
您能详细解释一下“用户 CPU 时间”和“系统 CPU 时间”吗？我读了很多，但我不太理解。最佳答案区别在于时间花在用户空间还是内核空间。用户 CPU 时间是处理器运行程序代码(或库中的代码)所花
profiling - 我应该使用什么分析器来测量_real_ 时间(包括等待系统调用)在此函数中花费，而不是 _CPU_ 时间
应用程序不计算东西，但做输入/输出、读取文件、使用网络。我希望探查器显示它。我希望像 callgrind 中的东西一样，在每个问题中调用 clock_gettime。或者像 oprofile 那样
jQuery 计时器可以在时间 x、时间 y、时间 z 上触发事件吗？
目前我的 web 应用程序接收 websocket 数据来触发操作。这会在页面重新加载时中断，因此我需要一个能够触发特定事件的客户端解决方案。这个想法可行吗？假设你有 TimeX = curre
linux - 找出 JBoss 消耗了多少 cpu 时间、内存和 I/O 时间？
很难说出这里问的是什么。这个问题是含糊的、模糊的、不完整的、过于宽泛的或修辞性的，无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开它，visit the help center 。已关
java - 将 Joda 时间 Instant 转换为 Java 时间 Instant
我有一个 Instant (org.joda.time.Instant) 的实例，我在一些 api 响应中得到它。我有另一个来自 (java.time.Instant) 的实例，这是我从其他调用中获得
python - 如何集成一个函数 w.r.t 时间；即 'y' 是一个数组，时间(t)的值从 1 到 3000 不等
如何集成功能 f(y) w.r.t 时间;即 'y'是一个包含 3000 个值和值 time(t) 的数组从 1 到 3000 不等。所以，在整合 f(y) 后我需要 3000 个值. 积分将是不确定
时间:如何以编程方式创建命名空间？
可以通过 CLI 创建命名空间，但是如何使用 Java SDK 来创建命名空间？最佳答案它以编程方式通过 gRPC API 完成由服务公开。在 Java 中，生成的 gRPC 客户端可以通过 W
Java日期DST调整我的日期/时间
我有一个函数，它接受 2 组日期(开始日期和结束日期)，这些日期将用于我的匹配引擎我必须知道start_date1和end_date1是否在start_date2和end_date2内快进:当我在
Python运行命令行(时间)
我想从 Python 脚本运行“time”unix 命令，以计算非 Python 应用程序的执行时间。我会使用 os.system 方法。有什么方法可以在Python中保存这个输出吗？我的目标是多次运
时间/日期轴的漂亮图形标签的算法？
我正在寻找一种“漂亮的数字”算法来确定日期/时间值轴上的标签。我熟悉 Paul Heckbert's Nice Numbers algorithm . 我有一个在 X 轴上显示时间/日期的图，用户可以
powershell - 获取格式化的通用日期/时间
在 PowerShell 中，您可以格式化日期以返回当前小时，如下所示: Get-Date -UFormat %H 您可以像这样在 UTC 中获取日期字符串: $dateNow = Get-Date
javascript - 检测子窗口何时加载 "each"时间
我正在尝试使用 Javascript 向父子窗口添加一些页面加载检查功能。我的目标是“从父窗口”检测，每次子窗口完全加载然后执行一些代码。我在父窗口中使用以下代码示例: childPage=wi
FFMPEG Drawtext 时间
我正在尝试设置此 FFmpeg 命令的 drawtext 何时开始，我尝试使用 start_number 但看起来它不会成功。 ffmpeg -i 1.mp4 -acodec aac -keyint_
excel - 将长日期文本转换为日期/时间
我收到了一个 Excel (2010) 电子表格，它基本上是一个文本转储。单元格 - J8 具有以下信息 2014 年 2 月 4 日星期二 00:08:06 EST 单元格 - L8 具有以下信息
excel - 时间/日期未转换
我收到的原始数据包含一列具有以下日期和时间戳格式的数据: 2014 年 3 月 31 日凌晨 3:38 单元格的格式并不一致，因为有些单元格有单个空格，而另一些单元格中有两个或三个字符之间的空格。所以
Grails - 如何在我的应用程序中显示版本和构建日期/时间
我想知道是否有办法在我的 Grails 应用程序顶部显示版本和构建日期。编辑:我应该说我正在寻找构建应用程序的日期/时间。最佳答案在您的主模板中，或任何地方。 Server version:

首页

博学

6Ren·AI

商城

java - Spark 工作之间的巨大时间差距