- Java 双重比较
- java - 比较器与 Apache BeanComparator
- Objective-C 完成 block 导致额外的方法调用?
- database - RESTful URI 是否应该公开数据库主键?
假设我在 Spark 中有一份工作;
CSV 文件 ==> 按列过滤 ==> 采样 ==> 另存为 JSON
现在我的要求是如何知道作业的哪个步骤(获取文件或过滤或采样)当前正在以编程方式执行(最好使用 Java API)?有什么办法吗?
我可以使用 SparkListener 类跟踪 Job、Stage 和 Task。它可以像跟踪阶段 ID 一样完成。但是如何知道作业链中的哪个阶段是哪个阶段的 Id。
当考虑按列过滤完成时,我想向用户发送通知。为此,我创建了一个扩展 SparkListener 类的类。但是我无法找到从哪里可以获得当前正在执行的转换名称的名称。是否有可能进行跟踪?
public class ProgressListener extends SparkListener{
@Override
public void onJobStart(SparkListenerJobStart jobStart)
{
}
@Override
public void onStageSubmitted(SparkListenerStageSubmitted stageSubmitted)
{
//System.out.println("Stage Name : "+stageSubmitted.stageInfo().getStatusString()); giving action name only
}
@Override
public void onTaskStart(SparkListenerTaskStart taskStart)
{
//no such method like taskStart.name()
}
}
最佳答案
您无法确切知道过滤操作何时开始或结束。
那是因为你有转换(filter
,map
,...)和 Action (count
,foreach
,...)。 Spark 会将尽可能多的操作放在一个阶段中。然后该阶段在输入的不同分区上并行执行。问题来了。
假设你有几个 worker 和下面的程序
LOAD ==> MAP ==> FILTER ==> GROUP BY + Aggregation
该程序可能有两个阶段:第一阶段将加载文件并应用map
和filter
。然后输出将被打乱以创建组。在第二阶段将执行聚合。
现在的问题是,您有多个工作人员,每个工作人员将并行处理一部分输入数据。也就是说,集群中的每个执行程序都会收到一份程序(当前阶段)的副本,并在分配的分区上执行它。
您会看到,您将拥有多个并行执行的 map
和 filter
运算符实例,但不一定同时执行。在极端情况下,worker 1 将在 worker 20 开始之前完成阶段 1(因此在 worker 20 之前完成其 filter
操作)。
对于 RDD,Spark 使用 iterator model一个舞台里面。然而,对于最新 Spark 版本中的数据集,它们会在分区上创建一个循环并执行转换。这意味着在这种情况下,Spark 本身并不知道转换运算符何时完成单个任务!
长话短说:
所以,现在我已经遇到了同样的问题:
在我们的 Piglet project (请允许一些广告 ;-) )我们从 Pig Latin 脚本生成 Spark 代码并希望分析脚本。我最终在所有 用户操作符 之间插入了 mapPartition
操作符,它会将分区 ID 和当前时间发送到将评估消息的服务器。然而,这个解决方案也有其局限性……我还不完全满意。
但是,除非你能够修改程序,否则恐怕你无法实现你想要的。
关于java - 如何知道 Apache Spark 中当前正在运行作业的哪个阶段?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/42224486/
我试图通过这段代码读取未知数量的整数: while (1) { int c = getchar (); if (c == EOF) break;
我正试图找到一个类似于谷歌分析日期选择器的日期选择器: 知道 jQuery 是否提供了类似的东西吗? 最佳答案 这个 Twitter Bootstrap 风格的日期范围选择器非常接近。 https:/
我正在使用 javascript。如何获取当前 URL 的路径并将其分配给我的代码?这是我的代码: $(document).ready(function() { $(".share").hides
如何获得今天的Julian day number (JDN)相等的?或任何日期? 我看了又看,但只发现了一些产生“year-dayOfYear”的函数,而不是:2457854。 最佳答案 在 bash
我有相当简单的 UDP 服务器写在 c 上。 有时我需要知道在套接字中排队的所有 udp 数据包(字节)的当前长度。 据我了解,getsockopt 没有得到这样的信息。 欢迎使用 Linux 和 F
我一直在寻找几个小时来找到一个可以在图像中添加诸如“填充:5px”之类的东西的插件。每个人都通过纯 html 做到这一点吗?我们的客户需要一种方法来简单地使用按钮或右键单击上下文菜单来添加它。有什么建
是否有可能获得当前正在执行的 TCL 脚本的完整路径? 在 PHP 中,它将是:__FILE__ 最佳答案 根据“当前正在执行的 TCL 脚本”的含义,您实际上可能会寻找 info script ,甚
我最近从直接使用 ISession 转向了包装的 ISession,即工作单元类型模式。 我曾经使用 SQL Lite(内存中)对此进行测试。我有一个简单的帮助器类,它配置我的 SessionFact
我按照步骤操作 here在 WebStorm 中配置代码完成和其他内容,但我仍然收到以下语法错误。 我该如何解决这个问题? 最佳答案 通过相应地将“JavaScript 语言版本”(Settings/
我可以为我团队的 TFS 当前 Sprint 任务板添加书签吗?我们有两周的冲刺,因此 URL 每两周更改一次。 默认 URL 的形式为: http://[Server]/tfs/[Project]/
是否有 Subversion 命令可以显示当前版本号? 在svn checkout之后,我想启动一个脚本并需要变量中的修订号。如果有像 svn info get_revision_number 这样的
我正在编写表单的一个组件 首次安装组件时,sources={{}} ,一本空字典。由于该组件包装了现有的 Javascript 库,因此我正在实现一个自定义比较函数。为了让这个 diffing 函数
无论系统时间设置为多少以及机器所在的时区,我都需要正确的 UTC 时间。 (即使我必须打电话到互联网才能同步......) 是否有一些库或其他方法可以优雅地做到这一点? 最佳答案 如果您想获得准确可靠
我一边编码,一边拿出一些我和 friend 建立的旧网站来重新开始工作。我已经有一段时间没有做过任何 AJAX 了,当我试图找出我的代码失败的地方时,我发现没有显示很多资源。我猜这是因为我使用的是旧方
由于对性能的巨大影响,我从不怀疑我现在的桌面CPU是否有分支预测。当然可以。但各种 ARM 产品又如何呢? iPhone或Android手机有分支预测吗?较旧的任天堂 DS?基于 PowerPC 的
我有一个具有以下有效负载的 JWT: { "id": "394a71988caa6cc30601e43f5b6569d52cd7f6df", "jti": "394a71988caa6cc30
从其他一些帖子中,我能够通过以下方式获取当前 URI: 但是以下方法不起作用: 我很好奇为什么上面的方法不起作用,以及如何将当前 URI 分配给字符串。 最佳答案 每the javadocs ,g
我在表格 View 中有几个单元格。现在在任何给定的时间点,我想计算 View 中单元格的当前高度,即如果它是 View 的 3/4,它应该返回 (cellheight)*3/4 高度。 我通过以下方
这是网站的身份验证脚本。这安全吗?是最近的节目吗?它已经过时了吗?是否有“更好更安全的方法”我很新,但我没有看到太多地方使用 header 授权。 如有任何帮助,我们将不胜感激!这是我制作的第一个登录
我已经在其他 stackoverflow 线程上检查过这个错误,但在我的代码中没有发现任何错误。也许我累了,但我觉得还好。 网站.urls.py: from django.conf.urls impo
我是一名优秀的程序员,十分优秀!