apache-spark - AWS EMR 多作业依赖争用-6ren

apache-spark - AWS EMR 多作业依赖争用

转载作者：行者123 更新时间：2023-12-02 19:12:33

25

4

问题
我试图在 EMR 中运行 2 个 pyspark 步骤，这两个步骤都使用 KinesisUtils 从 Kinesis 读取。这需要依赖库 spark-streaming-kinesis-asl_2.11。
我正在使用 Terraform 来建立 EMR 集群并使用 args 调用这些步骤:
--packages org.apache.spark:spark-streaming-kinesis-asl_2.11:2.4.5
从 maven 下载 jar 的两个步骤启动时似乎存在争用，并导致校验和失败。
尝试的事情

我尝试使用以下命令将 jar 的下载移动到 bootstrap bash 脚本:

须藤 spark-shell --packages org.apache.spark:spark-streaming-kinesis-asl_2.11:2.4.5
这会导致问题，因为 spark-shell 仅在主节点上可用，而 bootstrap 尝试在所有节点上运行。

我尝试将上述内容限制为仅在使用

的主机上运行

grep-q'"isMaster":true'/mnt/var/lib/info/instance.json ||{echo "不在主节点上运行，无事可做"&& exit 0;}
那似乎不起作用。

我试图在 EMR configuration.json 中添加 spark 配置来做到这一点
{
“分类”:“ Spark 默认”，
“特性”: {

"spark.jars.packages": "org.apache.spark:spark-streaming-kinesis-asl_2.11:2.4.5"

}
}

这也不起作用，似乎阻止了所有 jar 被复制到主节点目录
/home/hadoop/.ivy2/cache
手动工作是登录到主节点并运行
须藤 spark-shell --packages org.apache.spark:spark-streaming-kinesis-asl_2.11:2.4.5
然后在没有 --packages 选项的情况下手动提交作业。
目前，我需要做的就是分别手动启动失败的作业(AWS 控制台中的克隆步骤)并且一切运行正常。
我只是希望能够在所有步骤成功启动的情况下启动集群，任何帮助将不胜感激。

最佳答案

下载需要的jar包并上传到s3。(一次)

从步骤运行 pyspark 作业时，通过 --jars <s3 location of jar>在您的 spark-submit

关于apache-spark - AWS EMR 多作业依赖争用，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62680177/

25

4

0

文章推荐： docker - docker容器如何在Mesos/Marathon设置中进行通信

文章推荐： jenkins - 在Docker容器中使用Jenkins运行测试

文章推荐： hadoop - 如何将文件从远程服务器复制到HDFS

dependencies - gobject 依赖 glib 还是 glib 依赖 gobject？
我在 gobject 上阅读了一个维基百科页面，上面写着， Depending only on GLib and libc, GObject is a cornerstone of GNOME and
wpf - 依赖属性依赖于另一个
如何注册一个依赖属性，其值是使用另一个依赖属性的值计算的？由于 .NET 属性包装器在运行时被 WPF 绕过，因此不应在 getter 和 setter 中包含逻辑。解决方案通常是使用 Proper
ActionBarSherlock maven 依赖
我一直在尝试将 ActionbarSherlock maven 依赖项添加到我的项目中 com.actionbarsherlock library 4.2.0 在我的 po
oop - 依赖/依赖是什么意思？
http://tutorials.jenkov.com/ood/understanding-dependencies.html#whatis说(强调我的): Whenever a class A us
wpf - 依赖/附加属性如何在内部工作以及值存储在哪里？
我对所有这些魔法有点不清楚。据我了解，依赖属性是从 DependencyObject 继承的，因此存储值: 如果分配了值(在本地字典中)，则在实例本身中或者如果未指定值，则从指向父元素的链接中获取
Twilio RestSharp 依赖
我刚刚更新了在 ASP.NET Framework 4.5.2 版上运行的 MVC Web 应用程序。我正在使用 Twilio 发送 SMS 消息: var twilio = new TwilioRe
java - Spring 依赖
我刚刚发现了一件令人生畏的事情。 spring 依赖坐标有两个版本。项目依赖于 spring mvc 和 spring flow。有两组并行的依赖项。 Spring MVC 具有以下方案的依赖项
Maven 依赖 picocontainer
我正在尝试包含的 maven 依赖项 org.jacorb jacorb 2.3.1 依赖已解决，但它导致另一个依赖 picocontainer 出现问题: [ERROR
Haskell 依赖 hell
我正在尝试在 Haskell 项目中包含特定版本的库。该库是住宿加早餐型的(用于 martix 操作)，但我需要特定的 0.4.3 版本，该版本修复了乘法实现的错误。所以，我的 stack.yaml
iphone - 依赖 UIPickerView
有谁知道如何制作依赖的 UIPickerView.例如，当我选择组件一的第 2 行时，组件二的标题会发生变化吗？我在互联网上查找过，没有真正的答案，我尝试过使用 if 和 switch 语句，但它们
Maven WAR 依赖
我正在编写一个用于验收测试的项目，由于各种原因，这依赖于另一个打包为 WAR 的项目。我已成功使用 maven-dependency-plugin 解压 WAR，但无法让我的项目包含解压的 WEB-I
Django，依赖 session
或多或少我在 session 上大量构建我的网站(特别是重定向用户等)，我很好奇这是否是一种危险的做法。禁用浏览器 cookie 保存的用户的大致比例是多少？我愿意接受任何建议:) 谢谢最佳答案 s
scala - 依赖 future
开始玩 Scala futures，我被依赖的 futures 困住了。让我们举个例子。我搜索地点并获得 Future[Seq[Place]]。对于这些地点中的每一个，我搜索最近的地铁站(该服务返回
Django，依赖 session
或多或少我在 session 上大量构建我的网站(特别是重定向用户等)，我很好奇这是否是一种危险的做法。禁用浏览器 cookie 保存的用户的大致比例是多少？我愿意接受任何建议:) 谢谢最佳答案 s
c - GLIBC 依赖
我有一个二进制文件，需要一些 *.so 文件才能执行。现在，当我尝试在一些旧机器上执行它时，它会显示 /lib/libc.so.6: version `GLIBC_2.4' not found 如何将
javascript - DyGraph 依赖
我尝试使用 Dygraph 来表示图表，我在 https://github.com/danvk/dygraphs 中找到了代码，但是它有太多的依赖文件，我觉得很烦人。是否有一个文件可以容纳所有必需的
javascript - Jasmine 依赖
我正在处理一个 javascript 文件，该文件 a) 声明一个具有函数的对象，并且 b) 使用它期望在外部声明的散列调用该对象的 init 函数。我的 Jasmine 规范提示它找不到哈希，因为它
javascript - Angular 依赖
最近我一直在学习 Angular 并且进展顺利，但是关于依赖注入(inject)的一些事情我仍然不清楚。是否有任何理由在我的 app.js 文件中声明我的应用程序的其他部分(服务、 Controll
php - 依赖 "mysql_insert_id"
考虑一个名为 foo 的表，它有 id (PRIMARY & AUTO_INCREMENT) 列。我正在向该表中插入一行，挑战从此时开始。 $db->query("INSERT INTO `foo`
javascript - 依赖/级联下拉菜单
我正在使用级联下拉 jquery 插件。 (https://github.com/dnasir/jquery-cascading-dropdown) 我有两个下拉菜单。 “客户端”和“站点”。根据您

首页

博学

6Ren·AI

商城

apache-spark - AWS EMR 多作业依赖争用