pyspark - 如何在 EMR 笔记本中安装 .jar 依赖项？-6ren

pyspark - 如何在 EMR 笔记本中安装 .jar 依赖项？

转载作者：行者123 更新时间：2023-12-03 20:58:54

26

4

我正在运行 EMR 笔记本(平台:AWS，笔记本:jupyter，内核:PySpark)。
我需要安装一个 .jar 依赖项( sparkdl )来处理一些图像。

使用 Spark-submit，我可以使用:

spark-submit --packages databricks:spark-deep-learning:1.5.0-spark2.4-s_2.11

使用本地笔记本，我可以使用:

spark = (SparkSession
            .config('spark.jars.packages', 'databricks:spark-deep-learning:1.5.0-spark2.4-s_2.11')
            .getOrCreate()
)

但是如何在 EMR 笔记本上做同样的事情呢？

我可以使用 bootstrap 将其安装在每个节点上。但我不知道如何继续...

我可以配置 SparkSession 以使用依赖项。但是笔记本似乎无法访问存储库......而且我不知道让它加载复制到 S3 存储桶上的文件的语法......

编辑:
我试过

%%configure -f
{ "conf":{
          "spark.jars": "s3://p8-fruits/libs/spark-deep-learning-1.5.0-spark2.4-s_2.11.jar"
         }
}

这没有抛出任何错误，但我仍然无法使用它。当我尝试时 import sparkdl , 我收到了 ModuleNotFoundError: No module named 'sparkdl' .

非常感谢您的帮助 !

最佳答案

首先，您可以在 spark.jars.packages 中声明依赖项configure 中的指令魔法:

%%configure
{ 
    "conf": {
        "spark.jars.packages": "databricks:spark-deep-learning:1.5.0-spark2.4-s_2.11" 
    }
}

这对于常见情况应该足够了。
如果您的 EMR 集群无法访问 jar 存储库，您可能需要手动将 jar 放入 HDFS(假设您的 jar 在 /home/hadoop/libs/ 中)
例如

hdfs dfs -put /home/hadoop/libs/spark-deep-learning-1.5.0-spark2.4-s_2.11.jar /libs/spark-deep-learning-1.5.0-spark2.4-s_2.11.jar

并在 jars 内传递指示:

%%configure -f
{ 
    "jars": ["/libs/spark-deep-learning-1.5.0-spark2.4-s_2.11.jar"]
}

关于pyspark - 如何在 EMR 笔记本中安装 .jar 依赖项？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/59372693/

26

4

0

文章推荐： iPhone SDK : Change playback speed using core audio AVAudioPlayer

文章推荐： tensorboard - 如何在张量板中制作表格

dependencies - gobject 依赖 glib 还是 glib 依赖 gobject？
我在 gobject 上阅读了一个维基百科页面，上面写着， Depending only on GLib and libc, GObject is a cornerstone of GNOME and
wpf - 依赖属性依赖于另一个
如何注册一个依赖属性，其值是使用另一个依赖属性的值计算的？由于 .NET 属性包装器在运行时被 WPF 绕过，因此不应在 getter 和 setter 中包含逻辑。解决方案通常是使用 Proper
ActionBarSherlock maven 依赖
我一直在尝试将 ActionbarSherlock maven 依赖项添加到我的项目中 com.actionbarsherlock library 4.2.0 在我的 po
oop - 依赖/依赖是什么意思？
http://tutorials.jenkov.com/ood/understanding-dependencies.html#whatis说(强调我的): Whenever a class A us
wpf - 依赖/附加属性如何在内部工作以及值存储在哪里？
我对所有这些魔法有点不清楚。据我了解，依赖属性是从 DependencyObject 继承的，因此存储值: 如果分配了值(在本地字典中)，则在实例本身中或者如果未指定值，则从指向父元素的链接中获取
Twilio RestSharp 依赖
我刚刚更新了在 ASP.NET Framework 4.5.2 版上运行的 MVC Web 应用程序。我正在使用 Twilio 发送 SMS 消息: var twilio = new TwilioRe
java - Spring 依赖
我刚刚发现了一件令人生畏的事情。 spring 依赖坐标有两个版本。项目依赖于 spring mvc 和 spring flow。有两组并行的依赖项。 Spring MVC 具有以下方案的依赖项
Maven 依赖 picocontainer
我正在尝试包含的 maven 依赖项 org.jacorb jacorb 2.3.1 依赖已解决，但它导致另一个依赖 picocontainer 出现问题: [ERROR
Haskell 依赖 hell
我正在尝试在 Haskell 项目中包含特定版本的库。该库是住宿加早餐型的(用于 martix 操作)，但我需要特定的 0.4.3 版本，该版本修复了乘法实现的错误。所以，我的 stack.yaml
iphone - 依赖 UIPickerView
有谁知道如何制作依赖的 UIPickerView.例如，当我选择组件一的第 2 行时，组件二的标题会发生变化吗？我在互联网上查找过，没有真正的答案，我尝试过使用 if 和 switch 语句，但它们
Maven WAR 依赖
我正在编写一个用于验收测试的项目，由于各种原因，这依赖于另一个打包为 WAR 的项目。我已成功使用 maven-dependency-plugin 解压 WAR，但无法让我的项目包含解压的 WEB-I
Django，依赖 session
或多或少我在 session 上大量构建我的网站(特别是重定向用户等)，我很好奇这是否是一种危险的做法。禁用浏览器 cookie 保存的用户的大致比例是多少？我愿意接受任何建议:) 谢谢最佳答案 s
scala - 依赖 future
开始玩 Scala futures，我被依赖的 futures 困住了。让我们举个例子。我搜索地点并获得 Future[Seq[Place]]。对于这些地点中的每一个，我搜索最近的地铁站(该服务返回
Django，依赖 session
或多或少我在 session 上大量构建我的网站(特别是重定向用户等)，我很好奇这是否是一种危险的做法。禁用浏览器 cookie 保存的用户的大致比例是多少？我愿意接受任何建议:) 谢谢最佳答案 s
c - GLIBC 依赖
我有一个二进制文件，需要一些 *.so 文件才能执行。现在，当我尝试在一些旧机器上执行它时，它会显示 /lib/libc.so.6: version `GLIBC_2.4' not found 如何将
javascript - DyGraph 依赖
我尝试使用 Dygraph 来表示图表，我在 https://github.com/danvk/dygraphs 中找到了代码，但是它有太多的依赖文件，我觉得很烦人。是否有一个文件可以容纳所有必需的
javascript - Jasmine 依赖
我正在处理一个 javascript 文件，该文件 a) 声明一个具有函数的对象，并且 b) 使用它期望在外部声明的散列调用该对象的 init 函数。我的 Jasmine 规范提示它找不到哈希，因为它
javascript - Angular 依赖
最近我一直在学习 Angular 并且进展顺利，但是关于依赖注入(inject)的一些事情我仍然不清楚。是否有任何理由在我的 app.js 文件中声明我的应用程序的其他部分(服务、 Controll
php - 依赖 "mysql_insert_id"
考虑一个名为 foo 的表，它有 id (PRIMARY & AUTO_INCREMENT) 列。我正在向该表中插入一行，挑战从此时开始。 $db->query("INSERT INTO `foo`
javascript - 依赖/级联下拉菜单
我正在使用级联下拉 jquery 插件。 (https://github.com/dnasir/jquery-cascading-dropdown) 我有两个下拉菜单。 “客户端”和“站点”。根据您

首页

博学

6Ren·AI

商城

pyspark - 如何在 EMR 笔记本中安装 .jar 依赖项？