apache-spark - EMR PySpark : LZO Codec not found-6ren

apache-spark - EMR PySpark : LZO Codec not found

转载作者：行者123 更新时间：2023-12-04 04:50:04

24

4

在 EMR (Hadoop 2.4.0) 上使用 Spark (1.4.0) 在 YARN 模式下通过 IPython notebook 运行 PySpark，使用:

IPYTHON_OPTS="notebook --no-browser" nohup /usr/lib/spark/bin/pyspark --master yarn-client --num-executors 2 --executor-memory 512m --executor-cores 1 > /mnt/var/log/python_notebook.log 2> /mnt/var/log/python_notebook_err.log &

在 HDFS 中放置了一个简单的 CSV 文件，并尝试使用

sc.textFile('/tmp/text.csv').first()

但是，这给了我 Caused by: java.lang.ClassNotFoundException: Class com.hadoop.compression.lzo.LzoCodec not found .

在上下文中:

Py4JJavaError                             Traceback (most recent call last)
<ipython-input-54-e39168c6841b> in <module>()
----> 1 sc.textFile('/tmp/text.csv').first()

/usr/lib/spark/python/pyspark/rdd.py in first(self)
   1293         ValueError: RDD is empty
   1294         """
-> 1295         rs = self.take(1)
   1296         if rs:
   1297             return rs[0]

/usr/lib/spark/python/pyspark/rdd.py in take(self, num)
   1245         """
   1246         items = []
-> 1247         totalParts = self.getNumPartitions()
   1248         partsScanned = 0
   1249 

/usr/lib/spark/python/pyspark/rdd.py in getNumPartitions(self)
    353         2
    354         """
--> 355         return self._jrdd.partitions().size()
    356 
    357     def filter(self, f):

/usr/lib/spark/python/lib/py4j-0.8.2.1-src.zip/py4j/java_gateway.py in __call__(self, *args)
    536         answer = self.gateway_client.send_command(command)
    537         return_value = get_return_value(answer, self.gateway_client,
--> 538                 self.target_id, self.name)
    539 
    540         for temp_arg in temp_args:

/usr/lib/spark/python/lib/py4j-0.8.2.1-src.zip/py4j/protocol.py in get_return_value(answer, gateway_client, target_id, name)
    298                 raise Py4JJavaError(
    299                     'An error occurred while calling {0}{1}{2}.\n'.
--> 300                     format(target_id, '.', name), value)
    301             else:
    302                 raise Py4JError(

Py4JJavaError: An error occurred while calling o159.partitions.
: java.lang.RuntimeException: Error in configuring object
    at org.apache.hadoop.util.ReflectionUtils.setJobConf(ReflectionUtils.java:109)
    at org.apache.hadoop.util.ReflectionUtils.setConf(ReflectionUtils.java:75)
    at org.apache.hadoop.util.ReflectionUtils.newInstance(ReflectionUtils.java:133)
    at org.apache.spark.rdd.HadoopRDD.getInputFormat(HadoopRDD.scala:190)
    at org.apache.spark.rdd.HadoopRDD.getPartitions(HadoopRDD.scala:203)
    at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:219)
    at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:217)
    at scala.Option.getOrElse(Option.scala:120)
    at org.apache.spark.rdd.RDD.partitions(RDD.scala:217)
    at org.apache.spark.rdd.MapPartitionsRDD.getPartitions(MapPartitionsRDD.scala:32)
    at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:219)
    at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:217)
    at scala.Option.getOrElse(Option.scala:120)
    at org.apache.spark.rdd.RDD.partitions(RDD.scala:217)
    at org.apache.spark.api.java.JavaRDDLike$class.partitions(JavaRDDLike.scala:65)
    at org.apache.spark.api.java.AbstractJavaRDDLike.partitions(JavaRDDLike.scala:47)
    at sun.reflect.GeneratedMethodAccessor30.invoke(Unknown Source)
    at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
    at java.lang.reflect.Method.invoke(Method.java:606)
    at py4j.reflection.MethodInvoker.invoke(MethodInvoker.java:231)
    at py4j.reflection.ReflectionEngine.invoke(ReflectionEngine.java:379)
    at py4j.Gateway.invoke(Gateway.java:259)
    at py4j.commands.AbstractCommand.invokeMethod(AbstractCommand.java:133)
    at py4j.commands.CallCommand.execute(CallCommand.java:79)
    at py4j.GatewayConnection.run(GatewayConnection.java:207)
    at java.lang.Thread.run(Thread.java:745)
Caused by: java.lang.reflect.InvocationTargetException
    at sun.reflect.GeneratedMethodAccessor31.invoke(Unknown Source)
    at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
    at java.lang.reflect.Method.invoke(Method.java:606)
    at org.apache.hadoop.util.ReflectionUtils.setJobConf(ReflectionUtils.java:106)
    ... 25 more
Caused by: java.lang.IllegalArgumentException: Compression codec com.hadoop.compression.lzo.LzoCodec not found.
    at org.apache.hadoop.io.compress.CompressionCodecFactory.getCodecClasses(CompressionCodecFactory.java:135)
    at org.apache.hadoop.io.compress.CompressionCodecFactory.<init>(CompressionCodecFactory.java:175)
    at org.apache.hadoop.mapred.TextInputFormat.configure(TextInputFormat.java:45)
    ... 29 more
Caused by: java.lang.ClassNotFoundException: Class com.hadoop.compression.lzo.LzoCodec not found
    at org.apache.hadoop.conf.Configuration.getClassByName(Configuration.java:1980)
    at org.apache.hadoop.io.compress.CompressionCodecFactory.getCodecClasses(CompressionCodecFactory.java:128)
    ... 31 more

我已尝试按照说明操作 here并做了:

os.environ['SPARK_LIBRARY_PATH'] = "/usr/lib/hadoop-lzo/lib/native/"
os.environ['SPARK_CLASSPATH'] = "/usr/lib/hadoop-lzo/lib/"

然而，这似乎没有帮助。

最佳答案

我知道这个问题很老，但我过去一周一直在处理这个问题，所以我想我会发布我们的解决方案，以防其他人遇到这个问题。我们的设置是一个 EC2 实例作为 EMR 之外的驱动程序运行，然后它可以创建 EMR 集群并与主节点通信。集群运行的是 Spark 2.2.0，EMR 版本是 5.9.0。

解决方案是克隆 Twitter Hadoop-Lzo Github repo在 Spark 驱动程序上，然后将路径添加到 hadoop-lzo.jar 以触发提交参数。 SUBMIT_ARGS='--jars /opt/hadoop-lzo/target/hadoop-lzo-0.4.21-SNAPSHOT.jar .只需将 .jar 的路径替换为您将 repo 克隆到的路径。

关于apache-spark - EMR PySpark : LZO Codec not found，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/32212906/

24

4

0

文章推荐： r - Twitter数据分析-术语文档矩阵中的错误

文章推荐： ftp - vsftpd - 无法将文件上传到服务器。错误 553

文章推荐： vb.net - 在VB.NET中单击按钮时打开txt文件

groovy - geb 使用葡萄 - 下载失败 : commons-codec#commons-codec;1. 6!commons-codec.jar
我正在尝试使用 user guide 中的抓取示例运行 geb用于引入依赖项: $ cat my.groovy @Grapes([ @Grab("org.gebish:geb-core:0.9
codec - 如何在我的 Java 应用程序中使用 Opus-Codec
我阅读了很多关于 opus-codec 的内容，但我不明白如何在我的示例 Java 应用程序中使用它。是否有任何可用于 opus 的 .so 文件可以使用？如果没有，那么如何？最佳答案目前(在撰
maven - 访问被拒绝 : http://repo. maven.apache.org/maven2/commons-codec/commons-codec/1.4/commons-codec-1.4.pom，ReasonPhrase:Forbidden
我试图构建 Maven 项目，每当我在命令行上运行“mvn clean install”时，都会出现以下错误: 无法解析项目 com.my_project:jar:0.0.1-SNAPSHOT 的依
java.lang.NoClassDefFoundError : org/apache/lucene/codecs/Codec 错误
我有一个项目需要 Lucene(4.3.0) 并添加以下依赖项:lucene-core,lucene-analyzers-common,lucene-queries,lucene-queryparse
unit-testing - Grails 单元测试 : Json-Codec missing/How to mock Json-Codec?
我正在对 Controller 进行单元测试，目前我被服务(由 Controller 调用)中的“encodeAsJSON()”方法调用所困扰。我得到了 MissingMethodException
java - 是什么导致错误 ' A SPI class of type lucene.codecs.Codec name ' Lucene42'
无法弄清楚是什么原因导致 ' 名称为“Lucene42”的 org.apache.lucene.codecs.Codec 类型的 SPI 类不存在。您需要将支持此 SPI 的相应 JAR 文件添加到您
mongodb - org.bson.codecs.configuration.CodecConfigurationException : Can't find a codec for class [Ljava. lang.String;
我想运行以下命令来使用 MongoDB Java 驱动程序创建用户， client = new MongoClient(mongoClientURI); MongoDatabase d
java - 名称为 'Lucene54' 的 org.apache.lucene.codecs.Codec 类型的 SPI 类不存在
对于 lucene-core-5.5.2，我在 weblogic 服务器中遇到了问题 a。独立的搜索应用程序可以工作，但是当我部署为 WEB APP 时，它失败并出现以下错误 Exception ty
java - MongoDB jodatime : org. bson.codecs.configuration.CodecConfigurationException : Can't find a codec for class org. joda.time.DateTime
我的代码: DateTime dateTime = new DateTime(); BasicDBObject oldDoc = new BasicDBObject("email",email); B
java - org.bson.codecs.configuration.CodecConfigurationException : Can't find a codec for class org. hibernate.ogm.datastore.mongodb.type.GridFS
我正在尝试在 Hibernate-ogm 中尝试 GridFS。这就是我的课 import org.hibernate.ogm.datastore.mongodb.type.GridFS; @Embe
mongodb - org.bson.codecs.configuration.CodecConfigurationException : Can't find a codec for class org. springframework.data.mongodb.core.query.GeoCommand
我正在使用如下聚合: final List aggregations = new ArrayList<>(); Polygon polygon = new Polygon(new Po
java - 异常 : java. lang.IllegalArgumentException : An SPI class of type org. 名称为 'Lucene410' 的 apache.lucene.codecs.Codec 不存在
我正在处理一个多模块 gradle 项目(12 个模块)。我继承了该项目，需要更新其中使用的一些库的版本。我无法理解此错误的原因: ... 67 more Caused by: java.l
java - MongoDB Java 插入抛出 org.bson.codecs.configuration.CodecConfigurationException : Can't find a codec for class io. github.ilkgunel.mongodb.Pojo
我正在使用 Java 学习 MongoDB。我正在尝试使用 Java 驱动程序将数据插入 MongoDB。我正在像 MongoDB 教程中一样进行插入，而且一切都很好。但是如果我想插入一个变量，当我运
python - codecs.ascii_decode(输入，self.errors)[0] UnicodeDecodeError : 'ascii' codec can't decode byte 0xc2 in position 318: ordinal not in range(128)
我正在尝试打开并读取包含大量文本的 .txt 文件。下面是我的代码，我不知道如何解决这个问题。任何帮助将不胜感激。 file = input("Please enter a .txt file: ")
python - pip install django-toolbelt 报错:"codecs.ascii_decode(input, self.errors)[0] UnicodeDecodeError: ' ascii' codec can't decode byte 0xc2
我使用 Arch Linux 和默认的 Python 3。我使用 Konsole 通过命令 pip install django-toolbelt 下载 django-toolbelt。名称: pip
codec - FFMPEG中帧和包的区别
我正在尝试使用 LibAV 解码 mpeg 视频文件。有两个术语我无法正确理解，镜框和数据包 . 按照我目前的理解，镜框是未压缩的视频帧和数据包是压缩帧。问题 : 数据包有多个帧，对吗？一
codec - DICOM 像素数据压缩解压能否搞乱窗口中心和窗口宽度
我正在查看计算机断层扫描 (CT) DICOM 图像。这些最初是未压缩的 DICOM 图像。我有这些 DICOM 图像的无损 J2K 压缩形式:传输语法 = 1.2.840.10008.1.2.4.9
java - 如何安装Commons Codec？
如何安装通用编解码器？我已经下载了，但是我在网上搜索过，找不到这个问题的答案。我想使用 Base64 编码器和解码器。还有 1 个问题，如果我的代码使用这个编解码器，其他尝试使用我的程序的用户是否也
loci.formats.codec.ZlibCodec类的使用及代码示例
本文整理了Java中loci.formats.codec.ZlibCodec类的一些代码示例，展示了ZlibCodec类的具体用法。这些代码示例主要来源于Github/Stackoverflow/Ma
hivemall.utils.codec.ZigZagLEB128Codec类的使用及代码示例
本文整理了Java中hivemall.utils.codec.ZigZagLEB128Codec类的一些代码示例，展示了ZigZagLEB128Codec类的具体用法。这些代码示例主要来源于Githu

首页

博学

6Ren·AI

商城

apache-spark - EMR PySpark : LZO Codec not found