hadoop - AWS EMR S3DistCp : The auxService:mapreduce

hadoop - AWS EMR S3DistCp : The auxService:mapreduce_shuffle does not exist

转载作者：可可西里更新时间：2023-11-01 14:51:41

28

4

我通过 SSH 连接到 AWS EMR v5.4.0 实例，我想调用 s3distcp。 This link演示了如何设置一个 emr 步骤来调用它，但是当我运行它时出现以下错误:

Container launch failed for container_1492469375740_0001_01_000002 : org.apache.hadoop.yarn.exceptions.InvalidAuxServiceException: The auxService:mapreduce_shuffle does not exist
    at sun.reflect.NativeConstructorAccessorImpl.newInstance0(Native Method)
    at sun.reflect.NativeConstructorAccessorImpl.newInstance(NativeConstructorAccessorImpl.java:62)
    at sun.reflect.DelegatingConstructorAccessorImpl.newInstance(DelegatingConstructorAccessorImpl.java:45)
    at java.lang.reflect.Constructor.newInstance(Constructor.java:423)
    at org.apache.hadoop.yarn.api.records.impl.pb.SerializedExceptionPBImpl.instantiateException(SerializedExceptionPBImpl.java:168)
    at org.apache.hadoop.yarn.api.records.impl.pb.SerializedExceptionPBImpl.deSerialize(SerializedExceptionPBImpl.java:106)
    at org.apache.hadoop.mapreduce.v2.app.launcher.ContainerLauncherImpl$Container.launch(ContainerLauncherImpl.java:155)
    at org.apache.hadoop.mapreduce.v2.app.launcher.ContainerLauncherImpl$EventProcessor.run(ContainerLauncherImpl.java:390)
    at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1142)
    at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:617)
    at java.lang.Thread.run(Thread.java:745)

我关注了the instructions here但还是不行。

最佳答案

事实证明我需要 restart the yarn nodemanager service配置mapreduce_shuffle后:

$ initctl list | grep yarn
hadoop-yarn-resourcemanager start/running, process 1256
hadoop-yarn-proxyserver start/running, process 702
hadoop-yarn-nodemanager start/running, process 896
$ sudo stop hadoop-yarn-nodemanager
$ sudo start hadoop-yarn-nodemanager

此外，如果有帮助，yarn-site.xml 文件位于:/etc/hadoop/conf/yarn-site.xml。它已经有 yarn.nodemanager.aux-services 的条目，但未配置 mapreduce_shuffle:

<property>
  <name>yarn.nodemanager.aux-services</name>
  <value>spark_shuffle,</value>
</property>

<property>
  <name>yarn.nodemanager.aux-services.spark_shuffle.class</name>
  <value>org.apache.spark.network.yarn.YarnShuffleService</value>
</property>

所以我这样添加:

<property>
  <name>yarn.nodemanager.aux-services</name>
  <value>spark_shuffle,mapreduce_shuffle</value>
</property>

<property>
  <name>yarn.nodemanager.aux-services.mapreduce_shuffle.class</name>
  <value>org.apache.hadoop.mapred.ShuffleHandler</value>
</property>

<property>
  <name>yarn.nodemanager.aux-services.spark_shuffle.class</name>
  <value>org.apache.spark.network.yarn.YarnShuffleService</value>
</property>

关于hadoop - AWS EMR S3DistCp : The auxService:mapreduce_shuffle does not exist，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/43478985/

28

4

0

文章推荐： c - 通过程序集以编程方式检测上下文切换

文章推荐： azure - 如何在 Azure HDInsight 的 Spark 集群中配置 HBase？

文章推荐： windows - TShark 输出重定向

文章推荐： Hadoop:datanode 进程正在运行但不工作？

Hadoop Distcp - 增加 distcp.dynamic.max.chunks.tolerable 配置和调整 distcp
我正在尝试使用 distcp 在两个 hadoop 集群之间移动数据。大量的小文件需要移动大量的数据。为了让它更快，我尝试使用 -strategy dynamic，根据文档，它“允许更快的数据节点比更
hadoop - 'distcp' 和 'distcp -update' 之间的区别？
有什么区别 hadoop distcp 和 hadoop distcp -update 他们都做同样的工作，只是我们称呼他们的方式略有不同。它们都不会覆盖目标中已经存在的文件。那么两组不同的命令有什么
hadoop - 是否可以在 2 个 Hdfs 目录(单独的集群)之间使用 distcp 来 distcp 文件(逗号分隔)？
我只需要 distcp x 个文件。找不到解决方法。一个想法是将它复制到一个临时目录，然后distcp 该目录。完成后，我可以删除该临时目录。单独的 distcp 命令(针对每个文件)。这可能会
具有不同复制因子的集群之间的hadoop distcp
作为一些背景，我们有 2 个集群，目前用于生产和开发。作为其中的一部分，我们正在将文件(使用 hadoop distcp -update)从生产集群复制到开发集群，这些文件是由实时进程生成的(即它也有
hadoop - 带有文件列表的Hadoop distcp
我想使用distcp将文件列表(> 1K文件)复制到hdfs中。我已经将文件列表存储在本地目录中，现在可以使用-f复制所有文件吗？如果是，我必须在文件列表文件中保留什么格式？还是还有其他更好的方法？
Hadoop distcp 不工作
我正在尝试将数据从一个 HDFS 复制到另一个 HDFS。有什么建议为什么第一个有效但第二个无效？ (作品) hadoop distcp hdfs://abc.net:8020/foo/bar web
带有分区的 Hadoop distcp
我正在尝试从一个系统到另一个具有相同配置的系统(比如 A 到 B)执行 distcp。但是我在 A 中创建的分区在从 A 到 B 的 distcp 后没有显示在 B 中。我必须在 B 中手动创建分区。
Hadoop distcp 异常
我们正在使用 dictcp 将数据从 CDH4 复制到 CDH5。当我们在 CDH5 目标名称节点上运行命令时，我们得到以下异常。如果您已经遇到问题并知道解决方案，请告诉我。谢谢。 5/01/05 1
Hadoop distcp 错误
我正在尝试在两个启用 kerberos 的 hadoop 集群(版本 - Hadoop 2.0.0-cdh4.3.0)之间建立 Hadoop Distcp 当我在目标集群中使用命令“hadoop di
hadoop - Distcp 源长度不匹配
我在两个不同的 hadoop 集群之间执行 distcp 命令时遇到问题， Caused by: java.io.IOException: Mismatch in length of source:h
hadoop - 配置单元覆盖目录移动过程作为 distcp？
当我在配置单元中运行 INSERT OVERWRITE DIRECTORY 查询时，它似乎将结果存储在 .hivexxxx 暂存文件夹中，然后将文件从那里移动到该目录... 在 map reduce
Hadoop Distcp 将目录内的内容复制到同名目录
我在集群 A 中有一个目录:/a/b/c。该目录包含目录“一”、“二”、“三”、...、“九十”。在集群 B 中，我有目录/a/b/c。该目录包含目录“一”。我想将目录“一”到“九十”从集群 A 复制
hadoop - Distcp - 容器运行超出物理内存限制
几天来我一直在与 distcp 作斗争，我发誓我已经用 google 搜索了足够多的东西。这是我的用例: 用例我在某个位置有一个主文件夹，比如 /hdfs/root，里面有很多子目录(深度不固定)和
Hadoop DistCp 通过重命名处理相同的文件名
有什么方法可以运行 DistCp，但可以选择在文件名冲突时重命名？也许用一个例子来解释是最容易的。假设我正在将 hdfs:///foo 复制到 hdfs:///bar，foo 包含这些文件: hdf
Hadoop DistCp 使用通配符？
是否可以使用 DistCp 仅复制与特定模式匹配的文件？例如。对于/foo 我只想要 *.log 文件。最佳答案我意识到这是一个旧线程。但我自己对这个问题的答案很感兴趣——dk89 也在 2013
sockets - 在集群之间运行hadoop distcp -update时发生SocketTimeoutException
我正在使用hadoop distcp -update将目录从一个HDFS集群复制到另一个集群。有时(经常)，我得到这种异常: 13/07/03 00:20:03 INFO tools.DistCp:
hadoop - Hadoop Distcp-在不同位置之间复制时出现小文件问题
我试图复制400+ GB的数据和35.6 GB的数据量，这又是一个distcp作业，但是两者都花了将近2 -3个小时来完成。集群中确实有足够的资源。但是，当我检查了容器日志后，发现复制小文件花费了
hadoop - 如何列出事件的 DISTCP 作业？
如何列出事件的 DISTCP 作业？我正在两个集群之间运行一个 distcp 作业。hadoop distcp hdfs://x/y/x/y 我想持续运行它，但需要确保现有的 distcp 任务已完
hadoop - oozie distcp 操作中的正则表达式
我正在尝试将所有符合特定条件的文件复制到一个文件夹中 ${NAME_NODE}${PATH_COMVERSE}${CURRENT_DATE_NO_DASH}_*/*mta.
Hadoop distcp 错误路径仍然复制——数据去哪儿了？
我正在运行 hadoop distcp 将整个目录 (500GB+) 从 /path/to/source 复制到 /path/to/destination。但是，不是运行 $ hadoop distc

首页

博学

6Ren·AI

商城

hadoop - AWS EMR S3DistCp : The auxService:mapreduce_shuffle does not exist