apache-spark - Spark，EMR 上主节点的大小重要吗？-6ren

apache-spark - Spark，EMR 上主节点的大小重要吗？

转载作者：行者123 更新时间：2023-12-04 04:44:38

25

4

在 EMR 上运行 Spark ETL 作业时，主节点实例的大小是否重要？根据我的理解，主节点不处理数据的处理/计算，负责调度任务、与核心节点和任务节点通信以及其他管理任务。

这是否意味着如果我有 10 TB 的数据需要转换然后写出，我可以将 1 个中型实例用于主节点，将 10 个 8xlarge 实例用于核心节点？

根据阅读，我看到大多数人建议主节点实例类型应该与我目前使用的核心实例类型相同并且工作正常。对于主节点，这将是 1 个 8xlarge，对于核心节点，这将是 10 个 8xlarge。

根据 AWS 文档，我们应该使用 m4.large，所以我很困惑什么是正确的。

https://docs.aws.amazon.com/emr/latest/ManagementGuide/emr-plan-instances-guidelines.html

The master node does not have large computational requirements. For most clusters of 50 or fewer nodes, consider using an m4.large instance. For clusters of more than 50 nodes, consider using an m4.xlarge.

最佳答案

提问的方式有点含糊。尺寸确实很重要，即负载等。所以我从一个稍微不同的角度回答它。 “大多数人……”的东西既不存在也不存在。

过去分配 Master 的方式是 EMR 方法的一个弱点，恕我直言，当我在大约 9 个月前为 PoC 试用它时。为 Workers 分配大量资源，默认情况下 1 分配给 Master，这完全是矫枉过正。

因此，如果您按照标准行事，您就会为主节点的非必需资源支付大于所需资源的费用。有一种方法可以为 Master 定义一个更小的资源，但我在 hols 中，无法再次找到它。

However, look at the url here and you see now that during EMR Cluster Config you can easily define a smaller Master Node or many such Master Nodes for fail over, things have moved along since I last looked: https://confusedcoders.com/data-engineering/how-to-create-emr-cluster-with-apache-spark-and-apache-zeppelin.

另见 https://docs.aws.amazon.com/emr/latest/ManagementGuide/emr-plan-ha-launch.html对于多个这样的主节点。

一般来说，主节点在特征方面可能与工作节点不同，通常较小，但可能并非在所有情况下都是如此。也就是说，EMR 的目的往往指向更小的主节点配置。

关于apache-spark - Spark，EMR 上主节点的大小重要吗？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58052765/

25

4

0

文章推荐： solr - 如何通过查询字符串在solr中选择多个值？

文章推荐： wcf - 我无法在 VS2012 中向 MVC4 添加服务引用(WCF 库)

emr - 只有主节点和任务节点的 AWS EMR
当我确定源数据在 S3 中并且处理的结果将存储在 S3 中时，是否可以使用主节点和一组任务(从属)节点(没有核心节点)构建 AWS EMR。基本上，问题是“当 EMR 将在 S3 中处理数据时，需要
amazon-emr - 如何正确使用 EMR S3DistCp groupBy？
我正在使用 aws .net sdk 向 EMR 运行 s3distcp 作业，以使用 --groupBy arg 连接文件夹中的所有文件。但是无论我尝试过什么“groupBy”arg，它总是失败，或
amazon-emr - EMR Jupyter Notebook 的访问凭证
我刚刚建立了一个内置 Spark、JupyterHub 等的 EMR 集群。我可以通过 http://master_hostname:9443/hub/login 访问 Jupyter Noteboo
java - Hadoop 永远占领 EMR 和分析 EMR
我正在 S3 上运行一个超过 500 个文档的示例 hadoop 作业，在本地运行时需要 <15 分钟才能完成。然而，当我尝试在 EMR 上运行相同的作业时，需要两个多小时，但仍然没有完成缩减步骤，因
emr - EMR 上 Zeppelin 中的 Presto 解释器
是否可以将 Presto 解释器添加到 AWS EMR 4.3 上的 Zeppelin，如果可以，有人可以发布说明吗？我在 EMR 上运行 Presto-Sandbox 和 Zeppelin-Sand
amazon-emr - 如何在 AWS StepFunctions 中将变量传递给 EMR addStep
AWS Stepfunctions 最近添加了 EMR 集成，这很酷，但我找不到将变量从步骤函数传递到 addstep 参数的方法。例如，我想将“$.dayid”变量传递给“Parameters”>“
shell - Amazon EMR:如何在参数中添加带有嵌入式shell脚本的Amazon EMR MapReduce/Hive/Spark步骤？
例如，我有两个Hive作业，其中一个作业的输出用作第二个作业的参数/变量。我可以在终端上成功运行以下命令，以在EMR集群的主节点上获得结果。 [hadoop@ip-10-6-131-223 ~]$ h
r - 亚马逊 EMR : Using R code in Amazon EMR
我有一个非常初学者的问题。我刚刚阅读了一些有关 Amazon EMR 的文档。在我注册之前，我只是想询问一下如何在其中使用 R。我有一个 R 模块，它调用其他几个模块，然后，在它完成运行之前，将几个
python - 从 EMR Spark 连接到 EMR presto - 连接失败
我在从运行 Spark 的 AWS EMR 集群连接到另一个运行 presto 的 AWS EMR 集群时遇到问题。用 python 编写的代码是: jdbcDF = spark.read \
amazon-emr - Amazon EMR - 端口 9443 上缺少来自 EmrManagedMasterSecurityGroup 的入口规则
我正在努力解决这个问题，但无法弄清楚为什么我有一个要部署在 AWS 私有(private)子网中的 EMR 集群。我检查了文档 here . 根据以上内容，我明白了以下几点: 一个。对于我的 EM
amazon-emr - 无法访问 AWS EMR Ganglia 仪表板 - 403 Forbidden
我有一个 EMR 集群 response = emr_client.run_job_flow( Name="Test dashboards", ReleaseLabel='emr-6.
java - EMR 中的多个输入和多个映射器类(EMR 中是否有类似 Hadoop 上的 MultipleInputs 的东西)
我在使用 hadoop 时使用了 MultipleInputs 。因为我有多个映射器分配给不同的输入。我想知道 EMR 是否也支持它。在hadoop中我是这样操作的。这些是我的不同文件的映射器。在这
python - Jupyter + EMR + Spark - 从本地机器上的 Jupyter notebook 连接到 EMR 集群
我是 PySpark 和 EMR 的新手。我试图通过 Jupyter notebook 访问在 EMR 集群上运行的 Spark，但遇到了错误。我正在使用以下代码生成 SparkSession:
amazon-emr - Presto-Glue-EMR 集成 : presto-cli giving NullPointerException
我正在尝试将我的 Glue 目录连接到 EMR 中的 Presto 和 Hive。在 presto-cli 中运行查询时，我收到 NullPointerException 而相同的查询在 hive-c
python - 使用 --pool-emr-job-flows 时，MRJob 无法在 EMR 上启动新作业
我正在使用 MRJob 在 Amazon 的 EMR 上运行一个迭代的 hadoop 程序。当我不使用“--pool-emr-job-flows”选项时，一切正常(但速度很慢)。当我使用这个选项时，
hadoop - 获取 emr-ddb-hadoop.jar 以连接 DynamoDB 和 EMR Spark
我有一个 DynamoDB 表，我需要连接到 EMR Spark SQL 以在该表上运行查询。我得到了带有发布标签 emr-4.6.0 和 Spark 1.6.1 的 EMR Spark Cluste
Python 和 AWS EMR 步骤 : Using os. 系统运行 chmod 等命令在作为 EMR 步骤运行时不起作用
我的团队在 AWS 中工作，我们有 python 脚本，可以将文件从 S3 存储桶移动到 EC2 实例。我想用我们正在使用的脚本作为序言，它在直接从 ec2 实例运行时有效，并且仅在作为 EMR 步骤
apache-spark - 使用 Airflow dag run 创建 EMR 集群，任务完成后 EMR 将终止
我有 Airflow 作业，它们在 EMR 集群上运行良好。我需要的是，假设我有 4 个 Airflow 作业需要 EMR 集群，假设 20 分钟才能完成任务。为什么我们不能在 DAG 运行时创建一个
hadoop - 在配置 EMR 后，如何将文件从 S3 复制到 Data Pipeline 中的 Amazon EMR？
我正在 AWS 中创建一个数据管道来运行 Pig 任务。但是我的 Pig 任务需要 EMR 中的附加文件。在创建集群之后和运行 pig tasked 之前，我如何告诉 Data Pipeline 将文
amazon-emr - 在 AWS EMR 上设置 Spark Thrift Server 以建立 JBDC/ODBC 连接
如何在 EMR 上设置 Spark Thrift 服务器？我正在尝试使用 Spark Thrift 服务器与 EMR 建立 JDBC/ODBC 连接。例如直线> !connect jdbc:hive

首页

博学

6Ren·AI

商城

apache-spark - Spark，EMR 上主节点的大小重要吗？