hadoop - 您如何设置具有不同批处理持续时间的多个 Spark Streaming 作业？-6ren

hadoop - 您如何设置具有不同批处理持续时间的多个 Spark Streaming 作业？

转载作者：可可西里更新时间：2023-11-01 14:19:36

我们正处于转换大型企业当前数据架构的开始阶段，我目前正在构建一个 Spark Streaming ETL 框架，我们将在其中将所有源连接到目的地(源/目的地可以是 Kafka 主题、Flume 、HDFS 等)通过转换。这看起来像:

SparkStreamingEtlManager.addEtl(源、转换*、目标) SparkStreamingEtlManager.streamEtl() streamingContext.start()

假设是，因为我们应该只有一个 SparkContext，所以我们将在一个应用程序/jar 中部署所有 ETL 管道。

问题在于 batchDuration 是上下文本身的属性，而不是 ReceiverInputDStream 的属性(这是为什么？)。因此，我们是否需要拥有多个 Spark 集群，或者允许多个 SparkContext 并部署多个应用程序？有没有其他方法可以控制每个接收器的批处理持续时间？

如果我的假设有任何幼稚或需要改写，请告诉我。谢谢!

最佳答案

根据我的经验，不同的流有不同的调优要求。吞吐量、延迟、接收端的容量、要遵守的 SLA 等。

为了满足这种多样性，我们需要配置每个 Spark Streaming 作业来解决上述特殊性。因此，不仅是批处理间隔，还有内存和 CPU、数据分区、执行节点数量(当负载受网络限制时)等资源。

因此，每个 Spark Streaming 作业都成为 Spark 集群上的一个单独的作业部署。这也将允许监控和管理彼此独立的单独管道，并有助于进一步微调流程。

在我们的案例中，我们使用 Mesos + Marathon 来管理运行 3600x24x7 的 Spark Streaming 作业集。

关于hadoop - 您如何设置具有不同批处理持续时间的多个 Spark Streaming 作业？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/29612726/

文章推荐： hadoop - 使用 S3DistCp 从 HDFS 传输到 S3 时删除目录级别

文章推荐： c++ - 跨平台托盘应用

文章推荐： windows - Github 和 Putty SSH key 放置配置有什么区别？

Java flatmap Iterator, Stream>> 到 Pair, Stream>
我正在尝试实现具有以下签名的方法: public static Pair, Stream> flatten(Iterator, Stream>> iterator); 该方法的目标是将每种流类型展平

stream - flutter : stream two Streams into a single screen?
我有两个流从两个不同的 api 获取。 Stream get monthOutStream => monthOutController.stream; Stream get resultOutStre

java - Stream.of(int[]) 返回 Stream 而 Stream.of(String[]) 返回 Stream 为什么？
Stream.of(int[])返回 Stream ，而 Stream.of(String[])返回 Stream . 为什么这两种方法的行为不同？两者都应该返回 Stream和 Stream或 St

dart - 将 Stream> 转换为 Stream
我正在使用 rxdart在 dart 中处理流的包。我被困在处理一个特殊的问题上。请看一下这个虚拟代码: final userId = BehaviorSubject(); Stream getSt

stream - Streaming 在 Streaming SIMD Extensions (SSE) 中代表什么？
我到处都找遍了，还是没弄明白。我知道你可以用流建立两个关联: 用于支持数据存储的包装器意味着作为消费者和供应商之间的抽象层数据随着时间的推移变得可用，而不是一次全部 SIMD 代表单指令，多数据；在

java - 创建 Stream 后更改 Stream 源时 Stream 的行为
考虑下面的代码: List l=new ArrayList<>(); l.add(23);l.add(45);l.add(90); Stream str=l.stream

webpack - ./node_modules/stream-browserify/node_modules/readable-stream/lib/internal/streams/stream-browser.js 错误 : Can't resolve 'events'
我有一个大型主干/requirejs 应用程序，我想迁移到 webpack，最新的“webpack”:“^4.27.1”，但我遇到了一个我无法解决的错误。我一直在阅读 https://webpack

java.io.EOFException : no more data available - expected end tag to close start tag 异常
我正在使用 xmpp 开发聊天应用程序，根据我们的要求，我们有三台服务器 Apache Tomcat 7、ejabbered 2.1.11 和 mysql 5.5， to run xmppbot on

scala - 将 java.util.stream.Stream 转换为 Scala Stream
我知道如何使用 Java 库，并且我可以编写一些循环来执行我需要的操作，但问题更多，为什么 scala.collection.JavaConverters 中没有任何内容或scala.collecti

java - 使用 Stream stream = Arrays.stream(words) 过滤唯一字数；
我正在尝试创建一个单一的衬里，它应该计算一个非常长的文本文件中的唯一单词。独特的词例如:márya fëdorovna scarlet-liveried,...所以基本上都是非英语词。我的问题是我的

c# - Stream.Dispose 是否总是调用 Stream.Close(和 Stream.Flush)
如果我有以下情况: StreamWriter MySW = null; try { Stream MyStream = new FileStream("asdf.txt"); MySW =

java-8 - Java 8 Streams : how can i stream another stream. 我如何将代码转换为java8流
有人可以帮我将以下语句转换为 Java8: 我有一个像这样的 HashMap : private Map, List>> someMap; 我想在java8中转换以下逻辑: private Strin

java-8 - Java 8 Streams : how can i stream another stream. 我如何将代码转换为java8流
有人可以帮我将以下语句转换为 Java8: 我有一个像这样的 HashMap : private Map, List>> someMap; 我想在java8中转换以下逻辑: private Strin

java - 为什么具有短路操作的并行 Java Stream 会评估 Stream 的所有元素，而顺序 Stream 则不会？
考虑两种测试方法parallel()和sequential(): @Test public void parallel() throws Exception { System.ou

node.js - NodeJS : Stream. pipe(Stream) 有效但 Stream.read() 无效
我是 NodeJS 的新手，我基本上想做的是通过 HTTP 将 .pdf 上传到我的服务器。我正在使用 POST rquest 来处理 Content-Type multipart/form-data

c# - MemoryStream.WriteTo(Stream destinationStream) 与 Stream.CopyTo(Stream destinationStream)
哪个更好:MemoryStream.WriteTo(Stream destinationStream) 或 Stream.CopyTo(Stream destinationStream)？？我正在谈

stream - 延迟 Tokio Stream
给定一个 Stream，我想创建一个新的 Stream，其中的元素在它们之间有时间延迟。我尝试使用 tokio_core::reactor::Timeout 和 Stream 的 and_then

Spring Cloud Stream Kafka Streams Binder KafkaException : Could not start stream: 'listener' cannot be null
我是 Kafka Streams 和 Spring Cloud Stream 的新手，但在将集成相关代码移动到属性文件方面已经阅读了有关它的好东西，因此开发人员可以主要专注于事物的业务逻辑方面。这里

node.js - utility.pump(streamA, stream) 和 stream.pipe(stream) 有什么区别？
源代码看起来非常相似:pump , pipe .为什么我要使用一个而不是另一个？一个只是另一个的更好版本吗？最佳答案 Stream.pipe 现在显然是自 0.3.x 以来的首选方法，因此尽可能尝试

java - 使用 Java 中的 Streams/Lambda 将 Stream> 转换为 T[][]
我正在寻找是否有更好的方法来解决我不得不使用这些签名的困境(注意:由于 Spock 测试，T[][] 是必需的，我提供 T[][] 作为数据提供商) 我的方法签名是: public T[][] cr

可可西里

个人简介
我是一名优秀的程序员,十分优秀！

作者热门文章

android - RelativeLayout 背景可绘制重叠内容

android - 如何链接 cpufeatures lib 以获取 native android 库？

java - OnItemClickListener 不起作用，但 OnLongItemClickListener 在自定义 ListView 中起作用

java - Android 文件转字符串

滴滴打车优惠券免费领取

全站热门文章

.NET各版本贡献者列表

『玩转Streamlit』--数据展示组件

cmu15545-数据访问方式：B+树（B+Tree）

实战：Mailivery模拟登录

.NET9使用Scalar替代Swagger

.NET9发布性能提升、AI支持与全方位改进

Java灵魂拷问13个为什么，你都会哪些？

Spring-Event入门实践及执行原理

[这可能是最好的Spring教程！]Maven的模块管理——如何拆分大项目并且用parent继承保证代码的简介性

不当愣头青、聊聊软件架构中的那些惯用的保命手段

首页

博学

6Ren·AI

商城

hadoop - 您如何设置具有不同批处理持续时间的多个 Spark Streaming 作业？