apache-spark - 从 google pubsub 到 spark streaming 的数据摄取很慢-6ren

apache-spark - 从 google pubsub 到 spark streaming 的数据摄取很慢

转载作者：行者123 更新时间：2023-12-05 07:21:03

28

4

我正在使用谷歌云 Dataproc Spark 集群来运行 Spark 流作业，它从多个 PubSub 订阅中读取数据并写入 BigQuery。 PubSub 有 500 万个元素，滑动窗口为 2 分钟，批处理/窗口为 30 秒，我每批处理只得到大约 200,000 个元素。我希望第一批全部拿到500万。每个元素的大小约为 140 字节，采用 Avro 消息格式。

我在 Dataflow 中实现了每秒 100 万个元素的速度，但我想在 Dataproc 中实现同样的速度。我尝试使用 Dataproc 的自动缩放选项，还尝试使用在 Dataflow 上工作的相同 Beam 管道代码。如果我增加订阅数量，那么它可能会给我更多的吞吐量。是否有可能从单个订阅中获得 1M 元素/秒的吞吐量？

以下是我的 Scala 代码:

// Reading from multiple PubSub.
for (a <- 0 to Integer.parseInt(subs)) {
  logger.info("SKCHECK : Creating stream : " + subscription + a)
  val everysub  = PubsubUtils.createStream(
      ssc, projectId, None, subscription + a,
      SparkGCPCredentials.builder.jsonServiceAccount(jsonPath).build(),
      StorageLevel.MEMORY_ONLY_SER).map(message => {
          // Method to send avro bytes message and get row
          val row : Row = avroMsgToRow(message.getData())
          row
      })
}

我的 build.sbt 看起来像:

    libraryDependencies ++= Seq(
      "org.apache.spark" %% "spark-core" % sparkVersion,
      "org.apache.spark" %% "spark-sql" % sparkVersion,
     // "org.apache.spark" %% "spark-mllib" % sparkVersion,
      "org.apache.spark" %% "spark-streaming" % sparkVersion,
     // "org.apache.spark" %% "spark-hive" % sparkVersion,
      "com.google.cloud" % "google-cloud-bigquery" % bigQueryVersion,
      "com.google.apis" % "google-api-services-bigquery" % googleApiBigQueryVersion,
      "com.google.cloud" % "google-cloud-nio" % gcsNioVersion,
      "com.sksamuel.avro4s" %% "avro4s-core" % avro4sVersion
    )

    // https://mvnrepository.com/artifact/com.google.cloud.bigdataoss/bigquery-connector
    libraryDependencies += "com.google.cloud.bigdataoss" % "bigquery-connector" % "0.10.0-hadoop2"

    // https://mvnrepository.com/artifact/com.spotify/spark-bigquery
    libraryDependencies += "com.spotify" %% "spark-bigquery" % "0.2.2"

    libraryDependencies += "com.google.apis" % "google-api-services-pubsub" % "v1-rev425-1.25.0"

    // https://mvnrepository.com/artifact/org.apache.bahir/spark-streaming-pubsub
    libraryDependencies += "org.apache.bahir" %% "spark-streaming-pubsub" % "2.3.0"


    // https://mvnrepository.com/artifact/org.scala-lang/scala-library
    libraryDependencies += "org.scala-lang" % "scala-library" % "2.10.0-M3"

    // https://mvnrepository.com/artifact/org.apache.spark/spark-avro
    libraryDependencies += "org.apache.spark" %% "spark-avro" % "2.4.0"

如果您需要更多信息，请告诉我。

我希望通过单个 PubSub 订阅获得每秒 100 万个元素的数据摄取速度。

最佳答案

我认为您需要首先确定您的 Spark Streaming 作业的瓶颈。是 CPU 限制、内存限制、IO 限制还是因为 Spark 的某些参数导致它没有充分利用资源？我建议您首先检查资源利用率，然后尝试不同的 machine types .

关于apache-spark - 从 google pubsub 到 spark streaming 的数据摄取很慢，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/57145527/

28

4

0

文章推荐： indexing - 如何在 AWS-amplify graphql 模式中通过非主键查询

google-cloud-pubsub - com.google.cloud.pubsub.spi.v1.Publisher.publish 未将数据发送到 PubSub
对新版本 com.google.cloud.pubsub.spi.v1.Publisher.publish(pubsubMessage).get() 的调用永远挂起。我不确定问题是什么。代码片段:
google-cloud-pubsub - PubSub 会自动生成时间戳吗？
根据这里:https://cloud.google.com/pubsub/docs/reference/rest/v1/PubsubMessage 当发布者向队列发送消息时，不应填充时间戳字段。所以这
google-cloud-pubsub - Google PubSub 可靠性
Google PubSub 是否适合小批量(10 条消息/秒)但任务关键型消息传递，保证在任何固定时间段内及时传递每条消息？或者，它是否更适合高吞吐量，其中个别消息可能偶尔会丢失或无限期延迟？编辑
google-cloud-pubsub - 是否可以在不重新创建 PubSub 订阅的情况下修改全局确认截止日期？
我们创建了一个 pull使用 GCP Web GUI 的默认确认截止时间为 10 秒的 PubSub 订阅。原来是我们太乐观了，我们的服务处理一批拉取的消息需要10多秒的时间。该服务不会抛出异常，它实
google-cloud-pubsub - 批处理 PubSub 请求
批处理 pubsub 请求的 NODEJS 示例代码如下所示: // Imports the Google Cloud client library const PubSub = require(`@
google-cloud-pubsub - Google PubSub 同时发布请求
在 Google PubSub 中，可以异步调用来自客户端的发布调用。因此，我认为可以同时触发多个发布请求并将其发送到服务器，尤其是在批处理阈值太低的情况下。如果这是真的，pubsub 客户端如何控
google-cloud-pubsub - 确认的消息在 Google Pubsub 中徘徊
根据堆栈驱动程序图表，我们开始注意到某个主题/订阅的“未确认消息”数量不时增加。症状我不知道我们可以信任多少堆栈驱动程序图表，但我已经检查过: 拉取操作数与发布操作数一样多问题发生时ack操作计
message-queue - 可以使用数据流将 pubsub 消息重复数据删除回 pubsub 吗？
我有一个将数据写入 Google Cloud pubsub 的应用程序，根据 pubsub 的文档，由于重试机制导致的重复是偶尔会发生的事情。还有乱序消息的问题，这在 pubsub 中也不能保证。另
google-cloud-pubsub - 优先考虑 Google Pubsub 上的消息
我有一个包含多个拉取订阅的 pubsub 主题。我想要某种机制，我可以在其中发布带有“优先级”标签的消息，使消息尽可能地跳到队列的前面。我不需要任何有保证的排序语义，只需要“尽力而为”的优先级机制。
google-cloud-pubsub - GMB API - 与 PubSub 合作以获取实时评论通知
我在我们的平台中集成了 GMB API，并与 PubSub 合作以获取实时评论通知。为此，我已经完成了以下步骤: Created topic在谷歌 PubSub 云上。创建了它的 subscrip
google-cloud-pubsub - 在本地测试 Google Cloud PubSub 推送端点
试图找出在本地测试 PubSub 推送端点的最佳方法。我们尝试过使用 ngrok.io，但您必须拥有域才能加入白名单(这样做的工具也已损坏……导致无限重定向循环)。我们还尝试在本地模拟 PubSub。
firebase - 如何设置 pubsub 以便 firebase 可以通过云函数 pubsub 触发器接收？
我们希望通过带有 pubsub 触发器 ( https://firebase.google.com/docs/functions/pubsub-events ) 的 firebase 云函数接收有关某
google-cloud-pubsub - 排空或清除 Google Cloud pubsub 主题的最佳做法
关闭。这个问题是opinion-based .它目前不接受答案。想改善这个问题吗？更新问题，以便可以通过 editing this post 用事实和引文回答问题. 2年前关闭。 Improve t
google-cloud-pubsub - 谷歌云 PubSub 错误 : Deadline Exceeded
我有一个向 PubSub 主题发布消息的简单服务，偶尔会收到“已超过截止日期”错误消息: GaxError(RPC failed, caused by ) Python代码: from google.
google-cloud-pubsub - 为什么 Google PubSub 总是创建 60 个永久线程？
我的应用程序发布少量消息(最多每几秒 1 条)。它不订阅。首次使用时，PubSub 会创建 60 个永久保持事件状态的线程，如下所示: "grpc-default-worker-ELG-1-1 Id
java - 如何查询 PubSub 项目主题/特定主题的 pubsub.topics.list 权限
我想检查运行代码是否有权在特定项目中执行“pubsub.topics.list”。这段代码: try (TopicAdminClient admin = getTopicAdmin()) {
java - Spring 集成 pubsub 与 Spring amqp RabbitMQ pubsub
我正在开发微博 spring mvc hibernate 应用程序。我需要实现像推特这样的发布订阅功能。我正在使用 RabbitMQ 通过 Spring AMQP 抽象进行消息传递。我在网络上到处
google-cloud-pubsub - Apache Airflow 与 Google 云 pubsub 的集成
我对 Airflow 很陌生，并尝试使用 apache Airflow 与 google pubsub 的集成，我猜它是添加到“Airflow-300”JIRA 下的。如果我在这里阅读不正确，请纠正我
node.js - NodeJS 和 GCP PubSub - 类型错误 : PubSub is not a constructor at Object. <匿名>
我正在学习 https://www.woolha.com/tutorials/node-js-google-cloud-pub-sub-basic-examples 上的教程并且有一些困难.. 我在
.net-core - "process component pubsub error: init timeout for component pubsub exceeded after 5s"
我在我的 .net 核心微服务中使用 DAPR 和 Docker。我在 docker-compose.yml 中进行了以下配置以运行代理和 dapr pubsub 配置。 PUBSUB.yml api

首页

博学

6Ren·AI

商城

apache-spark - 从 google pubsub 到 spark streaming 的数据摄取很慢