apache-spark - 处理 spark streaming 中的数据库连接-6ren

apache-spark - 处理 spark streaming 中的数据库连接

转载作者：行者123 更新时间：2023-12-01 11:29:41

24

4

我不确定我是否正确理解了 spark 如何处理数据库连接以及如何可靠地使用 spark 内部的大量数据库更新操作而不可能搞砸 spark 作业。这是我一直在使用的代码片段(为了便于说明):

val driver = new MongoDriver
val hostList: List[String] = conf.getString("mongo.hosts").split(",").toList
val connection = driver.connection(hostList)
val mongodb = connection(conf.getString("mongo.db"))
val dailyInventoryCol = mongodb[BSONCollection](conf.getString("mongo.collections.dailyInventory"))

val stream: InputDStream[(String,String)] = KafkaUtils.createDirectStream[String, String, StringDecoder, StringDecoder, (String, String)](
  ssc, kafkaParams, fromOffsets,
  (mmd: MessageAndMetadata[String, String]) => (mmd.topic, mmd.message()));

def processRDD(rddElem: RDD[(String, String)]): Unit = {
    val df = rdd.map(line => {
        ...
    }).flatMap(x => x).toDF()

    if (!isEmptyDF(df)) {
        var mongoF: Seq[Future[dailyInventoryCol.BatchCommands.FindAndModifyCommand.FindAndModifyResult]] = Seq();

        val dfF2 = df.groupBy($"CountryCode", $"Width", $"Height", $"RequestType", $"Timestamp").agg(sum($"Frequency")).collect().map(row => {
        val countryCode = row.getString(0); val width = row.getInt(1); val height = row.getInt(2);
        val requestType = row.getInt(3); val timestamp = row.getLong(4); val frequency = row.getLong(5);
        val endTimestamp = timestamp + 24*60*60; //next day

        val updateOp = dailyInventoryCol.updateModifier(BSONDocument("$inc" -> BSONDocument("totalFrequency" -> frequency)), false, true)

        val f: Future[dailyInventoryCol.BatchCommands.FindAndModifyCommand.FindAndModifyResult] =
        dailyInventoryCol.findAndModify(BSONDocument("width" -> width, "height" -> height, "country_code" -> countryCode, "request_type" -> requestType,
         "startTs" -> timestamp, "endTs" -> endTimestamp), updateOp) 

        f
   })

   mongoF = mongoF ++ dfF2

   //split into small chunk to avoid drying out the mongodb connection
   val futureList: List[Seq[Future[dailyInventoryCol.BatchCommands.FindAndModifyCommand.FindAndModifyResult]]] = mongoF.grouped(200).toList

   //future list
   futureList.foreach(seqF => {
     Await.result(Future.sequence(seqF), 40.seconds)
   });     
}

stream.foreachRDD(processRDD(_))

基本上，我使用的是 Reactive Mongo (Scala)，对于每个 RDD，我将其转换为数据框，分组/提取必要的数据，然后针对 mongo 发起大量数据库更新查询。我想问:

我正在使用 mesos 在 3 台服务器上部署 spark，并且还有一台服务器用于 mongo 数据库。这是处理数据库连接的正确方法吗？我担心的是数据库连接/轮询是否在 spark 作业开始时打开并在整个 spark 持续时间(周，月......)期间正确维护(尽管超时/网络错误故障转移)，以及是否会在每次关闭时关闭批完了吗？考虑到作业可能会安排在不同的服务器上？这是否意味着每个批处理都会打开不同的数据库连接集？
如果执行查询时出现异常怎么办。该批处理的 Spark 作业会失败吗？但是下一批还会继续吗？
如果有太多查询(2000->+)无法在 mongo-database 上运行更新，并且执行时间超过配置的 spark 批处理持续时间(2 分钟)，是否会导致问题？我注意到，在我当前的设置中，大约 2-3 天后，所有批处理都在 Spark WebUI 上作为“进程”排队(如果我禁用 mongo 更新部分，那么我可以毫无问题地运行一周)，没有能够正常退出。这基本上会挂断所有批处理作业，直到我重新启动/重新提交作业。

非常感谢。如果您能帮我解决这个问题，我将不胜感激。

最佳答案

请阅读 http://spark.apache.org/docs/latest/streaming-programming-guide.html 中的“使用 foreachRDD 的设计模式”部分.这将消除您对应如何使用/创建连接的疑虑。

其次，我建议将直接更新操作与您的 Spark 作业分开。更好的方法是你的 spark 作业，处理数据然后将其发布到 Kafka 队列中，然后有另一个专用进程/作业/代码从 Kafka 队列读取数据并在 Mongo DB 上执行插入/更新操作。

关于apache-spark - 处理 spark streaming 中的数据库连接，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/33709769/

24

4

0

文章推荐： R:计算数据框中的行数，匹配字符位于字符串的指定位置

文章推荐： visual-studio - Nuget 找不到大多数包

python - 连接/连接/合并两个缺失一列的数据框
我知道这个问题可能已经被问过，但我检查了所有这些，我认为我的情况有所不同(请友善)。所以我有两个数据集，第一个是测试数据集，第二个是我保存在数据框中的预测(预测值，这就是没有数据列的原因)。我想合并两
Python - 如何组合/连接/连接 pandas 系列变量忽略空变量
在 .loc 方法的帮助下，我根据同一数据框中另一列中的值来识别 Panda 数据框中某一列中的值。下面给出了代码片段供您引用: var1 = output_df['Player'].loc[out
sftp - 服务器拒绝 SFTP 连接，但它会监听 FTP 连接
当我在 Windows 中使用 WinSCP 通过 Ubuntu 连接到 VMware 时，它提示: The server rejected SFTP connection, but it lis
java - 连接 3G 与 Wi-Fi 连接
我正在开发一个使用 xml web 服务的 android 应用程序。在 wi-fi 网络中连接时工作正常，但在 3G 网络中连接时失败(未找到 http 404)。这不仅仅发生在设备中。为了进行测
objective-c - 连接 Action 有效。连接 socket 不
我有一个XIB包含我的控件的文件，加载到 Interface Builder(Snow Leopard 上的 Xcode 4.0.2)中。文件的所有者被设置为 someClassController
mysql - 用户可以通过 PDO 连接，但不能通过 C mysql_real_connect 连接
我在本地计算机上管理 MySQL 数据库，并通过运行以下程序通过 C 连接到它: #include #include #include int main(int argc, char** arg
java - Spring 和 MySQL 连接(不断创建新连接而不是使用 hibernate 连接)
我不知道为什么每次有人访问我网站上的页面时，都会打开一个与数据库的新连接。最终我到达了大约 300 并收到错误并且页面不再加载。我认为它应该工作的方式是，我将 maxIdle 设置为 30，这意味着
python - 使用 Python 3 连接/连接 txt 文件中的行
希望清理 NMEA GPS 中的 .txt 文件。我当前的代码如下。 deletes = ['$GPGGA', '$GPGSA', '$GPGSV', '$PSRF156', ] searchquer
c# - 通过 C#.Net 创建/连接 VPN 连接
我有一个 URL、一个用户名和一个密码。我想在 C# .Net WinForms 中建立 VPN 连接。你能告诉我从哪里开始吗？任何第三方 API？代码示例将受到高度赞赏... 最佳答案您可以像
c++ - 将字符串 vector 连接(连接)到字符缓冲区，零字节作为分隔符/终止符
有没有更好的方法将字符串 vector 转换为字符 vector ，字符串之间的终止符为零。因此，如果我有一个包含以下字符串的 vector "test","my","string"，那么我想接收一
android - 在 Android Instrumented 测试中模拟无 Internet 连接/慢速 Internet 连接
我正在编写一个库，它不断检查 android 设备的连接，并在设备连接、断开连接或互联网连接变慢时给出回调。 https://github.com/muddassir235/connection_ch
Mysql 数据库无法使用 "loclhost"连接，但可以使用 "127.0.0.1"Centos 7 (Cloudlinux) 连接
我的操作系统:Centos 7 + CLOUDLINUX 7.7当我尝试从服务器登录Mysql时 [root@server3 ~]# Mysql -u root -h localhost -P 330
ruby-on-rails - 无法打开到本地主机的 TCP 连接:9200(连接被拒绝 - 连接(2)用于 "localhost"端口 9200)(Faraday::ConnectionFailed)
我收到错误:Puma 发现此错误:无法打开到本地主机的 TCP 连接:9200(连接被拒绝 - 连接(2)用于“本地主机”端口 9200)(Faraday::ConnectionFailed)在我的
ruby-on-rails - ActionView::Template::Error(无法打开到本地主机的 TCP 连接:9292(连接被拒绝 - 连接(2)用于 "localhost"端口 9292))
请给我一些解决以下错误的方法。这是一个聊天应用....代码和错误如下:: conversations_controller.rb def create if Conversation.bet
Excel 连接
我想将两个单元格中的数据连接到一个单元格中。我还想只组合那些具有相同 ID 的单元格。任务 ID 名称 4355.2 参与者 4355.2 领袖 4462.1 在线 4462.1 快速 4597.1
TSQL 连接
我经常需要连接 TSQL 中的字段... 使用“+”运算符时 TSQL 强制您处理的两个问题是 Data Type Precedence和 NULL 值。使用数据类型优先级，问题是转换错误。 1)
Facebook 连接
有没有在 iPad 或 iPhone 应用程序中使用 Facebook 连接。这个想法是登录这个应用程序，然后能够看到我的哪些 facebook 用户也在使用该应用程序及其功能。最佳答案是的。
连接/打印字符串文字
我在连接或打印字符串时遇到了一个奇怪的问题。我有一个 char * ，可以将其设置为字符串文字的几个值之一。 char *myStrLiteral = NULL; ... if(blah) myS
Xquery 连接
对于以下数据 - let $x := "Yahooooo !!!! Select one number - " let $y := 1 2 3 4 5 6 7 我想得到
Perl 连接
我正在看 UDEMY for perl 的培训视频，但是视频不清晰，看起来有错误。培训展示了如何使用以下示例连接 2 个字符串: #!usr/bin/perl print $str = "Hi";

首页

博学

6Ren·AI

商城

apache-spark - 处理 spark streaming 中的数据库连接