join - 与谷歌数据流的复杂连接-6ren

join - 与谷歌数据流的复杂连接

转载作者：行者123 更新时间：2023-12-04 11:35:47

25

4

我是一个新手，试图了解我们如何将批处理 ETL 过程重写到 Google Dataflow 中。我已经阅读了一些文档，运行了一些示例。

我提议新的 ETL 流程将由业务事件(即源 PCollection)驱动。这些将触发该特定业务实体的 ETL 过程。 ETL 过程将从源系统中提取数据集，然后将这些结果 (PCollections) 传递到下一个处理阶段。处理阶段将涉及各种类型的连接(包括笛卡尔连接和非键连接，例如日期带)。

所以这里有几个问题:

(1) 我提出的方法有效且有效吗？如果不是什么会更好，我还没有看到任何关于使用 Google Dataflow 的现实世界复杂 ETL 过程的演示，只有简单的场景。

是否有更适合的“更高级别”的 ETL 产品？我一直在关注 Spark 和 Flink 一段时间。

我们当前的 ETL 中等复杂，尽管只有大约 30 个核心表(经典的 EDW 维度和事实)和约 1000 个转换步骤。源数据很复杂(大约 150 个 Oracle 表)。

(2) 复杂的非键连接，如何处理？

我显然被 Google Dataflow 所吸引，因为它首先是一个 API，并且并行处理功能似乎非常适合(我们被要求从批处理转移到增量处理)。

用于此用例的 Dataflow 的一个很好的工作示例将真正插入采用!

谢谢，
迈克

最佳答案

听起来 Dataflow 很适合。我们允许您编写一个接受 PCollection 的管道。业务事件并执行 ETL。管道可以是批处理(定期执行)或流(每当输入数据到达时执行)。

大部分连接在 Dataflow 中相对易于表达。对于笛卡尔积，可以使用 side inputs 查看制作 PCollection 的内容可用作另一个 PCollection 中每个元素处理的输入.

你也可以看看使用 GroupByKey或 CoGroupByKey 实现连接。这些扁平化多个输入，并允许在一个地方使用相同的键访问所有值。您也可以使用 Combine.perKey计算与键关联的所有元素的关联和交换组合(例如，SUM、MIN、MAX、AVERAGE 等)。

日期带状连接听起来很适合 windowing它允许您编写一个消耗数据窗口的管道(例如，每小时窗口、每日窗口、每天滑动的 7 天窗口等)。

编辑:提及 GroupByKey和 CoGroupByKey .

关于join - 与谷歌数据流的复杂连接，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/35044083/

25

4

0

文章推荐： ffprobe - 如何限制ffprobe解释的帧数？

文章推荐： lets-encrypt - 将子域添加到现有证书

文章推荐： shopify - 如何在 Liquid 中定义全局变量？

python - 连接/连接/合并两个缺失一列的数据框
我知道这个问题可能已经被问过，但我检查了所有这些，我认为我的情况有所不同(请友善)。所以我有两个数据集，第一个是测试数据集，第二个是我保存在数据框中的预测(预测值，这就是没有数据列的原因)。我想合并两
Python - 如何组合/连接/连接 pandas 系列变量忽略空变量
在 .loc 方法的帮助下，我根据同一数据框中另一列中的值来识别 Panda 数据框中某一列中的值。下面给出了代码片段供您引用: var1 = output_df['Player'].loc[out
sftp - 服务器拒绝 SFTP 连接，但它会监听 FTP 连接
当我在 Windows 中使用 WinSCP 通过 Ubuntu 连接到 VMware 时，它提示: The server rejected SFTP connection, but it lis
java - 连接 3G 与 Wi-Fi 连接
我正在开发一个使用 xml web 服务的 android 应用程序。在 wi-fi 网络中连接时工作正常，但在 3G 网络中连接时失败(未找到 http 404)。这不仅仅发生在设备中。为了进行测
objective-c - 连接 Action 有效。连接 socket 不
我有一个XIB包含我的控件的文件，加载到 Interface Builder(Snow Leopard 上的 Xcode 4.0.2)中。文件的所有者被设置为 someClassController
mysql - 用户可以通过 PDO 连接，但不能通过 C mysql_real_connect 连接
我在本地计算机上管理 MySQL 数据库，并通过运行以下程序通过 C 连接到它: #include #include #include int main(int argc, char** arg
java - Spring 和 MySQL 连接(不断创建新连接而不是使用 hibernate 连接)
我不知道为什么每次有人访问我网站上的页面时，都会打开一个与数据库的新连接。最终我到达了大约 300 并收到错误并且页面不再加载。我认为它应该工作的方式是，我将 maxIdle 设置为 30，这意味着
python - 使用 Python 3 连接/连接 txt 文件中的行
希望清理 NMEA GPS 中的 .txt 文件。我当前的代码如下。 deletes = ['$GPGGA', '$GPGSA', '$GPGSV', '$PSRF156', ] searchquer
c# - 通过 C#.Net 创建/连接 VPN 连接
我有一个 URL、一个用户名和一个密码。我想在 C# .Net WinForms 中建立 VPN 连接。你能告诉我从哪里开始吗？任何第三方 API？代码示例将受到高度赞赏... 最佳答案您可以像
c++ - 将字符串 vector 连接(连接)到字符缓冲区，零字节作为分隔符/终止符
有没有更好的方法将字符串 vector 转换为字符 vector ，字符串之间的终止符为零。因此，如果我有一个包含以下字符串的 vector "test","my","string"，那么我想接收一
android - 在 Android Instrumented 测试中模拟无 Internet 连接/慢速 Internet 连接
我正在编写一个库，它不断检查 android 设备的连接，并在设备连接、断开连接或互联网连接变慢时给出回调。 https://github.com/muddassir235/connection_ch
Mysql 数据库无法使用 "loclhost"连接，但可以使用 "127.0.0.1"Centos 7 (Cloudlinux) 连接
我的操作系统:Centos 7 + CLOUDLINUX 7.7当我尝试从服务器登录Mysql时 [root@server3 ~]# Mysql -u root -h localhost -P 330
ruby-on-rails - 无法打开到本地主机的 TCP 连接:9200(连接被拒绝 - 连接(2)用于 "localhost"端口 9200)(Faraday::ConnectionFailed)
我收到错误:Puma 发现此错误:无法打开到本地主机的 TCP 连接:9200(连接被拒绝 - 连接(2)用于“本地主机”端口 9200)(Faraday::ConnectionFailed)在我的
ruby-on-rails - ActionView::Template::Error(无法打开到本地主机的 TCP 连接:9292(连接被拒绝 - 连接(2)用于 "localhost"端口 9292))
请给我一些解决以下错误的方法。这是一个聊天应用....代码和错误如下:: conversations_controller.rb def create if Conversation.bet
Excel 连接
我想将两个单元格中的数据连接到一个单元格中。我还想只组合那些具有相同 ID 的单元格。任务 ID 名称 4355.2 参与者 4355.2 领袖 4462.1 在线 4462.1 快速 4597.1
TSQL 连接
我经常需要连接 TSQL 中的字段... 使用“+”运算符时 TSQL 强制您处理的两个问题是 Data Type Precedence和 NULL 值。使用数据类型优先级，问题是转换错误。 1)
Facebook 连接
有没有在 iPad 或 iPhone 应用程序中使用 Facebook 连接。这个想法是登录这个应用程序，然后能够看到我的哪些 facebook 用户也在使用该应用程序及其功能。最佳答案是的。
连接/打印字符串文字
我在连接或打印字符串时遇到了一个奇怪的问题。我有一个 char * ，可以将其设置为字符串文字的几个值之一。 char *myStrLiteral = NULL; ... if(blah) myS
Xquery 连接
对于以下数据 - let $x := "Yahooooo !!!! Select one number - " let $y := 1 2 3 4 5 6 7 我想得到
Perl 连接
我正在看 UDEMY for perl 的培训视频，但是视频不清晰，看起来有错误。培训展示了如何使用以下示例连接 2 个字符串: #!usr/bin/perl print $str = "Hi";

首页

博学

6Ren·AI

商城

join - 与谷歌数据流的复杂连接