hadoop - 为什么分区连接(随机播放)并不总是比广播连接好？-6ren

hadoop - 为什么分区连接(随机播放)并不总是比广播连接好？

转载作者：可可西里更新时间：2023-11-01 14:45:29

26

4

我已经进行了深入的研究，但我找不到足够详细的信息..我读过这些:1) http://www.cloudera.com/content/www/en-us/documentation/enterprise/latest/PDF/cloudera-impala.pdf2) http://www.cidrdb.org/cidr2015/Papers/CIDR15_Paper28.pdf

但是我没有找到任何答案..

有人能解释一下为什么分区连接并不总是更好吗？我的意思是，如果我们有两个表 T1(大表)和 T2(小表)，如果我使用分区策略，它们都会被分区，并且我们将 T1/n-1 子集发送到其他节点，T2 也是如此.另一方面，如果我选择广播，Impala 将向其他 Impala 发送 T2*n-1 数据。

也许我不明白这些策略是如何运作的..如果我错了，有人能解释一下吗？也许用一个简单的平局？ (我已经在谷歌图片上搜索过..)

提前致谢

最佳答案

分区不是免费的，构建端和探测端(左侧和右侧)都需要进行分区才能进行分区连接。每个分区都需要一个交换计划片段作为子片段，并且每个片段都会引起网络传输。但是，如果构建端很小，那么每个节点都可以拥有它的副本(即广播)，然后使用未分区左侧探测构建端哈希表，而无需在探测上引入额外的子交换边。事实上，广播所需的交换特别昂贵，因为每个发送者需要发送给 N 个接收者。

什么是“足够小”以执行广播连接？这取决于许多因素，但最明显和最重要的是构建端哈希表应该适合内存。

这是一个示例计划，其中加入策略是 BROADCAST:

[localhost:21000] > explain select * from alltypes t1 join alltypessmall t2 on t1.id = t2.id;
Query: explain select * from alltypes t1 join alltypessmall t2 on t1.id = t2.id
+-----------------------------------------------------------+
| Explain String                                            |
+-----------------------------------------------------------+
| Estimated Per-Host Requirements: Memory=160.01MB VCores=2 |
|                                                           |
| 04:EXCHANGE [UNPARTITIONED]                               |
| |                                                         |
| 02:HASH JOIN [INNER JOIN, BROADCAST]                      |
| |  hash predicates: t1.id = t2.id                         |
| |                                                         |
| |--03:EXCHANGE [BROADCAST]                                |
| |  |                                                      |
| |  01:SCAN HDFS [functional.alltypessmall t2]             |
| |     partitions=4/4 files=4 size=6.32KB                  |
| |                                                         |
| 00:SCAN HDFS [functional.alltypes t1]                     |
|    partitions=24/24 files=24 size=478.45KB                |
+-----------------------------------------------------------+

这是一个示例，其中加入策略是分区的:

Query: explain select * from tpch.lineitem t1 join tpch.lineitem t2 on t1.l_orderkey = t2.l_orderkey
+-----------------------------------------------------------+
| Explain String                                            |
+-----------------------------------------------------------+
| Estimated Per-Host Requirements: Memory=815.44MB VCores=2 |
|                                                           |
| 05:EXCHANGE [UNPARTITIONED]                               |
| |                                                         |
| 02:HASH JOIN [INNER JOIN, PARTITIONED]                    |
| |  hash predicates: t1.l_orderkey = t2.l_orderkey         |
| |                                                         |
| |--04:EXCHANGE [HASH(t2.l_orderkey)]                      |
| |  |                                                      |
| |  01:SCAN HDFS [tpch.lineitem t2]                        |
| |     partitions=1/1 files=1 size=718.94MB                |
| |                                                         |
| 03:EXCHANGE [HASH(t1.l_orderkey)]                         |
| |                                                         |
| 00:SCAN HDFS [tpch.lineitem t1]                           |
|    partitions=1/1 files=1 size=718.94MB                   |
+-----------------------------------------------------------+
Fetched 16 row(s) in 0.03s

请注意，后一个计划有一个额外的交换。这意味着扫描有一个额外的计划片段 (id 00)。

关于hadoop - 为什么分区连接(随机播放)并不总是比广播连接好？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/34052494/

26

4

0

文章推荐： ruby - 为什么二进制文件在压缩时会损坏？

文章推荐： html - CSS 行为在 chrome 和 firefox 之间发生变化

networking - 广播
谁能给我提供代码或链接，以便在可能的情况下使用 UDP 发送和接收广播消息？我一直被困在一个问题中，希望你们能帮助我解决它。谢谢最佳答案这是一个 C# 示例: using System; usi
tensorflow - 如何乘以不同形状的张量？ (广播)
我想将形状为 [a,b,c] 的张量中的元素相乘，每个元素在第 3 维中使用来自形状为 [a,b] 的张量的标量。例如， x = |[1,2][3,4][5,6]| |[1,2][3,4][5,6]
python - TensorFlow 广播
广播是使具有不同形状的数组具有用于算术运算的兼容形状的过程。在 numpy 中，我们可以广播数组。 TensorFlow 图是否支持类似于 numpy 的广播？最佳答案是的，它是支持的。打开终端并
javascript - AngularJS 广播
我有一个刷新功能，需要广播到子 Controller 。我在父 Controller 中做了类似的事情: // Refresh/Cancel $scope.OnGridBODRefre
python - 广播/迭代字典值的有效方法
我正在尝试在计算中使用字典值，如下所示: mydict = dict(zip(['key1', 'key2', 'key3'], [1, 2, 3])) print
Java MPI 广播
刚刚掌握使用 MPI 的 Java 接口(interface)进行并行编程。只是想知道是否有人可以非常简单地解释广播的工作原理？我有以下内容: if (me ==0) { // This is th
广播 Intent 过滤器生成的Android推送通知替换为旧通知
我正在处理一个项目，当我发送消息时，我将它作为通知发送给另一个用户使用广播它工作正常但是当我再次发送新消息然后替换为旧通知而不创建新通知下面是我生成通知的代码 NotificationCompat.
Android视频流Socket MediaRecorder(广播)
我是 android 的初学者。但我非常需要你的帮助。我有一个流媒体视频广播视频项目。我找不到好的示例，在哪里可以实现从摄像机录制视频、将流发送(上传)到服务器以及从服务器下载(获取流)到播放器。请帮
javascript - AngularJS $广播
请帮我解决我的问题。当我从父 Controller 调用并在子 Controller 中捕获时，为什么 $broadcast 函数不起作用？
linux - 广播 socket
我如何从 shell 中看到设置了哪些套接字选项？我特别想知道是否设置了 SO_BROADCAST？最佳答案你看过lsof了吗？关于linux - 广播 socket ，我们在Stack Ove
python - Numpy 广播
当我在 Numpy 中进行此操作时会发生什么？ a = np.ones([500,1]) b = np.ones([5000,])/2 c = a + b # a.shape (500,1) # b.
Android ACTION_DATE_CHANGED 广播
我有一个 Nexus S，当我在手机上手动更改日期时，并不总是广播 ACTION_DATE_CHANGED。如果我将日期从 2014 年 2 月 13 日更改为 2014 年 2 月 14 日，我还没
SpringBoot整合RocketMQ事务/广播/顺序消息
环境：springboot2.3.9RELEASE + RocketMQ4.8.0 依赖 <dependency>
Netty 框架学习 —— UDP 广播
UDP 广播面向连接的传输（如 TCP）管理两个网络端点之间的连接的建立，在连接的生命周期的有序和可靠的消息传输，以及最后，连接的有序终止。相比之下，类似 UDP 的无连接协议中则没有持久化连接的概
angularjs - Angular - 广播，$on 在指令中多次调用
我正在开发一个带有 Angular 的单页应用程序，我需要在两个不同的指令之间进行通信，这些指令基本上没有父子关系。在指令 A 中，我有 2 个地方需要从不同的功能广播相同的事件。在指令 B 中，为
python - 广播 numpy 数组值
我有一个带有多个重复项的主要二维 numpy 数组和一个具有第一个唯一值的辅助数组。 [[ 0 0 1 ] [ 1 0 2 ] [ 2 0 2 ] ... [ 0 0 1 ]
c - 用于自动搜索服务器的 UDP 广播
我正在制作多人网络游戏。现在要连接到服务器，客户端需要服务器的 ip 地址。所以，我的实现方式如下。客户端在广播 IP 和端口 A 上广播其 IP 地址。服务器通过 A 监听它，并且服务器与客户
iphone - 广播 Apple 推送通知
是否可以在没有 Urban Airship 等服务的情况下广播推送通知？谢谢。最佳答案当然可以，但是您需要自己实现整个基础架构。 http://developer.apple.com/libra
optimization - Eigen :按行复制(广播)
我想复制矩阵的每一行 M没有任何复制发生(即通过创建 View ): 0 1 0 1 2 3 -> 0 1 2 3
python - Numpy:分配目的地是只读的 - 广播
我从一个 2D 数组开始，想将它广播到一个 3D 数组(例如，从灰度图像到 rgb 图像)。这是我使用的代码。 >>> img_grey = np.random.randn(4, 4) >>> img

首页

博学

6Ren·AI

商城

hadoop - 为什么分区连接(随机播放)并不总是比广播连接好？