apache-spark - 为什么我的 parquet 分区数据比非分区数据慢？-6ren

apache-spark - 为什么我的 parquet 分区数据比非分区数据慢？

转载作者：行者123 更新时间：2023-12-05 05:16:58

27

4

我的理解是:如果我在一个列上对数据进行分区，我将通过它进行查询应该会更快。但是，当我尝试它时，它似乎变慢了，为什么？

我有一个用户数据框，我尝试对 yearmonth 进行分区，但没有。

所以我有 1 个按 creation_yearmonth 分区的数据集。

questionsCleanedDf.repartition("creation_yearmonth") \
    .write.partitionBy('creation_yearmonth') \
    .parquet('wasb://.../parquet/questions.parquet')

我还有一个没有分区

questionsCleanedDf \
    .write \
    .parquet('wasb://.../parquet/questions_nopartition.parquet')

然后我尝试从这 2 个 Parquet 文件创建数据框并运行相同的查询

questionsDf = spark.read.parquet('wasb://.../parquet/questions.parquet')

和

questionsDf = spark.read.parquet('wasb://.../parquet/questions_nopartition.parquet')

查询

spark.sql("""
    SELECT * FROM questions
    WHERE creation_yearmonth = 201606
""")

似乎无分区的一贯更快或具有相似的时间(~2 - 3 秒)，而分区的一个稍微慢一点(~3 - 4 秒)。

我试着做了一个解释:

对于分区数据集:

== Physical Plan ==
*FileScan parquet [id#6404,title#6405,tags#6406,owner_user_id#6407,accepted_answer_id#6408,view_count#6409,answer_count#6410,comment_count#6411,creation_date#6412,favorite_count#6413,creation_yearmonth#6414] Batched: false, Format: Parquet, Location: InMemoryFileIndex[wasb://data@cs4225.blob.core.windows.net/parquet/questions.parquet], PartitionCount: 1, PartitionFilters: [isnotnull(creation_yearmonth#6414), (creation_yearmonth#6414 = 201606)], PushedFilters: [], ReadSchema: struct<id:int,title:string,tags:array<string>,owner_user_id:int,accepted_answer_id:int,view_count...

PartitionCount: 1 我应该因为在这种情况下，它可以直接进入分区应该更快？

对于非分区的:

== Physical Plan ==
*Project [id#6440, title#6441, tags#6442, owner_user_id#6443, accepted_answer_id#6444, view_count#6445, answer_count#6446, comment_count#6447, creation_date#6448, favorite_count#6449, creation_yearmonth#6450]
+- *Filter (isnotnull(creation_yearmonth#6450) && (creation_yearmonth#6450 = 201606))
   +- *FileScan parquet [id#6440,title#6441,tags#6442,owner_user_id#6443,accepted_answer_id#6444,view_count#6445,answer_count#6446,comment_count#6447,creation_date#6448,favorite_count#6449,creation_yearmonth#6450] Batched: false, Format: Parquet, Location: InMemoryFileIndex[wasb://data@cs4225.blob.core.windows.net/parquet/questions_nopartition.parquet], PartitionFilters: [], PushedFilters: [IsNotNull(creation_yearmonth), EqualTo(creation_yearmonth,201606)], ReadSchema: struct<id:int,title:string,tags:array<string>,owner_user_id:int,accepted_answer_id:int,view_count...

也很意外。起初数据集有日期作为字符串，所以我需要做这样的查询:

spark.sql("""
    SELECT * FROM questions
    WHERE CAST(creation_date AS date) BETWEEN '2017-06-01' AND '2017-07-01'
""").show(20, False)

我原以为这会更慢，但事实证明，它的性能最好~1-2 秒。这是为什么？我想在这种情况下，它需要转换每一行吗？

此处的解释输出:

== Physical Plan ==
*Project [id#6521, title#6522, tags#6523, owner_user_id#6524, accepted_answer_id#6525, view_count#6526, answer_count#6527, comment_count#6528, creation_date#6529, favorite_count#6530]
+- *Filter ((isnotnull(creation_date#6529) && (cast(cast(creation_date#6529 as date) as string) >= 2017-06-01)) && (cast(cast(creation_date#6529 as date) as string) <= 2017-07-01))
   +- *FileScan parquet [id#6521,title#6522,tags#6523,owner_user_id#6524,accepted_answer_id#6525,view_count#6526,answer_count#6527,comment_count#6528,creation_date#6529,favorite_count#6530] Batched: false, Format: Parquet, Location: InMemoryFileIndex[wasb://data@cs4225.blob.core.windows.net/filtered/questions.parquet], PartitionFilters: [], PushedFilters: [IsNotNull(creation_date)], ReadSchema: struct<id:string,title:string,tags:array<string>,owner_user_id:string,accepted_answer_id:string,v...

最佳答案

过度分区实际上会降低性能:

If a column has only a few rows matching each value, the number of directories to process can become a limiting factor, and the data file in each directory could be too small to take advantage of the Hadoop mechanism for transmitting data in multi-megabyte blocks.

这段摘录自另一个 Hadoop 组件的文档，Impala ，但提出的论点应该对 Hadoop 堆栈的所有组件都有效。

我认为无论使用何种分区方案，分区的优势在表增长到超过 900 MB-s 时才会显现。

关于apache-spark - 为什么我的 parquet 分区数据比非分区数据慢？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49776752/

27

4

0

文章推荐： scala - Akka Stateful Actor 跨节点复制

文章推荐： python - 在 Pandas 中查找真实部分的长度

文章推荐： github - Jupyter 笔记本 : image from github

区 block 链实现
关闭。这个问题需要更多 focused .它目前不接受答案。想改进这个问题？更新问题，使其仅关注一个问题 editing this post . 4年前关闭。 Improve this questi
PHP登录成员(member)区
我已经完成了注册页面，并且运行顺利。现在我需要弄清楚登录部分。我想要它，所以一旦用户登录，它就会将他们带到私有(private)页面，只有登录的用户才能看到。它不需要针对每个用户进行个性化设置，只
区 block 链 - 实现如何进行点对点发现？
出于个人好奇心，我目前正在学习区 block 链的工作原理。我正在学习这门类(class)，现在我已经使用网络套接字设置了点对点连接。区 block 链应用程序的多个实例现在可以使用这些套接字运行并相
sql - 区 block 链可以存储在SQL甚至noSQL数据库中吗？
我读过: The blockchain database isn’t stored in any single location, meaning the records it keeps are t
blockchain - 区 block 链是分布式数据库吗？
Closed. This question needs to be more focused。它当前不接受答案。想要改善这个问题吗？更新问题，使它仅关注editing this post的一个问题。
transactions - 区 block 链交易
如果我在区块链中进行交易，是否只有在将交易添加到区块链后才会进行比特币转账？如果是这样，挖掘区块可能需要时间，并且无法进行紧急付款。那么这不是区块链的劣势吗？最佳答案如果您不重视能够在没有第三方(
blockchain - 区 block 链如何安全？
Closed. This question needs to be more focused。它当前不接受答案。想改善这个问题吗？更新问题，使其仅通过editing this post专注于一个问题
blockchain - 区 block 链中的权限？
根据我的理解，我读到的关于区 block 链的所有内容都表明，即使在私有(private)区 block 链上，每个参与者都可以查看所有交易。我看到它提到区 block 链的一个用例可能是共享医疗数据
c# - 区 block IP地址
服务器正在发送消息时，如何阻止连接到服务器的一个IP地址。我的发送消息选项程序如下所示。 private void buttonSendMsg_Click(对象发送者，EventArgs e) {
hadoop - 区 block 大小效果Hadoop
iam正在hadoop apache 2.7.1上工作和iam添加大小不超过100 Kb的文件所以如果我将块大小配置为1 mb或默认值是 128兆字节不会影响我的文件，因为它们只会保存在一个块中
docker - 区 block 链REST端点不可访问
我有一个docker-compose文件here。我可以连接到7051并注册我的chaincode客户端，但是当我尝试连接到localhost:7050时，我得到一个错误，该错误在使用curl测试时如
list - 区 block 链是单链表吗？
从数据类型来看，区 block 链是单链表吗？因为每个 block 都使用哈希引用前一个 block 。或者它是某种树？最佳答案区 block 链表示为单链表的方式。每个 block 都有前一个
java - 区 block 链表示
我无法理解给定代码片段的 hashcode() 部分。我尝试过搜索它，但我无法弄清楚。 this.hash = Arrays.hashCode(new Integer[]{data.has
bitcoin - 区 block 链是去中心化数据库吗？
已关闭。这个问题是 not about programming or software development 。目前不接受答案。这个问题似乎不是关于 a specific programming
java - 区 block 链技术如何验证工作证明
我正在通过一些在线示例学习区 block 链。我有这个高级代码，我用以前的哈希创建一个新 block ，然后向它添加一个事务，然后生成 block 的困难哈希(有 8 个前导零) Block blo
php - 区 block 链api支付模块
我们有一个包含一些数字商品的网站。从那里购买的用户需要用 BTC 购买一些信用。在他购买信用卡后，脚本必须将他用 BTC 购买的货币 (USD) 数量加载到他的账户中。所以这里我们有 HTML 表单
ios - 区 block 完成状态验证
我目前正在使用 enumerateObjectsUsingBlock block 在 subview 下进行枚举，我怎样才能确定 block 的完成？下面是区 block 内容 [self.view
css - 锂中的 active 区
我通常将显示 block 放在链接上，以使按钮的所有 div 都处于事件状态，而不仅仅是文本。但在这种情况下，我需要在 ul li 中使用 display:inline-block 我认为这会禁用其他
python - 区 block 链信息钱包支票付款
我正在尝试创建付款账单并通过电报机器人发送给我的客户:我正在使用区 block 链 API V2-https://blockchain.info/api/api 接收。我的代码是: xpub='***
algorithm - 区 block 链和不可变链表有什么区别？
有个面试题:区 block 链和不可变链表有什么区别？我回答他们是相同的技术，然后没有通过测试。请纠正我的错误。最佳答案链表中的每一项通常通过指针或内存地址指向链表中的下一项。区 block

首页

博学

6Ren·AI

商城

apache-spark - 为什么我的 parquet 分区数据比非分区数据慢？