python - 为什么 Dask 似乎存储 Parquet 效率低下-6ren

python - 为什么 Dask 似乎存储 Parquet 效率低下

转载作者：行者123 更新时间：2023-12-04 14:53:12

25

4

当我使用 Pandas 和 Dask 将同一张表保存到 Parquet 中时，Pandas 会创建一个 4k文件，其中 Dask 创建了一个 39M文件。
创建数据框

import pandas as pd
import pyarrow as pa
import pyarrow.parquet as pq
import dask.dataframe as dd

n = int(1e7)
df = pd.DataFrame({'col': ['a'*64]*n})

用不同的方式保存

# Pandas: 4k
df.to_parquet('example-pandas.parquet')

# PyArrow: 4k
pq.write_table(pa.Table.from_pandas(df), 'example-pyarrow.parquet')

# Dask: 39M
dd.from_pandas(df, npartitions=1).to_parquet('example-dask.parquet', compression='snappy')

起初我认为 Dask 不使用字典和运行长度编码，但事实并非如此。我不确定我是否正确解释了元数据信息，但至少，它似乎完全相同:

>>> pq.read_metadata('example-pandas.parquet').row_group(0).column(0)
<pyarrow._parquet.ColumnChunkMetaData object at 0x7fbee7d1a770>
  file_offset: 548
  file_path: 
  physical_type: BYTE_ARRAY
  num_values: 10000000
  path_in_schema: col
  is_stats_set: True
  statistics:
    <pyarrow._parquet.Statistics object at 0x7fbee7d2cc70>
      has_min_max: True
      min: aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa
      max: aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa
      null_count: 0
      distinct_count: 0
      num_values: 10000000
      physical_type: BYTE_ARRAY
      logical_type: String
      converted_type (legacy): UTF8
  compression: SNAPPY
  encodings: ('PLAIN_DICTIONARY', 'PLAIN', 'RLE')
  has_dictionary_page: True
  dictionary_page_offset: 4
  data_page_offset: 29
  total_compressed_size: 544
  total_uncompressed_size: 596

>>> pq.read_metadata('example-dask.parquet/part.0.parquet').row_group(0).column(0)
<pyarrow._parquet.ColumnChunkMetaData object at 0x7fbee7d3d180>
  file_offset: 548
  file_path: 
  physical_type: BYTE_ARRAY
  num_values: 10000000
  path_in_schema: col
  is_stats_set: True
  statistics:
    <pyarrow._parquet.Statistics object at 0x7fbee7d3d1d0>
      has_min_max: True
      min: aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa
      max: aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa
      null_count: 0
      distinct_count: 0
      num_values: 10000000
      physical_type: BYTE_ARRAY
      logical_type: String
      converted_type (legacy): UTF8
  compression: SNAPPY
  encodings: ('PLAIN_DICTIONARY', 'PLAIN', 'RLE')
  has_dictionary_page: True
  dictionary_page_offset: 4
  data_page_offset: 29
  total_compressed_size: 544
  total_uncompressed_size: 596

为什么 Dask-create Parquet 大得多？或者，我如何进一步检查可能的问题？

最佳答案

Dask 似乎正在保存一个 int64 索引...

>>> meta.row_group(0).column(1)
<pyarrow._parquet.ColumnChunkMetaData object at 0x7fa41e1babd0>
  file_offset: 40308181
  file_path: 
  physical_type: INT64
  num_values: 10000000
  path_in_schema: __null_dask_index__
  is_stats_set: True
  statistics:
    <pyarrow._parquet.Statistics object at 0x7fa41e1badb0>
      has_min_max: True
      min: 0
      max: 9999999
      null_count: 0
      distinct_count: 0
      num_values: 10000000
      physical_type: INT64
      logical_type: None
      converted_type (legacy): NONE
  compression: SNAPPY
  encodings: ('PLAIN_DICTIONARY', 'PLAIN', 'RLE', 'PLAIN')
  has_dictionary_page: True
  dictionary_page_offset: 736
  data_page_offset: 525333
  total_compressed_size: 40307445
  total_uncompressed_size: 80284661

您可以使用 write_index 禁用此功能:

dd.from_pandas(df, npartitions=1).to_parquet('example-dask.parquet', compression='snappy', write_index=False)

Pyarrow 不会生成任何索引。
Pandas 确实会生成索引，但至少在使用箭头引擎时，简单的线性索引将被保存为元数据而不是实际的列。

>>> table = pq.read_table('example-pandas.parquet')
>>> pandas_meta = json.loads(table.schema.metadata[b'pandas'])
>>> pandas_meta['index_columns'][0]
{'kind': 'range', 'name': None, 'start': 0, 'stop': 10000000, 'step': 1}

关于python - 为什么 Dask 似乎存储 Parquet 效率低下，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/68688309/

25

4

0

文章推荐： macos - 如何在 SwiftUI 生命周期中显示 NSPopover？

文章推荐： python - Panda Python - 计算 bool 列中真假值的百分比

文章推荐： firebase - Nuxtjs 在 asyncData 中获取 firestore 数据

文章推荐： Flutter Web - TextFormField 禁用复制和粘贴

dask - Dask 如何处理函数定义中的外部或全局变量？
如果我有一个依赖于某些全局或其他常量的函数，如下所示: x = 123 def f(partition): return partition + x # note that x is def
dask - Dask 不支持项目分配
我们可以通过哪些方式在 Dask Arrays 中执行项目分配？即使是一个非常简单的项目分配，如:a[0] = 2 不起作用。最佳答案正确的。这是文档中提到的第一个限制。通常，涉及 for 循环
dask - dask 工作人员存储结果或文件的默认目录是什么？
[mapr@impetus-i0057 latest_code_deepak]$ dask-worker 172.26.32.37:8786 distributed.nanny - INFO -
dask - 异步计算 dask 数组 block (Dask + FastAPI)
我正在构建一个 FastAPI 应用程序，它将为 Dask 数组的 block 提供服务。我想利用 FastAPI's asynchronous functionality旁边Dask-distrib
dask - dask 数据帧的延迟重新分区
在延迟数据帧处理的几个阶段之后，我需要在保存数据帧之前对其进行重新分区。但是，.repartition() 方法要求我知道分区的数量(而不是分区的大小)，这取决于处理后数据的大小，这是未知的。我想我
dask - 使用 dask.delayed 和 pandas.DataFrame 将 dask.bag 字典转换为 dask.dataframe
我正在努力转换 dask.bag将字典放入 dask.delayed pandas.DataFrames进入决赛 dask.dataframe 我有一个函数 (make_dict) 将文件读入一个相当
dask - 如何使用 dask/dask-cudf 将单个大型 Parquet 文件读入多个分区？
我正在尝试使用 dask_cudf/dask 读取单个大型 parquet 文件(大小 > gpu_size)，但它目前正在读取它到一个分区中，我猜这是从文档字符串推断出的预期行为: dask.dat
dask - 如何从 Dask 调度程序获取仪表板地址
当启动一个 dask 分布式本地集群时，您可以为 dashboard_address 设置一个随机端口或地址。如果稍后获取scheduler对象。有没有办法提取仪表板的地址。我有这个: clust
dask - 对 dask 数据帧样本的计算比对所有数据的计算要长得多
我有一个 dask 数据框，由 parquet 支持。它有 1.31 亿行，当我对整个帧执行一些基本操作时，它们需要几分钟。 df = dd.read_parquet('data_*.pqt') un
dask - 使用 Dask 中的所有内核
我正在使用 24 个 vCPU 的谷歌云计算实例。运行代码如下 import dask.dataframe as dd from distributed import Client client =
dask - 在 Dask 数据帧子集上强制局部性
我正在尝试在多台机器上分发一个大型 Dask 数据帧，以便(稍后)在数据帧上进行分布式计算。我为此使用了 dask-distributed。我看到的所有 dask 分布式示例/文档都是从网络资源(h
dask - 我怎样才能在与提交它的机器不同的机器上获得 Dask 计算的结果？
我在 Django 服务器后面使用 Dask，这里总结了我的基本设置:https://github.com/MoonVision/django-dask-demo/可以在这里找到 Dask 客户端:h
dask - 使用多列作为索引来旋转 dask 数据框
我有以下格式的 Dask DataFrame: date hour device param value 20190701 21 dev_01 att_1 0.00
dask - 无法使用 dask 删除列或切片数据框？
我正在尝试使用 dask 而不是 Pandas，因为我有 2.6gb csv 文件。我加载它，我想删除一列。但似乎无论是 drop 方法 df.drop('column') 或切片 df[ : ,
dask - 如何使用 Dask 对大文本文件进行排序？
我有一个比我的内存大得多的文本文件。我想按字典顺序对该文件的行进行排序。我知道如何手动完成: 分成适合内存的块对块进行排序合并块我想用 dask 来做。我认为处理大量数据将是 dask 的一个用
dask - 如何在 Dask 中停止正在运行的任务？
使用 Dask 的分布式调度程序时，我有一个正在远程工作人员上运行的任务，我想停止该任务。我该如何阻止？我知道取消方法，但如果任务已经开始执行，这似乎不起作用。最佳答案如果它还没有运行如果任务
dask - 按顺序迭代一个 dask 包
我需要将一个非常大的 dask.bag 的元素提交到一个非线程安全的存储区，即我需要类似的东西 for x in dbag: store.add(x) 我无法使用compute，因为包太大，无
dask - 在 Dask 数据帧中的现有索引上设置分区
如果我有一个已经索引的 Dask 数据框 >>> A.divisions (None, None) >>> A.npartitions 1 我想设置分区，到目前为止我正在做 A.reset_index
dask - 如何让 Dask 知道索引已排序？
根据 this回答，如果 Dask 知道数据帧的索引已排序，则 Dask 数据帧可以执行智能索引。如果索引已排序，我如何让 Dask 知道？在我的具体情况下，我正在做这样的事情: for sour
dask - 如何检查是否有一个已经在运行的 dask 调度程序？
我想从具有特定数量的工作人员的 python 启动本地集群，然后将客户端连接到它。 cluster = LocalCluster(n_workers=8, ip='127.0.0.1') client

首页

博学

6Ren·AI

商城

python - 为什么 Dask 似乎存储 Parquet 效率低下