pandas - pandas和parquet的使用效率-6ren

pandas - pandas和parquet的使用效率

转载作者：行者123 更新时间：2023-12-05 09:28:24

26

4

人们经常谈论使用 parquet and pandas .我正在努力了解我们是否可以在与 pandas 一起使用时利用 parquet 文件的全部功能。例如，假设我有一个大的 Parquet 文件(按年份分区)，其中包含 30 列(包括年份、州、性别、姓氏)和许多行。我想加载 parquet 文件并执行类似的计算

import pandas as pd
df = pd.read_parquet("file.parquet")
df_2002 = df[df.year == 2002]
df_2002.groupby(["state", "gender"])["last_name"].count()

在此查询中，仅使用了 4 列(共 30 列)并且仅使用了年份 2002 分区。这意味着我们只想带来此计算所需的列和行，并且在带有谓词和投影下推的 Parquet 中可以实现类似的事情(以及我们使用 Parquet 的原因)。

但我想了解此查询在 Pandas 中的行为方式。它会在我们调用 df = pd.read_parquet("file.parquet) 时将所有内容都带入内存吗？或者这里应用了任何惰性因素来引入投影和谓词下推？如果不是在这种情况下，将 pandas 与 parquet 一起使用有什么意义？arrow package 可以实现这些吗？

尽管我没有使用过 dask 只是想知道这种情况是否可以在 dask 中处理，因为他们懒惰地执行它。

我确信这种情况在 spark 世界中得到了很好的处理，但只是想知道在本地场景中如何使用 pandas、arrow、dask、ibis 等包处理这些情况。

最佳答案

And I am trying hard to understand if we can utilize the entire features of parquet files when used with pandas.

TL;DR:是的，但与使用 Dask 之类的软件相比，您可能需要更加努力地工作。

For instance say I have a big parquet file (partitioned on year)

这是迂腐的，但单个 parquet 文件没有在任何地方进行分区。 Parquet“数据集”(文件集合)是分区的。例如:

my_dataset/year=2002/data.parquet
my_dataset/year=2003/data.parquet

Does it bring everything into memory the moment we call df = pd.read_parquet("file.parquet) ?

是的。但是……你可以做得更好:

df = pd.read_parquet('/tmp/new_dataset', filters=[[('year','=', 2002)]], columns=['year', 'state', 'gender', 'last_name'])

filters 关键字会将过滤器向下传递给 pyarrow，pyarrow 将以下推方式将过滤器应用于分区(例如，了解需要读取哪些目录)和行组统计信息.

columns 关键字会将列选择传递给 pyarrow，pyarrow 将应用选择以仅从磁盘读取指定的列。

Any of this is possible with the arrow package out there ?

pandas 的 read_parquet 文件中的所有内容都由 pyarrow 在幕后处理(除非您更改为其他引擎)。传统上，group_by 将由 pandas(好吧，也许是 numpy)直接处理，但如果您想尝试在 pyarrow 中做所有事情，pyarrow 也有一些实验性计算 API。

Eventhough I haven't used dask just wondering if this kind of situation is handled in dask as they perform it lazily.

据我了解(我对 dask 没有太多经验)，当你说...

df_2002 = df[df.year == 2002]
df_2002.groupby(["state", "gender"])["last_name"].count()

...在 dask 数据框中，dask 会发现它可以应用下推过滤器和谓词，并且它会在加载数据时这样做。所以 dask 负责确定您应该应用哪些过滤器以及您需要加载哪些列。这样您就不必提前自己弄清楚了。

完整示例(您可以使用 strace 来验证它只加载了两个 parquet 文件之一，并且只加载了该文件的一部分):

import pyarrow as pa
import pyarrow.dataset as ds
import pandas as pd

import shutil

shutil.rmtree('/tmp/new_dataset')
tab = pa.Table.from_pydict({
    "year": ["2002", "2002", "2002", "2002", "2002", "2002", "2003", "2003", "2003", "2003", "2003", "2003"],
    "state": [ "HI",   "HI",   "HI",   "HI",   "CO",   "CO",   "HI",   "HI",   "CO",   "CO",   "CO",   "CO"],
    "gender": [ "M",    "F",   None,    "F",    "M",    "F",   None,    "F",    "M",    "F",    "M",    "F"],
 "last_name": ["Smi", "Will", "Stev", "Stan",  "Smi", "Will", "Stev", "Stan",  "Smi", "Will", "Stev", "Stan"],
    "bonus": [    0,      1,      2,      3,      4,      5,      6,      7,      8,      9,     10,     11]
})
ds.write_dataset(tab, '/tmp/new_dataset', format='parquet', partitioning=['year'], partitioning_flavor='hive')

df = pd.read_parquet('/tmp/new_dataset', filters=[[('year','=', 2002)]], columns=['year', 'state', 'gender', 'last_name'])
df_2002 = df[df.year == 2002]
print(df.groupby(["state", "gender"])["last_name"].count())

免责声明:您在这里询问的是多项技术。我与 Apache Arrow 项目密切合作，因此我的回答可能偏向于那个方向。

关于pandas - pandas和parquet的使用效率，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/71345099/

26

4

0

文章推荐： ruby-on-rails - 启用 zeitwerk 后重新加载时未初始化的常量

文章推荐： tailwind-css - 紫杉顺风 css

jQuery .on 效率
第一个 .on 函数比第二个更有效吗？ $( "div.container" ).on( "click", "p", function(){ }); $( "body" ).on( "click",
JavaScript 效率
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。这个问题似乎与 help center 中定义的范围内的编程无关。 . 已关闭 7 年前。 Improve
jQuery 效率
我有这样的查询: $('#tabContainer li'); JetBrains WebStorm IDE 将其突出显示为低效查询。它建议我改用这个: $('#tabContainer').find
Ruby 效率
我刚刚在 coursera ( https://www.coursera.org/saas/) 上听了一个讲座，教授说 Ruby 中的一切都是对象，每个方法调用都是在对象上调用发送方法，将一些参数传递
excel - 函数输入数据类型是否影响循环速度/效率
这可能是用户“不喜欢”的另一个问题，因为它更多的是与建议相关而不是与问题相关。我有一个在保存和工作簿打开时触发的代码。它在 f(白天与夜晚，日期与实际日期)中选择正确的工作表。周一到周三我的情况
performance - 效率:递归与循环
这只是我的好奇心，但是更有效的是递归还是循环？给定两个功能（使用通用lisp）： (defun factorial_recursion (x) (if (> x 0) (*
loops - For循环或While循环-效率
这可能是一个愚蠢的问题，但是while循环的效率与for循环的效率相比如何？我一直被教导，如果可以使用for循环，那我应该这样做。但是，实际上之间的区别是什么: $i = 0; while($i <
elasticsearch - elasticsearch排序与得分-效率？
我有一个Elasticsearch索引，其中包含几百万条记录。 (基于时间戳的日志记录) 我需要首先显示最新记录(即，按时间戳降序排列的记录) 在时间戳上排序desc是否比使用时间戳的函数计分功能更有
Java 效率 - 点与坐标
使用Point2D而不是double x和y值时，效率有很大差异吗？我正在开发一个程序，该程序有许多圆圈在屏幕上移动。他们各自从一个点出发，并越来越接近目的地(最后，他们停下来)。使用 .getC
Java ArrayList 效率
我正在编写一个游戏，并且有一个名为 GameObject 的抽象类和三个扩展它的类(Player、Wall 和 Enemy)。我有一个定义为包含游戏中所有对象的列表。 List objects; 当
javascript - 链接与创建新集合 - 效率
我是 Backbone 的初学者，想知道两者中哪一个更有效以及预期的做事方式。 A 型:创建一个新集合，接受先前操作的结果并从新集合中提取 key result = new Backbone.Coll
SQL 通配符搜索 - 效率？
最近，关于使用 LIKE 和通配符搜索 MS SQL 数据库的最有效方法存在争论。我们正在使用 %abc%、%abc 和 abc% 进行比较。有人说过，术语末尾应该始终有通配符 (abc%)。因此，根
java - Scala 效率
关闭。这个问题是opinion-based 。目前不接受答案。想要改进这个问题吗？更新问题，以便 editing this post 可以用事实和引文来回答它。 . 已关闭 8 年前。 Improv
java - setVisible() 效率
我想知道，这样做会更有效率吗: setVisible(false) // if the component is invisible 或者像这样: if(isVisible()){
c# - 很多insertQuerys - 效率
我有一个静态方法可以打开到 SQL Server 的连接、写入日志消息并关闭连接。我在整个代码中多次调用此方法(平均每 2 秒一次)。问题是 - 它有效率吗？我想也许积累一些日志并用一个连接插入它们
javascript - PHP生成jQuery——效率
这个问题在这里已经有了答案: Best practice to avoid memory or performance issues related to binding a large numbe
java - 石头剪刀布游戏 - 效率？
我为我的 CS 课(高中四年级)制作了一个石头剪刀布游戏，我的老师给我的 shell 文件指出我必须将 do while 循环放入运行者中，但我不明白为什么？我的代码可以工作，但她说最好把它写在运行者
java - 自定义数组包装类类型转换安全/效率
我正在编写一个需要通用列表的 Java 应用程序。该列表需要能够经常动态地调整大小，对此的明显答案是通用的Linkedlist。不幸的是，它还需要像通过调用索引添加/删除值一样频繁地获取/设置值。 A
php - MYSQL查询的问题(效率)
我的 Mysql 语句遇到了真正的问题，我需要将几个表连接在一起，查询它们并按另一个表中值的平均值进行排序。这就是我所拥有的... SELECT ROUND(avg(re.rating
java - 效率？这些代码之间有什么区别吗？
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Is there a difference between i==0 and 0==i? 以下编码风格有什么

首页

博学

6Ren·AI

商城

pandas - pandas和parquet的使用效率