python - 何时在 pandas 中使用多索引与 xarray-6ren

python - 何时在 pandas 中使用多索引与 xarray

转载作者：太空狗更新时间：2023-10-29 20:15:16

24

4

pandas pivot tables documentation似乎建议使用多索引处理多于两个维度的数据:

In [1]: import pandas as pd

In [2]: import numpy as np

In [3]: import pandas.util.testing as tm; tm.N = 3

In [4]: def unpivot(frame):
   ...:         N, K = frame.shape
   ...:         data = {'value' : frame.values.ravel('F'),
   ...:                 'variable' : np.asarray(frame.columns).repeat(N),
   ...:                 'date' : np.tile(np.asarray(frame.index), K)}
   ...:         return pd.DataFrame(data, columns=['date', 'variable', 'value'])
   ...: 

In [5]: df = unpivot(tm.makeTimeDataFrame())

In [6]: df
Out[6]: 
         date variable     value    value2
0  2000-01-03        A  0.462461  0.924921
1  2000-01-04        A -0.517911 -1.035823
2  2000-01-05        A  0.831014  1.662027
3  2000-01-03        B -0.492679 -0.985358
4  2000-01-04        B -1.234068 -2.468135
5  2000-01-05        B  1.725218  3.450437
6  2000-01-03        C  0.453859  0.907718
7  2000-01-04        C -0.763706 -1.527412
8  2000-01-05        C  0.839706  1.679413
9  2000-01-03        D -0.048108 -0.096216
10 2000-01-04        D  0.184461  0.368922
11 2000-01-05        D -0.349496 -0.698993

In [7]: df['value2'] = df['value'] * 2

In [8]: df.pivot('date', 'variable')
Out[8]: 
               value                                  value2            \
variable           A         B         C         D         A         B   
date                                                                     
2000-01-03 -1.558856 -1.144732 -0.234630 -1.252482 -3.117712 -2.289463   
2000-01-04 -1.351152 -0.173595  0.470253 -1.181006 -2.702304 -0.347191   
2000-01-05  0.151067 -0.402517 -2.625085  1.275430  0.302135 -0.805035   


variable           C         D  
date                            
2000-01-03 -0.469259 -2.504964  
2000-01-04  0.940506 -2.362012  
2000-01-05 -5.250171  2.550861

我认为 xarray 是为处理这样的多维数据集而设计的:

In [9]: import xarray as xr

In [10]: xr.DataArray(dict([(var, df[df.variable==var].drop('variable', 1)) for var in np.unique(df.variable)]))
Out[10]: 
<xarray.DataArray ()>
array({'A':         date     value    value2
0 2000-01-03  0.462461  0.924921
1 2000-01-04 -0.517911 -1.035823
2 2000-01-05  0.831014  1.662027, 'C':         date     value    value2
6 2000-01-03  0.453859  0.907718
7 2000-01-04 -0.763706 -1.527412
8 2000-01-05  0.839706  1.679413, 'B':         date     value    value2
3 2000-01-03 -0.492679 -0.985358
4 2000-01-04 -1.234068 -2.468135
5 2000-01-05  1.725218  3.450437, 'D':          date     value    value2
9  2000-01-03 -0.048108 -0.096216
10 2000-01-04  0.184461  0.368922
11 2000-01-05 -0.349496 -0.698993}, dtype=object)

这些方法中的一种比另一种更好吗？为什么 xarray 没有完全取代多索引？

最佳答案

似乎确实有过渡到 xarray 来处理多维数组的工作。 Pandas 将减少对 3D 面板数据结构和 documentation even suggest using xarray for working with multidemensional arrays 中的支持。 :

'Oftentimes, one can simply use a MultiIndex DataFrame for easily working with higher dimensional data.

In addition, the xarray package was built from the ground up, specifically in order to support the multi-dimensional analysis that is one of Panel s main use cases. Here is a link to the xarray panel-transition documentation.'

来自xarray documentation他们陈述了他们的目的和目标:

xarray aims to provide a data analysis toolkit as powerful as pandas but designed for working with homogeneous N-dimensional arrays instead of tabular data...

...Our target audience is anyone who needs N-dimensional labelled arrays, but we are particularly focused on the data analysis needs of physical scientists – especially geoscientists who already know and love netCDF

与使用直接 numpy 相比，xarray 的主要优势在于它使用标签的方式与 pandas 在多个维度上使用的方式相同。如果您使用多索引处理 3 维数据，则 xarray 可能可以互换。随着数据集中维数的增加，xarray 变得更易于管理。我无法评论每个人在效率或速度方面的表现。

关于python - 何时在 pandas 中使用多索引与 xarray，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/42876278/

24

4

0

文章推荐： C++ STL 映射 : issues with BSTR

文章推荐： c++ - 使用 boost::python 从 C++ 创建 python collections.namedtuple

python-xarray - 从坐标增加 xarray 的维数
假设我有以下二维数组 >>> import numpy as np >>> budgets = np.array([ [np.nan, 450.], [500. , 10
python-xarray - xarray.open_mfdataset 用于一小部分变量
我正在尝试读取单个 WRF 的时间序列输出变量。时间序列是分布式的，每个文件一个时间戳，跨越 5000 多个 netCDF 文件。每个文件包含大约 200 个变量。有没有办法只为我感兴趣的变量调用
python-xarray: xarray.Dataset.keep?
我有一个相当大的 xr.Dataset，其中包含大约 20 个数据变量。我只对保留其中两个感兴趣。我看到 xr.Dataset.drop带有数据集的删除变量。我正在寻找保留变量的语法。我尝试了 f[
python-xarray - 在时间维度中对 xarray 数据集或数据数组进行子集化
我正在尝试计算 xarray 数据集中时间维度子集的每月气候。时间是使用 datetime64 定义的。如果我想使用整个时间序列，这很好用: monthly_avr=ds_clm.groupby('
python - 将 xarray 数据变量重新分配给 xarray 坐标
我有一个空间数据的 pandas 数据框，我想将其转换为 netCDF。我找到了 xarray 并将我的数据帧转换为 xarray 数据集的方法: # create xray Dataset from
python-xarray - xarray - 如何重命名 DataArray 对象上的维度
我有一个名为 rio 的 DataArray 对象。 In [59]: rio Out[59]: array([[[0, 0, ..., 0, 0], [0, 0, ..., 0,
memory - xarray.Dataset.to_array() 是否将数组加载到内存中以及如何有效地从 xarray 中采样小批量？
我目前正在尝试将一个大的多维数组 (>5 GB) 加载到 python 脚本中。由于我将数组用作机器学习模型的训练数据，因此以小批量高效加载数据非常重要，但要避免将整个数据集加载到内存中一次。我的想
python-xarray - Python Xarray `Dataset.sel()` 沿一维选择多个值
假设我有一个 dataset类型 xarray.Dataset .我有一个名为 name 的维度,(由 DataArray 中的所有 Dataset 共享，但我认为这对这个问题并不重要，)我想选择一个
python-xarray - 打开具有许多组的远程 zarr 商店并使用 xarray 保持坐标
我想读入 https://hrrrzarr.s3.amazonaws.com/index.html#sfc/20210208/20210208_00z_anl.zarr/ 的远程 zarr 存储。 z
python-xarray:如何将多个波段和日期的单个波段栅格数据转换为 xarray-Dataset 或 DataArray？
我想获取栅格(卫星图像)数据，并构建一个Dataset 或DataArray，以加快我的图像处理速度(我必须处理多-波段，多日期卫星图像很多)。数据来自每个图像日期的单独波段，我了解如何将每个波段日
Python xarray.concat 然后 xarray.to_netcdf 生成巨大的新文件大小
所以我有 3 个 netcdf4 文件(每个大约 90 MB)，我想使用包 xarray 将它们连接起来。每个文件都有一个变量 (dis)，以 0.5 度分辨率(纬度、经度)表示 365 天(时间)。
python-xarray - xarray : reverse an array along one coordinate
对于我的数据数组，我有坐标经度、纬度和时间。我只想沿纬度反转数组，以便 [90, 85, ..., -85, -90]变成 [-90, -80, ..., 85, 90] . 最佳答案同意@jham
python-xarray - 无法将 y 和 x 坐标分配给 xarray.DataArray
完成 MetPy 横截面示例后，我尝试将该示例推广到 NCEP NAM-12km GRIB2 文件，但未成功。通过将我的文件的 DataArray 与示例文件(netCDF 文件)进行比较，我发现 x
python-xarray - xarray.apply_ufunc() 与 GroupBy : unexpected number of dimensions
我正在使用 xarray.apply_ufunc() 将函数应用于 xarray.DataArray .它适用于某些 NetCDF，但在尺寸、坐标等方面似乎具有可比性的其他 NetCDF 会失败。但是
python-xarray - 以 block 的形式创建 xarray DataArray 并将其写入 NetCDF
是否也可以创建一个核外 DataArray，并使用 xarray 将其逐块写入 NetCDF4 文件？例如，当维度更大时，我希望能够以核外方式执行此操作，因此我无法将整个数组存储在内存中: num_
python-xarray - xarray/datetime64[ns] : remove or normalise time from datetime
我有一个数据数组arr，坐标为“时间”。到达: array([244.40161, 244.39998, ..., 244.40936, 244.40549], dtype=float32)
python-xarray - xarray/datetime64[ns] : remove or normalise time from datetime
我有一个数据数组arr，坐标为“时间”。到达: array([244.40161, 244.39998, ..., 244.40936, 244.40549], dtype=float32)
Easy way to convert Julian calendar to standard with Python xarray?(简单的方法来转换儒略历到标准的Python xarray？)
我是新手，我使用的是XARRAY。我的netcdf文件包含时间为‘天数自0001-01-01 00：00：00’的数据，日历类型为Julian。有谁知道将时间转换成标准日历的简单方法吗？。提前感谢：)
Easy way to convert Julian calendar to standard with Python xarray?(简单的方法来转换儒略历到标准的Python xarray？)
我是新手，我使用的是XARRAY。我的netcdf文件包含时间为‘天数自0001-01-01 00：00：00’的数据，日历类型为Julian。有谁知道将时间转换成标准日历的简单方法吗？。提前感谢：)
Easy way to convert Julian calendar to standard with Python xarray?(简单的方法来转换儒略历到标准的Python xarray？)
我是新手，我使用的是XARRAY。我的netcdf文件包含时间为‘天数自0001-01-01 00：00：00’的数据，日历类型为Julian。有谁知道将时间转换成标准日历的简单方法吗？。提前感谢：)

首页

博学

6Ren·AI

商城

python - 何时在 pandas 中使用多索引与 xarray