hdf5 - 如何合并多个 .h5 文件？-6ren

hdf5 - 如何合并多个 .h5 文件？

转载作者：行者123 更新时间：2023-12-04 00:02:28

25

4

在线提供的所有内容都太复杂了。我的数据库很大，我分部分导出。我现在有三个 .h5 文件，我想将它们组合成一个 .h5 文件以供进一步工作。我该怎么做？

最佳答案

这些示例展示了如何使用 h5py 在 2 个 HDF5 文件之间复制数据集。请参阅我对 的其他回答PyTables 例子。我创建了一些简单的 HDF5 文件来模拟 CSV 类型的数据(所有浮点数，但如果您有混合数据类型，过程是相同的)。根据您的描述，每个文件只有一个数据集。当您有多个数据集时，您可以使用 visititems() 扩展此过程在 h5py 中。

注意:用于创建示例中使用的 HDF5 文件的代码在最后。

所有方法均使用 glob()找到以下操作中使用的 HDF5 文件。

方法一:创建外部链接
这导致新的 HDF5 文件中有 3 个组，每个组都有一个指向原始数据的外部链接。这不会复制数据，但可以通过 1 个文件中的链接访问所有文件中的数据。

with h5py.File('table_links.h5',mode='w') as h5fw:
    link_cnt = 0 
    for h5name in glob.glob('file*.h5'):
        link_cnt += 1
        h5fw['link'+str(link_cnt)] = h5py.ExternalLink(h5name,'/')

方法 2a:“按原样”复制数据
(2020 年 5 月 26 日更新:这对所有数据集使用 .copy() 方法。)
这将使用原始数据集名称将原始文件中每个数据集的数据复制到新文件中。它循环复制所有根级数据集。这要求每个文件中的数据集具有不同的名称。数据不会合并为一个数据集。

with h5py.File('table_copy.h5',mode='w') as h5fw:
    for h5name in glob.glob('file*.h5'):
        h5fr = h5py.File(h5name,'r') 
        for obj in h5fr.keys():        
            h5r.copy(obj, h5fw)

方法 2b:“按原样”复制数据
(这是我最初的回答，在我知道 .copy() 方法之前。)
这会使用原始数据集名称将原始文件中每个数据集的数据复制到新文件中。这要求每个文件中的数据集具有不同的名称。数据不会合并为一个数据集。

with h5py.File('table_copy.h5',mode='w') as h5fw:
    for h5name in glob.glob('file*.h5'):
        h5fr = h5py.File(h5name,'r') 
        dset1 = list(h5fr.keys())[0]
        arr_data = h5fr[dset1][:]
        h5fw.create_dataset(dset1,data=arr_data)

方法 3a:将所有数据合并为 1 个固定大小的数据集
这会将原始文件中每个数据集中的数据复制并合并到新文件中的单个数据集中。在此示例中，对数据集名称没有限制。此外，我最初创建了一个大型数据集并且不调整大小。这假设有足够的行来保存所有合并的数据。应在生产工作中添加测试。

with h5py.File('table_merge.h5',mode='w') as h5fw:
    row1 = 0
    for h5name in glob.glob('file*.h5'):
        h5fr = h5py.File(h5name,'r') 
        dset1 = list(h5fr.keys())[0]
        arr_data = h5fr[dset1][:]
        h5fw.require_dataset('alldata', dtype="f",  shape=(50,5), maxshape=(100, 5) )
        h5fw['alldata'][row1:row1+arr_data.shape[0],:] = arr_data[:]
        row1 += arr_data.shape[0]

方法 3b:将所有数据合并到 1 个可调整大小的数据集
这类似于上面的方法。但是，我创建了一个可调整大小的数据集，并根据读取和添加的数据量进行放大。

with h5py.File('table_merge.h5',mode='w') as h5fw:
    row1 = 0
    for h5name in glob.glob('file*.h5'):
        h5fr = h5py.File(h5name,'r') 
        dset1 = list(h5fr.keys())[0]
        arr_data = h5fr[dset1][:]
        dslen = arr_data.shape[0]
        cols = arr_data.shape[1]
        if row1 == 0: 
            h5fw.create_dataset('alldata', dtype="f",  shape=(dslen,cols), maxshape=(None, cols) )
        if row1+dslen <= len(h5fw['alldata']) :
            h5fw['alldata'][row1:row1+dslen,:] = arr_data[:]
        else :
            h5fw['alldata'].resize( (row1+dslen, cols) )
            h5fw['alldata'][row1:row1+dslen,:] = arr_data[:]
        row1 += dslen

要创建上面阅读的源文件:

for fcnt in range(1,4,1):
    fname = 'file' + str(fcnt) + '.h5'
    arr = np.random.random(50).reshape(10,5)
    with h5py.File(fname,'w') as h5fw :
        h5fw.create_dataset('data_'+str(fcnt),data=arr)

关于hdf5 - 如何合并多个 .h5 文件？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58187004/

25

4

0

文章推荐： objective-c - UIAlertController 自 iOS 13 起消失

文章推荐： .net-core - 如何在 DDD - Event sourcing 中验证事件流？

文章推荐： dependencies - Julia:创建具有可选依赖项的包

hdf5 - HDF 是否进行字符串实习？
只是想知道我对组/数据集名称的自由程度如何，或者是否需要使名称简短(因此可读性较差)。这适用于包含许多具有许多重复名称的组和数据集的 HDF5 文件。一些 XML API 做 string inter
Pandas、大数据、HDF 表以及调用函数时的内存使用情况
简短问题当 Pandas 在 HDFStore 上工作时(例如: .mean() 或 .apply() )，它是否将内存中的完整数据作为 DataFrame 加载，还是将记录作为 Serie 进行处
Pandas :同一 HDF 中的大型数据帧？
我有几个不同的相关数据框(如果需要，可以使用 id 加入它们)。但是，我并不总是同时需要它们。由于它们非常大，将它们存储在单独的 HDF 存储中是否有意义？或者当我处理同一文件中的其他帧时，携带“未
python - 更新 HDF 文件中的一个字段
我似乎无法让它发挥作用。所有示例和线程都让人创建新的数据集。我只想更新已创建的数据集中的一个字段。这是我所拥有的: h5_file = h5py.File(event_file_path, "r+"
Java HDF fsDataOutputStream 写入失败创建空文件
我在 hadoop 上写入小文件时遇到一个奇怪的问题。下面是示例程序 public void writeFile(Configuration conf, String message, String
linux - 授予 hdf 删除目录的权限
当我运行 hdf namenode -format 时，它想要删除目录 /home/hadoop/hadooptmpdata/dfs/name/current 但它没有权限执行此操作。如何授予它权限？
python - Pandas Hdf 获取表信息
有没有办法使用 pandas HDF 存储获取 HDF 表的信息？例如在 SQL 中有: SELECT COUNT(*) 我想阅读基本表格大小而不必自己加载表格。最佳答案试试这个: In [4]
python - 以表格式使用 hdf 时内存泄漏？
在 pandas 下，每次我使用表格格式而不是固定格式时，我的内存消耗都会爆炸。 import numpy as np np.random.seed(seed=10) df = pd.DataFram
python - 在 HDF 存储中构建数据
我正在处理大量数据集，每个数据集都是一个 pandas DataFrame，由于它们的大小，我需要从磁盘访问它们。从我读到的内容来看，HDF 似乎是与它们一起工作的好方法，但我对构建数据的最佳方法有点
Azure Blob 存储和 HDF 文件存储
我正在开发云服务器，我需要使用 blob 存储来存储 HDF 文件 ( http://www.hdfgroup.org/HDF5/ )。与文件中的创建、读取、写入和修改数据元素相关的函数来自 HDF
python - Pandas 不修改默认的 hdf 格式
我正在尝试将数据存储为 hdf 格式，并希望将默认数据类型设置为表，以便稍后查询。我正在使用基本代码: import pandas as pd from numpy import random as
python - 加载 HDF 时出现非法指令(核心已转储)
我最近在 Lubuntu 上安装了 Anacondas Python。我正在尝试加载可在 Windows PC 上运行的 HDF 文件: In [14]: import pandas as pd I
python - pandas 内存消耗 hdf 文件分组
我写了下面的脚本，但是我有一个内存消耗的问题，pandas 分配了超过 30 G 的内存，其中数据文件的总和大约是 18 G import pandas as pd import numpy as n
database - HDF 与 NoSQL 解决方案
您好，我看到了一些以 HDF5 格式存储的科学数据，我想知道是否有任何 NoSQl 解决方案可以达到与 HDF5 相同的读/写性能。我的示例的数据使用树结构(/root 然后/root/key 然后
python - 从 hdf 文件中获取列名(标题)
我想知道如何获取 hdf 文件的列名(似乎存储在 hdf header 中)；例如，一个文件可能有名为 [a,b,c,d] 的列，而另一个文件有 [a,b,c] 列，而另一个文件有 [b,e,r,z]
python - 如何从 Pandas HDF 存储中读取 nrows？
我想做什么？ pd.read_csv(... nrows=###) 可以读取文件的前 n 行。我想在使用 pd.read_hdf(...) 时做同样的事情。问题是什么？我对 documentati
python - 如何高效地将数千张高清照片加载到 pandas df 中并转换为 HDF？
我想将数千张动物图像加载到 pandas df 中，添加特征并可能转换为 HDF。我使用 cv2.imread() 尝试了以下方法 import cv2 import os import numpy
apache-kafka - HDF 模式注册表和 Confluence 模式注册表之间的主要区别是什么？
我想知道 HDF 套件中嵌入的 kafka 和 Confluence 套件中嵌入的 kafka 之间的差异，特别是模式注册工具。最佳答案 https://registry-project.readt
apache-kafka - HDF 模式注册表和 Confluence 模式注册表之间的主要区别是什么？
我想知道 HDF 套件中嵌入的 kafka 和 Confluence 套件中嵌入的 kafka 之间的差异，特别是模式注册工具。最佳答案 https://registry-project.readt
写入 hdf 时的 Pandas/Pytable 内存开销
我使用 pandas 和 hdf5 文件来处理大量数据(例如 10GB 或更多)。我想使用表格格式，以便在读取数据时能够有效地查询数据。但是，当我想将数据写入 hdf 存储时(使用 DataFrame

首页

博学

6Ren·AI

商城

hdf5 - 如何合并多个 .h5 文件？