python - 从大型数据集高效创建二维直方图-6ren

python - 从大型数据集高效创建二维直方图

转载作者：太空狗更新时间：2023-10-29 20:39:03

我想根据存储在 HDF5 文件中的大型数据集(超过 100000 个样本)在 Python 中创建二维直方图。我想出了以下代码:

import sys
import h5py
import numpy as np
import matplotlib as mpl
import matplotlib.pylab

f = h5py.File(sys.argv[1], 'r')

A = f['A']
T = f['T']

at_hist, xedges, yedges = np.histogram2d(T, A, bins=500)
extent = [yedges[0], yedges[-1], xedges[0], xedges[-1]]

fig = mpl.pylab.figure()
at_plot = fig.add_subplot(111)

at_plot.imshow(at_hist, extent=extent, origin='lower', aspect='auto')

mpl.pylab.show()

f.close()

执行大约需要 15s(100000 个数据点)。然而，CERN 的 Root(使用其自己的树数据结构而不是 HDF5)可以在不到 1 秒的时间内完成此操作。你知道我如何加速代码吗？如果有帮助，我还可以更改 HDF5 数据的结构。

最佳答案

我会尝试一些不同的东西。

从 hdf 文件加载数据，而不是传入有效的内存映射数组。
如果这不能解决问题，您可以利用 scipy.sparse.coo_matrix 制作二维直方图。对于旧版本的 numpy，digitize(所有各种 histogram* 函数都在内部使用)在某些情况下可能会使用过多的内存。不过，最近 (>1.5??) 版本的 numpy 已不再是这种情况。

作为第一个建议的示例，您可以执行以下操作:

f = h5py.File(sys.argv[1], 'r')
A = np.empty(f['A'].shape, f['A'].dtype)
T = np.empty(f['T'].shape, f['T'].dtype)
f['A'].read_direct(A)
f['T'].read_direct(T)

这里的区别是整个数组将被读入内存，而不是h5py的类数组对象，这基本上是高效的内存-映射数组存储在磁盘上。

至于第二个建议，除非第一个建议对您的问题没有帮助，否则不要尝试。

它可能不会明显更快(并且对于小型数组可能会更慢)，并且对于最新版本的 numpy，它只是稍微提高了内存效率。我确实有一段代码是我故意这样做的，但我一般不会推荐它。这是一个非常骇人听闻的解决方案。不过，在非常特定的情况下(很多点和很多 bin)，它可以比 histogram2d 表现得更好。

抛开所有这些注意事项，这里是:

import numpy as np
import scipy.sparse
import timeit

def generate_data(num):
    x = np.random.random(num)
    y = np.random.random(num)
    return x, y

def crazy_histogram2d(x, y, bins=10):
    try:
        nx, ny = bins
    except TypeError:
        nx = ny = bins
    xmin, xmax = x.min(), x.max()
    ymin, ymax = y.min(), y.max()
    dx = (xmax - xmin) / (nx - 1.0)
    dy = (ymax - ymin) / (ny - 1.0)

    weights = np.ones(x.size)

    # Basically, this is just doing what np.digitize does with one less copy
    xyi = np.vstack((x,y)).T
    xyi -= [xmin, ymin]
    xyi /= [dx, dy]
    xyi = np.floor(xyi, xyi).T

    # Now, we'll exploit a sparse coo_matrix to build the 2D histogram...
    grid = scipy.sparse.coo_matrix((weights, xyi), shape=(nx, ny)).toarray()

    return grid, np.linspace(xmin, xmax, nx), np.linspace(ymin, ymax, ny)

if __name__ == '__main__':
    num=1e6
    numruns = 1
    x, y = generate_data(num)
    t1 = timeit.timeit('crazy_histogram2d(x, y, bins=500)',
            setup='from __main__ import crazy_histogram2d, x, y',
            number=numruns)
    t2 = timeit.timeit('np.histogram2d(x, y, bins=500)',
            setup='from __main__ import np, x, y',
            number=numruns)
    print 'Average of %i runs, using %.1e points' % (numruns, num)
    print 'Crazy histogram', t1 / numruns, 'sec'
    print 'numpy.histogram2d', t2 / numruns, 'sec'

在我的系统上，这会产生:

Average of 10 runs, using 1.0e+06 points
Crazy histogram 0.104092288017 sec
numpy.histogram2d 0.686891794205 sec

关于python - 从大型数据集高效创建二维直方图，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/8805601/

文章推荐： python - 如何使用 BeautifulSoup 和 Python 从

标签内的标签获取信息？

文章推荐： c++ - 从给定的图像数据中提取像素数据。需要帮助理解代码

文章推荐： c++ - 如何让 boost json 使用正确的数据类型

文章推荐： python - 我可以使用 dotall 的非贪婪正则表达式吗？

Gnuplot 直方图
我使用为 .dat 文件中的一些数据创建了直方图 binwidth=... bin(x,width)=width*floor(x/width) plot 'file' using (bin($1,b
Kibana 直方图 - 单个图表上的多条参数化线
我需要能够在单个直方图上显示多条线，其中每条线都应该由一个参数表示。我有多个服务器，我想监控它们的 CPU 使用率。我的 Kibana 输入数据如下所示: 时间戳 |机器 |姓名 |值(value)
Kibana 直方图 - 在单个图表上绘制多个系列
我在 Elasticsearch 中有一个索引，它包含一个简单对象数组(键值，请参见下面的示例)。文档有时间戳。我可以在 Kibana 中为每个键值创建单独的直方图(即一个用于 bytes_sen
来自频率表的 R 直方图
所以我想出了如何将我的数据下钻到频率表 - Overall.Cond Freq 235 1 0 236 2 0 237
带框阴影的 gnuplot 直方图
我的目标是使用 gnuplot 5.4 框创建直方图，并用特定的 RGB 值对每个框进行着色(出于测试目的，它是“绿色”，但在最终数据集中将是 #RRGGBB) 我的数据如下所示: 5.800507
r - 具有可变宽度的重叠条形图/直方图
我有 chr totgenes FST>0.4 %FST>0.4 exFST>0.4 %exFST>0.4 inFST>0.4 %inFST>0.4 chrtotlen 1 14
带有误差条的 Matplotlib 直方图
我用 matplotlib 创建了一个直方图使用 pyplot.hist()功能。我想在条形图中添加 bin 高度 ( sqrt(binheight) ) 的毒物误差平方根。我怎样才能做到这一点？ .
具有多个种群的 R 直方图
我有兴趣在 R 中创建一个包含两个(或更多)人口的直方图，这意味着 - 我不希望两个直方图共享同一个图形，而是一个包含两种或更多颜色的条形图。找到下面的图片 - 这就是我想要完成的。有什么想法吗？
Gnuplot、跳过时间数据、直方图
所以，我需要按日期制作数据直方图，但我有 xticlabel 重叠的问题，所以，我试图找到一个解决方案，如何跳过 xtics 以避免重叠。考虑到日期不是整数抽动，我试图以这种方式解决它: .dat 文
histogram - 在grafana中显示每小时平均值(直方图)
给定每小时都有数据点的(电力)市场数据的时间序列，我想显示一个包含每小时数据的所有时间/时间范围平均值的条形图，以便分析师可以轻松地将实际价格与所有时间平均值进行比较(一天中哪个小时最贵/最便宜)。
scala - 直方图 - 以并行方式进行
+----+----+--------+ | Id | M1 | trx | +----+----+--------+ | 1 | M1 | 11.35 | | 2 | M1 | 3.4
Gnuplot、跳过时间数据、直方图
所以，我需要按日期制作数据直方图，但我有 xticlabel 重叠的问题，所以，我试图找到一个解决方案，如何跳过 xtics 以避免重叠。考虑到日期不是整数抽动，我试图以这种方式解决它: .dat 文
gnuplot:误解数据(直方图)
我有以下示例数据文件，我想在 gnuplot 中将其绘制为直方图 1 1 2 2 4 3 我正在使用以下命令绘制数据:用方框绘制“sample.data”，生成以下图表: ##
java - 随机数测试(直方图)
我是 Java 编码新手，我正在尝试使用提供给我的以下方法创建直方图。这些注释是对每个方法的说明，稍后我们将使用它们来创建主方法并打印直方图。我已经达到了方法 3，并且能够很好地编译所有内容，但我不确
php - 如何使用文本文件中获得的数据绘制实时图形(直方图)
我有一个由服务器上的程序生成的连续生成的数据(文本文件)。我想将数据绘制为实时图表，就像 powergrid做。这是我的方法: 由于数据是在服务器上以文本文件的形式连续生成的，因此我编写了一个 PHP
javascript - D3 直方图
我正在尝试通过一个函数使用 D3 创建一个简单的直方图。图表的 y 值作为数组传递给函数，然后函数创建 svg 和条形图。我得到了正确的轴，但条被切断了。似乎我的矩形 x 值太大而无法放入 svg
c# - Linq 直方图
有没有办法用 linq 做一个分段直方图？我见过几个示例，您可以在其中计算特定对象的出现次数。是否可以创建一个基于 linq 的直方图来计算两个值之间的一系列对象的出现次数？我不知道您将如何按一系列
java - 初学Java(直方图)
我正在参加初级 Java 类(class)，任务是创建一个具有以下输出的直方图程序:(100 和 10 是用户输入)。有多少个数字？ 100 间隔多少？ 10 Histogram ---------
iphone - 核心图 - 直方图
如何使用 corePlot 实现直方图。实际上，我正在尝试使用条形图。在条形图中是否有任何选项可以对我的值进行分组。例如:所以我只能打印 3 条。这样值应该像这样分组: X 0...5: B
MySQL根据值范围(直方图)进行任意分组的方法
我有一个简单的数据集，其中脚本需要时间来完成各个步骤。时间是不可预测的，但主要分组在特定的时间范围内，但我想以十分之一秒的分组来绘制图表。 (我知道这很奇怪，这是一些报告可视化内容的要求)。我可以将我

太空狗

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

python - 从大型数据集高效创建二维直方图