python - 将许多巨大的 CSV 文件中的 XYZ 坐标有效地排序为小图 block-6ren

python - 将许多巨大的 CSV 文件中的 XYZ 坐标有效地排序为小图 block

转载作者：太空宇宙更新时间：2023-11-03 16:43:26

24

4

我的问题和目标:

我有许多巨大的 (1-10GB) CSV 文件，其中包含数十亿个 XYZ 坐标。我需要将它们插值到规则网格中，相当有效(不需要在 super 计算机上花费数周的计算时间)。

我的方法:

当处理几个较小的文件时，我将所有文件加载到一个 Pandas 数据帧中:

file_names = [files for files in os.listdir(my_path) if files.endswith(".csv")]  
data_list = []
for file_name in file_names:    
  df = pd.read_csv(my_path + "\\" + file_name, header=None, names=["x","y","z"], dtype=np.float32)
  data_list.append(df)    
frame = pd.concat(data_list)

之后，我得到frame[x].min()等坐标的最小/最大，并计算我想要将数据分解成的图 block 范围以简化插值:

tile_extents = [min_x - (min_x%tile_size), max_x - (max_x%tile_size) + tile_size, min_y - (min_y%tile_size), max_y - (max_y%tile_size) + tile_size]
for i in range(int((tile_extents[1]-tile_extents[0])/tile_size)):
  for j in range(int((tile_extents[3]-tile_extents[2])/tile_size)):
    current_tile_extent = [tile_extents[0]+i*tile_size, tile_extents[0]+i*tile_size+tile_size, tile_extents[2]+j*tile_size, tile_extents[2]+j*tile_size+tile_size]
    current_frame = frame[(frame["x"]>current_tile_extent[0]) & (frame["x"]<current_tile_extent[1]) & (frame["y"]>current_tile_extent[2]) & (frame["y"]<current_tile_extent[3])]

我可以将其保存到 CSV 文件中，然后对这些小子集运行插值。 但是如果我有 100GB 或更多 XYZ 坐标该怎么办？如何订购以便我可以将它们保存到图 block 中？

最佳答案

pandas.read_csv()可以以 block 的形式工作(请参阅chunksize参数)。

以下代码首先读取所有文件以查找 x 和 y 的最小值和最大值，然后计算图 block 并为每个图 block 创建一个文件 ( >tiles\i,j.csv)。然后，它再次读取所有文件，这次将行写入适当的图 block 文件中。
请务必根据您的需要调整chunksize!

我用一些假数据对此进行了测试，看起来不错:

import os
import numpy as np
import pandas as pd

def get_df_in_chunks(file_names, **kwargs):
    """Read all files in chunks."""
    # Set default chunk size if not specified.
    kwargs['chunksize'] = kwargs.get('chunksize', 100000)
    for file_name in file_names:
        df = pd.read_csv(file_name, **kwargs)
        yield from iter(df)

my_path = '.'
file_names = [my_path + "\\" + file for file in os.listdir(my_path) if file.endswith(".csv")]
print('file_names: {}'.format(file_names))

# Read all files to determine the global min and max values.
min_x = +np.inf
max_x = -np.inf
min_y = +np.inf
max_y = -np.inf
for chunk in get_df_in_chunks(file_names, header=None, dtype=np.float32,
                              usecols=["x","y"], names=["x","y"]):
    print('  - chunk: {}'.format(chunk.shape))
    min_x = min(min_x, chunk["x"].min())
    max_x = max(max_x, chunk["x"].max())
    min_y = min(min_y, chunk["y"].min())
    max_y = max(max_y, chunk["y"].max())
print("x min/max:", min_x, max_x)
print("y min/max:", min_y, max_y)

# Calculate tile extents.
tile_size = 1.5
tile_limits = [min_x - (min_x%tile_size),
               max_x - (max_x%tile_size) + tile_size,
               min_y - (min_y%tile_size),
               max_y - (max_y%tile_size) + tile_size]
print("tile_size:", tile_size)
print("tile_limits:", tile_limits)

if not os.path.exists(my_path + "\\tiles"):
    os.mkdir(my_path + "\\tiles")

tile_files = []
try:
    # Open all tile files.
    for i in range(int(round(tile_limits[1]-tile_limits[0])/tile_size)):
        for j in range(int(round(tile_limits[3]-tile_limits[2])/tile_size)):
            tile_extent = [tile_limits[0] + i*tile_size,
                           tile_limits[0] + i*tile_size + tile_size,
                           tile_limits[2] + j*tile_size,
                           tile_limits[2] + j*tile_size + tile_size]
            f = open(my_path + "\\tiles\\{},{}.csv".format(i,j), 'w')
            tile_files.append((f, tile_extent))

    for chunk in get_df_in_chunks(file_names, header=None, dtype=np.float32,
                                  usecols=["x","y","z"], names=["x","y","z"]):
        # For each tile, write all relevant rows into the corresponding tile file.
        for f, tile_extent in tile_files:
            # Option 1: boolean condition.
            frame = chunk[(chunk["x"] >= tile_extent[0]) &
                          (chunk["x"] <  tile_extent[1]) &
                          (chunk["y"] >= tile_extent[2]) &
                          (chunk["y"] <  tile_extent[3])]
            # Option 2: query using numexpr. Could be faster, but wasn't in my test.
            #frame = chunk.query('x >= {} & x < {} & y >= {} & y < {}'.format(*tile_extent))

            ##print('file: {} tile_extent: {} frame: shape={}'.format(f.name, tile_extent, frame.shape))
            frame.to_csv(f, header=None, index=False)
finally:
    # Close all tile files.
    for f, _ in tile_files:
        f.close()

关于python - 将许多巨大的 CSV 文件中的 XYZ 坐标有效地排序为小图 block ，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/36562479/

24

4

0

文章推荐：不支持 OpenGL GLX 扩展

文章推荐： c# - .NET 连接目录和 DirectInfo 问题

Matlab 填充 contour3 图，如 contourf 图
我想填充 3D 等高线图 (contour3(X,Y,Z))，就像 2D 等高线填充图 (contourf(X,Y,Z))。但我无法弄清楚如何实现这一目标。 contour3 和 surf 的组合不是
javascript - c3.js - 带有工具提示的 c3 图，里面有 c3 图
我有一个 c3.js 折线图，表示 2 个值的演变。我需要折线图的工具提示是饼图(工具提示 = 另一个 c3.js 图形)。这是我成功的: http://jsfiddle.net/owhxgaqm/
pandas - 来自 Pandas Dataframe 的 Seaborn fiddle 图，每列都有自己单独的 fiddle 图
我有具有结构的 Pandas 数据框: A B 0 1 1 1 2 1 2 3 4 3 3 7 4 6 8 如何生成 Seaborn Violin 图，每列作为其自己的单独
c++ - 基于 2D 图 block 的游戏，当我用相机放大时，图 block Sprite 之间会出现间隙吗？
我正在使用 D3DXSPRITE 方法将我的 map 图 block 绘制到屏幕上，我刚刚添加了一个缩放功能，当您按住向上箭头时会放大，但注意到您现在可以看到图 block 之间的间隙，这是一些屏幕截
数据结构-图
今天我们开始学习目前学习到的最难最复杂的数据结构图。简单回顾一下之前学习的数据结构，数组、单链表、队列等线性表中数据元素是一对一关系，而树结构中数据元素是一对多关系，而图结构中数据元素则是多对
linux服务器磁盘扩容的方法(图)
1、系统环境如下图： 2、为该系统添加一块新的虚拟硬盘，添加后需重启虚拟机，否则系统不识别；如下图，/dev/sdc 是新添加的硬盘； 3、fdisk /dev/sdc为新硬盘创建分区：
基于Linux下Nagios的安装与配置说明介绍[图]
1、nagios简介　　nagios是一款开源的电脑系统和网络监视工具，能有效监控windows、linux和unix的主机状态，交换机路由器等网络设置，打印机等。在系统或服务状态异常时发
从亚马逊的7个例子中学会如何成功做好邮件营销(图)
越来越多人开始习惯用手机上网，浏览网页、查看邮件···移动化已经成为互联网发展必然趋势，包括facebook在内的很多互联网公司都将移动广告作为下一个淘金地
Android图片处理实例介绍(图)
1.图片处理 1.圆角图片复制代码代码如下: /** * 转换成圆角 * &n
sqlserver数据库导入数据操作详解(图)
Microsoft SQL Server Management Studio是SQL SERVER的客户端工具，相信大家都知道。我不知道大伙使用导入数据的情况怎么样，反正我最近是遇到过。主要是因为没
debian6配置mysql允许远程连接的方法(图)
debian6系统：首先先安装mysql吧：打开终端（root）用户登入 apt-get purge mysql-server-5.5 安装完成后：默认情况下Mysql只允许本地登录
fedora16英文环境下支持中文输入法的方法介绍(图)
fedora16英文环境下支持中文输入法的方法 fedora16英文环境下支持FCITX的中文输入法： $ im-chooser 就会出现选择界面，选择第二个就行了。
.net预编译命令详解(图)
Net预编译命令 C:\WINDOWS\Microsoft.NET\Framework\v2.0.50727\aspnet_compiler.exe -? 显示说明我们需要选择的命令为&n
主板BIOS恢复出厂设置的方法[图]
有的时候电脑出现一些故障有的时候通过将其修改bios设置的方法来解决故障，那么在bios上设置能不能将电脑恢复出厂设置呢?其实也是可以的。方法也很简单的，只要会进入电脑的bios懂的上面英文的意思就
[图]Deepin系统首次在龙芯3号电脑上运行成功
笔者曾介绍过Deepin 将对龙芯进行全面支持，打造最优美龙芯电脑桌面。现在Deepin团队移植工作取得了突破性的成果，Deepin桌面已经在龙芯3A和龙芯3B电脑上成功运行起来了。以下为龙芯3
通过锁定Win7注册表编辑器来防止主页被篡改的方法(图)
在安装一些软件之后，我们的电脑总是会发生一点小变化，不是桌面上多了几个网址图标，就是IE浏览器的默认主页被篡改成乱七八糟的网址。最可气的是，在IE设置中将默认主页改回来后，下次启动Win7后又变了回
常用的注册表编辑器打开的方法汇总(图)
“注册表编辑器怎么打开”虽说不是很难的问题，但是对于对电脑常识不是很擅长的网民来说，当电脑出现问题或需要更改设置时，着实还是件头疼的问题。因为需要打开注册表进行操作解决。那么如何打开注册表编辑器呢?
WordPress建站的10个重要的安全插件和技巧(图)
这篇文章重点介绍10个重要的WordPress安全插件和技巧，用来保护WordPress网站或者博客。 1. WP Security 人工帮助你修复被黑客入侵的网站，只要按照他们网站上的联系电话
实现dedecms友情链接分栏目调用的方法(图)
其实运用object和javascript调用外部文件，也能实现不同栏目调用不同友情链接，即相当于调用不同栏目友情链接文件， {dede:field.typeid/}来获取当前栏目的ID。
复数矩阵的 R 图
我有一个复值矩阵。如果我发出命令: plot(myMatrix) 然后它在图形设备上显示一种散点图，X 轴标记为 Re(myMatrix)，Y 轴标记为 Im(myMatrix)。这显示了我正在寻找

首页

博学

6Ren·AI

商城

python - 将许多巨大的 CSV 文件中的 XYZ 坐标有效地排序为小图 block