python - 分割pandas数据框的有效方法-6ren

python - 分割pandas数据框的有效方法

转载作者：行者123 更新时间：2023-12-01 02:03:37

24

4

我有一个包含超过一百万条记录的大型数据框。我想根据客户 ID 将这个数据帧分成四个 block ，所以我尝试了以下脚本。

unique_customer=df['Customer'].unique()
n=len(unique_customer)

a=n/4
s1=a
s2=s1+a
s3=s2+a
s4=n

l1= unique_customer[:s1]
l2= unique_customer[s1:s2]
l3= unique_customer[s2:s3]
l4= unique_customer[s3:s4]

df1=df[df['Customer'].isin(l1)]
df2=df[df['Customer'].isin(l2)]
df3=df[df['Customer'].isin(l3)]
df4=df[df['Customer'].isin(l4)]

它适用于较小的数据集。但对于大数据集来说需要很长时间。有没有其他方法可以解决这个问题？

示例数据:输入:

   Customer  val1
0        a1   112
1        a2     2
2        a1    11
3        a3   154
4        a4    76
5        a5    12
6        a2     6
7        a4     7
8        a6    33
9        a5    67
10       a3   121
11       a5    21
12       a5    77
13       a4     3
14       a7    21
15       a5    65
16       a6    98
17       a8    45
18       a9    12

输出:df1

  Customer  val1
0       a1   112
1       a2     2
2       a1    11
6       a2     6

df2

   Customer  val1
3        a3   154
4        a4    76
7        a4     7
10       a3   121
13       a4     3

df3

   Customer  val1
5        a5    12
8        a6    33
9        a5    67
11       a5    21
12       a5    77
15       a5    65
16       a6    98

df4

   Customer  val1
14       a7    21
17       a8    45
18       a9    12

最佳答案

由于您没有提供数据，我将尝试给您一个我尚未测试过的答案。

groups = df.groupby('Customer').ngroup() % 4
df1, df2, df3, df4 = (g for _, g in df.groupby(groups))

尽管上述方法有效，但为了匹配您的输出，我必须在 np.arange 上对唯一数量的组使用 pd.qcut。

f, u = pd.factorize(df['Customer'])
q, b = pd.qcut(np.arange(len(u)), 4, retbins=True)
b[-1] += 1
groups = pd.cut(f, b, labels=False, right=False)
df1, df2, df3, df4 = (g for _, g in df.groupby(groups))

print(df1, df2, df3, df4, sep='\n'*2)

  Customer  val1
0       a1   112
1       a2     2
2       a1    11
6       a2     6

   Customer  val1
3        a3   154
4        a4    76
7        a4     7
10       a3   121
13       a4     3

   Customer  val1
5        a5    12
8        a6    33
9        a5    67
11       a5    21
12       a5    77
15       a5    65
16       a6    98

   Customer  val1
14       a7    21
17       a8    45
18       a9    12

关于python - 分割pandas数据框的有效方法，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49292383/

24

4

0

文章推荐： python - SymPy 矩阵列表的总和

文章推荐： Python/Matplotlib - 颜色条配置

文章推荐： python - 在 Jupyter 环境中运行 Jupyter Notebook

java正则表达式字符串被 "not\"分割
实际上我只需要用JAVA编写一个简单的程序来将MySQL INSERTS行转换为CSV文件(每个mysql表等于一个CSV文件) 在JAVA中使用正则表达式是最好的解决方案吗？我的主要问题是如何正确
Java读取txt文件到hashmap，按 ":"分割
我有一个 txt 文件，其格式为: Key:value Key:value Key:value ... 我想将所有键及其值放入我创建的 hashMap 中。如何让 FileReader(file) 或
使用正则表达式进行 Java 分割
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。要求提供代码的问题必须表现出对所解决问题的最低限度的了解。包括尝试的解决方案、为什么它们不起作用以及预期结果
mysql - 分割.sql备份文件
我每周都会从我的主机下载数据库的备份。它生成一个 .sql 文件，当前大小约为 800mb。此 .sql 文件包含 44 个表。有什么方法可以通过某些软件将 .sql 文件与所有表分开，以便单独导出
iphone - 分割 CGImage
在 iOS 4.0 及更高版本中，有没有一种方法可以在不将整个图像加载到内存的情况下对 CGImage 进行分割？我试图做的是*以编程方式*分割图像，以便在使用大图像的 CATiledLayer 应用
javascript - 用这个字符: "\"分割
我的 .split() 函数有问题，我有以下字符串: var imageUrl = "Images\Products\randomImage.jpg"; 我想用字符“\”分割，但是，这种情况发生了:
javascript 正则表达式分割
是否可以使用正则表达式将字符串拆分两次？例如，假设我有字符串: example=email@address.com|fname|lname 如何拆分结果为: email@address.com,fna
Java 数组上的多线程(分割)
我正在寻找一种在线程系统(主从)中使用数组的解决方案，它允许我通过用户输入在多个线程上划分矩阵的计算，并将其通过 1 个主线程引导到多个从属线程，这些从属线程计算矩阵的 1 个字段。我尝试运用我的知
opencv - 分割 - 分离接触对象
我建立了一个系统来分割包含手写符号的二值图像并对它们进行分类(专门用于音乐)。我知道有商业应用程序可以执行此操作，但这是我尝试将其作为一个项目从头开始。为了简单起见，假设我的整个图像中有两个元素:
image - 物体检测+分割
我正在尝试找到一种可接受的复杂性的有效方法检测图像中的对象，以便将其与周围环境隔离将该对象分割成它的子部分并标记它们，这样我就可以随意获取它们我进入图像处理世界已经 3 周了，我已经阅读了很多算
algorithm - 3D 分割
我有一组3D 空间中的点。下图是一个示例: 我想把这些点变成一个面。我只知道点的 X、Y 和 Z 值。例如，查看下图，它显示了从 3D 空间中的点生成的人脸网格。我在谷歌上搜索了很多，但我找到的是一
java - 在字符串java中用字符*分割
我有一个字符串 String placeStr="place1*place2*place3"我想获取包含 place1、place2、place3 的数组，如下所示: String[] places=
Python URL 分割
我在 Python 中有一个类似于 google.com 的字符串，我想将其分成两部分:google 和 .com。问题是我有一个 URL，例如 subdomain.google.com，我想将其拆分
Python中使用pypdf2合并、分割、加密pdf文件的代码详解
朋友需要对一个pdf文件进行分割，在网上查了查发现这个pypdf2可以完成这些操作，所以就研究了下这个库，并做一些记录。首先pypdf2是python3版本的，在之前的2版本有一个对应pypdf库。
assembly - 8086 无操作系统编程；分割
伙计们，这是一个难以解决的问题，因为它涉及很多硬件细节，所以我想把它放到 EE.SE，但它的主要重点是编程，所以我决定坚持在这里。我最近怀旧(以及渴望回到 CPU 内在函数)，所以我决定自制一个 8
list - 分割 Haskell 列表
给定 haskell 中的排序列表，我如何获得分段列表，其中连续数字位于同一列表中。例如，如果我有一个排序列表 [1,2,3,4,7,8,10,12,13,15] 结果将是 [[1,2,3 ,4],[
cocoa :分割 View 的奇怪紫色约束
如果我添加三个分割 View ，如下图所示，第三个分割 View (称为 splitView-3)将自动为该分割 View 中的自定义 View 生成约束，例如 customview1 的 Heigh
javascript - 如果我取消选中该复选框以及如果我选中按 (", "分割，如何打印空白)
关闭。此题需要details or clarity 。目前不接受答案。想要改进这个问题吗？通过 editing this post 添加详细信息并澄清问题. 已关闭 6 年前。 Improve th
java - 提供具有相同文件分割的 map 分割
如何为馈送给映射器的文件的每一行提供相同文件的拆分？基本上我想做的是 for each line in file-split { for each line in file{
hadoop - 带有Snappy压缩的ORC文件是否可在 strip 分割？
带有Snappy压缩功能的ORC文件是否可拆分成条形？据我所知，Snappy Compressed File是不可拆分的。但我在博客中读到，快速压缩的文件可以在 strip 上拆分。真的吗？最

首页

博学

6Ren·AI

商城

python - 分割pandas数据框的有效方法