python - 应用 groupby() 后计算最大行数-6ren

python - 应用 groupby() 后计算最大行数

转载作者：太空宇宙更新时间：2023-11-04 04:41:21

24

4

我有一个数据框如下-文件名 PageNo LineNo 名称 Class_par_ratio 17973375 - 1 TM000010 82 奶粉 17973375 - 1 TM000015 49 牛奶 MILK 17973375 - 1 TM000015 49 乳制品其他食品 17973375 - 1 TM000016 11 动植物脂肪油 17973375 - 1 TM000006 79 奶粉 17973375 - 1 TM000016 9 牛奶 MILK

我想按 FileName 和 Class_par_ratio 对输出进行分组，我还想找到 Class_par_ratio 的频率并将其放在列 - frequency 中，然后我想在另一个名为“max freq”的列中找到最大频率。

输出有点像-

FileName      Class_par_ratio           Frequency    Max_Class     Max Freq.
17743633 - 1  OTHER FOODS               2            OTHER GOODS    4
              OTHER GOODS               4                  
17743634 - 1  MEAT                      12           MEAT           12
17743634 - 2  MEAT                       1           MEAT            1
17743635 - 1  MEAT                      83           MEAT           83
              OTHER GOODS               2      
17743642 - 1  MEAT                      43           MEAT           43
              OTHER GOODS               2                  
17743739 - 1  OTHER GOODS               3            OTHER GOODS     3

到目前为止，我尝试过的代码片段是 -

1) df.groupby(['FileName'])['Class_par_ratio'].value_counts()

我得到的输出是:-

FileName      Class_par_ratio
17743633 - 1  OTHER GOODS         8
17743634 - 1  MEAT AND LIVESTOCK 15
17743634 - 2  PETROLEUM           1
17743635 - 1  MEAT AND LIVESTOCK 87

另一个是——

2) coll_g = coll.groupby(['FileName', 'Class_par_ratio']).size().groupby(              
['FileName', 'Class_par_ratio']).agg({'count': max})
coll_g = coll_g['count'].groupby(level=0, group_keys=False)
coll_g = coll_g.nlargest(1)
coll_g

在这里，我得到了出现次数最多的类，但我没有得到最大值。频率没有。我得到的输出是 -

17743754 - 1  MEAT & LIVESTOCK            1
17743759 - 1  ANIMAL AND VEGETABLE OIL    1
17743970 - 1  IRON ORE                    1
17743996 - 1  OTHER GOODS                 1

我正在使用 Pandas .20 和 python 3.6.3

你们能告诉我哪里出错了以及我的代码应该是什么吗。

最佳答案

使用agg通过 idxmax , 什么返回最大类别因为之前 set_index和 max 到新的 DataFrame 然后 join 到原始的 DataFrame:

df = df.groupby(['FileName'])['Class_par_ratio'].value_counts().reset_index(name='Freq')

df1 = df.set_index('Class_par_ratio').groupby(['FileName'])['Freq'].agg(['idxmax','max'])

d = {'idxmax':'Max_Class','max':'Max Freq.'}
df = df.join(df1, on='FileName').rename(columns=d)

或者使用双transform :

df = df.groupby(['FileName'])['Class_par_ratio'].value_counts().reset_index(name='Freq')

g = df.set_index('Class_par_ratio').groupby(['FileName'])['Freq']
df['Max_Class'] = g.transform('idxmax').values
df['Max Freq.'] = g.transform('max').values
print (df)
       FileName           Class_par_ratio  Freq Max_Class  Max Freq.
0  17973375 - 1                      MILK     4      MILK          4
1  17973375 - 1  ANIMAL AND VEGETABLE OIL     1      MILK          4
2  17973375 - 1               OTHER FOODS     1      MILK          4

第二个样本数据验证方案:

df1 = df.set_index('Class_par_ratio').groupby(['FileName'])['Frequency'].agg(['idxmax','max'])
d = {'idxmax':'Max_Class','max':'Max Freq.'}
df = df.join(df1, on='FileName').rename(columns=d)
print (df)
       FileName Class_par_ratio  Frequency    Max_Class  Max Freq.
0  17743633 - 1      OTHE FOODS          2  OTHER GOODS          4
1  17743633 - 1     OTHER GOODS          4  OTHER GOODS          4
2  17743634 - 1            MEAT         12         MEAT         12
3  17743634 - 2            MEAT          1         MEAT          1
4  17743635 - 1            MEAT         83         MEAT         83
5  17743635 - 1     OTHER GOODS          2         MEAT         83
6  17743642 - 1            MEAT         43         MEAT         43
7  17743642 - 1     OTHER GOODS          2         MEAT         43
8  17743739 - 1     OTHER GOODS          3  OTHER GOODS          3

如果需要删除重复值，请添加 duplicated与 mask :

cols = ['Max_Class','Max Freq.']
df[cols] = df[cols].mask(df['FileName'].duplicated())
print (df)
       FileName Class_par_ratio  Frequency    Max_Class  Max Freq.
0  17743633 - 1      OTHE FOODS          2  OTHER GOODS        4.0
1  17743633 - 1     OTHER GOODS          4          NaN        NaN
2  17743634 - 1            MEAT         12         MEAT       12.0
3  17743634 - 2            MEAT          1         MEAT        1.0
4  17743635 - 1            MEAT         83         MEAT       83.0
5  17743635 - 1     OTHER GOODS          2          NaN        NaN
6  17743642 - 1            MEAT         43         MEAT       43.0
7  17743642 - 1     OTHER GOODS          2          NaN        NaN
8  17743739 - 1     OTHER GOODS          3  OTHER GOODS        3.0

关于python - 应用 groupby() 后计算最大行数，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/50529955/

24

4

0

文章推荐： python - 具有有限替换的无序组合

文章推荐： regex - 日志提取: SED Command

文章推荐： regex - perl oneliner + 如何过滤文件

文章推荐： python - 两个 pandas DataFrame 之间每日数据的每月相关性

Haskell - 如何将最大值 (xs++ map (x+) xs) 转换为 max (最大 xs) (x + 最大 xs)
“用 Haskell 进行函数式思考”中的练习之一是使用融合定律使程序更加高效。我在尝试复制答案时遇到了一些麻烦。部分计算要求您将 maximum (xs++ map (x+) xs) 转换为 ma
R 最大/最小可表示数
我正在尝试获得 R 中最大/最小的可表示数字。输入“.Machine”后我有: $double.xmin [1] 2.225074e-308 $double.xmax [1] 1.797693e+
javascript - 浏览器验证消息最小/最大
有没有办法更改浏览器验证消息请检查所附图片。我目前正在使用 wooCommerce 目前它显示小于或等于 X 个数字，我想更改为请求超过 X 个项目的报价。请多多指教最佳答案您需要使用oni
R - 优化(最大)
我正在尝试将解决方案从 Excel 求解器复制到 R 中，但不知道从哪里开始。问题: 每小时选择 5 个选项(5 行)，以最大化“分数”的总和，而无需在多个小时内选择同一组 2 次。换句话说: 最
Haskell:最大/最小函数
Haskell 中是否有这样的功能: max_of_type :: (Num a) => a 所以: max_of_type :: Int == 2 ^ 31 - 1 // for example,
javascript - 控制输入数字字段最小/最大
我有这两个表示时间范围(秒)的输入字段，我需要这样设置，以便“from/min”字段不能高于“to/max”，反之亦然。到目前为止我得到了这个: jQuery(document).ready(fun
MySQL-获取一系列行中连续事件的最小/最大
我有一个看起来像这样的表: http://sqlfiddle.com/#!9/152d2/1/0 CREATE TABLE Table1 ( id int, value decimal(10,
mysql - 从多个项目中选择最小/最大
我会尝试尽可能简单地解释它: 首先是一些带有虚拟数据的数据库结构。结构 tb_spec_fk feature value ----------------- 1 1 1
mysql - 一对多加入聚合函数(最大)
我有两个表。表 1: +---------+---------+ | Lead_ID | Deal_ID | +---------+---------+ | 2323 | null |
MySQL - 最小/最大
我的数据库中有一个字段可以包含数字，例如8.00 或范围编号，例如8.00 - 10.00。如果您将每个数字作为单独的数字，我需要从表中获取 MIN() 和 MAX()。例如当范围为 8.00 -
Python:最大/最小内置函数取决于参数顺序
max(float('nan'), 1) 计算结果为 nan max(1, float('nan')) 计算结果为 1 这是预期的行为吗？感谢您的回答。 max 在 iterable 为空时引发异常
html - 最大/最小宽度使用最大可能宽度
我想问一下如何在 CSS 中创建一个页脚栏，它具有最小宽度(比如 650 像素)，并且会根据窗口大小进行拉伸(stretch)，但仅限于某个点(比如 1024 像素)。我的意思是当窗口大小为例如 1
css - 最大/最小宽度属性不适用于目标列
我尝试调整表格列宽(下一个链接上的“作者”列 http://deploy.jtalks.org/jcommune/branches/1?lang=en)。我已将最小/最大属性添加到 .author-c
c# - 最大/最小对象
在 C# 中，是否有用于将最小值和最大值存储为 double 值的内置类？此处列出的要点 http://msdn.microsoft.com/en-us/library/system.windows
python - 最大 GAE任务队列处理率
问题: 每个任务队列是否可以每秒处理超过 500 个任务？每个 GAE 应用是否可以每秒处理超过 50,000 个任务？详细信息: Task queue quota文档说: Push Queue
java - 最大/最小堆树可以包含重复值吗？
我想知道是否允许最大或最小堆树具有重复值？我试图仅通过在线资源查找与此相关的信息，但一直没有成功。最佳答案是的，他们可以。您可以在“算法简介”(Charles E. Leiserson、Cliff
powershell 最大/第一个/聚合函数
首先，我是 .NET 开发人员，喜欢 C# 中的 LINQ 和扩展方法。但是当我编写脚本时，我需要相当于 Enumerable extension methods 的东西任何人都可以给我任何建议/
c++ - 最大 malloc 大小低于预期
这是一个检查最大 malloc 大小的简单程序: #include std::size_t maxDataSize = 2097152000; //2000mb void MallocTest(vo
awk - 我的第一个脚本中的语法错误。(最小，最大)
我想找到我的数据的最小值和最大值。我的数据文件: 1 2 4 5 -3 -13 112 -3 55 42 42 而我的脚本: {min=max=$1} {if ($1max) {max=$1}
php - 如何为ElasticSearch聚合添加条件(最小/最大)？
我想查询我的Elastic-Search以获取仅具有正值的最低价格价格。我的价格也可以为零和-1；所以我不希望我的最小聚合返回0或-1。我知道我应该向查询(或过滤器)添加脚本，但是我不知道如何。我当前

首页

博学

6Ren·AI

商城

python - 应用 groupby() 后计算最大行数