python - 如何像 Pandas 老板一样切片、排名和争吵-6ren

python - 如何像 Pandas 老板一样切片、排名和争吵

转载作者：太空宇宙更新时间：2023-11-04 05:40:16

26

4

假设有一个查找表总结了这个星球上一些人的忙碌生活...

import pandas as pd
import numpy as np
import datetime as dt
from datetime import datetime as dt
t=pd.Timestamp

lu = pd.DataFrame({ 'name' : ['Bill','Elon','Larry','Jeff','Marissa'],
                                        'feels' : ['charitable','Alcoa envy','Elon envy','like the number 7','sassy'],
                                        'last ate' : [t('20151209'),t('20151201'),t('20151208'),t('20151208'),t('20151209')],
                                        'boxers' : [True,True,True,False,True]})

假设还知道这些人住在哪里以及他们何时做某些事情...

af = pd.DataFrame({ 'name' : ['Bill','Elon','Larry','Elon','Jeff','Larry','Larry'],
                                        'address' : ['in my computer','moon','internet','mars','cardboard box','autonomous car','every where'],
                                        'sq_ft' : [2,2135,69,84535, 1.32, 54,168],
                                        'forks' : [7,1,2,1,0,np.nan,1]})

rand_dates=[t('20141202'),t('20130804'),t('20120508'),t('20150411'),
                        t('20141209'),t('20091023'),t('20130921'),t('20110102'),
                        t('20130728'),t('20141119'),t('20151024'),t('20130824')]

df = pd.DataFrame({ 'name' : ['Elon','Bill','Larry','Elon','Jeff','Larry','Larry','Bill','Larry','Elon','Marissa','Jeff'],
                                        'activity' : ['slept','tripped','spoke','swam','spooked','liked','whistled','up dog','smiled','donated','grant men paternity leave','fondled'],
                                        'date' : rand_dates})

可以根据他们居住的地址对这些人进行排名，如下所示:

af.name.value_counts()

Larry    3
Elon     2
Jeff     1
Bill     1

需求 1: 使用上面的排名，如何创建一个由查找表 lu 中的信息组成的新“排名”数据框？简而言之，如何制作 Exhibit A？

# Exhibit A
  boxers              feels   last ate     name  addresses
0   True          Elon envy 2015-12-08    Larry          3
1   True         Alcoa envy 2015-12-01     Elon          2
2  False  like the number 7 2015-12-08     Jeff          1
3   True         charitable 2015-12-09     Bill          1

需求2:观察后面groupby操作的输出。如何确定最旧日期和最新日期之间的时间差，以便根据这样的时间差对 lu 的成员进行排名？.. 简单地说，如何从 groupby 到 Exhibit D？

df.groupby(['name','date']).size()

name     date      
Bill     2011-01-02    1
         2013-08-04    1
Elon     2014-11-19    1
         2014-12-02    1
         2015-04-11    1
Jeff     2013-08-24    1
         2014-12-09    1
Larry    2009-10-23    1
         2012-05-08    1
         2013-07-28    1
         2013-09-21    1
Marissa  2015-10-24    1

#Exhibit B - Calculate time deltas
name     time_delta
Bill     Timedelta('945 days 00:00:00')
Elon     Timedelta('143 days 00:00:00')
Jeff     Timedelta('472 days 00:00:00')
Larry    Timedelta('1429 days 00:00:00')
Marissa  Timedelta('0 days 00:00:00')

#Exhibit C - Rank time deltas (this is easy)
name     time_delta
Larry    Timedelta('1429 days 00:00:00')
Bill     Timedelta('945 days 00:00:00')
Jeff     Timedelta('472 days 00:00:00')
Elon     Timedelta('143 days 00:00:00')
Marissa  Timedelta('0 days 00:00:00')

#Exhibit D - Add to and re-rank the table built in Exhibit A according to time_delta
  boxers              feels   last ate     name  addresses          time_delta
0   True          Elon envy 2015-12-08    Larry          3  1429 days 00:00:00
1   True         charitable 2015-12-09     Bill          1   945 days 00:00:00
2  False  like the number 7 2015-12-08     Jeff          1   472 days 00:00:00
3   True         Alcoa envy 2015-12-01     Elon          2   143 days 00:00:00
4   True              sassy 2015-12-09  Marissa        NaN     0 days 00:00:00

先前研究: This so post on getting max values using groupby and transform和 this other so post on finding and selecting most frequent data信息丰富，但不适用于系列(count_values() 的结果)或只是让我失望......我实际上已经得到了第一部分的工作，但代码有错误并且可能效率低下。

简单易用的代码共享看看这个 IPython Notebook这说明了一切。否则，请查看 Python 2.7 code here .

最佳答案

我想你可以使用 join , sort_values . Aggregation在文档中。

#join value count to lu dataframe, renaming ans sorting
Exhibit_A = lu.set_index('name').join(af.name.value_counts()).rename(columns={'name': 'addresses'}).sort_values('addresses', ascending=False)
#drop rows with NaN, reset index
print Exhibit_A.dropna().reset_index()

    name boxers              feels   last ate  addresses
0  Larry   True          Elon envy 2015-12-08          3
1   Elon   True         Alcoa envy 2015-12-01          2
2   Bill   True         charitable 2015-12-09          1
3   Jeff  False  like the number 7 2015-12-08          1

#aggregate to min and max date 
g = df.groupby(['name']).agg({'date' : [np.max, np.min]})

#reset columns multiindex
levels = g.columns.levels
labels = g.columns.labels
g.columns = levels[1][labels[1]]

g['time_delta'] = g['amax'] - g['amin']

#drop columns
g = g.drop(['amax', 'amin'], axis=1)

#join to Exhibit_A, sort, reset index
Exhibit_D = Exhibit_A.join(g).sort_values('time_delta', ascending=False).reset_index()
#reorder columns
Exhibit_D = Exhibit_D[['boxers', 'feels', 'last ate', 'name', 'addresses' , 'time_delta' ]]
print Exhibit_D

  boxers              feels   last ate     name  addresses  time_delta
0   True          Elon envy 2015-12-08    Larry          3   1429 days
1   True         charitable 2015-12-09     Bill          1    945 days
2  False  like the number 7 2015-12-08     Jeff          1    472 days
3   True         Alcoa envy 2015-12-01     Elon          2    143 days
4   True              sassy 2015-12-09  Marissa        NaN      0 days

关于python - 如何像 Pandas 老板一样切片、排名和争吵，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/34191746/

26

4

0

文章推荐： python - 使用装饰器为递归函数计时

文章推荐： c - 功能不起作用，找不到我的错误

文章推荐： c - 在 C 中提取字节

文章推荐： c - dirent 不使用 unicode

r 元素频率和索引，排名
我正在查看下面的示例代码， r element frequency and column name 并且想知道除了r中的排名和频率之外，是否有任何方法可以显示每列中每个元素的索引。因此，例如，所需的输
sql - 如何根据列的变化值对记录进行分组/排名？
我有下表按 Id、Year DESC 排序 ID 年份有效 1 2011 1 1 2010 1 1 2009 0 1 2002 1 4 2013 1 4 2012 1 4 2011 1 等等。我想要
SQL 排名，同时保持时间排序
鉴于此数据 Type Time Outcome Wanted Result 1 8:00 1 1 1 9:00 1 1 1 10:00 1 1 0
Java - 排名/匹配句子
我正在寻找一种对两个句子进行排名/匹配的方法。例如，取以下2个例句。这是一个简短的句子。这是一个包含很多单词的长句子。我的新句子是这是一个句子。我想将我的新句子与现有句子进行比较。我的新句子
python - Scikit分类比较/排名
我是 scikit 新手，我正在按照此处的示例 http://scikit-learn.org/stable/tutorial/text_analytics/working_with_text_dat
Mysql - 获取用户上下5行(排名)
我有一张 table : r_user | r_points | -------------------- user1 | 12 | user2 | 124 | use
MySql - 排名，给定玩家的排名及周围
我需要获得顶级玩家、给定玩家的排名以及与该给定玩家排名相关的少数玩家。为了更清楚地解释，下表是我想要的，它显示了得分最高的 3 名玩家、给定玩家的排名 (id=11) 以及得分略高于和低于该给定玩家
MySQL右外连接空值，所有用户的排名(排名)
我正在尝试创建一个排名(排名)查询。我使用表users、schedule 和picks来计算排名。然而，这样做的缺陷是，如果用户未提交任何选择，则该用户将不会出现在排名中。下面的查询返回所有已提交
php - 选择标识符并显示其中的行/排名
这个问题已经有答案了: 已关闭10 年前。 Possible Duplicate: High score system from my iphone game 我的查询是: $sql = "SELEC
mysql - 根据比赛表中的胜率获取排名/排名
我有一个玩家表和MatchUps表。 MatchUps 表具有一个 winner_id 列和一个 loser_id 列。我可以根据一次查询的胜率获得排名/排名吗？如果我能为每个玩家返回这样的东西，那就
php - 排名/天梯系统
我正在尝试创建一个排名/阶梯系统，其中排名最高的氏族 (1) 应位于顶部，排名为 2 的氏族应位于顶部，依此类推。但我无法让它工作......我尝试了不同的方法: PHP: $sql = mysql_
MySQL 排名(排名靠前的用户)
我需要一份游戏中排名最高的玩家列表。排名是即时计算的，数据取自两个表。我设法以正确的方式对它们进行排序，但是@rank:=0 -> @rank:=@rank+1 技巧，其中一个名为 rank 的附加字
mySQL 排名(和抽奖)
下周末我们将进行一场包含 3 项资格赛(半决赛和决赛)的比赛。只有最好的 15 名参赛者才能参加半决赛。只有最好的 6 人才能参加总决赛。在资格考试中，每项资格考试的分数从 0 到 100 不等我
php - 排名/人气系统
我正在尝试找出对我的产品进行加权的最佳方式，以及它们应该以何种顺序出现在主页等地方。我想处理四个指标并将其转化为排名: 购买产品产品有多久了(以天为单位) 产品被保存了多少次产品被浏览了多少次
使用变量在存在索引的情况下进行 MySQL 排名
使用 @N=@N + 1 的经典技巧来获取某些有序列上的项目排名。现在在订购之前，我需要通过将它与其他表内部连接来从基表中过滤掉一些值。所以查询看起来像这样 -: SET @N=0; SELECT
并列情况下的 MySQL 排名
我需要一些帮助来处理在 MySQL 中排名时的关系。例如: 播放器 |积分玛丽:90 鲍勃:90 吉姆:65 凯文:12 Bob 和 Mary 应该都排名第一。吉姆应该是#3。凯文应该是#4。 My
arrays - 具有特定强度的下一个排列/排名
我正在寻找一种算法，该算法可以为我提供具有特定强度的下一个排列。长度为 n 的排列由元素 (1,2,3,...n) 定义排列的强度是多少？长度为 10 的排列的强度定义为 |a1-a2|+|a2-
algorithm - 排名/信誉算法
我正在编写一个具有信誉组件的电子商务引擎。我希望用户能够对项目进行评论和评分，并能够对评论进行评分。用于根据“最佳”评论对项目进行排序的最佳算法是什么？它必须根据给出最佳评论的人获得的质量评论数量进
MySQL Volley 排名
我有一个按游戏结果填满游戏的数据库表，想知道我是否可以计算以下内容: GP(玩过的游戏) 获胜失败积分(每胜2分，每负1分) 这是我的表结构: CREATE TABLE `results` (
MySQL:获取特定行的行号(排名)
我有一个 users 表，其中有一列名为 money_sent。我想按 money_sent 降序排列此表，然后找出特定用户的“排名”。例如，只有 111 人比用户 12392 花费更多的钱，因此他

首页

博学

6Ren·AI

商城

python - 如何像 Pandas 老板一样切片、排名和争吵