python - Pandas 数据框的列总和并与其他数据结合-6ren

python - Pandas 数据框的列总和并与其他数据结合

转载作者：行者123 更新时间：2023-12-01 04:20:30

24

4

这是 question 的延续我之前问过，当时得到了合适的答案。然而现在我的问题不同了，给出的答案不再(完全)适用。

我收集了大量 Twitter 消息，我想对其进行一些统计分析。部分数据框如下所示:

user.id      user.screen_name      user.followers_count      text
Jim          JimTHEbest            14                        blahbla
Jim          JIMisCOOL             15                        blebla
Sarah        Sarah123              33                        blaat
Sarah        Sarah123              33                        bla
Peter        PeterOnline           9                         blabla

user.id 永远不会改变，是 Twitter 帐户的标识符。

user.screen_name 为 Twitter 帐户指定的名称，可能会随着时间的推移而更改。

user.followers_count 帐户有多少关注者，可能会随着时间而变化。

文本 Twitter 消息，每行代表 1 条 Twitter 消息及其元数据。

我想做的是计算数据框中每个 Twitter 用户的推文频率，并将其与我已有的数据结合起来。这样我就得到了这样的东西:

user.id      user.screen_name      user.followers_count      count
Jim          JIMisCOOL             15                        2
Sarah        Sarah123              33                        2
Peter        PeterOnline           9                         1

数据集中每个 Twitter 用户的数据框有 1 行，显示他们的推文计数以及最后的 screen_name 和 follower_count。

我认为我应该做的是首先执行“计数”操作，然后 pd.merge 该结果与我的原始数据帧的一部分。在 pandas 文档的帮助下尝试合并并没有让我走得太远，主要是无休止地重复重复数据行..任何帮助将不胜感激!

我执行的计数部分如下:

df[['name', 'text']].groupby(['name']).size().reset_index(name='count')

最佳答案

# df being the original dataframe, taking the last row of each unique user.id and ignoring the 'text' column
output_df = df.drop_duplicates(subset='user.id', take_last=True)[['user.id', 'user.screen_name', 'user.followers_count']]
# adding the 'count' column
output_df['count'] = df['user.id'].apply(lambda x: len(df[df['user.id'] == x]))
output_df.reset_index(inplace=True, drop=True)
print output_df
>>   user.id user.screen_name  user.followers_count  count
   0     Jim        JIMisCOOL                    15      2
   1   Sarah         Sarah123                    33      2
   2   Peter      PeterOnline                     9      1

关于python - Pandas 数据框的列总和并与其他数据结合，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/33783680/

24

4

0

文章推荐： java - Android 多线程

文章推荐： asp.net - ajax jQuery asp.net 错误意外的标记 <

文章推荐： jquery - 发送不带参数的函数会导致未设置变量错误

文章推荐： java - 从 Java 运行 csstidy

Excel - 结合 SUMPRODUCT
我有一张 Excel 表格，用于更新玩家评分。播放器配售初始化 1 2 3 4 金融评级一个 1 2.0 1.000 0.018 0.016 0.014 2.007 D 2 -2.0 54.5
qt - 结合 QAbstractItemModels
我有一个 map = std::map ，其中 myItemModel继承QAbstractItemModel . 我现在要合并所有 myItemModel合一myItemModel (其他所有元素模
r - do.call 结合 "::"
我大量使用“do.call”来生成函数调用。例如: myfun <- "rnorm"; myargs <- list(n=10, mean=5); do.call(myfun, myargs); 但是
Scala future 结合
想象一下 InputStream 的以下变体: trait FutureInputStream { //read bytes asynchronously. Empty array means E
结合 C 和汇编代码
这是我的 C 代码: #include void sum(); int newAlphabet; int main(void) { sum();
Jquery:结合 "each"函数选择类后的所有内容
我只是想选择类“.last”之后的每个元素。 HTML: 1 2 Jquery
C# ？？结合？ : question
我正在为一个项目构建一个 XML 反序列化器，我经常遇到这种类型的代码情况: var myVariable = ParseNDecimal(xml.Element("myElement")) == n
SQLite:结合 OR 和 AND
这是来自 Selecting the highest salary 的继续问题假设有一个表 'wagetable' name lowhours highhours wage pri
c - 结合 if 语句来设置值限制
我正在为我的程序创建一个战舰程序；该程序运行良好，但我试图确保当用户将坐标超出范围时，程序会说他们输入的坐标不正确。这是代码: #include #include void
结合 GetLastError 的值和自定义错误消息
我有一个函数，它为每种情况返回不同的 DWORD 值，如果出现错误。所以我有以下定义: #define ERR_NO_DB_CONNECTION 0x90000 #define ERR_DB_N
结合.net框架在C#派生类中触发基类事件及实现接口事件
在派生类中引发基类事件以下简单示例演示了在基类中声明可从派生类引发的事件的标准方法。此模式广泛应用于 .NET Framework 类库中的 Windows 窗体类。在创建可用作其他类的基类的类时，应
perl 结合 map 和每个
我只是想知道这是否可能: use Modern::Perl; my @list = ('a' .. 'j'); map { func($_) } each(@list); sub func { m
excel - 结合 IF 函数和 OR 函数以允许多个条件
我一直在使用 =IF(L2="","Active",IF(K2I2,"Late"))) 有效，但现在我需要检查 F 上的多个条件专栏我试过了 OR 函数 =IF(OR(F2="Scheduled"
FFmpeg - 结合 2 个命令
我有 2 个命令，如下所示。在视频中添加介绍图片 ffmpeg -y -loop 1 -framerate 10 -t 3 -i intro.png -i video.mp4 -filter_com
vba - 结合 VBA 和公式来检查独特的输出
好的，我有这个公式可以根据名字和姓氏列表生成用户名。现在，虽然这可行，但我希望单元格改为引用我自己的 VBA 函数。但是，由于代码少得多，我仍然想使用原始公式。我有这个公式: =SUBSTITUTE
haproxy - 结合 HAProxy 统计数据？
我有两个 HAProxy 实例。两个实例都启用了统计信息并且工作正常。我正在尝试将两个实例的统计信息合并为一个，以便我可以使用单个 HAProxy 来查看前端/后端统计信息。我试图让两个 hapro
typescript - switchMap 结合 mergeMap
我有一个 Observable，其中每个新值都应该引起一个 HTTP 请求。在客户端，我只关心最新的响应值；但是，我希望每个请求都能完成以进行监控/等。目的。我目前拥有的是这样的: function
javascript - 如何将延迟加载与 TinyMCE 结合？
我的网站上有 TinyMCE 插件。在 TinyMCE 插件的 textarea 中添加图像时，我希望这些图像包含延迟加载。我网站的缩略图具有特定类型的延迟加载，其中 src 图像是灰色背景。根据用户
r - 将重叠间隔与 lubridate 结合
我希望合并润滑间隔，以便如果它们重叠，则从内部第一个时间获取最小值和从内部最后一个时间获取最大值并总结以创建一个跨越整个时间段的新间隔。这是一个reprex: library(lubridate, w
html - 结合 flex 和绝对定位时的混淆
我有一个应用程序，它本质上是一个页眉、主要内容和一个始终可见的页脚。页脚可以改变大小，我想在页脚上方的主内容面板上放置一些工具。主要布局是用 flex 完成的，我阅读文档的理解是绝对定位通过相对于最近

首页

博学

6Ren·AI

商城

python - Pandas 数据框的列总和并与其他数据结合