python - Groupby 类和计数特征中的缺失值-6ren

python - Groupby 类和计数特征中的缺失值

转载作者：IT老高更新时间：2023-10-28 21:08:14

26

4

我有一个问题，我在网络或文档中找不到任何解决方案，即使我认为这很微不足道。

我想做什么？

我有一个这样的数据框

CLASS FEATURE1 FEATURE2 FEATURE3
  X      A       NaN      NaN
  X     NaN       A       NaN
  B      A        A        A

我想按标签(CLASS)分组并显示每个特征中计算的 NaN 值的数量，使其看起来像这样。这样做的目的是大致了解缺失值如何分布在不同的类中。

CLASS FEATURE1 FEATURE2 FEATURE3
  X      1        1        2
  B      0        0        0

我知道如何接收 nonnull-Values 的数量 - df.groupby['CLASS'].count()

NaN-Values 有类似的东西吗？

我试图从 size() 中减去 count()，但它返回了一个未格式化的输出，其中填充了值 NaN

最佳答案

用isna计算一个掩码，然后分组求和:

df.drop('CLASS', 1).isna().groupby(df.CLASS, sort=False).sum().reset_index()

  CLASS  FEATURE1  FEATURE2  FEATURE3
0     X       1.0       1.0       2.0
1     B       0.0       0.0       0.0

另一种选择是使用 rsub 沿 0^th 轴从 count 中减去 size 作为索引对齐减法:

df.groupby('CLASS').count().rsub(df.groupby('CLASS').size(), axis=0)

或者，

g = df.groupby('CLASS')
g.count().rsub(g.size(), axis=0)

       FEATURE1  FEATURE2  FEATURE3
CLASS                              
B             0         0         0
X             1         1         2

有很多好的答案，所以这里有一些 timeits 供您阅读:

df_ = df
df = pd.concat([df_] * 10000)

%timeit df.drop('CLASS', 1).isna().groupby(df.CLASS, sort=False).sum()
%timeit df.set_index('CLASS').isna().sum(level=0)    
%%timeit
g = df.groupby('CLASS')
g.count().rsub(g.size(), axis=0)

11.8 ms ± 108 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)
9.47 ms ± 379 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)
6.54 ms ± 81.6 µs per loop (mean ± std. dev. of 7 runs, 100 loops each)

实际性能取决于您的数据和设置，因此您的里程可能会有所不同。

关于python - Groupby 类和计数特征中的缺失值，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/53947196/

26

4

0

文章推荐： java - 使用 JPA2 Criteria API 选择 MAX 时间戳

文章推荐： python - Python 中的 Google 身份验证器实现

文章推荐： java - 如何编写比较对象的 compareTo 方法？

文章推荐： python - Asyncio.gather 与 asyncio.wait

c# - LoginAsync 缺失
我编写了一个 Android 应用程序，它使用 Azure 来执行用户通过 Google、Twitter 和 Facebook 的登录；它使用 Microsoft.WindowsAzure.Mobil
c# - AdomdClient 缺失
我想将 AdomdClient 引用添加到 C# 项目，但它不在引用列表中。客户端列在程序集文件夹 C:\Windows\Assembly 中。计算机上安装了 SQL Server 2012。最佳
JavaScript - 缺失；声明之前
我正在学习“绘图应用程序”的教程。当我在 Firefox 上启动我的应用程序时，Firebug 告诉我“在语句之前缺少 ;” 我在第 9 行调用函数的位置。我只是不明白应该将这些“;”放在哪里. va
c# - AdomdClient 缺失
我想将 AdomdClient 引用添加到 C# 项目，但它不在引用列表中。客户端列在程序集文件夹 C:\Windows\Assembly 中。计算机上安装了 SQL Server 2012。最佳
Javascript 语法错误 - 缺失)
我在 Firebug 中不断收到关于 onClick 事件的错误。我已经尝试了 "和 ' 的各种不同组合，但无济于事。在添加 onClick 事件之前，这工作正常。有人能发现我可能做错了什么吗？
c++ - WSASetSocketSecurity 缺失
Visual Studio 2015 告诉我找不到 WSASetSocketSecurity。该 dll 存在并且还包括似乎没问题。我的包括: windows.h stdio.h Wincrypt
laravel - Eloquent whereHasNot 缺失
我需要访问 eloquent 的 whereHasNot方法(此处添加: https://github.com/laravel/framework/commit/8f0cb08d8ebd157cbfe
TensorFlow 对象检测评估 pycocotools 缺失
跟随宠物物体检测的 TF 教程:https://github.com/tensorflow/models/blob/master/research/object_detection/g3doc/run
Eclipse Galileo - JUnit 缺失
构建路径 > 添加库 > JUnit 无法添加 JUnit3 或 JUnit4 组件。我在.log 中看到这样的消息 !MESSAGE No property tester contributes
camera - Gstreamer ffdec_h264 缺失
我正在运行此脚本来查看网络上的摄像机: gst-launch udpsrc port=1234 ! "application/x-rtp, payload=127" ! rtph264depay !
java - 如何记录资源包 key 缺失
我正在使用http://java.sun.com/jsp/jstl/fmt用于从 Spring 配置中设置的 Message Resource Bundle 输出消息的标签库。消息解析也可以放在 Co
c# - HttpConfiguration.get_ServiceResolver() 缺失
我正在将 Ninject 与 MVC4 连接起来，并让它工作到尝试实际解决依赖关系的程度。但是，我收到以下异常: Method not found: 'System.Web.Http.Services
android - Admob 中的更新 - 缺失
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。这个问题似乎与 help center 中定义的范围内的编程无关。 . 关闭 9 年前。 Improve
c# - Microsoft.ApplicationInsights 缺失
我在启动 ASP.NET MVC5 应用程序时遇到问题。到目前为止一切正常。启动应用程序时出现以下错误: Could not load file or assembly 'Microsoft.Appl
python - conda 环境名称问题(缺失)
我已经使用以下方法创建了一个环境: conda create --prefix C:\Users\Dell\Dropbox\DjangoProjects\webenv python=3.6 执行后:c
c# - MVC 缺失 View
我们有一个遗留的 Web 窗体应用程序，我们最近将其从网站项目转换为 Web 应用程序项目。 Web 窗体项目是解决方案的“启动”项目。有一个 MVC 项目是对 Web 窗体项目的引用。在 MVC
java - Java 中的字体指标不正确/缺失？
使用某种字体，我使用Java的FontLayout来确定它的上升、下降和行距。 (参见 Java 的 FontLayout 教程 here) 在我的具体案例中，我使用的是 Arial Unicode
c++ - 未定义引用。 DSO 缺失
我正在尝试在 linux 下编译 qt ffmpeg 包装器简单编码/解码示例 QTFFmpegWrapper source # Set list of required FFmpeg librari
android - SlidingTabLayout setDistributeEvenly 缺失
我正在使用来自开发人员 android 页面的 SlidingTabLayout.java。在我使用 slidingTabLayout.setDistributeEvenly(true); 使 sli
video - FFmpeg 的常用过滤器 "v360"缺失
我正在尝试使用 v360 filter 将 180° 鱼眼视频转换为普通/常规视频的 FFmpeg . 这是我尝试过的命令:ffmpeg -i in.mp4 -vf "v360=input=fishe

首页

博学

6Ren·AI

商城

python - Groupby 类和计数特征中的缺失值