pandas - 从 Pandas 数据框中删除 'dominated' 行(所有值都低于任何其他行的值的行)-6ren

pandas - 从 Pandas 数据框中删除 'dominated' 行(所有值都低于任何其他行的值的行)

转载作者：行者123 更新时间：2023-12-02 18:37:44

25

4

编辑:为了清晰起见，更改了示例 df

我有一个数据框，类似于下面给出的数据框(除了真实的数据框有几千行和几千列，并且值是 float ):

df = pd.DataFrame([[6,5,4,3,8], [6,5,4,3,6], [1,1,3,9,5], [0,1,2,7,4], [2, 0, 0, 4, 0])

    0   1   2   3   4
0   6   5   4   3   8
1   6   5   4   3   6
2   1   1   3   9   5
3   0   1   2   7   4
4   2   0   0   4   0

从此数据框中，我想删除所有值都低于或等于任何其他行的所有行。对于这个简单的示例，应删除第 1 行和第 3 行(分别由第 0 行和第 2 行“主导”):

filtered df:
    0   1   2   3   4
0   6   5   4   3   8
2   1   1   3   9   5
4   2   0   0   4   0

如果该方法可以考虑浮点错误，那就更好了，因为我的真实数据帧包含 float (即，不要删除所有值都较低/相等的行，这些值不应低于一个小量(例如 0.0001)。

我解决这个问题的最初想法如下:

选择第一行
使用列表理解将其他行与其进行比较(见下文)
删除所有返回 True 的行
对下一行重复此操作

列表理解代码:

selected_row = df.loc[0
[(df.loc[r]<=selected_row).all() and (df.loc[r]<selected_row).any() for r in range(len(df))]
[False, True, False, False, False]

但这似乎效率不高。任何有关如何(有效)解决此问题的建议将不胜感激。

最佳答案

我们可以尝试使用 broadcasting :

import pandas as pd

df = pd.DataFrame([
    [6, 5, 4, 3, 8], [6, 5, 4, 3, 6], [1, 1, 3, 9, 5],
    [0, 1, 2, 7, 4], [2, 0, 0, 4, 0]
])

# Need to ensure only one of each row present since comparing to 1
# there needs to be one and only one of each row
df = df.drop_duplicates()

# Broadcasted comparison explanation below
cmp = (df.values[:, None] <= df.values).all(axis=2).sum(axis=1) == 1

# Filter using the results from the comparison
df = df[cmp]

df:

   0  1  2  3  4
0  6  5  4  3  8
2  1  1  3  9  5
4  2  0  0  4  0

直觉:

通过 DataFrame 广播比较操作:

(df.values[:, None] <= df.values)

[[[ True  True  True  True  True]
  [ True  True  True  True False]
  [False False False  True False]
  [False False False  True False]
  [False False False  True False]]  # df vs [6 5 4 3 8]

 [[ True  True  True  True  True]
  [ True  True  True  True  True]
  [False False False  True False]
  [False False False  True False]
  [False False False  True False]]  # df vs [6 5 4 3 6]

 [[ True  True  True False  True]
  [ True  True  True False  True]
  [ True  True  True  True  True]
  [False  True False False False]
  [ True False False False False]]  # df vs [1 1 3 9 5]

 [[ True  True  True False  True]
  [ True  True  True False  True]
  [ True  True  True  True  True]
  [ True  True  True  True  True]
  [ True False False False False]]  # df vs [0 1 2 7 4]

 [[ True  True  True False  True]
  [ True  True  True False  True]
  [False  True  True  True  True]
  [False  True  True  True  True]
  [ True  True  True  True  True]]]  # df vs [2 0 0 4 0]

然后我们可以检查all在axis=2上:

(df.values[:, None] <= df.values).all(axis=2)

[[ True False False False False]   # Rows le [6 5 4 3 8]
 [ True  True False False False]   # Rows le [6 5 4 3 6]
 [False False  True False False]   # Rows le [1 1 3 9 5]
 [False False  True  True False]   # Rows le [0 1 2 7 4]
 [False False False False  True]]  # Rows le [2 0 0 4 0]

然后我们可以使用sum总计有多少行小于或等于:

(df.values[:, None] <= df.values).all(axis=2).sum(axis=1)

[1 2 1 2 1]

只有 1 行小于或等于(仅自匹配)的行是要保留的行。因为我们drop_duplicates数据框中不会有重复项，因此唯一的 True 值将是自匹配值以及小于或等于的值:

(df.values[:, None] <= df.values).all(axis=2).sum(axis=1) == 1

[ True False  True False  True]

这将成为 DataFrame 的过滤器:

df = df[[True, False, True, False, True]]

df:

   0  1  2  3  4
0  6  5  4  3  8
2  1  1  3  9  5
4  2  0  0  4  0

关于pandas - 从 Pandas 数据框中删除 'dominated' 行(所有值都低于任何其他行的值的行)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/68522283/

25

4

0

文章推荐： algorithm - 以下快速排序的 Haskell 实现是否高效？

文章推荐： c - 是否可以在编译时确定实现是否提供精确宽度的整数类型？

文章推荐： c# - 引用多个 C# 项目时 Firebase 函数构建错误

文章推荐： python - 为每个元组添加第一个值

iPhone:删除/删除 SQLite 数据库？
我知道如何通过iPhone开发创建sqlite数据库、向其中插入数据、删除行等，但我试图以编程方式删除整个数据库本身，但没有得到任何帮助。请有人指导我如何通过代码从设备中删除/删除整个 sqlite
teradata - 删除/删除 Teradata 中的数据库
请帮助指导如何在 Teradata 中删除数据库。当我运行命令DROP DATABASE database_name时，我收到错误消息: *** Failure 3552 Cannot DROP d
azure - 删除/删除 Azure 警报规则
Azure 警报规则的删除命令似乎不起作用，尝试了下面的方法，它返回状态为无内容，并且警报未被删除使用的命令Remove-AzAlertRule -ResourceGroup "RGName"-Na
elasticsearch - Elasticsearch 数据丢失/删除/删除
我在 flex 搜索中为大约50000个视频建立了索引，但是当它达到52000左右时，所有数据都被删除。嗯，这对我来说真的很奇怪，我没有为ES设置任何Heap大小或最小或最大大小的内存大小，因此它们没
python - Django:删除/删除 slug
我正在处理的问题是表单错误“输入由字母、数字、下划线或连字符组成的有效‘slug’。” 以下是我的表单字段验证: def clean_slug(self): slug = self.c
jQuery 删除 : $ ("..."). 删除() 与 .remove ("...")
阅读文档，我希望 $("#wrap2").remove(".error") 从中删除所有 .error 元素#wrap2。然而看看这个 JSFiddle: http://jsfiddle.net/h
php - 删除/删除 laravel 项目
嗨，我第一次尝试发现 laravel 我从 laravel 4.2 开始，我刚刚创建了一个新项目，但我误以为我写了这样的命令行 composer create-project laravel/lara
Apache 2.4 - 删除 |删除 |卸载
我已经在网上搜索了很长一段时间，但我找不到如何完全删除 apache 2.4 。使用: Windows 7 c:\apache24\ 我已经尝试了所有命令，但没有任何效果。 httpd -k shu
python - 删除/删除 pandas DataFrame 中任意列中具有特定字符串的行
可能是一个简单的答案，所以提前道歉(最少的编码经验)。我正在尝试从任何列中删除具有特定字符串(经济 7)的任何行，并且一直在尝试离开此线程: How to drop rows from pandas
c++ - 删除/删除 vector 项的最有效/最快的方法
有几种方法可以删除/移除 vector 中的项目。我有一个指针 vector ，我需要在类的析构函数中删除所有指针。什么是最有效/最快甚至最安全的方式？ // 1º std::for_each(v
linux - 删除 xinetd 导致 plesk 删除
我安装了一个 VNC 服务器并在某处阅读了我必须安装 xinetd 的信息。稍后我决定删除 VNC 服务器，所以我也删除了 xinetd。似乎 xinetd 删除了一些与 plesk 相关的文件，如果
android - 如何完全杀死/删除/删除/停止 AsyncTask
我制作了一个从我们的服务器下载视频的应用。问题是: 当我取消下载时，我打电话: myAsyncTask.cancel(true) 我注意到，myAsyncTask 并没有在调用取消时停止...我的 P
machine-learning - 删除/删除 Vertica 中的机器学习模型(如果存在)
是否可以在使用DELETE_MODEL删除模型之前检查模型是否存在我试图避免在尝试删除尚未创建的模型时收到错误消息。基本上我正在寻找对应的: DROP TABLE IF EXISTS 但对于模型。最
php - 如何使用 php 删除/删除 mySQL 中的特定表行？
我已经有了这个代码: 但它仍然会生成一个表行条目。我想做的是，当输入的数量为0时，表行将被删除。请耐心等待，因为我是 php 和 mySQL 编码新手。最佳答案您忘记执行查询。应该是 $que
c# - 删除 EWS 中的 Exchange 事件修改/删除(即恢复事件)
在 SharePoint 中，如果您删除/修改重复日历条目的单次出现，则不会真正删除/修改任何内容 - 相反，会创建一个新条目，告诉 SP 对于特定日期，该事件不存在或具有新参数. 因此，这可以通过删
javascript - Laravel 5.2 & Dropzone.js - 删除(删除)上传的图片
在 routes.php 中我有以下路由: Route::post('dropzone', ['as' => 'dropzone.upload', 'uses' => 'AdminPhotoContr
Node.JS app.get 错误..无法获取/删除/删除/15
在我的应用程序中，我正在尝试删除产品。当我第一次删除产品时，它会成功并且 URL 更改为/remove_category/15。我正在渲染到同一页面。现在，当我尝试删除另一个产品时，网址更改为/rem
bash - 匹配后如何使用 BSD/OS X sed 删除/删除 X 行
这个问题被问了很多次，但给出的答案都是 GNU sed 特定的。 sed -i '' "/${FIND}/,+2d""$FILE" 给出“预期的上下文地址”错误。有人可以给我一个例子，说明如何使用
javascript - Google Maps JavaScript API V3 - 卸载/解构/删除/删除
在使用 V3 API 时，我找不到任何方法来删除和清理 Google map 。我已经在 AJAX 站点中运行它，所以我想完全关闭它而无需重新加载页面。我希望有一个 .unload() 或 .de
sql-server - 如何创建一个可以创建/更改/删除 View 但不能表、可以读取数据但不能插入/更新/删除/截断数据的 Azure SQL 数据库用户？
是否可以创建一个 Azure SQL 数据库用户来执行以下操作: 针对所有表和 View 进行 SELECT 创建/更改/删除 View 但用户不应该不拥有以下权限: 针对任何表或 View 插入/更

首页

博学

6Ren·AI

商城

pandas - 从 Pandas 数据框中删除 'dominated' 行(所有值都低于任何其他行的值的行)