python - 如何在删除 NA 的同时获取重复值的索引？结果索引小于原始数据帧-6ren

python - 如何在删除 NA 的同时获取重复值的索引？结果索引小于原始数据帧

转载作者：行者123 更新时间：2023-12-01 07:37:09

24

4

我正在与 df 合作:

df.shape[0]

82208

我想根据名字、姓氏和电子邮件对重复项建立索引:

indx = (df.dropna(subset=['firstname', 'lastname', 'email'])
       .duplicated(subset=['firstname', 'lastname', 'email'], keep=False))


indx

0         True
1         True
2        False
3        False
4         True
5         True

indx.shape[0]

73797

我无法使用 df[indx] 将其用于原始 df，因为它们的大小不匹配，如您从 .shape[0] 中看到的那样。我也尝试使用 indx.index ，但我得到:


df[indx.indx]

KeyError: "None of [Int64Index([    0,     1,     2,     3,     4,     5,     6,     7,     8,\n                9,\n            ...\n            82198, 82199, 82200, 82201, 82202, 82203, 82204, 82205, 82206,\n            82207],\n           dtype='int64', length=73797)] are in the [columns]"

我知道这很简单，但我就是想不通。看来我生成的 indx 重置了它的索引。我想要得到的是第一个 df 中存在重复项的索引。我猜我的问题与生成索引时的 dropna() 有关。

编辑:建议查看重复的帖子，但这并不能回答我的问题。重复的只是基本索引。

我的问题是，在生成新索引/ bool 系列'indx'时，原始df索引丢失了。所以它不能用于索引df。

编辑:另一个解决方案是重新索引，使其与 df 的大小相匹配。


df = pd.DataFrame({'firstname':['stack','Bar Bar',np.nan,'Bar Bar','john','mary','jim'],
                   'lastname':['jim','Bar','Foo Bar','Bar','con','sullivan','Ryan'],
                   'email':[np.nan,'Bar','Foo Bar','Bar','john@com','mary@com','Jim@com']})

print(df)

  firstname  lastname     email
0     stack       jim       NaN
1   Bar Bar       Bar       Bar
2       NaN   Foo Bar   Foo Bar
3   Bar Bar       Bar       Bar
4      john       con  john@com
5      mary  sullivan  mary@com
6       jim      Ryan   Jim@com


indx = (df.dropna(subset=['firstname', 'lastname', 'email'])
                 .duplicated(subset=['firstname', 'lastname', 'email'], keep=False))

indx = indx.reindex(df.index, fill_value=False)


df[indx ]

  firstname lastname email
1   Bar Bar      Bar   Bar
3   Bar Bar      Bar   Bar

最佳答案

不要删除 nan，然后创建 bool 掩码，而是添加到为 nan 返回 False 的 bool 掩码，以便保留所有索引，但为 nan 返回 false。使用 df.isna() 和 df.any() 对于 axis=1 我们可以使用以下内容:

cols=['firstname', 'lastname', 'email']
index=(~df[cols].isna().any(1)&df.duplicated(subset=cols, keep=False))

关于python - 如何在删除 NA 的同时获取重复值的索引？结果索引小于原始数据帧，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/56937088/

24

4

0

文章推荐： python - 如何使用selenium将值输入到文本框中？

文章推荐： javascript - 根据元素出现的频率对数组进行排序

文章推荐： python - 我需要帮助将 urlpatterns url 转换为等效路径

文章推荐： php - 如何使用jquery ajax将php中的echo拆分为2个不同的div

ActiveRecord测试哈希条件内大于/小于
问题:如果联接表的属性大于/小于值，是否可以在散列条件下进行测试例如:测试 Actor 年龄是否大于年龄变量: 是否可以写而不是 ARRAY CONDITION 的: ageVariable = 3
JavaScript:小于 + 大于
这个问题已经有答案了: How to check if a number is between two values? (12 个回答) 已关闭 6 年前。我目前正在 Codecademy 上学习
java - 检查连续元素是否不同(小于)
我想知道是否有一种方法可以比较 arrayList 中的连续元素。我有这个 for (int j=0; j< Index.size(); j++) { if(Index.get(j) < Ind
java - 切换大于/小于
我正在压缩一些代码，现在我有 4 种方法，它们几乎都做同样的事情，除了 for 循环的建模有点不同。我正在传递 int 的 up , down , right ，和left作为这个紧凑方法的参数，这与
mysql - sql时间查询大于/小于
SELECT DISTINCT s.sname, s.sid FROM student s, class c WHERE s.programme = 'CS' AND s.level = '2' AN
Java通过命令行读取文件，<(小于)符号
我正在尝试通过命令行读取文件名，这是教授要我们输入的命令: java MultiBinaryClient xxxxxx.edu 6001 < files.txt 我正在尝试使用 args[3]获取文
C# 方括号和大于/小于
在 C# 中，您可能会看到以下内容: [] 或类似的行(但没有大于/小于符号): [assembly: AssemblyTitle("MyProject")] 我知道第一个称为属性(它有 gt 和 l
c - 内部工作大于/小于
我只是想知道大于/小于的结果是如何计算并返回给高级语言的。我在这里寻找硬件门模型。让我们用一个统一的例子来解释，比如说5 > 3。最佳答案它通常通过带有进位检测的减法来实现。从门控的角度来看
c - 小于(<)float与c中if语句的比较
这个问题在这里已经有了答案: strange output in comparison of float with float literal (8 个答案) 关闭 8 年前。案例一 float
ant - Apache Ant 小于
你到底如何检查一个数字属性是否小于 Apache Ant？从我所看到的(我是 Ant 的新手)你只能做 ? 最佳答案您可以使用 (见 http://ant.apa
c - 小于 FLT_EPSILON 的最大数字是多少？
在 C 中使用 float.h 我想知道如何找到最大的数字，如果我加到 1，答案将保持为 1。即 1 + x = 1 如何找到 x？最佳答案如果你想要“小于 FLT_EPSILON 的最大数字”
elasticsearch - Elasticsearch-小于-1个字节的值不受查询节点支持
我正在尝试查询节点统计信息端点(_nodes / stats)并收到此错误: {"error":{"root_cause":[{"type":"illegal_argument_exception",
java - 有没有更快的方法来检查列表中的某个项目是否大于、小于、等于某个数字？
有没有更快的方法来检查列表中的项目是否大于、小于或等于某个数字？或者你只需要循环它？我只是好奇是否有为此预先构建的函数。示例: 列表包含 5、5、10、15、15、20。我想检查是否有多少个
java - 如何比较已转换为整数的字符串的值(大于/小于)？
因此，我必须编写一个代码，从用户那里获取 2 个日期(月/日/年)，如果第一个日期小于第二个日期，则返回“true”。在任何其他情况下，日期将为“假”或“它们是相同的”。我被告知我不能要求用户执行指定
javascript - 优雅地检查两个变量之间的范围是否大于/小于 'x'
我有两个变量，如果它们的值彼此相差在 5 个数字以内，我想触发一些代码。不知道哪个变量具有更高的值，我可以这样做: if (var1 > var2) { if ((var1 - var2) < 5
java - 小于 ObjectOutputStream 基元的基元数组
我有一个函数，它接受一个对象并将其转换为字节数组: public static byte[] serialize(Object obj) throws IOException { try(By
android - 小于 4MB 的即时应用程序
下载大小已经低于 4MB 的应用程序是否也可以作为免安装应用程序未经修改地分发？最佳答案要将该应用程序作为免安装应用程序提供，仍需采取一些步骤。参见 http://g.co/instantapps
MySQL WHERE 子句 - 年龄大于/小于
我有以下 SELECT 但无法正常工作: SELECT COUNT(userid) FROM login WHERE 17 YEAR(DATE_SUB(NOW(), INTERVAL TO_DAYS
javascript - if 小于 on .length 的条件不能精确工作
我制作了一个脚本，其中 #hsz-wrap2 附加到最后一个可见的 div，当 div 数量低于或等于 16 在 #snapshot_vertical div 内。但是，if 条件的工作方式我不明白
html - 小于 992px 的捕捉点搜索框定位出错？
我在外部的一排内放置了一个 Logo 、一个搜索框和一个语言栏，并位于 Bootstrap 导航栏上方。这一行当然仍在主容器中，但它包含我提到的 3 个元素——我和我的客户认为这 3 个元素独立于导航

首页

博学

6Ren·AI

商城

python - 如何在删除 NA 的同时获取重复值的索引？结果索引小于原始数据帧