python - 从先前的行和特定列值有效地更新 pandas 数据框中的 NaN-6ren

python - 从先前的行和特定列值有效地更新 pandas 数据框中的 NaN

转载作者：太空狗更新时间：2023-10-30 02:26:41

25

4

我有一个 pandas'DataFrame ，它看起来像这样:

# Output 
#        A     B     C     D
# 0    3.0   6.0   7.0   4.0
# 1   42.0  44.0   1.0   3.0
# 2    4.0   2.0   3.0  62.0
# 3   90.0  83.0  53.0  23.0
# 4   22.0  23.0  24.0   NaN
# 5    5.0   2.0   5.0  34.0
# 6    NaN   NaN   NaN   NaN
# 7    NaN   NaN   NaN   NaN
# 8    2.0  12.0  65.0   1.0
# 9    5.0   7.0  32.0   7.0
# 10   2.0  13.0   6.0  12.0
# 11   NaN   NaN   NaN   NaN
# 12  23.0   NaN  23.0  34.0
# 13  61.0   NaN  63.0   3.0
# 14  32.0  43.0  12.0  76.0
# 15  24.0   2.0  34.0   2.0

我想做的是用前一行最早的 B 值填充 NaN。除了列 D 之外，在这一行中，我希望将 NaN 替换为零。

我调查过 ffill、fillna.. 似乎都无法完成这项工作。

到目前为止我的解决方案:

def fix_abc(row, column, df):

    # If the row/column value is null/nan 
    if pd.isnull( row[column] ):

        # Get the value of row[column] from the row before
        prior = row.name
        value = df[prior-1:prior]['B'].values[0]

        # If that values empty, go to the row before that
        while pd.isnull( value ) and prior >= 1 :
            prior = prior - 1
            value = df[prior-1:prior]['B'].values[0]

    else:
        value = row[column]

    return value 

df['A'] = df.apply( lambda x: fix_abc(x,'A',df), axis=1 )
df['B'] = df.apply( lambda x: fix_abc(x,'B',df), axis=1 )
df['C'] = df.apply( lambda x: fix_abc(x,'C',df), axis=1 )


def fix_d(x):
    if pd.isnull(x['D']):
        return 0
    return x

df['D'] = df.apply( lambda x: fix_d(x), axis=1 )

感觉这样效率很低，而且很慢。所以我想知道是否有更快、更有效的方法来做到这一点。

示例输出；

#        A     B     C     D
# 0    3.0   6.0   7.0   3.0
# 1   42.0  44.0   1.0  42.0
# 2    4.0   2.0   3.0   4.0
# 3   90.0  83.0  53.0  90.0
# 4   22.0  23.0  24.0   0.0
# 5    5.0   2.0   5.0   5.0
# 6    2.0   2.0   2.0   0.0
# 7    2.0   2.0   2.0   0.0
# 8    2.0  12.0  65.0   2.0
# 9    5.0   7.0  32.0   5.0
# 10   2.0  13.0   6.0   2.0
# 11  13.0  13.0  13.0   0.0
# 12  23.0  13.0  23.0  23.0
# 13  61.0  13.0  63.0  61.0
# 14  32.0  43.0  12.0  32.0
# 15  24.0   2.0  34.0  24.0

我已将包含数据框数据的代码转储到可用的 python fiddle ( here )

最佳答案

fillna 允许使用多种方式进行填充。在这种情况下，D 列可以只填充 0。 B 列可以通过pad 填充。然后 A 和 C 列可以从 B 列填充，例如:

代码:

df['D'] = df.D.fillna(0)
df['B'] = df.B.fillna(method='pad')
df['A'] = df.A.fillna(df['B'])
df['C'] = df.C.fillna(df['B'])

测试代码:

df = pd.read_fwf(StringIO(u"""
       A     B     C     D
     3.0   6.0   7.0   4.0
    42.0  44.0   1.0   3.0
     4.0   2.0   3.0  62.0
    90.0  83.0  53.0  23.0
    22.0  23.0  24.0   NaN
     5.0   2.0   5.0  34.0
     NaN   NaN   NaN   NaN
     NaN   NaN   NaN   NaN
     2.0  12.0  65.0   1.0
     5.0   7.0  32.0   7.0
     2.0  13.0   6.0  12.0
     NaN   NaN   NaN   NaN
    23.0   NaN  23.0  34.0
    61.0   NaN  63.0   3.0
    32.0  43.0  12.0  76.0
    24.0   2.0  34.0   2.0"""), header=1)

print(df)

df['D'] = df.D.fillna(0)
df['B'] = df.B.fillna(method='pad')
df['A'] = df.A.fillna(df['B'])
df['C'] = df.C.fillna(df['B'])
print(df)

结果:

       A     B     C     D
0    3.0   6.0   7.0   4.0
1   42.0  44.0   1.0   3.0
2    4.0   2.0   3.0  62.0
3   90.0  83.0  53.0  23.0
4   22.0  23.0  24.0   NaN
5    5.0   2.0   5.0  34.0
6    NaN   NaN   NaN   NaN
7    NaN   NaN   NaN   NaN
8    2.0  12.0  65.0   1.0
9    5.0   7.0  32.0   7.0
10   2.0  13.0   6.0  12.0
11   NaN   NaN   NaN   NaN
12  23.0   NaN  23.0  34.0
13  61.0   NaN  63.0   3.0
14  32.0  43.0  12.0  76.0
15  24.0   2.0  34.0   2.0

       A     B     C     D
0    3.0   6.0   7.0   4.0
1   42.0  44.0   1.0   3.0
2    4.0   2.0   3.0  62.0
3   90.0  83.0  53.0  23.0
4   22.0  23.0  24.0   0.0
5    5.0   2.0   5.0  34.0
6    2.0   2.0   2.0   0.0
7    2.0   2.0   2.0   0.0
8    2.0  12.0  65.0   1.0
9    5.0   7.0  32.0   7.0
10   2.0  13.0   6.0  12.0
11  13.0  13.0  13.0   0.0
12  23.0  13.0  23.0  34.0
13  61.0  13.0  63.0   3.0
14  32.0  43.0  12.0  76.0
15  24.0   2.0  34.0   2.0

关于python - 从先前的行和特定列值有效地更新 pandas 数据框中的 NaN，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44098231/

25

4

0

文章推荐： python - Matplotlib - 向图例行添加标题

文章推荐： python - 以 2 为底的对数刻度

文章推荐： Python 3 没有名为 '_ssl' 的模块

文章推荐： python - 雅虎财经 API/URL 不工作 : Python fix for Pandas DataReader

javascript - (NaN != NaN) 和 (NaN !== NaN) 有什么区别？
首先我想说的是，我知道isNaN()和 Number.isNaN()工作。我正在阅读 David Flanagan 的 The Definite Guide，他举例说明了如何检查值是否为 NaN :
javascript - 如何摆脱 NaN/NaN/NaN
在表中，对于 skips day 列，最后一行的默认值始终是单词“last”，它不是数字。现在，结果日期显示为“NaN/NaN/NaN”，有什么方法可以将其替换为 Nil 之类的东西。非常感谢。
Javascript 获取 NaN :NaN:NaN
我正在制作一个网站，如果用户登录，则会为用户提供一定的注销时间，其中定义了注销时间，剩余时间是从注销时间 - 服务器时间获得的。我已经通过 PHP 获得了注销时间和服务器时间，但我想动态显示剩余时间
ios - 什么可能导致此 "Fatal Exception: CALayerInvalidGeometry CALayer bounds contains NaN: [nan nan; nan nan]"崩溃？
我有以下代码，它简单地初始化一个 UIImageView 以适应 UIImage 在当前屏幕尺寸上尽可能大的比例: CGSize mainScreenSize = [appDelegate mainS
python - 为什么 (nan,)==(nan,) 为 True，而 nan==nan 为 False？
这个问题已经有答案了: Why in numpy `nan == nan` is False while nan in [nan] is True? (1 个回答) 已关闭 3 年前。我只是觉得这有
javascript - 将 JqGrid 列模式显示为日期和超链接显示 NAN/NAN/NAN
我有动态 JQGrid，其中一列是日期列。我从包含 URL 和日期的 feed 中获取数据。我需要为“日期列”开发列模型，使其显示日期和超链接。但不幸的是，数据显示为 NAN/NAN/NAN (这可
java - map(NaN) 返回 NaN 但我无法调试 NaN
我已经包含了一个演示我的问题的片段。基本上处理给了我这个错误: 调用map(NaN, -3, 3, -125, 125)，返回NaN(不是数字) 我理解此消息的方式是，map 函数返回 NaN，并且由
javascript - 过滤日期在 AngularJS 中返回 NaN-NaN-NaN
我在下面创建的过滤器适用于 Chrome，但不适用于 Firefox。我不明白为什么。 myApp.filter('dateCustom', [ '$filter', function ($fil
python - 为什么在 numpy `nan == nan` 中为 False 而 [nan] 中的 nan 为 True？
虽然问题的第一部分(在标题中)之前已经回答过几次(即 Why is NaN not equal to NaN? )，但我不明白为什么第二部分会以它的方式工作(受此启发问题 How to Check l
c# - 如何使用泛型测试 NaN(或者为什么 NaN.Equals(NaN) == true)？
我需要在数组中找到min和max值(不考虑可能的NaN值在这个数组中)。这只使用 double 会很容易，但是这些 FindMin 和 FindMax 函数必须使用泛型类型。我尝试以这种方式测
ios - 'CALayer 位置包含 NaN : [nan nan]' on UIScrollView
我正在开发一个屏幕，其中 UIScrollView 内只有一个 UIImageView。 UIScrollView 使用户能够固定和缩放图像。我从下面的帖子中得到了帮助。它使用 Storyboard和
ios - Swift:CALayer 边界包含 NaN:[nan nan;南南]？
尽管看到了类似的答案，但我不知道这里发生了什么。我制作了一个自定义的 UIImageview，它应该在创建后立即开始动画: class HeaderAnimator: UIImageView {
python - Pandas :用下一个非 NaN/# 连续 NaN 填充 NaN
我正在寻找一个 pandas 系列并用下一个数值的平均值填充 NaN，其中:average = next numerical value/(# consecutive NaNs + 1) 到目前为止，
javascript - jQuery UI $.datepicker.formatDate 返回 NaN NaN Nan
我有一个 mySql 表，其中有一个名为 posts 的列，该列设置为 timestamp 类型，默认为 current_timestamp。然后，我使用 php PDO 获取它的值(以及其他一些列)
c++ - NAN 差异 - std::nan 与 quiet_NaN() 与宏 NAN
我想知道以下类型的 nan 之间有什么区别。除了 NAN_macro (计算结果为 -nan(ind) 而不是 nan )的视觉差异外，它们的行为似乎都相同(根据下面的示例脚本)。我看了一些其他的答
javascript - 如何解析 NaN :NaN:NaN error in Mozilla Firefox and IE
我为我的网页做了倒计时；它在除 Mozilla 和 IE 之外的所有浏览器上都能正常工作。我做错了什么，我该如何解决？下面是我的代码: ***var dt = '2018-06-14 11:59
ios - 调试 'CALayer position contains NaN: [nan nan]'
在将 Xcode 更新到 8.3 后，我在启动时开始收到此错误:由于未捕获的异常“CALayerInvalidGeometry”而终止应用程序，原因:“CALayer 位置包含 NaN:[nan na
javascript - 如果 Date 为空格式 date() 返回 NaN/NaN/NaN 而不是没有值
我正在使用 jquery 自动完成 onselect 它在不同的文本字段中显示数据。我使用 format_date() 函数在 #dob 和 #anniversery 中显示格式化日期 select:
javascript - IE8 中 Ext JS 网格日期值的 NaN.NaN.NaN 值
我有一个带有 json Store 和 DateField 的网格。 Firefox 运行良好，但在 Internet Explorer 8 中无法运行。我这样定义: function conver
objective-c - 如何解决CALayerInvalidGeometry'，原因: 'CALayer position contains NaN: [nan nan]?
我有一个错误，它在启动时使应用程序崩溃。这是我得到的错误: *** Terminating app due to uncaught exception 'CALayerInvalidGeometry'

首页

博学

6Ren·AI

商城

python - 从先前的行和特定列值有效地更新 pandas 数据框中的 NaN