
使用 pandas 的 fillna() 以均值或中位数填充 NaN 时出现 inf,通常源于对全为 NaN 的列执行统计计算——此时 mean() 或 median() 返回 nan,若后续参与除法等运算(如标准化、归一化),可能触发 0/0 或 inf 传播。
使用 pandas 的 `fillna()` 以均值或中位数填充 nan 时出现 `inf`,通常源于对全为 nan 的列执行统计计算——此时 `mean()` 或 `median()` 返回 `nan`,若后续参与除法等运算(如标准化、归一化),可能触发 `0/0` 或 `inf` 传播。
在数据清洗过程中,用列均值或中位数填充缺失值是常见做法,但若未提前校验数据质量,极易引入隐性错误。最典型的问题是:某列全部为 NaN。此时调用 df[col].mean() 或 df[col].median() 将返回 np.nan;而 fillna() 会将该 np.nan 填入整列——表面看“填充成功”,实则未解决缺失问题。当后续进行如 (x - mean) / std 等标准化操作时,若 std == 0(例如单值列或全 NaN 列经填充后方差仍为 0),分母为零即产生 inf 或 -inf。
✅ 正确做法是:填充前主动检测并处理全 NaN 列。示例代码如下:
import pandas as pd
import numpy as np
# 示例:构造含全 NaN 列的数据
df = pd.DataFrame({
'A': [1, 2, np.nan, 4],
'B': [np.nan, np.nan, np.nan, np.nan], # 全 NaN 列
'C': [5.0, 6.0, 7.0, np.nan]
})
# 方案1:跳过全 NaN 列,仅对有效列填充
for col in df.columns:
if df[col].notna().any(): # 至少有一个非 NaN 值
df[col] = df[col].fillna(df[col].median()) # 或 .mean()
else:
print(f"警告:列 '{col}' 全为 NaN,已设为 0 或删除")
df[col] = 0 # 或 df.drop(columns=[col], inplace=True)
# 方案2:一行式安全填充(推荐)
df = df.apply(lambda x: x.fillna(x.median() if x.notna().any() else 0))
⚠️ 注意事项:
- df.mean() 默认跳过 NaN,但若整列无有效值,则返回 nan;同理 median() 亦如此。务必通过 .notna().any() 显式校验;
- 避免在填充后直接做 df.apply(lambda x: (x - x.mean()) / x.std()) —— 应先检查 x.std() != 0,或使用 scipy.stats.zscore 等健壮函数;
- 使用 pd.options.mode.use_inf_as_na = True 可将 inf 视为缺失值统一处理,便于后续诊断。
总结:inf 不是 fillna() 的直接输出,而是“无效统计量 → 错误填充 → 后续数值运算崩溃”的链式结果。养成填充前探查 df.isna().sum() 和 df.describe() 的习惯,能从根本上规避此类问题。










