应使用loc+range生成新id填充缺失值,因fillna不支持range;需计算缺失数、确定起始id(max()+1或默认1),再用list(range())或np.arange赋值,并注意dtype兼容性。

用 fillna() + range() 填充缺失ID最直接
当原始ID列(比如 'id')含 NaN,又想补成连续整数时,别用 ffill() 或 bfill()——它们复用已有值,不生成新ID。正确做法是先定位缺失位置,再用递增序列填充。
实操建议:
- 先用
df['id'].isna()得到布尔索引 - 计算待填数量:
missing_count = df['id'].isna().sum() - 生成起始值需注意:若已有ID最大为 100,新ID应从
101开始,避免重复(可用df['id'].max()获取,但要处理全空情况) - 推荐写法:
start_id = df['id'].max() + 1 if not df['id'].isna().all() else 1 new_ids = range(start_id, start_id + missing_count) df.loc[df['id'].isna(), 'id'] = list(new_ids)
为什么不用 df['id'].fillna() 直接传 range?
fillna() 不接受可迭代对象(如 range),传进去会报 TypeError: "value" parameter must be a scalar, dict, or Series。它只支持标量(如 0)、同长度的 Series,或按列名映射的 dict。
常见错误写法:
df['id'].fillna(range(100, 200)) # ❌ 报错
绕过方法:把 range 转成 list 后赋值给切片,如上一节所示;或构造一个临时 Series,索引对齐缺失行:
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
mask = df['id'].isna() fill_series = pd.Series(range(start_id, start_id + mask.sum()), index=df[mask].index) df.loc[mask, 'id'] = fill_series
如果要求“全局唯一”且后续还追加数据,得预留增长空间
单纯用 max() + 1 在单次处理中安全,但若该DataFrame后续还会 concat 新数据、或作为中间表反复读写,可能撞ID。此时应放弃依赖历史最大值,改用更鲁棒的方式:
- 用
pd.util.hash_pandas_object(df, index=True)生成行级哈希再截取,但不保证自增 - 更实用的是引入外部计数器:启动时读取当前最大ID(如从数据库或文件),填完后更新该值
- 若只是临时分析用途,直接用
df.reset_index(drop=True).index + 1生成全新ID列(但会丢弃原ID语义)
性能敏感时避免 loc + list 组合
当缺失行数超百万,list(range(...)) 会一次性分配大内存。可改用 numpy.arange 配合 .values 提升效率:
import numpy as np new_ids = np.arange(start_id, start_id + missing_count) df.loc[df['id'].isna(), 'id'] = new_ids
注意:df.loc[...] 赋值时,右边如果是 np.ndarray,Pandas 自动对齐;但若 df['id'] 是 Int64(nullable int)类型,需确保 new_ids 是整型而非浮点,否则会转成 float64 并引入 nan。
真正容易被忽略的是 dtype 兼容性——填完后检查 df['id'].dtype,必要时显式转回 "Int64":
df['id'] = df['id'].astype("Int64")Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










