update方法仅按索引和列名双对齐覆盖,不新增行列,nan默认不覆盖,inplace=true易致静默错误,应优先用combine_first或预过滤交集。

update 方法只按索引对齐更新,不按列名
如果你期望 update 像 SQL 的 UPDATE 那样按字段名匹配更新,会出错。它实际行为是:用右侧 DataFrame 的值,**覆盖左侧 DataFrame 中相同索引 + 相同列名位置的值**;但前提是列名必须一致,且只更新左侧已存在的列——右侧多出的列会被忽略。
- 左侧缺失的索引,不会被新增;右侧多余的索引,完全不起作用
- 如果两表列名不完全一致,比如左侧是
['name', 'age'],右侧是['name', 'score'],那么只有'name'列会被更新,'score'被丢弃 - NaN 值默认不覆盖(这是关键!),除非显式设置
overwrite=True
update 无法更新缺失列,也不能新增行
常见误用场景:想用 update 把新数据“补全”到原表里,比如添加新用户或新字段。这不行——update 不是 concat 或 merge,它只做就地覆盖。
- 想新增行?得用
pd.concat([df_old, df_new], ignore_index=False)再去重/去并 - 想新增列?得用
df_old.join(df_new[新列])或直接赋值df_old['new_col'] = ... - 想用 update 补 NaN?记得加参数
overwrite=False(默认值)——它本来就不覆盖 NaN;如果真要强制写入,得设overwrite=True,但注意这会把原来非空值也刷掉
update 的 inplace 行为容易引发静默错误
update 默认是 inplace=True,但它不返回新对象,也不报错,而是在原 DataFrame 上改。如果误写成 df = df.update(...),结果 df 变成 None,后续操作全崩。
- 正确写法只有两种:
df.update(other)(直接改 df),或df_updated = df.copy().update(other) or df.copy()(先 copy 再改,但注意 update 返回 None,所以得写成df_copy = df.copy(); df_copy.update(other); df_updated = df_copy) - 更安全的做法是避免 inplace:用
df.combine_first(other)(优先取左,左为 NaN 时取右)或手动构造掩码更新 - 调试时建议先检查索引是否对齐:
set(df.index) & set(other.index),空交集意味着 update 完全没生效
替代方案:combine_first 和 mask 更可控
当 update 行为不符合预期时,combine_first 和布尔索引 mask 往往更直观、更易 debug。
-
df.combine_first(other):以 df 为主,other 中索引存在且 df 对应位置为 NaN 的才填充——适合补缺,不破坏原有非空值 -
df.loc[other.index, other.columns] = other:暴力按坐标赋值,但要求索引和列都存在,否则报KeyError -
df.mask(df.index.isin(other.index) & df.columns.isin(other.columns), other, inplace=False):太绕,一般不用;更常用的是df.update(other, overwrite=True)加上预过滤
真正批量更新前,先跑一次 other[other.index.isin(df.index)] 确保只处理交集部分,能避开大部分“看起来调了却没变”的问题。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











