loc配合布尔索引赋值最稳妥,推荐df.loc[条件,'列']=值;避免链式赋值;多条件用&连接并加括号;np.where适合三元逻辑;mask/where用于清洗;禁用apply行操作;注意索引对齐。

用 loc 配合布尔索引直接赋值最稳妥
直接改列值时,loc 是唯一推荐方式。Pandas 的链式赋值(比如 df[df['A'] > 0]['B'] = 1)会触发 SettingWithCopyWarning,且实际可能不生效——因为右侧表达式常返回视图或副本。
实操建议:
- 写法必须是
df.loc[条件, '目标列'] = 新值,条件用布尔 Series,比如df['A'] > 0 - 新值可以是标量、等长数组,或另一个 Series(索引需对齐)
- 如果条件涉及多列,用括号包住每个子条件,用
&(不是and)连接,例如(df['A'] > 0) & (df['C'] == 'x') - 避免在条件里用
isnull()或notna()后直接跟=,应统一用df.loc[df['A'].notna(), 'B'] = ...
用 numpy.where 处理三元逻辑更清晰
当更新逻辑是“满足条件取 X,否则取 Y”,np.where 比嵌套 loc 更易读、性能也更好,尤其对大 DataFrame。
实操建议:
-
df['B'] = np.where(df['A'] > 0, 'high', 'low')—— 第二、三参数支持标量、数组或 Series - 可嵌套:
np.where(df['A'] > 10, 'high', np.where(df['A'] > 0, 'mid', 'low')) - 注意:如果第二/三参数含 NaN,结果类型可能自动升为
object;必要时用astype()显式指定 - 不能用
np.where做原地修改(它返回新数组),所以要重新赋值给列
用 mask 和 where 替换特定条件下的值
这两个方法语义明确:mask 是“满足条件就替换成指定值(默认 NaN)”,where 是“满足条件才保留原值,否则替换”。适合清洗类场景。
实操建议:
df['B'] = df['B'].mask(df['A'] → 把 A 小于 0 对应的 B 改成 0-
df['B'] = df['B'].where(df['A'] >= 0, -1)→ 等价于上一行,但逻辑主语是“保留哪些” - 它们默认不修改原 DataFrame,必须显式赋值;传参
inplace=True虽然存在,但不推荐(和loc一样,易出错) - 如果条件列有 NaN,
mask/where默认把对应位置也设为 NaN,如需保留原值,加参数other=df['B']并配合cond.fillna(False)
别踩 apply + lambda 的性能坑
用 df['B'] = df.apply(lambda x: x['B'] * 2 if x['A'] > 0 else x['B'], axis=1) 能跑通,但这是最慢的方式,10 万行以上明显卡顿,且无法利用向量化。
实操建议:
- 除非逻辑极度复杂(比如调外部 API、正则分组后拼接),否则一律避免
apply行操作 - 字符串操作优先用
str.xxx方法(如df['A'].str.contains(...)),数值计算优先用np.where或布尔索引 - 真要用
apply,确保函数返回标量,并用result_type='expand'控制输出结构,避免隐式类型转换
最易被忽略的是索引对齐问题:用 loc 或 np.where 时,如果条件来自另一个 DataFrame 或 Series,务必确认索引完全一致,否则静默填充 NaN 或错位赋值。动手前先 df.index.equals(other.index) 检查一次。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











