最直观的多条件分支赋值用 numpy.where,需用 & | ~ 且括号包裹条件;数值分箱优先用 pd.cut/pd.qcut;复杂逻辑用 df.loc 分步赋值并预先初始化列;避免 apply 和 python 布尔运算符。

用 numpy.where 做多条件分支赋值最直观
当新列的值取决于两三个列的组合逻辑(比如“如果 A>0 且 B=='X',则取 C*2;否则取 D”),numpy.where 比 apply 更快也更易读。它支持嵌套,但超过三层嵌套就该考虑其他方式了。
常见错误是直接用 Python 的 and/or,这在 Pandas 中会报 ValueError: The truth value of a Series is ambiguous。必须改用 &、|、~,且每个条件要括起来。
df['new_col'] = np.where((df['A'] > 0) & (df['B'] == 'X'), df['C'] * 2, df['D'])- 多个条件嵌套:用
np.where(cond1, val1, np.where(cond2, val2, val3)) - 注意:
&是位与,不是布尔与;(df['A'] > 0)返回的是布尔 Series,必须加括号保证运算优先级
用 pd.cut 或 pd.qcut 做数值区间分箱派生
如果你的条件本质是“把某列按范围切分成类别”,比如把 score 列转成 'low'/'medium'/'high',硬写 where 条件容易出错且难维护。pd.cut 是专为此设计的。
区别在于:pd.cut 按指定边界切分,pd.qcut 按分位数切分(每组数据量大致相等)。两者都支持 labels 参数直接映射名称。
df['grade'] = pd.cut(df['score'], bins=[0, 60, 80, 100], labels=['F', 'C', 'A'])- 边界不闭合时会生成
NaN,可加include_lowest=True让左端点闭合 - 如果想基于多列合成一个指标再分箱(如
(df['math'] + df['eng']) / 2),先算出中间 Series 再传给cut
用 df.loc 配合布尔索引做分步赋值
当逻辑特别复杂、分支多、或需要复用中间计算结果时,df.loc 分步写比嵌套 where 更清晰。它天然支持多列条件组合,且赋值目标明确。
容易忽略的是:df.loc[condition, 'new_col'] = value 必须确保 'new_col' 已存在,否则会报 KeyError。要么提前 df['new_col'] = np.nan 初始化,要么用 df.loc[:, 'new_col'] = ...(但这样无法条件赋值)。
- 先初始化:
df['status'] = '' - 再分步:
df.loc[(df['age'] >= 18) & (df['income'] > 50000), 'status'] = 'adult_high' df.loc[df['age']- 最后补默认值:
df['status'] = df['status'].replace('', 'other')
避免在 apply 里遍历行处理多条件
很多人第一反应是写 lambda x: func(x.A, x.B, x.C) 然后 apply(axis=1),这在小数据上没问题,但一旦行数过万,性能会断崖式下降——因为完全失去了向量化优势。
除非你的逻辑涉及无法向量化的操作(比如调用外部 API、正则捕获多组命名组、依赖前一行状态),否则别用 apply 做多列条件判断。Pandas 的布尔索引、where、cut、map 几乎能覆盖 95% 的派生需求。
- 反例:
df['flag'] = df.apply(lambda r: 'yes' if r['A'] > r['B'] else 'no', axis=1)→ 应改用np.where(df['A'] > df['B'], 'yes', 'no') - 若真要用
apply,务必加上result_type='expand'或raw=True提速,但效果有限 - 调试时可在
apply函数里加print,但上线前必须删掉——它会让速度雪崩
实际中最大的坑不是语法,而是忘记检查缺失值。所有布尔条件遇到 NaN 都会变成 False(或引发 NA 传播),导致派生列结果意外为空。动手前先跑一遍 df[['A','B','C']].isna().sum()。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











