python中用&、|、~组合布尔条件时括号不能省,因位运算符优先级高于比较运算符,不加括号会报错或逻辑错误;正确写法为(df.age > 25) & (df.city == "beijing");且不可用and/or/not替代。

用 &、|、~ 组合布尔条件时括号不能省
Python 中 &(与)、|(或)、~(非)的优先级高于比较运算符,不加括号会直接报错或逻辑错乱。比如想筛选年龄大于 25 且城市是 "Beijing" 的行,写成 df.age > 25 & df.city == "Beijing" 会触发 ValueError: The truth value of a Series is ambiguous。
正确写法必须给每个比较表达式加括号:
df[(df.age > 25) & (df.city == "Beijing")]
常见错误点:
-
&不能写成and(那是 Python 原生逻辑,不支持 Series) -
|不能写成or,~不能写成not - 字符串匹配注意大小写和空格,建议先用
df.city.str.lower().str.strip()清洗再比
用 query() 方法写多条件更接近自然语言
当条件较多或含变量时,query() 可读性明显更好,它支持字符串表达式解析,自动识别列名,还允许插入外部变量(用 @ 前缀)。
例如筛选多个城市 + 年龄区间 + 非空邮箱:
cities = ["Beijing", "Shanghai", "Guangzhou"]
min_age, max_age = 22, 30
df.query('city in @cities and @min_age <p>优势和限制:</p>
- 支持
in、not in、链式比较(如22 ),不用重复写列名 - 列名含空格或特殊字符需用反引号包裹,如
`user id` > 100 - 性能略低于布尔索引(尤其小数据集差异可忽略,大数据量建议用布尔索引)
处理缺失值时 isna() 和 notna() 比 == np.nan 可靠
NaN 不等于任何值,包括它自己,所以 df.col == np.nan 永远返回全 False。过滤含缺失值的行必须用专门方法。
典型场景:排除年龄为空、且邮箱也为空的记录:
df[~(df.age.isna() & df.email.isna())]
或者用 query() 写得更清楚:
df.query('age.notna() or email.notna()')
注意点:
-
isna()对数值、字符串、时间类型都适用;isnull()是别名,行为一致 - 如果列是 object 类型但混有数字和字符串,
isna()仍能正确识别 NaN/None,而== None可能失效 - 想保留只有部分字段缺失的行,别误用
dropna()全局删——那是另一层操作
复杂逻辑嵌套时先拆成中间布尔 Series 再组合
超过 4–5 个条件连写容易出错,也不利于调试。推荐把每条规则单独赋值为变量,再用 &/| 拼接。
比如筛选“活跃用户”:近 7 天有登录、累计积分 > 1000、且不是测试账号(邮箱不含 test 或 demo):
recent_login = df.last_login >= (pd.Timestamp.now() - pd.Timedelta("7D"))
high_score = df.points > 1000
not_test = ~df.email.str.contains(r"test|demo", case=False, na=False)
<p>df[recent_login & high_score & not_test]</p>
这样做的好处:
- 每步可单独
print(recent_login.sum())查数量,快速定位哪条条件筛太狠 - 复用方便,比如后续还要统计“高积分但未近期登录”的用户,只需换组合
- 避免长表达式中括号错位,特别是嵌套
str.contains()这类带参数的方法时
真正麻烦的从来不是语法本身,而是条件语义是否覆盖了业务边界——比如“近 7 天”是否包含今天、“测试账号”是否要排除手机号注册的临时号,这些得和产品对齐,代码只是忠实执行。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











