先筛数据再分组;预筛选用布尔索引,filter()是对每组判断是否保留;agg()中需注意count与size对nan处理不同;多级分组须确保索引为multiindex才可用level;命名聚合可避免列名混乱。

用 groupby() 做条件分组前先筛数据还是后筛?
直接在 groupby() 后加 filter() 或用布尔索引预筛选,效果完全不同。前者是「对每组内部判断是否保留该组」,后者是「先砍掉不符合条件的行,再分组」。比如想只统计销售额 > 1000 的客户所在地区的平均订单量,必须先用布尔索引过滤:df[df['sales'] > 1000].groupby('region')['order_count'].mean()。如果写成 df.groupby('region').filter(lambda x: x['sales'].sum() > 1000),会按地区总销售额筛选地区,结果完全不是你要的。
agg() 里混用不同聚合函数时怎么指定列?
不能直接写 df.groupby('category').agg({'price': 'mean', 'qty': 'sum'}) 就完事——这看似正确,但一旦某列含缺失值且你用了 'count' 和 'size' 混搭,结果可能出人意料。'count' 统计非空值个数,'size' 统计行数(含 NaN),二者在有空值时数值不同。更稳妥的做法是显式控制:
df.groupby('category').agg({
'price': ['mean', 'std'],
'qty': lambda x: x.sum() if not x.isna().all() else 0
})
注意:匿名函数里要处理空组,否则报 ValueError: No objects to concatenate。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
多级分组后想对某一层做聚合,但 level 参数不生效?
level 只在索引是 MultiIndex 时才有效,DataFrame 本身列名不是索引就不能用。常见错误是把 df.set_index(['A', 'B']).groupby(level=0).sum() 套用到普通列上。正确做法是老实用列名:df.groupby(['A', 'B'])['value'].sum().unstack('B')。如果真需要按层级操作,先确认 df.index 是 MultiIndex 类型,否则 level=0 会静默忽略或抛 KeyError。
聚合结果列名混乱,比如变成 ('sales', 'mean') 元组?
这是 agg() 接收字典且值为列表时的默认行为,Pandas 会把列名和函数名拼成 MultiIndex 列。不想看到元组,有两个办法:
- 用命名聚合:
df.groupby('team').agg(avg_score=('score', 'mean'), total_pts=('points', 'sum')) - 聚合后重设列名:
result.columns = ['avg_score', 'total_pts']
命名聚合更推荐,它从 Pandas 0.25+ 开始支持,语义清晰,且不会因列顺序变动导致赋值错位。但注意:传入字符串函数名(如 'mean')比传函数对象(如 np.mean)更快,尤其大数据量时差异明显。
sum() 遇到全 NaN 列返回 NaN,count() 返回 0,size() 返回行数。不提前检查缺失模式,聚合结果可能看起来“算出来了”,但业务含义已经偏移。Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










