groupby后一次性计算多个聚合指标应使用agg()传入字典或命名元组,如{'sales': 'sum', 'profit': ['mean', 'std']},避免多次groupby重复遍历;对同一列需不同条件聚合时用lambda(如lambda x: x.quantile(0.9));多函数输出会生成multiindex,需用元组索引或展平列名。

Groupby后怎么一次性计算多个聚合指标?
直接在 agg() 里传入字典或命名元组,比链式调用 mean()、sum() 高效得多,也更易读。别用多次 groupby().xxx(),那会重复遍历数据。
- 用字典指定列到函数的映射:
df.groupby('category').agg({'sales': 'sum', 'profit': ['mean', 'std']}) - 给结果列重命名:用命名元组
('total_sales', 'sum')或字典{'total': 'sum', 'avg': 'mean'} - 注意:传入列表(如
['mean', 'max'])会产生 MultiIndex 列名,后续取列要写成df[('profit', 'mean')]
如何对同一列应用不同条件的聚合(比如分位数+计数)?
不能只靠内置字符串名(如 'quantile')搞定所有需求,得用 lambda 或自定义函数,尤其涉及条件逻辑时。
- 分位数必须显式传参:
lambda x: x.quantile(0.9),写成'quantile'会报错TypeError: quantile() missing 1 required positional argument: 'q' - 带条件的计数:用
lambda x: (x > 100).sum()替代count(),避免先布尔索引再 groupby 的性能损耗 - 组合使用时,确保返回标量——返回 Series 或 DataFrame 会导致
ValueError: cannot concatenate a non-NDFrame object
为什么 groupby.agg() 后索引变多层,取数总出错?
只要你在 agg() 里对一列用了多个函数(比如 ['min', 'max']),pandas 就自动升维成 MultiIndex 列,不是 bug,是设计行为。
- 快速展平:加
as_index=False不起作用;正确做法是调用droplevel(0, axis=1)(如果只有一级分组)或重命名列 - 安全取列:优先用元组索引
df[('value', 'max')],而不是df['value_max']——后者依赖你是否提前重命名 - 避免陷阱:
reset_index()在 agg 后要放在最后一步,否则可能把分组键变成普通列,丢失结构语义
大数据量下 groupby.agg() 卡顿或内存爆掉怎么办?
默认 pandas 把整个中间结果保留在内存,遇到千万级行+多列聚合时很容易 OOM,得主动控制计算粒度和类型。
- 提前筛选:在
groupby前用query()或布尔索引剔除无关行,别让无用数据参与分组 - 降精度:对数值列用
astype('float32')或'int32',尤其聚合前——float64占用内存是float32的两倍 - 替代方案:真到上亿行,考虑
dask.dataframe.groupby().agg()或polars.group_by().agg(),它们天然支持懒执行和分块
agg({'col': 'nunique'}) 返回 int64,但若原始列含 NaN,nunique 结果是 float64,后续做 merge 或 plot 就可能静默失败。Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











