numpy没有groupby方法,应区分场景:整数键用np.bincount或np.add.reduceat;非整数键优先转pandas处理。强行模拟pandas链式调用低效且难维护,混用才是业务常态。

NumPy里没有groupby方法,别硬套pandas思维
NumPy本身不提供类似SQL或pandas的groupby接口,强行用np.unique+np.where拼逻辑容易写崩,也难维护。真正“优雅”的做法是:明确区分场景——如果只是简单聚合(如按整数标签分组求均值),用np.bincount或np.add.reduceat;如果分组键是浮点/字符串/复合结构,优先转成pandas再回传NumPy数组,别死磕纯NumPy。
用np.bincount高效实现整数键分组聚合
这是最接近SQL GROUP BY int_col SUM(val)的纯NumPy方案,但要求分组键必须是非负整数且范围不大。它底层调用C实现,比Python循环快10倍以上。
-
np.bincount(keys, weights=values, minlength=max_key+1)直接完成加权计数或求和 - 若要算均值,得配合
np.bincount(keys)算各组频次,再做逐元素除法(注意除零) - 键含负数?先
keys = keys - keys.min()平移;键稀疏(比如最大值是1e6但只用了100个)?minlength设太大浪费内存,此时该换scipy.ndimage.labeled_comprehension或切回pandas
keys = np.array([0, 1, 0, 1, 2]) vals = np.array([10, 20, 30, 40, 50]) sums = np.bincount(keys, weights=vals) # array([40., 60., 50.]) counts = np.bincount(keys) # array([2, 2, 1]) means = np.divide(sums, counts, out=np.zeros_like(sums, dtype=float), where=counts!=0)
当分组键不是整数时,np.unique + 索引向量化是底线方案
字符串、浮点数、元组等无法直接喂给bincount,这时np.unique返回的inverse索引是关键桥梁——它把任意键映射成整数ID,后续就能复用bincount或np.add.reduceat。
- 务必用
return_inverse=True,别只拿unique_keys然后用np.where挨个找,那会退化成O(n²) -
np.add.reduceat需要索引按分组排序,所以得先np.argsort重排keys和values,再用np.unique(..., return_index=True)拿到每组起始位置 - 浮点键慎用
==比较,先用np.round或np.isclose预处理,否则np.unique可能把本该同组的值拆开
为什么不该在NumPy里模拟pandas的groupby链式调用
试图用类、装饰器或高阶函数封装出arr.groupby('col').mean()这种API,实际会引入三重负担:一是每次调用都要重复解析键、重建索引;二是缺失pandas的延迟计算和块管理,中间结果全在内存;三是无法处理缺失值对齐、多级索引、混合类型等真实SQL场景。一旦逻辑变复杂(比如窗口函数、自连接分组),代码可读性断崖下跌。
真正省事的做法是:用pandas.DataFrame(arr).groupby(...).agg(...).values拿到结果数组,全程不超过两行。纯NumPy的“优雅”只存在于小规模、固定模式、极致性能要求的内核场景里——多数业务代码里,混用才是常态。
最容易被忽略的一点:NumPy分组操作默认不保序,而SQL GROUP BY结果顺序由键决定。如果下游依赖顺序,必须显式用np.argsort或pandas.Categorical控制。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











