为 DataFrame 添加按组内子组聚合值排序的排名列

千敏酱_2534

千敏酱_2534

2026-10-09

497人浏览

原创

为 DataFrame 添加按组内子组聚合值排序的排名列

本文介绍如何在 pandas 中高效地为 dataframe 新增一列,表示每个 (group, subgroup) 组合基于其 value 总和的全局降序排名。核心思路是先分组求和、再排名、最后回填到原始数据。

本文介绍如何在 pandas 中高效地为 dataframe 新增一列,表示每个 (group, subgroup) 组合基于其 value 总和的全局降序排名。核心思路是先分组求和、再排名、最后回填到原始数据。

在数据分析中,常需对嵌套分组(如 group → subgroup)按某数值列的聚合结果(如 sum、mean)进行排序并赋予排名,再将该排名广播回原始行级数据。本例中,目标是:对每组 (group, subgroup) 计算 value 列的总和,然后根据该总和从大到小排名(最大和为第 1 名),并将该排名作为新列 rank 添加到原始 DataFrame 的每一行。

实现的关键在于三步链式操作:

  1. 分组聚合:使用 df.groupby(['group', 'subgroup'])['value'].sum() 得到每个子组的总和;
  2. 计算排名:对聚合结果调用 .rank(ascending=False) 实现降序排名(默认 method='average',遇并列取平均秩;如需最小秩可用 method='min');
  3. 回填匹配:通过 merge() 将带排名的子组摘要表与原始 DataFrame 基于 group 和 subgroup 列左连接。

完整代码如下:

import pandas as pd

df = pd.DataFrame({
    "group": ["a", "a", "a", "a", "a", "b", "b", "b", "b", "b", "c"],
    "subgroup": ["i","ii","i","ii","i","ii","i","ii","i","ii","ii"],
    "value": [2, 4, 2, 3, 5, 1, 2, 4, 1, 5, 11]
})

# 生成 rank 列:按 (group, subgroup) 的 value 总和降序排名
rank_series = df.groupby(['group', 'subgroup'])['value'].sum().rank(ascending=False)
rank_df = rank_series.rename('rank').reset_index()

out = df.merge(rank_df, on=['group', 'subgroup'])
print(out)

输出结果中,rank 列为浮点数(如 3.0),这是因为 rank() 默认返回 float64 类型。若需整数排名(例如处理无并列场景),可在合并后添加 .astype(int),但需注意:若存在并列(相同总和),rank(method='average') 会生成非整数(如 2.5),此时强制转 int 会截断,建议改用 method='min' 或 method='dense' 并配合 astype(int):

# 更鲁棒的整数排名(并列时取最小秩)
rank_series = df.groupby(['group', 'subgroup'])['value'].sum().rank(
    method='min', ascending=False
).astype(int)

此外,需注意:

  • merge() 默认为 inner join,但因 rank_df 由 df 分组生成,所有 (group, subgroup) 组合均存在,故结果与原始行数一致;
  • 若原始数据含缺失的 (group, subgroup) 组合(极少见),可显式指定 how='left' 提高可读性;
  • 此方法时间复杂度为 O(n),远优于循环或 apply,适用于大规模数据。

综上,该方案简洁、高效、可读性强,是 Pandas 中实现“分组聚合后排名回填”的标准范式。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

320

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

232

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

451

25

Kratos框架Protobuf接口定义与代码生成合集
Kratos框架Protobuf接口定义与代码生成合集

本专题讲解Kratos框架接口定义体系,涵盖proto编写规范、proto add/client/server生成命令、http注解路由、validate校验、OpenAPI文档生成、跨服务proto复用与兼容性设计。

2026.10.10

0

15

C++虚函数怎么定义和调用
C++虚函数怎么定义和调用

C++虚函数是实现运行时多态的重要机制。本专题从virtual关键字的基本用法入手,介绍基类与派生类之间的函数重写、基类指针调用派生类方法,以及动态绑定的执行过程,帮助初学者掌握虚函数的核心语法。

2026.10.10

0

26

C++类与对象的封装方法教程
C++类与对象的封装方法教程

C++封装是面向对象编程的核心特性之一,通过类将数据与操作数据的函数组织在一起,并利用访问权限控制外部访问。本专题介绍类的定义、成员变量、成员函数以及public、private和protected的使用方法,帮助初学者掌握封装的基本原理。

2026.10.10

0

32

C++构造函数定义与调用方法
C++构造函数定义与调用方法

C++构造函数用于初始化类对象,是面向对象编程的重要基础。本专题从构造函数的定义、声明和调用入手,介绍默认构造函数、带参数构造函数、拷贝构造函数及成员初始化列表,帮助初学者掌握对象创建与初始化的基本方法。

2026.10.10

0

16

Kratos框架零基础入门教程
Kratos框架零基础入门教程

本专题整理Kratos框架入门内容,涵盖Go环境准备、kratos CLI安装升级、new命令创建项目、目录结构分层说明、服务启动与双协议端口、依赖下载报错排查,帮助开发者快速跑通第一个Kratos框架微服务应用。

2026.10.10

0

15

C++条件判断语句怎么写
C++条件判断语句怎么写

C++条件判断是控制程序执行流程的重要基础。本专题介绍if、if-else、else if和switch等常见分支语句,结合条件表达式、比较运算符与代码示例,帮助初学者掌握不同场景下的判断逻辑。

2026.10.10

0

13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习