用rank()实现窗口分组排序需先groupby再调用rank(),而非相反;method参数控制并列处理;多列排序需预排序或apply自定义逻辑;rank返回名次,argsort返回索引;注意nan在groupby和rank中的不同行为。

用 rank() 实现窗口内分组排序
直接在 groupby() 后链式调用 rank(),就能实现 SQL 中 ROW_NUMBER() OVER (PARTITION BY ... ORDER BY ...) 的效果。关键不是单独用 rank(),而是让它作用在分组后的每一块数据上。
常见错误是先 rank() 再 groupby(),结果整个 DataFrame 被统一排序,完全失去“窗口”语义。
- 正确写法:
df.groupby('category')['score'].rank(method='min', ascending=False) -
method参数决定并列处理方式:'min'(默认,相同值取最小名次)、'dense'(跳过后续空位)、'average'(取平均名次) - 注意:返回的是
Series,若要赋回原df,需显式赋值,如df['rank'] = df.groupby(...).rank(...)
处理多列排序与复合窗口
SQL 中常写 ORDER BY col1 DESC, col2 ASC,Pandas 里不能直接传多列进 rank(),得先用 sort_values() 预排好序,再按顺序生成序号——但这样会丢失原始行顺序。更稳妥的做法是用 apply() + 自定义排序逻辑。
- 推荐方案:对每个分组,用
apply(lambda x: x.sort_values(['col1', 'col2'], ascending=[False, True]).reset_index(drop=True).index + 1)模拟ROW_NUMBER() - 若只需名次无需严格连续编号,仍可用
rank(),但得先构造一个组合排序键,例如df.assign(sort_key=df['col1'] * -1 + df['col2'] / 1e6).groupby('group_col')['sort_key'].rank(method='min') -
rank()本身不支持多列ascending参数,这是和 SQL 最明显的表达力差距
rank() 和 argsort() 的本质区别
rank() 返回的是“名次”,而 np.argsort() 或 Series.argsort() 返回的是“索引位置”。两者在无重复值时结果看起来相似,但语义和行为完全不同。
- 遇到重复值:
rank(method='min')给两个相同值都返回3.0(如果前面有2个更小值),而argsort()一定返回两个不同整数索引 - 性能上:
rank()是专为排序名次优化的,比手动sort_values().reset_index().index快且内存友好 - 类型安全:
rank()默认返回float64(因可能含小数,如method='average'),若后续要当整数用,得加.astype('int64'),但要注意 NaN 和并列情况是否允许强制转整
小心 groupby 后 rank 的缺失值传播
如果分组列或排序列含 NaN,groupby() 默认会丢弃这些行,导致结果长度变短;而 rank() 对自身输入中的 NaN 默认返回 NaN 名次——这两者叠加容易造成静默错位。
- 检查手段:
len(df) == len(df.groupby('g')['x'].rank())应为True,否则说明有分组被 drop 掉了 - 保留 NaN 分组:用
groupby('g', dropna=False) - 控制 NaN 在排序中的位置:用
na_option='top'或'bottom'传给rank(),否则默认'keep'(即名次也为 NaN)
实际用的时候,多数场景用第一种写法就足够了;真正卡住人的,往往是没意识到 rank() 不接受多列排序参数,以及 NaN 在 groupby 和 rank 两层中各自的行为不一致。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











