percent_rank返回0到1间的相对排名,首行为0.0、末行为1.0,判断“前5%”应写percent_rank() >= 0.95;相同分数得相同值,空值默认排最前,需desc+nulls last调整;不支持跨分区归一化,大数据量注意全表排序开销。

PERCENT_RANK 返回的是相对排名位置(0 到 1 之间),不是“前 X%”的含义,直接用它不能得出“全站前 5%”这类分类结果——得配合 WHERE 或窗口过滤逻辑二次处理。
PERCENT_RANK 的计算逻辑和边界值表现
它按升序排列后,对第 n 行返回 (n-1) / (total_rows - 1)。注意:首行永远是 0.0,末行永远是 1.0(哪怕只有一行,PERCENT_RANK() 也会返回 0.0)。
常见误解是以为 PERCENT_RANK = 0.95 就代表“前 5%”,其实它只表示“比 95% 的人得分低”,真正得分高于它的只有 5% 的样本——所以判断“是否在前 5%”应写成:PERCENT_RANK() >= 0.95。
- 空值(
NULL)默认排在最前,若想让NULL排最后,需显式加ORDER BY score DESC NULLS LAST - 相同分数会得到相同
PERCENT_RANK值,但分母仍是总行数减一,不是去重后行数 - 不支持
PARTITION BY后再跨分区归一化;每个分区独立算分母
正确写法:全站排名 + 百分位阈值过滤
假设表叫 user_scores,字段为 user_id 和 score,要查出“全站得分在前 10% 的用户”:
SELECT user_id, score, pr
FROM (
SELECT user_id, score,
PERCENT_RANK() OVER (ORDER BY score DESC) AS pr
FROM user_scores
) t
WHERE pr >= 0.9;
这里必须用 ORDER BY score DESC,否则高分反而排后面,pr >= 0.9 就会选中低分用户。
- 如果业务要求“并列不占名额”,得改用
DENSE_RANK()配合行数换算,PERCENT_RANK本身不提供该语义 - MySQL 8.0+、PostgreSQL 13+、SQL Server 2012+ 支持;SQLite 和旧版 MySQL 不支持
- 大数据量时,
OVER()无PARTITION BY会触发全表排序,注意执行计划里的Sort节点开销
和 CUME_DIST、NTILE 的关键区别
PERCENT_RANK 是基于位置的线性归一化,而 CUME_DIST 统计“小于等于当前值的比例”,两者在有重复值时结果不同;NTILE(100) 是强行把数据等分 100 桶,每桶行数尽量一致,但无法保证第 95 桶以上就真是前 5%——尤其当数据分布倾斜时(比如 90% 用户分数集中在 1 分)。
- 查“严格前 5% 高分用户”:用
PERCENT_RANK() >= 0.95 - 查“累计覆盖 95% 用户的最低分数”:用
CUME_DIST()找第一个 ≥ 0.95 的行 - 查“按分数分 100 档,取最高一档”:用
NTILE(100) OVER (...) = 1,但档内可能混入大量低分
真正容易被忽略的是:PERCENT_RANK 对空值和重复值的处理方式会直接影响阈值判断结果,上线前务必用实际数据验证边界 case——比如全站只有 1 个用户、或所有用户分数都一样时,PERCENT_RANK 是否符合业务预期。











