percentile_cont(0.5) 是最接近统计学中位数定义的标准写法,需严格配合 within group (order by ...) 和 over (partition by ...) 使用,不可省略排序子句;mysql 8.0+ 需手写 row_number()+count() 逻辑;percentile_disc(0.5) 返回实际值但偏保守,近似函数精度不可控。

PERCENTILE_CONT(0.5) 是最接近“标准解法”的写法
PostgreSQL、SQL Server(2012+)、Oracle、BigQuery 都支持 PERCENTILE_CONT(0.5),它基于线性插值,语义上最符合统计学中位数定义。但必须注意:它不是聚合函数,不能直接跟在 GROUP BY 后面;也不能省略 WITHIN GROUP (ORDER BY ...)——漏掉就会报错 Window function requires an ORDER BY clause。
典型正确结构是:PERCENTILE_CONT(0.5) WITHIN GROUP (ORDER BY amount) OVER (PARTITION BY user_level)。这个表达式会为每一行返回其所在分组的中位数值,所以外层通常要加 DISTINCT 或用子查询去重,否则每组所有行都重复输出同一个值。
常见误用:
- 写成
SELECT user_level, PERCENTILE_CONT(0.5) FROM t GROUP BY user_level→ 报错,缺少WITHIN GROUP和OVER - 写成
PERCENTILE_CONT(0.5) OVER (PARTITION BY user_level)→ 报错,漏了WITHIN GROUP (ORDER BY ...) - 排序列含大量
NULL且未指定NULLS LAST→ 不同数据库对NULL排序策略不同,中位数可能漂移
MySQL 8.0+ 必须手写 ROW_NUMBER() + COUNT() 逻辑
MySQL 原生不支持 PERCENTILE_CONT,哪怕 8.0+ 版本也一样。你得靠窗口函数组合手动定位中间位置。核心是两步:对每组按值排序编号,再根据总行数 cnt 判断取哪一行或哪两行。
关键点:
-
ROW_NUMBER() OVER (PARTITION BY group_col ORDER BY value)给每组内行连续编号 -
COUNT(*) OVER (PARTITION BY group_col)算出每组总行数 - 中位位置统一用
rn IN (FLOOR((cnt + 1)/2.0), CEIL((cnt + 1)/2.0))覆盖奇偶两种情况 - 最后用
AVG(value)聚合这两行(若只有一行,AVG也不影响结果)
注意:MySQL 的 AVG(INT) 会自动转为 DECIMAL,没问题;但 SQL Server 中 AVG(INT) 仍返回 INT,必须显式 CAST(val AS FLOAT),否则小数被截断。
别硬套“每行都带中位数”的窗口需求
多数真实场景只要每组一个中位数值(比如报表汇总、BI 取数),根本不需要让每行都重复输出。强行用 OVER (PARTITION BY ...) 让中位数“广播”到每行,除了增加计算开销,还容易误导后续逻辑——比如误以为这个值会随某行变化而动态更新。
更高效的做法是先算中位数,再关联原表:
- 用子查询或 CTE 先按组算出中位数(
GROUP BY+PERCENTILE_CONT或手写逻辑) - 再用
JOIN或LATERAL(PostgreSQL)把中位数字段补回原表 - 这样避免重复计算,也更易加索引优化(如联合索引
(group_col, value))
性能隐患很实在:没索引支撑 PARTITION BY group_col ORDER BY value 时,大表排序开销极高,尤其千万级数据。
PERCENTILE_DISC(0.5) 和近似函数不是万能替代
PERCENTILE_DISC(0.5) 返回实际存在的某个值(不插值),对偶数个样本只取下中位数(如 [100,200,300,400] 返回 200),结果偏保守,和统计习惯不符。它适合“必须返回原始数据中某一行”的强约束场景,但一般不用作默认选择。
像 PERCENTILE_APPROX()(某些大数据引擎提供)是近似算法,快但不准,误差不可控,不适合财务、审计等对精度敏感的业务。而且它通常不支持标准 SQL 引擎,跨平台迁移成本高。
真正容易被忽略的点是空值和重复值处理:ROW_NUMBER() 不去重,RANK() 会跳号——选错编号函数,中间位置就偏了;PERCENTILE_CONT 默认忽略 NULL,但如果你的业务要求把 NULL 当作 0 参与排序,就得提前 COALESCE(value, 0) 处理。










