case when 区间分类需确保结构正确、边界无误且有兜底逻辑,否则导致漏数、重叠或null;group by须重复写case表达式以满足sql列一致性要求;不等宽区间必须用case when,验证需结合distinct和边界手算。

直接用 CASE WHEN 做区间分类没问题,但必须写对结构、边界和兜底逻辑,否则结果会漏数、重叠或全是 NULL。
为什么GROUP BY里必须重复写CASE表达式?
因为 SQL 要求 GROUP BY 中的列必须和 SELECT 中的非聚合列严格一致。只在 SELECT 里写 CASE WHEN age ,却不在 <code>GROUP BY 中重复,MySQL 5.7+ 严格模式或 PostgreSQL 会直接报错:column "age" must appear in the GROUP BY clause。
- 不能偷懒用别名(如
GROUP BY age_group),多数数据库不支持同级引用 - 可用列序号(如
GROUP BY 1)替代,但可读性差,改SELECT顺序就失效 - 若区间逻辑复杂,建议先用 CTE 提前算出标签,再外层
GROUP BY
左闭右开 vs 左闭右闭:边界怎么写才不重不漏?
用 BETWEEN 18 AND 35 是左闭右闭,等价于 age >= 18 AND age ;而用 <code>age >= 18 AND age 是左闭右开。混用会导致 35 岁被分到两个组,或 36 岁“掉进缝隙”。
- 统一选一种风格,全程保持一致
- 推荐左闭右开(
[a, b)),尤其配合FLOOR(value / width)时天然匹配 - 注意
BETWEEN包含两端,和 <code> 手动写时务必核对临界值是否被覆盖
空值、负数、超大异常值怎么兜底?
漏写 ELSE 或没处理 NULL,会让这部分数据在分组结果中消失(变成 NULL 组),或者被错误归入某个正常区间。
- 显式加
WHEN age IS NULL THEN '未知',而不是靠ELSE模糊兜底 - 对业务无效值(如
age = -1、age > 150)单独判断,避免污染主区间统计 - 不要在
WHERE里提前WHERE age > 0过滤——这会让“异常”组不出现在结果里,而你可能需要知道它有多少条
FLOOR() 适合等宽区间,但负数会翻车
用 FLOOR(age / 10.0) 快速生成 0、1、2… 对应 [0,10)、[10,20)、[20,30)… 看似简洁,但 age = -5 会得 FLOOR(-0.5) = -1,直接跳到负组,和业务语义完全脱节。
- 仅适用于非负数,或已用
WHERE age >= 0预过滤(但注意这又绕回上一条的兜底问题) - 更稳的做法是偏移后计算:
FLOOR((age + 100) / 10.0)再映射回描述,但增加理解成本 - 一旦区间不等宽(如 0–17、18–24、25–44…),
FLOOR就不再适用,必须回归CASE WHEN
最常被忽略的是:CASE WHEN 的执行顺序和类型一致性。写完别急着跑,先用 SELECT DISTINCT 看一眼原始字段真实取值分布,再拿几条边界数据(比如 age = 0、17、18、999、NULL)手算一遍分支走向——很多线上问题,就卡在这几步验证没做。











