cube生成所有维度组合的完整幂集,需配合group by和聚合函数使用,缺一不可;null需用grouping()区分语义汇总与原始空值;高基数列慎用,推荐grouping sets替代。

CUBE 生成的是所有维度组合的完整幂集,不是简单小计,别误当 ROLLUP 用。
WITH CUBE 必须配合 GROUP BY 和聚合函数一起写
单独写 GROUP BY col1, col2 WITH CUBE 会报错,因为 SQL Server 要求 SELECT 列中:所有非聚合列必须出现在 GROUP BY 子句里,且必须包含至少一个聚合表达式(如 SUM()、AVG())。
- 错误写法:
SELECT 项目, 颜色 FROM 存货表 GROUP BY 项目, 颜色 WITH CUBE→ 缺少聚合函数,报错 - 正确写法:
SELECT 项目, 颜色, SUM(质量) AS 总质量 FROM 存货表 GROUP BY 项目, 颜色 WITH CUBE - 如果只想看汇总值(比如全表总和),仍需保留维度列占位,SQL Server 不允许
SELECT SUM(质量) FROM ... WITH CUBE
NULL 值来自 CUBE 还是源数据?用 GROUPING() 函数区分
结果里出现的 NULL 有两种来源:真实数据里的空值,或 CUBE 自动生成的“该维度全部”的占位符。不加判断直接 IS NULL 会混淆两者。
-
GROUPING(项目) = 1表示这行的项目是 CUBE 生成的汇总行(即“所有项目”),此时项目列值为NULL -
GROUPING(项目) = 0表示项目的NULL来自原始数据 - 常用写法:
CASE WHEN GROUPING(项目) = 1 THEN '总计' ELSE ISNULL(项目, '未知') END
CUBE 的组合数量爆炸,慎用于高基数列
如果有 n 个 GROUP BY 列,CUBE 会生成 2ⁿ 种分组组合。3 列 → 8 组;5 列 → 32 组;8 列 → 256 组。实际执行时不仅慢,还可能因内存不足失败。
- 例如:
GROUP BY 班级, 性别, 年级, 学号, 课程名 WITH CUBE——学号和课程名基数极高,基本不可行 - 替代思路:优先用
GROUPING SETS明确列出需要的组合,比如只想要(班级+性别)、(班级)、(性别)、()四种,就写GROUP BY GROUPING SETS ((班级,性别), (班级), (性别), ()) - 执行计划里能看到多个 Hash Match Aggregate 阶段,这是 CUBE 内部展开各子分组的表现
真正难处理的不是语法,而是理解哪些 NULL 是语义上的“全部”,哪些是脏数据;还有在业务需求明确前,别急着把 6 个字段全塞进 CUBE —— 那不是分析,是自找麻烦。











