group by本身不清洗数据,需配合trim()、coalesce()、regexp_replace()预处理空格/null/不可见字符;用group_concat(distinct...separator...)合并去重;按业务时间字段(非id)取最新记录;必须创建新表交付干净结果。

GROUP BY 本身不清洗数据,它只分组;真正起作用的是配合它使用的函数和逻辑——尤其是 GROUP_CONCAT、MIN()/MAX()、以及对空格/NULL的预处理。直接写 GROUP BY 不加清理,脏数据会原样折叠进结果里。
GROUP BY 前必须先 trim 和 coalesce
数据库里大量“看起来有值、实际全是空格”的字段,比如 name 或 product 字段存了 ' 苹果 ',GROUP BY 会把它和 '苹果' 当成两组——导致本该合并的记录被拆开。
- 用
TRIM()去掉首尾空格:GROUP BY TRIM(name) - 用
COALESCE()或IFNULL()把NULL转成统一占位符,避免NULL单独成组:GROUP BY COALESCE(TRIM(name), 'unknown') - 如果字段含不可见字符(如换行、制表符),单靠
TRIM()不够,得用REGEXP_REPLACE(col, '[[:space:]]+', ' ')先标准化空白
用 GROUP_CONCAT 合并重复用户的多条记录
这是最典型的“去重+整合”场景:同一用户有多条订单,要合并商品名、保留姓名、去重城市名。但 GROUP_CONCAT 默认用逗号拼接,且不自动去重、不限长度。
- 加
DISTINCT避免重复商品:GROUP_CONCAT(DISTINCT product) - 用
SEPARATOR指定连接符,比如竖线:GROUP_CONCAT(DISTINCT product SEPARATOR ' | ') - 注意长度限制:
GROUP_CONCAT默认最大 1024 字符,超长会被截断;临时调大用SET SESSION group_concat_max_len = 10000; - 别忘了对参与合并的字段也做
TRIM(),否则'苹果 '和' 苹果'会被当成两个不同值拼进去
按业务规则保留“最新一条”,而不是随便挑一条
很多人用 MIN(id) 或 MAX(id) 来选代表记录,但 id 不一定反映业务时间顺序——尤其当数据来自多个导入批次或有软删除时。
- 优先依赖真实业务时间字段,比如
created_at或update_time - 子查询中用
MAX(created_at)找每组最新时间,再关联回原表取整行:SELECT t1.* FROM orders t1 INNER JOIN (SELECT user_id, MAX(created_at) AS max_time FROM orders GROUP BY user_id) t2 ON t1.user_id = t2.user_id AND t1.created_at = t2.max_time - 如果时间字段也有脏数据(比如为
0000-00-00或NULL),必须先用WHERE created_at > '1970-01-01'过滤,否则MAX()会返回异常值
别跳过创建新表这步,原表不是你的试验田
直接在生产表上跑 GROUP BY 查询没问题,但一旦涉及 CREATE TABLE AS SELECT 或后续更新,就必须建新表。原因很实在:
- 原始表可能被其他任务实时写入,边查边建表容易锁表或读到中间状态
- 清洗逻辑出错(比如漏了
TRIM())导致结果错,改起来比删掉重跑新表成本高得多 - 业务方要验证结果时,需要稳定快照;而反复执行同一语句,若源数据在变,每次结果都可能不同
所以这句一定要写:CREATE TABLE cleaned_orders AS SELECT ...,而不是只在客户端看一眼结果就完事。真正的清洗完成,是以新表可交付为准——那才是你敢发给下游的干净数据。










