group by + having 是唯一能直接筛选重复组的组合:必须先按目标字段分组,再用 having count() > 1 过滤,where 中禁止使用聚合函数;查单列或组合重复需完整列出 group by 字段;要获取所有重复行,须用 in 子查询或窗口函数 count() over(partition by ...)。

GROUP BY + HAVING 是唯一能直接筛选重复组的组合
WHERE 不能用 COUNT(*) > 1,因为聚合值在分组前不存在,数据库会报错 ERROR: aggregate functions are not allowed in WHERE。必须先 GROUP BY 字段,再用 HAVING 过滤分组结果。
常见写法:
- 查单列重复:比如找重复邮箱,写
GROUP BY email HAVING COUNT(*) > 1 - 查多列组合重复:如
(user_id, order_date)不该重复却重复了,就GROUP BY user_id, order_date HAVING COUNT(*) > 1 -
SELECT列中所有非聚合字段(如email)必须出现在GROUP BY子句里,否则语法错误
想看所有重复的原始行?别只靠 GROUP BY 输出摘要
GROUP BY 只返回每组一行汇总(如 email 和计数),但排查异常需要看到每条重复记录的完整字段。这时得绕开分组限制,用子查询或窗口函数。
推荐方案:
- 兼容性最广的写法(适用于 MySQL 5.7、PostgreSQL、SQL Server 等):
SELECT * FROM users WHERE email IN (SELECT email FROM users GROUP BY email HAVING COUNT(*) > 1) - 更高效、一次扫描的写法(MySQL 8.0+、PostgreSQL、SQL Server、Oracle、BigQuery 支持):
SELECT * FROM (SELECT *, COUNT(*) OVER (PARTITION BY email) AS cnt FROM users) t WHERE t.cnt > 1 - 注意:如果重复字段含
NULL,GROUP BY会把所有NULL归为一组——业务上若认为空值不算重复,需提前加WHERE email IS NOT NULL
多字段重复判断时,PARTITION BY 必须和业务定义一致
比如你认定“同一用户同一天订单重复”才算异常,那判定依据就是 user_id 和 order_date 组合。窗口函数里漏掉任一字段,标记就会出错。
正确写法示例:
- 标记所有重复订单行:
COUNT(*) OVER (PARTITION BY user_id, order_date) - 错误写法(只按
user_id分组):COUNT(*) OVER (PARTITION BY user_id)—— 会把不同日期的订单也标为重复 - 删除重复时若用
ROW_NUMBER(),同样要PARTITION BY user_id, order_date ORDER BY created_at DESC,否则保留逻辑错位
查出来之后下一步怎么做?别跳过验证环节
查出重复数据只是起点,后续操作容易踩坑:
- 删之前务必先
SELECT出来人工核对,尤其当表无主键或存在外键约束时 - 用子查询方式删(如
DELETE ... WHERE id IN (...))可能因数据量大导致锁表或超时;窗口函数方案虽好,但 PostgreSQL 需用ctid或 CTE,MySQL 8.0+ 要用DELETE FROM t USING cte语法 - 如果表里有大量
NULL值参与分组,且业务语义上它们不应被视作相同,就得拆成两步:先过滤IS NOT NULL,再分组;或单独统计IS NULL的数量做判断
真正麻烦的不是写不出语句,而是没想清楚“什么算重复”——字段组合、NULL 处理、时间字段排序优先级,这些细节一旦错,查出来的就不是异常,而是噪音。











