string_agg本身不支持去重,需在聚合前用distinct或array_agg(distinct)预处理;错误写法会丢失分组上下文,正确做法须保留分组字段并确保去重在排序前完成。

STRING_AGG 本身不支持去重,必须提前处理数据
STRING_AGG 是一个纯聚合函数,只负责把输入值按顺序拼接,对重复值完全无感。它没有 DISTINCT 参数(不像 COUNT 或 AVG),所以直接写 STRING_AGG(DISTINCT col) 会报错:ERROR: syntax error at or near "DISTINCT"。想实现去重拼接,得在进入 STRING_AGG 之前就把重复项干掉。
用子查询 + DISTINCT 去重后再聚合
最通用、兼容性最好的做法:先用子查询或 CTE 对目标字段做 DISTINCT(必要时加 GROUP BY 分组键),再在外层用 STRING_AGG 拼接。注意子查询必须保留分组维度字段,否则会跨组混叠。
常见错误是漏掉分组字段导致聚合错乱:
- ❌ 错误写法(丢失分组上下文):
SELECT STRING_AGG(name, ',') FROM (SELECT DISTINCT name FROM users) t;
- ✅ 正确写法(保留 group_id):
SELECT group_id, STRING_AGG(name, ',') FROM (SELECT DISTINCT group_id, name FROM users) t GROUP BY group_id;
PostgreSQL 15+ 可用 FILTER + ARRAY 联合去重(更灵活但稍重)
如果要去重逻辑复杂(比如需按条件过滤后再去重),可借助 ARRAY 和 UNNEST 组合。PostgreSQL 15 开始支持 ARRAY_AGG 的 DISTINCT 修饰,配合 ARRAY_TO_STRING 替代 STRING_AGG:
SELECT group_id,
ARRAY_TO_STRING(ARRAY_AGG(DISTINCT name ORDER BY name), ',')
FROM users
GROUP BY group_id;
这个写法显式声明了 DISTINCT,且支持 ORDER BY 控制拼接顺序。但注意:ARRAY_AGG 内存开销略高于原生 STRING_AGG,大数据量时要留意。
ORDER BY 在去重后才生效,别指望它自动去重
有人误以为加 ORDER BY 能“顺带”去重,比如写 STRING_AGG(name, ',' ORDER BY name) —— 这只会排序,重复值照旧拼进去。去重和排序是两个独立步骤,顺序不能颠倒。
关键点:
-
DISTINCT必须作用于输入行集,不是作用于STRING_AGG的参数 - 若原始数据含空值(
NULL),DISTINCT会保留一个NULL,而STRING_AGG默认跳过NULL;如需保留,加COALESCE(name, 'N/A') - MySQL / SQL Server 不叫
STRING_AGG,分别是GROUP_CONCAT和STRING_AGG(2017+),但去重逻辑一致:都得靠前置DISTINCT
真正容易被忽略的是子查询中是否无意引入了隐式重复——比如 JOIN 多表后没去重就直接聚合,结果比预期多出好几倍相同值。动手前先 SELECT DISTINCT ... GROUP BY 看一眼中间结果,比调半天拼接逻辑更省时间。










