postgresql 10+ 和 oracle 12cr2+ 支持 string_agg(distinct ...) 和 listagg(distinct ...),mysql 用 group_concat(distinct ...),trino/bigquery 需数组函数中转去重,复杂去重应前置到输入层。

直接用 STRING_AGG(DISTINCT ...),PostgreSQL 10+ 和 Oracle LISTAGG 都原生支持;MySQL 要用 GROUP_CONCAT(DISTINCT ...);Trino/BQ 则需绕过 DISTINCT 用数组函数。
PostgreSQL:优先用 STRING_AGG(DISTINCT ...),别写子查询
这是最简、最稳的写法,语法清晰,执行计划干净:
SELECT user_id, STRING_AGG(DISTINCT tag, ',' ORDER BY tag NULLS LAST) FROM user_tags GROUP BY user_id;
-
DISTINCT必须紧贴在表达式前,写成STRING_AGG(tag DISTINCT, ',')是错的,会报语法错误 - 不加
ORDER BY时结果顺序不确定——哪怕源表有索引或ORDER BY子句,聚合也不保序 -
NULL默认参与排序且排最前,业务上常要NULLS LAST或提前过滤:WHERE tag IS NOT NULL AND TRIM(tag) != '' - 空格敏感:
'VIP'和'VIP '被视为不同值,建议统一TRIM(tag)
MySQL:必须用 GROUP_CONCAT(DISTINCT ...),不能漏掉关键字
MySQL 5.7+ 和 8.0 均支持 DISTINCT 直接写在 GROUP_CONCAT 内部,无需子查询:
SELECT department_id, GROUP_CONCAT(DISTINCT employee_name ORDER BY employee_name SEPARATOR ';') FROM employees GROUP BY department_id;
-
DISTINCT是可选关键字,但一旦需要去重就必须显式写出,漏掉就全量拼接 - 分隔符默认是逗号,用
SEPARATOR指定更安全,避免依赖隐式行为 - 结果长度受
group_concat_max_len限制(默认 1024),超长会被截断且无提示,查不到数据时先检查这个变量 - 大小写默认敏感,
'Apple'和'apple'不去重,必要时套LOWER(employee_name)
Oracle / Trino / BigQuery:DISTINCT 不可用,得走数组中转
Oracle 的 LISTAGG 支持 DISTINCT(12cR2+),但 Trino 和 BigQuery 的 STRING_AGG 不支持,必须用数组函数组合:
Trino:
SELECT group_id, ARRAY_JOIN(ARRAY_DISTINCT(ARRAY_AGG(name)), ',') FROM t GROUP BY group_id;
BigQuery:
SELECT group_id, ARRAY_TO_STRING(ARRAY(SELECT DISTINCT x FROM UNNEST(arr) AS x), ',')
FROM (SELECT group_id, ARRAY_AGG(name) AS arr FROM t GROUP BY group_id);
- Trino 中
ARRAY_DISTINCT会丢弃NULL,若需保留,得先FILTER或改用ARRAY_AGG(DISTINCT ...)+ARRAY_JOIN - BigQuery 的
UNNEST展开后去重,中间结果可能翻倍,大数据量时注意 shuffle 压力 - 所有数组方案都要求字段类型一致,
INT和STRING混合会报错,提前CAST
去重逻辑复杂时,别硬套 DISTINCT,先清洗再聚合
当“去重”不是简单字段唯一,而是基于多列组合、优先级或业务规则(比如只留 source = 'system' 的 tag),DISTINCT 就失效了。
正确做法是把去重逻辑上推到输入层:
WITH deduped AS (
SELECT user_id, tag,
ROW_NUMBER() OVER (PARTITION BY user_id, tag ORDER BY CASE source WHEN 'system' THEN 1 ELSE 2 END) AS rn
FROM user_tags
)
SELECT user_id, STRING_AGG(tag, ',') FROM deduped WHERE rn = 1 GROUP BY user_id;
- 用
ROW_NUMBER()或DISTINCT ON(PG)做预过滤,比在聚合里套多层UNNEST+ARRAY+DISTINCT快得多,也易读 - 如果去重要跨表关联(如用户主表 + 标签表 + 权限表),先
JOIN再DISTINCT ON,别在聚合函数里JOIN -
STRING_AGG或GROUP_CONCAT的输出是字符串,后续无法再取第 2 个元素或算长度;真需要结构化结果,就用ARRAY_AGG返回数组,别急着转字符串











