为什么SQL查询中COUNT(DISTINCT)性能极差如何优化?

千萱小哥_9303

千萱小哥_9303

2026-10-02

236人浏览

原创

count(distinct) 性能瓶颈在于与分组、连接、过滤耦合在同一层,应下沉至子查询预聚合,配合分区裁剪和联合索引避免临时表与全表扫描。

为什么sql查询中count(distinct)性能极差如何优化?

因为 COUNT(DISTINCT) 在每个分组内都得独立做一次哈希或排序去重,数据量大、分组多时,CPU 和临时磁盘开销会指数级上涨——不是“慢一点”,而是可能从毫秒级跳到分钟级。

为什么 EXPLAIN 出现 Using temporary; Using filesort 就该警觉

这表示 MySQL 正在磁盘上建临时表来完成去重,已彻底脱离内存哈希路径。尤其当 GROUP BY 字段基数高(比如 10 万 channel)、DISTINCT 字段本身也高基数(如 user_id)时,每个分组都要跑一遍全量去重逻辑,IO 和 CPU 双爆。

  • 别信“加个索引就能快”——COUNT(DISTINCT) 很难直接走索引跳过排序,除非满足松散索引扫描条件(如 GROUP BY a 且索引是 (a, b),同时只查 MAX(b) 这类有序聚合)
  • WHERE 条件没下推到子查询里?分区字段(如 dt)漏写?那整个大表都会被扫一遍
  • MySQL 5.7+ 中,如果 SELECT 字段未被联合索引完全覆盖,优化器大概率放弃索引,强制回表 + 临时表

把 COUNT(DISTINCT) 沉到子查询里再 JOIN

核心思路:不让去重和分组耦合在一层,把高成本动作“下沉”,让外层只做轻量关联。

原始写法(危险):

SELECT b.name, COUNT(DISTINCT a.user_id)
FROM table_a a
JOIN table_b b ON a.dashboard_id = b.id
GROUP BY b.name;

优化后(推荐):

SELECT b.name, new_a.ct
FROM table_b b
JOIN (
  SELECT dashboard_id, COUNT(DISTINCT user_id) AS ct
  FROM table_a 
  WHERE dt = '2026-09'  -- 必须加!否则子查询仍扫全表
  GROUP BY dashboard_id
) new_a ON new_a.dashboard_id = b.id;
  • 子查询结果集极小(比如几百个 dashboard_id),JOIN 成本几乎可忽略
  • WHERE dt = ... 必须写在子查询内,才能触发分区裁剪
  • 若 table_a 有联合索引 (dashboard_id, user_id, dt),这个子查询甚至能避免排序

多个 COUNT(DISTINCT) 同时出现必须拆开算

写成 COUNT(DISTINCT user_id), COUNT(DISTINCT order_no) 看似简洁,但 Spark / Hive / MySQL 都会为每个启动独立去重通道,shuffle 数据翻倍,内存压力陡增。

正确做法是分别预聚合再 JOIN:

SELECT t1.channel, t1.user_cnt, t2.order_cnt
FROM (
  SELECT channel_code AS channel, COUNT(DISTINCT user_id) AS user_cnt
  FROM user_order 
  WHERE del_flag = '0' AND create_date BETWEEN '2026-01-01' AND '2026-09-30'
  GROUP BY channel_code
) t1
JOIN (
  SELECT channel_code AS channel, COUNT(DISTINCT order_no) AS order_cnt
  FROM user_order 
  WHERE del_flag = '0' AND create_date BETWEEN '2026-01-01' AND '2026-09-30'
  GROUP BY channel_code
) t2 ON t1.channel = t2.channel;
  • 两个子查询可并行执行,且各自结果集小、可控
  • WHERE 条件重复写不可怕,怕的是漏写导致全表扫描
  • 字段越多,越要警惕——三个 COUNT(DISTINCT) 就意味着三倍 shuffle 量

最易被忽略的一点:COUNT(DISTINCT) 的性能瓶颈从来不在“去重”本身,而在于它强迫数据库把去重动作和分组、连接、过滤这些操作绑死在同一执行层级。只要把它从主查询里拎出来,哪怕多写几行 SQL,性能拐点往往就出现在那一层子查询的边界上。

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

2023.10.12

3923

8

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2023.10.27

831

4

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

2024.02.23

1029

5

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

5761

10

sql procedure语法错误解决方法
sql procedure语法错误解决方法

sql procedure语法错误解决办法:1、仔细检查错误消息;2、检查语法规则;3、检查括号和引号;4、检查变量和参数;5、检查关键字和函数;6、逐步调试;7、参考文档和示例。想了解更多语法错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

2703

4

oracle数据库运行sql方法
oracle数据库运行sql方法

运行sql步骤包括:打开sql plus工具并连接到数据库。在提示符下输入sql语句。按enter键运行该语句。查看结果,错误消息或退出sql plus。想了解更多oracle数据库的相关内容,可以阅读本专题下面的文章。

2024.04.07

5740

11

sql中where的含义
sql中where的含义

sql中where子句用于从表中过滤数据,它基于指定条件选择特定的行。想了解更多where的相关内容,可以阅读本专题下面的文章。

2024.04.29

7581

6

sql中删除表的语句是什么
sql中删除表的语句是什么

sql中用于删除表的语句是drop table。语法为drop table table_name;该语句将永久删除指定表的表和数据。想了解更多sql的相关内容,可以阅读本专题下面的文章。

2024.04.29

1030

5

sql中删除一列的命令是什么
sql中删除一列的命令是什么

在sql中,使用alter table语句可以删除一列,语法为:alter table table_name drop column column_name。想了解更多sql的相关内容,可以阅读本专题下面的文章。

2024.04.29

912

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习