SQL如何优化大型企业的报表SQL查询_聚合函数性能调优

大磊姑娘_5650

大磊姑娘_5650

2026-03-20

591人浏览

原创

count(*)比count(字段)快因只统计行数、可走索引或元数据,而后者需判null并读取列内容;但字段允许null且业务需排除空值时不可替换,否则结果错误。

sql如何优化大型企业的报表sql查询_聚合函数性能调优

为什么 COUNT(*) 比 COUNT(字段) 快,但有时又不能换?

因为 COUNT(*) 只统计行数,优化器可直接走索引或元数据;而 COUNT(字段) 会跳过 NULL 值,必须读取实际列内容。在宽表、大分区表上,后者可能多扫几倍 I/O。

  • 如果字段允许 NULL 且业务逻辑真需要排除空值,别硬套 COUNT(*) —— 结果错比慢更严重
  • 常见误用:用 COUNT(id) 替代 COUNT(*),以为主键非空就安全;但若 id 是 INT 类型且含 0(非 NULL),COUNT(id) 仍会统计它,和业务语义可能不一致
  • 验证方法:执行 EXPLAIN FORMAT=JSON 看 rows_examined 和是否出现 Using index for count

GROUP BY 里加了 ORDER BY 却没生效?检查隐式排序失效场景

MySQL 8.0+ 默认关闭隐式排序,PostgreSQL 从不保证 GROUP BY 输出顺序;即使旧版 MySQL 曾“看起来有序”,也不该依赖——这是典型伪稳定。

  • 显式写 ORDER BY:哪怕和 GROUP BY 字段相同,也必须重复写一遍,例如 GROUP BY dept_id ORDER BY dept_id
  • 报表导出时顺序错乱,常因中间层(如 BI 工具缓存)或连接池复用导致执行计划变化,不是 SQL 写错了,而是没加 ORDER BY
  • 如果只想要最新一条记录的聚合(比如每个部门最新一笔销售额),别用 GROUP BY + ORDER BY + LIMIT,改用窗口函数:ROW_NUMBER() OVER (PARTITION BY dept_id ORDER BY create_time DESC)

WHERE 条件里用函数导致索引失效,但有些情况能绕过去

像 WHERE DATE(create_time) = '2024-01-01' 会让 create_time 索引完全失效;但不是所有函数都不可优化。

  • 优先改写为范围查询:WHERE create_time >= '2024-01-01' AND create_time
  • YEAR()、MONTH() 这类确定性函数,在 MySQL 5.7+ 支持函数索引(需建 INDEX idx_year ON t1 ((YEAR(create_time)))),但注意 PostgreSQL 不支持函数索引字段直接用于 = 查询,得配合表达式索引+重写条件
  • 避免在大表 WHERE 中用 LIKE '%xxx' 或 IN (子查询) —— 前者无法走 B-tree 索引,后者可能触发嵌套循环,查千万级数据时秒变分钟级

聚合前先 FILTER 还是聚合后 HAVING?性能差十倍不止

HAVING 是对已聚合结果再过滤,意味着所有分组都得算完;而 WHERE 或 FILTER(PostgreSQL)是在聚合前筛掉无关行,I/O 和 CPU 都省得多。

  • 想查“订单金额超 10 万的客户数”,别写 HAVING SUM(amount) > 100000,先用 WHERE amount > 0(或其他高选择率条件)缩小扫描集
  • PostgreSQL 支持 COUNT(*) FILTER (WHERE status = 'paid'),比先 GROUP BY 再 HAVING 快得多,且语义清晰
  • MySQL 没原生 FILTER,可用 SUM(IF(status='paid', 1, 0)) 替代,但注意 IF 在 WHERE 里不生效,必须放在聚合函数内

最常被忽略的是统计口径和执行计划的耦合:同一句 SQL 在不同数据分布下,优化器可能选错索引或临时表策略,尤其当分区表里某几个分区数据量突增时。上线前一定要用真实数据量级压测,而不是只看开发环境 EXPLAIN 的预估行数。

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
大数据分析工具有哪四个
大数据分析工具有哪四个

大数据分析的四个工具分别是rapidminer、Hpcc、Hadoop和Pentaho bi。大数据分析用于从各种来源生成的原始数据中提取有价值的数据。这些数据帮助我们获得有意义的见解、隐藏的模式、未知的相关性、市场趋势等等,具体取决于行业。大数据分析的主要动机是提供有价值的见解,以便为未来做出更好的决策。php中文网为大家带来了大数据分析的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

4396

5

Java 大数据处理基础(Hadoop 方向)
Java 大数据处理基础(Hadoop 方向)

本专题聚焦 Java 在大数据离线处理场景中的核心应用,系统讲解 Hadoop 生态的基本原理、HDFS 文件系统操作、MapReduce 编程模型、作业优化策略以及常见数据处理流程。通过实际示例(如日志分析、批处理任务),帮助学习者掌握使用 Java 构建高效大数据处理程序的完整方法。

2025.12.08

1229

12

大数据专业学习教程
大数据专业学习教程

本专题整合了大数据专业学习相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.05

223

5

python处理大数据合集
python处理大数据合集

本专题整合了python处理大数据相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.05

446

22

数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

2023.10.12

3923

8

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2023.10.27

831

4

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

2024.02.23

1029

5

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

5761

10

sql procedure语法错误解决方法
sql procedure语法错误解决方法

sql procedure语法错误解决办法:1、仔细检查错误消息;2、检查语法规则;3、检查括号和引号;4、检查变量和参数;5、检查关键字和函数;6、逐步调试;7、参考文档和示例。想了解更多语法错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

2703

4

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习