为什么在大型SQL查询中使用窗口聚合函数比使用自连接子查询性能更好?

秋丽同学_1086

秋丽同学_1086

2026-06-14

393人浏览

原创

窗口函数性能优于自连接,因其仅需一次全表扫描、一次排序和一次临时表构建,而自连接会为外层每行重复触发排序与临时表操作,导致o(n²)复杂度;实测1000万行查最新订单,窗口函数耗时3.8秒,相关子查询达12.5秒。

为什么在大型sql查询中使用窗口聚合函数比使用自连接子查询性能更好?

窗口函数只扫一次表,自连接可能扫 N 次

核心区别在执行计划里:Using filesortUsing temporary 在窗口函数中各出现一次;而自连接中,这两个提示会随外层行数重复触发。比如外层 10 万行,内层就可能执行 10 万次排序和临时表构建。

常见错误现象:

  • EXPLAIN 显示 Type: ALLRows 列数值爆炸式增长
  • 查询耗时随数据量非线性暴涨,10 万行就开始卡顿
  • 执行计划里反复出现 DEPENDENT SUBQUERY

实操建议:

agent-browser
agent-browser

agent-browser是一款AI智能体工具,Vercel Labs 开源的浏览器自动化工具。

下载
  • ROW_NUMBER() OVER (PARTITION BY customer_id ORDER BY order_time DESC) 替代 NOT EXISTSLEFT JOIN 查最新订单
  • 确保 PARTITION BYORDER BY 字段有复合索引,例如 (customer_id, order_time DESC)
  • 时间字段重复时,ORDER BY order_time DESC, id DESC 补二级排序,避免结果不可复现

LAG/LEAD 天然保序,自连接依赖物理连续性

有人写 JOIN t1 ON t2.id = t1.id + 1 做环比,但生产环境 ID 绝对不连续——删过数据、批量插入、分布式主键都会让这个假设崩掉。

实操建议:

  • 改用 LAG(amount) OVER (PARTITION BY user_id ORDER BY event_time),它只认逻辑顺序,不依赖存储顺序
  • LAG(value, 1, 0) 第三个参数设默认值,避免 NULL 污染后续计算(比如做减法得 NULL
  • 如果 event_time 有重复,必须加二级排序字段(如 id),否则 MySQL 8.0 每次返回“前一行”可能不同
  • LEAD() 同理,但方向相反;两者都强制要求 ORDER BY,否则报错 ERROR 3589 (HY000): Window '<unnamed>' requires an ORDER BY clause</unnamed>

SUM() OVER 走累积算法,子查询每行触发独立扫描

传统写法 (SELECT SUM(amount) FROM orders o2 WHERE o2.date 是典型 O(N²) 模式:N 行数据,就要执行 N 次子查询扫描。

实操建议:

  • SUM(amount) OVER (ORDER BY date ROWS UNBOUNDED PRECEDING),MySQL 内部用单趟累积算法完成
  • 必须显式写 ROWS,别省略——RANGE 在时间字段上会把相同值的多行全纳入,导致“同一天多笔订单”被重复累加
  • 日期字段含 NULL 时,MySQL 默认把 NULL 排最前,可能让第一行累计值异常;建议提前 WHERE date IS NOT NULL 或用 COALESCE(date, '1970-01-01')

窗口函数不能直接 WHERE 过滤,但嵌套开销几乎为零

你没法在 WHERE 里写 RANK() OVER () > 10,MySQL 会报语法错误。这不是缺陷,而是 SQL 执行顺序决定的:WHERESELECT 阶段之前,而窗口函数属于 SELECT 计算环节。

实操建议:

  • 正确做法是套一层子查询或 CTE:
    SELECT * FROM (
      SELECT *, ROW_NUMBER() OVER (PARTITION BY dept ORDER BY salary DESC) AS rn
      FROM employees
    ) AS t1 WHERE rn 
  • 这个额外嵌套几乎不增加开销——窗口计算本身已产出全部结果,过滤只是最后切片
  • 而自连接若想实现“每部门前 3 高薪”,往往得先聚合再关联,中间结果集更大、内存占用更高

真正容易被忽略的是:窗口函数快的前提是 PARTITION BYORDER BY 字段有合适索引。没索引时,MySQL 仍要回表排序,Using filesort 时间会暴涨——性能优势瞬间归零。

相关文章

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

相关标签:

聚合函数

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
大数据分析工具有哪四个
大数据分析工具有哪四个

大数据分析的四个工具分别是rapidminer、Hpcc、Hadoop和Pentaho bi。大数据分析用于从各种来源生成的原始数据中提取有价值的数据。这些数据帮助我们获得有意义的见解、隐藏的模式、未知的相关性、市场趋势等等,具体取决于行业。大数据分析的主要动机是提供有价值的见解,以便为未来做出更好的决策。php中文网为大家带来了大数据分析的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

4056

5

Java 大数据处理基础(Hadoop 方向)
Java 大数据处理基础(Hadoop 方向)

本专题聚焦 Java 在大数据离线处理场景中的核心应用,系统讲解 Hadoop 生态的基本原理、HDFS 文件系统操作、MapReduce 编程模型、作业优化策略以及常见数据处理流程。通过实际示例(如日志分析、批处理任务),帮助学习者掌握使用 Java 构建高效大数据处理程序的完整方法。

2025.12.08

1209

12

大数据专业学习教程
大数据专业学习教程

本专题整合了大数据专业学习相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.05

203

5

python处理大数据合集
python处理大数据合集

本专题整合了python处理大数据相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.05

426

22

数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

2023.10.12

3743

8

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2023.10.27

791

4

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

2024.02.23

969

5

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

5501

10

sql procedure语法错误解决方法
sql procedure语法错误解决方法

sql procedure语法错误解决办法:1、仔细检查错误消息;2、检查语法规则;3、检查括号和引号;4、检查变量和参数;5、检查关键字和函数;6、逐步调试;7、参考文档和示例。想了解更多语法错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

2503

4

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.1万人学习