怎么在SQL存储过程中实现大数据的分页查询以减少IO消耗?

夜雪君_8684

夜雪君_8684

2026-09-13

169人浏览

原创

应采用键集分页替代offset-fetch:以主键或唯一递增字段为游标,配合复合索引(如ix_logs_created),避免函数排序和not in子查询,确保高效稳定。

怎么在sql存储过程中实现大数据的分页查询以减少io消耗?

用键集分页替代OFFSET-FETCH

OFFSET-FETCH在SQL Server中超过百万行后性能断崖式下跌,不是因为语法错,而是引擎必须扫描并跳过前面所有行——逻辑读暴涨,IO压力直接拉满。键集分页绕过这个问题:它不依赖“跳过N行”,而是记住上一批最后一条的id(或复合排序字段),下一次查WHERE id > @lastId ORDER BY id

实操要点:

  • 分页字段必须有索引,且最好是主键或唯一递增字段;复合排序场景下,建联合索引如IX_orders_status_created(顺序必须匹配ORDER BY status, created_at DESC, id DESC
  • 禁止在ORDER BY里用NEWID()GETDATE()或计算列,否则索引失效,触发强制Sort算子
  • 不要用TOP @batchSize NOT IN (SELECT ...),子查询在大数据量下变成全表扫描

跨表JOIN分页必须用动态SQL+显式索引对齐

多表JOIN后直接套OFFSET 1000 ROWS FETCH NEXT 20 ROWS ONLY,大概率出错或慢到超时。根本原因是JOIN结果中非驱动表字段可能为NULL,导致排序不稳定;SQL Server要求分页排序必须是确定性的,而NULL参与排序会破坏确定性。

安全做法是把ORDER BY严格绑定到主表(如orders.id)的高选择性字段,并用动态SQL拼接整个查询:

  • 表名/字段名一律用QUOTENAME()包裹,防注入,例如'FROM ' + QUOTENAME(@MainTable) + ' o LEFT JOIN ' + QUOTENAME(@UserTable) + ' u ON o.user_id = u.id'
  • WHERE条件分段组装,每段前后加空格,最后用REPLACE(@WhereClause, 'WHERE AND', 'WHERE')清理语法错误
  • 模糊搜索避免LIKE '%abc',改用全文索引或前导通配符可控的方案(如u.name LIKE @UserName + '%'

批处理更新要切片+限速,别碰大事务

在存储过程中批量更新百万行时,写UPDATE big_table SET status = 1 WHERE condition等于主动锁表、刷爆binlog、触发Lock wait timeout exceeded。这不是代码逻辑问题,而是事务粒度失控。

人工智能数字技术机器人全息大脑大数据分析矢量素材(EPS)
人工智能数字技术机器人全息大脑大数据分析矢量素材(EPS)

这是一款人工智能数字技术机器人全息大脑大数据分析矢量素材,格式为 EPS,含 JPG 预览图。

下载

正确切法:

  • WHERE id BETWEEN @startId AND @endId分片,别依赖LIMIT配合ORDER BY,否则边界数据可能漏或重复
  • 每次更新后加WAITFOR DELAY '00:00:00.1'(SQL Server)或DO SLEEP(0.1)(MySQL),缓解I/O和主从延迟
  • 检查innodb_buffer_pool_size(MySQL)或max server memory(SQL Server),内存不足时频繁刷脏页反而更慢
  • 如果执行中报锁超时,第一反应不是调优SQL,而是把批次从5000降到1000——这是最快速有效的止损点

索引碎片高时重建比重组织更有效

即使分页SQL写得再规范,如果底层索引碎片率长期高于30%,logical reads仍会飙升。这不是查询问题,是物理存储退化——页分裂导致B树不紧凑,范围扫描被迫读更多页。

判断和处理:

  • 查碎片率:SELECT avg_fragmentation_in_percent FROM sys.dm_db_index_physical_stats(DB_ID(), OBJECT_ID('orders'), NULL, NULL, 'DETAILED')
  • 碎片>30%必须ALTER INDEX IX_orders_id ON orders REBUILD,别用REORGANIZE——后者只整理页内,不合并页、不释放空间
  • 重建索引期间会阻塞写操作,建议在低峰期执行;线上系统可考虑在线重建(SQL Server Enterprise版支持WITH (ONLINE = ON)

最容易被忽略的是:键集分页依赖索引稳定性,而高碎片会让MAX(id)取值不准、游标偏移,这种问题不会报错,只会悄悄漏数据。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
大数据分析工具有哪四个
大数据分析工具有哪四个

大数据分析的四个工具分别是rapidminer、Hpcc、Hadoop和Pentaho bi。大数据分析用于从各种来源生成的原始数据中提取有价值的数据。这些数据帮助我们获得有意义的见解、隐藏的模式、未知的相关性、市场趋势等等,具体取决于行业。大数据分析的主要动机是提供有价值的见解,以便为未来做出更好的决策。php中文网为大家带来了大数据分析的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

4056

5

Java 大数据处理基础(Hadoop 方向)
Java 大数据处理基础(Hadoop 方向)

本专题聚焦 Java 在大数据离线处理场景中的核心应用,系统讲解 Hadoop 生态的基本原理、HDFS 文件系统操作、MapReduce 编程模型、作业优化策略以及常见数据处理流程。通过实际示例(如日志分析、批处理任务),帮助学习者掌握使用 Java 构建高效大数据处理程序的完整方法。

2025.12.08

1209

12

大数据专业学习教程
大数据专业学习教程

本专题整合了大数据专业学习相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.05

203

5

python处理大数据合集
python处理大数据合集

本专题整合了python处理大数据相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.05

426

22

数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

2023.10.12

3743

8

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2023.10.27

791

4

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

2024.02.23

969

5

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

5521

10

sql procedure语法错误解决方法
sql procedure语法错误解决方法

sql procedure语法错误解决办法:1、仔细检查错误消息;2、检查语法规则;3、检查括号和引号;4、检查变量和参数;5、检查关键字和函数;6、逐步调试;7、参考文档和示例。想了解更多语法错误的相关内容,可以阅读本专题下面的文章。

2024.03.06

2503

4

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PostgreSQL vs MySQL
PostgreSQL vs MySQL

共1课时 | 169人学习

大数据(MySQL)视频教程完整版
大数据(MySQL)视频教程完整版

共200课时 | 26.8万人学习

PHP会话控制/文件上传/分页技术
PHP会话控制/文件上传/分页技术

共22课时 | 2.8万人学习