先确认磁盘是否真卡:iostat -xmd 1 观察2–3分钟,%util > 80% 且 await > 20ms 同时持续出现即可断定;await ≫ svctm 表示i/o队列积压,非磁盘本身慢。

看 iostat 的 %util 和 await 是不是真卡住了磁盘
别一看到 Seconds_Behind_Master 大或慢日志里有几条长 SQL 就开调优,先确认是不是磁盘真的扛不住了。跑 iostat -xmd 1 看 2–3 分钟,盯住两个值:%util > 80% 且 await > 20ms 同时持续出现,基本就能断定是磁盘响应拖慢了 SQL 执行。
注意几个坑:
-
await ≫ svctm(比如 await=50ms、svctm=2ms)说明 I/O 队列积压严重,不是磁盘本身慢,而是请求太多或队列深度不够 -
r/s或w/s突增,但 MySQL 慢日志里没几条慢 SQL?那大概率是后台刷脏页、写 redo、读 relay log 这类“非用户 SQL”在抢 IO - 云盘环境要额外检查
vm.swappiness,设成 0 或 1,否则 swap 活动会把 IO 放大效应翻倍
查 SHOW PROCESSLIST 里 SQL 线程是不是卡在 Updating/Writing to net
从库同步慢时,SHOW PROCESSLIST 中的 SQL 线程如果长期停留在 Updating 或 Writing to net(注意:不是 Locked 或 Sending data),就是典型磁盘写入跟不上重放节奏的信号。
配合验证:
- 用
SELECT @@relay_log, @@datadir;查路径,再df -h看挂载点是否一致——relay_log 和 innodb 数据共盘是隐蔽杀手,哪怕 NVMe 也会互相抢占 - 运行
SHOW ENGINE INNODB STATUS\G,重点看 LOG 段:Log flushed up to推进缓慢,或Last checkpoint at和Log sequence number差值极小,说明 redo 刷盘被堵住 -
SHOW GLOBAL STATUS LIKE 'Innodb_buffer_pool_hit_rate'低于 95%,热数据反复进出磁盘,IO 争抢加剧
开 log_slow_extra=ON 看慢日志里的真实 IO 消耗
默认慢日志不记录 I/O 细节,必须显式开启 log_slow_extra=ON(MySQL 8.0.26+),才能看到 InnoDB_IO_r_ops(实际读页数)、InnoDB_IO_r_bytes、InnoDB_pages_distinct 这些关键字段。
实操中重点关注:
- 一个
Query_time=0.8s但InnoDB_IO_r_ops=12000的查询,基本是全表扫描或索引失效;而Query_time=1.2s但InnoDB_IO_r_ops=3,问题更可能在锁等待或网络 -
InnoDB_pages_distinct远小于InnoDB_IO_r_ops(如 50 vs 5000),说明大量重复读同一页面,缓冲池太小 + 大范围扫描 - 用
mysqldumpslow -s ar -t 10 /var/lib/mysql/slow.log按平均读页数排序,快速揪出 “IO 最狠” 的 Top 10 查询
临时关掉 innodb_flush_log_at_trx_commit=1(仅限非核心从库)
这个参数默认为 1,但它是为主库强一致性设计的;从库只要重放不丢就行,主库 binlog 已落盘,没必要每笔事务都 fsync。设成 1 后,SQL 线程每执行一个事务就得等一次磁盘落盘,尤其主库发来大量短事务时,fsync 排队直接压垮吞吐。
实测改 SET GLOBAL innodb_flush_log_at_trx_commit = 0 后,Seconds_Behind_Master 常从 120s 降到 8s 以内。但必须配套:
-
SET GLOBAL sql_log_bin = 0(除非你用 GTID 做级联复制) - 只适用于报表、BI、搜索同步这类允许秒级延迟的场景,金融核心从库不能硬套
- 云环境还要确认 relay_log_space_limit 别设太小(比如 1G),否则内存吃紧时频繁轮转 + fsync 更卡
真正难的不是发现 %util 高,而是区分这高到底是用户 SQL 直接读写导致的,还是 InnoDB 后台线程(刷脏页、purge、log_writer)在偷偷吃带宽。很多 case 里,停掉 SQL 线程后 iostat 依然居高不下,这时候得去 SHOW ENGINE INNODB STATUS 里扒 LOG 和 FILE I/O 段,或者用 pt-ioprofile 抓实时调用栈——否则调参只是隔靴搔痒。











