vmstat 中 si(swap-in)和 so(swap-out)两列直接暴露 swap 抖动,持续非零或周期性尖峰即表明频繁换入换出;swpd 仅反映静态 swap 使用量,不能指示抖动。

vmstat 输出里哪几列暴露 Swap 抖动
Swap 抖动本质是内核频繁在物理内存和交换分区之间搬数据,vmstat 最直接的信号就藏在 si(swap-in,每秒从磁盘读入内存的 KB 数)和 so(swap-out,每秒写入磁盘的 KB 数)这两列。只要它们持续非零(比如 >100 KB/s),尤其出现周期性尖峰,基本就是抖动在发生。
注意:swpd 列只显示当前已使用的 swap 总量,它高不等于在抖——可能只是静态驻留;真正危险的是 si/so 的活跃搬运。
- 观察频率建议用
vmstat 1 10(每秒刷新,共 10 次),避免用默认 5 秒间隔漏掉瞬时抖动 - 如果
si和so同时显著上升,说明进程反复换入换出,比单向搬运更糟 -
bi/bo(块设备 I/O)若同步飙升,可佐证 swap 操作正在抢占磁盘带宽
为什么 free -h 看内存充足却还在 swap
Linux 内存管理不以“剩余”为唯一依据,而看页面回收成本。即使 free 显示还有 GB 空闲,只要内核判定某些内存页“冷”(长期未访问)、且 swap 分区响应快(比如 SSD 上的 swap),它就会主动把它们换出腾出缓存空间——这叫“预防性 swap”,不是故障,但会掩盖真实压力点。
- 检查
/proc/sys/vm/swappiness:值越高(默认 60),越倾向 swap;设为 1–10 可大幅抑制非必要换出 - 确认 swap 分区是否在 SSD 上:HDD 上的 swap 抖动会导致
si/so值虽小,但延迟极高,wa(iowait)列会明显升高 - 运行
cat /proc/meminfo | grep -E "Swap|Active|Inactive",对比Inactive(anon)和SwapTotal,若前者接近后者,说明大量匿名页被标记为可换出
如何定位哪个进程在触发 swap 搬运
vmstat 本身不提供进程级信息,必须配合其他工具交叉验证。抖动发生时,top 或 htop 的 SWAP 列(需开启)只能看静态占用;真要抓搬运瞬间,得盯 /proc/[pid]/status 里的 MMUPageSize 和 MMUPageSize,但更实用的是用 smem 或 ps 结合 RSS/VSS 差异反推。
- 用
ps aux --sort=-%mem | head -20找 RSS 高的进程,再查其cat /proc/[pid]/status | grep VmSwap,值大且波动说明它正被频繁换入换出 -
smem -s swap -r | head -10直接按实际 swap 使用量排序(需提前安装smem) - 警惕 Java 进程:JVM 堆外内存(如 DirectByteBuffer)不计入 RSS,但会进 swap,此时
so升高而 top 里看不到对应进程内存异常
swap 抖动下 vmstat 的采样陷阱
vmstat 是轮询式采样,抖动若发生在两次采样中间,会被平滑掉。例如每秒一次采样,而某进程每 300ms 触发一次 2MB swap-out,vmstat 可能只报出平均 6.7 MB/s,掩盖了真实的脉冲特征。
- 改用
vmstat 0.1(100ms 间隔)可提升捕捉率,但别低于 0.1——内核统计本身有开销,太密反而失真 - 不要只信单次
vmstat,用vmstat 1 | tee vmstat.log录几分钟,再用awk '{print $10,$11}' vmstat.log | sort -n看si/so的分布极值 - 若
vmstat显示si/so低但系统卡顿,可能是 swap 分区碎片化或元数据锁争用,这时要查dmesg | grep -i "swap"是否有swapfile: page allocation failure类错误
真正难处理的不是 swap 抖动本身,而是它常和内存泄漏、cgroup 内存限制、透明大页(THP)折叠失败这些底层机制缠在一起——vmstat 只给你一个窗口,别把它当诊断终点。











