排查网络抖动需先用ping、mtr、ss验证现象,再用tcpdump抓包分析时间戳跳跃、重复ack、零窗口探测和sack异常,并结合tcpretrans、ethtool、/proc/net/snmp交叉验证。

排查网络抖动,核心是观察延迟波动和异常重传,而tcpdump能帮你捕获真实路径上的时间戳、RTT变化、重复ACK、SACK块、乱序包等关键信号。它不直接测“抖动值”,但提供所有原始依据——抖动本质是数据包到达间隔的不稳定,必须靠逐包时间线还原。
抓包前先确认抖动现象是否真实存在
别一上来就抓包。先用基础命令快速验证:
- ping -c 20 目标IP:看 min/avg/max/mdev,mdev(平均偏差)超过10ms就值得怀疑;max明显高于avg说明有尖峰延迟
- mtr --report 目标IP:定位抖动发生在哪一跳,如果某中间节点mdev突增,问题大概率在上游网络
- ss -i dst 目标IP:端口:查看当前连接的rtt和rttvar(RTT方差),rttvar持续升高是内核已感知到抖动的明确信号
针对性抓包:聚焦TCP交互与时间细节
抖动影响最直接的是TCP行为,所以过滤要精准,时间精度要高:
Linux 性能分析与调优专家,覆盖 CPU、内存、磁盘 I/O、网络、内核参数、编译优化、容器/K8s。适用场景:系统卡顿/高负载、内存不足/OOM/Swap 高、CPU 异常/iowait 高。
-
带毫秒级时间戳 + 完整包 + 不解析:
tcpdump -i eth0 -nn -tttt -s0 -w jitter.pcap 'tcp and host 192.168.1.100 and port 8080' -
只抓SYN/SYN-ACK/ACK建立阶段(排查握手延迟):
tcpdump -i eth0 -nn -tttt 'tcp[tcpflags] & (tcp-syn|tcp-ack) != 0 and host 192.168.1.100' -
专门抓重传和重复ACK(抖动常引发):
tcpdump -i eth0 -nn -tttt 'tcp[tcpflags] & tcp-ack != 0 and (tcp[12:1] & 0xf0) > 0x50 or ip[2:2] > 1500'(后半段粗略匹配大包或重传特征,实际建议用Wireshark后分析)
用tcpdump输出快速识别抖动线索
边抓边看时,重点关注这几类模式:
- 时间戳跳跃:同一连接中,连续ACK之间时间差忽大忽小(如0.002s → 0.124s → 0.003s),说明链路延迟不稳
- 重复ACK爆发:客户端连续发出多个相同seq的ACK(如ack 12345重复出现3次以上),通常因丢包或严重乱序,背后往往是抖动导致接收窗口错乱
- 零窗口探测(ZeroWindowProbe)频繁出现:服务端反复发大小为1的包试探接收方窗口,说明对方应用处理慢或缓冲区满——这也可能是抖动引发的连锁反应
- 选择性确认(SACK)块不连续或缺失:正常SACK应覆盖连续字节范围,若出现大量空洞或SACK被忽略,常伴随高抖动环境下的乱序加剧
结合其他工具交叉验证
tcpdump是证据源,不是诊断终点:
- 抓包同时运行tcpretrans -l(来自iproute2),实时看内核重传队列长度,若其数值与tcpdump中重传包数量强相关,说明抖动已触发协议层响应
- 用ethtool -S eth0 | grep -E "(rx_.*drop|tx_.*drop|over)"排除网卡级丢包——抖动有时是丢包的表象,根源可能是rx_over_errors飙升(Ring Buffer溢出)
- 检查/proc/net/snmp中TCP的EstabResets和OutRsts是否异常增长,抖动严重时连接可能被主动重置










