linux tcp指标深度采集关键在于分层精准:一、读取/proc/net/snmp与netstat原始计数器;二、用ss -i获取连接级状态与缓冲区快照;三、通过ebpf跟踪tcp_retransmit_skb等函数实现动态行为追踪;四、交叉验证指标定位根因。

Linux 系统中 TCP 指标的深度采集,关键不在“抓多少”,而在于“采得准、看得清、关联得上”。它需要分层覆盖内核协议栈行为、连接状态、缓冲区使用和网络路径表现,避免只看表面统计而漏掉根因。
一、从内核协议栈直接读取原始计数器
Linux 通过 /proc/net/snmp 和 /proc/net/netstat 暴露 TCP 协议栈各阶段的原子事件计数,这是最权威的一手指标源:
-
/proc/net/snmp:含标准 RFC MIB 统计(如 TcpCurrEstab、TcpRetransSegs、TcpOutSegs),适合监控重传率、连接建立成功率等宏观指标 -
/proc/net/netstat:补充扩展统计(如 TcpExtSyncookiesSent、TcpExtTW、TcpExtDelayedACKs),能定位 SYN cookie 启用情况、TIME_WAIT 堆积、延迟确认触发频次等深层问题 - 建议用
nstat -z | grep -E 'Tcp|TcpExt'整合两者,过滤零值项,聚焦活跃指标;配合定时轮询(如每5秒)生成时序数据,便于趋势比对
二、实时连接级状态与缓冲区快照
单靠全局计数器无法反映连接分布不均或局部拥塞。需结合 ss 获取连接粒度的运行时状态:
-
ss -i显示每个 TCP 连接的当前滑动窗口、RTT 估值、拥塞窗口(cwnd)、慢启动阈值(ssthresh)及接收/发送队列长度(rwnd、wqueue) -
ss -s提供连接状态汇总(如 ESTAB、TIME-WAIT 数量),但要注意其统计不含监听套接字,需额外用ss -ltn补全 - 高频采集时推荐加
-n(禁 DNS 解析)和-o(显示定时器),例如:ss -tinp -o state established '( dport = :8080 )' | head -20,快速筛查高延迟或高重传嫌疑连接
三、基于 eBPF 的动态行为追踪
当需要突破静态统计局限,观测协议栈函数内部耗时、丢包上下文或特定路径触发条件时,eBPF 是目前最有效的深度采集手段:
- 用
bpftrace跟踪关键函数,例如:bpftrace -e 'kprobe:tcp_retransmit_skb { @retrans[comm] = count(); }',按进程统计重传触发次数 - 结合
uprobe或tracepoint捕获 socket 层调用(如tcp_sendmsg返回值、sk_stream_wait_memory阻塞时长),识别应用写入阻塞是否源于发送缓冲区满 - 输出可直接对接 Prometheus(通过 bpf_exporter)或写入 ring buffer 实时分析,避免传统工具采样丢失瞬态尖峰
四、指标交叉验证与异常锚定
单一指标易误判。深度采集必须设计交叉校验逻辑:
- 若
TcpExtTCPTimeouts上升,同时ss -i中大量连接显示cwnd=1且rttvar剧增,大概率是弱网下持续超时退避 - 若
TcpExtListenOverflows> 0,再查ss -ltn的 Recv-Q 是否长期非零,可确认 accept 队列溢出而非 syn 队列 - 重传率(
TcpRetransSegs / TcpOutSegs)>2%,但ss -i中无连接显示retrans字段增长 → 可能是中间设备干扰,需 tcpdump 抓包比对序列号











