物理网卡中断(irq)不平衡是宿主机底层网络调度异常,会导致docker compose微服务出现连接超时、http卡顿、grpc流中断等网络抖动,需从内核中断分配与容器网络协同入手排查和优化。

物理网卡中断(IRQ)不平衡本身不是 Composer 的问题,而是宿主机底层网络资源调度异常,它会间接引发 Docker Compose 部署的微服务出现连接超时、HTTP 请求卡顿、gRPC 流中断等“网络抖动”表象。这类问题常被误判为服务配置或代码缺陷,实则需从 Linux 内核中断分配与容器网络协同角度切入。
确认是否真由 IRQ 不平衡引起
先排除其他常见干扰,再聚焦网卡中断:
- 用 docker stats 观察容器 CPU 使用率是否突增但业务无明显负载——可能是软中断(ksoftirqd)占满单核
- 运行 cat /proc/interrupts | grep eth(如 eth0),检查某一个 CPU 核(如 CPU0)的中断计数远高于其他核(差 5 倍以上即属异常)
- 执行 top -H -p $(pgrep ksoftirqd),看是否某个线程持续 100% 占用单个 CPU
- 对比 ping 宿主机网关 和 ping 同一局域网内另一台机器,若前者延迟稳定而后者偶发 200ms+,说明问题在本地网卡收包路径
平衡网卡中断到多核(关键操作)
Linux 默认可能将所有网卡中断绑定到 CPU0,尤其在虚拟化或云主机环境下更常见。需手动分散:
- 查网卡对应中断号:grep eth0 /proc/interrupts | awk '{print $1}' | tr -d ':'
- 查看当前绑定:cat /proc/irq/{N}/smp_affinity_list(N 是上一步得到的数字)
- 将中断均衡分发到 CPU0–CPU3(以 4 核为例):echo 0-3 | sudo tee /proc/irq/{N}/smp_affinity_list
- 为防重启失效,写入 /etc/rc.local 或 systemd service,在 docker 启动前执行
容器网络层适配优化
即使 IRQ 平衡了,Docker 的默认桥接网络仍可能加剧单核压力。建议组合调整:
- 禁用宿主机上不必要的 NIC offload 功能(如 TSO、GSO),避免大包重组压垮单核:ethtool -K eth0 tso off gso off
- 为 Docker daemon 配置 --iptables=false + 手动管理 iptables 规则,减少 conntrack 表锁竞争
- 若使用自定义 bridge 网络,启用 com.docker.network.driver.mtu=1400,降低分片概率
- 对高吞吐微服务(如 API 网关),改用 host 网络模式(仅限可信内网),绕过 docker0 桥接和 NAT
服务侧韧性增强(不依赖底层修复)
IRQ 问题难以 100% 消除,微服务需自身具备容忍能力:
- HTTP 客户端设置合理超时:connect_timeout ≥ 5s,timeout ≥ 15s,避免因短暂中断直接失败
- 禁用长连接复用(keep-alive)或缩短 idle 超时(如 30s),防止连接卡在僵死状态
- 对跨中心调用,按错误类型分级重试:仅对 ConnectionException 重试,跳过 503/429 等明确拒绝响应
- 在服务启动脚本中加入 IRQ 健康检查,若发现单核中断占比 >70%,自动告警并触发降级逻辑











