tcp keepalive是内核级被动探测机制,通过空ack包检测空闲连接存活状态,需显式启用并配置tcp_keepalive_time、intvl、probes三参数;它不替代应用层心跳,而是作为断电、宕机等异常场景的保底保障。

心跳检测可以借助 TCP Keepalive 机制实现底层连接存活判断,但它不是传统意义上“应用层心跳”,而是一种由内核自动触发的被动探测手段。它不发送业务数据,也不依赖你的代码轮询,但能帮你尽早发现对端宕机、网络中断或中间设备静默丢弃连接等异常情况。
Keepalive 是怎么当“心跳”用的
TCP Keepalive 本身不叫心跳包,但作用类似——在连接空闲时主动发探测报文(通常是空 ACK),看对端是否响应。一旦连续多次无应答,内核就认为连接已断,并让后续 recv() 或 send() 立即返回错误(如 ECONNRESET 或 ETIMEDOUT)。
- 它只在连接完全无数据收发时才启动,不会干扰正常业务流量
- 探测由操作系统内核完成,无需你在应用层反复调用 send/recv
- 失败后套接字状态会变为不可读/不可写,可被 select()、poll() 或阻塞 I/O 捕获
C语言中启用并配置 Keepalive 的关键步骤
必须显式开启,否则默认关闭。仅调用 setsockopt(..., SO_KEEPALIVE, ...) 不够,还需设置三个核心参数才能适配实际网络环境:
- tcp_keepalive_time:连接空闲多久后发第一个探测(Linux 默认 7200 秒,太长,建议设为 60~300 秒)
- tcp_keepalive_intvl:两次探测之间的间隔(默认 75 秒,建议 10~30 秒)
- tcp_keepalive_probes:最大探测次数(默认 9 次,建议 3~5 次,避免等待过久)
代码示例(需在 connect() 或 accept() 后立即设置):
int opt = 1; setsockopt(sockfd, SOL_SOCKET, SO_KEEPALIVE, &opt, sizeof(opt)); // 启用后,通过 setsockopt 设置内核级参数(Linux) int idle = 120; // 2分钟空闲后开始探测 int interval = 15; // 每15秒重试一次 int probes = 3; // 最多重试3次 setsockopt(sockfd, IPPROTO_TCP, TCP_KEEPIDLE, &idle, sizeof(idle)); setsockopt(sockfd, IPPROTO_TCP, TCP_KEEPINTVL, &interval, sizeof(interval)); setsockopt(sockfd, IPPROTO_TCP, TCP_KEEPCNT, &probes, sizeof(probes));
Keepalive 探测失败后,程序该怎么响应
Keepalive 不会自动重连或通知你,它只是让系统“知道连接坏了”。你需要结合 I/O 模型做正确处理:
- 使用 select() 或 poll() 时:若套接字变为“可读”,但 recv() 返回 0,说明对端已正常关闭;若返回 -1 且 errno == ECONNRESET / ETIMEDOUT,说明 Keepalive 探测失败,连接异常中断
- 阻塞模式下:下次 recv() 或 send() 会直接失败,需检查返回值和 errno
- 务必在错误分支中关闭 socket 并触发重连逻辑,否则残留套接字会持续占用资源
Keepalive 和应用层心跳该选哪个
它们不是互斥关系,而是互补:
- Keepalive 是保底手段:覆盖进程崩溃、断电、路由中断等你无法控制的场景,但延迟高(至少要等 idle + intvl × probes)
- 应用层心跳是主动策略:周期性发业务协议定义的心跳帧(如 ping/pong),响应快、可携带上下文、还能顺便做会话续期,但需自己设计编解码与超时判定
- 推荐组合:Keepalive 作为兜底(防止半开连接堆积),应用层心跳用于快速感知与业务联动(如用户在线状态更新)










