c++ hft低延迟编程 c++高频交易系统如何优化网络延迟

酷宇大大_7566

酷宇大大_7566

2026-03-20

702人浏览

原创

so_reuseport 通过为每个线程创建独立 socket 并启用该选项,避免 accept 队列争用,提升并发吞吐;需 linux 3.9+,且必须在 socket() 后立即 setsockopt;配合 epoll_wait 轮询、epollet、sendmmsg 批量发包、af_packet 零拷贝收包及关闭网卡 offload,可显著降低延迟并提升性能。

c++ hft低延迟编程 c++高频交易系统如何优化网络延迟

用 SO_REUSEPORT 避免 accept 队列争用

多线程监听同一个端口时,内核默认把所有新连接塞进一个全局 accept 队列,线程抢着 accept() 会引发锁竞争和缓存颠簸——实测在 10G 网卡 + 40 核机器上,单队列吞吐卡在 8–12 万连接/秒,启用 SO_REUSEPORT 后轻松翻倍。

关键不是“能不能用”,而是“必须每个 socket 单独 setsockopt”:

  • socket() 后立即调用 setsockopt(fd, SOL_SOCKET, SO_REUSEPORT, &opt, sizeof(opt)),不能等 bind() 之后
  • 多个线程需各自创建独立 socket、bind 到同一地址,再 listen;共用一个 fd 再 fork 不行
  • Linux 3.9+ 才完整支持,旧内核(如 CentOS 7 默认 3.10)可用,但需确认 /proc/sys/net/core/somaxconn ≥ 65535

epoll_wait 超时设为 0 还是 -1?

设 -1(永久阻塞)看似省电,但在 HFT 场景下会让事件处理延迟不可控:网卡中断到用户态回调之间,可能被调度器插进一个 50μs 的其他任务。实测将 epoll_wait 超时设为 0(轮询),配合 busy_poll 内核参数,端到端 P99 延迟下降 18–22μs。

但代价明显:

C++ Code Review Master
C++ Code Review Master

组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。

下载
  • CPU 使用率从 12% 拉到 35%,需绑定独占 CPU 核,禁用 intel_idle 和 cpufreq
  • 必须搭配 EPOLLET 边沿触发,否则重复通知导致 busy loop
  • epoll_wait 返回后要立刻处理完所有就绪 fd,不能中途 sleep 或阻塞 I/O

发包不走 sendto,改用 sendmmsg 批量提交

单次 sendto 触发一次 syscall + 上下文切换,高频报价场景下每秒几万次调用,光上下文切换就吃掉 3–5μs/次。用 sendmmsg 一次提交最多 1024 个 msghdr,实测在 25Gbps 网卡上,吞吐提升 2.1 倍,P50 延迟压到 8.3μs。

注意三个硬约束:

  • 所有消息必须发往同一目标地址(sockaddr 相同),跨 IP 必须分组调用
  • 每个 msghdr 的 msg_iov 总长度不能超 net.core.wmem_max(通常 212992 字节)
  • 内核 3.0+ 才支持,且需确保 CONFIG_NETFILTER_XT_TARGET_TPROXY_SOCKET 未启用(某些发行版默认开,会干扰 sendmmsg 路径)

UDP 收包避免 recvfrom 拷贝:用 recvmmsg + AF_PACKET 零拷贝

标准 recvfrom 每次都从内核 skb 拷贝到用户 buffer,对 10K+/秒 的行情 tick,仅内存带宽就占满 PCIe 3.0 x4 的 30%。真低延迟必须绕过协议栈:

  • 用 AF_PACKET + TPACKET_V3 直接 mmap 网卡 ring buffer,收包零拷贝,但需自己解析 IP/UDP 头
  • recvmmsg 批量收包比循环调用 recvfrom 少 70% 的 syscall 开销,且能复用同一 buffer pool 减少 malloc 压力
  • 必须关闭 NIC offload:ethtool -K eth0 gso off tso off gro off lro off,否则 AF_PACKET 可能收到分片或聚合包

最麻烦的其实是时序校准——AF_PACKET 时间戳来自网卡硬件,而业务逻辑依赖系统时钟,两者偏差可能达 ±200ns,得用 PTP 或 GPSDO 对齐,这点容易被忽略。

C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!

相关文章

c++速学教程(入门到精通)
c++速学教程(入门到精通)

c++怎么学习?c++怎么入门?c++在哪学?c++怎么学才快?不用担心,这里为大家提供了c++速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

c++

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
堆和栈的区别
堆和栈的区别

堆和栈的区别:1、内存分配方式不同;2、大小不同;3、数据访问方式不同;4、数据的生命周期。本专题为大家提供堆和栈的区别的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.18

5227

5

堆和栈区别
堆和栈区别

堆(Heap)和栈(Stack)是计算机中两种常见的内存分配机制。它们在内存管理的方式、分配方式以及使用场景上有很大的区别。本文将详细介绍堆和栈的特点、区别以及各自的使用场景。php中文网给大家带来了相关的教程以及文章欢迎大家前来学习阅读。

2023.08.10

2308

6

线程和进程的区别
线程和进程的区别

线程和进程的区别:线程是进程的一部分,用于实现并发和并行操作,而线程共享进程的资源,通信更方便快捷,切换开销较小。本专题为大家提供线程和进程区别相关的各种文章、以及下载和课程。

2023.08.10

3858

6

Python 多线程与异步编程实战
Python 多线程与异步编程实战

本专题系统讲解 Python 多线程与异步编程的核心概念与实战技巧,包括 threading 模块基础、线程同步机制、GIL 原理、asyncio 异步任务管理、协程与事件循环、任务调度与异常处理。通过实战示例,帮助学习者掌握 如何构建高性能、多任务并发的 Python 应用。

2025.12.24

1069

20

java多线程相关教程合集
java多线程相关教程合集

本专题整合了java多线程相关教程,阅读专题下面的文章了解更多详细内容。

2026.01.21

363

30

C++多线程相关合集
C++多线程相关合集

本专题整合了C++多线程相关教程,阅读专题下面的的文章了解更多详细内容。

2026.01.21

539

24

C# 多线程与异步编程
C# 多线程与异步编程

本专题深入讲解 C# 中多线程与异步编程的核心概念与实战技巧,包括线程池管理、Task 类的使用、async/await 异步编程模式、并发控制与线程同步、死锁与竞态条件的解决方案。通过实际项目,帮助开发者掌握 如何在 C# 中构建高并发、低延迟的异步系统,提升应用性能和响应速度。

2026.02.06

369

20

C++多线程并发控制与线程安全设计实践
C++多线程并发控制与线程安全设计实践

本专题围绕 C++ 在高性能系统开发中的并发控制技术展开,系统讲解多线程编程模型与线程安全设计方法。内容包括互斥锁、读写锁、条件变量、原子操作以及线程池实现机制,同时结合实际案例分析并发竞争、死锁避免与性能优化策略。通过实践讲解,帮助开发者掌握构建稳定高效并发系统的关键技术。

2026.03.16

213

22

Java 多线程与并发编程实战
Java 多线程与并发编程实战

深入讲解 Java 并发编程体系,涵盖 Thread / Runnable / Callable 线程创建方式、线程生命周期与状态转换、synchronized 同步锁与 Lock/ReentrantLock 显式锁、volatile 可见性保证、ThreadPool 线程池配置与调优(核心参数/拒绝策略)、JUC 并发工具类(CountDownLatch/CyclicBarrier/Semaphore/ConcurrentHashMa

2026.04.17

329

31

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 Essentials 免费课程
Conan 2 Essentials 免费课程

共0课时 | 0人学习

CMake 与 Conan 集成实践
CMake 与 Conan 集成实践

共0课时 | 0人学习

Conan 2 高级依赖模型介绍
Conan 2 高级依赖模型介绍

共0课时 | 0人学习