最直接可控的函数耗时测量方式是用 std::chrono::steady_clock 手动打点并显式转换单位,推荐封装为 raii 计时器配合宏自动管理生命周期,再聚合统计至结构化报告。

用 std::chrono 手动打点测单个函数耗时
最直接、可控性最强的方式就是对关键函数或代码段插入起止时间戳。别依赖全局 profiler 工具——它们容易漏掉你真正想盯的细粒度逻辑。
常见错误是只测 std::chrono::steady_clock::now() 但没注意返回值类型,导致减法出错或隐式转换丢失精度:
- 必须用同一时钟类型(推荐
std::chrono::steady_clock,不受系统时间调整影响) - 差值要用
std::chrono::duration_cast显式转成你需要的单位(如std::chrono::microseconds),不能直接.count()后强转 - 避免把时间测量逻辑和业务逻辑耦合太紧;封装成 RAII 类(比如
ScopedTimer)更安全
示例:
auto start = std::chrono::steady_clock::now();
do_something_heavy();
auto end = std::chrono::steady_clock::now();
auto us = std::chrono::duration_cast<:chrono::microseconds>(end - start).count();
std::cout <h3>用宏 + RAII 自动记录作用域耗时</h3>
<p>手动写 <code>start/end</code> 容易漏、难维护,尤其在多分支或异常路径下。用宏包裹 RAII 计时器能保证进出自动记录,且支持命名标识。</p>
<p>关键点在于:RAII 对象生命周期必须严格绑定到作用域,析构时才触发日志;宏要展开成带唯一标识符的变量名,避免嵌套作用域重名冲突。</p>
<ul>
<li>宏定义里用 <code>__COUNTER__</code> 或 <code>__LINE__</code> 生成局部变量名(<code>__FILE__</code> 太长,不推荐)</li>
<li>计时器类的构造函数记录起点,析构函数算差值并输出(建议输出到 <code>std::cerr</code>,避免和正常输出混在一起)</li>
<li>不要在计时器里做格式化字符串拼接——开销大;先存原始 <code>microseconds::count()</code>,最后统一打印</li>
</ul>
<p>典型用法:</p><div class="aritcle_card flexRow artxards">
<div class="artcardd flexRow">
<a class="aritcle_card_img" rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架"><img
src="https://img.php.cn/upload/skill/000/000/081/178988956499722.jpg" alt="C++ 算法竞赛自动化测试数据生成与校验框架" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架" class="overflowclass">C++ 算法竞赛自动化测试数据生成与校验框架</a>
<p class="overflowclass">根据原题生成新题面、验证器及完整测试数据,自动套用 testlib 模板,用于用户要求生成测试数据时。</p>
</div>
<a rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
</a>
</div>
</div>
<pre class="brush:php;toolbar:false;">#define SCOPED_TIMER(name) ScopedTimer timer##__COUNTER__(name)
// …
void process_frame() {
SCOPED_TIMER("process_frame");
decode();
filter();
encode();
}
聚合多个耗时数据到结构化报告
光有单次耗时没意义,真实分析需要统计分布:平均值、P95、最大值、调用次数。硬编码 printf 不可扩展,得建轻量级计时器注册表。
核心结构是一个全局 std::unordered_map<:string timerstat></:string>,每次进入同一名字的 SCOPED_TIMER 就往对应项累加耗时和计数。
- 用
std::atomic保护共享计数器(尤其多线程场景下),但注意atomic<int64_t></int64_t>比atomic<long long></long>更稳妥 - 避免在 hot path 上做 map 查找——提前缓存
TimerStat*指针,首次访问后复用 - 报告输出时机很重要:不能每帧都 dump,建议在程序退出前或按固定周期(如每 100 帧)汇总一次
输出示例(文本格式即可,无需 JSON):
decode: calls=1247, avg=842μs, p95=1120μs, max=3890μs filter: calls=1247, avg=210μs, p95=290μs, max=760μs encode: calls=1247, avg=1560μs, p95=1980μs, max=4200μs
注意编译器优化和 CPU 频率干扰
测出来的数字不准?大概率是编译器把被测代码优化掉了,或者 CPU 动态降频拉低了单次执行速度。
- 确保测试时关掉
-O0(太慢)、也别用-O3(可能内联/消除整个块);-O2是较合理基线 - 禁用编译器对计时代码本身的优化:用
volatile强制读写,或调用asm volatile("" ::: "memory")插内存屏障 - Linux 下可用
sudo cpupower frequency-set -g performance锁定 CPU 频率;Windows 可设电源计划为“高性能” - 单次测量波动大?至少跑 10 次取中位数,别信第一次结果
最常被忽略的是:没确认被测代码是否真的执行了——比如条件分支没进、输入数据为空、缓存命中导致耗时极低。先加个 std::cerr 确认逻辑走通,再测时。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










