cachegrind_annotate 用于解析 cachegrind 二进制输出文件并按行显示 cache miss 等指标,需编译时加 -g3 且未 strip,配合 --auto=yes 和 --show=i1mr,d1mw,l2mr 等参数才能精准映射到源码行。

用 cachegrind_annotate 解析并按行显示指标
Valgrind 的 Cachegrind 默认只生成二进制分析文件(如 cachegrind.out.12345),不直接显示每行代码的 cache miss、instructions 等数据。必须用配套工具 cachegrind_annotate 读取该文件,并结合源码才能映射到具体行——前提是编译时带 -g 且未 strip。
典型流程是:
- 运行:
valgrind --tool=cachegrind --cachegrind-out-file=cg.out ./my_program - 解析:
cachegrind_annotate cg.out --auto=yes --show=I1mr,D1mw,L2mr
--auto=yes 是关键:它自动查找当前目录下的源文件;若源码不在当前目录,需用 --source-path=/path/to/src 指定。
为什么有些行显示 ???? 或完全没数据
常见原因不是工具问题,而是符号/路径断链:
- 编译没加
-g,或用了-g1(信息不足),推荐-g3 - 可执行文件被 strip 过(
strip ./my_program),debug info 全丢 - 源文件已移动或重命名,
cachegrind_annotate找不到对应.c文件 - 内联函数或模板实例化代码,Cachegrind 默认归到调用点,不展开到原始定义行
验证 debug info 是否完整:运行 readelf -w ./my_program | head -20,能看到 DW_TAG_compile_unit 和文件路径才算正常。
cachegrind_annotate 的关键参数怎么选
默认输出只显示函数级汇总,要看到每行数据,必须显式控制聚合粒度和过滤项:
-
--show=I1mr,D1mw,L2mr:只显示一级指令 cache miss、一级数据写 miss、二级 cache miss —— 避免混入大量Ir(instruction count)干扰判断热点行 -
--threshold=0.1:只显示占总 miss 数 0.1% 以上的行(防止刷屏) -
--no-show-percs=yes:关闭百分比列,改用绝对数值,方便横向比较不同 run 的差异 -
--context=3:上下各显示 3 行代码,看清循环体或 if 分支边界
注意:I1mr 单位是“miss per 1000 instructions”,不是绝对次数;实际 miss 总数得看 summary 行末的 == total == 值再反推。
想对比两次运行的每行差异?别用 cachegrind_annotate 直接比
它不支持 diff 模式。正确做法是分别生成两份注解文本,再用外部工具处理:
- 先导出两份带行号的纯文本:
cachegrind_annotate cg1.out --auto=yes --show=D1mw > a.txt,同理生成b.txt - 用
diff -u a.txt b.txt | grep '^[+-][^+-]' | grep -E '^[+-][0-9]+:'快速定位变化行 - 更稳的方式:用脚本提取每行的 D1mw 数值(正则匹配
^\s*[0-9]+\s+([0-9.]+)),再做数值差分
真正难的是语义对齐——比如重构后某段逻辑拆成两个函数,行号变了,但 cache 行为本质相同。这时候光看行号 diff 会误判,得结合调用栈(--callgrind-out-file + callgrind_annotate)交叉验证。











