LLVM Pass怎么测量耗时并查找编译瓶颈

小杰吖_6254

小杰吖_6254

2026-09-29

516人浏览

原创

最直接方式是用functionpass在函数入口(首个basicblock起始)和所有出口(含returninst/resumeinst/unwindinst)插入gettimeofday计时逻辑,传入函数名字符串常量和时间戳,避免使用clock()等失真或线程不安全的api。

llvm pass怎么测量耗时并查找编译瓶颈

用 FunctionPass 插入 gettimeofday 计时代码

最直接的方式是在每个函数入口和出口插入时间采集逻辑,靠 FunctionPass 遍历所有函数,跳过已注入的辅助函数(如 my_fun_b、my_fun_e),避免重复插桩。关键不是“加计时”,而是确保插入点正确:入口必须在第一个 BasicBlock 的起始位置(用 F.getEntryBlock()),出口必须覆盖所有 return 指令(包括隐式 return 和异常 unwind 路径)。

常见错误是只处理 ReturnInst,漏掉 ResumeInst 或 UnwindInst,导致程序崩溃或计时不全。建议统一用 IRBuilder 在每个 terminator 前插入 my_fun_e 调用,并传入函数名字符串常量和开始时间值。

  • 函数名需转为全局常量字符串,避免 runtime 动态构造开销
  • 时间戳用 gettimeofday 比 clock() 更准,但注意它返回的是微秒级整数,不是浮点秒
  • 不要在 runOnModule 里做耗时操作(比如遍历所有函数再统计),那会拖慢编译本身

为什么不能用 clock() 或 CLOCKS_PER_SEC

clock() 返回的是进程 CPU 时间,不是 wall-clock 时间,在多线程或系统调度干扰下严重失真;CLOCKS_PER_SEC 在不同平台定义不一(Linux 是 1000000,macOS 可能是 1000000000),且无法反映真实 I/O 或等待延迟。你真正想测的是“这个函数从进入执行到离开花了多少真实时间”,不是“它占用了多少 CPU 周期”。

更麻烦的是:clock() 在某些 libc 实现中是线程局部的,LLVM Pass 插入后若函数被多线程调用,计时器变量可能被多个线程竞争写入,结果不可信。而 gettimeofday 是 syscall,返回全局单调递增的时间戳,只要不跨进程共享同一计时变量,就安全得多。

Vibe Island
Vibe Island

一款AI开发辅助工具,主要用于灵动岛式AI编程管理工具,适合需要提升相关任务效率的用户。

下载
  • 务必用 struct timeval + gettimeofday,而不是 std::chrono —— 后者依赖 C++ 运行时,LLVM IR 层不认
  • 不要试图在 Pass 里调用 printf;输出必须交给运行时函数(如 my_fun_e)在程序实际运行时完成
  • 若目标平台无 gettimeofday(如裸机环境),得换用 rdtsc 指令,但要注意乱序执行和频率漂移问题

编译瓶颈定位:别只看函数耗时总和

函数级耗时数据只是表象。真正的编译瓶颈往往藏在 Pass 执行顺序、IR 大小膨胀、或某几个 Pass 的反复触发中。比如一个 LoopVectorizePass 在某个函数上卡住 8 秒,很可能是因为它在尝试展开一个有副作用的循环体,反复回退重试;而你在运行时看到的只是该函数耗时高,误以为是业务逻辑问题。

LLVM 提供了内置分析开关:-mllvm -print-after-all 会 dump 每个 Pass 前后的 IR,配合 diff 可快速识别哪次优化导致 IR 行数暴增;-time-passes 则直接输出各 Pass 自身耗时(单位 ms),精确到小数点后一位。

  • -time-passes 输出里如果 InstructionCombining 占比超 40%,说明 IR 存在大量冗余指令,应检查前端是否生成了低效 IR
  • 若 GlobalDCE 耗时异常高,大概率是模块里存在大量未使用的全局变量或弱符号,需清理 dead code
  • 启用 -debug-pass=Structure 可打印 Pass 管线结构,确认你写的自定义 Pass 是否被多次执行(比如被放进 AlwaysInliner 循环里)

多线程场景下计时器失效怎么办

你写的计时器默认是全局变量累加,比如 TimeFor_foo += ...。一旦函数被多线程并发调用,这个写操作就是竞态的——没有原子性保证,最终结果必然小于真实总和,甚至出现负值(因寄存器重排或 cache 不一致)。

解决办法只有两个:要么彻底禁用多线程执行(加 -j1 编译),要么改用线程局部存储(TLS)。LLVM IR 支持 @llvm.thread.local.address 内建调用,但需要手写 TableGen 规则并链接 compiler-rt;更现实的做法是让运行时函数(如 my_fun_e)内部用 pthread key 或 __thread 变量暂存单线程耗时,最后由主线程统一合并。

  • 别指望 std::atomic —— 它在 IR 层不存在,Clang 会降级为锁实现,反而引入更大开销
  • 若只需粗略定位热点函数,可先忽略多线程问题,用单线程跑通逻辑再迭代
  • 真正要上线的性能分析工具,必须把计时器变量声明为 thread_local 并在 C++ 运行时初始化,否则 LLVM 无法生成正确 TLS 访问码
真实瓶颈往往不在函数体内部,而在函数边界——比如频繁的栈帧建立/销毁、参数拷贝、或 ABI 适配开销。计时器插得越细,越容易暴露这类底层问题;但插得太密(比如每条语句都计时),又会让编译时间和二进制体积失控。平衡点通常在函数粒度,再辅以 -time-passes 查编译阶段耗时。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

180

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

80

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

80

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

60

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

60

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

60

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

60

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

80

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

100

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程