LLVM后端怎么为新CPU添加调度模型

浅浩吖_3702

浅浩吖_3702

2026-10-01

902人浏览

原创

必须用llvm-exegesis实测带依赖链的端到端延迟,再按硬件资源、操作数宽度和寄存器类在*schedule.td中精确建模procresource与writelatency,否则调度模型会误导llvm-mca和代码生成。

llvm后端怎么为新cpu添加调度模型

直接在 Cpu0Schedule.td 或对应目标的 *Schedule.td 里写 TableGen 调度模型,不是填数字那么简单——你得先测出真实延迟,再反推资源约束,否则模型越“精确”越误导 llvm-mca 和最终生成代码。

为什么不能照搬手册写 SchedModel

手册上写的 ADDrr 延迟是 1 cycle,但实测在你的 CPU 上可能是 2 cycle(因为微码更新后端口重映射了),或者在特定操作数组合下变成 3 cycle(比如源/目标寄存器别名触发 micro-op fusion 拆分)。llvm-exegesis 能暴露这些细节,而 TableGen 里硬编码的 WriteLatency = 1 会让整个调度链路误判关键路径。

  • 手册数据滞后:AVX-512 指令在不同 stepping 的 Intel CPU 上端口分配可能完全不同,llvm-exegesis -mode=latency 才能拿到当前芯片的真实值
  • 依赖关系影响延迟:同一个 MOV64rr,前一条指令写 RAX、本条读 RAX,和前后完全无关,测出来延迟差一倍以上
  • 寄存器重命名绕过伪依赖:XOR32rr %reg, %reg 后接 ADD32rr %reg, %other,手册标延迟 1,实测为 0(重命名直接消除了依赖)

怎么用 llvm-exegesis 测出可信的延迟值

别用默认参数跑,它默认只测“无依赖”场景,而调度模型真正要建模的是有依赖链的端到端延迟。关键命令是:

llvm-exegesis -mode=latency -opcode-name=ADD32rr -uops=2 -iterations=100000

其中 -uops=2 强制构造一条两指令依赖链(比如 MOV32rr %rax, %rbx; ADD32rr %rax, %rcx),这样测出来的才是调度器真正需要的 WriteLatency。

Facet
Facet

一款结合AI图像生成与编辑能力的视觉创作工具,支持对图片进行生成、修改和迭代,适合创意设计工作。

下载
  • 对每条关键指令(ALU、load、store、branch、vector)都跑一遍带依赖链的测试
  • 注意区分 latency(端到端延迟)和 throughput(吞吐量),TableGen 中 WriteRes 描述后者,WriteLatency 描述前者
  • 测完用 llvm-exegesis -mode=report 生成 CSV,挑出 median 值,别用平均值(受噪声干扰大)

*Schedule.td 里怎么写才不翻车

TableGen 不是配置文件,它是编译期生成 C++ 调度逻辑的 DSL。一个常见错误是把所有指令都塞进同一个 SchedRW,结果 llvm-mca 报 Resource pressure too high 却找不到源头。

  • 每个功能单元(如 ALU0、ALU1、AGU)必须定义独立的 ProcResource,不能共用 ID
  • SchedWriteRes 必须严格匹配硬件资源:比如你的 CPU 有 2 个整数 ALU,就得写两个 ProcResource 并在 SchedWriteRes 中显式指定使用哪个
  • WriteLatency 要按操作数宽度和寄存器类拆分:例如 ADD32rr 和 ADD64rr 延迟不同,就得定义两个独立的 WriteRes 条目
  • 别漏掉 ReadAdvance:load 指令如果支持地址生成提前完成(如 LEA-like behavior),得在这里声明,否则调度器会多等 cycles

验证模型是否生效的最快方式

改完 *Schedule.td 后,不要急着跑完整编译,先用 llvm-mca 快速验证:

llc -march=yourtarget -mcpu=yourcpu -o - input.ll | llvm-mca -mcpu=yourcpu -timeline -iterations=10

重点看输出里的 Timeline view 是否出现预期的指令并行(比如两条独立 ADD 真的被调度到同一 cycle),以及 Resource pressure 数值是否与你定义的 ProcResource 容量一致。

最容易被忽略的是:TableGen 编译后生成的 C++ 代码不会自动 reload,每次改完 *Schedule.td 都必须重新 build libLLVMYourTargetCodeGen.a,否则 llc 用的还是旧模型——这个步骤没有报错提示,静默失效。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2223

5

前端和后端的区别
前端和后端的区别

前端关注的是用户界面的设计和交互,而后端则注重数据处理和逻辑控制。想了解更多前端后端的相关内容,可以阅读本专题下面的文章。

2024.03.19

5870

13

后端的主要工作内容介绍
后端的主要工作内容介绍

后端是应用程序的服务端部分,负责核心任务,如数据库交互、业务逻辑处理和响应客户端请求。想了解更多后端的相关内容,可以阅读本专题下面的文章。

2024.03.19

5186

10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

20

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

0

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

0

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

20

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

20

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

220

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程