llvm后端默认不启用分支放宽(branch relaxation),因其会增加指令数、降低密度、影响预测且需额外资源;是否启用取决于目标后端是否实现相关接口并声明支持。

LLVM 后端默认对分支指令(如 br、call、jmp)的位移范围有严格限制,尤其在 RISC 架构(如 RISC-V、ARM)或某些嵌入式目标上,短跳转指令仅支持 ±2 KiB 或 ±4 KiB 的 PC 相对偏移。当函数过大、或跳转目标离得太远时,会触发 relocation truncated to fit 或 branch out of range 错误——这不是 IR 问题,而是后端在生成 MachineInstr 阶段无法用单条短跳转指令编码目标地址。
为什么 branch relaxation 不是自动开启的
LLVM 并不默认启用分支放宽(branch relaxation),因为:它会增加指令数量(插入跳转桩)、破坏指令密度、影响流水线预测,并且需要额外的寄存器/内存临时空间。是否启用取决于目标后端是否注册并实现了 TargetLowering::getJumpTableEncoding() 和 TargetInstrInfo::getBranchDestinations() 等接口,以及是否在 TargetSubtargetInfo 中声明了 hasBranchRelaxationSupport() 返回 true。
- ARM64 默认关闭,需显式传
-mbranch-protection=none+ 启用EnableLongBranchPass - RISC-V 的
rv64gc后端从 LLVM 15 起支持,但需在RVTTI::getRelaxationMode()返回RelaxAll或RelaxConditional - x86-64 几乎不触发,因
jmp/je等原生支持 32 位位移
手动启用 branch relaxation 的关键步骤
绕过默认策略、强制启用放宽,核心是让后端在 MachineFunction 层插入跳转桩(thunk)或拆分长跳转为多条指令。实操路径如下:
- 确认目标后端已实现
TargetInstrInfo::insertIndirectBranch()(例如lib/Target/RISCV/RISCVInstrInfo.cpp中有完整实现) - 在
TargetLowering子类中重载isBlockOnlyReachableByFallthrough(),避免误判“不可达块”而跳过 relax - 在
TargetPassConfig::addMachinePasses()中插入addPass(new BranchRelaxationPass()),位置需在addPreEmitPass()之前 - 编译时加
-mattr=+relax(若目标支持该属性),或通过TargetOptions::EnableLongBranch强制开启
示例(RISC-V):llc -march=rv64gc -mattr=+relax input.ll -o output.s 会在超出 beq ±4 KiB 范围时,自动生成类似 auipc t0, %pcrel_hi(jump_target); addi t0, t0, %pcrel_lo(jump_target); jr t0 的三指令序列。
常见错误与绕过技巧
即使启用了 relax,仍可能失败,典型现象包括:
-
error: relocation R_RISCV_JAL out of range:说明 relax pass 未生效,检查是否漏掉addPass(new BranchRelaxationPass())或目标子模块未注册 - 放松后性能下降明显:跳转桩破坏了 BTB(分支目标缓冲区)局部性,可尝试用
__attribute__((section(".hot")))把热分支块集中到同一 4 KiB 页面 - 链接时报
undefined reference to `__long_branch_stub_*:这是 relax pass 插入的桩函数未被链接器识别,需确保使用lld(而非ld.bfd),并加--no-relax关闭链接器自身的 relax 干扰 - 手动插入桩更可控:在 IR 层用
call void @llvm.experimental.noalias.scope.decl(...)无意义调用占位,再用opt -passes='function(instcombine,early-cse),loop(simplifycfg)' -S诱导 IR 拆分基本块,间接缓解距离压力
真正难的不是加开关,而是判断 relax 是否已在 pipeline 中被后续 pass 破坏——比如寄存器分配后插入的 spill code 可能把目标块推得更远,而 relax pass 已经跑过了。所以必须把 BranchRelaxationPass 放在寄存器分配之后、指令调度之前,且不能被 MachieCopyPropagation 之类 pass 合并掉跳转桩。











