现代工业与前沿科研的每一次跃迁,其背后都离不开庞大而精密的高性能计算软件体系支撑。而在这些软件的底层逻辑中,往往潜藏着一种既关键又“吃力”的核心计算范式——stencil 模板计算。无论是数值天气预报、地质地震波反演、电磁场建模,还是新型材料微观结构模拟,其数学本质均可归结为:在离散网格上,持续利用邻域点的加权组合更新每个网格单元的状态。这类计算天然具有高访存比、强数据局部性特征,极易受内存带宽制约,常占据整个应用执行时间的60%以上——它的效率,直接牵动一国高端工业软件与科学计算基础设施的命脉。
以往,将 Stencil 计算推向硬件性能天花板,几乎只能依赖凤毛麟角的超算领域专家。尽管已有编译器框架、DSL 代码生成器及自动调优工具链(如 Halide、TVM 等)可辅助生成代码或搜索参数,但其优化策略的设计、调度模型的构建、硬件特性的适配,仍需资深工程师深度介入。一旦更换计算场景、调整模板形状(Shape)、迁移至新架构平台,便需重新手工建模、反复调试,严重阻碍了优化能力的泛化与规模化复用。
如今,这一长期僵持的局面正被打破——面壁智能携手 OpenBMB 开源社区,正式发布全球首个支持 Stencil 全流程自动研究与自动部署的 AI 驱动优化系统:ForgeStencil,并同步开源。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

官方披露数据显示,ForgeStencil 在一周内即完成对100余款真实工业级与科研级软件的端到端自动优化,单任务平均优化耗时压缩至小时量级,相较传统人工优化方式,研发效率提升约百倍;且该能力具备良好的横向扩展性,可随计算资源规模线性增长。这意味着,Stencil 优化首次真正挣脱人力瓶颈,迈向工业化、标准化、可复制的规模化落地阶段。
其最具革命性的突破,在于首创“双 Agent 协同、零人工干预”的全自动范式。用户仅需提交原始应用源码,系统即可自主完成从热点识别、Kernel 构造、算子替换、正确性验证,到最终无缝集成回原工程的全部环节,全程无需任何专家介入决策。系统由两大智能体构成:
- Kernel Agent:专注算子级创新,扮演“算法科学家”角色,面向主流 Stencil 类型(如 Jacobi、Gauss-Seidel、Laplacian 等)、多维 Shape 变体(3D/2D/非规则)、不同精度需求(fp32/fp16/int8),自主开展数学建模、访存调度设计与指令级优化,构建高性能专用算子矩阵,将抽象公式转化为逼近硬件物理极限的高效实现;
- App Agent:聚焦工程落地,担当“系统工程师”,为每一款真实应用定制优化路径:精准定位性能瓶颈、建立 GPU 基线性能模型、驱动 Kernel Agent 生成适配算子、完成集成测试,并调用应用自带测试用例实施端到端功能与性能双重校验。
在权威算子级基准对比中,ForgeStencil 与 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等主流框架同场竞技:在统一 fp32 精度下,取得几何平均2.35倍加速;启用混合精度 fp16 加载/存储后,进一步获得1.95倍额外提速;即使面对业界公认的难点——变系数、全 Shape 支持的复杂 Stencil 场景,仍相较当前最优基线保持1.34倍几何平均加速优势。

更值得关注的是,ForgeStencil 并未止步于理想化 Benchmark,而是深度切入真实工业产线。在其已验证的典型应用中,约42% 的优化案例直接对应实际生产环境:
- hypre 结构化多重网格求解器库提速3.86倍;
- minisweep 核反应堆中子输运模拟加速5.78倍;
- gprMax 与 FDTD 电磁仿真框架提速2.47倍;
- RTM 逆时偏移地震成像算法提速1.81倍;
- 道达尔 minimod 地震 mini-app 加速1.22倍;
- QuantLib 金融衍生品定价库提速1.82倍;
- 非笛卡尔坐标系 MRI 图像重建加速2.45倍;
- 数字乳腺断层合成(DBT)反投影计算加速1.63倍。
从能源勘探企业、高端医疗影像设备厂商,到国家级气象中心,其负载均已纳入 ForgeStencil 实际优化范围。
区别于人类专家经验高度私有化、难以沉淀与复用,ForgeStencil 构建了一个共享知识中枢——海量并行运行的 Agent 共同维护、实时更新同一套优化知识图谱,实现经验的即时共享与群体智能的协同进化。这也是面壁智能继今年5月推出 ForgeTrain(AI 驱动的训练自动化系统)之后,依托 Forge Engineering 软件工程新范式所交付的又一里程碑成果:从“自动生成代码”,跃升至“自动研究+自动优化”;从“单点算子加速”,拓展至“真实应用闭环部署”。
短期来看,存量工业软件可通过 ForgeStencil 实现小时级自动升级,快速获取逼近硬件极限的高性能实现,显著降低算力消耗与研发周期,直接驱动降本增效;长远而言,当 CAE 仿真、油气地震成像、电磁与流体建模等高端装备研发、能源勘探、芯片设计的核心数字底座全面实现自动化优化,中国制造业智能化升级进程将获得实质性加速引擎。目前,ForgeStencil 已在 GitHub 全面开源,面壁智能诚邀全球 HPC 学者、工业软件开发者及开源社区共建者共同参与生态建设。











