☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

字节跳动 Seed 团队与清华大学智能产业研究院(AIR)近期正式推出 CUDA Agent 系统。该系统是一项面向高性能 GPU 内核生成的智能体强化学习框架,旨在赋能大型语言模型掌握硬件级优化能力,推动 AI 在底层系统编程领域实现关键跃迁。
长期以来,尽管主流大模型在通用编程任务中表现优异,但在 CUDA 代码生成方面仍面临显著短板:虽可产出语法无误的内核,却普遍缺乏对内存访问模式、线程调度、共享内存布局等微架构特性的深度理解,导致实际性能常逊于 torch.compile 等成熟编译器优化方案。KernelBench 测试数据显示,原始模型 Seed1.6 的任务通过率为 74.0%,但仅 27.2% 的生成内核在运行速度上优于 torch.compile,整体几何均速亦低于编译器基准。
为攻克这一难题,CUDA Agent 构建了一个高度拟真的 CUDA 开发沙盒环境,集成自动编译验证、多维度性能剖析(如 Nsight Compute)、细粒度正确性检查,并通过严格的文件权限隔离与执行约束杜绝“作弊路径”。系统采用近端策略优化(PPO)算法,完成长达 150 步的端到端强化训练,在涵盖 250 个多样化任务的基准测试中,最终实现 98.8% 的整体功能通过率,其中 96.8% 的生成内核实测性能超越 torch.compile。
在生态建设层面,研究团队已开源 CUDA-Agent-Ops-6K 数据集(含 6000 条高质量融合算子样本)、SKILL.md 技能规范文档,以及完整的奖励设计与热身训练配方。虽然当前尚未发布完整模型权重,但该技术路径已展现出在 AI 基础设施优化、大模型低延迟推理、自动驾驶实时计算及高频量化交易等严苛场景中的巨大应用潜力。











