今天,阶跃正式全量开放其新一代旗舰基座模型——step5preview,定位清晰而坚定:一款专为真实世界中 agentic 任务深度优化的主力大模型。它直面ai领域一个长期存在的经典难题——“帕累托困境”:能力、效率与成本三者之间往往彼此制约;过往提升任一维度,常需以牺牲其他维度为代价;而真正的突破不在于消除取舍,而在于通过架构创新,整体外推帕累托前沿边界。
本次的关键跃迁,来自稀疏MoE(Mixture of Experts)架构的深度实践。Step5Preview 总参数量达600B,但每次推理仅激活27B,原生支持高达100万Token的上下文窗口,并原生兼容文本与视觉双模态输入。在Artificial Analysis发布的Intelligence Index榜单中,它斩获44分,稳居全球开源模型前三;更值得关注的是其单任务推理成本仅为Claude Opus5的八分之一——这意味着,同等预算可获得更强智能,或相同性能下实现显著降本,两条路径均已打通。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

硬核实力已在多个高难度权威基准测试中充分显现。在Agents' Last Exam的CLI子集ALE-CLI、聚焦金融投资研究的FrontierFinance评测,以及跨领域深度推理挑战DRACO中,Step5Preview表现仅次于GPT-6Astra与Claude Opus5,大幅领先其余参评开源模型;GDPval-AA v2采用截至9月19日的最新实测数据,DeepSWE v1.1则基于SWE-agent harness,在temperature=1.0、top_p=0.95条件下完成评测。
编程能力方面,阶跃构建了自有评测体系StepCodeBench,覆盖553个独立代码仓库、9类典型开发任务、20个应用领域及33种主流编程语言。Step5Preview在整体任务成功率与跨场景鲁棒性上均展现出扎实水准,能稳定承接Bug修复、功能开发、代码重构、环境配置等真实工程需求。一段典型演示中,模型通读ESP32全系列开发文档后,自主将一块ESP32-S3开发板改造为具备蓝牙按键+语音输入能力的Vibe Coding键盘——过程中自行打开COM串口、调用摄像头、截取设备图像、模拟鼠标操作,并依据真实运行报错持续迭代调试,连续工作超三小时未中断。

使用 @youdotcom-oss/teams-anthropic 将 Anthropic Claude 模型(Opus、Sonnet、Haiku)添加到 Microsoft Teams.ai 应用程序中。可选集成 You.com MCP 服务器以进行网页搜索和内容提取。
长周期复杂任务更能体现其Agentic本质。首项实验设定24小时时限与单张H100算力资源,要求从零优化一个MLA GPU内核(头维度512、batch=1、64注意力头、8192 token序列)。Step5Preview全程自主修改CUDA代码、编译运行、吞吐测试,对“能跑通但性能下降”的方案果断回退,始终基于当前最优版本继续搜索,最终在约22小时内将峰值性能拉升至508 TFLOPS,超越Claude Opus5的493 TFLOPS。第二项实验同样限定24小时,目标是通过自动化后训练提升Qwen3-30B-A3B在AIME24上的数学解题准确率;模型自主决策标注API调用策略、数据采样方式与训练节奏,最终将准确率由53.3%提升至60%,与Opus5持平,且所用标注token更少。
在前端与多模态交互层面,Step5Preview不止于生成HTML,更能调用Blender完成3D资产建模与多轮迭代修改,并无缝接入Three.js构建可交互Web应用乃至轻量级游戏;甚至可从1922年出版的《广九铁路旅行指南》原始扫描文本中精准抽取信息,构建出含行程查询、费用计算、历史路线动态回放等功能的交互式数字产品,让尘封史料真正“活”起来。
金融领域被阶跃视为综合能力的终极试金石。团队围绕企业研究这一高复杂度流程,自研三大内部评测:FinStepBench-LiveSearch检验动态需求下的金融信息检索与交叉验证能力;CorporateValuation考察将非结构化数据与主观假设转化为可复现、可审计的估值模型的能力;DeepResearch则评估从证据采集、逻辑推演到生成完整研究报告的端到端研究闭环能力。外部基准FrontierFinance则以220道专家级题目、11543项细粒度评分标准,覆盖尽调、估值、风控、交易、宏观、ESG六大投资场景。Step5Preview在全部四项评测中均交出领先级表现。
从Step3.5Flash、Step3.7Flash一路演进至Step5Preview,阶跃始终坚持同一战略主线:下一代Scaling定律的核心,不再是单纯堆叠算力,而是让每一份算力都产生更高密度的价值。随着今日全量开放,完整模型权重将于10月15日正式发布——这款重新定义“能力—成本—效率”三角关系的开源旗舰,正静待开发者将其作为Agentic任务的日常主力,投入真实世界的复杂战场。










