阶跃甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把开源旗舰的"性价比边界"往外推了一格

落枫小哥_3113

落枫小哥_3113

2026-09-20

964人浏览

原创

今天,阶跃正式全量开放其新一代旗舰基座模型——step5preview,定位清晰而坚定:一款专为真实世界中 agentic 任务深度优化的主力大模型。它直面ai领域一个长期存在的经典难题——“帕累托困境”:能力、效率与成本三者之间往往彼此制约;过往提升任一维度,常需以牺牲其他维度为代价;而真正的突破不在于消除取舍,而在于通过架构创新,整体外推帕累托前沿边界。

本次的关键跃迁,来自稀疏MoE(Mixture of Experts)架构的深度实践。Step5Preview 总参数量达600B,但每次推理仅激活27B,原生支持高达100万Token的上下文窗口,并原生兼容文本与视觉双模态输入。在Artificial Analysis发布的Intelligence Index榜单中,它斩获44分,稳居全球开源模型前三;更值得关注的是其单任务推理成本仅为Claude Opus5的八分之一——这意味着,同等预算可获得更强智能,或相同性能下实现显著降本,两条路径均已打通。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

阶跃甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把开源旗舰的

硬核实力已在多个高难度权威基准测试中充分显现。在Agents' Last Exam的CLI子集ALE-CLI、聚焦金融投资研究的FrontierFinance评测,以及跨领域深度推理挑战DRACO中,Step5Preview表现仅次于GPT-6Astra与Claude Opus5,大幅领先其余参评开源模型;GDPval-AA v2采用截至9月19日的最新实测数据,DeepSWE v1.1则基于SWE-agent harness,在temperature=1.0、top_p=0.95条件下完成评测。

编程能力方面,阶跃构建了自有评测体系StepCodeBench,覆盖553个独立代码仓库、9类典型开发任务、20个应用领域及33种主流编程语言。Step5Preview在整体任务成功率与跨场景鲁棒性上均展现出扎实水准,能稳定承接Bug修复、功能开发、代码重构、环境配置等真实工程需求。一段典型演示中,模型通读ESP32全系列开发文档后,自主将一块ESP32-S3开发板改造为具备蓝牙按键+语音输入能力的Vibe Coding键盘——过程中自行打开COM串口、调用摄像头、截取设备图像、模拟鼠标操作,并依据真实运行报错持续迭代调试,连续工作超三小时未中断。

阶跃甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把开源旗舰的

Build Teams.ai Apps with Anthropic Claude
Build Teams.ai Apps with Anthropic Claude

使用 @youdotcom-oss/teams-anthropic 将 Anthropic Claude 模型(Opus、Sonnet、Haiku)添加到 Microsoft Teams.ai 应用程序中。可选集成 You.com MCP 服务器以进行网页搜索和内容提取。

下载

长周期复杂任务更能体现其Agentic本质。首项实验设定24小时时限与单张H100算力资源,要求从零优化一个MLA GPU内核(头维度512、batch=1、64注意力头、8192 token序列)。Step5Preview全程自主修改CUDA代码、编译运行、吞吐测试,对“能跑通但性能下降”的方案果断回退,始终基于当前最优版本继续搜索,最终在约22小时内将峰值性能拉升至508 TFLOPS,超越Claude Opus5的493 TFLOPS。第二项实验同样限定24小时,目标是通过自动化后训练提升Qwen3-30B-A3B在AIME24上的数学解题准确率;模型自主决策标注API调用策略、数据采样方式与训练节奏,最终将准确率由53.3%提升至60%,与Opus5持平,且所用标注token更少。

在前端与多模态交互层面,Step5Preview不止于生成HTML,更能调用Blender完成3D资产建模与多轮迭代修改,并无缝接入Three.js构建可交互Web应用乃至轻量级游戏;甚至可从1922年出版的《广九铁路旅行指南》原始扫描文本中精准抽取信息,构建出含行程查询、费用计算、历史路线动态回放等功能的交互式数字产品,让尘封史料真正“活”起来。

金融领域被阶跃视为综合能力的终极试金石。团队围绕企业研究这一高复杂度流程,自研三大内部评测:FinStepBench-LiveSearch检验动态需求下的金融信息检索与交叉验证能力;CorporateValuation考察将非结构化数据与主观假设转化为可复现、可审计的估值模型的能力;DeepResearch则评估从证据采集、逻辑推演到生成完整研究报告的端到端研究闭环能力。外部基准FrontierFinance则以220道专家级题目、11543项细粒度评分标准,覆盖尽调、估值、风控、交易、宏观、ESG六大投资场景。Step5Preview在全部四项评测中均交出领先级表现。

从Step3.5Flash、Step3.7Flash一路演进至Step5Preview,阶跃始终坚持同一战略主线:下一代Scaling定律的核心,不再是单纯堆叠算力,而是让每一份算力都产生更高密度的价值。随着今日全量开放,完整模型权重将于10月15日正式发布——这款重新定义“能力—成本—效率”三角关系的开源旗舰,正静待开发者将其作为Agentic任务的日常主力,投入真实世界的复杂战场。

相关专题

更多
Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

20

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

180

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

100

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

60

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

400

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Claude Code 快速上手核心指南
Claude Code 快速上手核心指南

共0课时 | 0人学习

Claude Code 官方文档
Claude Code 官方文档

共0课时 | 0人学习

Claude Code 官方中文文档
Claude Code 官方中文文档

共0课时 | 0人学习