☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek高级研究员罗福莉在X平台发布动态,首次对外披露旗下新一代大模型MiMo-V2.6的强化学习(RL)训练进展,并同步推出实时训练可视化页面,正式开启大模型RL训练全流程公开直播。这一举措象征着小米在打通语言智能与物理世界交互、迈向通用人工智能(AGI)的关键路径上取得实质性跃升,相关底层技术方案也明确将在未来数周内分阶段开源。
在技术实现层面,MiMo-V2.6正推进高强度多任务智能体(Agent)强化学习实验。团队聚焦三大核心方向进行系统性扩容:
- 算力维度:单步训练吞吐量达约20亿Token,采用1568个Prompt × 16次Rollout的超大规模采样结构,并全面启用Fully Async(完全异步)并行机制;
- 环境维度:构建支持一次运行中动态混合多个仿真框架与真实工具链的代理式RL训练环境;
- 评估维度:引入融合测试用例驱动与量规化奖励函数的组内信用分配(Agentic In-group Credit Assignment)机制,提升策略优化精度。
训练直播页持续更新关键指标,包括进度节点、Token累计消耗、样本量、单位成本及多项内部性能曲线。数据显示:MiMo-V2.6-Pro已完成约1天19小时训练,投入达89万美元;MiMo-V2.6-Flash训练时长为1天14小时,支出39.7万美元;双版本合计训练经费已逾128万美元。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
罗福莉,这位出生于1995年的AI领域领军人物,本科就读于北京师范大学计算机科学与技术专业,硕士毕业于北京大学计算语言学研究所。其学术履历涵盖ACL顶会8篇论文(含2篇第一作者),曾主导阿里巴巴达摩院VECO多语言预训练项目及AliceMind开源生态建设,并深度参与DeepSeek-V2系列模型研发。自2023年11月加入小米以来,她全面牵头MiMo大模型体系建设,致力于打造首个面向物理世界推理与行动的端到端智能基座。今年3月,其主导迭代的MiMo-V2-Pro以万亿级参数规模位列Artificial Analysis全球大模型综合智能榜第八(品牌维度第五)。
此次MiMo-V2.6以“全链路可见、全过程可验”为原则推进RL训练直播与细节开源,不仅印证了小米在强化学习扩展定律(RL Scaling Law)上的扎实工程沉淀,更有望引领行业从依赖经验调参的“黑盒试错”,转向可复现、可验证、可协作的“极客级开源训练新范式”。










