minimax m3强在不用moe而自研msa稀疏注意力,将单token计算量降至上代1/20,首次实现国产模型同时支撑百万token上下文、原生多模态与自主agent三重能力。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想快速掌握MiniMax M3到底强在哪、为什么能跑通100万Token上下文、凭什么在SWE-Bench Pro上压过GPT-5.5,而不是被一堆技术术语绕晕——这篇文章只讲清三个硬核事实:它没用MoE,它靠MSA把注意力计算量砍到上一代的1/20,它第一次让国产模型同时扛住长文本、多模态、自主Agent三重负载。
为什么M3敢不用MoE?
主流大模型都在堆专家数量,比如Mixtral 8×7B、DeepSeek-V2 236B;M3反其道而行,直接弃用MoE架构。【这不是保守,而是算力账算清楚了】 MoE在短文本场景有稀疏优势,但当上下文拉到100万Token时,路由开销、专家激活抖动、显存碎片会指数级放大——实测中MoE模型在128K以上就出现解码延迟跳变,而M3在1M Token下仍保持线性增长。
MiniMax选择从注意力机制底层重写规则,把“每个token都要看全序列”这个Transformer原罪,改成“每个query只关注最相关的32个key”。这步改动让QK^T矩阵从1T元素压缩到32M元素,显存占用从理论2TB降到实际16GB。
MSA不是“裁剪”,是动态筛选
方法一:静态稀疏(如Block Sparse)——提前划分固定区域,简单但漏关键信息;
方法二:Top-K稀疏(如Llama-3的FlashAttention-3)——每层选Top-K相似度token,效果好但K值难调;
方法三:MSA的动态门控稀疏——用轻量级gate网络实时预测哪些key对当前query真正重要,【gate参数仅占模型总参数0.03%,却决定99%的注意力路径】。
这个gate不参与主干梯度回传,只在推理时做一次前向判断。它让M3在处理代码仓库时自动聚焦函数定义+调用链,在分析会议视频时锁定发言人+PPT帧+字幕时间戳,而不是靠人工设定规则。
1M上下文不是数字游戏
第一步:把三体三部曲(约120万汉字)喂给M3,它能准确回答“第2卷第7章里,叶文洁向谁透露了红岸基地坐标?”
第二步:上传一个含57个文件的GitHub仓库ZIP包,M3在10秒内完成依赖图构建+高危函数标记+重构建议生成;
第三步:拖入一段2小时Zoom会议录像+同步OCR文字稿,M3输出带时间戳的决策清单:“00:47:22张工提出API限流方案→01:03:15李经理否决→01:12:44王总监拍板采用熔断降级”。
这三步背后是MSA的跨模态对齐能力:文本token、代码AST节点、视频关键帧特征向量,全部映射到同一稀疏注意力空间,共享gate筛选逻辑。没有这个统一底座,多模态只是拼接,长上下文只是缓存。
M3的Agent能力怎么来的?
不是加插件,不是套框架——M3把工具调用、环境观测、动作反馈全部编码进token流。比如执行“查服务器CPU负载并重启卡死进程”,它生成的token序列天然包含:
• 工具名(ssh)→ 参数(user@host)→ 命令(top -b -n1 | grep python)→ 解析规则(提取%CPU列>90的PID)→ 下一动作(kill -9 {PID})。
这种端到端生成能力来自Claw-Eval训练范式:用真实Linux终端轨迹构造监督信号,强制模型学会“观察→推理→行动→验证”的闭环节奏。M3在Claw-Eval上得分比第二名高11.3%,差距主要来自失败后的自我纠错速度——平均2.7步内修正错误命令,而竞品需5.4步。











