minimax m3能处理100万tokens并超越gpt-5.5,核心在于其自研msa稀疏注意力架构:先通过索引探路快速定位高价值kv块,再仅对这些块执行稠密计算,跳过低信息密度区域,实现prefill提速9.7倍、decoding提速15.6倍、单token计算量降至上代1/20。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想弄懂MiniMax M3为什么能一口气处理100万tokens的长文档、还能在编程和Agent任务中跑赢GPT-5.5,就得先看透它底层那个叫“稀疏注意力”的新引擎——它不是简单地把计算砍掉一部分,而是让模型学会像人一样“挑重点看”。
传统注意力为什么撑不住百万上下文
先说清楚问题在哪:标准Transformer里的注意力机制,要求每个词(Query)都跟整段文本里所有词(Key-Value)挨个算相关度。一段100万字的代码仓库,光是这一步就要做1万亿次乘加运算,显存爆、速度慢、电费贵——【O(N²)复杂度是硬伤,不是调参能绕开的】。
这不是模型“不够聪明”,是数学结构本身卡住了脖子。
稀疏注意力不是“偷懒”,是“精准调度”
MiniMax M3用的是自研MSA(MiniMax Sparse Attention),核心思路就两个阶段:
方法一:Index Attention(索引探路)
先用一个轻量级的“索引查询”(Idx Q)快速扫一遍全部KV块,对每一块做Block Max Pool(块级最大池化),只保留块内最突出的那个信号;再选出Top-k得分最高的块坐标——这步耗时不到原计算的5%。
方法二:Sparse Attention(稀疏计算)
真正的Query(Q1/Q2/Q3)只跟上一步挑出来的那几个高价值KV块做完整Attention计算,其余99%的token直接跳过。就像查资料时先翻目录再精读章节,而不是逐页通读。
这一步的关键在于:【跳过的不是噪声,而是已被验证为低信息密度的区域;保留的也不是随机片段,而是经索引机制确认的语义高亮区】。
M3的两阶段设计为什么比DeepSeek V4更直接
第一步:用索引机制定位关键块
第二步:只在定位块上执行稠密计算
整个流程没有压缩、不丢原始token、不引入额外重建误差。对比DeepSeek V4的CSA+HSA两级结构(先压缩再补救),M3走的是奥坎姆剃刀路线——Routing准,就不需要补救。
实测数据很说明问题:在100万token长度下,Prefill提速9.7倍,Decoding提速15.6倍,单token计算量压到M2的1/20。











