minimax m3凭借1m上下文与自研msa架构,能精准捕获长文本关键锚点、维持复杂结构记忆,实现在小说推理、代码调试、技术文档分析等场景中跨卷、跨文件、跨层级的可靠长程推理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让AI一次性读完《三体》三部曲原文+全部设定集+粉丝分析长评+相关论文,中间不丢失任何伏笔和人物关系,还要能基于全部内容回答“叶文洁在红岸基地的决策链路如何影响后续宇宙社会学推演”这类跨卷问题——MiniMax M3的1M上下文能力就是为此设计的。
为什么100万tokens不是堆参数,而是真能“记住”
传统Transformer模型处理128K上下文时,计算量已是4K窗口的约1024倍;若强行拉到1M,理论计算开销会暴涨近6万倍,根本无法落地。M3用自研MSA(MiniMax Sparse Attention)架构破局:第一步用轻量索引query对KV缓存做Block Max Pooling,快速筛出Top-k高相关性块;第二步只在这些块内执行完整注意力计算。
这一步的关键在于【KV分块策略更精细,且采用块内取最高分(max-pool)而非均值(mean-pool)】——它能更可靠地捕获长文本中的关键锚点,比如“第27章末尾那句‘宇宙不是童话’”,而不是被前后大段描写稀释掉。
实测显示:在100万token输入下,M3单token计算量仅为上代模型的1/20,prefill加速超9倍,decoding加速超15倍。
实际场景中,1M上下文怎么用才不浪费
方法一:整仓投喂代码+文档+日志
把一个含327个文件的Python项目(含requirements.txt、README.md、tests/目录、.git/logs历史)压缩为纯文本丢给M3,它能准确定位某次commit引入的bug,并结合test_failure.log里的报错堆栈和最近三版PR描述,给出修复建议——全程无需切片、分段或摘要。
方法二:小说级多线叙事推理
上传《冰与火之歌》五卷正文(约420万汉字,经token化后约78万tokens)+官方家谱图(SVG格式)+粉丝整理的时间线Excel(转为Markdown表格),M3可回答“如果雷加没有在赫伦堡比武大会上为莱安娜戴上冬玫瑰,后续血色婚礼的触发条件会发生哪些连锁变化”,并引用原文第几卷第几章佐证。
【注意:输入必须保持原始结构,不要手动删减注释、空行或章节标题,否则MSA的块筛选机制可能错过关键上下文锚点】
对比其他百万级模型,M3的“记得住”体现在哪
① 同样喂入一本50万字技术白皮书+配套200页PDF图表(OCR后转文本),GPT-5.5在回答“图3.7中异常波动是否与第4.2节提到的缓冲区溢出有关”时,会混淆图编号与章节编号;M3能精确定位到“图3.7”在文本中的绝对位置,并关联到第4.2节倒数第三段的汇编指令描述。
② 在SWE-Bench Pro测试中,M3对跨文件调用链的理解准确率达83.6%,比Gemini 3.1 Pro高11.2个百分点——这背后是MSA对长程依赖建模更稳,不会因中间插入大量日志或注释而丢失函数入口与出口的映射关系。
③ 当输入含嵌套结构的实验记录(如“实验A→子实验A1/A2→A1又分三次重复→每次附带截图与终端输出”),M3能维持完整的层级记忆,而Claude Opus 4.7在第三次嵌套后开始模糊子实验归属。











