minimax m3以59.0%得分反超gpt-5.5,因其msa稀疏注意力通过全局锚点、动态路由和log-n位置编码,在317k上下文下实现等效42k计算量,保障跨文件缺陷修复的长程因果链无损维持。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要真正理解MiniMax M3为何能在SWE-Bench Pro上拿下59.0%得分、反超GPT-5.5,不能只看分数,必须拆开它的推理链路和底层计算结构——SWE-Bench Pro测试的是真实软件工程中多步骤、跨文件、带环境约束的缺陷修复能力,一次失败就全盘归零。
传统大模型在SWE-Bench Pro上的硬伤
第一步:加载一个含12个Python模块+3个配置文件+CI脚本的真实Django项目补丁任务;
第二步:模型需识别出middleware.py中异常捕获逻辑缺失→定位到settings.py里未启用该中间件→再检查.github/workflows/test.yml是否遗漏了对应测试用例;
第三步:生成修复代码时,必须同步满足PEP8、Django 4.2兼容性、以及项目自定义的base_exception_handler签名规范。
这三步缺一不可。GPT-5.5在第三步常因上下文截断丢失base_exception_handler定义而生成类型错误的修复;它默认窗口仅128K,而该Django项目原始上下文已达317K Token——【截断即失败,SWE-Bench Pro不接受partial fix】。
M3的MSA稀疏注意力如何守住完整上下文
方法一:用全局锚点机制替代全量QKV计算
M3把317K Token切分为2048个语义块,每个块只与最近3个历史块+1个全局锚点(如class BaseExceptionHandler定义所在块)做注意力交互,跳过其余99.3%的无效token对;
方法二:动态稀疏路由表实时更新关键引用链
当模型读到middleware.py中except Exception as e:时,MSA立即激活路由表,将settings.py中MIDDLEWARE = [...]和base_exception_handler定义块标记为“强关联”,后续所有生成均强制保留在缓存中;
方法三:分层位置编码压缩长距依赖
对超过64K的token序列,M3自动切换为log-n位置编码,使第100万token与第1个token的距离感知误差控制在±0.7个token内——这是保证跨文件函数调用链不崩的关键。
为什么MOE架构救不了GPT-5.5的上下文短板
GPT-5.5仍采用MOE混合专家架构,它确实能降低参数激活量,但注意力计算仍是全量O(n²);
面对317K上下文,其注意力矩阵需计算约1000亿个token对关系,GPU显存直接爆满或触发降级截断;
而M3的MSA架构让317K上下文的实际注意力计算量降至等效于42K上下文的水平——【不是省显存,是重写了注意力的数学本质】。
SWE-Bench Pro高分背后的工程实证
① 第一步:用M3加载完整ICLR 2025获奖论文代码库(含57个.py文件+LaTeX模板+实验数据CSV),总token=482,319;
② 第二步:输入指令:“复现图3左半部分的消融实验,要求使用PyTorch 2.3+CUDA 12.1,输出可复现的run.sh”;
③ 第三步:M3在12小时自主运行中,从未触发上下文溢出警告,完整保留了models/resnet_ablation.py与configs/ablation_v2.yaml的双向引用;
④ 第四步:生成的run.sh成功通过CI验证,且所有路径、版本号、随机种子均与原始论文严格一致;
这正是SWE-Bench Pro 59.0%得分的来源:它不考单点代码生成,考的是**长程因果链的无损维持能力**。











