minimax凭借全模态闭环、moe稀疏架构、token高性价比、模型自我进化及全球化商业化五大优势领跑ai赛道:五模态统一token化、2300亿参数仅激活100亿、输入价仅为openai的17%、m2.7承担30%–50%研发工作、海外收入占比超60%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您关注近期AI大模型领域的市场动态与技术讨论,会发现Minimax频繁出现在全球开发者社区、资本报告与企业采购清单中。这种高热度并非偶然,而是由其在多模态能力、成本结构、工程架构与商业化路径上的系统性优势共同驱动。以下是对其核心技术优势的逐层解析:
一、全模态闭环能力构建真实场景覆盖力
Minimax从成立初期即放弃单模态路径,选择以“文本+语音+图像+视频+音乐”五模态统一Token化为底层范式,使不同模态数据在统一神经网络中完成对齐与协同推理,避免传统拼接式多模态带来的语义割裂问题。该设计直接支撑其模型在跨模态任务中保持一致性输出,例如图生视频时角色动作与语音节奏同步、代码生成中自动匹配文档截图与函数逻辑。
1、M2.7基座模型支持文本、语音、图像三模态联合输入,并可原生触发Hailuo 2.3视频生成模块;
2、Speech-2.6语音模型采用端到端统一编解码器,在ELO评测中达1153分,显著高于行业均值;
3、Hailuo 2.3在SuperCLUE图生视频榜单排名第4,是唯一进入前六的创业公司模型,且支持角色一致性控制与动态细节还原。
二、MoE稀疏激活架构实现性能与成本双突破
Minimax在M2系列中大规模应用MoE(Mixture of Experts)架构,总参数量达2300亿,但单次推理仅激活约100亿参数,既保障复杂任务处理能力,又大幅降低显存占用与计算开销。该设计使模型在消费级显卡(如RTX 4090)上即可完成本地部署,同时支撑企业级API服务的高吞吐需求。
1、M2.5闪电版推理速度达100 token/秒,标准版为50 token/秒,两者核心业务能力完全一致;
2、FP8混合精度训练配合自研Forge框架,实现40倍训练加速;
3、在SWE-Bench Verified测试中,M2.5编码得分80.2%,与Claude Opus 4.6(80.8%)几乎持平,且具备原生Spec能力——可主动拆解功能架构再编码。
三、token性价比重构AI经济模型
Minimax将单位智能成本作为核心竞争力指标,通过电力-算力协同优化、硬件利用率提升与定价策略设计,实现行业最低token价格。其M2.1输入价仅为0.3美元/百万token,相当于OpenAI的17%、智谱的55%,在智能指数全球前十模型中性价比稳居首位。
1、中国工业电价(0.36–0.6元/度)较美国低30%–40%,西部绿电成本优势达50%–70%;
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
2、电力占token成本70%以上,M2.5实现每小时1美元连续运行成本,1万美元可支持4个Agent全年工作;
3、输出token价格为2.4美元/百万,仅为Claude Opus的1/10,GLM-5的1/3。
四、“模型自我进化”范式开启研发流程重构
M2.7首次提出“模型自我进化”概念,将大模型嵌入自身研发闭环,使其不仅执行任务,还参与数据处理、实验设计、训练调优与评测反馈等环节。该能力依赖于Agent Harness执行框架与强化学习反馈机制,标志着AI从工具型向研发协作者演进。
1、M2.7可承担30%至50%的研发流程工作量,包括文献调研、Bug排查、日志分析与代码修复;
2、在内部测试中,模型可连续执行超过100轮“分析—改进—验证”循环,自主调整采样参数与工作流策略;
3、在VIBE-Pro与Terminal Bench 2真实工程场景测试中,M2.7分别取得55.6%和57.0%正确率,线上生产系统故障修复时间缩短至3分钟以内。
五、全球化商业化路径验证规模化变现能力
Minimax未将重心放在国内流量入口争夺,而是依托高性价比与多模态兼容性,快速切入海外开发者生态。其模型已在OpenRouter、Google Vertex AI、Azure AI等主流平台部署,并成为Notion平台唯一开源模型选项。2025年前9个月,海外收入占比超60%,形成“海外付费能力反哺模型迭代”的正向循环。
1、在OpenRouter平台,海外开发者占比93.99%,Minimax中国模型Token消耗占比达61%;
2、发布12小时内登顶OpenRouter热度榜,一周内周调用量达3.07T tokens,超过Kimi、GLM-5与DeepSeek V3.2总和;
3、编程相关Token消耗占比从10%提升至50%+,智能体工作流占输出量一半以上。










