7 月 31 日,minimax 正式推出全新一代多模态生成模型 minimax h3,并同步宣布即将开源。
作为 MiniMax 由“垂直任务专用模型”迈向“通用多模态智能体”的关键里程碑,H3 打破传统以图像、视频、音频等单一模态生成或编辑为界限的设计范式,转而聚焦于多模态语境下的统一意图理解,从而实现更自然、更连贯的跨模态内容生成与表达。
MiniMax H3 兼容文本、图像、音频及视频等多种输入形式,支持 2K 分辨率原生输出,可一次性生成最长 15 秒的音画同步内容,在显著增强视听内容生成能力的同时,大幅降低高质量视频创作与应用的技术门槛。
在实际性能表现上,MiniMax H3 已达到商用标准,具备覆盖多类场景的内容生成实力。其在指令精准响应、文字与品牌元素准确呈现、V2V Motion Transfer(视频动作迁移)等核心能力上尤为突出,支持高精度、强可控性的多模态内容编辑与生成,广泛适配广告营销、品牌传播、电商展示、产品设计、UI/UX 交互、游戏开发等商业化应用场景。
根据 Artificial Analysis 发布的全球视频大模型评测榜单,MiniMax H3 在“视频编辑能力”单项中位列世界第一。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

MiniMax 3.0.18 是一款高效、轻量级的系统优化与多媒体增强工具。该版本在核心性能上进一步升级,提供更稳定的运行环境与更低的资源占用。主要功能包括智能内存管理、启动项优化、网络加速及高清音视频解码增强,显著提升设备响应速度与影音体验。新版修复了已知兼容性问题,并优化了界面交互逻辑,适用于日常办公与娱乐场景。MiniMax 3.0.18 秉承简洁实用的设计理念,帮助用户轻松维护系统健康,提升整体使用效率。
自创立以来,MiniMax 始终坚持文本与多模态模型双线自主研发路线,已成功开源三代 M 系列文本大模型。此次发布的 H3,则是 MiniMax 首款面向社区开源的多模态生成模型。
H3 吸收了文本大模型发展过程中已被广泛验证的有效技术路径,如复杂问题分解、推理增强(Reasoning)、长上下文扩展(Scaling Context)以及 Muon 优化器等,并将其创新性迁移至多模态理解建模、多源异构数据构建与联合训练体系中。围绕多样化任务理解与指令执行能力,MiniMax 对训练数据体系进行了多轮精细化迭代,显著提升了模型在开放输入与复杂指令下的泛化性与鲁棒性。
MiniMax H3 的视频生成定价为 0.8 元/秒(2K 分辨率),仅为当前行业主流旗舰视频模型报价的三分之一。该成本优势源于 MiniMax 自研的高压缩率 Tokenizer,有效减少视频生成所需的 Token 数量;同时,针对视频长度、分辨率及多模态理解与生成负载差异大的特点,团队在异构训练架构、动态负载均衡机制与 GPU 利用效率等方面完成系统级优化,在保障模型效果的同时,切实控制训练与推理成本。
MiniMax H3 的发布,正将业内多模态模型的竞争维度,从单一性能指标,拓展至效果、成本、开放程度与生态协同能力的综合比拼,进一步助推国产 AI 芯片与大模型软硬件协同生态的繁荣发展。与此同时,MiniMax 的多模态技术演进也正式迈入模型能力、训练效率、开源生态与产业落地四维协同推进的新阶段。
“借助 MiniMax H3,我们致力于为更多企业、开发者及内容创作者提供低门槛、高自由度的内容生产工具。H3 将在未来数日内正式开源,企业用户可在本地环境灵活部署,结合自有数据与业务逻辑进行定制化调优,更好满足安全与合规要求;芯片厂商与开源社区开发者亦可深度参与适配与性能优化工作,共同压缩使用成本、拓宽应用边界。”MiniMax 相关负责人表示,“我们将持续推动优质文本与多模态模型,从过去封闭式服务模式,走向更加开放、共建、共享的产业协作新生态。”










