☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

8 月 3 日,AI 科技公司 MiniMax 正式对外开源其全新一代通用视频生成模型
在输出能力方面,H3 可生成时长为 4 至 15 秒的高质量音视频内容,帧率稳定达 24 FPS,并支持 32 kHz 立体声音频编码。用户可根据创作需求自由选择 21:9、16:9、4:3 或 1:1 等主流画面比例;基础模式下默认以较短边为 768 像素进行渲染,兼顾效率与清晰度;而启用专属的 H3-Regenerate-2K 超分路径后,则可进一步输出分辨率达 2K 的精细影像。
语言支持层面,H3 已实现对阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、西班牙语、葡萄牙语及俄语共 11 种国际主流语言的稳健交互,大幅增强全球化应用场景的适配性。
为匹配不同层级的创作需求,H3 提供两类差异化输入架构:H3-Base-FL2VA 首尾帧驱动模式,允许输入 0–2 张图像,灵活支撑文生视频、首帧延展、尾帧回溯以及首尾协同生成等多种范式;而 H3-Base-Ref2VA 全模态参考模式则支持最多 9 张图像、3 段视频(累计时长≤15 秒)及 3 段音频的混合输入,单次请求最多容纳 12 个媒体文件,赋予专业用户前所未有的多维控制精度。
从底层技术架构看,完整版 MiniMax H3 由三大核心组件构成:H3-Context-IR(上下文中间表征模块),负责将复杂、模糊甚至多义的用户指令解析为结构化、可执行的语义表示,是保障生成质量与意图对齐的核心枢纽;H3-Base 模块承担基础音视频合成任务,输出分辨率为 768p 的初始结果;H3-Regenerate-2K 模块则通过将初代输出与原始上下文联合反馈,完成高保真 2K 超分辨率重建,在保留动态细节的同时大幅提升画面锐度与纹理真实感。
目前,MiniMax H3 已依据 MiniMax H3 Community License 开源发布,全部代码、权重及配套资源已同步上线











