xai 宣布对视频生成模型 imagine video 1.5 进行关键性迭代,正式引入图像参考、语音参考、纯文本驱动视频生成以及原生 1080p 分辨率输出四大核心能力,显著增强 ai 视频创作过程中的角色连贯性、场景精准度与画面表现力。现阶段,文本到视频(text-to-video)及原生 1080p 视频生成功能已全面登陆 grok imagine 网页端、ios 应用与 android 应用;而图像参考与语音参考功能则率先面向美国地区的 supergrok heavy 和 supergrok plus 订阅用户开放,后续将逐步扩展至更广泛用户群体。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

本次升级重构了视频生成的工作流逻辑,赋予创作者更高自由度的控制方式:既可仅凭自然语言提示直接生成视频,也可上传参考图像以锁定特定人物形象、产品外观或环境构图;更进一步,支持同步输入角色图像与对应语音样本,确保该角色在多镜头、多角度画面中始终维持统一的视觉特征与声线风格。xAI 指出,Imagine Video 1.5 单次生成任务最多可接受七组独立视觉参考,分别用于锚定人脸细节、产品结构或空间元素,从而实现颗粒级的内容调控。
在多重参考协同机制下,用户得以灵活组合控制维度——例如固定人物身份的同时更换背景环境,或保持场景框架不变而切换不同角色,亦可仅调整动作姿态而不影响整体视觉设定。语音参考功能则针对性地攻克了传统 AI 视频中角色音画脱节、声音漂移等长期痛点,有效保障同一角色在跨片段叙事中面部一致性与语音稳定性双重统一。
面向技术集成场景,xAI 已通过其官方 API 开放 grok-imagine-video-1.5 模型调用权限,全面支持图像引用、文本生成视频及原生 1080p 输出能力。开发者可通过 API 提交提示词、参考图像 URL、目标时长、宽高比与分辨率等参数完成视频合成;语音参考则需通过特定请求协议接入。
Imagine Video 1.5 于上月首次亮相,xAI 当时即强调该版本在动态流畅性、物理行为建模及音频合成质量等方面取得实质性突破。此次功能拓展进一步夯实了模型在身份识别、场景理解与产品级细节还原上的能力边界,标志着 AI 视频生成正加速脱离基础帧序列拼接阶段,向具备专业影视工业属性的多模态内容生产平台演进。











