veo 3 是系统性重构的多模态视频生成模型,聚焦多模态协同生成与物理真实感建模:支持文本+图像+音频三模态联合编码,引入运动场预测实现惯性运动与遮挡恢复,采用四阶段解耦训练与jax+tpu工程优化。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Veo 3 的训练架构不是对 Veo 2 的简单增强,而是围绕“多模态协同生成”和“物理真实感建模”两个核心目标,进行的系统性重构。升级重点不在堆参数,而在结构分工更细、模态耦合更深、计算调度更智能。
多模态输入融合机制升级
Veo 2 主要依赖文本提示驱动视频生成,音画分离;Veo 3 则原生支持文本+图像+音频三模态联合编码。其关键变化在于:UL2 编码器不再仅处理文字,而是与 ViT(视觉Transformer)和 Audio Spectrogram Transformer 并行编码,再通过跨模态注意力层对齐语义——比如用户输入“机器人说‘启动协议’并伴随机械音效”,模型会同步对齐口型动作、语音波形与文本语义,避免后期配音导致的唇形错位。
- 文本路径:UL2 编码 → 语义嵌入向量
- 图像路径:ViT 分块编码 → 视觉锚点嵌入
- 音频路径:梅尔频谱编码 + 时序Transformer → 声学特征嵌入
- 三者在潜在空间中通过可学习的交叉门控(Cross-Gated Fusion)加权融合,形成统一条件提示
时空建模结构从“帧堆叠”走向“运动场建模”
Veo 2 采用类扩散的帧级去噪策略,易出现运动抖动或物体形变;Veo 3 引入显式运动建模模块(Motion Field Predictor),在潜在空间中先预测光流场与变形场,再指导视频重建。这使得生成内容能自然呈现惯性运动、弹性形变、遮挡恢复等物理规律行为。
Veo 3.1增强了音频生成能力、提示词理解能力和角色一致性控制。支持多参考图生成、场景扩展(Scene Extension)、更长视频制作以及更精准的镜头控制,同时提升了画面真实感和叙事能力。是当前 Google 主推的旗舰视频生成模型。
- 底层:3D卷积提取局部时空特征
- 中层:运动场预测头输出稀疏光流+体素变形向量
- 顶层:Transformer-XL 对长序列运动轨迹建模(支持60秒连续生成)
- 实测显示,Veo 3 在“奔跑人物腿部摆动一致性”指标上比 Veo 2 提升57%
训练流程分阶段解耦 + 动态计算分配
Veo 2 训练采用端到端联合优化,资源消耗大、调试困难;Veo 3 明确拆分为四阶段流水线,并引入动态计算路由机制:
- 预处理阶段:自动清洗 WebVid-10M 等数据集,剔除低质量帧+语音失步样本
- 表征对齐阶段:冻结主干,仅训练跨模态投影头,拉近图文音嵌入距离
- 潜在生成阶段:用轻量级扩散模型学习压缩视频潜变量去噪
- 解码精修阶段:调用专用超分+时序插帧网络,提升1080p细节与帧率稳定性
- 训练时根据 batch 内容复杂度,自动启用/跳过部分子模块(如简单静物场景跳过运动场预测)
工程支撑体系同步升级
架构升级离不开底层工程能力适配。Veo 3 全面转向 JAX + TPU v5e 集群,并构建了配套的可观测训练平台:
- 采用 pjit + sharding 自动切分模型参数与激活值,单卡显存占用降低38%
- 内置训练健康看板,实时监控“文本-画面对齐度”“音画同步误差”“运动连贯性熵值”等业务指标
- 支持热插拔式模块替换——例如将 Motion Field Predictor 替换为自研的神经ODE求解器,无需重训整网










