Stable Video Diffusion来了，代码权重已上线-人工智能-PHP中文网

首页

科技周边

人工智能

Stable Video Diffusion来了，代码权重已上线

PHPz

Nov 22, 2023 pm 02:30 PM

ai模型

AI 画图的著名公司 Stability AI，终于入局 AI 生成视频了。

这周二，基于稳定扩散的视频生成模型 Stable Video Diffusion 推出了，AI 社区立即展开了讨论

Stable Video Diffusion来了，代码权重已上线

很多人都表示「我们终于等到了」。

Stable Video Diffusion来了，代码权重已上线

项目链接：https://github.com/Stability-AI/generative-models

现在，你可以利用现有的静态图像生成几秒钟的视频

基于 Stability AI 原有的 Stable Diffusion 文生图模型，Stable Video Diffusion 成为了开源或已商业行列中为数不多的视频生成模型之一。

Stable Video Diffusion来了，代码权重已上线

但目前还不是所有人都可以使用，Stable Video Diffusion 已经开放了用户候补名单注册（https://stability.ai/contact）。

根据介绍，稳定视频传播可以轻松适应各种下游任务，包括通过对多视图数据集进行微调，从单个图像进行多视图合成。稳定人工智能表示，正在计划建立和扩展这一基础的各种模型，类似于围绕稳定扩散建立的生态系统

Stable Video Diffusion来了，代码权重已上线

通过稳定的视频传播，可以以每秒3到30帧的可定制帧速率生成14和25帧的视频

在外部评估中，Stability AI 证实这些模型超越了用户偏好研究中领先的闭源模型：

Stable Video Diffusion来了，代码权重已上线

Stability AI 强调，Stable Video Diffusion 现阶段不适用于现实世界或直接的商业应用，后续将根据用户对安全和质量的见解和反馈完善该模型。

Stable Video Diffusion来了，代码权重已上线

论文地址：https://stability.ai/research/stable-video-diffusion-scaling-latent-video-diffusion-models-to-large-datasets

稳定的视频传输是稳定AI开源模型家族中的一员。现在看来，他们的产品已涵盖图像、语言、音频、三维和代码等多个模态，这充分证明了他们对提升人工智能的承诺

Stable Video Diffusion 的技术层面

稳定视频扩散模型作为一种高分辨率视频的潜在扩散模型，已经达到了文本到视频或图像到视频的 SOTA 水平。最近，通过在小型高质量视频数据集上插入时间层并进行微调，将2D图像合成训练的潜在扩散模型转变为生成视频模型。然而，文献中的训练方法千差万别，该领域尚未就视频数据整理的统一策略达成一致

在 Stable Video Diffusion 的论文中，Stability AI 确定并评估了成功训练视频潜在扩散模型的三个不同阶段：文本到图像预训练、视频预训练和高质量视频微调。他们还证明了精心准备的预训练数据集对于生成高质量视频的重要性，并介绍了训练出一个强大基础模型的系统化策划流程，其中包括了字幕和过滤策略。

Stability AI 在论文中还探讨了在高质量数据上对基础模型进行微调的影响，并训练出一个可与闭源视频生成相媲美的文本到视频模型。该模型为下游任务提供了强大的运动表征，例如图像到视频的生成以及对摄像机运动特定的 LoRA 模块的适应性。除此之外，该模型还能够提供强大的多视图 3D 先验，这可以作为多视图扩散模型的基础，模型以前馈方式生成对象的多个视图，只需要较小的算力需求，性能还优于基于图像的方法。

Stable Video Diffusion来了，代码权重已上线

具体而言，训练该模型成功需要经历以下三个阶段：

阶段一：图像预训练。本文将图像预训练视为训练 pipeline 的第一阶段，并将初始模型建立在 Stable Diffusion 2.1 的基础上，这样一来为视频模型配备了强大的视觉表示。为了分析图像预训练的效果，本文还训练并比较了两个相同的视频模型。图 3a 结果表明，图像预训练模型在质量和提示跟踪方面都更受青睐。

Stable Video Diffusion来了，代码权重已上线