若webui无视频生成功能,需安装animatediff扩展并部署运动模型、使用mov2mov插件逐帧重绘、通过批量图生图+ffmpeg合成、用ebsynth utility补帧或加载temporalnet增强一致性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望使用Stable Diffusion将文本或图像转化为短视频,但当前WebUI界面中未显示视频生成功能,则可能是由于缺少必要扩展、运动模型未正确部署或配置参数不匹配。以下是解决此问题的步骤:
一、安装AnimateDiff扩展并配置运动模型
AnimateDiff是目前最主流的Stable Diffusion文本生成视频(Text-to-Video)方案,它通过向U-Net注入轻量级运动模块(Motion Module),使静态图生图模型具备帧间时序建模能力。该方法无需重训整个模型,兼容绝大多数SD 1.5/2.x及SDXL检查点。
1、打开AUTOMATIC1111 WebUI,在顶部导航栏点击“扩展” → “可用”选项卡。
2、在搜索框中输入"animatediff",找到"sd-webui-animatediff",点击“安装”按钮。
3、安装完成后,点击“重启UI”(非关闭浏览器,而是页面内触发重启)。
4、访问Hugging Face链接:https://huggingface.co/guoyww/animatediff/resolve/main/mm_sd_v15_v2.ckpt,下载motion module文件。
5、将下载的mm_sd_v15_v2.ckpt放入路径:stable-diffusion-webui/extensions/sd-webui-animatediff/model/(若目录不存在,请手动创建)。
6、再次重启WebUI,进入文生图界面后,应可见“AnimateDiff”标签页及运动参数面板。
二、使用Mov2mov插件逐帧重绘生成视频
Mov2mov属于图像驱动型视频生成方法,适用于已有参考视频或关键帧的风格迁移任务。其本质是对输入视频逐帧调用图生图(img2img)流程,利用ControlNet约束动作与结构,实现可控重绘。该方式对显存压力较低,适合中端GPU用户。
1、进入WebUI的“扩展” → “从URL安装”,粘贴地址:https://github.com/ArtVentureX/sd-webui-mov2mov,点击安装。
2、重启WebUI后,在左侧菜单栏确认出现“Mov2mov”新选项卡。
3、上传原始视频(MP4/WebM格式,建议≤10秒、分辨率≤768×512)。
4、设置基础参数:重绘幅度(Denoising strength)=0.4,启用OpenPose + Depth ControlNet,并确保对应预处理器已加载。
5、指定目标模型与提示词,点击“生成”,系统将自动拆帧、重绘、合成为新视频文件。
三、采用批量图生图+FFmpeg合成方案
该方法绕过专用视频扩展,完全基于WebUI原生图生图功能,通过脚本控制多轮推理生成图像序列,再用外部工具合成视频。灵活性高,便于调试单帧质量,且规避部分扩展兼容性问题。
1、准备一张高质量源图,作为所有帧的初始输入图像。
2、在WebUI中切换至“图生图”界面,勾选“迭代批次(Batch count)”并设为所需帧数(如24帧)。
3、在提示词中加入“frame 1 of 24”, “frame 2 of 24”…等动态标识(需配合Prompt Matrix或Dynamic Prompting脚本支持)。
4、设置种子(Seed)为-1以启用随机变化,同时保持CFG Scale=7–9与采样步数=20–30平衡稳定性与多样性。
5、生成完毕后,前往输出目录,使用FFmpeg命令行执行合成:ffmpeg -framerate 12 -i "output_%05d.png" -c:v libx264 -pix_fmt yuv420p output.mp4。
四、启用Ebsynth Utility进行关键帧引导补帧
Ebsynth Utility并非直接集成于SD WebUI,而是一个独立的后期处理工具,擅长在仅提供少量人工精修关键帧(如3–5帧)的前提下,自动传播纹理与细节至中间帧,显著提升视频连贯性与艺术一致性,常与AnimateDiff或Mov2mov结果联用。
1、从GitHub下载Ebsynth Utility v2.4.0或更高版本(Windows/Linux版)。
2、将AnimateDiff或Mov2mov生成的首帧、中帧、末帧导出为PNG,并用Photoshop或Clip Studio Paint进行手动优化(修正闪烁、畸变、结构断裂)。
3、在Ebsynth Utility中导入原始视频(未重绘版)作为“Source Video”,导入精修后的关键帧作为“Style Images”。
4、设置Patch Size=32, Search Radius=128, Iterations=8,启用“Preserve Edges”选项。
5、点击“Run Ebsynth”,等待处理完成,输出目录将生成补全后的完整帧序列。
五、加载TemporalNet增强帧间一致性
TemporalNet是专为缓解Mov2mov类方法闪烁问题设计的ControlNet子模块,通过引入时间维度卷积核,显式建模相邻帧特征差异,在不增加显著显存开销前提下提升运动平滑度。需单独安装并启用。
1、从GitHub仓库https://github.com/Kosinkadink/ComfyUI-AnimateDiff-Evolved获取TemporalNet模型文件(temporalnet_fp16.safetensors)。
2、将其放入stable-diffusion-webui/extensions/sd-webui-controlnet/models/目录。
3、重启WebUI后,在ControlNet面板中选择“temporalnet”模型,启用并设置Weight=0.8、Resize Mode=Scale to Fit (Inner Fit)。
4、上传视频首帧与第二帧构成双帧输入(需开启ControlNet“Batch”模式),其余设置保持与Mov2mov一致。











