是,因显存不足。“cuda out of memory”报错源于模型加载、高分辨率采样、controlnet叠加等导致vram耗尽,尤其在4–8gb显存设备上,需通过--lowvram启动、降分辨率、精简工作流及启用block swap等综合优化。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LiblibAI整合包里的ComfyUI运行时频繁报“CUDA out of memory”,生成中途崩溃、工作流卡死、高清图直接无法启动——这些问题都指向显存资源被过度挤占,而非硬件本身不可用。
启动参数强制启用低显存模式
首次运行或重启ComfyUI前,必须修改启动命令。在LiblibAI的启动器界面中,点击右上角「设置」→「高级设置」→ 找到「自定义启动参数」输入框,填入:【--lowvram --always-gpu】。这一步不能跳过,否则后续所有优化都会失效——【--lowvram】会禁用模型权重缓存、自动卸载闲置节点,是4–8GB显存设备的生存底线。
若使用.bat脚本启动,需手动编辑文件,在python main.py后追加这两个参数;未加参数直接双击运行,默认走标准模式,显存占用立刻翻倍。
分辨率与批量大小双降级
方法一:图像尺寸砍半再起步
将输出分辨率从768×768直接改为512×512。显存占用与像素总数平方成正比,768²=589824,512²=262144,后者仅占前者的44%,对8GB显卡已是安全阈值。
方法二:批处理数量归零
把batch_size参数从2或4强行设为1。哪怕你只想同时出两张图,也必须拆成两次运行——多一张图就多一份中间特征图缓存,而ComfyUI默认不释放,显存会线性堆高直至溢出。
注意:不要依赖“Hires. fix”自动放大来绕过分辨率限制。它会在第二阶段重新加载VAE和UNet,等于重复消耗一次显存,反而更容易崩。
精简工作流中的隐性显存大户
第一步:关闭所有未连接的LoRA加载节点
即使LoRA节点没连入主流程,只要它存在于画布上且已加载模型,就会常驻显存。右键→「删除」或先断开输入再禁用(右键→Disable)。
第二步:替换VAE为taehu87的tiny版本
原生SD 1.5 VAE约占用0.8GB显存,而taehu87/tiny-sd-vae-ft-mse-512(.safetensors格式)仅需0.3GB,精度损失肉眼不可辨。下载后放入ComfyUI/models/vae/,在工作流中改选该文件即可。
第三步:停用ControlNet预处理器图像缓存
在ControlNet Apply节点前,插入「CleanCacheNode」(需提前安装ComfyUI-CleanCache插件)。勾选“Clear Preprocessor Cache”,每次执行完预处理立刻清空CPU内存中暂存的边缘图/深度图——这部分数据虽不占VRAM,但会挤占RAM,间接导致系统启用虚拟内存,拖慢模型加载,诱发显存分配失败。
启用Block Swap动态模块交换(WanVideoWrapper专用)
如果你正在跑图生视频类工作流(如Wan2.2、AnimateDiff),必须开启Block Swap:
① 确保已安装ComfyUI-WanVideoWrapper插件;
② 在节点面板中找到「WanVideoSetBlockSwap」节点,拖入画布;
③ 再添加一个「WanVideoBlockList」节点,双击编辑,填入“0-5,8”表示将UNet前6层和第9层设为可交换模块;
④ 将模型加载节点(CheckpointLoaderSimple)的输出 → WanVideoSetBlockSwap的model输入;
⑤ 将WanVideoSetBlockSwap的输出 → 后续所有视频生成节点的model输入。
该机制会让非当前计算所需的Transformer块自动卸载到系统内存,实测可降低峰值显存35%以上。但切记:系统内存必须≥32GB,否则卸载后无处存放,反而触发OOM。











