真慢需分步排查:先确认是否为首次加载假象,再删冗余节点、换轻量模型并预热、关高开销参数、启用分块推理及禁用lora。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

确认是否真慢:先排除加载假象
打开工作流后黑屏超过40秒没反应,别急着优化——这大概率是首次加载未完成,【未加载完成就操作会导致节点失联、参数丢失】。刷新页面重试,等界面彻底变黑、右上角出现「开始生图」按钮后再动鼠标。
如果已进入编辑状态,但点击「开始生图」后进度条卡在0%或10%,说明不是流程慢,而是模型没加载成功,直接跳到第三步查红框节点。
砍掉冗余节点:从视觉层快速瘦身
按空格键拖动画面,用滚轮放大,找那些标着「Disabled」或带灰色斜杠图标的节点——它们虽不执行,但仍在占用内存解析。右键→「Remove」删掉。
重点清理三类“伪功能”节点:重复的VAEDecode(一个流程只需一个解码器)、堆叠的ImageScale(缩放节点连着缩放节点)、以及没连线的CLIPTextEncode(孤悬的提示词框不参与计算却吃显存)。
删完后点右上角「保存当前流程」,再重新运行测试。这一步能立竿见影降低30%以上初始化耗时。
模型加载提速:换轻量模型+预热机制
方法一:把CheckpointLoaderSimple节点里默认的大模型(如sdxl_1.0.safetensors,约6GB)换成轻量替代款,比如「juggernautXL_v8Rundiffusion.safetensors」或「playground-v2.5-1024px-aesthetic.safetensors」,体积小一半,加载快2~3倍。
方法二:在运行前主动触发一次“冷启动”——双击任意一个已加载模型的节点(如CheckpointLoaderSimple),不改任何参数,直接点「OK」。这会强制ComfyUI提前把模型载入显存,后续正式生图时跳过加载环节。
【切勿在未加载完成时点击「开始生图」,否则会触发二次加载,总耗时翻倍】。
参数级调优:关掉高开销选项
第一步:找到KSampler或KSamplerAdvanced节点,展开高级选项 → 关闭「Preview Image」开关。这个实时预览每步都生成小图,显存压力陡增,关掉后生图速度提升明显。
第二步:把steps(采样步数)从30降到20,CFG scale从7降到5。对多数风格化出图而言,20步+5 CFG已足够稳定,耗时直降40%,画质损失肉眼难辨。
第三步:检查「EmptyLatentImage」节点的分辨率。若原图仅512×512,却设成1024×1024潜空间,AI要多算4倍像素——按实际输出需求设,别盲目拉高。
硬件感知策略:绕过显存瓶颈
如果你用的是4GB或6GB显存的入门卡(如RTX 3050/4060),必须启用分块推理:找到KSampler节点 → 勾选「v_prediction」或「sgm_uniform」采样器 → 在下方开启「tiling」选项。它会把大图切成小块逐块处理,不爆显存,也不显著拖慢整体速度。
禁用所有LoraLoader节点(除非你明确需要那个LoRA效果)。每个LoRA加载都要额外走一遍权重融合,4GB卡上加载2个LoRA,光初始化就多花8秒。
最后,关闭浏览器其他标签页,特别是含视频或WebGL的页面——LiblibAI的ComfyUI在线版对系统资源争抢敏感,后台Chrome进程吃掉2GB内存时,工作流响应延迟会飙升。











