可从零搭建多模态穿搭推荐agent:第一步创建多模态bot并开启图片输入;第二步接入qwen-vl/minicpm-v模型,注入潮流知识库或配置识别+搭配工作流;第三步标准化图片预处理与尺寸限制;第四步用卡片消息+图片生成插件输出可视化搭配方案。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想让AI根据你的衣橱照片自动推荐今日穿搭、分析单品潮流指数、生成虚拟试穿效果图,又担心扣子(Coze)平台操作复杂、插件配置混乱、视觉模型调用失败?本指南直接带你从零搭建一个能看图识衣、懂时尚逻辑、会生成搭配建议的视觉智能Agent,跳过所有冗余概念,只留可执行动作。
第一步:创建专属视觉Agent并启用多模态能力
进入Coze官网登录后,点击右上角「Bot」→「创建 Bot」→输入名称如「衣橱智配」→在「Bot 类型」中【必须选择「多模态 Bot」】,普通Bot无法处理图片输入;若误选「文本 Bot」,后续所有图像解析步骤将全部报错且不可回退。
创建完成后,点击左侧菜单「设置」→「功能」→开启「支持图片输入」和「支持文件上传」两项开关;关闭「自动回复」,避免图片未处理完就触发默认话术干扰流程。
第二步:接入视觉理解模型与服装知识库
在「插件」→「添加插件」中搜索并安装「Qwen-VL」或「MiniCPM-V」——这两个是当前Coze官方适配最稳的开源多模态模型,别选GPT-4V,Coze尚未开放其API直连权限。
方法一:用「知识库」注入时尚规则
新建知识库命名为「当季潮流规则」,上传PDF格式的《2024春夏Pantone色卡+搭配禁忌清单》《基础款单品价值评估表》;上传后点击「立即解析」,等待状态变为「已就绪」再进行下一步,【未完成解析就启用知识检索,Agent会返回“未找到相关信息”而非报错,极难排查】。
方法二:用「工作流」串联图像识别与风格匹配
进入「工作流」→「新建工作流」→拖入「图像理解」节点(选择刚装好的Qwen-VL)→连接「文本生成」节点→在后者提示词框中写:“你是一名资深买手,请基于以下识别出的单品(颜色/材质/廓形/品牌标识)和当前季节,给出3套搭配建议,每套含1个核心单品+2个协调单品+1个点睛配饰,用短句分行输出,不解释原理。”
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
第三步:配置用户衣橱图片的标准化处理路径
① 用户首次发送衣橱照片时,Agent必须先执行裁切与光照归一化——在工作流开头插入「图像预处理」节点,勾选「自动裁切主体」和「白平衡校正」,否则牛仔裤在暗光浴室拍的照片会被识别成深灰甚至黑色,导致色系推荐全盘错误。
② 设置图片尺寸强制约束:在「Bot 设置」→「输入限制」中,将「最大图片尺寸」设为1024×1024像素,大于此值的图会触发压缩失真,毛衣纹理细节丢失,影响材质判断准确率。
③ 为避免用户乱传截图或网页图干扰识别,在「触发条件」里添加过滤规则:“当消息含图片且文件名含‘screenshot’或‘webp’时,自动回复‘请发送实物单品清晰正拍图,勿传截图或网页保存图’”。
第四步:部署搭配结果的可视化呈现模板
在工作流末尾的「回复」节点中,禁用纯文本输出,改用「卡片消息」格式:标题写「✨你的今日穿搭方案」→正文用「-」分隔三套方案→每套方案后插入一个「图片生成」插件调用,提示词固定为:“flat lay摄影风格,白色背景,{方案描述中的3件单品+1配饰}真实质感摆拍,无文字,高清”,这样用户能直接看到虚拟搭配效果,而不是靠想象拼凑。
测试时用一张黑T恤+蓝牛仔裤+小白鞋的图触发,若生成图中T恤变成灰色或牛仔裤出现褶皱变形,说明Qwen-VL节点的置信度阈值太低,需回到该节点设置里把「最低识别置信度」从0.3调至0.65。










