必须统一或结构化管理训练集中的服装,否则模型会因服饰噪声导致生成时服装随机漂移;推荐单服装锁定、分批次训练或多套服装主次分明三种策略,并需人工精准打标、严格控制标签顺序与用词。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在LiblibAI上训练出能稳定复现特定角色服装的LoRA模型,必须明确控制服装在训练集中的呈现方式——服装不一致不是“丰富多样性”,而是直接导致生成时服装随机漂移的核心原因。
为什么服装必须统一或结构化管理
你训练出的LoRA模型不会“理解”角色有“多套衣服”,它只会从所有图片中提取高频共现特征。当140张图里包含37种不同外套、12种发型、8种鞋款时,模型学到的不是“这个角色穿什么”,而是“这个人像区域+一堆浮动服饰噪声”的耦合模式。结果就是:脸部锚定成功,衣服彻底失控——这正是你在NGA社区描述的“脸部还原很好,但衣服一张都不像”的真实机理。
服装混杂会稀释触发词权重,使模型无法建立“角色名→某件红裙”的强映射关系。哪怕你手动打了red_dress标签,只要全集里只有3张带这件裙子的图,而其他137张全是不同服饰,模型就会把red_dress当成低频干扰项忽略。
实操方案:三类服装策略任选其一
方法一:单服装锁定(新手首选)
只用1套完整服装的20–50张图训练,包括正面/3/4侧/微侧脸/半身/全身/手部特写,全部保持相同衣服、相同发型、相同背景、相同光照。这是唯一能让LoRA把“角色身份”和“该服装纹理+剪裁+配色”深度绑定的方式。
【关键动作】拍摄或截取时,确保衣襟走向、盘扣数量、袖口褶皱形态完全一致;避免同一套衣服因拍摄角度不同造成视觉差异过大(如俯拍显短袖、平视显长袖),这种差异会被模型误判为“不同款式”。
方法二:分服装分批次训练
若角色确需多套服装(如短剧主角有校服/便装/礼服三套),不要混训。拆成3个独立LoRA:xiaohong_uniform_v1、xiaohong_casual_v2、xiaohong_formal_v3,每套单独准备25张图,每张图都打上对应服装关键词(如uniform_school_blue, casual_denim_jacket)并前置到标签首位。
提示词中调用时必须严格匹配:(xiaohong_uniform_v1:0.75), uniform_school_blue → 才能激活对应服装权重。混用触发词会导致风格污染。
方法三:主服装+可控变体(进阶)
以1套主服装(占比≥70%)为基础,在剩余30%图中仅引入1个可变量:要么只换围巾颜色,要么只换发饰类型,要么只换外搭马甲——且每种变体仅出现3–5次。所有变体图仍打主服装标签,额外追加一个轻量修饰词,如uniform_school_blue, red_scarf。
这样模型既牢靠学习主服装骨架,又能识别修饰词作为可控扰动开关。测试发现,这种结构下red_scarf触发率可达82%,而随机生成其他配饰的概率压降至5%以下。
服装标签必须人工干预
第一步:上传后进入「裁剪/打标」页,关闭自动打标。LiblibAI的自动打标器对服饰细节识别极弱,常把“立领盘扣”标成“collar”,把“斜纹百褶裙”标成“skirt”,丢失关键区分度。
第二步:对每张图手动输入标签,格式为【触发词】+【1girl】+【服装精准词】,例如:xiaohong_1girl, uniform_school_blue, stand_up_collar, five_gold_buttons。
第三步:服装词必须放在1girl之后、其他泛化词之前,顺序不可颠倒。模型按标签位置分配注意力权重,靠后的词衰减严重。
【严禁使用模糊词】如“pretty dress”“cool outfit”“nice clothes”——这些词在底模中已高度泛化,叠加后反而削弱角色专属服装信号。











