重复图片会导致lora模型过拟合局部噪声,引发五官粘连、背景复刻、水印复现等问题;需用感知哈希工具识别并删除重复图,保留最优版本,统一命名并精简标签。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LiblibAI训练LoRA时若训练集里混入大量重复图片,模型会把同一张图的多个副本当成不同样本反复强化,导致特征学习严重偏向局部噪声而非通用风格,生成图出现五官粘连、背景块状复刻、服饰纹理机械重复等现象,甚至直接复现出原图水印或拍摄瑕疵。
重复图片如何悄悄混进训练集
用手机连拍模式拍了10张相似角度的照片,仅调了亮度就另存为不同文件名;用PS批量导出时勾选“保留图层效果”,结果每张图都带相同阴影滤镜;从同一网页下载多张缩略图,实际是同一张图经不同压缩率生成的JPEG变体——这些都会被LiblibAI识别为独立图像,但模型学不到新信息。
检查方法很简单:把所有图拖进Windows资源管理器→按“大小”排序→相邻文件尺寸完全一致的,95%是重复图或无损复制。
重复图对训练过程的三重干扰
第一步:上传后平台自动打标阶段,AI会为每张重复图生成几乎相同的标签序列,比如连续5张都是(1girl, white_dress, studio_lighting:1.2),导致该组合权重被错误放大,其他真实差异特征(如袖口褶皱、发丝走向)反而被压制。
第二步:训练中loss值会异常快速下降,表面看很健康,实则模型正在死记硬背这张图的像素排列——第3轮loss就跌破0.1,但第5轮开始生成图就开始出现固定位置的噪点斑块,那是原图JPEG压缩伪影被当成了“风格特征”。
第三步:最终模型泛化能力归零。换提示词加“full body”“back view”,生成图仍固执地只出正面半身像,因为训练集中90%的图都是同一构图,模型认定“这就是唯一正确姿态”。
清理重复图的实操步骤
① 用image-deduplication工具扫描整个文件夹,它基于感知哈希比对,能识别缩放/旋转/轻微调色后的重复图。
② 导出重复组列表后,人工保留【清晰度最高、主体占比最大、光照最均匀】的那一张,其余全部删除——不要只删文件名带“_copy”的,很多重复图命名完全不同。
③ 清理完立刻重命名剩余图片:统一用01_、02_开头的纯数字序号+下划线+英文描述,例如01_scholar_front.jpg,【禁用任何中文、空格、括号、全角符号】,否则LiblibAI上传时会静默跳过部分文件。
④ 每张图配同名txt标签文件,打开后手动删掉AI自动生成的冗余词,只留2–4个核心词,例如scholar, ink_wash, front_view —— 重复图清得越干净,标签越精简,模型学到的才是真风格。











