搜索
首页科技周边人工智能简化文生图prompt,LLM模型生成高质量图像

扩散模型已经成为主流的文本到图像生成模型,它可以通过文本提示来引导生成高质量且内容丰富的图像

如果输入的提示过于简洁,现有的模型在语义理解和常识推理方面都存在局限,这将导致生成的图像质量明显下降

中山大学HCP实验室的林倞团队提出了一种名为SUR-adapter的简单而有效的微调方法,旨在提高模型对叙述性提示的理解能力。该方法是一种语义理解和推理适配器,适用于预训练的扩散模型,并具有参数高效的特点

简化文生图prompt,LLM模型生成高质量图像

请点击以下链接查看论文:https://arxiv.org/abs/2305.05189

开源地址:https://github.com/Qrange-group/SUR-adapter

为了达到这个目标,研究人员首先收集并标注了一个名为SURD的数据集。这个数据集包含了超过5.7万个多模态样本,每个样本都包含一个简单的叙述性提示、一个复杂的基于关键字的提示以及一张高质量的图像

研究人员将叙事提示的语义表示与复杂提示对齐,并通过知识蒸馏将大型语言模型(LLM)的知识迁移到SUR适配器,以便能够获得强大的语义理解和推理能力来构建高质量的文本语义表征用于文本到图像生成。然后,他们将叙事提示的语义表示与复杂提示对齐,并通过知识蒸馏将大型语言模型(LLM)的知识迁移到SUR适配器,以便能够获得强大的语义理解和推理能力来构建高质量的文本语义表征用于文本到图像生成

简化文生图prompt,LLM模型生成高质量图像

我们通过集成多个LLM和预训练扩散模型进行实验,发现该方法能够有效地使扩散模型理解和推理简洁的自然语言描述,同时不会降低图像质量

这种方法可以使得文本到图像的扩散模型更易于使用,提供更好的用户体验,进一步推动用户友好的文本到图像生成模型的发展,并弥补简单叙事提示和基于关键字提示之间的语义差距

背景介绍

目前,以稳定扩散为代表的文本到图像预训练模型已经成为人工智能生成内容领域最重要的基础模型之一,在图像编辑、视频生成、3D对象生成等任务中起着重要作用

目前,这些预训练的扩散模型的语义能力主要取决于文本编码器(如CLIP),其语义理解能力直接影响到扩散模型的生成效果

本文首先通过构造视觉问答任务(VQA)中常见的问题类别,如"计数"、"颜色"和"动作",来测试Stable diffusion的图文匹配准确度。我们将人工统计并进行测试

以下是构造各种提示的示例,详见下表

简化文生图prompt,LLM模型生成高质量图像

根据下表所示的结果,文章揭示了目前的文生图预训练扩散模型存在严重的语义理解问题。大量问题的图文匹配准确度不足50%,甚至在某些问题下,准确度仅为0%

简化文生图prompt,LLM模型生成高质量图像

为了获得符合文本生成条件的图像,我们需要找到方法来增强预训练扩散模型中本文编码器的语义能力

方法概述

重写后的内容:1. 数据预处理

首先,我们可以从常用的扩散模型在线网站lexica.art、civitai.com和stablediffusionweb中获取大量的图片文本对。然后,我们需要对这些数据进行清洗和筛选,以获得超过57000张高质量的三元组数据(包括复杂提示、简单提示和图片),并将其构成SURD数据集

简化文生图prompt,LLM模型生成高质量图像

在下图中所示,复杂提示是指生成图像时扩散模型所需的文本提示条件,通常这些提示具有复杂的格式和描述。简单提示是通过BLIP对图像生成的文本描述,它采用符合人类描述的语言格式

一般来说,符合正常人类语言描述的简单提示很难让扩散模型生成足够符合语义的图像,而复杂提示(用户戏称为扩散模型的“咒语”)则可以达到令人满意的效果

需要进行重新编写的内容是:2. 大型语言模型的语义蒸馏

本文介绍了一种使用Transformer结构的Adapter来蒸馏大型语言模型在特定隐藏层中的语义特征的方法,并通过将Adapter引导的大型语言模型信息与原始文本编码器输出的语义特征进行线性组合,得到最终的语义特征

大语言模型选用的是不同大小的LLaMA模型,而扩散模型的UNet部分在整个训练过程中的参数都是冻结的

简化文生图prompt,LLM模型生成高质量图像

需要进行重写的内容是:3. 图像质量恢复

为了保持原意不变,需要将内容改写为中文: 由于本文结构在预训练大模型推理过程引入了可学习模块,一定程度破坏了预训练模型的原图生成质量,因此需要将图像生成的质量拉回原预训练模型的生成质量水平

简化文生图prompt,LLM模型生成高质量图像

本文使用SURD数据集中的三元组,在训练过程中引入了相应的质量损失函数,以恢复图像生成的质量。具体而言,本文希望通过新模块后获得的语义特征能够与复杂提示的语义特征尽可能地对齐

下图展示了SUR-adapter对预训练扩散模型的fine-tuning框架。右侧为Adapter的网络结构

简化文生图prompt,LLM模型生成高质量图像

实验结果

对于SUR-adapter的性能,本文从语义匹配和图像质量两个方面进行了分析

一方面,根据下表显示,SUR-adapter能够有效地解决文生图扩散模型中常见的语义不匹配问题,适用于不同的实验设置。在不同类别的语义准则下,准确度也有一定的提升

另一方面,本文利用常用的BRISQUE等常用的图像质量评价指标下,对原始pretrain扩散模型和使用了SUR-adapter后的扩散模型所生成图片的质量进行统计检验,我们可以发现两者没有显著的差异。

我们还进行了一项人类偏好的调查问卷测试

通过以上分析,可以得出结论,所提出的方法能够在保持图像生成质量的同时,缓解预训练文本到图像的固有图文不匹配问题

简化文生图prompt,LLM模型生成高质量图像

简化文生图prompt,LLM模型生成高质量图像

我们还可以通过以下图像生成的示例来定性展示,更详细的分析和细节请参阅本文和开源仓库

需要进行改写的内容是:

简化文生图prompt,LLM模型生成高质量图像

简化文生图prompt,LLM模型生成高质量图像

HCP实验室简介

林倞教授于2010年创办了中山大学人机物智能融合实验室(HCP Lab)。近年来,该实验室在多模态内容理解、因果及认知推理、具身智能等领域取得了丰富的学术成果。实验室多次荣获国内外科技奖项和最佳论文奖,并致力于开发产品级的人工智能技术和平台

以上是简化文生图prompt,LLM模型生成高质量图像的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:51CTO.COM。如有侵权,请联系admin@php.cn删除
优化您的组织与Genai代理商的电子邮件营销优化您的组织与Genai代理商的电子邮件营销Apr 13, 2025 am 11:44 AM

介绍 恭喜!您经营一家成功的业务。通过您的网页,社交媒体活动,网络研讨会,会议,免费资源和其他来源,您每天收集5000个电子邮件ID。下一个明显的步骤是

Apache Pinot实时应用程序性能监视Apache Pinot实时应用程序性能监视Apr 13, 2025 am 11:40 AM

介绍 在当今快节奏的软件开发环境中,确保最佳应用程序性能至关重要。监视实时指标,例如响应时间,错误率和资源利用率可以帮助MAIN

Chatgpt击中了10亿用户? Openai首席执行官说:'短短几周内翻了一番Chatgpt击中了10亿用户? Openai首席执行官说:'短短几周内翻了一番Apr 13, 2025 am 11:23 AM

“您有几个用户?”他扮演。 阿尔特曼回答说:“我认为我们上次说的是每周5亿个活跃者,而且它正在迅速增长。” “你告诉我,就像在短短几周内翻了一番,”安德森继续说道。 “我说那个私人

pixtral -12b:Mistral AI'第一个多模型模型 - 分析Vidhyapixtral -12b:Mistral AI'第一个多模型模型 - 分析VidhyaApr 13, 2025 am 11:20 AM

介绍 Mistral发布了其第一个多模式模型,即Pixtral-12b-2409。该模型建立在Mistral的120亿参数Nemo 12B之上。是什么设置了该模型?现在可以拍摄图像和Tex

生成AI应用的代理框架 - 分析Vidhya生成AI应用的代理框架 - 分析VidhyaApr 13, 2025 am 11:13 AM

想象一下,拥有一个由AI驱动的助手,不仅可以响应您的查询,还可以自主收集信息,执行任务甚至处理多种类型的数据(TEXT,图像和代码)。听起来有未来派?在这个a

生成AI在金融部门的应用生成AI在金融部门的应用Apr 13, 2025 am 11:12 AM

介绍 金融业是任何国家发展的基石,因为它通过促进有效的交易和信贷可用性来推动经济增长。交易的便利和信贷

在线学习和被动攻击算法指南在线学习和被动攻击算法指南Apr 13, 2025 am 11:09 AM

介绍 数据是从社交媒体,金融交易和电子商务平台等来源的前所未有的速度生成的。处理这种连续的信息流是一个挑战,但它提供了

您需要查看的3台Openai' s的动手实验 - 分析Vidhya您需要查看的3台Openai' s的动手实验 - 分析VidhyaApr 13, 2025 am 11:06 AM

介绍 您在讲话之前真正思考和理性多久?当前最新的LLM GPT-4O已经在不花很多时间做出回应的情况下提供了令人印象深刻的回应。但是想象一下它是否开始服用

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么(黄色晶体)
3 周前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.最佳图形设置
3 周前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.如果您听不到任何人,如何修复音频
3 周前By尊渡假赌尊渡假赌尊渡假赌
WWE 2K25:如何解锁Myrise中的所有内容
4 周前By尊渡假赌尊渡假赌尊渡假赌

热工具

WebStorm Mac版

WebStorm Mac版

好用的JavaScript开发工具

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

DVWA

DVWA

Damn Vulnerable Web App (DVWA) 是一个PHP/MySQL的Web应用程序,非常容易受到攻击。它的主要目标是成为安全专业人员在合法环境中测试自己的技能和工具的辅助工具,帮助Web开发人员更好地理解保护Web应用程序的过程,并帮助教师/学生在课堂环境中教授/学习Web应用程序安全。DVWA的目标是通过简单直接的界面练习一些最常见的Web漏洞,难度各不相同。请注意,该软件中

Atom编辑器mac版下载

Atom编辑器mac版下载

最流行的的开源编辑器

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具