搜索
首页科技周边人工智能真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

得到一张好看的照片越来越容易了。

假期出游,肯定少不了拍照留念。不过,大部分在景区拍摄的照片或多或少都有些遗憾,背景里不是多了些什么,就是少了些什么。

获得一张「完美」的图像,是 CV 研究人员长期以来努力的目标之一。日前,Google Research 和康奈尔大学的研究人员合作,提出了一种「真实的图像补全」(Authentic Image Completion)技术——用于图像补全的生成模型 RealFill。

RealFill 模型的优势是可以使用少量的场景参考图像进行个性化设置,而这些参考图像无须与目标图像对齐,甚至可以在视角、光线条件、相机光圈或图像风格等方面有极大的差异。一旦完成个性化设置,RealFill 就能够以忠实于原始场景的方式,用视觉上引人入胜的内容来补全目标图像。

真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

  • 请点击以下链接查看论文:https://arxiv.org/abs/2309.16668

  • 项目页面链接:https://realfill.github.io/

补画(inpainting)和扩画(outpainting)模型是能够在图像的未知区域生成高质量、合理的图像内容的技术,但这些模型生成的内容必然是不真实的,因为这些模型在真实场景的上下文信息方面存在不足。相比之下,RealFill 能够生成「应该」出现在那里的内容,从而使图像补全的结果更为真实。

作者在论文中指出,他们定义了一个新的图像补全问题——「真实图像补全」(Authentic Image Completion)。不同于传统的生成型图像修复(替代缺失区域的内容可能与原始场景不一致),真实图像补全的目标是使补全的内容尽可能忠实于原始场景,用「应该出现在那里」的内容来补全目标图像,而不是用「可能在那里」的内容。

作者表示,RealFill 是首个通过在过程中添加更多的条件(即添加参考图像)来扩展生成型图像修复模型表达力的方法。

在一个涵盖了一系列多样化且具有挑战性的场景的新的图像补全基准测试中,RealFill 的表现大大超过了现有的方法。

方法

RealFill 的目标是在尽可能保持真实性的前提下,使用少量的参考图像来补全给定目标图像的缺失部分。具体说,给定最多 5 张参考图像,和一张大致捕捉到相同场景(但布局或外观可能不同)的目标图像。

对于给定的场景,研究人员首先通过在参考图像和目标图像上微调一个预训练的 inpainting 扩散模型,创建一个个性化的生成模型。这个微调过程被设计成让微调后的模型不仅保持良好的图像先验,还能学习输入图像中的场景内容、光照和风格。然后,使用这个微调过的模型,通过标准的扩散采样过程来填充目标图像中的缺失区域。真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

值得注意的是,为了实际的应用价值,该模型特别关注更具挑战性、无约束的情况,即目标图像和参考图像可能有非常不同的视点、环境条件、相机光圈、图像风格,甚至包括移动的对象。

实验结果

根据左侧的参考图像,RealFill 能够对右侧的目标图像进行扩展(uncrop)或修复(inpaint),生成的结果不仅视觉上吸引人,而且与参考图像保持一致,即使参考图像和目标图像在视点、光圈、光照、图像风格和物体运动等方面存在较大差异。

真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFillRealFill 模型的输出效果。给定左侧的参考图像,RealFill 能够扩画出对应的右侧目标图像。白色框内的区域被提供给网络作为已知的像素,而白色框外的区域都是生成的。结果显示,即使参考图像和目标图像之间存在包括视点、光圈、光照、图像风格和物体运动等巨大差异,RealFill 也能生成高质量且忠实于参考图像的图像。来源:论文

对照实验

研究人员比较了 RealFill 模型和其他的基准方法。相比之下,RealFill 生成的结果质量高,在场景保真度和与参考图像的一致性方面,RealFill的表现更好。

Paint-by-Example 无法实现高度的场景保真,因为它依赖于 CLIP 嵌入,而 CLIP 嵌入只能捕获高级语义信息。

Stable Diffusion Inpainting 虽然可以产生看似合理的结果,但由于 prompt 的表达能力有限,所以最终生成结果与参考图像并不一致。

真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

RealFill 与其他两种基线方法的比较。覆盖了一层透明白色掩码的区域是目标图像未修改的部分。来源:realfill.github.io

局限

研究人员也讨论了 RealFill 模型的一些潜在的问题和限制,包括处理速度、对视点变化的处理能力,以及对基础模型具有挑战性的情况的处理能力。具体说:

RealFill 需要对输入图像进行基于梯度的微调过程,这使得它的运行速度相对较慢。
当参考图像和目标图像之间的视点变化非常大时,RealFill 往往无法恢复 3D 场景,特别是当只有一张参考图像的时候。

由于 RealFill 主要依赖于从基础的预训练模型继承的图像先验,因此它无法处理那些对基础模型来说具有挑战性的情况,例如 stable diffusion 模型无法处理好文本。

真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill

最后,作者向合作者表达了感激之情:

我们要感谢 Rundi Wu、Qianqian Wang、Viraj Shah、Ethan Weber、Zhengqi Li、Kyle Genova、Boyang Deng、Maya Goldenberg、Noah Snavely、Ben Poole、Ben Mildenhall、Alex Rav-Acha、Pratul Srinivasan、Dor Verbin 和 Jon Barron 的宝贵讨论和反馈,同时也感谢 Zeya Peng、Rundi Wu、Shan Nan 对评估数据集的贡献。我们特别感谢 Jason Baldridge、Kihyuk Sohn、Kathy Meier-Hellstern 和 Nicole Brichtova 对项目的反馈和支持。

请阅读原始论文并访问项目主页以获取更多信息

以上是真实性震撼!谷歌和康奈尔大学推出真实图像补全技术RealFill的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:机器之心。如有侵权,请联系admin@php.cn删除
人工智能治疗师在这里:您需要了解的14个开创性的心理健康工具人工智能治疗师在这里:您需要了解的14个开创性的心理健康工具Apr 30, 2025 am 11:17 AM

尽管它无法提供训练有素的治疗师的人类联系和直觉,但研究表明,许多人很乐意与相对无面和匿名的AI机器人分享他们的担忧和担忧。 这是否总是好我

叫AI到杂货店过道叫AI到杂货店过道Apr 30, 2025 am 11:16 AM

人工智能(AI)是一种技术数十年的技术,正在彻底改变食品零售业。 从大规模的效率提高和成本降低到精简的各种业务功能的流程,AI的影响是Undeniabl

从生成的AI中进行佩普谈话来提升您的精神从生成的AI中进行佩普谈话来提升您的精神Apr 30, 2025 am 11:15 AM

让我们来谈谈。 对创新AI突破的分析是我正在进行的AI中正在进行的福布斯列覆盖的一部分,包括识别和解释各种有影响力的AI复杂性(请参阅此处的链接)。此外,对于我的comp

为什么AI驱动的超个性化是所有企业必须的为什么AI驱动的超个性化是所有企业必须的Apr 30, 2025 am 11:14 AM

保持专业形象需要偶尔的衣柜更新。 在线购物方便时,它缺乏面对面尝试的确定性。 我的解决方案? AI驱动的个性化。 我设想AI助手策划服装Selecti

忘记Duolingo:Google Translate的新AI功能教授语言忘记Duolingo:Google Translate的新AI功能教授语言Apr 30, 2025 am 11:13 AM

谷歌翻译新增语言学习功能 据Android Authority报道,应用专家AssembleDebug发现,最新版本的谷歌翻译应用包含一个新的“练习”模式的测试代码,旨在帮助用户通过个性化活动来提高他们的语言技能。此功能目前对用户不可见,但AssembleDebug能够部分激活它并查看其一些新的用户界面元素。 激活后,该功能会在屏幕底部添加一个新的“毕业帽”图标,标有“Beta”徽章,表明“练习”功能最初将以实验形式发布。 相关的弹出提示显示“练习为你量身定制的活动!”,这意味着谷歌将生成定制的

他们正在为AI制作TCP/IP,这就是Nanda他们正在为AI制作TCP/IP,这就是NandaApr 30, 2025 am 11:12 AM

麻省理工学院的研究人员正在开发Nanda,这是为AI代理设计的开创性的Web协议。 Nanda的缩写是网络代理和分散的AI,通过添加Internet功能,使AI Agen能够构建人类的模型上下文协议(MCP)。

提示:DeepFake检测是一项蓬勃发展的业务提示:DeepFake检测是一项蓬勃发展的业务Apr 30, 2025 am 11:11 AM

Meta的最新冒险:与Chatgpt竞争的AI应用程序 Facebook,Instagram,WhatsApp和Threads的母公司Meta正在启动新的AI功能应用程序。 这个独立的应用程序Meta AI旨在直接与Openai的Chatgpt竞争。 杠杆

接下来的两年在AI网络安全方面为业务领导者接下来的两年在AI网络安全方面为业务领导者Apr 30, 2025 am 11:10 AM

导航AI网络攻击的上升潮流 最近,CISO的杰森·克林顿(Jason Clinton)拟人化,强调了与非人类身份相关的新兴风险 - 作为机器对机器的通信增殖,维护这些“身份”

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

MinGW - 适用于 Windows 的极简 GNU

MinGW - 适用于 Windows 的极简 GNU

这个项目正在迁移到osdn.net/projects/mingw的过程中,你可以继续在那里关注我们。MinGW:GNU编译器集合(GCC)的本地Windows移植版本,可自由分发的导入库和用于构建本地Windows应用程序的头文件;包括对MSVC运行时的扩展,以支持C99功能。MinGW的所有软件都可以在64位Windows平台上运行。

适用于 Eclipse 的 SAP NetWeaver 服务器适配器

适用于 Eclipse 的 SAP NetWeaver 服务器适配器

将Eclipse与SAP NetWeaver应用服务器集成。

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

Dreamweaver Mac版

Dreamweaver Mac版

视觉化网页开发工具