CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务-人工智能-PHP中文网

首页

科技周边

人工智能

CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Apr 19, 2024 pm 09:40 PM

git工程genn2n

CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

我们网站的AIxiv专栏是关于学术和技术内容的栏目。过去几年来，我们网站的AIxiv专栏已经收到超过2000篇内容，覆盖全球各大高校与企业的顶级实验室，有助于推进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或联系报道。投稿邮箱为liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com。

来自香港科技大学，清华大学的研究者提出了「GenN2N」，一个统一的生成式 NeRF-to-NeRF 转换框架，适用于各种 NeRF 转换任务，例如文字驱动的 NeRF 编辑、着色、超分辨率、修复等，性能均表现极其出色！

CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

论文地址：https://arxiv.org/abs/2404.02788
论文主页：https://xiangyueliu.github.io/GenN2N/
Github 地址：https://github.com/Lxiangyue/GenN2N
论文标题：GenN2N: Generative NeRF2NeRF Translation

近年来，神经辐射场（NeRF）因其紧凑、高质量、多功能性在三维重建、三维生成和新视角合成领域引起了广泛关注。然而，一旦创建了 NeRF 场景，这些方法通常缺乏对生成几何和外观的进一步控制。因此，NeRF 编辑（NeRF Editing）最近成为了一个值得关注的研究重点。

目前的 NeRF 编辑方法通常是针对特定任务的，例如 NeRF 的文本驱动编辑、超分辨率、修复和着色。这些方法需要大量的特定任务领域知识。而在 2D 图像编辑领域，开发通用的图像到图像（Image-to-image）转换方法成为一种趋势，例如利用 2D 生成模型 Stable Difussion 支持多功能的图像编辑。因此，我们提出了利用基础的 2D 生成模型进行通用的 NeRF 编辑。

随之而来的挑战是 NeRF 和 2D 图像之间的表示差距，尤其是图像编辑器通常会为不同视角生成多种不一致的编辑。最近的一种基于文本的 NeRF 编辑方法 Instruct-NeRF2NeRF 对此进行了探究。其采用 “渲染 - 编辑 - 聚合” 的流程，通过逐步渲染多视角图像、编辑这些图像，将编辑图像聚合到 NeRF 中逐步更新 NeRF 场景。然而这种编辑方法，针对特定的编辑需求，经过大量的优化，只能生成一种特定编辑的结果，如果用户不满意则需要反复迭代尝试。

因此，我们提出了「GenN2N」，一种适用于多种 NeRF 编辑任务的 NeRF-to-NeRF 通用框架，其核心在于用生成的方式来刻画编辑过程多解性，使其可以借助生成式编辑轻松产生大量符合要求的编辑结果供用户挑选。

在 GenN2N 的核心部分，1）引入了 3D VAE-GAN 的生成式框架，使用 VAE 表征整个编辑空间，来学习与一组输入的 2D 编辑图像对应的所有可能的 3D NeRF 编辑分布，并用 GAN 为编辑 NeRF 的不同视图提供合理的监督，确保编辑结果的真实性，2）使用对比学习解耦编辑内容和视角，确保不同视角间的编辑内容一致性，3）在推理时，用户简单地从条件生成模型中随机地采样出多个编辑码，就可以生成与编辑目标对应的各种 3D 编辑结果。

相比于各种 NeRF 编辑任务的 SOTA 方法（ICCV2023 Oral 等），GenN2N 在编辑质量、多样性、效率等方面均优于已有方法。

方法介绍

我们首先进行 2D 图像编辑，然后将这些 2D 编辑提升到 3D NeRF 来实现生成式的 NeRF-to-NeRF 的转换。

CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

A. 隐式蒸馏（Latent Distill）

我们用 Latent Distill Module 作为 VAE 的 encoder，为每张编辑图像学习一个隐式的编辑码，在 NeRF-to-NeRF 转换中通过此编辑码控制生成的内容。所有编辑码在 KL loss 的约束下服从一个良好的正态分布，以便更好地采样。为了解耦编辑内容和视角，我们精心设计了对比学习，鼓励相同编辑风格视角不同的图片的编辑码相近，不同编辑风格但视角相同的图片的编辑码互相远离。

B.NeRF-to-NeRF 的转换（Translated NeRF）

我们用 NeRF-to-NeRF Translation 作为 VAE 的 decoder，其以编辑码作为输入，将原始的 NeRF 修改为一个转换 NeRF。我们在原 NeRF 网络隐藏层之间添加了残差层，这些残差层以编辑码作为输入来调制隐藏层神经元，使得转换 NeRF 既能够保留原本 NeRF 的信息，又可以根据编辑码来控制转换 3D 内容。同时，NeRF-to-NeRF Translation 也作为生成器参与生成对抗训练。通过生成而非优化的方式，使得我们可以一次性得到多种转换结果，显著提升了 NeRF 转换效率和结果多样性。

C. 条件判别器（Conditional Discriminator）

转换 NeRF 的渲染图片构成了需要判别的生成空间，这些图片的编辑风格、渲染视角各异，导致生成空间非常复杂。因此我们提供一个 condition 作为判别器的额外信息。具体而言，判别器在鉴别生成器的渲染图片 CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

（负样本）或训练数据中的编辑图片 CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

（正样本）时，我们都从训练数据中再挑选一张相同视角的编辑图片 CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务

作为条件，这使得判别器在鉴别正负样本时不会受到视角因素的干扰。

D. 推理（Inference）

在 GenN2N 优化后，用户可以从正态分布中随机采样出编辑码，输入转换 NeRF 即可生成出编辑后的高质量、多视角一致性的 3D NeRF 场景。

实验

我们在多种 NeRF-to-NeRF 任务上进行了大量的实验，包括 NeRF 文本驱动编辑、着色、超分辨率、修复等。实验结果展示了 GenN2N 卓越的编辑质量、多视角一致性、生成的多样性和编辑效率。

A. 基于文本的 NeRF 编辑

B.NeRF 着色

C.NeRF 超分辨率

D.NeRF 修复

对比实验

我们的方法与各种特定 NeRF 任务的 SOTA 方法进行了定性和定量对比（包括文本驱动编辑、着色、超分辨率和修复等）。结果表明，GenN2N 作为一个通用框架，其表现与特定任务 SOTA 相当或者更好，同时编辑结果具有更强的多样性（如下是 GenN2N 与 Instruct-NeRF2NeRF 在基于文本的 NeRF 编辑任务上的对比）。

A. 基于文本的 NeRF 编辑

了解更多实验、方法内容，请参考论文主页。

团队介绍

该论文来自香港科技大学谭平团队、清华大学 3DVICI Lab、上海人工智能实验室和上海期智研究院，论文的作者为香港科技大学学生刘襄阅，清华大学学生薛晗，香港科技大学学生罗堃铭，指导老师为清华大学弋力老师和香港科技大学谭平老师。

以上是CVPR 2024高分论文：全新生成式编辑框架GenN2N，统一NeRF转换任务的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：机器之心。如有侵权，请联系admin@php.cn删除

个人黑客将是一只非常凶猛的熊May 11, 2025 am 11:09 AM

网络攻击正在发展。通用网络钓鱼电子邮件的日子已经一去不复返了。网络犯罪的未来是超个性化的，利用了容易获得的在线数据和AI来制作高度针对性的攻击。想象一个知道您的工作的骗子

教皇狮子座XIV揭示了AI如何影响他的名字选择May 11, 2025 am 11:07 AM

新当选的教皇狮子座（Leo Xiv）在对红衣主教学院的就职演讲中，讨论了他的同名人物教皇里奥XIII的影响，他的教皇（1878-1903）与汽车和汽车和汽车公司的黎明相吻合

Fastapi -MCP初学者和专家教程-Analytics VidhyaMay 11, 2025 am 10:56 AM

本教程演示了如何使用模型上下文协议（MCP）和FastAPI将大型语言模型（LLM）与外部工具集成在一起。我们将使用FastAPI构建一个简单的Web应用程序，并将其转换为MCP服务器，使您的L

dia-1.6b tts：最佳文本到二元格生成模型 - 分析vidhyaMay 11, 2025 am 10:27 AM

探索DIA-1.6B：由两个本科生开发的开创性的文本对语音模型，零资金！这个16亿个参数模型产生了非常现实的语音，包括诸如笑声和打喷嚏之类的非语言提示。本文指南

AI可以使指导比以往任何时候都更有意义May 10, 2025 am 11:17 AM

我完全同意。我的成功与导师的指导密不可分。他们的见解，尤其是关于业务管理，构成了我的信念和实践的基石。这种经验强调了我对导师的承诺

AI发掘了采矿业的新潜力May 10, 2025 am 11:16 AM

AI 增强型矿业设备矿业作业环境恶劣且危险重重。人工智能系统通过将人类从最危险的环境中移除并增强人类能力，帮助提高整体效率和安全性。人工智能越来越多地用于为矿业作业中使用的自动驾驶卡车、钻机和装载机提供动力。这些 AI 驱动的车辆能够在危险环境中精确作业，从而提高安全性和生产力。一些公司已经开发出用于大型矿业作业的自动驾驶采矿车辆。在挑战性环境中运行的设备需要持续维护。然而，维护会使关键设备离线并消耗资源。更精确的维护意味着昂贵且必要的设备的正常运行时间增加以及显着的成本节约。 AI 驱动