搜尋
首頁科技週邊人工智慧何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

大佬何恺明还未正式入职MIT,但和MIT的第一篇合作研究已经出来了:

他和MIT师生一起开发了一个自条件图像生成框架,名叫RCG(代码已开源)

这个框架结构非常简单但效果拔群,直接在ImageNet-1K数据集上实现了无条件图像生成的新SOTA

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

它生成的图像不需要任何人类注释(也就是提示词、类标签什么的),就能做到既保真又具有多样性。

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

这样的它不仅显著提高了无条件图像生成的水平,还能跟当前最好的条件生成方法一较高下。

用何恺明团队自己的话来说:

有条件和无条件生成任务之间长期存在的性能差距,终于在这一刻被弥补了。

那么,它究竟是如何做到的呢?

类似自监督学习的自条件生成

首先,所谓无条件生成,就是模型在没有输入信号帮助的情况下直接捕获数据分布生成内容。

这种训练方式很困难,因此一直与条件生成存在很大的性能差距——就像无监督学习无法与监督学习相比

正如自我监督学习的出现一样,它也改变了这种情况

在无条件图像生成领域,也有一个类似于自监督学习概念的自条件生成方法。

相比传统的无条件生成简单地将噪声分布映射到图像分布,这种方法主要将像素生成过程设置在从数据分布本身导出的表示分布上

它有望超越条件图像生成,并推动诸如分子设计或药物发现这种不需要人类给注释的应用往前发展(这也是为什么条件生成图像发展得这么好,我们还要重视无条件生成)

现在,基于这个自条件生成概念,何恺明团队首先开发了一个表示扩散模型RDM

通过自监督图像编码器从图像中截取,主要用于生成低维自监督图像表示

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

它的核心架构如下:

首先是输入层,它负责将表征投射到隐藏维度C,接着是N个全连接块,最后是一个输出层,负责把隐藏层的潜在特征重新投射(转换)到原始表征维度。

其中每一层都包含一个LayerNorm层、一个SiLU层以及一个线性层。

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

这样的RDM具有两个优点:

它的特点之一是具有很强的多样性,另一个特点是计算开销很小

在此之后,团队借助RDM提出了今天的主角:表示条件图像生成架构RCG

它是一个简单的自条件生成框架,由三个组件组成:

一个是SSL图像编码器,用于将图像分布转换为紧凑的表示分布。

一个是RDM,用于对该分布进行建模和采样。

最后是一个像素生成器MAGE,用于根据表示来处理图像像。

MAGE的工作方式是在token化的图像中添加随机掩码,并要求网络以从同一图像中提取的表示为条件来重建丢失的token

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

经过测试发现,最终结果显示,尽管这个自条件生成框架的结构简单,但其效果非常出色

在ImageNet 256×256上,RCG实现了3.56的FID和186.9的IS(Inception Score)得分。

相比之下,在它之前最厉害的无条件生成方法FID分数为7.04,IS得分为123.5。

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

對於RCG來說,它不僅在條件生成方面表現出色,而且在與該領域基準模型相比時,它的水平相當甚至超過

最後,在無分類器引導的情況下,RCG的成績還能進一步提升到3.31(FID)和253.4(IS)

團隊表達了:

這些結果顯示,條件影像生成模型具有巨大的潛力,可能預示著這一領域的新時代即將來臨

團隊介紹

本文一共三位作者:

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

一作是MIT博士生黎天鴻,本科畢業於清華姚班 ,研究方向為跨模態整合感測技術。

他的個人主頁非常有趣,還專門放了一個食譜合集——研究和烹飪是他最熱衷的兩件事

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

另一位作者是MIT電機工程與電腦科學系(EECS)教授、MIT無線網路和行動運算中心主任Dina Katabi,她是今年斯隆獎的獲得者,並已當選美國國家科學院院士。

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

最後,通訊作者為何愷明,他將在明年正式回歸學界、離開Meta加入MIT電機工程和電腦科學系,與Dina Katabi成為同事。

何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破

請點擊以下連結查看論文:https://arxiv.org/abs/2312.03701

以上是何愷明與MIT合作:簡單框架實現無條件影像產生的最新突破的詳細內容。更多資訊請關注PHP中文網其他相關文章!

陳述
本文轉載於:51CTO.COM。如有侵權,請聯絡admin@php.cn刪除
什麼是及時工程中的問題鏈? - 分析Vidhya什麼是及時工程中的問題鏈? - 分析VidhyaApr 17, 2025 am 11:06 AM

問題鏈:革命性及時工程 想像一下與AI的對話,每個問題都基於上一個問題,從而導致越來越有見地的答案。這是及時工程中的問題鏈(COQ)的力量

訪問Mistral Nemo:功能,應用程序和含義訪問Mistral Nemo:功能,應用程序和含義Apr 17, 2025 am 11:04 AM

Mistral Nemo:強大的開源多語言LLM Mistral AI和Nvidia的合作努力Mismtral Nemo是一種尖端的開源大語模型(LLM),提供最先進的自然語言處理。 這120億桿

Excel中的回合功能是什麼? - 分析VidhyaExcel中的回合功能是什麼? - 分析VidhyaApr 17, 2025 am 10:56 AM

掌握Microsoft Excel的圓形功能,以獲得精確的數值數據 數字是電子表格的基礎,但是實現準確性和可讀性通常不僅需要原始數據。 Microsoft Excel的圓形功能是TRA的強大工具

使用LlamainDex的反射劑指南使用LlamainDex的反射劑指南Apr 17, 2025 am 10:41 AM

增強AI智能:深入研究LlamainDex的反射性AI代理 想像一個AI不僅可以解決問題,而且還反映了自己的改進思維過程。這是反光AI代理的領域,本文探討了

如何用蘭班計算和存儲矢量嵌入?如何用蘭班計算和存儲矢量嵌入?Apr 17, 2025 am 10:37 AM

利用Langchain和向量嵌入以增強內容檢索 先前的文章涵蓋了與查詢相關內容提取的數據加載和分裂技術。 本文使用向量嵌入來深入研究高級數據檢索

2025年僱用數據科學新生的前13家公司2025年僱用數據科學新生的前13家公司Apr 17, 2025 am 10:30 AM

數據科學職業:頂級公司和2024年成功的技巧 近期的數據科學畢業生和旨在跨國公司(MNC)的最終工程專業的學生有很多選擇。 本指南重點介紹了僱用數據SC的領先公司

如何與Genai創造引人入勝的客戶體驗?如何與Genai創造引人入勝的客戶體驗?Apr 17, 2025 am 10:27 AM

通過生成AI增強客戶體驗:一種戰略方法 客戶滿意度至關重要,企業越來越認識到提供出色的體驗的必要性。 超過70%的客戶希望個性化服務

AI的突破為Flux.1,Gemma 2,Sam 2等AI的突破為Flux.1,Gemma 2,Sam 2等Apr 17, 2025 am 10:26 AM

AI每週摘要:開創性的創新和道德考慮 歡迎回到Av Bytes,這是您每週最令人興奮的AI進步的綜述!本週的亮點展示了文本到圖像生成的顯著進步,模型效率

See all articles

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

AI Hentai Generator

AI Hentai Generator

免費產生 AI 無盡。

熱門文章

R.E.P.O.能量晶體解釋及其做什麼(黃色晶體)
1 個月前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.最佳圖形設置
1 個月前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.如果您聽不到任何人,如何修復音頻
1 個月前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.聊天命令以及如何使用它們
1 個月前By尊渡假赌尊渡假赌尊渡假赌

熱工具

WebStorm Mac版

WebStorm Mac版

好用的JavaScript開發工具

記事本++7.3.1

記事本++7.3.1

好用且免費的程式碼編輯器

EditPlus 中文破解版

EditPlus 中文破解版

體積小,語法高亮,不支援程式碼提示功能

SublimeText3漢化版

SublimeText3漢化版

中文版,非常好用

VSCode Windows 64位元 下載

VSCode Windows 64位元 下載

微軟推出的免費、功能強大的一款IDE編輯器