朋友,你知道這個英文單字是什麼嗎?
Pneumonoultramicroscopicsilicovolcanoconiosis.
這個世界公認最長-由45個字母組成的單詞,意思是「因肺部沉積火山矽質微粒所引起的疾病」(俗稱火山矽肺病)。
但如果說,現在不是讓你拼讀這個單字,而是…把它給畫出來呢?
(讀都讀不出來,還畫畫???)
Google最新提出來的一個AI-Parti,它就能輕鬆hold住這事。
在把這個字「投餵」給Parti後,它就能有模有樣地生成多張合情合理的肺部疾病圖片:
但這只是Parti小試牛刀的能力,根據Google介紹,它是目前最先進的「文字轉圖像」AI。
例如,跟它說句:“把悉尼歌劇院和巴黎鐵塔做個結合”,輸出結果是這樣的:
(不知道的還真以為是畫報呢)
而且在演算法路數上,還不同於Google自家的Imagen,Parti可以說是把「AI作畫」捲出了新高度。
就連GoogleAI負責人Jeff Dean也連發數條推文,玩得不亦樂乎:
#可擴展到200億參數:更逼真,更「聰明」
#事實上,Parti的能力還不止於此。
得益於模型可擴展到200億參數,一方面,它產生的影像更加細節逼真。
不管是短短幾個字,還是五十多個單字的小段落,都能清晰展現出來。
例如,The back of a violin,小提琴的背面。
也或是照著梵谷《星空》來描述的夜晚畫面。 ps,這段有67個單字。
結果Parti也不在話下,一攬子把各種風格的圖全畫給你了~
Parti主要是將文字產生圖像視為序列到序列之間建模。這有點類似於機器翻譯,將文字標記作為編碼器的輸入,目標輸出從文字變成了圖像。
從結構上看,它的所有元件只有三個部分:編碼器、解碼器以及圖像標記器,而且都是基於標準Transformer。
首先,使用基於Transformer的影像標記器ViT-VQGAN,將影像編碼為離散的標記序列。
接著再透過Transformer的編碼-解碼結構,將參數擴展到200億。
以往關於文本生成圖像的研究,除了最早出現的GAN,大體可以分成兩種思路。
一種是基於自迴歸模型,先文字特徵對應到影像特徵,再使用類似Transformer的序列架構,來學習語言輸入與影像輸出之間的關係。
這種方法的關鍵組成部分是影像標記器,將每個影像轉換為離散單元的序列。例如DALL-E和CogView,就採用了這一思路。
另一種則是這段時間以來進展頻頻的路線-基於擴散的文字到影像模型,例如DALL-E 2和Imagen。
他們摒棄了影像標記器,而是採用擴散模型來直接產生影像。可以看到的是,這些模型產生的影像品質較高,在MS-COCO零樣本FID得分較好。
而Parti模型的成功,證明了自迴歸模型可以用來改善文字產生圖像的效果。
同時,Parti也引進並發布了新的基準測試-PartiPrompts,用於衡量模型在12個類別和11個挑戰方面的能力。
但Parti還是有一定的局限性,研究人員也展示了一些bug:
比如,對否定的描述就沒招了~
一個沒有香蕉的盤子,旁邊一個沒有柳橙汁兒的玻璃杯。
也會犯一些常識性錯誤,例如不合理地縮放。例如這張圖,機器人竟然比賽車高出好幾倍。
一個穿著賽車服和黑色遮陽板的閃亮機器人自豪地站在一輛F1賽車前。太陽落在城市景觀上。漫畫書插圖。
Google「自己捲自己」
在這項研究來自Google Research,團隊中的華人居多。
研究核心工作人員包括Yuanzhong Xu、Thang Luong等,目前均就職於Google從事AI相關研究工作。
(Thang Luong在Google學術上的引用量高達20000 )
△左:Yuanzhong Xu;右:Thang Luong
#不過有趣的是,同為“說句話讓AI作畫”,同為出自谷歌之手的Imagen,它跟Parti還真有點千絲萬縷的關係。
在Parti的GitHub的專案文件中就有提到:
#感謝Imagen團隊,他們在發布Imagen之前與我們分享了其最近完整的結果。
他們在CF-guidance方面的重要發現,對最終的Parti模型特別有幫助。
而且Imagen的作者之一Burcu Karagol Ayan,也參與了Parti的計畫中。
(有種谷歌「自己捲自己」那味了)
#不只如此,就連「隔壁」DALL-E 2的作者Aditya Ramesh,也給Parti在MS-COCO評價方面做了討論工作。
以及DALL-Eval的作者們,也在Parti資料方面的工作提供了幫助。
One More Thing
有說一,就「文字產生圖像」這事,可不只是研究人員們的寵兒。
網友們在「玩」它這條路上,也是樂此不疲(腦洞不要太大好吧)。
前一陣子讓Imagen畫一幅宋朝“虎戴VR”,直接演變成AI作畫大戰。
△圖:Imagen作畫
DALL·E、MidJourney等「聞訊趕來」參與其中。
△ DALL·E作畫
#甚至還有把Wordle和DALL-E 2搞到一起的:
#…
不過回歸到這次的Parti,好玩歸好玩,但還是有網友提出了「直擊靈魂」的問題:
啥時候商業化?要是自己「關門玩」就沒意思了。
Parti論文網址:
https://parti.research.google/
GitHub專案網址:
https://github.com/google-research/parti
#參考連結:
##[1]https:/ /twitter.com/lmthang/status/1539664610596225024[2]https://gizmodo.com/new-browser-game-combines-dall-e-mini-and-wordle-1849105289[3]https://imagen.research .google/以上是谷歌新AI火了!世界最長單字都能畫的詳細內容。更多資訊請關注PHP中文網其他相關文章!

擁抱Face的OlympicCoder-7B:強大的開源代碼推理模型 開發以代碼為中心的語言模型的競賽正在加劇,擁抱面孔與強大的競爭者一起參加了比賽:OlympicCoder-7B,一種產品

你們當中有多少人希望AI可以做更多的事情,而不僅僅是回答問題?我知道我有,最近,我對它的變化感到驚訝。 AI聊天機器人不僅要聊天,還關心創建,研究

隨著智能AI開始融入企業軟件平台和應用程序的各個層面(我們必須強調的是,既有強大的核心工具,也有一些不太可靠的模擬工具),我們需要一套新的基礎設施能力來管理這些智能體。 總部位於德國柏林的流程編排公司Camunda認為,它可以幫助智能AI發揮其應有的作用,並與新的數字工作場所中的準確業務目標和規則保持一致。該公司目前提供智能編排功能,旨在幫助組織建模、部署和管理AI智能體。 從實際的軟件工程角度來看,這意味著什麼? 確定性與非確定性流程的融合 該公司表示,關鍵在於允許用戶(通常是數據科學家、軟件

參加Google Cloud Next '25,我渴望看到Google如何區分其AI產品。 有關代理空間(此處討論)和客戶體驗套件(此處討論)的最新公告很有希望,強調了商業價值

為您的檢索增強發電(RAG)系統選擇最佳的多語言嵌入模型 在當今的相互聯繫的世界中,建立有效的多語言AI系統至關重要。 強大的多語言嵌入模型對於RE至關重要

特斯拉的Austin Robotaxi發射:仔細觀察Musk的主張 埃隆·馬斯克(Elon Musk)最近宣布,特斯拉即將在德克薩斯州奧斯汀推出的Robotaxi發射,最初出於安全原因部署了一支小型10-20輛汽車,並有快速擴張的計劃。 h

人工智能的應用方式可能出乎意料。最初,我們很多人可能認為它主要用於代勞創意和技術任務,例如編寫代碼和創作內容。 然而,哈佛商業評論最近報導的一項調查表明情況並非如此。大多數用戶尋求人工智能的並非是代勞工作,而是支持、組織,甚至是友誼! 報告稱,人工智能應用案例的首位是治療和陪伴。這表明其全天候可用性以及提供匿名、誠實建議和反饋的能力非常有價值。 另一方面,營銷任務(例如撰寫博客、創建社交媒體帖子或廣告文案)在流行用途列表中的排名要低得多。 這是為什麼呢?讓我們看看研究結果及其對我們人類如何繼續將


熱AI工具

Undresser.AI Undress
人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover
用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool
免費脫衣圖片

Clothoff.io
AI脫衣器

Video Face Swap
使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱門文章

熱工具

VSCode Windows 64位元 下載
微軟推出的免費、功能強大的一款IDE編輯器

MinGW - Minimalist GNU for Windows
這個專案正在遷移到osdn.net/projects/mingw的過程中,你可以繼續在那裡關注我們。 MinGW:GNU編譯器集合(GCC)的本機Windows移植版本,可自由分發的導入函式庫和用於建置本機Windows應用程式的頭檔;包括對MSVC執行時間的擴展,以支援C99功能。 MinGW的所有軟體都可以在64位元Windows平台上運作。

mPDF
mPDF是一個PHP庫,可以從UTF-8編碼的HTML產生PDF檔案。原作者Ian Back編寫mPDF以從他的網站上「即時」輸出PDF文件,並處理不同的語言。與原始腳本如HTML2FPDF相比,它的速度較慢,並且在使用Unicode字體時產生的檔案較大,但支援CSS樣式等,並進行了大量增強。支援幾乎所有語言,包括RTL(阿拉伯語和希伯來語)和CJK(中日韓)。支援嵌套的區塊級元素(如P、DIV),

PhpStorm Mac 版本
最新(2018.2.1 )專業的PHP整合開發工具

SublimeText3 英文版
推薦:為Win版本,支援程式碼提示!