2D影像的3D重建一直是CV領域的重頭戲。
層出不同的模型被發展出來試圖攻克這個難題。
今天,新加坡國立大學的學者共同發表了一篇論文,發展了一個全新的框架Anything-3D來解決這個老大難問題。
#論文網址:https://arxiv.org/pdf/2304.10261.pdf
#借助Meta「分割一切」模型,Anything-3D直接讓分割後的任意物體活起來了。
另外,再用上Zero-1-to-3模型,就可以得到不同角度的柯基。
甚至,還可以進行人物3D重建。
可以說,這把真突破了。
Anything-3D!
在現實世界中,各種物件和各類環境既多元又複雜。所以,在不受限制的情況下,從單一RGB影像中進行三維重建面臨許多困難。
在此,新加坡國立大學研究人員結合了一系列視覺語言模型和SAM(Segment-Anything)物件分割模型,產生了一個功能多、可靠的系統— —Anything-3D。
目的就是在單一視角的條件下,完成3D重建的任務。
他們採用BLIP模型產生紋理描述,用SAM模型擷取影像中的物體,然後利用文字→影像的擴散模型Stable Diffusion將物體放置到Nerf(神經輻射場)中。
在後續的實驗中,Anything-3D展現了其強大的三維重建的能力。不僅準確,適用面也非常廣泛。
Anything-3D在解決現有方法的限制這方面,效果明顯。研究者透過對各類資料集的測驗和評估,展現了這種新框架的優點。
上圖中,我們可以看到,「柯基吐舌頭千里奔襲圖」、「銀翅女神像委身豪車圖」 ,以及「田野棕牛頭戴藍繩圖」。
這是一個初步展示,Anything-3D框架能夠熟練地將在任意的環境中拍攝的單視角圖像中恢復成的3D的形態,並生成紋理。
儘管相機視角和物件屬性有很大的變化,但這種新框架總是能提供準確度較高的結果。
要知道,從2D影像重建3D物件是電腦視覺領域主題的核心,對機器人、自動駕駛、擴增實境、虛擬現實,以及三維列印等領域都有巨大影響。
雖說這幾年來取得了一些不錯的進展,但在非結構化環境中進行單一影像物件重建的任務仍然是一個具有很大吸引力且亟待解決的問題。
目前,研究人員的任務就是從一張單一的二維影像中產生一個或多個物體的三維表示,表示方法包括點雲、網格或體積表示。
然而,這個問題根本上並不成立。
由於二維投影所產生的內在模糊性,無法明確地確定一個物體的三維結構。
再加上形狀、大小、紋理和外觀的巨大差異,重建自然環境下的物體非常複雜。此外,現實世界影像中的物體經常會被遮擋,這會阻礙被遮蔽部分的精確重建。
同時,光照和陰影等變數也會大幅影響物體的外觀,而角度和距離的不同也會導致二維投影的明顯變化。
困難說夠了,Anything-3D可以出場了。
論文中,研究人員詳細介紹了這個開創性的系統框架,將視覺語言模型和物件分割模型融合在一起,輕鬆鬆就能把2D物件搞成3D的。
這樣,一個功能強大、自適應能力強的系統就成了。單視圖重建? Easy.
研究人員表示,將這兩種模型結合,就可以擷取並確定給定影像的三維紋理和幾何形狀。
Anything-3D利用BLIP模型(Bootstrapping語言-圖像模型)預先訓練圖像的文字描述,然後再用SAM模型辨識物件的分佈區域。
接下來,利用分割出來的物件和文字描述來執行3D重建任務。
換句話說,論文利用預先訓練好的2D文字→影像擴散模型來進行影像的3D合成。此外,研究人員以分數蒸餾訓練一個專門用於影像的Nerf.
上圖就是產生3D影像的整個過程。左上角是2D原圖,先經過SAM,分割出柯基,再經過BLIP,生成文本描述,再用分數蒸餾搞個Nerf出來。
透過對不同資料集的嚴格實驗,研究人員展示了這種方法的有效性和適應性,同時,在準確性、穩健性和概括能力方面都超過了現有的方法。
研究人員也對自然環境中3D物件重建中已有的挑戰進行了全面深入地分析,探討了新框架如何解決此類問題。
最終,透過將基礎模型中的零距離視覺和語言理解能力融合,新框架更能從真實世界的各類影像中重建物體,產生精確、複雜、適用面廣的3D表示。
可以說,Anything-3D是3D物件重建領域的一個重大突破。
以下是更多的例子:
酷黑色內裝小白保時捷,亮麗橙色挖機吊車,綠帽小黃橡皮鴨
時代眼淚褪色大砲、小豬可愛迷你存錢筒、硃砂紅四腳高腳凳
這個新框架可以互動式地辨識單視角影像中的區域,並以最佳化的文字嵌入來表示2D物體。最終,使用一個3D感知的分數蒸餾模型有效地產生高品質的3D物體。
總之,Anything-3D展示了從單視角影像重建自然3D物體的潛力。
研究者稱,新框架3D重建的品質還可以更完美,研究人員正在不斷努力提高生成的品質。
此外,研究人員表示,目前沒有提供3D資料集的定量評估,如新的視圖合成和誤差重建,但在未來的工作迭代中會納入這些內容。
同時,研究人員的最終目標是擴大這個框架,以適應更多的實際情況,包括稀疏視圖下的物件復原。
作者介紹
Wang目前是新加坡國立大學(NUS)ECE系的終身助理教授。
在加入新加坡國立大學之前,他曾是Stevens理工學院CS系的助理教授。在加入Stevens之前,我曾在伊利諾大學厄巴納-香檳分校Beckman研究所的Thomas Huang教授的圖像形成小組擔任博士後。
Wang在洛桑聯邦理工學院(EPFL)電腦視覺實驗室獲得博士學位,由Pascal Fua教授指導,並在2010年獲得香港理工大學計算機系的一等榮譽學士學位。
以上是NUS華人團隊發布最新模型:單視圖重建3D,快速準確!的詳細內容。更多資訊請關注PHP中文網其他相關文章!

写在前面&笔者的个人理解三维Gaussiansplatting(3DGS)是近年来在显式辐射场和计算机图形学领域出现的一种变革性技术。这种创新方法的特点是使用了数百万个3D高斯,这与神经辐射场(NeRF)方法有很大的不同,后者主要使用隐式的基于坐标的模型将空间坐标映射到像素值。3DGS凭借其明确的场景表示和可微分的渲染算法,不仅保证了实时渲染能力,而且引入了前所未有的控制和场景编辑水平。这将3DGS定位为下一代3D重建和表示的潜在游戏规则改变者。为此我们首次系统地概述了3DGS领域的最新发展和关

您一定记得,尤其是如果您是Teams用户,Microsoft在其以工作为重点的视频会议应用程序中添加了一批新的3DFluent表情符号。在微软去年宣布为Teams和Windows提供3D表情符号之后,该过程实际上已经为该平台更新了1800多个现有表情符号。这个宏伟的想法和为Teams推出的3DFluent表情符号更新首先是通过官方博客文章进行宣传的。最新的Teams更新为应用程序带来了FluentEmojis微软表示,更新后的1800表情符号将为我们每天

0.写在前面&&个人理解自动驾驶系统依赖于先进的感知、决策和控制技术,通过使用各种传感器(如相机、激光雷达、雷达等)来感知周围环境,并利用算法和模型进行实时分析和决策。这使得车辆能够识别道路标志、检测和跟踪其他车辆、预测行人行为等,从而安全地操作和适应复杂的交通环境.这项技术目前引起了广泛的关注,并认为是未来交通领域的重要发展领域之一。但是,让自动驾驶变得困难的是弄清楚如何让汽车了解周围发生的事情。这需要自动驾驶系统中的三维物体检测算法可以准确地感知和描述周围环境中的物体,包括它们的位置、

当八卦开始传播新的Windows11正在开发中时,每个微软用户都对新操作系统的外观以及它将带来什么感到好奇。经过猜测,Windows11就在这里。操作系统带有新的设计和功能更改。除了一些添加之外,它还带有功能弃用和删除。Windows11中不存在的功能之一是Paint3D。虽然它仍然提供经典的Paint,它对抽屉,涂鸦者和涂鸦者有好处,但它放弃了Paint3D,它提供了额外的功能,非常适合3D创作者。如果您正在寻找一些额外的功能,我们建议AutodeskMaya作为最好的3D设计软件。如

ChatGPT给AI行业注入一剂鸡血,一切曾经的不敢想,都成为如今的基操。正持续进击的Text-to-3D,就被视为继Diffusion(图像)和GPT(文字)后,AIGC领域的下一个前沿热点,得到了前所未有的关注度。这不,一款名为ChatAvatar的产品低调公测,火速收揽超70万浏览与关注,并登上抱抱脸周热门(Spacesoftheweek)。△ChatAvatar也将支持从AI生成的单视角/多视角原画生成3D风格化角色的Imageto3D技术,受到了广泛关注现行beta版本生成的3D模型,

对于自动驾驶应用来说,最终还是需要对3D场景进行感知。道理很简单,车辆不能靠着一张图像上得到感知结果来行驶,就算是人类司机也不能对着一张图像来开车。因为物体的距离和场景的和深度信息在2D感知结果上是体现不出来的,而这些信息才是自动驾驶系统对周围环境作出正确判断的关键。一般来说,自动驾驶车辆的视觉传感器(比如摄像头)安装在车身上方或者车内后视镜上。无论哪个位置,摄像头所得到的都是真实世界在透视视图(PerspectiveView)下的投影(世界坐标系到图像坐标系)。这种视图与人类的视觉系统很类似,

一些原神“奇怪”的关键词,在这两天很有关注度,明明搜索指数没啥变化,却不断有热议话题蹦窜。例如了龙王、钟离等“转变”立绘激增,虽在网络上疯传了一阵子,但是经过追溯发现这些是合理、常规的二创同人。如果单是这些,倒也翻不起多大的热度。按照一部分网友的说法,除了原神自身就有热度外,发现了一件格外醒目的事情:原神3d同人作者shirakami已经被捕。这引发了不小的热议。为什么被捕?关键词,原神3D动画。还是越过了线(就是你想的那种),再多就不能明说了。经过多方求证,以及新闻报道,确实有此事。自从去年发

原标题:Radocc:LearningCross-ModalityOccupancyKnowledgethroughRenderingAssistedDistillation论文链接:https://arxiv.org/pdf/2312.11829.pdf作者单位:FNii,CUHK-ShenzhenSSE,CUHK-Shenzhen华为诺亚方舟实验室会议:AAAI2024论文思路:3D占用预测是一项新兴任务,旨在使用多视图图像估计3D场景的占用状态和语义。然而,由于缺乏几何先验,基于图像的场景


熱AI工具

Undresser.AI Undress
人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover
用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool
免費脫衣圖片

Clothoff.io
AI脫衣器

AI Hentai Generator
免費產生 AI 無盡。

熱門文章

熱工具

mPDF
mPDF是一個PHP庫,可以從UTF-8編碼的HTML產生PDF檔案。原作者Ian Back編寫mPDF以從他的網站上「即時」輸出PDF文件,並處理不同的語言。與原始腳本如HTML2FPDF相比,它的速度較慢,並且在使用Unicode字體時產生的檔案較大,但支援CSS樣式等,並進行了大量增強。支援幾乎所有語言,包括RTL(阿拉伯語和希伯來語)和CJK(中日韓)。支援嵌套的區塊級元素(如P、DIV),

SublimeText3 英文版
推薦:為Win版本,支援程式碼提示!

Dreamweaver Mac版
視覺化網頁開發工具

Atom編輯器mac版下載
最受歡迎的的開源編輯器

禪工作室 13.0.1
強大的PHP整合開發環境