suchen
HeimTechnologie-PeripheriegeräteKIOpen Source! Jenseits von ZoeDepth! DepthFM: Schnelle und genaue monokulare Tiefenschätzung!

0. Was bewirkt dieser Artikel?

Vorgeschlagenes DepthFM: Ein vielseitiges und schnelles generatives monokulares Tiefenschätzungsmodell auf dem neuesten Stand der Technik. Zusätzlich zu herkömmlichen Tiefenschätzungsaufgaben demonstriert DepthFM auch hochmoderne Fähigkeiten bei nachgelagerten Aufgaben wie dem Tiefen-Inpainting. DepthFM ist effizient und kann Tiefenkarten innerhalb weniger Inferenzschritte synthetisieren.

Lassen Sie uns diese Arbeit gemeinsam lesen~

1. Papierinformationen

Titel: DepthFM: Fast Monocular Depth Estimation with Flow Matching

Autoren: Ming Gui, Johannes S. Fischer, Ulrich Prestel, Pingchuan Ma, Dmytro Kotovenko, Olga Grebenkova, Stefan Andreas Baumann, Vincent Tao Hu, Björn Ommer

Institution: MCML

Originallink: https://arxiv.org/abs/2403.13788

Code-Link: https://github.com/ CompVis/ Depth -fm

Offizielle Homepage: https:// Depthfm.github.io/

2. Zusammenfassung

ist für viele nachgelagerte Besichtigungsaufgaben und -anwendungen von entscheidender Bedeutung. Aktuelle Unterscheidungsmethoden für dieses Problem sind durch verwischende Artefakte eingeschränkt, während generative Methoden auf dem neuesten Stand der Technik aufgrund ihrer SDE-Natur unter einer langsamen Geschwindigkeit der Trainingsproben leiden. Anstatt mit Rauschen zu beginnen, suchen wir nach einer direkten Zuordnung vom Eingabebild zum Tiefenbild. Wir beobachten, dass dies durch Flussanpassung effizient konstruiert werden kann, da seine gerade Flugbahn im Lösungsraum für Effizienz und hohe Qualität sorgt. Unsere Studie zeigt, dass vorab trainierte Bilddiffusionsmodelle als ausreichendes Vorwissen für Deep-Flow-Matching-Modelle verwendet werden können. Bei Benchmarks komplexer Naturszenen zeigt unser leichtgewichtiger Ansatz modernste Leistung bei vorteilhaft niedrigem Rechenaufwand, obwohl er nur auf einer kleinen Menge synthetischer Daten trainiert wird.

3. Effektdemonstration

DepthFM ist ein schnelles Inferenzfluss-Matching-Modell mit starker Zero-Shot-Generalisierungsfähigkeit, das starkes Vorwissen nutzen und leicht auf unbekannte reale Bilder verallgemeinern kann. Nach dem Training mit synthetischen Daten lässt sich das Modell gut auf unbekannte reale Bilder verallgemeinern und passt Tiefenbilder genau an.

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

Im Vergleich zu anderen hochmodernen Modellen erhält DepthFM mit nur einer Funktionsauswertung deutlich klarere Bilder. Die Tiefenschätzung von Marigold dauert doppelt so lange wie die von DethFM, kann jedoch keine Tiefenkarten mit derselben Granularität erstellen.

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

4. Hauptbeiträge

(1) Vorgeschlagenes DepthFM, ein hochmodernes, vielseitiges und schnelles monokulares Tiefenschätzungsmodell. Zusätzlich zu herkömmlichen Tiefenschätzungsaufgaben demonstriert DepthFM auch hochmoderne Fähigkeiten bei nachgelagerten Aufgaben wie Tiefeninpainting und tiefenkonditionierter Bildsynthese.

(2) demonstriert die erfolgreiche Übertragung starker Bild-Prioritäten von Diffusionsmodellen auf Flow-Matching-Modelle, wobei die Abhängigkeit von Trainingsdaten gering ist und keine Bilder aus der realen Welt erforderlich sind.

(3) zeigt, dass das Flow-Matching-Modell effizient ist und Tiefenkarten innerhalb eines einzigen Inferenzschritts synthetisieren kann.

(4) Obwohl DepthFM nur auf synthetische Daten trainiert wurde, schneidet es bei Benchmark-Datensätzen und natürlichen Bildern gut ab.

(5) Verwenden Sie den Oberflächennormalverlust als Hilfsziel, um eine genauere Tiefenschätzung zu erhalten.

(6) Zusätzlich zur Tiefenschätzung kann auch die Zuverlässigkeit seiner Vorhersage zuverlässig vorhergesagt werden.

5. Was ist das konkrete Prinzip?

Trainingspipeline. Das Training ist durch Flussanpassung und Oberflächennormalverlust begrenzt: Für Flussanpassung wird datenabhängiges Flussanpassung verwendet, um das Vektorfeld zwischen der Grundwahrheitstiefe und dem entsprechenden Bild zurückzubilden. Darüber hinaus wird geometrischer Realismus durch einen Oberflächennormalenverlust erreicht.

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

Datenbezogener Flussabgleich: DepthFM regressiert das geradlinige Vektorfeld zwischen der Bildverteilung und der Tiefenverteilung unter Verwendung von Bild-zu-Tiefen-Paaren. Dieser Ansatz fördert effizientes mehrstufiges Denken ohne Einbußen bei der Leistung.

Feinabstimmung von Diffusion Priors: Die Autoren demonstrieren die erfolgreiche Übertragung leistungsstarker Image Priors von einem Basisbildsynthese-Diffusionsmodell (Stable Diffusion v2-1) auf ein Flow-Matching-Modell, wobei kaum auf Trainingsdaten zurückgegriffen wird und keine echten Daten erforderlich sind -Weltbild.

Hilfsflächennormalverlust: Da DepthFM nur auf synthetischen Daten trainiert wird und die meisten synthetischen Datensätze bodenwahre Oberflächennormalen liefern, wird der Oberflächennormalverlust als Hilfsziel verwendet, um die Genauigkeit der DepthFM-Tiefenschätzung zu verbessern.

6. Experimentelle Ergebnisse Tabelle 1 zeigt qualitativ den Leistungsvergleich von DepthFM mit entsprechenden Modellen auf dem neuesten Stand der Technik. Während andere Modelle für das Training häufig auf große Datensätze angewiesen sind, nutzt DepthFM das umfangreiche Wissen, das dem zugrunde liegenden diffusionsbasierten Modell innewohnt. Diese Methode spart nicht nur Rechenressourcen, sondern betont auch die Anpassungsfähigkeit und Trainingseffizienz des Modells.

Vergleich der diffusionsbasierten Marigold-Tiefenschätzung, des Flow Matching (FM)-Benchmarks und des DepthFM-Modells. Jede Methode wird mit nur einem Ensemblemitglied und mit unterschiedlicher Anzahl von Funktionsauswertungen (NFE) an zwei gemeinsamen Benchmark-Datensätzen evaluiert. Im Vergleich zur FM-Basislinie integriert DepthFM den normalen Verlust und die datenabhängige Kopplung während des Trainings.

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

Qualitative Ergebnisse für Marigold- und DepthFM-Modelle in unterschiedlicher Anzahl funktionaler Auswertungen. Es ist erwähnenswert, dass Marigold durch einstufige Inferenz keine aussagekräftigen Ergebnisse liefert, während die Ergebnisse von DepthFM bereits die tatsächliche Tiefenkarte zeigen.

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

Tiefenvervollständigung auf Hypersim. Links: Etwas Tiefe verleihen. Mittel: Tiefe, geschätzt aus der angegebenen Teiltiefe. Rechts: Wahre Tiefe.

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

7. Zusammenfassung

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

DepthFM, eine Flow-Matching-Methode zur monokularen Tiefenschätzung. Durch das Erlernen einer direkten Zuordnung zwischen dem Eingabebild und der Tiefe, anstatt eine Normalverteilung in eine Tiefenkarte zu entrauschen, ist dieser Ansatz deutlich effizienter als aktuelle diffusionsbasierte Lösungen und liefert dennoch feinkörnige Tiefenkarten ohne gemeinsame Artefakte des diskriminierenden Paradigmas . DepthFM verwendet als Vorstufe ein vorab trainiertes Bilddiffusionsmodell und überträgt es effektiv auf ein Deep-Flow-Matching-Modell. Daher wird DepthFM nur auf synthetische Daten trainiert, lässt sich aber während der Inferenz dennoch gut auf natürliche Bilder verallgemeinern. Darüber hinaus hat sich gezeigt, dass der zusätzliche Verlust der Oberflächennormalen die Tiefenschätzung verbessert. Der leichtgewichtige Ansatz von DepthFM ist wettbewerbsfähig, schnell und liefert zuverlässige Vertrauensschätzungen.

Leser, die an weiteren experimentellen Ergebnissen und Artikeldetails interessiert sind, können den Originalartikel lesen

Das obige ist der detaillierte Inhalt vonOpen Source! Jenseits von ZoeDepth! DepthFM: Schnelle und genaue monokulare Tiefenschätzung!. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Stellungnahme
Dieser Artikel ist reproduziert unter:51CTO.COM. Bei Verstößen wenden Sie sich bitte an admin@php.cn löschen
Lesen des AI-Index 2025: Ist AI Ihr Freund, Feind oder Co-Pilot?Lesen des AI-Index 2025: Ist AI Ihr Freund, Feind oder Co-Pilot?Apr 11, 2025 pm 12:13 PM

Der Bericht des Stanford University Institute for Human-orientierte künstliche Intelligenz bietet einen guten Überblick über die laufende Revolution der künstlichen Intelligenz. Interpretieren wir es in vier einfachen Konzepten: Erkenntnis (verstehen, was geschieht), Wertschätzung (Sehenswürdigkeiten), Akzeptanz (Gesichtsherausforderungen) und Verantwortung (finden Sie unsere Verantwortlichkeiten). Kognition: Künstliche Intelligenz ist überall und entwickelt sich schnell Wir müssen uns sehr bewusst sein, wie schnell künstliche Intelligenz entwickelt und ausbreitet. Künstliche Intelligenzsysteme verbessern sich ständig und erzielen hervorragende Ergebnisse bei mathematischen und komplexen Denktests, und erst vor einem Jahr haben sie in diesen Tests kläglich gescheitert. Stellen Sie sich vor, KI zu lösen komplexe Codierungsprobleme oder wissenschaftliche Probleme auf Graduiertenebene-seit 2023-

Erste Schritte mit Meta Lama 3.2 - Analytics VidhyaErste Schritte mit Meta Lama 3.2 - Analytics VidhyaApr 11, 2025 pm 12:04 PM

Metas Lama 3.2: Ein Sprung nach vorne in der multimodalen und mobilen KI Meta hat kürzlich Lama 3.2 vorgestellt, ein bedeutender Fortschritt in der KI mit leistungsstarken Sichtfunktionen und leichten Textmodellen, die für mobile Geräte optimiert sind. Aufbau auf dem Erfolg o

AV -Bytes: META ' S Lama 3.2, Googles Gemini 1.5 und mehrAV -Bytes: META ' S Lama 3.2, Googles Gemini 1.5 und mehrApr 11, 2025 pm 12:01 PM

Die KI -Landschaft dieser Woche: Ein Wirbelsturm von Fortschritten, ethischen Überlegungen und regulatorischen Debatten. Hauptakteure wie OpenAI, Google, Meta und Microsoft haben einen Strom von Updates veröffentlicht, von bahnbrechenden neuen Modellen bis hin zu entscheidenden Verschiebungen in LE

Die menschlichen Kosten für das Gespräch mit Maschinen: Kann sich ein Chatbot wirklich darum kümmern?Die menschlichen Kosten für das Gespräch mit Maschinen: Kann sich ein Chatbot wirklich darum kümmern?Apr 11, 2025 pm 12:00 PM

Die beruhigende Illusion der Verbindung: Blühen wir in unseren Beziehungen zur KI wirklich auf? Diese Frage stellte den optimistischen Ton des "Fortschritts -Menschen mit AI) des MIT Media Lab in Frage. Während die Veranstaltung moderne EDG präsentierte

Verständnis der Scipy Library in PythonVerständnis der Scipy Library in PythonApr 11, 2025 am 11:57 AM

Einführung Stellen Sie sich vor, Sie sind ein Wissenschaftler oder Ingenieur, der sich mit komplexen Problemen befasst - Differentialgleichungen, Optimierungsherausforderungen oder Fourier -Analysen. Pythons Benutzerfreundlichkeit und Grafikfunktionen sind ansprechend, aber diese Aufgaben erfordern leistungsstarke Tools

3 Methoden zum Ausführen von LLAMA 3.2 - Analytics Vidhya3 Methoden zum Ausführen von LLAMA 3.2 - Analytics VidhyaApr 11, 2025 am 11:56 AM

METAs Lama 3.2: Ein multimodales KI -Kraftpaket Das neueste multimodale Modell von META, Lama 3.2, stellt einen erheblichen Fortschritt in der KI dar, das ein verbessertes Sprachverständnis, eine verbesserte Genauigkeit und die überlegenen Funktionen der Textgenerierung bietet. Seine Fähigkeit t

Automatisierung von Datenqualitätsprüfungen mit DagsterAutomatisierung von Datenqualitätsprüfungen mit DagsterApr 11, 2025 am 11:44 AM

Datenqualitätssicherung: Automatisieren von Schecks mit Dagster und großen Erwartungen Die Aufrechterhaltung einer hohen Datenqualität ist für datengesteuerte Unternehmen von entscheidender Bedeutung. Wenn Datenvolumina und Quellen zunehmen, wird die manuelle Qualitätskontrolle ineffizient und anfällig für Fehler.

Haben Mainframes eine Rolle in der KI -Ära?Haben Mainframes eine Rolle in der KI -Ära?Apr 11, 2025 am 11:42 AM

Mainframes: Die unbesungenen Helden der KI -Revolution Während die Server bei allgemeinen Anwendungen und mehreren Kunden übernommen werden, werden Mainframes für hochvolumige, missionskritische Aufgaben erstellt. Diese leistungsstarken Systeme sind häufig in Heavil gefunden

See all articles

Heiße KI -Werkzeuge

Undresser.AI Undress

Undresser.AI Undress

KI-gestützte App zum Erstellen realistischer Aktfotos

AI Clothes Remover

AI Clothes Remover

Online-KI-Tool zum Entfernen von Kleidung aus Fotos.

Undress AI Tool

Undress AI Tool

Ausziehbilder kostenlos

Clothoff.io

Clothoff.io

KI-Kleiderentferner

AI Hentai Generator

AI Hentai Generator

Erstellen Sie kostenlos Ai Hentai.

Heißer Artikel

R.E.P.O. Energiekristalle erklärten und was sie tun (gelber Kristall)
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Beste grafische Einstellungen
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. So reparieren Sie Audio, wenn Sie niemanden hören können
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌
WWE 2K25: Wie man alles in Myrise freischaltet
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌

Heiße Werkzeuge

EditPlus chinesische Crack-Version

EditPlus chinesische Crack-Version

Geringe Größe, Syntaxhervorhebung, unterstützt keine Code-Eingabeaufforderungsfunktion

SublimeText3 Linux neue Version

SublimeText3 Linux neue Version

SublimeText3 Linux neueste Version

WebStorm-Mac-Version

WebStorm-Mac-Version

Nützliche JavaScript-Entwicklungstools

Senden Sie Studio 13.0.1

Senden Sie Studio 13.0.1

Leistungsstarke integrierte PHP-Entwicklungsumgebung

Herunterladen der Mac-Version des Atom-Editors

Herunterladen der Mac-Version des Atom-Editors

Der beliebteste Open-Source-Editor