suchen
HeimTechnologie-PeripheriegeräteKICVPR 2024 |. Tsinghua & Bosch sind gut darin, komplexe Szenen und Sprachausdrücke zu verarbeiten, und schlugen eine neue Instanzsegmentierungsnetzwerkarchitektur MagNet vor

CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet

Die AIxiv-Kolumne ist eine Kolumne, in der akademische und technische Inhalte auf dieser Website veröffentlicht werden. In den letzten Jahren sind in der AIxiv-Kolumne dieser Website mehr als 2.000 Berichte eingegangen, die Spitzenlabore großer Universitäten und Unternehmen auf der ganzen Welt abdecken und so den akademischen Austausch und die Verbreitung wirksam fördern. Wenn Sie hervorragende Arbeiten haben, die Sie teilen möchten, können Sie gerne einen Beitrag leisten oder uns für die Berichterstattung kontaktieren. E-Mail-Adresse: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com.

Referring Image Segmentation (RIS) ist eine sehr anspruchsvolle multimodale Aufgabe, die Algorithmen erfordert, um gleichzeitig feine menschliche Sprache und visuelle Bildinformationen zu verstehen und Sätze im Bild zu klassifizieren Pixelebene. Durchbrüche in der RIS-Technologie werden voraussichtlich revolutionäre Veränderungen in vielen Bereichen wie der Mensch-Computer-Interaktion, der Bildbearbeitung und dem autonomen Fahren mit sich bringen. Es kann die Effizienz und Erfahrung der Mensch-Maschine-Zusammenarbeit erheblich verbessern. Obwohl die aktuellen hochmodernen RIS-Algorithmen erhebliche Fortschritte gemacht haben, stehen sie immer noch vor dem Problem der Modalitätslücke, das heißt, die Verteilung von Bild- und Textmerkmalen ist nicht vollständig aufeinander abgestimmt. Dieses Problem ist besonders akut, wenn es um komplexe referenzielle Sprachausdrücke und seltene Kontexte geht.

CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet

Abbildung 1: Schematische Darstellung der Bedeutung feinkörniger Sprach-Bild-Ausrichtungsfunktionen für RIS. Die rote Maske ist das Vorhersageergebnis von LAVT, einem der derzeit fortschrittlichsten RIS-Algorithmen, und das gelbe gestrichelte Kästchen ist die korrekte Anmerkung.

Die aktuelle RIS-Forschung konzentriert sich hauptsächlich auf den Entwurf neuartiger Verlustfunktionen oder die Einführung innovativer Netzwerkarchitekturen/-module, um die Ausrichtung der Sprach-Bild-Verteilung zu verbessern. Trotz erheblicher Fortschritte gibt es immer noch zwei grundlegende Probleme, die zu ihrer Unzulänglichkeit bei der feinkörnigen visuellen Erdung führen:

1 Diese Methoden basieren hauptsächlich auf der Satzebene. Die Sprachfunktionen führen eine Sprach-Bild-Ausrichtung durch, was zu ihrer Schwachstelle führt Fähigkeit zur Sprach-Bild-Ausrichtung auf Textebene.
2. Diesen Methoden fehlen häufig explizite Überwachungssignale während des Trainingsprozesses und sie können dem Modell nicht effektiv beibringen, eine feinkörnige Ausrichtung durchzuführen, was zu einer schlechten Leistung bei der Verarbeitung komplexer Referenzsprachen führt.法 Abbildung 2: Die Mängel des bestehenden Algorithmus

CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet

In einer aktuellen CVPR 2024-Arbeit hat das gemeinsame Forschungsteam der Abteilung für Automatisierung der Tsinghua-Universität und des Bosch Central Research Institute eine neue Hilfsaufgabe Mask Grounding entworfen . Diese Aufgabe zielt darauf ab, dem Modell explizit beizubringen, feinkörnige Korrespondenzen zwischen Text und visuellen Objekten zu lernen, indem Teile von Textwörtern zufällig maskiert werden und der Algorithmus lernen kann, ihre wahre Identität vorherzusagen. Darüber hinaus schlugen sie ein neuartiges modalübergreifendes Ausrichtungsmodul und eine neuartige modalübergreifende Ausrichtungsverlustfunktion (Cross-modal Alignment Loss) vor, um die Lücke zwischen Sprache und Bildern weiter umfassend zu verringern. Basierend auf diesen Technologien entwickelten sie eine neue Netzwerkarchitektur zur Instanzsegmentierung, das Mask-Grounded Network (MagNet).

Papiertitel: Mask Grounding for Referring Image Segmentation

CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet

Papieradresse: https://arxiv.org/abs/2312.12198
  • In RefCOCO, RefCOCO + -Ref Mit dem Datensatz übertraf MagNet alle bisherigen optimalen Algorithmen deutlich und verbesserte den Kernindikator des gesamten Schnittmengen-zu-Union-Verhältnisses (oIoU) deutlich um 2,48 Prozentpunkte. Die Visualisierungsergebnisse bestätigen auch, dass MagNet eine hervorragende Leistung bei der Verarbeitung komplexer Szenen und Sprachausdrücke aufweist.

Methode

MagNet besteht aus 3 unabhängigen und komplementären Modulen, nämlich Mask Grounding, Cross-modal Alignment Module und Cross-modal Alignment Loss.

1.Erdung maskieren

Abbildung 3: Mask -Erdungsflussdiagramm

Maske

Wie in Abbildung 3 gezeigt, wählt der Autor bei der Eingabebild, dem entsprechenden Referenzausdruck und der Segmentierungsmaske, einige der Sätze Vokabular nach dem Zufallsprinzip aus und ersetzen Sie es durch ein spezieller erlernbarer Masken-Token. Das Modell wird dann trainiert, um die tatsächliche Identität dieser ersetzten Wörter vorherzusagen. Durch die erfolgreiche Vorhersage der Identität des maskierten Tokens ist das Modell in der Lage zu verstehen, welche Wörter im Text welchen Teilen des Bildes entsprechen, und erlernt dabei feinkörnige Sprach-Bild-Ausrichtungsfunktionen. Um diese Hilfsaufgabe auszuführen, werden zunächst die Mittelpunktskoordinaten des Maskenbereichs extrahiert und an einen zweischichtigen MLP übergeben, um die Merkmale der Segmentierungsmaske zu kodieren. Gleichzeitig wird eine lineare Ebene verwendet, um die Sprachmerkmale auf die gleichen Abmessungen wie die Bildmerkmale abzubilden. Anschließend werden diese Merkmale mithilfe des vorgeschlagenen Masken-Token-Prädiktors gemeinsam verarbeitet, und das Aufmerksamkeitsmechanismusmodul wird für die Masken-Token-Vorhersage verwendet. Obwohl Mask Grounding einen zusätzlichen Vorwärtsdurchlauf durch den Sprachcodierer erfordert, um die maskierten Ausdrücke zu verarbeiten, ist der Gesamtrechenaufwand nahezu vernachlässigbar, da der Sprachcodierer so klein ist. Cross-modal Alignment Module (CAM)

CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet

Wie in Abbildung 4 dargestellt, schlugen die Autoren zur weiteren Verbesserung der Modellleistung auch ein Cross-modal Alignment Module (CAM) vor, um den Sprach-Bild-Ausrichtungseffekt zu verbessern indem vorab globaler Kontext in Bildmerkmale eingefügt wird, bevor die Sprach-Bild-Fusion durchgeführt wird. CAM generiert zunächst K-Feature-Maps unterschiedlicher Pyramidenskalen mithilfe von Pooling-Operationen mit unterschiedlichen Fenstergrößen. Anschließend wird jede Feature-Map durch einen dreischichtigen MLP geleitet, um globale Informationen besser zu extrahieren, und führt eine Kreuzaufmerksamkeitsoperation mit einer anderen Modalität durch. Als nächstes werden alle Ausgabe-Features durch bilineare Interpolation auf die ursprüngliche Feature-Map-Größe hochgesampelt und in der Kanaldimension verkettet. Anschließend wird ein 2-Layer-MLP verwendet, um die Anzahl der verketteten Feature-Kanäle wieder auf die ursprünglichen Abmessungen zu reduzieren. Um zu verhindern, dass multimodale Signale das ursprüngliche Signal überlagern, wird eine Gated-Einheit mit Tanh-Nichtlinearität verwendet, um die endgültige Ausgabe zu modulieren. Schließlich wird diese Gated-Funktion wieder zu den Eingabefunktionen hinzugefügt und an die nächste Stufe des Bild- oder Sprachcodierers übergeben. In der Implementierung der Autoren wird CAM am Ende jeder Stufe der Bild- und Sprachencoder hinzugefügt.

3. Cross-modal Alignment Loss (CAL)

                                 Formel

CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet

Um das Modell zur Ausrichtung von Sprach- und Bildfunktionen zu überwachen, hat Autor A Es wird eine neuartige modalübergreifende Alignment-Loss-Funktion (CAL) vorgeschlagen. Abbildung 5 zeigt die mathematische Formel dieser Verlustfunktion. Im Gegensatz zu früheren Arbeiten berücksichtigt CAL sowohl die Ausrichtung von Pixel zu Pixel (P2P) als auch von Pixel zu Text (P2T). Eine genaue Pixel-zu-Pixel-Ausrichtung stellt sicher, dass das Modell Segmentierungsmasken mit genauen Formen und Grenzen segmentieren und ausgeben kann, während eine genaue Pixel-zu-Text-Ausrichtung es dem Modell ermöglicht, Textbeschreibungen korrekt den Bildbereichen zuzuordnen, mit denen sie übereinstimmen.

Experimente

In Tabelle 1 verwendet der Autor die oIoU-Metrik, um MagNet zu bewerten und seine Leistung mit vorhandenen hochmodernen Algorithmen zu vergleichen. Die Testdaten sind RefCOCO, RefCOCO + und G-Ref. Sowohl in den Einstellungen für einzelne als auch für mehrere/zusätzliche Datensätze ist die Leistung von MagNet bei diesen Datensätzen ausschließlich SOTA.
Tabelle 1: Experimentelle Ergebnisse – Visualisierungsergebnisse Auch die Ergebnisse sind hervorragend , was in vielen schwierigen Szenarien die LAVT-Basislinie übertrifft.
Zusammenfassung

Dieser Artikel befasst sich mit den Herausforderungen und aktuellen Problemen im Bereich der Referenzsegmentierung (RIS), insbesondere mit den Mängeln bei der feinkörnigen Ausrichtung von Sprache und Bild. Als Reaktion auf diese Probleme schlugen Forscher der Tsinghua-Universität und des Bosch Central Research Institute eine neue Methode namens MagNet vor, die die Sprache durch die Einführung der Hilfsaufgabe Mask Grounding, eines modalübergreifenden Ausrichtungsmoduls und einer modalübergreifenden Ausrichtungsverlustfunktion umfassend verbessert der Ausrichtungseffekt zwischen Bildern. Experimente belegen, dass MagNet bei RefCOCO-, RefCOCO+- und G-Ref-Datensätzen eine deutlich bessere Leistung erzielt, die bisherigen hochmodernen Algorithmen übertrifft und starke Generalisierungsfähigkeiten demonstriert. Die Visualisierungsergebnisse bestätigen auch die Überlegenheit von MagNet bei der Verarbeitung komplexer Szenen und Sprachausdrücke. Diese Forschung liefert nützliche Inspirationen für die Weiterentwicklung des Bereichs der Referenzsegmentierung und dürfte zu größeren Durchbrüchen auf diesem Gebiet führen. CVPR 2024 | 擅长处理复杂场景和语言表达,清华&博世提出全新实例分割网络架构MagNet
Teamvorstellung

Dieses Papier stammt von der Abteilung für Automatisierung der Tsinghua-Universität (https://www.au.tsinghua.edu.cn) und dem Bosch Central Research Institute (https:// www.bosch.com/research/). Unter ihnen ist Zhuang Rongxian, der Erstautor der Arbeit, Doktorand an der Tsinghua-Universität und Praktikant an der Bosch Academia Sinica; der Projektleiter ist Dr. Qiu Xuchong, ein leitender F&E-Wissenschaftler an der Bosch Academia Sinica; Professor Huang Gao von der Abteilung für Automatisierung der Tsinghua-Universität.

Das obige ist der detaillierte Inhalt vonCVPR 2024 |. Tsinghua & Bosch sind gut darin, komplexe Szenen und Sprachausdrücke zu verarbeiten, und schlugen eine neue Instanzsegmentierungsnetzwerkarchitektur MagNet vor. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Stellungnahme
Dieser Artikel ist reproduziert unter:机器之心. Bei Verstößen wenden Sie sich bitte an admin@php.cn löschen
Kochen innovation: Wie künstliche Intelligenz den Lebensmittelservice verändertKochen innovation: Wie künstliche Intelligenz den Lebensmittelservice verändertApr 12, 2025 pm 12:09 PM

KI verstärken die Zubereitung der Lebensmittel KI -Systeme werden während der Nahten immer noch in der Zubereitung von Nahrungsmitteln eingesetzt. KI-gesteuerte Roboter werden in Küchen verwendet, um Aufgaben zur Zubereitung von Lebensmitteln zu automatisieren, z.

Umfassende Anleitung zu Python -Namespaces und variablen ScopesUmfassende Anleitung zu Python -Namespaces und variablen ScopesApr 12, 2025 pm 12:00 PM

Einführung Das Verständnis der Namespaces, Scopes und des Verhaltens von Variablen in Python -Funktionen ist entscheidend, um effizient zu schreiben und Laufzeitfehler oder Ausnahmen zu vermeiden. In diesem Artikel werden wir uns mit verschiedenen ASP befassen

Ein umfassender Leitfaden zu Vision Language Models (VLMs)Ein umfassender Leitfaden zu Vision Language Models (VLMs)Apr 12, 2025 am 11:58 AM

Einführung Stellen Sie sich vor, Sie gehen durch eine Kunstgalerie, umgeben von lebhaften Gemälden und Skulpturen. Was wäre, wenn Sie jedem Stück eine Frage stellen und eine sinnvolle Antwort erhalten könnten? Sie könnten fragen: „Welche Geschichte erzählst du?

MediaTek steigert die Premium -Aufstellung mit Kompanio Ultra und Abmessung 9400MediaTek steigert die Premium -Aufstellung mit Kompanio Ultra und Abmessung 9400Apr 12, 2025 am 11:52 AM

In diesem Monat hat MediaTek in diesem Monat eine Reihe von Ankündigungen gemacht, darunter das neue Kompanio Ultra und die Abmessung 9400. Diese Produkte füllen die traditionelleren Teile von MediaTeks Geschäft aus, die Chips für Smartphone enthalten

Diese Woche in AI: Walmart setzt Modetrends vor, bevor sie jemals passierenDiese Woche in AI: Walmart setzt Modetrends vor, bevor sie jemals passierenApr 12, 2025 am 11:51 AM

#1 Google gestartet Agent2Agent Die Geschichte: Es ist Montagmorgen. Als mit KI betriebener Personalvermittler arbeiten Sie intelligenter, nicht härter. Sie melden sich im Dashboard Ihres Unternehmens auf Ihrem Telefon an. Es sagt Ihnen, dass drei kritische Rollen bezogen, überprüft und geplant wurden

Generative KI trifft PsychobabbleGenerative KI trifft PsychobabbleApr 12, 2025 am 11:50 AM

Ich würde vermuten, dass du es sein musst. Wir alle scheinen zu wissen, dass Psychobabble aus verschiedenen Geschwätzern besteht, die verschiedene psychologische Terminologie mischen und oft entweder unverständlich oder völlig unsinnig sind. Alles was Sie tun müssen, um fo zu spucken

Der Prototyp: Wissenschaftler verwandeln Papier in PlastikDer Prototyp: Wissenschaftler verwandeln Papier in PlastikApr 12, 2025 am 11:49 AM

Laut einer neuen Studie, die diese Woche veröffentlicht wurde, wurden im Jahr 2022 nur 9,5% der im Jahr 2022 hergestellten Kunststoffe aus recycelten Materialien hergestellt. In der Zwischenzeit häufen sich Plastik weiter in Deponien - und Ökosystemen - um die Welt. Aber Hilfe ist unterwegs. Ein Team von Engin

Der Aufstieg des KI -Analysten: Warum dies der wichtigste Job in der KI -Revolution sein könnteDer Aufstieg des KI -Analysten: Warum dies der wichtigste Job in der KI -Revolution sein könnteApr 12, 2025 am 11:41 AM

Mein jüngstes Gespräch mit Andy Macmillan, CEO der führenden Unternehmensanalyse -Plattform Alteryx, zeigte diese kritische, aber unterschätzte Rolle in der KI -Revolution. Wie Macmillan erklärt, die Lücke zwischen Rohgeschäftsdaten und KI-fertigen Informat

See all articles

Heiße KI -Werkzeuge

Undresser.AI Undress

Undresser.AI Undress

KI-gestützte App zum Erstellen realistischer Aktfotos

AI Clothes Remover

AI Clothes Remover

Online-KI-Tool zum Entfernen von Kleidung aus Fotos.

Undress AI Tool

Undress AI Tool

Ausziehbilder kostenlos

Clothoff.io

Clothoff.io

KI-Kleiderentferner

AI Hentai Generator

AI Hentai Generator

Erstellen Sie kostenlos Ai Hentai.

Heißer Artikel

R.E.P.O. Energiekristalle erklärten und was sie tun (gelber Kristall)
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Beste grafische Einstellungen
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. So reparieren Sie Audio, wenn Sie niemanden hören können
3 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌
WWE 2K25: Wie man alles in Myrise freischaltet
4 Wochen vorBy尊渡假赌尊渡假赌尊渡假赌

Heiße Werkzeuge

MinGW – Minimalistisches GNU für Windows

MinGW – Minimalistisches GNU für Windows

Dieses Projekt wird derzeit auf osdn.net/projects/mingw migriert. Sie können uns dort weiterhin folgen. MinGW: Eine native Windows-Portierung der GNU Compiler Collection (GCC), frei verteilbare Importbibliotheken und Header-Dateien zum Erstellen nativer Windows-Anwendungen, einschließlich Erweiterungen der MSVC-Laufzeit zur Unterstützung der C99-Funktionalität. Die gesamte MinGW-Software kann auf 64-Bit-Windows-Plattformen ausgeführt werden.

SublimeText3 Linux neue Version

SublimeText3 Linux neue Version

SublimeText3 Linux neueste Version

DVWA

DVWA

Damn Vulnerable Web App (DVWA) ist eine PHP/MySQL-Webanwendung, die sehr anfällig ist. Seine Hauptziele bestehen darin, Sicherheitsexperten dabei zu helfen, ihre Fähigkeiten und Tools in einem rechtlichen Umfeld zu testen, Webentwicklern dabei zu helfen, den Prozess der Sicherung von Webanwendungen besser zu verstehen, und Lehrern/Schülern dabei zu helfen, in einer Unterrichtsumgebung Webanwendungen zu lehren/lernen Sicherheit. Das Ziel von DVWA besteht darin, einige der häufigsten Web-Schwachstellen über eine einfache und unkomplizierte Benutzeroberfläche mit unterschiedlichen Schwierigkeitsgraden zu üben. Bitte beachten Sie, dass diese Software

Herunterladen der Mac-Version des Atom-Editors

Herunterladen der Mac-Version des Atom-Editors

Der beliebteste Open-Source-Editor

Sicherer Prüfungsbrowser

Sicherer Prüfungsbrowser

Safe Exam Browser ist eine sichere Browserumgebung für die sichere Teilnahme an Online-Prüfungen. Diese Software verwandelt jeden Computer in einen sicheren Arbeitsplatz. Es kontrolliert den Zugriff auf alle Dienstprogramme und verhindert, dass Schüler nicht autorisierte Ressourcen nutzen.