recherche
MaisonPériphériques technologiquesIA'AI Perspective Eye', triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de l'occlusion et de l'achèvement de tout objet

L'occlusion est l'un des problèmes les plus fondamentaux mais toujours non résolus de la vision par ordinateur, car l'occlusion signifie le manque d'informations visuelles, tandis que les systèmes de vision industrielle s'appuient sur des informations visuelles pour la perception et la compréhension, et dans le monde réel, entre les objets. Occlusion mutuelle est partout. Les derniers travaux de l'équipe d'Andrew Zisserman du laboratoire VGG de l'université d'Oxford ont résolu systématiquement le problème de l'occlusion complète d'objets arbitraires et ont proposé un nouvel ensemble de données d'évaluation plus précise pour ce problème. Ce travail a été salué par le patron du MPI Michael Black, le compte officiel du CVPR, le compte officiel du Département d'informatique de l'Université de Californie du Sud, etc. sur la plateforme X. Ce qui suit est le contenu principal de l'article « Amodal Ground Truth and Completion in the Wild ».

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet


  • Lien papier : https://arxiv.org/pdf/2312.17247.pdf
  • Page d'accueil du projet : https://www.robots.ox.ac.uk/~vgg /research/amodal/
  • Adresse du code : https://github.com/Championchess/Amodal-Completion-in-the-Wild

La segmentation modale est conçue pour compléter l'objet étant la partie occluse, c'est-à-dire c'est-à-dire un masque de forme qui donne les parties visibles et invisibles de l'objet. Cette tâche peut bénéficier à de nombreuses tâches en aval : reconnaissance d'objets, détection de cibles, segmentation d'instances, édition d'images, reconstruction 3D, segmentation d'objets vidéo, support du raisonnement relationnel entre objets, manipulation et navigation du robot, car dans ces tâches, on sait que l'objet occulté est intact La forme aidera.

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

Cependant, comment évaluer les performances d'un modèle pour la segmentation non modale dans le monde réel est un problème difficile : bien qu'il y ait un grand nombre d'objets occultés dans de nombreuses images, comment obtenir une référence pour les formes complètes de ces objets. Qu'en est-il des masques standards ou non modaux ? Les travaux antérieurs impliquaient l'annotation manuelle de masques non modaux, mais les normes de référence pour une telle annotation sont difficiles à éviter d'introduire des erreurs humaines. Il existe également des travaux consistant à créer des ensembles de données synthétiques, par exemple en attachant directement un autre objet à un objet complet. forme complète de l'objet occulté, mais les images obtenues de cette manière ne sont pas de véritables scènes d'images. Par conséquent, ce travail propose une méthode par projection de modèle 3D pour construire un ensemble de données d'images réelles à grande échelle (MP3D-Amodal) couvrant plusieurs catégories d'objets et fournissant des masques amodaux pour évaluer avec précision les performances de la segmentation amodale. La comparaison des différents ensembles de données est la suivante :

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

Plus précisément, en prenant l'ensemble de données MatterPort3D comme exemple, pour tout ensemble de données avec de vraies photos et une structure tridimensionnelle de la scène, nous pouvons combiner les données de tous les objets de la scène La forme tridimensionnelle est projetée simultanément sur la caméra pour obtenir le masque modal de chaque objet (la forme visible, car les objets s'occultent les uns les autres), puis la forme tridimensionnelle de chaque objet dans la scène est projetée sur la caméra séparément pour obtenir le masque non modal de l'objet, c'est-à-dire la forme complète. En comparant le masque modal et le masque non modal, les objets masqués peuvent être repérés.

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

Les statistiques de l'ensemble de données sont les suivantes :

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

Un échantillon de l'ensemble de données est le suivant :

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

De plus, résoudre la forme complète tâche de reconstruction de n'importe quel objet, l'auteur extrait les connaissances préalables sur la forme complète de l'objet à partir des caractéristiques du modèle de diffusion stable pour effectuer une segmentation non modale de tout objet occlus. L'architecture spécifique est la suivante (SDAmodal) :

.

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

La motivation pour proposer d'utiliser la fonction de diffusion stable est que Stable Diffusion a la capacité de compléter des images, elle peut donc contenir toutes les informations sur l'objet dans une certaine mesure et parce que Stable Diffusion a été entraînée avec un grand nombre d'images. nombre d'images, on peut s'attendre à ce qu'il ait la capacité de traiter n'importe quel objet dans n'importe quel environnement. Contrairement aux cadres en deux étapes précédents, SDAmodal ne nécessite pas de masques d'occlusion annotés en entrée ; SDAmodal a une structure simple, mais montre une forte capacité de généralisation à échantillon nul (comparez les paramètres F et H dans le tableau suivant, seule la formation sur COCOA peut améliorer sur un autre ensemble de données dans un domaine différent et des catégories différentes) ; même s'il n'y a pas d'annotation des objets occlus, SDAmodal peut améliorer l'ensemble de données existant COCOA couvrant plusieurs types d'objets occlus et le nouveau jeu de données proposé sur MP3D-Amodal, Les performances SOTA (réglage H) ont été atteintes.

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

En plus des expériences quantitatives, les comparaisons qualitatives reflètent également les avantages du modèle SDAmodal : On peut l'observer sur la figure ci-dessous (tous les modèles sont uniquement entraînés sur COCOA), pour différents types d'objets occlus, que ce soit Qu'il provienne de COCOA ou d'un autre MP3D-Amodal, SDAmodal peut grandement améliorer l'effet de segmentation non modale, et le masque non modal prédit est plus proche du réel.

AI Perspective Eye, triple lauréat du prix Marr, Andrew dirige une équipe pour résoudre le problème de locclusion et de lachèvement de tout objet

Pour plus de détails, veuillez lire l'article original.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration
Cet article est reproduit dans:. en cas de violation, veuillez contacter admin@php.cn Supprimer
Gemma Scope: le microscope de Google pour regarder dans le processus de pensée de l'IAGemma Scope: le microscope de Google pour regarder dans le processus de pensée de l'IAApr 17, 2025 am 11:55 AM

Explorer le fonctionnement interne des modèles de langue avec Gemma Scope Comprendre les complexités des modèles de langue IA est un défi important. La sortie de Google de Gemma Scope, une boîte à outils complète, offre aux chercheurs un moyen puissant de plonger

Qui est un analyste de Business Intelligence et comment en devenir un?Qui est un analyste de Business Intelligence et comment en devenir un?Apr 17, 2025 am 11:44 AM

Déverrouiller le succès de l'entreprise: un guide pour devenir un analyste de Business Intelligence Imaginez transformer les données brutes en informations exploitables qui stimulent la croissance organisationnelle. C'est le pouvoir d'un analyste de Business Intelligence (BI) - un rôle crucial dans GU

Comment ajouter une colonne dans SQL? - Analytique VidhyaComment ajouter une colonne dans SQL? - Analytique VidhyaApr 17, 2025 am 11:43 AM

Instruction ALTER TABLE de SQL: Ajout de colonnes dynamiquement à votre base de données Dans la gestion des données, l'adaptabilité de SQL est cruciale. Besoin d'ajuster votre structure de base de données à la volée? L'énoncé de la table alter est votre solution. Ce guide détaille l'ajout de Colu

Analyste d'entreprise vs analyste de donnéesAnalyste d'entreprise vs analyste de donnéesApr 17, 2025 am 11:38 AM

Introduction Imaginez un bureau animé où deux professionnels collaborent sur un projet critique. L'analyste commercial se concentre sur les objectifs de l'entreprise, l'identification des domaines d'amélioration et la garantie d'alignement stratégique sur les tendances du marché. Simulé

Que sont le comte et le coude à Excel? - Analytique VidhyaQue sont le comte et le coude à Excel? - Analytique VidhyaApr 17, 2025 am 11:34 AM

Excel Counting and Analysis: Explication détaillée du nombre et des fonctions de compte Le comptage et l'analyse des données précises sont essentiels dans Excel, en particulier lorsque vous travaillez avec de grands ensembles de données. Excel fournit une variété de fonctions pour y parvenir, les fonctions Count et Count sont des outils clés pour compter le nombre de cellules dans différentes conditions. Bien que les deux fonctions soient utilisées pour compter les cellules, leurs cibles de conception sont ciblées sur différents types de données. Faisons des détails spécifiques du comptage et des fonctions de coude, mettons en évidence leurs caractéristiques et différences uniques et apprenez à les appliquer dans l'analyse des données. Aperçu des points clés Comprendre le nombre et le cou

Chrome est là avec l'IA: vivre quelque chose de nouveau tous les jours !!Chrome est là avec l'IA: vivre quelque chose de nouveau tous les jours !!Apr 17, 2025 am 11:29 AM

La révolution de l'IA de Google Chrome: une expérience de navigation personnalisée et efficace L'intelligence artificielle (IA) transforme rapidement notre vie quotidienne, et Google Chrome mène la charge dans l'arène de navigation Web. Cet article explore les exciti

Côté humain de l'AI: le bien-être et le quadruple de basCôté humain de l'AI: le bien-être et le quadruple de basApr 17, 2025 am 11:28 AM

Réinventuation d'impact: le quadruple bas Pendant trop longtemps, la conversation a été dominée par une vision étroite de l’impact de l’IA, principalement axée sur le résultat du profit. Cependant, une approche plus holistique reconnaît l'interconnexion de BU

5 cas d'utilisation de l'informatique quantique qui change la donne que vous devriez connaître5 cas d'utilisation de l'informatique quantique qui change la donne que vous devriez connaîtreApr 17, 2025 am 11:24 AM

Les choses évoluent régulièrement vers ce point. L'investissement affluant dans les prestataires de services quantiques et les startups montre que l'industrie comprend son importance. Et un nombre croissant de cas d'utilisation réels émergent pour démontrer sa valeur

See all articles

Outils d'IA chauds

Undresser.AI Undress

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Clothoff.io

Dissolvant de vêtements AI

AI Hentai Generator

AI Hentai Generator

Générez AI Hentai gratuitement.

Article chaud

R.E.P.O. Crystals d'énergie expliqués et ce qu'ils font (cristal jaune)
1 Il y a quelques moisBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Meilleurs paramètres graphiques
1 Il y a quelques moisBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Comment réparer l'audio si vous n'entendez personne
1 Il y a quelques moisBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Commandes de chat et comment les utiliser
1 Il y a quelques moisBy尊渡假赌尊渡假赌尊渡假赌

Outils chauds

Bloc-notes++7.3.1

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

Télécharger la version Mac de l'éditeur Atom

Télécharger la version Mac de l'éditeur Atom

L'éditeur open source le plus populaire

Adaptateur de serveur SAP NetWeaver pour Eclipse

Adaptateur de serveur SAP NetWeaver pour Eclipse

Intégrez Eclipse au serveur d'applications SAP NetWeaver.

Listes Sec

Listes Sec

SecLists est le compagnon ultime du testeur de sécurité. Il s'agit d'une collection de différents types de listes fréquemment utilisées lors des évaluations de sécurité, le tout en un seul endroit. SecLists contribue à rendre les tests de sécurité plus efficaces et productifs en fournissant facilement toutes les listes dont un testeur de sécurité pourrait avoir besoin. Les types de listes incluent les noms d'utilisateur, les mots de passe, les URL, les charges utiles floues, les modèles de données sensibles, les shells Web, etc. Le testeur peut simplement extraire ce référentiel sur une nouvelle machine de test et il aura accès à tous les types de listes dont il a besoin.

VSCode Windows 64 bits Télécharger

VSCode Windows 64 bits Télécharger

Un éditeur IDE gratuit et puissant lancé par Microsoft