Angle d’Anderson

Données synthétiques : combler le fossé d’occlusion avec Grand Theft Auto

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les chercheurs de l’Université de l’Illinois ont créé un nouveau jeu de données de vision par ordinateur qui utilise des images synthétiques générées par un moteur de jeu Grand Theft Auto pour aider à résoudre l’un des obstacles les plus épineux de la segmentation sémantique – la reconnaissance d’objets qui ne sont que partiellement visibles dans les images et les vidéos sources.

Dans ce but, comme décrit dans l’article, les chercheurs ont utilisé le moteur de jeu GTA-V pour générer un jeu de données synthétiques qui ne contient pas seulement un nombre record d’instances d’occlusion, mais qui comporte également une segmentation sémantique parfaite et une étiquetage, et qui prend en compte les informations temporelles d’une manière qui n’est pas abordée par les jeux de données open source similaires.

Compréhension complète de la scène

La vidéo ci-dessous, publiée comme matériel de soutien pour la recherche, illustre les avantages d’une compréhension complète 3D d’une scène, dans laquelle les objets masqués sont connus et exposés dans la scène dans toutes les circonstances, permettant ainsi au système d’évaluation d’apprendre à associer des vues partiellement masquées avec l’objet entier (étiqueté).

Source: http://sailvos.web.illinois.edu/_site/index.html

Le jeu de données résultant, appelé SAIL-VOS 3D, est considéré par les auteurs comme le premier jeu de données de maillage de vidéo synthétique avec annotation cadre par cadre, segmentation d’instance, profondeur de vérité pour les vues de scène et annotations 2D délimitées par des boîtes de délimitation.

Source (Cliquez pour agrandir)

Les annotations de SAIL-VOS 3D incluent la profondeur, la segmentation modale et amodale, les étiquettes sémantiques et les maillages 3D. Les données comprennent 484 vidéos totalisant 237 611 cadres à une résolution de 1280×800, y compris les transitions de plans.

Au-dessus, les cadres CGI d'origine; deuxième rangée, segmentation d'instance; troisième rangée, segmentation amodale, qui illustre la profondeur de la compréhension de la scène et la transparence disponibles dans les données. Source

Au-dessus, les cadres CGI d’origine; deuxième rangée, segmentation d’instance; troisième rangée, segmentation amodale, qui illustre la profondeur de la compréhension de la scène et la transparence disponibles dans les données. Source (Cliquez pour agrandir)


Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai