Angle d’Anderson

UrbanScene3D : Paysages urbains étiquetés sémantiquement pour la recherche sur les véhicules autonomes

mm
Ajouter Unite.AI à vos sources préférées sur Google

Le Visual Computing Research Center de l’Université de Shenzhen en Chine a développé un grand ensemble de données de scènes urbaines qui offre des simulations diverses et entièrement étiquetées sémantiquement d’un certain nombre de grandes villes du monde, en tant que ressource pour les initiatives de recherche en apprentissage automatique sur les environnements de simulation de conduite, de drone et d’autres types.

Intitulé UrbanScene3D, le simulateur présente une variété de reconstructions urbaines denses et détaillées avec des textures réalistes. De nombreux scénarios sont créés par des modelisateurs professionnels à partir de données aériennes disponibles publiquement, et présentent un niveau d’optimisation humaine qui est actuellement difficile ou coûteux à simuler dans des systèmes de synthèse d’images entièrement programmatiques et de capture RGB-D basés sur la photogrammétrie, tels que les champs de rayonnement neuronal (NeRF).

 

Le projet vise à remédier à l’un des principaux déséquilibres de la recherche en vision par ordinateur – un manque de jeux de données d’environnements urbains riches et étiquetés sémantiquement avec une structure de modèle de haute qualité, par rapport à un niveau très élevé de disponibilité de données sémantiques et de modélisation similaires relatives aux scènes intérieures.

Les simulations exécutées dans UrbanScene3D peuvent fournir la vérité de base pour la génération de jeux de données spécifiques aux projets relatifs aux véhicules autonomes et aux drones, entre autres possibilités.

UrbanScene3D exécutant AirSim et produisant des cartes de profondeur. Source: https://arxiv.org/pdf/2107.04286.pdf

UrbanScene3D exécutant AirSim et produisant des cartes de profondeur. Source: https://arxiv.org/pdf/2107.04286.pdf

Les fichiers source du projet, d’environ 70 Go, ont été publiés gratuitement à des fins de recherche et d’utilisation éducative. La mise en œuvre peut s’exécuter dans un environnement C++ ou en Python, et nécessite Unreal Engine 4 (avec 4.24 recommandé). Pour les projets aériens, tels que la formation et la simulation de drones, le projet prend également en charge AirSim de Microsoft.

UrbanScene3D présente six environnements CAD modelés par des artistes professionnels à partir d’images ou de cartes satellitaires, ainsi que cinq environnements réels reconstruits. Les scènes CAD présentent des reconstructions de New York, Chicago, San Francisco, Shenzhen, Suzhou et Shanghai. Les données dérivées d’images sont centrées sur cinq scènes spécifiques de ces villes, notamment un hôpital et un campus universitaire.

Villes représentées dans UrbanScene3D.

Villes représentées dans UrbanScene3D.

Les données brutes d’acquisition pour UrbanScene3D sont également mises à disposition, présentant des images aériennes haute résolution de 6000×4000 pixels et des vidéos aériennes 4K, ainsi que des poses et des modèles 3D reconstruits.

Le projet vise à remédier aux limitations des jeux de données de scènes urbaines existants et est le premier à fournir des détails de niveau CAD de haute qualité avec étiquetage sémantique et informations de carte de profondeur. Les efforts précédents incluent:

COCO

Publié en 2014, le jeu de données Common Objects in Context (COCO) de Microsoft dataset présente 1,5 million d’instances d’objets sur 80 catégories, ainsi que la reconnaissance d’objets dans le contexte et cinq légendes par image. COCO ne présente pas de maillage GT avec pose ou d’informations de profondeur.

L'ensemble d'icônes de l'explorateur COCO.

L’ensemble d’icônes de l’explorateur COCO. Source: https://arxiv.org/pdf/1405.0312.pdf

The KITTI Vision Benchmark Suite

Produit par le Karlsruhe Institute of Technology et le Toyota Technological Institute à Chicago, KITTI fournit des informations de profondeur, mais pas de masques d’instances.

CityScape

Le jeu de données Cityscapes pour la compréhension des scènes urbaines sémantiques (également connu sous le nom de CityScape) a été publié en 2016 et présente une segmentation sémantique dense et une segmentation d’instances de personnes et de véhicules. Son objectif principal est d’aider au développement de systèmes de conduite autonome et de secteurs adjacents de surveillance urbaine.

Il présente huit classes, notamment plat, humain, véhicule, construction, objet, nature, ciel et vide, et offre des annotations fines sur 5000 images.

Source: https://www.cityscapes-dataset.com/examples/#fine-annotations

Source: https://www.cityscapes-dataset.com/examples/#fine-annotations

CityScape a été publié en 2020 et présente des fonctionnalités similaires à celles d’UrbanScene3D, à l’exception qu’il ne dispose pas de modélisation CAD.

ApolloCar3D

Lancé en 2018 et dirigé par Baidu Research, ApolloCar3D est une collaboration entre plusieurs unités de recherche universitaires en Occident et en Asie, notamment l’Université de Californie à San Diego, l’Université nationale australienne et l’Université polytechnique du Nord-Ouest à Xi’an, Chine.

ApolloCar3D est spécifiquement destiné à la recherche sur les véhicules autonomes au niveau du sol et présente 5 277 images de conduite et plus de 60 000 instances de véhicules alimentées par des modèles 3D CAD détaillés rendus à des tailles absolues et étiquetés pour des points clés sémantiques. Le jeu de données est plus de 20 fois plus grand que KITTI, mais, contrairement à UrbanScene3D, ne présente que des informations de profondeur partielles.

66 points clés sont définis pour chaque véhicule augmenté par CAD dans le jeu de données ApolloCar3D. Source: https://arxiv.org/pdf/1811.12222.pdf

66 points clés sont définis pour chaque véhicule augmenté par CAD dans le jeu de données ApolloCar3D. Source: https://arxiv.org/pdf/1811.12222.pdf

HoliCity

HoliCity, décrit comme ‘une plate-forme de données à l’échelle de la ville pour l’apprentissage de structures 3D holistiques’, est une collaboration de 2021 entre UC Berkeley, Stanford, USC et Bytedance Research à Palo Alto. Il comprend un jeu de données 3D à l’échelle de la ville avec un niveau élevé de détail structurel et offre 6 300 scènes de panorama du monde réel couvrant une superficie supérieure à 20 kilomètres carrés.

Le projet est destiné à des applications réelles telles que la localisation, la réalité augmentée, la cartographie et la reconstruction à l’échelle de la ville. Bien qu’il présente une modélisation CAD, le niveau de détail est inférieur à celui d’UrbanScene3D.

Source: https://github.com/zhou13/holicity

Source: https://github.com/zhou13/holicity

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai