Andersons hoek
UrbanScene3D: Semantisch gelabelde stedelijke omgevingen voor autonome voertuigonderzoek

Het Visual Computing Research Center van de Shenzhen University in China heeft een grote schaal stedelijke scène dataset ontwikkeld die diverse, volledig semantisch gelabelde simulaties van een aantal grote steden over de hele wereld biedt, als een resource voor rijden, drone en andere soorten machine learning omgevingsimulatie-onderzoeksinitiatieven.

Genoemd UrbanScene3D, de simulator beschikt over een variëteit aan dichte en gedetailleerde, navigeerbare stedelijke reconstructies met realistische textures. Veel van de scenario’s zijn gemaakt door professionele modelleurs die werken vanuit openbaar beschikbare luchtfoto’s, en beschikken over een niveau van menselijke optimalisatie dat momenteel moeilijk of duur is om te simuleren in geheel programmatische beeldsynthese en RGB-D-capture-systemen op basis van fotogrammetrie, zoals Neural Radiance Fields (NeRF).
Het project adresseert een van de belangrijkste onevenwichtigheden in computer vision onderzoek – een gebrek aan rijke, semantisch gelabelde stedelijke omgevingsdatasets met hoge kwaliteit modelstructuur, in vergelijking met het zeer hoge niveau van beschikbaarheid van soortgelijke semantische en modelleringsgegevens met betrekking tot interne scènes.
Simulaties die worden uitgevoerd in UrbanScene3D kunnen grondwaarheid bieden voor de generatie van latere projectspecifieke datasets met betrekking tot autonome voertuigen en drones, onder andere mogelijkheden.

UrbanScene3D uitgevoerd met AirSim en het produceren van dieptekaarten. Bron: https://arxiv.org/pdf/2107.04286.pdf
De bronbestanden van het project, rond de 70gb, zijn vrijgegeven voor onderzoeks- en onderwijsdoeleinden. Implementatie kan worden uitgevoerd in een C++-omgeving of in Python, en vereist Unreal Engine 4 (met 4.24 aanbevolen). Voor luchtonderzoeken, zoals drone-training en simulatie, ondersteunt het project ook Microsoft’s AirSim.
UrbanScene3D beschikt over zes professioneel gemodelleerde CAD-omgevingen gegenereerd door professionele kunstenaars vanuit afbeeldingen of vanuit satellietkaarten, samen met vijf gereconstrueerde echte wereldomgevingen. De CAD-scènes beschikken over reconstructies van New York City, Chicago, San Francisco, Shenzhen, Suzhou en Shanghai. De afbeelding-gebaseerde gegevens zijn gericht op vijf specifieke scènes van deze steden, waaronder een ziekenhuis en een universiteitscampus.
De ruwe acquisitiegegevens voor UrbanScene3D worden ook beschikbaar gesteld, met hoge resolutie luchtfoto’s van 6000×4000 pixels, en 4K-luchtfilm, samen met poses en de gereconstrueerde 3D-modellen.
Het project heeft tot doel de beperkingen van bestaande stedelijke scène-datasets aan te pakken, en is het eerste dat hoge kwaliteit CAD-niveau detail biedt samen met semantische labeling en dieptekaartinformatie. Eerdere inspanningen omvatten:
COCO
Uitgegeven in 2014, Microsoft’s Common Objects in Context (COCO) dataset beschikt over 1,5 miljoen objectinstanties over 80 categorieën, samen met objectherkenning in context, en vijf onderschriften per afbeelding. COCO beschikt niet over GT-mesh met pose of diepteninformatie.

De COCO-explorer-pictogrammen. Bron: https://arxiv.org/pdf/1405.0312.pdf
The KITTI Vision Benchmark Suite
Geproduceerd door de Karlsruhe Institute of Technology en de Toyota Technological Institute at Chicago, KITTI biedt diepteninformatie, maar geen instantiemaskers.
CityScape
De Cityscapes Dataset voor Semantic Urban Scene Understanding (ook wel CityScape genoemd) werd uitgegeven in 2016, en beschikt over dichte semantische segmentatie, en instantiesegmentatie van mensen en voertuigen. Als zodanig is het primaire doel om te helpen bij de ontwikkeling van autonome rij-systemen en aangrenzende sectoren van stedelijke monitoring.
Het beschikt over acht klassen, waaronder plat, mens, voertuig, constructie, object, natuur, hemel en leeg, en biedt fijne annotaties over 5000 afbeeldingen.

Bron: https://www.cityscapes-dataset.com/examples/#fine-annotations
CityScape werd uitgegeven in 2020, en is vergelijkbaar met UrbanScene3D, behalve dat het geen CAD-modellering beschikt.
ApolloCar3D
Gelanceerd in 2018 en geleid door Baidu Research, ApolloCar3D is een samenwerking tussen een aantal academische onderzoeksunits over de hele wereld, waaronder de University of California at San Diego, de Australian National University, en de Northwestern Polytechnical University at Xi’an, China.
ApolloCar3D is specifiek gericht op grondniveau autonome voertuigonderzoek, en beschikt over 5.277 rijafbeeldingen, en meer dan 60.000 voertuiginstanties die worden aangedreven door gedetailleerde 3D-CAD-modellen die op absolute grootte worden weergegeven, en gelabeld voor semantische sleutelpunten. De dataset is meer dan 20 keer groter dan KITTI, maar, in tegenstelling tot UrbanScene3D, beschikt het alleen over gedeeltelijke diepteninformatie.

66 sleutelpunten zijn gedefinieerd voor elk CAD-aangevuld voertuig in de ApolloCar3D-dataset. Bron: https://arxiv.org/pdf/1811.12222.pdf
HoliCity
HoliCity, beschreven als ‘Een stedelijke schaal data-platform voor het leren van holistische 3D-structuren’, is een samenwerking tussen UC Berkeley, Stanford, USC en Bytedance Research at Palo Alto. Het bestaat uit een stedelijke schaal 3D-dataset met een hoog niveau van structurele details, en biedt 6.300 echte wereldpanorama-scènes die een oppervlakte van meer dan 20 vierkante kilometer beslaan.
Het project is gericht op real-world toepassingen zoals lokaliseren, augmented reality, mapping en stedelijke schaal reconstructie. Hoewel het CAD-modellering beschikt, is het niveau van detail lager dan dat van UrbanScene3D.

Bron: https://github.com/zhou13/holicity













