Andersons Blickwinkel

UrbanScene3D: Semantisch beschriftete Stadtlandschaften für Forschung zu autonomem Fahren

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Das Visual Computing Research Center an der Shenzhen University in China hat ein großes städtisches Szenen-Datenset entwickelt, das diverse, vollständig semantisch beschriftete Simulationen einer Reihe von großen Städten auf der ganzen Welt bietet, als Ressource für Forschungsinitiativen zu Fahrzeugen, Drohnen und anderen Arten von maschinellem Lernen in Umgebungen.

Das Simulator-System, das UrbanScene3D genannt wird, bietet eine Vielzahl von dichten und detaillierten, navigierbaren städtischen Rekonstruktionen mit realistischen Texturen. Viele der Szenarien werden von professionellen Modellierern erstellt, die auf öffentlich verfügbaren Luftbildern basieren, und verfügen über ein Maß an menschlicher Optimierung, das derzeit schwierig oder teuer zu simulieren ist in vollständig programmatischen Bildsynthese- und RGB-D-Erfassungssystemen, die auf Photogrammetrie basieren, wie z.B. Neural Radiance Fields (NeRF).

 

Das Projekt adressiert eines der großen Ungleichgewichte in der Forschung zu maschinellem Sehen – einen Mangel an reichen, semantisch beschrifteten städtischen Umgebungsdatensätzen mit hoher Qualität der Modellstruktur im Vergleich zu der sehr hohen Verfügbarkeit von ähnlichen semantischen und Modellierungsdaten in Bezug auf Innenräume.

Simulationen, die in UrbanScene3D ausgeführt werden, können als Grundlage für die Generierung von projektspezifischen Datensätzen in Bezug auf autonome Fahrzeuge und Drohnen dienen, sowie für andere Möglichkeiten.

UrbanScene3D mit AirSim und Erstellung von Tiefenkartierungen. Quelle: https://arxiv.org/pdf/2107.04286.pdf

UrbanScene3D mit AirSim und Erstellung von Tiefenkartierungen. Quelle: https://arxiv.org/pdf/2107.04286.pdf

Die Quelldateien des Projekts, die etwa 70 GB umfassen, wurden veröffentlicht und sind für Forschungs- und Bildungszwecke kostenlos verfügbar. Die Implementierung kann in einer C++-Umgebung oder in Python ausgeführt werden und erfordert Unreal Engine 4 (mit 4.24 empfohlen). Für Luftprojekte, wie z.B. Drohnen-Training und -Simulation, unterstützt das Projekt auch Microsofts AirSim.

UrbanScene3D bietet sechs professionell modellierte CAD-Umgebungen, die von professionellen Künstlern aus Bildern oder Satellitenkarten erstellt wurden, sowie fünf rekonstruierte reale Umgebungen. Die CAD-Szenen bieten Rekonstruktionen von New York City, Chicago, San Francisco, Shenzhen, Suzhou und Shanghai. Die bildbasierten Daten konzentrieren sich auf fünf spezifische Szenen aus diesen Städten, einschließlich eines Krankenhauses und eines Universitätscampus.

Städte, die in UrbanScene3D dargestellt werden.

Städte, die in UrbanScene3D dargestellt werden.

Die Rohdaten für UrbanScene3D werden auch verfügbar gemacht, einschließlich hochauflösender Luftbilder mit 6000×4000 Pixeln und 4K-Luftvideos, sowie Poses und die rekonstruierten 3D-Modelle.

Das Projekt zielt darauf ab, die Einschränkungen bestehender städtischer Szenen-Datensätze zu adressieren und ist der erste, der eine hohe Qualität von CAD-Modellierungen zusammen mit semantischer Beschriftung und Tiefenkartierungs-Informationen bietet. Frühere Bemühungen umfassen:

COCO

Veröffentlicht im Jahr 2014, bietet Microsofts Common Objects in Context (COCO) Datensatz 1,5 Millionen Objektinstanzen über 80 Kategorien, zusammen mit Objekterkennung im Kontext und fünf Bildunterschriften pro Bild. COCO bietet keine GT-Mesh mit Pose oder Tiefeninformationen.

Das COCO-Explorer-Icon-Set.

Das COCO-Explorer-Icon-Set. Quelle: https://arxiv.org/pdf/1405.0312.pdf

The KITTI Vision Benchmark Suite

Produziert von der Karlsruher Institut für Technologie und dem Toyota Technological Institute at Chicago, bietet KITTI Tiefeninformationen, aber keine Instanzmasken.

CityScape

Der Cityscapes-Datensatz für semantische städtische Szenen-Verständnis (auch bekannt als CityScape) wurde 2016 veröffentlicht und bietet dichte semantische Segmentierung und Instanzsegmentierung von Personen und Fahrzeugen. Als solches ist sein primäres Ziel, die Entwicklung von autonomen Fahrzeugsystemen und angrenzenden Sektoren der städtischen Überwachung zu unterstützen.

Es bietet acht Klassen, einschließlich flach, menschlich, Fahrzeug, Bau, Objekt, Natur, Himmel und Leer, und bietet feine Anmerkungen über 5000 Bilder.

Quelle: https://www.cityscapes-dataset.com/examples/#fine-annotations

Quelle: https://www.cityscapes-dataset.com/examples/#fine-annotations

CityScape wurde 2020 veröffentlicht und ist in seinen Funktionen ähnlich wie UrbanScene3D, außer dass es keine CAD-Modellierung bietet.

ApolloCar3D

Gestartet im Jahr 2018 und von Baidu Research geleitet, ist ApolloCar3D eine Zusammenarbeit zwischen mehreren akademischen Forschungseinheiten in West und Asien, einschließlich der University of California at San Diego, der Australian National University und der Northwestern Polytechnical University at Xi’an, China.

ApolloCar3D ist speziell auf die Forschung zu autonomen Fahrzeugen auf Bodenniveau ausgerichtet und bietet 5.277 Fahrzeugbilder und über 60.000 Fahrzeuginstanzen, die durch detaillierte 3D-CAD-Modelle mit absoluten Größen und semantischen Schlüsselpunkten unterstützt werden. Der Datensatz ist mehr als 20-mal größer als KITTI, aber im Gegensatz zu UrbanScene3D bietet er nur teilweise Tiefeninformationen.

66 Schlüsselpunkte sind für jedes CAD-ergänzte Fahrzeug im ApolloCar3D-Datensatz definiert. Quelle: https://arxiv.org/pdf/1811.12222.pdf

66 Schlüsselpunkte sind für jedes CAD-ergänzte Fahrzeug im ApolloCar3D-Datensatz definiert. Quelle: https://arxiv.org/pdf/1811.12222.pdf

HoliCity

HoliCity, beschrieben als ‘Eine stadtweite Datenplattform für das Lernen von holistischen 3D-Strukturen’, ist eine Zusammenarbeit von 2021 zwischen UC Berkeley, Stanford, USC und Bytedance Research at Palo Alto. Es umfasst einen stadtweiten 3D-Datensatz mit einem hohen Maß an struktureller Detailgenauigkeit und bietet 6.300 reale Panorama-Szenen, die eine Fläche von über 20 Quadratkilometern abdecken.

Das Projekt ist auf reale Anwendungen wie Lokalisierung, erweiterte Realität, Kartierung und stadtweite Rekonstruktion ausgerichtet. Obwohl es CAD-Modellierung bietet, liegt das Detailniveau unter dem von UrbanScene3D.

Quelle: https://github.com/zhou13/holicity

Quelle: https://github.com/zhou13/holicity

Das Projekt ist auf reale Anwendungen wie Lokalisierung, erweiterte Realität, Kartierung und stadtweite Rekonstruktion ausgerichtet. Obwohl es CAD-Modellierung bietet, liegt das Detailniveau unter dem von UrbanScene3D.

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai