Andersons vinkel

UrbanScene3D: Semantisk mærket bylandskaber til forskning i selvstyrende køretøjer

mm
Føj Unite.AI til dine foretrukne kilder på Google

Visual Computing Research Center på Shenzhen Universitet i Kina har udviklet en stor skala byscene datasæt, der tilbyder diverse, fuldt semantisk mærkede simulationer af en række større byer rundt om i verden, som en ressource for kørsel, drone og andre former for maskinlæringsmiljøsimuleringsinitiativer.

Navngivet UrbanScene3D, simulatoreren har en række tætte og detaljerede, navigable byrekonstruktioner med realistiske teksturer. Mange af scenarierne er skabt af professionelle modelører, der arbejder fra offentligt tilgængelige luftfotos, og har et niveau af menneskeledet optimering, som i øjeblikket er svært eller dyrt at simulere i fuldstændig programmeret billeddannelse og RGB-D-kapturssystemer baseret på fotogrammetri, såsom Neural Radiance Fields (NeRF).

 

Projektet adresse en af de største ubalancer i computer vision-forskning – en mangel på rige, semantisk mærkede bymiljødatasæt med høj kvalitet modellstruktur, sammenlignet med det meget høje niveau af tilgængelighed af lignende semantisk og modellingsdata relateret til indendørs scener.

Simulationer, der køres i UrbanScene3D, kan give grundsand for generation af efterfølgende projekt-specifikke datasæt relateret til selvstyrende køretøjer og droner, blandt andre muligheder.

UrbanScene3D kører AirSim og producerer dybdekort. Kilde: https://arxiv.org/pdf/2107.04286.pdf

UrbanScene3D kører AirSim og producerer dybdekort. Kilde: https://arxiv.org/pdf/2107.04286.pdf

Projektets kildefiler, omkring 70gb, er blevet frigivet gratis til formål af forskning og uddannelsesbrug. Implementering kan køre i en C++-miljø eller i Python og kræver Unreal Engine 4 (med 4.24 anbefalet). Til luftbårne projekter, såsom drone-træning og simulation, understøtter projektet også Microsofts AirSim.

UrbanScene3D har seks professionelt modellerede CAD-miljøer genereret af professionelle kunstnere fra billeder eller fra satellitkort, samt fem rekonstruerede virkelige verden miljøer. CAD-scenerne har rekonstruktioner af New York City, Chicago, San Francisco, Shenzhen, Suzhou og Shanghai. Billederne er centreret om fem specifikke scener fra disse byer, herunder et hospital og et universitetscampus.

Byer repræsenteret i UrbanScene3D.

Byer repræsenteret i UrbanScene3D.

De rå akquisitionsdata for UrbanScene3D er også blevet gjort tilgængelige, med høj opløsning luftfotos på 6000×4000 pixels og 4K luftvideo, samt med stillinger og de rekonstruerede 3D-modeller.

Projektet sigter mod at adresse begrænsningerne i eksisterende byscene datasæt og er det første, der tilbyder høj kvalitet CAD-niveau detalje sammen med semantisk mærkning og dybde-kort information. Tidligere bestræbelser inkluderer:

COCO

Udgivet i 2014, Microsofts Common Objects in Context (COCO) datasæt har 1,5 million objektinstanser på tværs af 80 kategorier, samt objektgenkendelse i kontekst og fem undertekster per billede. COCO har ikke GT-mesh med stilling eller dybdeinformation.

COCO-explorer ikonsæt.

COCO-explorer ikonsæt. Kilde: https://arxiv.org/pdf/1405.0312.pdf

The KITTI Vision Benchmark Suite

Produceret af Karlsruhe Institute of Technology og Toyota Technological Institute at Chicago, KITTI giver dybdeinformation, men ikke instansmasker.

CityScape

Cityscapes Dataset for Semantic Urban Scene Understanding (aka CityScape) blev udgivet i 2016 og har tæt semantisk segmentering og instanssegmentering af mennesker og køretøjer. Dets primære formål er at hjælpe med udviklingen af selvstyrende kørselsystemer og tilstødende sektorer af byovervågning.

Det har otte klasser, herunder flat, menneske, køretøj, konstruktion, objekt, natur, himlen og tom, og tilbyder fine annoteringer på tværs af 5000 billeder.

Kilde: https://www.cityscapes-dataset.com/examples/#fine-annotations

Kilde: https://www.cityscapes-dataset.com/examples/#fine-annotations

CityScape blev udgivet i 2020 og er lignende i funktioner til UrbanScene3D, bortset fra at det mangler CAD-modellering.

ApolloCar3D

Lanceret i 2018 og ledet af Baidu Research, ApolloCar3D er et samarbejde mellem en række akademiske forskningsenheder på tværs af vesten og Asien, herunder University of California at San Diego, Australian National University og Northwestern Polytechnical University at Xi’an, Kina.

ApolloCar3D er specifikt rettet mod selvstyrende køretøjsforskning på grundniveau og har 5.277 kørselsbilleder og over 60.000 køretøjsinstanser drevet af detaljerede 3D CAD-modeller renderet i absolut størrelse og mærket for semantiske nøglepunkter. Datasættet er mere end 20 gange større end KITTI, men, i modsætning til UrbanScene3D, har det kun delvis dybdeinformation.

66 nøglepunkter er defineret for hvert CAD-forstærket køretøj i ApolloCar3D-datasættet. Kilde: https://arxiv.org/pdf/1811.12222.pdf

66 nøglepunkter er defineret for hvert CAD-forstærket køretøj i ApolloCar3D-datasættet. Kilde: https://arxiv.org/pdf/1811.12222.pdf

HoliCity

HoliCity, beskrevet som ‘En by-skala data-platform for at lære holistiske 3D-strukturer’, er et samarbejde fra 2021 mellem UC Berkeley, Stanford, USC og Bytedance Research at Palo Alto. Det består af en by-skala 3D-datasæt med høj strukturdetalje og tilbyder 6.300 virkelige verden panorama-scener, der dækker et område på over 20 kvadratkilometer.

Projektet er rettet mod virkelige anvendelser såsom lokalisation, forstærket virkelighed, kortlægning og by-skala rekonstruktion. Selvom det har CAD-modellering, er detaljeniveauet under det i UrbanScene3D.

Kilde: https://github.com/zhou13/holicity

Kilde: https://github.com/zhou13/holicity

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai