Andersons vinkel
UrbanScene3D: Semantiskt märkta stadslandskap för forskning om autonoma fordon

Visual Computing Research Center vid Shenzhen University i Kina har utvecklat en stor skala urban scen datauppsättning som erbjuder mångfald, fullständigt semantiskt märkta simuleringar av ett antal stora städer runt om i världen, som en resurs för körning, drönare och andra typer av maskinlärningsmiljösimuleringsinitiativ.

Med titeln UrbanScene3D, simulatorn har en mängd olika tät och detaljerad, navigerbar urban rekonstruktion med realistiska texturer. Många av scenarierna skapas av professionella modellbyggare som arbetar från offentligt tillgängliga flygbilder, och har en nivå av mänsklig optimering som för närvarande är svår eller dyr att simulera i helt programmatiska bildsynthesis- och RGB-D-kapningssystem baserade på fotogrammetri, såsom Neural Radiance Fields (NeRF).
Projektet behandlar en av de stora obalanserna i datorseende-forskning – bristen på rika, semantiskt märkta urban miljödatauppsättningar med högkvalitativ modellstruktur, jämfört med den mycket höga tillgängligheten av liknande semantiska och modelleringsdata relaterade till inomhusscener.
Simuleringar som körs i UrbanScene3D kan ge grund för generering av efterföljande projektspecifika datauppsättningar relaterade till autonoma fordon och drönare, bland andra möjligheter.
Projektets källfiler, runt 70gb, har släppts kostnadsfritt för forsknings- och utbildningsändamål. Implementeringen kan köras i en C++-miljö eller i Python, och kräver Unreal Engine 4 (med 4.24 rekommenderat). För luftburet projekt, såsom drönarutbildning och simulering, stöder projektet också Microsofts AirSim.
UrbanScene3D har sex professionellt modellerade CAD-miljöer genererade av professionella artister från bilder eller satellitkartor, tillsammans med fem rekonstruerade verkliga världsmiljöer. CAD-scenarierna har rekonstruktioner av New York City, Chicago, San Francisco, Shenzhen, Suzhou och Shanghai. Bildbaserade data fokuserar på fem specifika scener från dessa städer, inklusive ett sjukhus och ett universitetscampus.
De råa insamlingsdata för UrbanScene3D släpps också, med högupplösta luftbilder på 6000×4000 pixlar, och 4K-luftvideos, tillsammans med poser och de rekonstruerade 3D-modellerna.
Projektet syftar till att åtgärda begränsningarna i befintliga urban scen datauppsättningar, och är den första som erbjuder högkvalitativa CAD-nivådetaljer tillsammans med semantisk märkning och djupkartsinformation. Tidigare insatser inkluderar:
COCO
Släppt 2014, Microsofts Common Objects in Context (COCO) datauppsättning har 1,5 miljoner objektinstanser över 80 kategorier, tillsammans med objektigenkänning i sammanhang, och fem undertexter per bild. COCO har inte GT-nät med pose eller djupinformation.

COCO-explorikonsamlingen. Källa: https://arxiv.org/pdf/1405.0312.pdf
The KITTI Vision Benchmark Suite
Producerad av Karlsruhe Institute of Technology och Toyota Technological Institute at Chicago, KITTI erbjuder djupinformation, men inte instansmasker.
CityScape
Cityscapes Dataset för Semantisk Urban Scen Förståelse (även känd som CityScape) släpptes 2016, och har tät semantisk segmentering, och instanssegmentering av människor och fordon. Dess primära mål är att hjälpa till att utveckla autonoma körningssystem och angränsande sektorer av urban övervakning.
Det har åtta klasser, inklusive platt, människa, fordon, konstruktion, objekt, natur, himlen och tom, och erbjuder fin annoteringar över 5000 bilder.

Källa: https://www.cityscapes-dataset.com/examples/#fine-annotations
CityScape släpptes 2020, och är liknande i funktioner till UrbanScene3D, förutom att den saknar CAD-modellering.
ApolloCar3D
Lanserad 2018 och lett av Baidu Research, ApolloCar3D är ett samarbete mellan flera akademiska forskningsenheter i väst och Asien, inklusive University of California at San Diego, Australian National University och Northwestern Polytechnical University i Xi’an, Kina.
ApolloCar3D är specifikt inriktad på marknivå autonoma fordon, och har 5 277 körbilder, och över 60 000 fordonsexemplar som drivs av detaljerade 3D-CAD-modeller som renderas i absoluta storlekar, och märkta för semantiska nyckelpunkter. Datauppsättningen är mer än 20 gånger större än KITTI, men, till skillnad från UrbanScene3D, har den endast delvis djupinformation.

66 nyckelpunkter definieras för varje CAD-förbättrad fordon i ApolloCar3D-datauppsättningen. Källa: https://arxiv.org/pdf/1811.12222.pdf
HoliCity
HoliCity, beskriven som ‘En cityskalig dataplattform för att lära sig holistiska 3D-strukturer’, är ett 2021 samarbete mellan UC Berkeley, Stanford, USC och Bytedance Research i Palo Alto. Det består av en cityskalig 3D-datauppsättning med hög detaljnivå, och erbjuder 6 300 verkliga världspanorama-scener som täcker ett område som överstiger 20 kvadratkilometer.
Projektet syftar till att tillämpas i verkliga världen, såsom lokaliserings-, förstärkt verklighet-, kartläggnings- och cityskalig rekonstruktion. Trots att det har CAD-modellering, är detaljnivån lägre än UrbanScene3D.

Källa: https://github.com/zhou13/holicity














