AI-modeller og platforme

Ny teknik hjælper AI med at identificere 3D-objekter

mm
Føj Unite.AI til dine foretrukne kilder på Google

En ny teknik, der er udviklet af forskere ved North Carolina State University, forbedrer artificial intelligence (AI)-programmers evne til at identificere 3D-objekter. Denne teknik, der hedder MonoCon, hjælper også AI med at lære, hvordan 3D-objekterne relaterer til hinanden i rummet ved hjælp af 2D-billeder.

MonoCon kunne potentielt have en bred vifte af anvendelser, herunder at hjælpe selvstændige køretøjer med at navigere rundt om andre køretøjer ved hjælp af 2D-billeder, der modtages fra en onboard-kamera. Det kunne også spille en rol i produktion og robotteknologi.

Tianfu Wu er hovedforfatter af forskningspapiret og en adjunktprofessor i elektroteknik og datateknik ved North Carolina State University.

“Vi lever i en 3D-verden, men når vi tager et billede, optager det verden i et 2D-billede,” siger Wu.

“AI-programmer modtager visuelle input fra kameraler. Så hvis vi vil have, at AI skal interagere med verden, må vi sikre, at det kan fortolke, hvad 2D-billeder kan fortælle os om 3D-rummet. I denne forskning fokuserer vi på en del af denne udfordring: hvordan vi kan få AI til at nøjagtigt genkende 3D-objekter – såsom mennesker eller biler – i 2D-billeder og placere disse objekter i rummet,” fortsætter Wu.

Autonome køretøjer

Autonome køretøjer afhænger ofte af lidar til at navigere i 3D-rum. Lidar, der bruger laser til at måle afstand, er dyrt, hvilket betyder, at autonome systemer ikke inkluderer megen redundans. At placere dusinvis af lidar-sensorer på en masseproduceret selvstændig bil ville være utroligt dyrt.

“Men hvis et autonomt køretøj kunne bruge visuelle input til at navigere gennem rummet, kunne man bygge ind i redundans,” siger Wu. “Fordi kameraler er betydeligt billigere end lidar, ville det være økonomisk forsvarligt at inkludere ekstra kameraler – bygge redundans ind i systemet og gøre det både sikrere og mere robust.

“Det er en praktisk anvendelse. Men vi er også begejstrede for den fundamentale fremgang i dette arbejde: at det er muligt at få 3D-data fra 2D-objekter.”

Træning af AI

MonoCon kan identificere 3D-objekter i 2D-billeder, før de placeres i en “indramning”, der fortæller AI, hvilke objekters ydre kanter er.

“Hvad der adskiller vores arbejde fra andre, er, hvordan vi træner AI, som bygger på tidligere træningsteknikker,” siger Wu. “Ligesom tidligere bestræbelser placerer vi objekter i 3D-indramninger under træningen af AI. Men ud over at bede AI om at forudsige afstanden fra kamera til objekt og dimensionerne af indramningerne, beder vi også AI om at forudsige placeringen af hver af indramningens otte punkter og dens afstand fra indramningens center i to dimensioner. Vi kalder dette “hjælpekontekst”, og vi fandt, at det hjælper AI med at mere nøjagtigt identificere og forudsige 3D-objekter baseret på 2D-billeder.

“Den foreslåede metode er motiveret af en velkendt teorem i målteori, Cramér-Wold-teoremet. Det er også potentelt anvendeligt på andre strukturerede output-forudsigelsesopgaver i computerseende.”

MonoCon blev testet med en bredt anvendt benchmark-datasæt kaldet KITTI.

“På det tidspunkt, hvor vi indsendte dette papir, opførte MonoCon sig bedre end nogen af de mange andre AI-programmer, der var rettet mod at udtrække 3D-data om biler fra 2D-billeder,” siger Wu.

Holdet vil nu se på at skala processen op med større datasæt.

“Fremadrettet skal vi skala processen op og arbejde med større datasæt for at evaluere og finjustere MonoCon til brug i autonom kørsel,” siger Wu. “Vi vil også gerne udforske anvendelser i produktion, for at se, om vi kan forbedre ydeevnen af opgaver såsom brugen af robotarme.”

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.