AI-modeller og plattformer
Ny teknikk hjelper AI med å identifisere 3D-objekter

En ny teknikk utviklet av forskere ved North Carolina State University forbedrer evnen til kunstig intelligens (AI)-programmer til å identifisere 3D-objekter. Kalt MonoCon, hjelper teknikken også AI til å lære hvordan 3D-objektene relaterer til hverandre i rommet ved å bruke 2D-bilder.
MonoCon kan potensielt ha en rekke anvendelser, inkludert å hjelpe selvstyrende kjøretøy med å navigere rundt andre kjøretøy ved å bruke 2D-bilder mottatt fra en onboard-kamera. Det kan også spille en rolle i produksjon og robotikk.
Tianfu Wu er hovedforfatter av forskningsrapporten og en assistentprofessor i elektro- og datateknikk ved North Carolina State University.
“Vi lever i en 3D-verden, men når du tar et bilde, registrerer det verden i en 2D-bilde,” sier Wu.
“AI-programmer mottar visuell input fra kamere. Så hvis vi vil at AI skal kunne samhandle med verden, må vi sikre at det kan tolke hva 2D-bilder kan fortelle det om 3D-rommet. I denne forskningen fokuserer vi på en del av denne utfordringen: hvordan vi kan få AI til å nøyaktig gjenkjenne 3D-objekter – som mennesker eller biler – i 2D-bilder, og plassere disse objektene i rommet,” fortsetter Wu.
Autonome kjøretøy
Autonome kjøretøy avhenger ofte av lidar for å navigere i 3D-rom. Lidar, som bruker laser til å måle avstand, er dyrt, og det betyr at autonome systemer ikke inkluderer mye redundans. Å plassere dusinvis av lidar-sensorer på en masseprodusert sjåførløs bil ville være usedvanlig dyrt.
“Men hvis et autonomt kjøretøy kunne bruke visuell input til å navigere gjennom rommet, kunne du bygge inn redundans,” sier Wu. “Fordi kamere er betydelig billigere enn lidar, ville det være økonomisk mulig å inkludere ekstra kamere – bygge inn redundans i systemet og gjøre det både tryggere og mer robust.
“Dette er en praktisk anvendelse. Men vi er også spente på den grunnleggende fremgangen i dette arbeidet: at det er mulig å få 3D-data fra 2D-objekter.”
Trening av AI
MonoCon kan identifisere 3D-objekter i 2D-bilder før de plasseres i en “begrensende boks”, som forteller AI om ytterkantene av objektet.
“Hva som skiller vårt arbeid fra andre er hvordan vi trener AI-en, som bygger på tidligere treningsteknikker,” sier Wu. “Liksom tidligere forsøk, plasserer vi objekter i 3D-begrensende bokser under trening av AI-en. Men i tillegg til å be AI-en om å forutsi kamera-til-objekt-avstand og dimensjoner på begrensende bokser, ber vi også AI-en om å forutsi plasseringen av hver av boksens åtte punkter og dens avstand fra sentrum av begrensende boks i to dimensjoner. Vi kaller dette ‘hjelpekontekst’, og vi fant at det hjelper AI-en med å mer nøyaktig identifisere og forutsi 3D-objekter basert på 2D-bilder.
“Den foreslåtte metoden er motivert av en velkjent teorem i målteori, Cramér-Wold-teoremet. Det er også potensielt anvendelig på andre strukturerte utgangsprediksjonsoppgaver i datavisjon.”
MonoCon ble testet med en bredt brukt benchmark-datasett kalt KITTI.
“På tidspunktet for vår innsending av denne artikkelen, utførte MonoCon bedre enn noen av de dusinvis av andre AI-programmer som er rettet mot å trekke ut 3D-data om biler fra 2D-bilder,” sier Wu.
Teamet vil nå se på å skalerer opp prosessen med større datasett.
“Vi skal nå skalerer opp prosessen og arbeide med større datasett for å evaluere og finjustere MonoCon for bruk i autonom kjøring,” sier Wu. “Vi ønsker også å utforske anvendelser i produksjon, for å se om vi kan forbedre ytelsen av oppgaver som bruk av robotarm.”












