AI-modeller och plattformar

Ny teknik hjälper AI att identifiera 3D-objekt

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En ny teknik som utvecklats av forskare vid North Carolina State University förbättrar artificiell intelligens (AI) programs förmåga att identifiera 3D-objekt. Tekniken, som kallas MonoCon, hjälper också AI att lära sig hur 3D-objekten relaterar till varandra i rummet med hjälp av 2D-bilder.

MonoCon kan potentiellt ha en stor mängd tillämpningar, inklusive att hjälpa autonoma fordon att navigera runt andra fordon med hjälp av 2D-bilder från en kamera ombord. Det kan också spela en roll i tillverkning och robotik.

Tianfu Wu är huvudförfattare till forskningsrapporten och biträdande professor i elektroteknik och datorteknik vid North Carolina State University.

“Vi lever i en 3D-värld, men när vi tar en bild, registrerar den världen i en 2D-bild”, säger Wu.

“AI-program får visuell input från kameror. Så om vi vill att AI ska interagera med världen, måste vi se till att det kan tolka vad 2D-bilder kan berätta om 3D-rymden. I denna forskning fokuserar vi på en del av den utmaningen: hur vi kan få AI att korrekt känna igen 3D-objekt – som människor eller bilar – i 2D-bilder och placera dessa objekt i rummet”, fortsätter Wu.

Autonoma fordon

Autonoma fordon förlitar sig ofta på lidar för att navigera i 3D-rymden. Lidar, som använder laser för att mäta avstånd, är dyrt, vilket innebär att autonoma system inte innehåller mycket redundans. Att placera dussintals lidar-sensorer på en massproducerad bil utan förare skulle vara otroligt dyrt.

“Men om ett autonomt fordon kunde använda visuell input för att navigera genom rummet, kunde man bygga in redundans”, säger Wu. “Eftersom kameror är betydligt billigare än lidar, skulle det vara ekonomiskt möjligt att inkludera fler kameror – bygga in redundans i systemet och göra det både säkrare och mer robust.

“Det är en praktisk tillämpning. Men vi är också upphetsade över den grundläggande framstegen i detta arbete: att det är möjligt att få 3D-data från 2D-objekt.”

Träning av AI

MonoCon kan identifiera 3D-objekt i 2D-bilder innan de placeras i en “begränsningsruta”, som talar om för AI de yttre kanterna på objektet.

“Vad som särskiljer vårt arbete är hur vi tränar AI, som bygger på tidigare träningsmetoder”, säger Wu. “Liksom tidigare ansträngningar placerar vi objekt i 3D-begränsningsrutor medan vi tränar AI. Men förutom att be AI att förutsäga kamera-till-objekt-avstånd och dimensioner på begränsningsrutorna, ber vi också AI att förutsäga platserna för var och en av rutans åtta punkter och dess avstånd från mitten av begränsningsrutan i två dimensioner. Vi kallar detta “hjälpkontext”, och vi fann att det hjälper AI att mer exakt identifiera och förutsäga 3D-objekt baserat på 2D-bilder.

“Den föreslagna metoden är motiverad av en välkänd sats i måtteori, Cramér-Wold-satsen. Den är också potentiellt tillämplig på andra strukturerade utdataprediktionsuppgifter inom datorteknik.”

MonoCon testades med en allmänt använd benchmark-dataset som kallas KITTI.

“Vid den tidpunkt då vi skickade in denna artikel, presterade MonoCon bättre än något av de dussintals andra AI-programmen som syftade till att extrahera 3D-data om fordon från 2D-bilder”, säger Wu.

Teamet kommer nu att skala upp processen med större dataset.

“Vi skalar nu upp processen och arbetar med större dataset för att utvärdera och finjustera MonoCon för användning i autonom körning”, säger Wu. “Vi vill också undersöka tillämpningar inom tillverkning, för att se om vi kan förbättra prestandan för uppgifter som användningen av robotarmar.”

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.