Robotikk og fysisk AI

Maskinlæringsmodell forstår objektrelationer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere ved Massachusetts Institute of Technology (MIT) har utviklet en ny maskinlæringsmodell (ML) som forstår de underliggende relasjonene mellom objekter i en scene. Modellen representerer individuelle relasjoner en om gangen før den kombinerer representasjonene for å beskrive den totale scenen.

Gjennom denne nye tilnærmingen kan ML-modellen generere mer nøyaktige bilder fra tekstbeskrivelser, og den kan gjøre dette selv når scenen har flere prosjekter arrangert i forskjellige relasjoner med hverandre.

Dette nye frembruddet er viktig ettersom mange dype læringsmodeller ikke kan forstå de sammenflettede relasjonene mellom individuelle objekter.

Teamets modell kan brukes i tilfeller der industriroboter må utføre flertrinns manipulasjonsoppgaver, som å stable varer eller montere apparater. Den hjelper også til å få maskiner til å lære av og samhandle med sine omgivelser, akkurat som mennesker.

Yilun Du er en PhD-student ved Computer Science and Artificial Intelligence Laboratory (CSAIL) og medforfatter av artikkelen. Du ledet forskningen sammen med Shuang Li, en CSAIL-PhD-student, og Nan Liu, en masterstudent ved University of Illinois at Urbana-Champaign. Det inkluderte også Joshua B. Tenenbaum, Paul E. Newton Career Development Professor of Cognitive Science and Computation i Department of Brain and Cognitive Sciences, og seniorforfatter Antonio Torralba, Delta Electronics Professor of Electrical Engineering and Computer Science. Begge Tenenbaum og Torralba er medlemmer av CSAIL.

Det nye rammeverket

“Når jeg ser på et bord, kan jeg ikke si at det er et objekt på XYZ-locasjon. Våre hjerner fungerer ikke på den måten. Når vi forstår en scene, forstår vi den virkelig basert på relasjonene mellom objekter. Vi tror at ved å bygge et system som kan forstå relasjonene mellom objekter, kan vi bruke det systemet til å manipulere og endre våre omgivelser mer effektivt,” sier Du.

Det nye rammeverket kan generere et bilde av en scene basert på en tekstbeskrivelse av objekter og deres relasjoner.

Systemet kan deretter bryte disse setningene ned i mindre deler som beskriver hver enkelt relasjon. Hver del modelleres separat, og delene kombineres gjennom en optimeringsprosess som genererer et bilde av scenen.

Med setningene brutt ned i kortere deler, kan systemet deretter rekombinere dem på forskjellige måter, noe som gjør det mulig å tilpasse seg scenbeskrivelser det aldri har møtt før.

“Andre systemer ville ta alle relasjonene helhetlig og generere bildet på en gang fra beskrivelsen. Men slike tilnærminger feiler når vi har utenfor-distribusjonsbeskrivelser, som beskrivelser med flere relasjoner, siden disse modellene ikke kan tilpasse seg på en gang for å generere bilder som inneholder flere relasjoner. Men siden vi komponerer disse separate, mindre modellene sammen, kan vi modellere et større antall relasjoner og tilpasse oss nye kombinasjoner,” sier Du.

Systemet kan også utføre denne prosessen i revers. Hvis det mates et bilde, kan det finne tekstbeskrivelser som matcher relasjonene mellom objekter i scenen.

Vurdering av modellen

Forskerne ba mennesker evaluere om de genererte bildene matchet den opprinnelige scenbeskrivelsen. Når beskrivelsene inneholdt tre relasjoner, som var den mest komplekse typen, sa 91 prosent av deltakerne at den nye modellen fungerte bedre enn andre dype læringsmetoder.

“En interessant ting vi fant var at for vår modell, kan vi øke vår setning fra å ha en relasjonsbeskrivelse til å ha to, eller tre, eller selv fire beskrivelser, og vår tilnærming fortsetter å være i stand til å generere bilder som er riktig beskrevet av disse beskrivelsene, mens andre metoder feiler,” sier Du.

Modellen viste også en imponerende evne til å fungere med beskrivelser det ikke hadde møtt tidligere.

“Dette er svært løftende fordi det er nærmere hvordan mennesker fungerer. Mennesker kan kanskje bare se noen få eksempler, men vi kan trekke nyttig informasjon fra bare disse få eksemplene og kombinere dem sammen for å skape uendelige kombinasjoner. Og vår modell har en slik egenskap som gjør at den kan lære fra færre data, men generalisere til mer komplekse scener eller bildegenerering,” sier Li.

Teamet vil nå se på å teste modellen på virkelige bilder som er mer komplekse og utforske hvordan de kan inkorporere modellen i robotikk-systemer.

Alex leder Unite.AI sine AI-drevne nyhetsoperasjoner, og kombinerer journalistikk, forskning og automatisering for å støtte rettidig og skalerbar dekning av kunstig intelligens. Arbeidet hans bidrar til å sikre at fremvoksende AI‑utviklinger blir fremhevet effektivt, samtidig som publikasjonens redaksjonelle standarder opprettholdes.