Robotteknologi og fysisk AI
Maskinlæringsmodel forstår objektrelationer
Forskere ved Massachusetts Institute of Technology (MIT) har udviklet en ny maskinlæringsmodel (ML), der forstår de underliggende relationer mellem objekter i en scene. Modellen repræsenterer individuelle relationer én ad gangen, før den kombinerer repræsentationerne for at beskrive den samlede scene.
Gennem denne nye tilgang kan ML-modellen generere mere præcise billeder fra tekstbeskrivelser, og den kan gøre dette, selv når scenen har flere projekter arrangeret i forskellige relationer med hinanden.
Denne nye udvikling er vigtig, da mange dybe læringsmodeller ikke kan forstå de sammenflettede relationer mellem individuelle objekter.
Teamets model kan bruges i tilfælde, hvor industrielle robotter skal udføre flertrinsmanipulationsopgaver, såsom stablede emner eller samling af apparater. Den hjælper også med at føre til, at maskiner til sidst kan lære af og interagere med deres omgivelser, ligesom mennesker.
Yilun Du er en ph.d.-studerende ved Computer Science and Artificial Intelligence Laboratory (CSAIL) og co-lead-forfatter af artiklen. Du ledte forskningen sammen med Shuang Li, en CSAIL-ph.d.-studerende, og Nan Liu, en studerende ved University of Illinois at Urbana-Champaign. Det inkluderede også Joshua B. Tenenbaum, Paul E. Newton Career Development Professor of Cognitive Science and Computation i afdelingen for Brain and Cognitive Sciences, og seniorforfatter Antonio Torralba, Delta Electronics Professor of Electrical Engineering and Computer Science. Begge Tenenbaum og Torralba er medlemmer af CSAIL.
Den nye ramme
“Når jeg ser på et bord, kan jeg ikke sige, at der er et objekt på XYZ-placering. Vores hjerner fungerer ikke på den måde. Når vi forstår en scene, forstår vi den virkelig på baggrund af relationerne mellem objekterne. Vi mener, at ved at opbygge et system, der kan forstå relationerne mellem objekter, kan vi bruge det system til mere effektivt at manipulere og ændre vores omgivelser,” siger Du.
Den nye ramme kan generere et billede af en scene på baggrund af en tekstbeskrivelse af objekter og deres relationer.
Systemet kan derefter bryde disse sætninger ned i mindre dele, der beskriver hver enkelt relation. Hver del modelleres separat, og dele kombineres gennem en optimeringsproces, der genererer et billede af scenen.
Med sætningerne brudt ned i kortere stykker kan systemet derefter gensammensætte dem på forskellige måder, hvilket muliggør, at det kan tilpasse sig scenbeskrivelser, det aldrig har mødt før.
“Andre systemer ville tage alle relationer holistisk og generere billedet på én gang fra beskrivelsen. Men sådanne tilgange fejler, når vi har beskrivelser uden for distributionen, såsom beskrivelser med flere relationer, da disse modeller ikke rigtigt kan tilpasse sig på én gang for at generere billeder, der indeholder flere relationer. Men da vi komponerer disse separate, mindre modeller sammen, kan vi modelere et større antal relationer og tilpasse os til nye kombinationer,” siger Du.
Systemet kan også udføre denne proces i omvendt. Hvis det får et billede, kan det finde tekstbeskrivelser, der matcher relationerne mellem objekter i scenen.
Evaluering af modellen
Forskerne bad mennesker evaluere, om de genererede billeder svarede til den oprindelige scenbeskrivelse. Når beskrivelserne indeholdt tre relationer, hvilket var den mest komplekse type, sagde 91 procent af deltagere, at den nye model fungerede bedre end andre dybe læringsmetoder.
“En interessant ting, vi fandt, er, at for vores model kan vi øge vores sætning fra at have én relationsbeskrivelse til at have to, eller tre, eller endda fire beskrivelser, og vores tilgang kan fortsat generere billeder, der korrekt beskrives af disse beskrivelser, mens andre metoder fejler,” siger Du.
Modellen demonstrerede også en imponerende evne til at arbejde med beskrivelser, den ikke havde mødt før.
“Dette er meget lovende, fordi det er tættere på, hvordan mennesker fungerer. Mennesker kan måske kun se få eksempler, men vi kan udtrække nyttig information fra bare disse få eksempler og kombinere dem sammen for at skabe uendelige kombinationer. Og vores model har en sådan egenskab, der tillader den at lære af færre data, men generalisere til mere komplekse scener eller billedgeneration,” siger Li.
Teamet vil nu se på at teste modellen på virkelige billeder, der er mere komplekse, og udforske, hvordan man til sidst kan inkorporere modellen i robotsystemer.












