Robotik och fysisk AI
Maskinlärningsmodell förstår objektrelationer
Forskare vid Massachusetts Institute of Technology (MIT) har utvecklat en ny maskinlärningsmodell (ML) som förstår de underliggande relationerna mellan objekt i en scen. Modellen representerar individuella relationer en i taget innan de kombineras för att beskriva den övergripande scenen.
Genom denna nya tillvägagångssätt kan ML-modellen generera mer exakta bilder från textbeskrivningar, och den kan göra detta även när scenen har flera projekt arrangerade i olika relationer med varandra.
Denna nya utveckling är viktig med tanke på att många djupa inlärningsmodeller inte kan förstå de sammanflätade relationerna mellan enskilda objekt.
Teamets modell kan användas i fall där industrirobotar måste utföra flerstegsmanipulationer, såsom stapling av föremål eller montering av apparater. Den hjälper också till att maskiner så småningom kan lära sig av och interagera med sin omgivning, precis som människor.
Yilun Du är en doktorand i datavetenskap och artificiell intelligenslaboratorium (CSAIL) och medförfattare till artikeln. Du ledde forskningen tillsammans med Shuang Li, en CSAIL-doktorand, och Nan Liu, en masterstudent vid University of Illinois at Urbana-Champaign. Det inkluderade också Joshua B. Tenenbaum, Paul E. Newton Career Development Professor of Cognitive Science and Computation i institutionen för hjärna och kognitiv vetenskap, och seniorförfattare Antonio Torralba, Delta Electronics Professor of Electrical Engineering and Computer Science. Både Tenenbaum och Torralba är medlemmar i CSAIL.
Den nya ramen
“När jag tittar på ett bord kan jag inte säga att det finns ett objekt på XYZ-plats. Våra hjärnor fungerar inte så. När vi förstår en scen, förstår vi den verkligen baserat på relationerna mellan objekten. Vi tror att genom att bygga ett system som kan förstå relationerna mellan objekt, kan vi använda det systemet för att mer effektivt manipulera och förändra vår omgivning”, säger Du.
Den nya ramen kan generera en bild av en scen baserat på en textbeskrivning av objekt och deras relationer.
Systemet kan sedan bryta ner dessa meningar i mindre delar som beskriver varje enskild relation. Varje del modelleras separat, och delarna kombineras genom en optimeringsprocess som genererar en bild av scenen.
Med meningarna brutna ner i kortare delar, kan systemet sedan kombinera dem på olika sätt, vilket möjliggör anpassning till scenbeskrivningar som det aldrig har mött tidigare.
“Andra system skulle ta alla relationer holistiskt och generera bilden på en gång från beskrivningen. Men sådana tillvägagångssätt misslyckas när vi har beskrivningar utanför distributionen, såsom beskrivningar med fler relationer, eftersom dessa modeller inte kan anpassa sig på en gång för att generera bilder som innehåller fler relationer. Men eftersom vi sammansätter dessa separata, mindre modeller, kan vi modellera ett större antal relationer och anpassa oss till nya kombinationer”, säger Du.
Systemet kan också utföra denna process i omvänd ordning. Om det matas med en bild, kan det hitta textbeskrivningar som matchar relationerna mellan objekten i scenen.
Utvardering av modellen
Forskarna bad människor att utvärdera om de genererade bilderna matchade den ursprungliga scenbeskrivningen. När beskrivningarna innehöll tre relationer, vilket var den mest komplexa typen, sa 91 procent av deltagarna att den nya modellen fungerade bättre än andra djupa inlärningsmetoder.
“En intressant sak vi fann var att för vår modell kan vi öka vår mening från att ha en relationsbeskrivning till att ha två, eller tre, eller till och med fyra beskrivningar, och vår tillvägagångssätt fortsätter att kunna generera bilder som korrekt beskrivs av dessa beskrivningar, medan andra metoder misslyckas”, säger Du.
Modellen visade också en imponerande förmåga att arbeta med beskrivningar som den inte hade mött tidigare.
“Detta är mycket lovande eftersom det är närmare hur människor fungerar. Människor kan bara se några exempel, men vi kan extrahera användbar information från bara dessa få exempel och kombinera dem för att skapa oändliga kombinationer. Och vår modell har en sådan egenskap som tillåter den att lära sig från färre data men generalisera till mer komplexa scener eller bildgenerering”, säger Li.
Teamet kommer nu att testa modellen på riktiga bilder som är mer komplexa och undersöka hur man kan inkorporera modellen i robotiksystem.












