Robotică și IA fizică
Modelul de învățare automată înțelege relațiile dintre obiecte
Cercetătorii de la Institutul de Tehnologie din Massachusetts (MIT) au dezvoltat un nou model de învățare automată (ML) care înțelege relațiile subiacente dintre obiecte într-o scenă. Modelul reprezintă relații individuale una câte una, înainte de a combina reprezentările pentru a descrie scena în ansamblu.
Prin această abordare nouă, modelul ML poate genera imagini mai precise din descrieri textuale și poate face acest lucru chiar și atunci când scena are multiple proiecte aranjate în relații diferite unele cu altele.
Acestă nouă dezvoltare este importantă, având în vedere că multe modele de învățare profundă nu pot înțelege relațiile împletite dintre obiecte individuale.
Modelul echipei ar putea fi utilizat în cazurile în care roboții industriali trebuie să efectueze sarcini de manipulare în mai multe etape, cum ar fi stivuirea obiectelor sau asamblarea aparatelor. De asemenea, ajută la faptul că mașinile vor putea învăța și interacționa cu mediul lor, la fel ca oamenii.
Yilun Du este student doctorand în Laboratorul de Știință și Inteligență Artificială (CSAIL) și coautor al articolului. Du a condus cercetarea împreună cu Shuang Li, student doctorand CSAIL, și Nan Liu, student absolvent al Universității Illinois din Urbana-Champaign. De asemenea, a inclus Joshua B. Tenenbaum, profesor de științe cognitive și computaționale în Departamentul de Creier și Științe Cognitive, și autorul senior Antonio Torralba, profesor de electronică și informatică. Atât Tenenbaum, cât și Torralba sunt membri ai CSAIL.
Noul Cadru
“Când privesc o masă, nu pot spune că există un obiect la locația XYZ. Mințile noastre nu funcționează astfel. În mințile noastre, atunci când înțelegem o scenă, o înțelegem cu adevărat pe baza relațiilor dintre obiecte. Credem că, prin construirea unui sistem care poate înțelege relațiile dintre obiecte, am putea utiliza acel sistem pentru a manipula și schimba mediul nostru în mod mai eficient,” spune Du.
Noul cadru poate genera o imagine a unei scene pe baza unei descrieri textuale a obiectelor și relațiilor lor.
Sistemul poate apoi descompune aceste propoziții în bucăți mai mici care descriu fiecare relație individuală. Fiecare parte este modelată separat, iar piesele sunt combinate printr-un proces de optimizare care generează o imagine a scenei.
Cu propozițiile descompuse în bucăți mai mici, sistemul poate apoi recombina acestea în moduri diferite, permițându-i să se adapteze la descrieri de scene pe care nu le-a întâlnit anterior.
“Alte sisteme ar lua toate relațiile în mod holistic și ar genera imaginea dintr-o singură descriere. Cu toate acestea, astfel de abordări eșuează atunci când avem descrieri care nu se încadrează în distribuția noastră, cum ar fi descrieri cu mai multe relații, deoarece aceste modele nu pot adapta în mod eficient pentru a genera imagini care conțin mai multe relații. Cu toate acestea, deoarece compunem aceste modele separate, mai mici, împreună, putem modela un număr mai mare de relații și ne putem adapta la combinații noi,” spune Du.
Sistemul poate efectua și acest proces în sens invers. Dacă i se furnizează o imagine, poate găsi descrieri textuale care se potrivesc relațiilor dintre obiecte în scenă.
Evaluarea Modelului
Cercetătorii au cerut oamenilor să evalueze dacă imaginile generate se potrivesc cu descrierea originală a scenei. Atunci când descrierile conțineau trei relații, ceea ce a fost cel mai complex tip, 91% dintre participanți au spus că noul model a performant mai bine decât alte metode de învățare profundă.
“Un lucru interesant pe care l-am găsit este că, pentru modelul nostru, putem crește propoziția noastră de la o relație la două, sau trei, sau chiar patru descrieri, și abordarea noastră continuă să poată genera imagini care sunt descrise în mod corect de aceste descrieri, în timp ce alte metode eșuează,” spune Du.
Modelul a demonstrat, de asemenea, o capacitate impresionantă de a lucra cu descrieri pe care nu le-a întâlnit anterior.
“Acest lucru este foarte promițător, deoarece este mai aproape de modul în care funcționează oamenii. Oamenii pot vedea doar câteva exemple, dar putem extrage informații utile din doar aceste câteva exemple și le putem combina pentru a crea combinații infinite. Și modelul nostru are o astfel de proprietate care îi permite să învețe din mai puține date, dar să generalizeze la scene sau generări de imagini mai complexe,” spune Li.
Echipa va testa acum modelul pe imagini din lumea reală care sunt mai complexe și va explora modul în care să încorporeze modelul în sisteme de roboți.












