Robotyka i fizyczna AI
Model uczenia maszynowego rozumie relacje między obiektami
Naukowcy z Massachusetts Institute of Technology (MIT) opracowali nowy model uczenia maszynowego (ML), który rozumie podstawowe relacje między obiektami w scenie. Model reprezentuje indywidualne relacje jeden po drugim, zanim połączy reprezentacje, aby opisać całą scenę.
Dzięki nowemu podejściu model ML może generować bardziej dokładne obrazy z opisów tekstowych, i może to robić nawet wtedy, gdy scena ma wiele projektów ułożonych w różnych relacjach względem siebie.
Ten nowy rozwój jest ważny, ponieważ wiele modeli głębokiego uczenia nie potrafi zrozumieć splątanych relacji między poszczególnymi obiektami.
Model zespołu może być użyty w przypadkach, w których roboty przemysłowe muszą wykonywać wieloetapowe zadania manipulacji, takie jak układanie przedmiotów lub montaż urządzeń. Pomaga również doprowadzić do tego, że maszyny będą w stanie uczyć się i wchodzić w interakcje ze swoim otoczeniem, podobnie jak ludzie.
Yilun Du jest doktorantem w Computer Science and Artificial Intelligence Laboratory (CSAIL) i współprowadzącym autorem artykułu. Du kierował badaniami wraz z Shuang Li, doktorantem CSAIL, i Nan Liu, studentem Uniwersytetu Illinois w Urbana-Champaign. W badaniu wziął również udział Joshua B. Tenenbaum, profesor Cognitive Science and Computation w Department of Brain and Cognitive Sciences, oraz senior autor Antonio Torralba, profesor Electrical Engineering and Computer Science. Zarówno Tenenbaum, jak i Torralba są członkami CSAIL.
Nowy model
“Gdy patrzę na stół, nie mogę powiedzieć, że jest tam obiekt w miejscu XYZ. Nasze umysły nie działają w ten sposób. W naszych umysłach, gdy rozumiemy scenę, naprawdę rozumiemy ją na podstawie relacji między obiektami. Uważamy, że budując system, który może zrozumieć relacje między obiektami, możemy użyć tego systemu do skuteczniejszego manipulowania i zmieniania naszego otoczenia”, mówi Du.
Nowy model może generować obraz sceny na podstawie opisu tekstowego obiektów i ich relacji.
System może następnie rozbić te zdania na mniejsze części, które opisują każdą relację. Każda część jest modelowana oddzielnie, a części są łączone za pomocą procesu optymalizacji, który generuje obraz sceny.
Z zdaniem rozbitym na krótsze części, system może następnie łączyć je w różny sposób, umożliwiając mu adaptację do opisów scen, których nie spotkał wcześniej.
“Inne systemy brałyby wszystkie relacje całościowo i generowałyby obraz jednym zamachem z opisu. Jednak takie podejścia zawodzą, gdy mamy opisy poza zasięgiem, takie jak opisy z większą liczbą relacji, ponieważ te modele nie mogą się naprawdę dostosować do generowania obrazów zawierających więcej relacji. Jednak ponieważ łączymy te oddzielne, mniejsze modele, możemy modelować większą liczbę relacji i dostosowywać się do nowych kombinacji”, mówi Du.
System może również wykonać ten proces w odwrotnym kierunku. Jeśli zostanie mu podany obraz, może znaleźć opisy tekstowe, które odpowiadają relacjom między obiektami w scenie.
Ocena modelu
Naukowcy poprosili ludzi, aby ocenili, czy wygenerowane obrazy odpowiadają oryginalnemu opisowi sceny. Gdy opisy zawierały trzy relacje, co było najbardziej złożonym typem, 91 procent uczestników stwierdziło, że nowy model działa lepiej niż inne metody głębokiego uczenia.
“Jedną interesującą rzeczą, którą odkryliśmy, jest to, że nasz model może zwiększyć nasz opis od jednej relacji do dwóch, trzech lub nawet czterech opisów, i nasze podejście nadal jest w stanie generować obrazy, które są poprawnie opisane przez te opisy, podczas gdy inne metody zawodzą”, mówi Du.
Model wykazał również imponującą zdolność do pracy z opisami, których wcześniej nie spotkał.
“To jest bardzo obiecujące, ponieważ jest to bliższe temu, jak działają ludzie. Ludzie mogą zobaczyć tylko kilka przykładów, ale możemy wydobyć użyteczne informacje z tylko tych kilku przykładów i połączyć je, aby utworzyć nieskończone kombinacje. I nasz model ma taką właściwość, która pozwala mu uczyć się z mniejszych danych, ale uogólniać do bardziej złożonych scen lub generowania obrazów”, mówi Li.
Zespół będzie teraz badał model na rzeczywistych obrazach, które są bardziej złożone, i będzie badał, jak ostatecznie włączyć model do systemów robotycznych.












