Robotyka i fizyczna AI

Roboty mogące nauczyć się skomplikowanych zadań zaledwie kilku demonstracji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W jednym z najnowszych rozwojów w dziedzinie robotyki, naukowcy z Uniwersytetu Południowej Kalifornii (USC) opracowali system, w którym roboty mogą nauczyć się skomplikowanych zadań zaledwie kilku demonstracji. Co więcej, niektóre z tych demonstracji mogą być niedoskonałe.

Badania zostały przedstawione na Konferencji Robotyki (CoRL) 18 listopada, zatytułowane “Nauka z demonstracji przy użyciu logiki sygnałów czasowych.”

System

Jakość każdej demonstracji jest mierzona, aby system mógł się uczyć ze swoich sukcesów i porażek. W przeciwieństwie do obecnych metod, które wymagają co najmniej 100 demonstracji, aby nauczyć określone zadanie, nowy system wymaga tylko kilku. W sposób intuicyjny, sposób, w jaki te roboty uczą się, jest podobny do sposobu, w jaki ludzie uczą się od siebie nawzajem. Na przykład, ludzie obserwują i uczą się od innych, którzy wykonują zadania pomyślnie lub niedoskonale.

Aniruddh Puranic jest głównym autorem badań i doktorantem w dziedzinie informatyki na USC Viterbi School of Engineering.

“Wiele systemów machine learning i reinforcement learning wymaga dużych ilości danych i setek demonstracji – potrzebujesz człowieka, który będzie demonstrował ponownie i ponownie, co nie jest wykonalne”, powiedział Puranic.

“Ponadto, większość ludzi nie ma wiedzy programistycznej, aby wyraźnie określić, co robot powinien robić, a człowiek nie może możliwie zademonstrować wszystkiego, czego robot potrzebuje, aby wiedzieć”, kontynuował. “Co się stanie, jeśli robot spotka coś, czego nie widział wcześniej? To jest kluczowe wyzwanie.”

Naukowcy wykorzystali “logikę sygnałów czasowych” lub STL, aby określić jakość demonstracji, klasyfikując je odpowiednio i tworząc wewnętrzne nagrody.

Istnieją dwa główne powody, dla których naukowcy zdecydowali się na STL:

  1. Poprzez naukę za pomocą demonstracji, roboty mogą nauczyć się niedoskonałości lub nawet niebezpieczne zachowania i niepożądane działania.
  2. Demonstracje mogą się różnić pod względem jakości w zależności od użytkownika, który je dostarcza, a niektóre demonstracje są lepszymi wskaźnikami pożądanego zachowania niż inne.

Poprzez opracowanie systemu w ten sposób, robot może nadal uczyć się z niedoskonałych demonstracji, nawet jeśli nie spełniają one wymogów logiki. Innymi słowy, sam podejmuje decyzję o dokładności lub powodzeniu.

Stefanos Nikolaidis jest współautorem i asystentem profesora informatyki na USC Viterbi.

“Załóżmy, że roboty uczą się z różnych typów demonstracji – mogą to być demonstracje praktyczne, filmy lub symulacje – jeśli zrobię coś, co jest bardzo niebezpieczne, standardowe podejścia będą robić jedną z dwóch rzeczy: albo całkowicie zignorują to, albo jeszcze gorzej, robot nauczy się złej rzeczy”, mówi Nikolaidis.

“W przeciwieństwie do tego, w bardzo inteligentny sposób, ta praca wykorzystuje pewne zdroworozsądkowe rozumowanie w postaci logiki, aby zrozumieć, które części demonstracji są dobre, a które nie”, kontynuuje. “W istocie, to jest dokładnie to, co ludzie również robią.”

Logika sygnałów czasowych

Roboty mogą rozumować o bieżących i przyszłych wynikach za pomocą STL, który jest wyrażonym językiem symbolicznym. Wcześniej niż STL, badania opierały się na “logice czasowej liniowej”.

Jyo Deshmukh jest byłym inżynierem Toyoty i asystentem profesora informatyki na USC.

“Gdy wchodzimy w świat systemów cyber-fizycznych, takich jak roboty i samochody autonomiczne, gdzie czas jest kluczowy, logika czasowa liniowa staje się nieco niewygodna, ponieważ rozumuje o sekwencjach wartości true/false dla zmiennych, podczas gdy STL pozwala rozumować o sygnałach fizycznych”, mówi Deshmukh.

Zespół naukowców był zaskoczony poziomem sukcesu systemu.

“W porównaniu z algorytmem stanu sztuki, który jest wykorzystywany w aplikacjach robotycznych, widzimy różnicę o rząd wielkości w liczbie demonstracji wymaganych”, mówi Nikolaidis.

Zdaniem naukowców systemy mogą się uczyć z symulatorów jazdy i w końcu z filmów. Następnym krokiem jest przetestowanie go na prawdziwych robotach, ponieważ początkowe testy zostały przeprowadzone na symulatorze gry. System będzie przydatny w aplikacjach takich jak te w środowiskach domowych, magazynach i łazikach kosmicznych.

“Jeśli chcemy, aby roboty były dobrymi współpracownikami i pomagały ludziom, najpierw muszą się uczyć i adaptować do ludzkich preferencji w sposób bardzo wydajny”, mówi Nikolaidis. “Nasza metoda zapewnia to.”

Alex kieruje operacjami informacyjnymi Unite.AI opartymi na sztucznej inteligencji, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy jednoczesnym zachowaniu standardów redakcyjnych publikacji.