Robotika a fyzická AI
Roboti schopni se učit složité úkoly z několika demonstrací
V jedné z posledních vývojových kroků v oblasti robotiky vyvinuli výzkumníci z University of Southern California (USC) systém, ve kterém roboti mohou učit složité úkoly z několika demonstrací. Ještě působivěji, některé z demonstrací mohou být nedokonalé.
Výzkum byl prezentován na Konferenci o učení robotů (CoRL) 18. listopadu, pod názvem “Učení z demonstrací pomocí signálové temporální logiky.”
Systém
Kvalita každé demonstrace je měřena, aby systém mohl učit z úspěchů a selhání. Na rozdíl od současných metod, které vyžadují alespoň 100 demonstrací pro naučení konkrétního úkolu, nový systém vyžaduje pouze několik. Intuitivním způsobem, způsobem, jakým tito roboti učí, je podobný tomu, jak lidé učí od sebe. Například lidé sledují a učí se od ostatních, kteří dokončují úkoly úspěšně nebo nedokonale.
Aniruddh Puranic je hlavní autor výzkumu a doktorand v oboru počítačových věd na USC Viterbi School of Engineering.
“Mnoho systémů strojového učení a učení s posilováním vyžaduje velké množství dat a stovky demonstrací – potřebujete člověka, aby demonstrovat opakovaně, což není proveditelné,” řekl Puranic.
“Také většina lidí nemá znalosti programování, aby explicitně stanovila, co robot potřebuje udělat, a člověk nemůže possibly demonstrovat vše, co robot potřebuje vědět,” pokračoval. “Co když robot narazí na něco, co neviděl dříve? To je klíčová výzva.”
Výzkumníci využili “signálovou temporální logiku” nebo STL, aby určili kvalitu demonstrací, řadili je podle ní a vytvářeli vnitřní odměny.
Existují dva hlavní důvody, proč výzkumníci rozhodli o STL:
- Učením se z demonstrací mohou roboti získat nedokonalosti nebo i nebezpečné chování a nežádoucí akce.
- Demonstrace se mohou lišit v kvalitě v závislosti na uživateli, který je poskytuje, a některé demonstrace jsou lepšími ukazateli požadovaného chování než ostatní.
Vývojem systému tímto způsobem může robot stále učit z nedokonalých demonstrací, i když nesplňují logické požadavky. Jinými slovy, činí své vlastní závěry o přesnosti nebo úspěchu.
Stefanos Nikolaidis je spoluautor a asistent profesora počítačových věd na USC Viterbi.
“Řekněme, že roboti učí z různých typů demonstrací – mohlo by to být praktické demonstrování, videa nebo simulace – pokud udělám něco velmi nebezpečného, standardní přístupy budou dělat jednu ze dvou věcí: buď úplně zanedbají, nebo ještě hůře, robot se naučí špatnou věc,” říká Nikolaidis.
“Naopak, v tomto velmi inteligentním způsobu tato práce používá一些 společenský rozum ve formě logiky, aby pochopila, které části demonstrace jsou dobré a které nejsou,” pokračuje. “V podstatě je to přesně to, co také lidé dělají.”
Signálová temporální logika
Roboti mohou rozumět současným a budoucím výsledkům prostřednictvím STL, která je výразným matematickým symbolickým jazykem. Předtím než STL, výzkum spoléhal na “lineární temporální logiku.”
Jyo Deshmukh je bývalý inženýr Toyota a asistent profesora počítačových věd na USC.
“Když jdeme do světa kybernetických fyzických systémů, jako jsou roboti a autonomní vozidla, kde čas je zásadní, lineární temporální logika se stává trochu neohrabanou, protože rozumí sekvencím pravdivých/nepravdivých hodnot proměnných, zatímco STL umožňuje rozumět fyzickým signálům,” říká Deshmukh.
Tým výzkumníků byl překvapen úrovní úspěchu systému.
“Ve srovnání se státním algoritmem, který se široce používá v aplikacích robotiky, vidíte řádovou velikost rozdílu v počtu demonstrací, které jsou vyžadovány,” říká Nikolaidis.
Podle výzkumníků systémy mohou učit z driving simulátorů a nakonec i z videí. Další krok je otestovat jej na skutečných robotech, protože počáteční testování bylo provedeno na herním simulátoru. Systém bude užitečný pro aplikace, jako jsou ty v domácích prostředích, skladech a roverech pro vesmírnou exploraci.
“Pokud chceme, aby roboti byli dobrými partnery a pomáhali lidem, musí se nejprve naučit a přizpůsobit se lidským preferencím velmi efektivně,” říká Nikolaidis. “Naše metoda poskytuje to.”












