Robotyka i fizyczna AI
Naukowcy komputerowi używają wzmocnienia pozytywnego, aby nauczyć roboty
Naukowcy komputerowi z Uniwersytetu Johns Hopkins wykorzystali długo stosowaną technikę treningu, czyli wzmocnienie pozytywne, często używaną do szkolenia zwierząt, takich jak psy, aby nauczyć robota nowych umiejętności. Jedną z tych nowych umiejętności było układanie bloków.
Robot nazywa się Spot, a zdaniem badaczy, może nauczyć się umiejętności w ciągu kilku dni, co tradycyjnie zajmowałoby około miesiąca.
Wzmocnienie pozytywne
Wzmocnienie pozytywne zostało wykorzystane przez zespół, aby zwiększyć zestaw umiejętności robota. Szybkość, z jaką zespół mógł to osiągnąć, ułatwia wdrożenie tego typu robotów w świecie rzeczywistym.
Praca została opublikowana w IEEE Robotics and Automation Letters, pod tytułem „Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.”
Andrew Hundt jest doktorantem pracującym na Uniwersytecie Johns Hopkins i głównym autorem badań.
„Pytanie brzmi, jak możemy nauczyć robota nowej umiejętności?” powiedział. „Miałem psy, więc wiem, że nagrody działają, i to było inspiracją dla mojego algorytmu uczenia.”
Jednym z powodów, dla których wzmocnienie pozytywne działa na komputerach, jest to, że nie mają one intuicyjnych mózgów, co oznacza, że są one praktycznie pustą kartą, na której można wyświetlić wszystko. Innymi słowy, muszą się wszystkiego uczyć od podstaw. Jedną z najskuteczniejszych metod uczenia się dla komputerów jest próba i błąd, nad którym robotycy nadal pracują.
To właśnie zrobili badacze, tworząc system nagród dla robota, podobnie jak w procesie szkolenia psa za pomocą smakołyków. Różnica polega na tym, że robot otrzymuje punkty numeryczne, gdy wykonuje zadanie poprawnie.
https://www.youtube.com/watch?v=dvxqjJBWFD4
Umiejętności nauczone
Gdy chodziło o naukę układania bloków, robot musiał nauczyć się koncentrować na konstruktywnych działaniach. W tej metodzie robot Spot otrzymywał wyższe punkty, gdy wykonywał poprawne zachowania podczas układania bloków. Z drugiej strony, nie otrzymywał punktów za niepoprawne zachowania. Otrzymywał najwyższą ilość punktów, gdy ukończył stos czterech bloków z ostatnim blokiem na górze.
Badacze odnieśli wielki sukces w tej metodzie, a robot nauczył się w ciągu kilku dni, co wcześniej zajmowałoby tygodnie. Dzięki szkoleniu symulowanego robota, zespół zmniejszył czas praktyki przed przejściem do robota Spot.
„Robot chce wyższego wyniku”, powiedział Hundt. „Szybko uczy się odpowiedniego zachowania, aby otrzymać najlepszą nagrodę. W rzeczywistości, wcześniej zajmowało to miesiąc praktyki, aby robot osiągnął 100% skuteczności. Udało nam się to osiągnąć w ciągu dwóch dni.”
Oprócz nauki układania bloków, robot również wykorzystał wzmocnienie pozytywne, aby nauczyć się innych zadań, takich jak gra w symulowaną grę nawigacyjną.
„Na początku robot nie ma pojęcia, co robi, ale staje się coraz lepszy z każdą praktyką. Nigdy nie poddaje się i kontynuuje próby układania, aż w końcu ukończy zadanie 100% czasu”, powiedział Hundt.
Niektóre z możliwych zastosowań tej metody obejmują szkolenie robotów domowych do wykonywania określonych zadań, a także poprawę pojazdów autonomicznych.
„Naszym celem jest ostatecznie stworzenie robotów, które mogą wykonywać złożone zadania w świecie rzeczywistym – takie jak montaż produktów, opieka nad osobami starszymi i chirurgia”, powiedział Hager. „Nie wiemy obecnie, jak zaprogramować takie zadania – świat jest zbyt złożony. Ale praca taka pokazuje, że istnieje obietnica idei, że roboty mogą nauczyć się wykonywać takie zadania w świecie rzeczywistym w bezpieczny i wydajny sposób.”












