Modele i platformy AI
DeepMind i Google Brain mają na celu stworzenie metod poprawy wydajności uczenia ze wzmocnieniem

Systemy uczenia ze wzmocnieniem mogą być potężne i niezawodne, zdolne do wykonywania skomplikowanych zadań poprzez tysiące iteracji treningu. Chociaż algorytmy uczenia ze wzmocnieniem są w stanie umożliwić zaawansowane i czasem zaskakujące zachowania, wymagają one długiego czasu treningu i ogromnych ilości danych. Te czynniki sprawiają, że techniki uczenia ze wzmocnieniem są dość nieefektywne, a niedawno zespoły badawcze z Alphabet (GOOG ) (GOOGL ) DeepMind i Google Brain podjęły się znalezienia bardziej efektywnych metod tworzenia systemów uczenia ze wzmocnieniem.
Jak donosi VentureBeat, połączony zespół badawczy niedawno zaproponował metody poprawy efektywności treningu uczenia ze wzmocnieniem. Jedną z proponowanych ulepszeń był algorytm o nazwie Adaptive Behavior Policy Sharing (ABPS), a drugim był framework o nazwie Universal Value Function Approximators (UVFA). ABPS pozwala pulom agentów AI na współdzielenie ich doświadczeń wybranych adaptacyjnie, podczas gdy UVFA pozwala tym agentom AI na równoczesne badanie skierowanych strategii eksploracji.
ABPS ma na celu przyspieszenie dostosowywania hiperparametrów podczas treningu modelu. ABPS sprawia, że znalezienie optymalnych hiperparametrów jest szybsze, dzięki temu, że kilku różnych agentów z różnymi hiperparametrami może współdzielić swoje doświadczenia polityki zachowania. Aby być bardziej precyzyjnym, ABPS pozwala agentom uczenia ze wzmocnieniem na wybór działań spośród działań, które polityka uznała za dopuszczalne, a następnie nagradza je i obserwuje na podstawie stanu następnego.
Agenci AI są szkoleni z różnymi kombinacjami możliwych hiperparametrów, takimi jak współczynnik wygaszania i współczynnik uczenia. Podczas treningu modelu celem jest to, aby model zbiegał się na kombinacji hiperparametrów, która daje mu najlepszą wydajność, a w tym przypadku również poprawia efektywność danych. Efektywność jest zwiększana przez trening wielu agentów jednocześnie i wybór zachowania tylko jednego agenta do wdrożenia podczas następnego kroku. Polityka, którą ma agent docelowy, jest używana do próbkowania działań. Przejścia są następnie rejestrowane w wspólnym miejscu, a to miejsce jest stale oceniane, aby wybór polityki nie musiał występować tak często. Na końcu treningu wybiera się zespół agentów i wybiera się najlepsze agenty do ostatecznego wdrożenia.
Jeśli chodzi o UVFA, próbuje ono rozwiązać jeden z powszechnych problemów uczenia ze wzmocnieniem, a mianowicie słabo wzmocnione agenty często nie uczą się zadań. UVFA próbuje rozwiązać ten problem, ucząc agenta odrębnych strategii eksploatacji i eksploracji w tym samym czasie. Rozdzielanie zadań tworzy ramy, które pozwalają na kontynuowanie eksploracji środowiska przez strategie eksploracji, podczas gdy strategie eksploatacji próbują maksymalizować nagrodę dla bieżącego zadania. Strategie eksploracji UVFA służą jako architektura bazowa, która będzie się stale poprawiać, nawet jeśli nie ma naturalnych nagród. W takim przypadku przybliża się funkcję, która odpowiada nagrodzie wewnętrznej, co popycha agenty do eksploracji wszystkich stanów w środowisku, nawet jeśli często wracają do znanych stanów.
Jak wyjaśnia VentureBeat, gdy framework UVFA jest w użyciu, nagrody wewnętrzne systemu są podawane bezpośrednio agentowi jako dane wejściowe. Agent następnie przechowuje reprezentację wszystkich danych wejściowych (takich jak nagrody, działania i stan) podczas danego epizodu. W efekcie nagroda jest zachowana w czasie i polityka agenta jest co najmniej częściowo poinformowana o niej w każdym momencie.
To jest osiągane za pomocą modułu “nowości epizodycznej” i modułu “nowości przez całe życie”. Funkcja pierwszego modułu polega na przechowywaniu bieżącej, epizodycznej pamięci i mapowaniu bieżących wyników na wcześniej wymienioną reprezentację, pozwalając agentowi na określenie wewnętrznej nagrody epizodycznej dla każdego kroku treningu. Następnie stan związany z bieżącą obserwacją jest dodawany do pamięci. Tymczasem moduł nowości przez całe życie jest odpowiedzialny za wpływanie na to, jak często agent eksploruje w ciągu wielu epizodów.
Zgodnie z zespołami Alphabet/Google, nowe techniki treningu już wykazały potencjał dla znaczącej poprawy podczas treningu systemu uczenia ze wzmocnieniem. UVFA był w stanie podwoić wydajność niektórych podstawowych agentów, którzy grali w różne gry Atari. Tymczasem ABPS był w stanie poprawić wydajność na niektórych tych samych grach Atari, zmniejszając zmienność wśród najlepszych agentów o około 25%. Algorytm wyszkolony z UVFA był w stanie osiągnąć wysoki wynik w grze Pitfall samodzielnie, bez żadnych zaprojektowanych cech demo ludzkich.












