Podstawy AI

Co to jest Głębokie Uczenie ze Wzmocnieniem?

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Co to jest Głębokie Uczenie ze Wzmocnieniem?

Wraz z nienadzorowanym uczeniem maszynowym i nadzorowanym uczeniem, inną powszechną formą tworzenia sztucznej inteligencji jest uczenie ze wzmocnieniem. Poza zwykłym uczeniem ze wzmocnieniem, głębokie uczenie ze wzmocnieniem moÅže prowadzić do niesamowicie imponujących wynikÃģw, dzięki temu, Åže łączy najlepsze aspekty zarÃģwno głębokiego uczenia, jak i uczenia ze wzmocnieniem. Przyjrzyjmy się, jak dokładnie działa głębokie uczenie ze wzmocnieniem.

Przed tym, jak zagłębimy się w głębokie uczenie ze wzmocnieniem, moÅže być dobrą ideą, aby odświeÅžyć naszą wiedzę na temat tego, jak działa zwykłe uczenie ze wzmocnieniem. W uczeniu ze wzmocnieniem, algorytmy ukierunkowane na cele są projektowane za pomocą procesu prÃģb i błędÃģw, optymalizując działanie, ktÃģre prowadzi do najlepszego wyniku/działania, ktÃģre uzyskuje najwięcej “nagrody”. Kiedy algorytmy uczenia ze wzmocnieniem są szkolone, otrzymują “nagrody” lub “kary”, ktÃģre wpływają na to, jakie działania będą one podejmować w przyszłości. Algorytmy starają się znaleŚć zestaw działań, ktÃģre zapewnią systemowi najwięcej nagrody, balansując zarÃģwno natychmiastowe, jak i przyszłe nagrody.

Algorytmy uczenia ze wzmocnieniem są bardzo potęŞne, poniewaÅž mogą być stosowane do prawie kaÅždego zadania, mogąc elastycznie i dynamicznie uczyć się z otoczenia i odkrywać moÅžliwe działania.

Przegląd Głębokiego Uczenia ze Wzmocnieniem

Zdjęcie: Megajuice via Wikimedia Commons, CC 1.0 (https://commons.wikimedia.org/wiki/File:Reinforcement_learning_diagram.svg)

Kiedy mÃģwimy o głębokim uczeniu ze wzmocnieniem, otoczenie jest zwykle reprezentowane przez obrazy. Obraz jest zapisem otoczenia w określonym momencie czasu. Agent musi analizować obrazy i wyodrębnić z nich istotne informacje, uÅžywając ich do podjęcia decyzji o tym, jakie działanie powinien wykonać. Głębokie uczenie ze wzmocnieniem jest zwykle prowadzone za pomocą jednej z dwÃģch rÃģÅžnych technik: wartościowej nauki i nauki opartej na polityce.

Techniki oparte na wartości wykorzystują algorytmy i architektury takie jak sieci neuronowe i Deep-Q-Networks. Te algorytmy działają, konwertując obraz na odcień szarości i wycinając niepotrzebne części obrazu. Następnie obraz przechodzi przez rÃģÅžne operacje splotu i pulowania, wyodrębniając najbardziej istotne części obrazu. WaÅžne części obrazu są następnie uÅžywane do obliczania Q-wartości dla rÃģÅžnych działań, ktÃģre agent moÅže wykonać. Q-wartości są uÅžywane do określenia najlepszego kursu działania dla agenta. Po obliczeniu początkowych Q-wartości, wykonuje się propagację wsteczną, aby określić najbardziej dokładne Q-wartości.

Metody oparte na polityce są uÅžywane, gdy liczba moÅžliwych działań, ktÃģre agent moÅže wykonać, jest niezwykle wysoka, co jest zwykle przypadkiem w scenariuszach rzeczywistych. Sytuacje takie wymagają innego podejścia, poniewaÅž obliczanie Q-wartości dla wszystkich poszczegÃģlnych działań nie jest praktyczne. Metody oparte na polityce działają bez obliczania funkcji wartości dla poszczegÃģlnych działań. Zamiast tego, przyjmują politykę, ucząc się polityki bezpośrednio, często za pomocą technik zwanych Policy Gradients.

Policy gradients działają, otrzymując stan i obliczając prawdopodobieństwa działań na podstawie wcześniejszych doświadczeń agenta. Najbardziej prawdopodobne działanie jest następnie wybrane. Ten proces jest powtarzany do końca okresu oceny i nagrÃģd, ktÃģre są przydzielane agentowi. Po rozdaniu nagrÃģd, parametry sieci są aktualizowane za pomocą propagacji wstecznej.

Co to jest Q-Learning?

PoniewaÅž Q-Learning jest tak duŞą częścią procesu głębokiego uczenia ze wzmocnieniem, przyjrzyjmy się, jak działa system Q-Learning.

Proces Decyzji Markowa

Proces decyzji Markowa. Zdjęcie: waldoalvarez via Pixabay, Pixbay License (https://commons.wikimedia.org/wiki/File:Markov_Decision_Process.svg)

Aby agent sztucznej inteligencji mÃģgł wykonać serię zadań i osiągnąć cel, agent musi być w stanie radzić sobie z sekwencją stanÃģw i zdarzeń. Agent zaczyna w jednym stanie i musi wykonać serię działań, aby osiągnąć stan końcowy, a moÅže istnieć ogromna liczba stanÃģw pomiędzy stanem początkowym a końcowym. Przechowywanie informacji dotyczących kaÅždego stanu jest niepraktyczne lub niemoÅžliwe, więc system musi znaleŚć sposÃģb, aby zachować tylko najbardziej istotne informacje o stanie. To jest osiągane za pomocą Procesu Decyzji Markowa, ktÃģry zachowuje tylko informacje o bieŞącym stanie i poprzednim stanie. KaÅždy stan podÄ…Åža za właściwością Markowa, ktÃģra śledzi, jak agent zmienia się z poprzedniego stanu do bieŞącego.

Głębokie Q-Learning

Kiedy model ma dostęp do informacji o stanach środowiska, Q-wartości mogą być obliczone. Q-wartości są łączną nagrodą przyznaną agentowi na końcu sekwencji działań.

Q-wartości są obliczane za pomocą serii nagrÃģd. Istnieje natychmiastowa nagroda, obliczona w bieŞącym stanie i zaleÅžna od bieŞącego działania. Q-wartość dla następnego stanu jest rÃģwnieÅž obliczana, wraz z Q-wartością dla stanu po tym, i tak dalej, aÅž do obliczenia wszystkich Q-wartości dla rÃģÅžnych stanÃģw. Istnieje rÃģwnieÅž parametr Gamma, ktÃģry jest uÅžywany do kontrolowania, jak duÅžo przyszłe nagrody wpływają na działania agenta. Polityki są zwykle obliczane przez losowe inicjowanie Q-wartości i pozwolenie modelowi zbiec w kierunku optymalnych Q-wartości w trakcie szkolenia.

Głębokie Sieci Q

Jednym z podstawowych problemÃģw związanych z uÅžyciem Q-Learning w uczeniu ze wzmocnieniem jest to, Åže ilość pamięci wymagana do przechowywania danych szybko rośnie wraz ze wzrostem liczby stanÃģw. Głębokie sieci Q rozwiązują ten problem, łącząc modele sieci neuronowych z Q-wartościami, umoÅžliwiając agentowi uczyć się z doświadczenia i podejmować rozsądne decyzje o najlepszych działaniach do podjęcia. Z głębokim Q-Learning, Q-wartości są szacowane za pomocą sieci neuronowych. Sieć neuronowa przyjmuje stan jako dane wejściowe i wyprowadza Q-wartość dla wszystkich moÅžliwych działań, ktÃģre agent moÅže wykonać.

Głębokie Q-Learning jest realizowane przez przechowywanie wszystkich wcześniejszych doświadczeń w pamięci, obliczanie maksymalnych wyjść dla sieci Q i następnie uÅžywanie funkcji straty do obliczania rÃģÅžnicy między bieŞącymi wartościami a teoretycznie najwyÅžszymi moÅžliwymi wartościami.

Głębokie Uczenie ze Wzmocnieniem vs Głębokie Uczenie

Jedną z waÅžnych rÃģÅžnic między głębokim uczeniem ze wzmocnieniem a zwykłym głębokim uczeniem jest to, Åže w przypadku pierwszego dane wejściowe są stale zmieniające się, co nie jest przypadkiem w tradycyjnym głębokim uczeniu. Jak moÅžna uwzględnić dane wejściowe i wyjściowe, ktÃģre są stale zmieniające się?

Podstawowo, aby uwzględnić rozbieÅžność między przewidywanymi wartościami a wartościami docelowymi, moÅžna uÅžyć dwÃģch sieci neuronowych zamiast jednej. Jedna sieć szacuje wartości docelowe, podczas gdy druga sieć jest odpowiedzialna za przewidywania. Parametry sieci docelowej są aktualizowane, gdy model uczy się, po wybranych iteracjach szkolenia. Wyjścia odpowiednich sieci są następnie łączone, aby określić rÃģÅžnicę.

Nauka oparta na Polityce

Nauka oparta na polityce działa inaczej niÅž podejścia oparte na Q-wartości. Podczas gdy podejścia Q-wartości tworzą funkcję wartości, ktÃģra przewiduje nagrody dla stanÃģw i działań, metody oparte na polityce określają politykę, ktÃģra mapuje stany na działania. Innymi słowy, funkcja polityki, ktÃģra wybiera działania, jest optymalizowana bezpośrednio, bez uwzględniania funkcji wartości.

Gradienty Polityki

Polityka dla głębokiego uczenia ze wzmocnieniem naleÅžy do jednej z dwÃģch kategorii: stochastycznej lub deterministycznej. Polityka deterministyczna jest taka, w ktÃģrej stany są mapowane na działania, co oznacza, Åže gdy polityka otrzymuje informacje o stanie, zwraca działanie. Tymczasem stochastyczne polityki zwracają rozkład prawdopodobieństwa działań zamiast jednego, dyskretnego działania.

Polityki deterministyczne są uÅžywane, gdy nie ma niepewności co do wynikÃģw działań, ktÃģre moÅžna wykonać. Innymi słowy, gdy środowisko jest deterministyczne. W przeciwieństwie do tego, stochastyczne polityki są odpowiednie dla środowisk, w ktÃģrych wynik działań jest niepewny. Zwykle scenariusze uczenia ze wzmocnieniem obejmują pewien stopień niepewności, więc stochastyczne polityki są uÅžywane.

Podejścia gradientu polityki mają kilka zalet w porÃģwnaniu z podejściami Q-Learning, a takÅže kilka wad. W kwestii zalet, metody oparte na polityce zbiegają się na optymalne parametry szybciej i bardziej niezawodnie. Gradient polityki moÅže być po prostu śledzony, aÅž do osiągnięcia najlepszych parametrÃģw, podczas gdy w podejściach opartych na wartościach niewielkie zmiany w oszacowanych wartościach działań mogą prowadzić do duÅžych zmian w działaniach i ich parametrach.

Gradienty polityki działają lepiej w przypadku wysokowymiarowych przestrzeni działań. Kiedy istnieje niezwykle wysoka liczba moÅžliwych działań do podjęcia, głębokie Q-Learning staje się niepraktyczne, poniewaÅž musi przydzielić ocenę kaÅždemu moÅžliwemu działaniu we wszystkich krokach czasowych, co moÅže być niemoÅžliwe obliczeniowo. Jednak z podejściami opartymi na polityce, parametry są dostosowywane w czasie, a liczba moÅžliwych najlepszych parametrÃģw szybko maleje, gdy model zbiega.

Gradienty polityki są rÃģwnieÅž w stanie wdraÅžać stochastyczne polityki, w przeciwieństwie do polityk opartych na wartościach. PoniewaÅž stochastyczne polityki produkują rozkład prawdopodobieństwa, nie jest wymagany kompromis między eksploracją a eksploatacją.

W kwestii wad, głÃģwną wadą gradientÃģw polityki jest to, Åže mogą utknąć podczas poszukiwania optymalnych parametrÃģw, koncentrując się tylko na wąskim, lokalnym zestawie optymalnych wartości zamiast globalnych optymalnych wartości.

Funkcja Oceny Polityki

Polityki uÅžywane do optymalizacji wydajności modelu mają na celu maksymalizację funkcji oceny – J(Îļ). Jeśli J(Îļ) jest miarą tego, jak dobra jest nasza polityka w osiąganiu poŞądanego celu, moÅžemy znaleŚć wartości “Îļ“, ktÃģre dają nam najlepszą politykę. Po pierwsze, musimy obliczyć oczekiwaną nagrodę polityki. Szacujemy nagrodę polityki, abyśmy mieli cel, coś, ku czemu moÅžemy dÄ…Åžyć. Funkcja oceny polityki jest tym, jak obliczamy oczekiwaną nagrodę polityki, a istnieją rÃģÅžne funkcje oceny polityki, ktÃģre są powszechnie uÅžywane, takie jak: wartości początkowe dla środowisk epizodycznych, średnia wartość dla środowisk ciągłych i średnia nagroda na krok czasowy.

Wspinaczka Gradientu Polityki

Wspinaczka gradientu ma na celu przesunięcie parametrÃģw do miejsca, w ktÃģrym ocena jest najwyÅžsza. Zdjęcie: Public Domain (https://commons.wikimedia.org/wiki/File:Gradient_ascent_(surface).png)

Po uÅžyciu poŞądanej funkcji oceny polityki i obliczeniu oczekiwanego wynagu polityki, moÅžemy znaleŚć wartość parametru “Îļ“, ktÃģry maksymalizuje funkcję oceny. Aby zmaksymalizować funkcję oceny J(Îļ), uÅžywana jest technika zwana “wspinaczką gradientu”. Wspinaczka gradientu jest podobna doConcept gradientu w głębokim uczeniu, ale optymalizujemy pod kątem najbardziej stromego wzrostu zamiast spadku. Jest to dlatego, Åže nasza ocena nie jest “błędem”, jak w wielu problemach głębokiego uczenia. Nasza ocena jest czymś, co chcemy maksymalizować. WyraÅženie zwane Twierdzeniem Gradientu Polityki jest uÅžywane do oszacowania gradientu w odniesieniu do polityki “Îļ“.

Podsumowanie Głębokiego Uczenia ze Wzmocnieniem

Podsumowując, głębokie uczenie ze wzmocnieniem łączy aspekty uczenia ze wzmocnieniem i głębokich sieci neuronowych. Głębokie uczenie ze wzmocnieniem jest realizowane za pomocą dwÃģch rÃģÅžnych technik: głębokiego Q-Learning i gradientÃģw polityki.

Metody głębokiego Q-Learning mają na celu przewidywanie, jakie nagrody będą następować po określonych działaniach w danym stanie, podczas gdy podejścia oparte na gradientach polityki mają na celu optymalizację przestrzeni działań, przewidywanie samych działań. Podejścia oparte na polityce do głębokiego uczenia ze wzmocnieniem są albo deterministyczne, albo stochastyczne w naturze. Polityki deterministyczne mapują stany bezpośrednio na działania, podczas gdy stochastyczne polityki produkują rozkłady prawdopodobieństwa działań.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, Åže pomoÅže innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.