Podstawy AI

Co to jest uczenie ze wzmocnieniem?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Co to jest uczenie ze wzmocnieniem?

Uczenie ze wzmocnieniem to prosta technika machine learning, która polega na szkoleniu sztucznej inteligencji poprzez powtarzanie działań i nagradzanie za poprawne działania. Agent uczenia ze wzmocnieniem eksperymentuje w środowisku, podejmując działania i otrzymując nagrody, gdy podejmie poprawne działania. Z czasem agent uczy się podejmować działania, które maksymalizują jego nagrodę. To jest szybka definicja uczenia ze wzmocnieniem, ale bliższe przyjrzenie się pojęciom za tym pojęciem pomoże Ci zrozumieć je lepiej.

Termin “uczenie ze wzmocnieniem” został zaadaptowany z pojęcia wzmocnienia w psychologii. Dlatego też warto się przyjrzeć pojęciu wzmocnienia w psychologii. W psychologicznym sensie, wzmocnienie odnosi się do czegoś, co zwiększa prawdopodobieństwo, że dana odpowiedź lub działanie wystąpi. To pojęcie wzmocnienia jest centralnym pomysłem teorii warunkowania operacyjnego, której twórcą jest psycholog B.F. Skinner. W tym kontekście, wzmocnienie to wszystko, co powoduje zwiększenie częstotliwości danego zachowania. Jeśli pomyślimy o możliwych wzmocnieniach dla ludzi, mogą to być rzeczy takie jak pochwały, podwyżka w pracy, cukierki i zabawy.

W tradycyjnym, psychologicznym sensie, istnieją dwa rodzaje wzmocnienia. Jest wzmocnienie pozytywne i negatywne. Wzmocnienie pozytywne polega na dodaniu czegoś, aby zwiększyć zachowanie, jak na przykład dawanie psu cukierka, gdy jest grzeczny. Wzmocnienie negatywne polega na usunięciu bodźca, aby wywołać zachowanie, jak na przykład wyłączenie głośnych dźwięków, aby wywołać zachowanie lękliwego kota.

Wzmocnienie pozytywne i negatywne

Wzmocnienie pozytywne zwiększa częstotliwość zachowania, podczas gdy wzmocnienie negatywne zmniejsza ją. Ogólnie, wzmocnienie pozytywne jest najczęstszym rodzajem wzmocnienia stosowanym w uczeniu ze wzmocnieniem, ponieważ pomaga modelom maksymalizować wydajność w danym zadaniu. Nie tylko to, ale wzmocnienie pozytywne prowadzi do trwałych zmian, które mogą stać się stałymi wzorcami i utrzymywać się przez długi czas.

W przeciwieństwie do tego, wzmocnienie negatywne również zwiększa prawdopodobieństwo zachowania, ale jest stosowane w celu utrzymania minimalnego poziomu wydajności, a nie osiągania maksymalnej wydajności modelu. Wzmocnienie negatywne w uczeniu ze wzmocnieniem może pomóc upewnić się, że model unika niepożądanych działań, ale nie może sprawić, aby model eksplorował pożądane działania.

Szkolenie agenta uczenia ze wzmocnieniem

Podczas szkolenia agenta uczenia ze wzmocnieniem, istnieją cztery różne składniki lub stany stosowane w szkoleniu: stan początkowy (Stan 0), nowy stan (Stan 1), działania i nagrody.

Wyobraź sobie, że szkolimy agenta uczenia ze wzmocnieniem, aby grał w grę platformową, w której celem AI jest dotarcie do końca poziomu, poruszając się w prawo po ekranie. Stan początkowy gry jest pobierany ze środowiska, co oznacza, że pierwszy klatka gry jest analizowany i podawany modelowi. Na podstawie tej informacji, model musi podjąć decyzję o działaniu.

Podczas początkowych faz szkolenia, te działania są losowe, ale gdy model jest wzmocniony, pewne działania staną się bardziej powszechne. Po podjęciu działania, środowisko gry jest aktualizowane i tworzony jest nowy stan lub klatka. Jeśli działanie podjęte przez agenta dało pożądany wynik, na przykład agent jest nadal żywy i nie został trafiony przez wroga, agent otrzymuje nagrodę i staje się bardziej prawdopodobne, że podejmie to samo działanie w przyszłości.

Ten podstawowy system jest ciągle powtarzany, dzieje się to raz za razem, i za każdym razem agent próbuje się uczyć i maksymalizować swoją nagrodę.

Zadania epizodyczne a zadania ciągłe

Zadania uczenia ze wzmocnieniem można geralnie podzielić na dwie kategorie: zadania epizodyczne i zadania ciągłe.

Zadania epizodyczne wykonują pętlę szkolenia i poprawiają swoją wydajność, aż do momentu, gdy zostaną spełnione określone kryteria końcowe i szkolenie zostanie zakończone. W grze, może to być dotarcie do końca poziomu lub upadek w pułapkę, taką jak kolce. W przeciwieństwie do tego, zadania ciągłe nie mają kryteriów zakończenia, co oznacza, że szkolenie trwa w nieskończoność, aż do momentu, gdy inżynier zdecyduje się zakończyć szkolenie.

Monte Carlo a Temporal Difference

Istnieją dwa podstawowe sposoby szkolenia agenta uczenia ze wzmocnieniem. W podejściu Monte Carlo, nagrody są przydzielane agentowi (jego wynik jest aktualizowany) tylko na końcu epizodu szkolenia. Innymi słowy, tylko wtedy, gdy zostanie spełnione kryterium zakończenia, model dowiaduje się, jak dobrze się sprawił. Może wtedy wykorzystać tę informację do aktualizacji i gdy rozpocznie się następna runda szkolenia, będzie reagował zgodnie z nową informacją.

Metoda temporal-difference różni się od metody Monte Carlo tym, że estymacja wartości, czyli estymacja wyniku, jest aktualizowana w trakcie epizodu szkolenia. Gdy model przechodzi do następnego kroku czasowego, wartości są aktualizowane.

Eksploracja a eksploatacja

Szkolenie agenta uczenia ze wzmocnieniem to równowaga między dwiema różnymi miarami: eksploracją i eksploatacją.

Eksploracja to akt zbierania więcej informacji o otoczeniu, podczas gdy eksploatacja to korzystanie z już znanych informacji o otoczeniu, aby zdobyć punkty nagrody. Jeśli agent tylko eksploruje i nigdy nie eksploatuje otoczenia, pożądane działania nigdy nie będą wykonywane. Z drugiej strony, jeśli agent tylko eksploatuje i nigdy nie eksploruje, agent nauczy się wykonywać tylko jedną akcję i nie odkryje innych możliwych strategii zdobywania nagród. Dlatego też, równowaga między eksploracją a eksploatacją jest kluczowa przy tworzeniu agenta uczenia ze wzmocnieniem.

Zastosowania uczenia ze wzmocnieniem

Uczenie ze wzmocnieniem może być stosowane w szerokim zakresie zastosowań i jest najlepiej dopasowane do aplikacji, w których zadania wymagają automatyzacji.

Automatyzacja zadań do wykonania przez roboty przemysłowe to jeden z obszarów, w którym uczenie ze wzmocnieniem się sprawdza. Uczenie ze wzmocnieniem może być również stosowane w problemach takich jak wydobywanie informacji z tekstu, tworzenie modeli, które mogą podsumować długie teksty. Naukowcy również eksperymentują z użyciem uczenia ze wzmocnieniem w dziedzinie opieki zdrowotnej, z agentami uczenia ze wzmocnieniem, które wykonują zadania takie jak optymalizacja polityk leczenia. Uczenie ze wzmocnieniem mogłoby być również stosowane do dostosowywania materiałów edukacyjnych do potrzeb uczniów.

Podsumowanie uczenia ze wzmocnieniem

Uczenie ze wzmocnieniem to potężna metoda konstruowania agentów AI, które mogą prowadzić do imponujących i czasem zaskakujących wyników. Szkolenie agenta za pomocą uczenia ze wzmocnieniem może być skomplikowane i trudne, ponieważ wymaga wielu iteracji szkolenia i delikatnej równowagi między eksploracją a eksploatacją. Jednakże, jeśli się powiedzie, agent stworzony za pomocą uczenia ze wzmocnieniem może wykonywać złożone zadania w szerokim zakresie różnych środowisk.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.