Základy AI

Co je učení s posilováním?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Co je učení s posilováním?

Jednoduše řečeno, učení s posilováním je technika strojového učení, která zahrnuje trénování umělých inteligentních agentů prostřednictvím opakování akcí a přidružených odměn. Agent učení s posilováním experimentuje v prostředí, provádí akce a je odměňován, když jsou provedeny správné akce. Časem se agent učí provádět akce, které maximalizují jeho odměnu. To je rychlé definice učení s posilováním, ale bližší pohled na koncepty za učením s posilováním vám pomůže získat lepší, intuitivnější pochopení.

Pojem “učení s posilováním” je odvozen od konceptu posilování v psychologii. Z tohoto důvodu se podívejme na psychologický koncept posilování. V psychologickém smyslu se termín posilování vztahuje na něco, co zvyšuje pravděpodobnost, že určitá odpověď/akce bude provedena. Tento koncept posilování je centrální ideou teorie operantního kondicionování, která byla původně navržena psychologem B.F. Skinnerem. V tomto kontextu je posilování cokoliv, co způsobí, že se frekvence určitého chování zvýší. Pokud si uvědomíme možné posilování pro lidi, mohou to být věci jako chvála, zvýšení platu, bonbony a zábavné činnosti.

V tradičním, psychologickém smyslu existují dva typy posilování. Existuje pozitivní posilování a negativní posilování. Pozitivní posilování je přidání něčeho, aby se zvýšila frekvence chování, jako je dání odměny psu, když se chová dobře. Negativní posilování zahrnuje odstranění stimulu, aby se vyvolala určitá akce, jako je vypnutí hlasitých zvuků, aby se vyvedl plašený kočka.

Pozitivní a negativní posilování

Pozitivní posilování zvyšuje frekvenci chování, zatímco negativní posilování snižuje frekvenci. Obecně je pozitivní posilování nejčastěji používaným typem posilování v učení s posilováním, protože pomáhá modelům maximalizovat výkon na dané úloze. Kromě toho vede pozitivní posilování model k tomu, aby prováděl udržitelné změny, změny, které se mohou stát konzistentními vzorci a trvat po dlouhou dobu.

Naopak, zatímco negativní posilování také zvyšuje frekvenci chování, používá se pro udržení minimálního standardu výkonu, spíše než pro dosažení maximálního výkonu modelu. Negativní posilování v učení s posilováním může pomoci zajistit, aby model byl držený dál od nežádoucích akcí, ale nemůže wirklich vést model k tomu, aby探oval желанные akce.

Trénování agenta učení s posilováním

Když je agent učení s posilováním trénován, existují čtyři různé ingredience nebo stavy používané v tréninku: počáteční stavy (Stav 0), nový stav (Stav 1), akce a odměny.

Představte si, že trénujeme agenta učení s posilováním, aby hrál platformovou videohru, kde je cílem agenta dostat se na konec úrovně pohybem doprava přes obrazovku. Počáteční stav hry je získán z prostředí, což znamená, že první snímek hry je analyzován a dán modelu. Na základě této informace musí model rozhodnout o akci.

Během počátečních fází tréninku jsou tyto akce náhodné, ale jak je model posilován, certain akce se stanou častějšími. Po provedení akce je prostředí hry aktualizováno a vytvořen je nový stav nebo snímek. Pokud akce provedená agentem vyprodukovala žádoucí výsledek, řekněme, že v tomto případě agent je stále naživu a nebyl zasažen nepřítelem, je agentovi udělena nějaká odměna a stává se více pravděpodobným, že bude provádět stejnou akci v budoucnu.

Tento základní systém se neustále opakuje, děje se znovu a znovu, a každý krát se agent snaží naučit trochu více a maximalizovat svou odměnu.

Epizodické vs kontinuální úkoly

Úkoly učení s posilováním lze obvykle zařadit do jedné ze dvou různých kategorií: epizodické úkoly a kontinuální úkoly.

Epizodické úkoly provedou tréninkový smyčku a vylepší svůj výkon, dokud nejsou splněna某 kritéria a trénink je ukončen. Ve hře to může být dosažení konce úrovně nebo pád do pasti, jako jsou špičky. Naopak kontinuální úkoly nemají ukončovací kritéria, essenciálně pokračují v tréninku donekonečna, dokud inženýr nezvolí ukončit trénink.

Monte Carlo vs Temporální rozdíl

Existují dva hlavní způsoby, jak naučit, nebo trénovat, agenta učení s posilováním. V Monte Carlo přístupu jsou odměny doručeny agentovi (jeho skóre je aktualizováno) pouze na konci tréninkové epizody. Jinými slovy, pouze když je splněna ukončovací podmínka, model se naučí, jak dobře si vedl. Může pak použít tyto informace k aktualizaci a když je spuštěn další tréninkový kolo, bude reagovat v souladu s novými informacemi.

Temporální rozdíl metoda se liší od Monte Carlo metody v tom, že odhad hodnoty, nebo odhad skóre, je aktualizován během tréninkové epizody. Jakmile model postupuje do dalšího časového kroku, jsou hodnoty aktualizovány.

Explorace vs Exploatace

Trénování agenta učení s posilováním je rovnovážný akt, který zahrnuje rovnováhu dvou různých metrik: explorace a exploatace.

Explorace je akt shromažďování více informací o okolním prostředí, zatímco exploatace je použití již známých informací o prostředí k získání bodů za odměnu. Pokud agent pouze exploruje a nikdy neexploituje prostředí, žádoucí akce nikdy nebudou provedeny. Naopak, pokud agent pouze exploituje a nikdy neexploruje, agent se naučí provádět pouze jednu akci a nebude objevovat jiné možné strategie, jak získat body za odměnu. Proto je vyvážení explorace a exploatace kritické při vytváření agenta učení s posilováním.

Případy použití učení s posilováním

Učení s posilováním lze použít v široké škále rolí a je nejlépe vhodné pro aplikace, kde úkoly vyžadují automatizaci.

Automatizace úkonů, které mají být provedeny průmyslovými roboty, je jednou oblastí, kde učení s posilováním prokazuje své přínosy. Učení s posilováním lze také použít pro problémy, jako je textové dolování, vytváření modelů, které jsou schopné shrnout dlouhé texty. Výzkumníci také experimentují s použitím učení s posilováním ve zdravotnictví, kde agenti učení s posilováním zpracovávají úkoly, jako je optimalizace léčebných politik. Učení s posilováním by mohlo být také použito k přizpůsobení vzdělávacího materiálu pro studenty.

Shrnutí učení s posilováním

Učení s posilováním je silnou metodou konstrukce umělých inteligentních agentů, která může vést k působivým a někdy překvapivým výsledkům. Trénování agenta prostřednictvím učení s posilováním může být komplexní a obtížné, protože vyžaduje mnoho tréninkových iterací a jemnou rovnováhu explorace a exploatace. Nicméně, pokud je úspěšné, agent vytvořený pomocí učení s posilováním může provádět komplexní úkoly v široké škále různých prostředí.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.