Modely a platformy AI
Výzkumníci z oblasti umělé inteligence vytvořili model pro hraní videoher, který si pamatuje minulé události

Tým výzkumníků z laboratoře umělé inteligence společnosti Uber nedávno vyvinul systém algoritmů umělé inteligence, který překonal jak lidské hráče, tak i jiné systémy umělé inteligence v klasických videohrách Atari. Systém umělé inteligence vyvinutý výzkumníky je schopen pamatovat si dříve úspěšné strategie a vytvářet nové strategie na základě toho, co fungovalo v minulosti. Výzkumný tým studie se domnívá, že algoritmy, které vyvinuli, mají potenciální aplikace v dalších technických oborech, jako je zpracování jazyka a robotika.
Typická metoda používaná pro vytvoření systémů umělé inteligence schopných hrát videohry spočívá v použití algoritmu učení s posilováním. Algoritmy učení s posilováním se učí, jak provádět úkoly procházením možných akcí, a po každé akci jsou jim poskytovány某 druh posilování (odměna nebo trest). Postupem času se model umělé inteligence učí, které akce vedou k větším odměnám, a stává se více pravděpodobným, že tyto akce provede. Bohužel, modely učení s posilováním narazí na potíže, když narazí na datové body, které jsou v rozporu s ostatními v datové sadě.
Podle výzkumného týmu je důvod, proč jejich přístup nebyl dosud zvažován jinými výzkumníky umělé inteligence, ten, že strategie se liší od přístupu “vnitřní motivace” typicky používaného v učení s posilováním. Problém s přístupem vnitřní motivace spočívá v tom, že model může být náchylný k “zapomínání” potenciálně odměňujících oblastí, které si stále zaslouží prozkoumání. Tento jev se nazývá “odpojení”. V důsledku toho, když model narazí na neočekávaná data, může zapomenout na oblasti, které by měly být stále prozkoumány.
Podle TechXplore se výzkumný tým pokusil vytvořit učící se model, který je více flexibilní a schopen reagovat na neočekávaná data. Výzkumníci překonali tento problém tím, že zavedli algoritmus, který je schopen pamatovat si všechny akce provedené předchozí verzí modelu, když se pokusil vyřešit problém. Když model umělé inteligence narazí na datový bod, který není konzistentní s tím, co se naučil doposud, model zkontroluje svou paměťovou mapu. Model pak identifikuje, které strategie byly úspěšné a které ne, a zvolí strategie vhodně.
Při hraní videohry model shromažďuje snímky obrazovky hry, jak hraje, a vytváří záznam svých akcí. Obrázky jsou seskupeny dohromady na základě podobnosti, vytvářející jasná časová místa, na která se model může vrátit. Algoritmus může použít zaznamenané obrázky, aby se vrátil na zajímavé místo v čase a pokračoval v prozkoumání odtud. Když model zjistí, že prohrává, vrátí se k snímkům obrazovky, které pořídil, a pokusí se o jinou strategii.
Podle BBC existuje také problém s řešením nebezpečných scénářů pro agenta umělé inteligence, který hraje hru. Pokud agent narazí na nebezpečí, které ho může zabít, zabrání mu to návratu do oblastí, které si zaslouží další prozkoumání, problém nazývaný “vyřazení”. Model umělé inteligence řeší problémy s vyřazením prostřednictvím samostatného procesu od toho, který se používá k podpoře prozkoumání starých oblastí.
Výzkumný tým nechal model projet 55 her Atari. Tyto hry se běžně používají k měření výkonu modelů umělé inteligence, ale výzkumníci přidali do her nový prvek. Výzkumníci zavedli další pravidla do her, kterými modelu uložili, aby nejen dosáhl nejvyššího skóre, ale aby se také pokusil dosáhnout ještě vyššího skóre pokaždé. Když byly analyzovány výsledky výkonu modelu, výzkumníci zjistili, že jejich systém umělé inteligence překonal ostatní systémy umělé inteligence ve hrách asi v 85 % případů. Model umělé inteligence se đặceně osvědčil ve hře Montezuma’s Revenge, platformové hře, ve které hráč vyhýbá se nebezpečím a sbírá poklady. Hra porazila rekord lidského hráče a také dosáhla vyššího skóre než jakýkoli jiný systém umělé inteligence.
Podle výzkumníků z laboratoře umělé inteligence společnosti Uber mají strategie použité výzkumným týmem potenciální aplikace v odvětvích, jako je robotika. Roboti profitují z schopnosti pamatovat si, které akce jsou úspěšné, které nefungovaly a které nebyly dosud vyzkoušeny.












