Modely a platformy AI
Demonstrační agenti AI prokázali emergentní inteligentní vlastnosti ve virtuální hře na schovávání
Jedna z interessantních skutečností o výzkumu AI je, že může často provádět akce a sledovat strategie, které překvapují samotné výzkumníky, kteří je navrhli. To se stalo během nedávné virtuální hry na schovávání, ve které byli proti sobě postavěni několika agenti AI. Výzkumníci z OpenAI, firmy zabývající se AI se sídlem v San Francisku, byli překvapeni, když zjistili, že jejich agenti AI začali využívat strategie ve hře, o kterých výzkumníci nevěděli, že existují.
OpenAI vyškolila skupinu agentů AI, aby hráli hru na schovávání jeden proti druhému. Tyto programy AI jsou školeny pomocí učení s posilováním, techniky, při které je požadované chování vyvoláno z algoritmů AI tím, že jim jsou poskytovány zpětné vazby. AI začíná náhodnými akcemi a každé akce, které mu přinese blíž ke svému cíli, je agent odměněn. AI chce získat co největší možnou odměnu, a proto experimentuje, aby zjistilo, které akce mu přinesou největší odměnu. Díky pokusům a omylům je AI schopno rozpoznat strategie, které mu přinesou vítězství, ty, které mu přinesou největší odměnu.
Učení s posilováním již prokázalo působivý úspěch při učení pravidel her. OpenAI nedávno vyškolila tým AI, aby hrál hru DOTA 2, a AI porazila tým světových šampionů mezi lidmi loni. Totéž se stalo s hrou StarCraft, když AI byla vyškolena na hru DeepMind. Učení s posilováním bylo také použito k tomu, aby AI programy naučily hrát Pictionary s lidmi, učit se interpretovat obrázky a používat základní rozumové uvažování.
V herní hře na schovávání vytvořené výzkumníky byli proti sobě postavěni několik agentů AI. Výsledkem byla soutěž, ve které každý agent chtěl překonat ostatní a získat co největší počet bodů. Nová strategie přijatá jedním agentem způsobila, že jeho soupeř hledal novou strategii, aby ho překonal, a naopak. Igor Mordatch, výzkumník z OpenAI, vysvětlil IEEE Spectrum, že tento experiment demonstruje, že tento proces pokusů a omylů mezi agenty „je dostatečný pro to, aby agenti naučili překvapivé chování sami od sebe – je to jako děti, které hrají spolu.”
Co přesně byly tyto překvapivé chování? Výzkumníci očekávali, že agenti AI naučí čtyři základní strategie, a tyto naučili poměrně rychle, stali se v nich kompetentními po pouhých 25 milionech simulovaných her. Hra se odehrávala ve 3D prostředí plném ramp, bloků a zdí. Agenti AI naučili se pronásledovat jeden druhého, pohybovat bloky, aby vytvořili pevnosti, ve kterých se mohli schovat, a pohybovat rampami. Agenti, kteří hledali, naučili se táhnout rampy, aby se dostali do pevností schovávajících se agentů, zatímco schovávající se agenti naučili se snažit vzít rampy do svých pevností, aby je hledající agenti nemohli použít.
Ale kolem 380 milionu her se stalo něco neočekávaného. Agenti AI naučili se používat dvě strategie, které výzkumníci neočekávali. Agenti, kteří hledali, naučili se, že když skočí na bednu a nakloní/usednou na bednu směrem k nearby pevnosti, mohou skočit do pevnosti a najít schovávajícího se agenta. Výzkumníci nevěděli, že to je možné v rámci fyziky herního prostředí. Schovávající se agenti naučili se vypořádat s touto otázkou tím, že táhli bedny do svých pevností.
Zatímco neočekávané chování agentů AI školených pomocí algoritmů učení s posilováním je v tomto případě neškodné, vyvolává to některé potenciální obavy o tom, jak je učení s posilováním aplikováno v jiných situacích. Člen výzkumného týmu OpenAI, Bowen Baker, vysvětlil IEEE Spectrum, že tato neočekávaná chování by mohla být potenciálně nebezpečná. Co když roboti začali chovat v neočekávaných způsobech?
„Stavět tato prostředí je obtížné,” vysvětlil Baker. „Agenti vymyslí tato neočekávaná chování, která budou bezpečnostním problémem v budoucnu, když je umístíte do složitějších prostředí.”
Ale Baker také vysvětlil, že strategie učení s posilováním by mohly vést k inovativním řešením současných problémů. Systémy vyškolené pomocí učení s posilováním by mohly řešit širokou škálu problémů s řešeními, která si možná ani nemůžeme představit.












