Modely a platformy AI
POKELLMON: Agent s lidskou paritou pro Pokémon bitvy s LLM
Velké jazykové modely a generativní umělá inteligence prokázaly bezprecedentní úspěch v širokém spektru úkolů zpracování přirozeného jazyka. Po dobytí oblasti NLP je pro výzkumníky a vývojáře GenAI a LLM další výzvou prozkoumat, jak velké jazykové modely mohou autonomně působit ve skutečném světě s prodlouženou generační mezerou od textu k akci, což představuje významný paradigmatický posun v hledání umělé obecné inteligence. Online hry jsou považovány za vhodnou zkušební základnu pro vývoj velkých jazykových modelů, které interagují s vizuálním prostředím způsobem, který připomíná lidské chování.
Například v populární online simulační hře Minecraft lze použít rozhodovací agenti, aby pomohli hráčům při prozkoumávání světa a rozvoji dovedností pro vytváření nástrojů a řešení úkolů. Dalším příkladem interakce LLM agentů s vizuálním prostředím je hra The Sims, ve které agenti prokázali pozoruhodný úspěch v sociálních interakcích a vykazují chování podobné lidskému. Nicméně, ve srovnání s existujícími hrami, taktické bojové hry mohou být lepší volbou pro měření schopnosti velkých jazykových modelů hrát virtuální hry. Hlavním důvodem, proč taktické hry představují lepší měřítko, je to, že míra vítězství lze měřit přímo a konzistentní protivníci, včetně lidských hráčů a AI, jsou vždy k dispozici.
Na základě toho POKELLMON cílí být prvním agentem, který dosahuje lidské úrovně výkonu v taktických hrách, podobně jako v bitvách Pokémon. V jádru rámce POKELLMON zahrnuje tři hlavní strategie.
- Učení s posilováním v kontextu, které spotřebuje textovou zpětnou vazbu odvozenou z bitev okamžitě, aby se policy mohla iterativně rafinovat.
- Generace s znalostním rozšířením, která získá externí znalosti, aby potlačila halucinace, umožňující agentovi jednat správně a včas.
- Konzistentní generace akcí, aby se minimalizoval problém panické změny, když agent narazí na silného protivníka a chce se mu vyhnout.
Tento článek si klade za cíl pokrýt rámec POKELLMON podrobně a prozkoumáme mechanismus, metodologii, architekturu rámce a jeho srovnání se stávajícími rámci. Budeme také hovořit o tom, jak rámec POKELLMON prokazuje pozoruhodné lidské bojové strategie a schopnosti rozhodování v reálném čase, dosahující úctyhodné míry vítězství téměř 50%. Takže pojďme začít.
POKELLMON: Agent s lidskou paritou pro Pokémon bitvy s LLM
Růst schopností a efektivity velkých jazykových modelů a generativních AI rámců v posledních letech byl prostě úžasný, zejména u úkolů NLP. Nedávno se vývojáři a výzkumníci AI snažili najít způsoby, jak učinit Generativní AI a LLM více prominentní ve skutečných scénářích se schopností autonomního jednání ve fyzickém světě. K dosažení této autonomní výkonnosti ve fyzických a skutečných scénářích považují výzkumníci a vývojáři hry za vhodnou zkušební základnu pro vývoj LLM-embodied agentů, kteří interagují s vizuálním prostředím způsobem, který připomíná lidské chování.
Předtím se vývojáři snažili vyvinout LLM-embodied agenty v virtuálních simulačních hrách, jako je Minecraft a The Sims, ačkoli se věří, že taktické hry, jako je Pokémon, mohou být lepší volbou pro vývoj těchto agentů. Bitvy Pokémon umožňují vývojářům vyhodnotit schopnost trenéra bojovat v známých hrách Pokémon a nabízí několik výhod oproti jiným taktickým hrám. Protože akční a stavové prostory jsou diskrétní, lze je přeložit do textu bez ztráty. Následující obrázek ilustruje typickou bitvu Pokémon, ve které je hráč požádán, aby vygeneroval akci, kterou provede v každém kole, na základě aktuálního stavu Pokémonů z obou stran. Uživatelé mají možnost vybrat si z pěti různých Pokémonů a existuje celkem čtyři pohyby v akčním prostoru. Kromě toho hra pomáhá zmírnit stres na dobu inferencingu a náklady na inferencing pro LLM, protože formát na základě kol eliminuje požadavek na intenzivní hru. Jako výsledek je výkon závislý především na schopnosti rozumu velkého jazykového modelu.

POKELLMON: Metodologie a architektura
Celkový rámec a architektura rámce POKELLMON jsou ilustrovány v následujícím obrázku.

Během každého kola rámec POKELLMON používá předchozí akce a odpovídající textovou zpětnou vazbu, aby rafinoval policy iterativně, a také doplňuje aktuální stavové informace s externími znalostmi, jako jsou účinky schopností/pohybů nebo vztahy výhod/nedostatků. Pro vstupní informace rámec POKELLMON generuje několik akcí nezávisle a poté vybírá nejvíce konzistentní jako výstup.
Učení s posilováním v kontextu
Lidští hráči a sportovci často činí rozhodnutí nejen na základě aktuálního stavu, ale také reflektují zpětnou vazbu z předchozích akcí a zkušeností jiných hráčů. Bylo by bezpečné říci, že pozitivní zpětná vazba je to, co pomáhá hráči učit se z chyb a zabraňuje mu opakovat stejné chyby znovu a znovu. Bez řádné zpětné vazby by agenti POKELLMON mohli zůstat u stejné chybné akce, jak je demonstrováno v následujícím obrázku.

Jak je vidět, agent v rámci hry používá vodní pohyb proti Pokémonovi, který má schopnost „Suchá kůže“, která umožňuje mu anulovat poškození vodními útoky. Hra se snaží upozornit uživatele blikající zprávou „Imunní“ na obrazovce, která by mohla pobídot lidského hráče, aby přehodnotil své akce a změnil je, i bez znalosti „Suché kůže“. Nicméně, tato informace není zahrnuta do stavového popisu pro agenta, což vede k tomu, že agent dělá stejnou chybu znovu.
Aby se agent POKELLMON mohl učit ze svých předchozích chyb, rámec implementuje přístup učení s posilováním v kontextu. Učení s posilováním je populární přístup v strojovém učení, který pomáhá vývojářům rafinovat policy, protože vyžaduje numerické odměny pro vyhodnocení akcí. Protože velké jazykové modely mají schopnost interpretovat a rozumět jazyku, textové popisy se staly novou formou odměny pro LLM. Zahrnutím textové zpětné vazby z předchozích akcí je agent POKELLMON schopen iterativně a okamžitě rafinovat svou policy, a to je učení s posilováním v kontextu.
Generace s znalostním rozšířením nebo KAG
Ačkoli implementace učení s posilováním v kontextu pomáhá s halucinacemi do jisté míry, může to stále vést k fatálním důsledkům, než agent obdrží zpětnou vazbu. Například, pokud agent rozhodne se bojovat proti ohnivému Pokémonovi s trávníkovým Pokémonem, je pravděpodobné, že první vyhraje v jednom kole. Aby se snížily halucinace dále a zlepšila se rozhodovací schopnost agenta, rámec POKELLMON implementuje přístup generace s znalostním rozšířením nebo KAG, techniku, která využívá externí znalosti k rozšíření generace.
Nyní, když model generuje čtyři typy zpětné vazby, zmínky o Pokémonových pohybech a informacích umožňují agentovi odvodit vztah typové výhody sám. V pokusu o snížení halucinace v rozumu dále, rámec POKELLMON explicitně označí typovou výhodu a slabost protivníkových Pokémonů a agentových Pokémonů s dostatečnými popisy. Kromě toho je obtížné zapamatovat si pohyby a schopnosti s rozdílnými účinky Pokémonů, zejména proto, že jich je mnoho. Následující tabulka demonstruje výsledky generace s znalostním rozšířením.

Kromě toho, vývojáři pozorovali, že když byl agent poskytnut s externími znalostmi o Pokémoních, začal používat speciální pohyby ve správný čas, jak je demonstrováno v následujícím obrázku.

Konzistentní generace akcí
Stávající modely prokázaly, že implementace přístupů prompting a rozumu může zlepšit schopnost LLM při řešení složitých úkolů. Místo generování jedné akce, rámec POKELLMON vyhodnocuje stávající strategie prompting, včetně CoT nebo Chain of Thought, ToT nebo Tree of Thought a Self Consistency. Pro Chain of Thought, agent inicializuje myšlenku, která analyzuje aktuální bojovou situaci a výstupní akci podmíněnou na myšlence. Pro Self Consistency, agent generuje tři akce a vybírá výstup, který obdržel maximum hlasů. Nakonec, pro přístup Tree of Thought, rámec generuje tři akce, stejně jako v přístupu Self Consistency, ale vybírá tu, kterou považuje za nejlepší, poté, co je vyhodnotil sám.

Existuje pouze jedna akce pro každé kolo, což znamená, že i když agent rozhodne se změnit, a protivník rozhodne se útočit, Pokémon, který vstoupil, by utrpěl poškození. Obvykle agent rozhodne se změnit, protože chce type-výhodou změnit Pokémon mimo boje, a tak Pokémon, který vstoupil, by mohl vydržet poškození, protože byl typu odolný proti pohybům protivníkových Pokémonů. Nicméně, jako výše, pro agenta s rozumným myšlením, i když silný protivník nutí různé rotace, jedná nekonzistentně s misí, protože by mohl nechtít vstoupit do Pokémona, ale několik Pokémonů a zpět, což nazýváme panickou změnou. Panická změna eliminuje šance na provedení pohybů a vede k porážkám.
POKELLMON: Výsledky a experimenty
Než budeme diskutovat o výsledcích, je důležité pochopit bojové prostředí. Na začátku kola prostředí obdrží žádost o akci od serveru a odpoví na tuto žádost na konci, která také obsahuje výsledek z předchozího kola.
- Nejprve analyzuje zprávu a aktualizuje lokální stavové proměnné, 2. poté překládá stavové proměnné do textu. Textový popis má čtyři hlavní části: 1. Informace o vlastním týmu, které obsahují atributy Pokémonů v poli a mimo pole (nepoužité).
- Informace o protivníkově týmu, které obsahují atributy protivníkových Pokémonů v poli a mimo pole (některé informace jsou neznámé).
- Informace o bojišti, které zahrnují počasí, vstupní nebezpečí a terén.
- Historické informace o kole, které obsahují předchozí akce Pokémonů a jsou uloženy v logovací frontě. LLM přebírá přeložený stav jako vstup a výstupní akce pro další krok. Akce je poté odeslána na server a provedena ve stejnou dobu jako akce provedená člověkem.
Boj proti lidským hráčům
Následující tabulka ilustruje výkon agenta POKELLMON proti lidským hráčům.

Jak je vidět, agent POKELLMON dosahuje výkonu srovnatelného s hráči na žebříčku, kteří mají vyšší míru vítězství ve srovnání s pozvaným hráčem a mají rozsáhlé bojové zkušenosti.
Analýza bojových dovedností
Rámec POKELLMON zřídka dělá chybu při výběru účinného pohybu a přepíná se na jiného vhodného Pokémona díky strategii generace s znalostním rozšířením.

Jak je vidět v předchozím příkladu, agent používá pouze jednoho Pokémona, aby porazil celý protivníkův tým, protože je schopen vybrat různé útočné pohyby, ty, které jsou nejúčinnější pro protivníka v dané situaci. Kromě toho, rámec POKELLMON také prokazuje lidskou strategii vyčerpání. Některé Pokémony mají pohyb „Jedovatý“, který může způsobit další poškození na každém kole, zatímco pohyb „Zotavit“ umožňuje jim zotavit své HP. Využívaje toho, agent nejprve otráví protivníkového Pokémona a poté používá pohyb „Zotavit“, aby se vyhnul mdlobám.

Závěrečné myšlenky
V tomto článku jsme hovořili o POKELLMONu, přístupu, který umožňuje velkým jazykovým modelům hrát Pokémon bitvy proti lidem autonomně. POKELLMON cílí být prvním agentem, který dosahuje lidské úrovně výkonu v taktických hrách, podobně jako v bitvách Pokémon. Rámec POKELLMON zahrnuje tři klíčové strategie: učení s posilováním v kontextu, které spotřebuje textovou zpětnou vazbu jako „odměnu“ pro iterativní rafinaci policy bez tréninku, generace s znalostním rozšířením, která získá externí znalosti, aby potlačila halucinace a zajistila, že agent jedná včas a správně, a konzistentní generace akcí, která zabraňuje problému panické změny, když se setká se silnými protivníky.












