AI-modellen en platforms

POKELLMON: Een menselijke-pariteitagent voor Pokémon-gevechten met LLM’s

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Grote taalmodellen en generatieve AI hebben ongekende successen behaald op een breed scala aan taken voor natuurlijke taalverwerking. Na het veroveren van het NLP-veld, is de volgende uitdaging voor GenAI- en LLM-onderzoekers om te onderzoeken hoe grote taalmodellen autonoom kunnen handelen in de echte wereld met een verlengde generatiekloof van tekst naar actie, waardoor een significante paradigma verschuiving ontstaat in de zoektocht naar kunstmatige algehele intelligentie. Online games worden beschouwd als een geschikte testomgeving om grote taalmodellen te ontwikkelen die kunnen interactie hebben met de visuele omgeving op een manier die lijkt op menselijk gedrag.

Bijvoorbeeld, in een populaire online simulatiegame zoals Minecraft, kunnen beslissingsagents worden ingezet om spelers te helpen bij het verkennen van de wereld en het ontwikkelen van vaardigheden voor het maken van gereedschap en het oplossen van taken. Een ander voorbeeld van LLM-agents die interactie hebben met de visuele omgeving is te zien in een andere online game, The Sims, waar agents opmerkelijk succes hebben behaald in sociale interacties en gedrag dat lijkt op dat van mensen. Echter, in vergelijking met bestaande games, kunnen tactische gevechtsgames een betere keuze zijn om de mogelijkheden van grote taalmodellen te testen om virtuele games te spelen. De belangrijkste reden waarom tactische games een betere benchmark zijn, is dat de winst kan worden gemeten en dat er consistent tegenstanders zijn, waaronder menselijke spelers en AI.

Op basis van hetzelfde, streeft POKELLMON ernaar om ‘s werelds eerste geïncarneerde agent te zijn die menselijke prestaties bereikt in tactische games, zoals die in Pokémon-gevechten. De POKELLMON-framework omvat drie hoofdstrategieën.

  1. In-context reinforcement learning die tekstgebaseerde feedback consumeert afgeleid van gevechten om de beleid iteratief te verfijnen.
  2. Knowledge-augmented generation die externe kennis ophaalt om hallucinaties te bestrijden, waardoor de agent op de juiste manier en op het juiste moment kan handelen.
  3. Consistente actiegeneratie om de paniekschakelingsituatie te minimaliseren wanneer de agent een sterke tegenstander tegenkomt en deze wil vermijden.

Dit artikel heeft als doel de POKELLMON-framework in detail te behandelen en we onderzoeken de mechanismen, de methodologie, de architectuur van het framework en de vergelijking met state-of-the-art-frameworks. We zullen ook praten over hoe de POKELLMON-framework opmerkelijke menselijke strategieën en beslissingsvermogens toont, en een respectabele winst van bijna 50% behaalt. Laten we beginnen.

POKELLMON: Een menselijke-pariteitagent voor Pokémon-gevechten met LLM’s

De groei in de mogelijkheden en efficiëntie van grote taalmodellen en generatieve AI-frameworks in de afgelopen jaren is niets minder dan geweldig, vooral op NLP-taken. Onlangs hebben ontwikkelaars en AI-onderzoekers gewerkt aan manieren om generatieve AI en LLM’s meer prominent te maken in de echte wereld met de mogelijkheid om autonoom te handelen in fysieke en echte wereldsituaties. Om deze autonome prestaties in fysieke en echte wereldsituaties te bereiken, beschouwen onderzoekers en ontwikkelaars games als een geschikte testomgeving om LLM-geïncarneerde agents te ontwikkelen die kunnen interactie hebben met de visuele omgeving op een manier die lijkt op menselijk gedrag.

Eerder hebben ontwikkelaars geprobeerd om LLM-geïncarneerde agents te ontwikkelen op virtuele simulatiegames zoals Minecraft en The Sims, hoewel het wordt aangenomen dat tactische games zoals Pokémon een betere keuze zouden zijn om deze agents te ontwikkelen. Pokémon-gevechten bieden ontwikkelaars de mogelijkheid om de vaardigheden van een trainer te evalueren om te vechten in bekende Pokémon-games en biedt verschillende voordelen ten opzichte van andere tactische games. Aangezien de actie- en statusruimtes discreet zijn, kunnen ze worden vertaald in tekst zonder enige verlies. De volgende figuur illustreert een typisch Pokémon-gevecht waarbij de speler wordt gevraagd om een actie te genereren om uit te voeren bij elke beurt, gegeven de huidige status van de Pokémon van elke kant.

POKELLMON: Methodologie en architectuur

De algehele framework en architectuur van de POKELLMON-framework wordt geïllustreerd in de volgende afbeelding.

Tijdens elke beurt, gebruikt de POKELLMON-framework de vorige acties en de corresponderende tekstgebaseerde feedback om het beleid iteratief te verfijnen, evenals het huidige statusinformatie aan te vullen met externe kennis zoals ability/move-effecten of voordeel/zwakte-relaties. Voor de invoergegevens, genereert de POKELLMON-framework meerdere acties onafhankelijk en selecteert vervolgens de meest consistente als de finale output.

In-Context Reinforcement Learning

Menselijke spelers en atleten nemen vaak beslissingen niet alleen op basis van de huidige status, maar reflecteren ook op de feedback van vorige acties en de ervaringen van andere spelers. Het zou veilig zijn om te zeggen dat positieve feedback helpt een speler te leren van zijn fouten en hem ervan weerhoudt om dezelfde fout te maken. Zonder adequate feedback, kan de POKELLMON-agent blijven hangen in dezelfde foutieve actie, zoals wordt gedemonstreerd in de volgende figuur.

Om ervoor te zorgen dat de POKELLMON-agent leert van zijn vorige fouten, implementeert de framework de In-Context Reinforcement Learning-benadering. Versterking van het leren is een populaire benadering in machine learning en helpt ontwikkelaars bij het verfijnen van het beleid, aangezien het numerieke beloningen vereist om acties te evalueren. Aangezien grote taalmodellen de mogelijkheid hebben om taal te interpreteren en te begrijpen, zijn tekstgebaseerde beschrijvingen een nieuwe vorm van beloning voor LLM’s geworden.

Bovendien toont de gebruik van de In-Context Reinforcement Learning-benadering een aanzienlijke boost in prestaties, zoals wordt gedemonstreerd in de volgende figuur.

Wanneer het wordt vergeleken met de oorspronkelijke prestaties op GPT-4, stijgt de winst met bijna 10% en de gevechtsscore met bijna 13%. Bovendien, zoals wordt gedemonstreerd in de volgende figuur, begint de agent te analyseren en te veranderen van zijn actie als de acties die in de vorige beurten werden uitgevoerd, niet aan de verwachtingen voldeden.

Knowledge-Augmented Generation of KAG

Hoewel de implementatie van In-Context Reinforcement Learning enige hallucinaties helpt te voorkomen, kan het nog steeds fatale gevolgen hebben voordat de agent de feedback ontvangt. Om hallucinaties verder te verminderen en de beslissingsvaardigheid van de agent te verbeteren, implementeert de POKELLMON-framework de Knowledge-Augmented Generation of KAG-benadering, een techniek die externe kennis gebruikt om generatie te versterken.

Nu, wanneer het model de 4 soorten feedback genereert die hierboven worden besproken, annoteren ze de Pokémon-bewegingen en -informatie, waardoor de agent de type-voordeelrelatie zelf kan afleiden. In een poging om hallucinaties verder te verminderen, annoteren de POKELLMON-framework expliciet de type-voordeel en -zwakte van de tegenstander en de agent, met adequate beschrijvingen.

Bovendien hebben ontwikkelaars waargenomen dat wanneer de agent werd voorzien van externe kennis van Pokémon, het begon te gebruiken van speciale bewegingen op het juiste moment, zoals wordt gedemonstreerd in de volgende afbeelding.

Consistente Actiegeneratie

Bestaande modellen demonstreren dat de implementatie van prompting- en redeneerbenaderingen de mogelijkheden van LLM’s kan verbeteren om complexe taken op te lossen. In plaats van een eenmalige actie te genereren, evalueert de POKELLMON-framework bestaande prompting-strategieën, waaronder CoT of Chain of Thought, ToT of Tree of Thought, en Self Consistency.

Er is slechts één actie per beurt, wat impliceert dat zelfs als de agent besluit om te schakelen en de tegenstander besluit aan te vallen, de ingeschakelde Pokémon de schade zou kunnen krijgen. Normaal gesproken besluit de agent om te schakelen omdat het een type-voordeel wil hebben voor een Pokémon die buiten het gevecht staat, en dus kan de ingeschakelde Pokémon de schade weerstaan, aangezien het typebestendig is tegen de bewegingen van de tegenstander.

POKELLMON: Resultaten en experimenten

Voordat we de resultaten bespreken, is het essentieel om de gevechtsomgeving te begrijpen. Aan het begin van een beurt, ontvangt de omgeving een actie-aanvraagbericht van de server en zal hierop reageren aan het einde, wat ook de uitvoeringsresultaten van de vorige beurt bevat.

  1. Eerst parseert het bericht en werkt de lokale statusvariabelen bij, 2. vervolgens vertaalt het de statusvariabelen in tekst. De tekstbeschrijving heeft voornamelijk vier delen: 1. Eigen teaminformatie, die de attributen van Pokémon in het veld en buiten het veld (ongebruikt) bevat.
  2. Tegenstander teaminformatie, die de attributen van tegenstander-Pokémon in het veld en buiten het veld (enige informatie is onbekend) bevat.
  3. Gevechtsveldinformatie, die het weer, entry-hazards en terrein omvat.
  4. Historische beurtlog-informatie, die de vorige acties van beide Pokémon bevat en wordt opgeslagen in een log-wachtrij. LLM’s nemen de vertaalde status als invoer en produceren acties voor de volgende stap. De actie wordt vervolgens naar de server gestuurd en uitgevoerd op hetzelfde moment als de actie die door de mens wordt gedaan.

Gevecht tegen menselijke spelers

De volgende tabel illustreert de prestaties van de POKELLMON-agent tegen menselijke spelers.

Zoals te zien is, levert de POKELLMON-agent prestaties die vergelijkbaar zijn met die van ladder-spelers die een hogere winst hebben dan een uitgenodigde speler, evenals uitgebreide gevechtservaring.

Gevechtsvaardigheidanalyse

De POKELLMON-framework maakt zelden een fout bij het kiezen van de effectieve beweging en schakelt over naar een andere geschikte Pokémon vanwege de Knowledge-Augmented Generation-strategie.

Zoals wordt getoond in het bovenstaande voorbeeld, gebruikt de agent slechts één Pokémon om het hele team van de tegenstander te verslaan, aangezien het in staat is om verschillende aanvalsacties te kiezen, die het meest effectief zijn voor de tegenstander in die situatie. Bovendien toont de POKELLMON-framework ook een menselijke strategie van uitputting. Sommige Pokémon hebben een “Toxic”-beweging die extra schade kan toebrengen bij elke beurt, terwijl de “Recover”-beweging het mogelijk maakt om HP te herstellen.

Slotgedachten

In dit artikel hebben we het over POKELLMON gehad, een benadering die grote taalmodellen in staat stelt om autonoom Pokémon-gevechten tegen mensen te spelen. POKELLMON streeft ernaar om ‘s werelds eerste geïncarneerde agent te zijn die menselijke prestaties bereikt in tactische games, zoals die in Pokémon-gevechten. De POKELLMON-framework introduceert drie sleutelstrategieën: In-Context Reinforcement Learning, die tekstgebaseerde feedback consumeert als “beloning” om het actiegeneratiebeleid iteratief te verfijnen zonder training, Knowledge-Augmented Generation die externe kennis ophaalt om hallucinaties te bestrijden en ervoor zorgt dat de agent op de juiste manier en op het juiste moment handelt, en Consistente Actiegeneratie die het paniekschakelingsprobleem voorkomt wanneer het tegen sterke tegenstanders komt.

Kunal Kejriwal is een backend‑engineer die zich specialiseert in Python, PostgreSQL, Redis en cloudinfrastructuur op GCP en AWS. Met drie jaar ervaring in het bouwen en opschalen van productiesystemen schrijft hij over AI‑infrastructuur, gedistribueerde systemen en de architectuur achter het inzetten van machine‑learning workloads.