AI-modeller och plattformar
POKELLMON: En mänsklig-paritet agent med LLM för Pokémon-strider
Stora språkmodeller och generativa AI har visat en utanförordentlig framgång på en mängd olika naturliga språkbehandlingstekniker. Efter att ha erövrat NLP-området är nästa utmaning för GenAI- och LLM-forskare att undersöka hur stora språkmodeller kan agera autonomt i den verkliga världen med en utökad generationsgap från text till handling, vilket representerar en betydande paradigm i strävan efter artificiell allmän intelligens. Onlinespel anses vara en lämplig testbas för att utveckla stora språkmodell-inkarnerade agenter som interagerar med den visuella miljön på ett sätt som en människa skulle göra.
Till exempel, i ett populärt onlinesimuleringsspel som Minecraft, kan beslutsfattande agenter användas för att hjälpa spelarna att utforska världen samt utveckla färdigheter för att skapa verktyg och lösa uppgifter. Ett annat exempel på LLM-agenter som interagerar med den visuella miljön kan upplevas i ett annat onlinespel, The Sims, där agenter har visat en anmärkningsvärd framgång i sociala interaktioner och uppvisar ett beteende som liknar människor. Men, jämfört med existerande spel, kan taktiska stridsspel visa sig vara ett bättre val för att utvärdera förmågan hos stora språkmodeller att spela virtuella spel. Den primära anledningen till varför taktiska spel är ett bättre benchmark är att vinstfrekvensen kan mätas direkt, och konsekventa motståndare, inklusive mänskliga spelare och AI, är alltid tillgängliga.
Genom att bygga på detta, syftar POKELLMON till att vara världens första inkarnerade agent som uppnår mänsklig nivå på taktiska spel, liknande den som ses i Pokémon-strider. I dess kärna inkorporerar POKELLMON-ramverket tre huvudstrategier.
- Inkontextuell förstärkt inlärning som konsumerar textbaserad feedback som härrör från strider omedelbart för att raffinera policyn iterativt.
- Kunskapsförstärkt generation som hämtar extern kunskap för att motverka hallucinationer, vilket möjliggör för agenten att agera korrekt och när det behövs.
- Konsekvent aktionsgeneration för att minimera panikväxlingsläget när agenten möter en stark motståndare och vill undvika att möta dem.
Denna artikel syftar till att täcka POKELLMON-ramverket i detalj, och vi undersöker mekanismen, metodiken, arkitekturen i ramverket samt dess jämförelse med state-of-the-art-ramverk. Vi kommer också att diskutera hur POKELLMON-ramverket visar anmärkningsvärd mänsklig-stridstaktik och beslutsfattande förmåga i realtid, och uppnår en respektabel vinstfrekvens på nästan 50%. Så låt oss komma igång.
POKELLMON: En mänsklig-paritet agent med LLM för Pokémon-strider
Tillväxten i förmågor och effektivitet hos stora språkmodeller och generativa AI-ramverk under de senaste åren har varit ingenting annat än förbluffande, särskilt på NLP-uppgifter. Nyligen har utvecklare och AI-forskare arbetat med att göra generativ AI och LLM mer framträdande i verkliga världsscenarier med förmågan att agera autonomt i den fysiska världen.
Tidigare har utvecklare försökt att utveckla LLM-inkarnerade agenter på virtuella simulerings-spel som Minecraft och Sims, men det anses att taktiska spel som Pokémon kan vara ett bättre val för att utveckla dessa agenter. Pokémon-strider möjliggör för utvecklare att utvärdera en tränarens förmåga att strida i kända Pokémon-spel och erbjuder flera fördelar jämfört med andra taktiska spel.
POKELLMON: Metodik och Arkitektur
Det övergripande ramverket och arkitekturen för POKELLMON-ramverket visas i följande bild.
Inkontextuell Förstärkt Inlärning
Mänskliga spelare och idrottare fattar ofta beslut inte bara baserat på den aktuella situationen, utan de reflekterar också över feedback från tidigare handlingar samt andras erfarenheter.
Kunskapsförstärkt Generation eller KAG
Även om implementeringen av Inkontextuell Förstärkt Inlärning hjälper till att minska hallucinationer till viss del, kan det fortfarande leda till fatala konsekvenser innan agenten får feedback.
Konsekvent Aktionsgeneration
Existerande modeller visar att implementeringen av promptning och resonemang tillvägagångssätt kan förbättra LLM:s förmåga att lösa komplexa uppgifter.
POKELLMON: Resultat och Experiment
Innan vi diskuterar resultaten är det viktigt att förstå stridsmiljön.
Strid Mot Mänskliga Spelare
Följande tabell visar prestationen för POKELLMON-agenten mot mänskliga spelare.
Stridsteknikanalys
POKELLMON-ramverket gör sällan misstag när det gäller att välja effektiva rörelser och byter till en annan lämplig Pokémon tack vare den kunskapsförstärkta generationsstrategin.
Slutliga Tankar
I denna artikel har vi diskuterat POKELLMON, en metod som möjliggör för stora språkmodeller att spela Pokémon-strider mot människor autonomt.












