Modele și platforme AI

POKELLMON: Un agent cu paritate umană pentru bătălii Pokémon cu LLM

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Modelele de limbaj mari și inteligența artificială generativă au demonstrat un succes fără precedent într-o gamă largă de sarcini de procesare a limbajului natural. După ce au cucerit domeniul NLP, următoarea provocare pentru cercetătorii și dezvoltatorii GenAI și LLM este de a explora cum modelele de limbaj mari pot acționa autonom în lumea reală, cu o lacună extinsă de generare de la text la acțiune, reprezentând un paradigma semnificativă în urmărirea inteligenței artificiale generale. Jocurile online sunt considerate a fi o fundație de testare adecvată pentru a dezvolta agenți încarnați LLM care interacționează cu mediul vizual într-un mod care seamănă cu comportamentul uman.

De exemplu, într-un joc de simulare online popular, cum ar fi Minecraft, agenții de luare a deciziilor pot fi utilizați pentru a ajuta jucătorii în explorarea lumii și dezvoltarea abilităților pentru crearea de unelte și rezolvarea sarcinilor. Un alt exemplu de agenți LLM care interacționează cu mediul vizual poate fi experimentat într-un alt joc online, The Sims, unde agenții au demonstrat un succes remarcabil în interacțiunile sociale și au arătat un comportament care seamănă cu cel uman. Cu toate acestea, comparativ cu jocurile existente, jocurile tactice de luptă ar putea fi o alegere mai bună pentru a testa capacitatea modelelor de limbaj mari de a juca jocuri virtuale. Motivul principal pentru care jocurile tactice sunt o fundație de testare mai bună este că rata de câștig poate fi măsurată direct, iar adversarii constanți, inclusiv jucători umani și AI, sunt întotdeauna disponibili.

Pe baza acestor considerații, POKELLMON are ca scop să fie primul agent încarnat care atinge performanța umană în jocuri tactice, asemănătoare cu cea observată în bătălii Pokémon. La nivelul său de bază, cadrul POKELLMON include trei strategii principale.

  1. Învățarea prin întărire în context care consumă feedback text-based derivat din bătălii instantaneu pentru a rafina politica în mod iterativ.
  2. Generarea augmentată cu cunoștințe care recuperează cunoștințe externe pentru a combate halucinațiile, permițând agentului să acționeze la momentul potrivit și în mod corespunzător.
  3. Generarea de acțiuni consistente pentru a minimiza situația de comutare panică atunci când agentul întâlnește un adversar puternic și dorește să evite confruntarea cu acesta.

Acest articol are ca scop să acopere cadrul POKELLMON în profunzime și să exploreze mecanismul, metodologia, arhitectura cadrului, precum și comparația cu cadrurile de stat de artă. Vom discuta, de asemenea, despre modul în care cadrul POKELLMON demonstrează strategii de luptă remarcabil de umane și capacități de luare a deciziilor în timp real, atingând o rată de câștig respectabilă de aproape 50%. Să începem.

POKELLMON: Un agent cu paritate umană pentru bătălii Pokémon cu LLM

Creșterea capacităților și eficienței modelelor de limbaj mari și a cadrului inteligenței artificiale generative în ultimii ani a fost cu adevărat uimitoare, în special în sarcinile de procesare a limbajului natural. Recent, dezvoltatorii și cercetătorii AI au lucrat la modalități de a face inteligența artificială generativă și LLM mai proeminente în scenarii reale, cu capacitatea de a acționa autonom în lumea fizică.

Anterior, dezvoltatorii au încercat să creeze agenți încarnați LLM în jocuri de simulare virtuale, cum ar fi Minecraft și The Sims, deși se crede că jocurile tactice, cum ar fi Pokémon, ar putea fi o alegere mai bună pentru a dezvolta acești agenți. Bătăliile Pokémon permit dezvoltatorilor să evalueze capacitatea unui antrenor de a lupta în jocuri de Pokémon cunoscute și oferă mai multe avantaje față de alte jocuri tactice. Deoarece spațiile de acțiune și stare sunt discrete, ele pot fi traduse în text fără nicio pierdere. Figura următoare ilustrează o bătălie tipică de Pokémon în care jucătorul este solicitat să genereze o acțiune pentru a fi efectuată la fiecare tur, dată starea curentă a Pokémonului de pe ambele părți.

POKELLMON: Metodologie și Arhitectură

Cadrul general și arhitectura cadrului POKELLMON sunt ilustrate în imaginea următoare.

La fiecare tur, cadrul POKELLMON utilizează acțiunile anterioare și feedback-ul text-based corespunzător pentru a rafina politica în mod iterativ, împreună cu informația de stare curentă, augmentată cu cunoștințe externe, cum ar fi efectele abilităților/mișcărilor sau relația de avantajoasă/slabă. Pentru informația dată ca intrare, cadrul POKELLMON generează mai multe acțiuni independent și selectează cele mai consistente ca ieșire finală.

Învățarea prin Întărire în Context

Jucătorii umani și atleții iau adesea decizii nu numai pe baza stării curente, ci și reflectă asupra feedback-ului de la acțiunile anterioare, precum și asupra experiențelor altor jucători. Ar fi sigur să spunem că feedback-ul pozitiv este ceea ce ajută un jucător să învețe din greșelile sale și să evite să repete aceleași greșeli. Fără un feedback corespunzător, agenții POKELLMON ar putea rămâne blocați în aceeași acțiune greșită, așa cum se demonstrează în figura următoare.

Așa cum se poate observa, agentul din joc utilizează o mișcare pe bază de apă împotriva unui Pokémon care are abilitatea “Piele uscată”, care îi permite să anuleze daunele împotriva atacurilor pe bază de apă. Jocul încearcă să alerteze utilizatorul prin afișarea mesajului “Imun” pe ecran, ceea ce ar putea determina un jucător uman să-și reconsidere acțiunile și să le schimbe, chiar dacă nu cunoaște despre “Piele uscată”. Cu toate acestea, acest lucru nu este inclus în descrierea stării pentru agent, ceea ce duce la faptul că agentul repetă aceeași greșeală.

Pentru a asigura că agentul POKELLMON învață din greșelile sale anterioare, cadrul implementează abordarea de Învățare prin Întărire în Context. Învățarea prin întărire este o abordare populară în învățarea mașinilor, care ajută la rafinarea politicii, deoarece necesită recompense numerice pentru a evalua acțiunile. Deoarece modelele de limbaj mari pot interpreta și înțelege limbajul, descrierile textuale au devenit o nouă formă de recompensă pentru LLM. Prin includerea feedback-ului text-based de la acțiunile anterioare, agentul POKELLMON este capabil să-și rafineze politica în mod iterativ și instantaneu, și anume Învățarea prin Întărire în Context.

Generarea Augmentată cu Cunoștințe sau KAG

Deși implementarea Învățării prin Întărire în Context ajută la reducerea halucinațiilor până la un anumit punct, ea poate totuși avea consecințe fatale înainte ca agentul să primească feedback-ul. De exemplu, dacă agentul decide să lupte împotriva unui Pokémon de foc cu un Pokémon de iarbă, primul este probabil să câștige într-un singur tur. Pentru a reduce halucinațiile și mai mult și pentru a îmbunătăți capacitatea de luare a deciziilor a agentului, cadrul POKELLMON implementează abordarea de Generare Augmentată cu Cunoștințe sau KAG, o tehnică care utilizează cunoștințe externe pentru a augmenta generarea.

Acum, atunci când modelul generează cele patru tipuri de feedback discutate anterior, el anotează mișcările și informațiile Pokémon, permițând agentului să inferă relația de avantajoasă/slabă în mod autonom. În încercarea de a reduce halucinația conținută în raționament și mai mult, cadrul POKELLMON anotează în mod explicit avantajoasa și slaba Pokémonului advers și a Pokémonului agentului, cu descrieri adecvate. Mai mult, este dificil să se memoreze mișcările și abilitățile cu efecte distincte ale Pokémonului, mai ales că există multe dintre ele. Tabelul următor demonstrează rezultatele generării augmentate cu cunoștințe. Este demn de remarcat că, prin implementarea abordării de Generare Augmentată cu Cunoștințe, cadrul POKELLMON este capabil să crească rata de câștig cu aproximativ 20% de la 36% la 55%.

Mai mult, s-a observat că, atunci când agentul a fost furnizat cu cunoștințe externe despre Pokémon, el a început să utilizeze mișcări speciale la momentul potrivit, așa cum se demonstrează în imaginea următoare.

Generarea de Acțiuni Consistente

Modelele existente demonstrează că implementarea abordărilor de promptare și raționament poate îmbunătăți capacitatea LLM de a rezolva sarcini complexe. În loc de a genera o singură acțiune, cadrul POKELLMON evaluează strategii de promptare existente, inclusiv CoT sau Lanțul de Gândire, ToT sau Arborele de Gândire și Autoconsistență. Pentru Lanțul de Gândire, agentul generează inițial o gândire care analizează scena de luptă curentă și produce o acțiune condiționată de gândire. Pentru Autoconsistență, agentul generează trei acțiuni și selectează ieșirea care a primit cel mai mare număr de voturi. În cele din urmă, pentru abordarea Arborelui de Gândire, cadrul generează trei acțiuni, la fel ca în abordarea Autoconsistenței, dar selectează cea mai bună după evaluarea lor de către sine.

Există doar o singură acțiune pentru fiecare tur, ceea ce înseamnă că, chiar dacă agentul decide să schimbe și adversarul decide să atace, Pokémonul care intră în luptă va suferi daunele. Normal, agentul decide să schimbe pentru că dorește să schimbe un Pokémon de pe teren cu unul care are avantajoasă față de mișcările Pokémonului advers, și astfel Pokémonul care intră în luptă poate suporta daunele, deoarece este rezistent la mișcările Pokémonului advers. Cu toate acestea, așa cum s-a menționat anterior, pentru agentul cu raționament CoT, chiar dacă Pokémonul advers puternic forțează mai multe rotații, el acționează în mod inconsistent cu misiunea, deoarece poate să nu dorească să schimbe cu Pokémonul, ci cu mai multe Pokémon și înapoi, ceea ce numim comutare panică. Comutarea panică elimină șansele de a efectua mișcări și, prin urmare, duce la înfrângere.

POKELLMON: Rezultate și Experimente

Înainte de a discuta rezultatele, este esențial să înțelegem mediul de luptă. La începutul unui tur, mediul primește un mesaj de solicitare de acțiune de la server și va răspunde la acest mesaj la sfârșitul turului, care conține și rezultatul execuției de la turul anterior.

  1. Mai întâi, parsează mesajul și actualizează variabilele de stare locale, 2. apoi traduce variabilele de stare în text. Descrierea textului are în principal patru părți: 1. Informații despre echipa proprie, care conține atributele Pokémonului de pe teren și ale celui de pe bancă (neutilizat).
  2. Informații despre echipa adversă, care conține atributele Pokémonului advers de pe teren și ale celui de pe bancă (unele informații sunt necunoscute).
  3. Informații despre teren, care includ vremea, pericolele de pe teren și terenul.
  4. Informații despre istoricul tururilor anterioare, care conține acțiunile anterioare ale ambelor Pokémon și este stocat într-o coadă de jurnal. LLM-urile iau starea tradusă ca intrare și produc acțiuni pentru următorul pas. Acțiunea este apoi trimisă serverului și executată în același timp cu acțiunea efectuată de jucătorul uman.

Bătălia Împotriva Jucătorilor Umani

Tabelul următor ilustrează performanța agentului POKELLMON împotriva jucătorilor umani.

Așa cum se poate observa, agentul POKELLMON oferă o performanță comparabilă cu jucătorii de pe ladder, care au o rată de câștig mai mare comparativ cu un jucător invitat și care au o experiență extinsă de luptă.

Analiza Abilităților de Luptă

Cadrul POKELLMON rareori face o greșeală la alegerea mișcării eficiente și schimbă cu un alt Pokémon potrivit datorită strategiei de Generare Augmentată cu Cunoștințe.

Așa cum se arată în exemplul de mai sus, agentul utilizează doar un singur Pokémon pentru a învinge întreaga echipă adversă, deoarece este capabil să aleagă mișcări de atac diferite, cele mai eficiente pentru adversar în acea situație. Mai mult, cadrul POKELLMON exhibă și o strategie de uzură umană. Unele Pokémon au o mișcare “Toxic” care poate inflige daune suplimentare la fiecare tur, în timp ce mișcarea “Recover” îi permite să-și recupereze punctele de viață. Profitând de aceasta, agentul otrăvește mai întâi Pokémonul advers și utilizează mișcarea “Recover” pentru a preveni propriul Pokémon să leșine.

Gânduri Finale

În acest articol, am discutat despre POKELLMON, o abordare care permite modelelor de limbaj mari să joace bătălii Pokémon împotriva jucătorilor umani în mod autonom. POKELLMON are ca scop să fie primul agent încarnat care atinge performanța umană în jocuri tactice, asemănătoare cu cea observată în bătălii Pokémon. Cadrul POKELLMON introduce trei strategii cheie: Învățarea prin Întărire în Context, care consumă feedback-ul text-based ca “recompensă” pentru a rafina politica de generare a acțiunilor fără antrenament, Generarea Augmentată cu Cunoștințe care recuperează cunoștințe externe pentru a combate halucinațiile și a asigura că agentul acționează la momentul potrivit și în mod corespunzător, și Generarea de Acțiuni Consistente care previne problema de comutare panică atunci când se confruntă cu adversari puternici.

Kunal Kejriwal este un inginer backend specializat în Python, PostgreSQL, Redis și infrastructură cloud pe GCP și AWS. Cu trei ani de experiență în construirea și scalarea sistemelor de producție, el scrie despre infrastructura AI, sistemele distribuite și arhitectura din spatele implementării sarcinilor de învățare automată.