Modelli e piattaforme di IA
POKELLMON: Un Agente di Parità Umana con LLM per Battaglie di Pokémon
I Modelli Linguistici di Grande Scala e l’Intelligenza Artificiale Generativa hanno dimostrato un successo senza precedenti in una vasta gamma di compiti di Elaborazione del Linguaggio Naturale. Dopo aver conquistato il campo dell’NLP, la prossima sfida per i ricercatori di GenAI e LLM è esplorare come i modelli linguistici di grande scala possano agire autonomamente nel mondo reale con un gap di generazione esteso da testo ad azione, rappresentando così un paradigma significativo nella ricerca dell’Intelligenza Artificiale Generale. I giochi online sono considerati una base di test appropriata per sviluppare agenti incorporati di LLM che interagiscono con l’ambiente visivo in modo simile a quello umano.
Ad esempio, in un popolare gioco di simulazione online come Minecraft, gli agenti di decisione possono essere impiegati per assistere i giocatori nell’esplorazione del mondo e nello sviluppo di abilità per creare strumenti e risolvere compiti. Un altro esempio di agenti LLM che interagiscono con l’ambiente visivo può essere trovato in un altro gioco online, The Sims, dove gli agenti hanno dimostrato un notevole successo nelle interazioni sociali e mostrano un comportamento che assomiglia a quello umano. Tuttavia, rispetto ai giochi esistenti, i giochi tattici potrebbero rivelarsi una scelta migliore per valutare la capacità dei modelli linguistici di grande scala di giocare a giochi virtuali. Il motivo principale per cui i giochi tattici sono una scelta migliore è che il tasso di vittoria può essere misurato direttamente e gli avversari consistenti, compresi i giocatori umani e l’IA, sono sempre disponibili.
Sviluppando questo concetto, POKELLMON mira a essere il primo agente incorporato al mondo che raggiunge le prestazioni umane nei giochi tattici, simili a quelle osservate nelle battaglie di Pokémon. Al suo nucleo, il framework POKELLMON incorpora tre strategie principali.
- Apprendimento per rinforzo in contesto che consuma feedback testuale derivato dalle battaglie istantaneamente per raffinare la politica in modo iterativo.
- Generazione aumentata della conoscenza che recupera conoscenze esterne per contrastare le allucinazioni, consentendo all’agente di agire in modo tempestivo e appropriato.
- Generazione di azioni coerenti per minimizzare la situazione di commutazione panica quando l’agente incontra un giocatore forte e vuole evitare di affrontarlo.
Questo articolo mira a coprire il framework POKELLMON in profondità e esploriamo il meccanismo, la metodologia, l’architettura del framework e il suo confronto con i framework attuali. Discuteremo anche come il framework POKELLMON dimostra strategie di battaglia simili a quelle umane e capacità di decisione in tempo reale, raggiungendo un rispettabile tasso di vittoria del 50%. Quindi, iniziamo.
POKELLMON: Un Agente di Parità Umana con LLM per Battaglie di Pokémon
La crescita delle capacità e dell’efficienza dei Modelli Linguistici di Grande Scala e dei framework di Intelligenza Artificiale Generativa negli ultimi anni è stata nulla short di meravigliosa, soprattutto nei compiti di NLP. Di recente, gli sviluppatori e i ricercatori di IA hanno lavorato per rendere l’IA Generativa e i LLM più prominenti in scenari del mondo reale con la capacità di agire autonomamente nel mondo fisico. Per raggiungere questa prestazione autonoma in situazioni fisiche e reali, i ricercatori e gli sviluppatori considerano i giochi una base di test appropriata per sviluppare agenti incorporati di LLM che interagiscono con l’ambiente visivo in modo simile a quello umano.
In precedenza, gli sviluppatori hanno tentato di sviluppare agenti incorporati di LLM in giochi di simulazione virtuale come Minecraft e The Sims, sebbene si creda che i giochi tattici come Pokémon potrebbero essere una scelta migliore per sviluppare questi agenti. Le battaglie di Pokémon consentono agli sviluppatori di valutare la capacità di un allenatore di combattere in giochi di Pokémon ben noti e offrono diversi vantaggi rispetto ad altri giochi tattici. Dal momento che gli spazi di azione e di stato sono discreti, possono essere tradotti in testo senza alcuna perdita. La figura seguente illustra una battaglia di Pokémon tipica in cui il giocatore è invitato a generare un’azione da eseguire in ogni turno dato lo stato attuale dei Pokémon di entrambi i lati. I giocatori hanno la possibilità di scegliere tra cinque Pokémon diversi e ci sono quattro mosse nello spazio di azione. Inoltre, il gioco aiuta ad alleviare lo stress sui tempi di inferenza e sui costi di inferenza per i LLM, poiché il formato a turni elimina la necessità di un gioco intensivo. Di conseguenza, le prestazioni dipendono principalmente dalla capacità di ragionamento del modello linguistico di grande scala.

POKELLMON: Metodologia e Architettura
La struttura complessiva e l’architettura del framework POKELLMON sono illustrate nell’immagine seguente.

Durante ogni turno, il framework POKELLMON utilizza le azioni precedenti e il feedback testuale corrispondente per raffinare la politica in modo iterativo, oltre ad arricchire le informazioni sullo stato attuale con conoscenze esterne come gli effetti delle abilità/mosse o le relazioni di vantaggio/debolezza. Per le informazioni fornite in input, il framework POKELLMON genera più azioni in modo indipendente e seleziona quelle più coerenti come output finale.
Apprendimento per Rinforzo in Contesto
I giocatori umani e gli atleti spesso prendono decisioni non solo sulla base dello stato attuale, ma riflettono anche sul feedback delle azioni precedenti e sulle esperienze di altri giocatori. Sarebbe sicuro dire che il feedback positivo è ciò che aiuta un giocatore a imparare dai propri errori e a evitare di ripetere gli stessi errori. Senza un feedback appropriato, gli agenti POKELLMON potrebbero rimanere bloccati sulla stessa azione di errore, come dimostrato nella figura seguente.

Come si può osservare, l’agente nel gioco utilizza una mossa basata sull’acqua contro un Pokémon con l’abilità “Dry Skin”, che annulla il danno contro gli attacchi basati sull’acqua. Il gioco tenta di avvertire l’utente lampeggiando il messaggio “Immune” sullo schermo, che potrebbe indurre un giocatore umano a riconsiderare le proprie azioni e a cambiarle, anche senza conoscere l’abilità “Dry Skin”. Tuttavia, non è incluso nella descrizione dello stato per l’agente, portando l’agente a commettere lo stesso errore ancora.
Per assicurarsi che l’agente POKELLMON impari dai propri errori precedenti, il framework implementa l’approccio di apprendimento per rinforzo in contesto. L’apprendimento per rinforzo è un approccio popolare nell’apprendimento automatico e aiuta gli sviluppatori a raffinare la politica poiché richiede ricompense numeriche per valutare le azioni. Dal momento che i modelli linguistici di grande scala possono interpretare e comprendere il linguaggio, le descrizioni testuali sono emerse come una nuova forma di ricompensa per i LLM. Includendo il feedback testuale dalle azioni precedenti, l’agente POKELLMON è in grado di raffinare la propria politica in modo iterativo e istantaneo, ovvero l’apprendimento per rinforzo in contesto. Il framework POKELLMON sviluppa quattro tipi di feedback,
- Il danno effettivo causato da una mossa di attacco in base alla differenza di HP tra due turni consecutivi.
- L’efficacia delle mosse di attacco. Il feedback indica l’efficacia dell’attacco in termini di avere nessun effetto o essere immune, inefficace o super-effettivo a causa degli effetti dell’abilità/mossa o del vantaggio di tipo.
- L’ordine di priorità per l’esecuzione di una mossa. Poiché le statistiche precise per il Pokémon avversario non sono disponibili, il feedback sull’ordine di priorità fornisce una stima approssimativa della velocità.
- L’effetto effettivo delle mosse eseguite sul nemico. Sia le mosse di attacco che lo stato possono risultare in esiti come il recupero di HP, il potenziamento delle statistiche o gli svantaggi, l’infliction di condizioni come il congelamento, le ustioni o il veleno.

Inoltre, l’uso dell’approccio di apprendimento per rinforzo in contesto risulta in un notevole aumento delle prestazioni, come dimostrato nella figura seguente.

Quando confrontato con le prestazioni originali su GPT-4, il tasso di vittoria aumenta di quasi il 10% e il punteggio di battaglia aumenta di quasi il 13%. Inoltre, come dimostrato nella figura seguente, l’agente inizia ad analizzare e a cambiare la propria azione se le mosse eseguite nelle mosse precedenti non sono state in grado di soddisfare le aspettative.

Generazione Aumentata della Conoscenza o KAG
Sebbene l’implementazione dell’apprendimento per rinforzo in contesto aiuti a ridurre le allucinazioni in una certa misura, può ancora risultare in conseguenze fatali prima che l’agente riceva il feedback. Ad esempio, se l’agente decide di combattere contro un Pokémon di tipo fuoco con un Pokémon di tipo erba, il primo è probabile che vinca in un solo turno. Per ridurre ulteriormente le allucinazioni e migliorare la capacità di decisione dell’agente, il framework POKELLMON implementa l’approccio di generazione aumentata della conoscenza o KAG, una tecnica che impiega conoscenze esterne per aumentare la generazione.
Ora, quando il modello genera i quattro tipi di feedback discussi sopra, annota le mosse e le informazioni dei Pokémon, consentendo all’agente di inferire la relazione di vantaggio di tipo da solo. Nel tentativo di ridurre ulteriormente le allucinazioni contenute nel ragionamento, il framework POKELLMON annota esplicitamente il vantaggio di tipo e la debolezza del Pokémon avversario e del Pokémon dell’agente con descrizioni adeguate. Inoltre, è difficile memorizzare le mosse e le abilità con effetti distinti dei Pokémon, specialmente poiché ce ne sono molti. La tabella seguente dimostra i risultati della generazione aumentata della conoscenza. È degno di nota che implementando l’approccio di generazione aumentata della conoscenza, il framework POKELLMON è in grado di aumentare il tasso di vittoria del 20% rispetto al 36% esistente, raggiungendo il 55%.

Inoltre, gli sviluppatori hanno osservato che quando l’agente è stato fornito di conoscenze esterne sui Pokémon, ha iniziato a utilizzare mosse speciali al momento giusto, come dimostrato nell’immagine seguente.

Generazione di Azioni Coerenti
I modelli esistenti dimostrano che l’implementazione di approcci di ragionamento e prompt può migliorare la capacità dei LLM di risolvere compiti complessi. Invece di generare un’azione one-shot, il framework POKELLMON valuta le strategie di prompt esistenti, tra cui CoT o Catena di Pensiero, ToT o Albero del Pensiero e Coerenza con se stessi. Per la Catena di Pensiero, l’agente genera inizialmente un pensiero che analizza lo scenario di battaglia attuale e produce un’azione condizionata sul pensiero. Per la Coerenza con se stessi, l’agente genera tre azioni e seleziona l’output che ha ricevuto il maggior numero di voti. Infine, per l’approccio Albero del Pensiero, il framework genera tre azioni, come nell’approccio di Coerenza con se stessi, ma seleziona quella che considera la migliore dopo averle valutate tutte da solo. La tabella seguente riassume le prestazioni degli approcci di prompt.

C’è solo un’azione per ogni turno, il che significa che anche se l’agente decide di cambiare e l’avversario decide di attaccare, il Pokémon di cambio subirà il danno. Normalmente l’agente decide di cambiare perché vuole cambiare un Pokémon fuori dal campo di battaglia, e quindi il Pokémon di cambio può sostenere il danno, poiché è resistente al tipo di mossa del Pokémon avversario. Tuttavia, come sopra, per l’agente con ragionamento CoT, anche se il potente avversario costringe a ruotare, agisce in modo incoerente con la missione, poiché potrebbe non voler cambiare con il Pokémon, ma con più Pokémon e indietro, che chiamiamo commutazione panica. La commutazione panica elimina le possibilità di eseguire mosse e quindi porta alla sconfitta.
POKELLMON: Risultati e Esperimenti
Prima di discutere i risultati, è essenziale capire l’ambiente di battaglia. All’inizio di un turno, l’ambiente riceve un messaggio di richiesta di azione dal server e risponderà a questo messaggio alla fine, che contiene anche il risultato dell’esecuzione dell’ultimo turno.
- Innanzitutto, analizza il messaggio e aggiorna le variabili di stato locali, 2. quindi traduce le variabili di stato in testo. La descrizione del testo ha principalmente quattro parti: 1. informazioni sulla squadra, che contiene gli attributi dei Pokémon in campo e fuori campo (inutilizzati).
- Informazioni sulla squadra avversaria, che contiene gli attributi dei Pokémon avversari in campo e fuori campo (alcune informazioni sono sconosciute).
- Informazioni sul campo di battaglia, che includono il meteo, gli ostacoli di ingresso e il terreno.
- Informazioni sul log storico dei turni, che contiene le azioni precedenti di entrambi i Pokémon e viene memorizzato in una coda di log. I LLM prendono lo stato tradotto come input e producono azioni per il prossimo passo. L’azione viene quindi inviata al server e eseguita allo stesso tempo dell’azione eseguita dall’umano.
Battaglia contro Giocatori Umani
La tabella seguente illustra le prestazioni dell’agente POKELLMON contro i giocatori umani.

Come si può osservare, l’agente POKELLMON consegna prestazioni paragonabili a quelle dei giocatori della classifica che hanno un tasso di vittoria più alto rispetto a un giocatore invitato e con un’esperienza di battaglia estensiva.
Analisi delle Abilità di Battaglia
Il framework POKELLMON raramente commette errori nella scelta della mossa efficace e passa a un altro Pokémon adatto grazie alla strategia di generazione aumentata della conoscenza.

Come mostrato nell’esempio sopra, l’agente utilizza solo un Pokémon per sconfiggere l’intera squadra avversaria, poiché è in grado di scegliere mosse di attacco diverse, quelle più efficaci per l’avversario in quella situazione. Inoltre, il framework POKELLMON esibisce anche una strategia di logoramento umana. Alcuni Pokémon hanno una mossa “Tossico” che può infliggere danni aggiuntivi ad ogni turno, mentre la mossa “Recupero” gli consente di recuperare i propri HP. Sfruttando ciò, l’agente prima avvelena il Pokémon avversario e utilizza la mossa di recupero per evitare di svenire.

Pensieri Finali
In questo articolo, abbiamo parlato di POKELLMON, un approccio che consente ai modelli linguistici di grande scala di giocare a battaglie di Pokémon contro gli umani in modo autonomo. POKELLMON mira a essere il primo agente incorporato al mondo che raggiunge le prestazioni umane nei giochi tattici, simili a quelle osservate nelle battaglie di Pokémon. Il framework POKELLMON introduce tre strategie chiave: Apprendimento per Rinforzo in Contesto, che consuma il feedback testuale come “ricompensa” per raffinare la politica di generazione di azioni senza addestramento, Generazione Aumentata della Conoscenza che recupera conoscenze esterne per combattere le allucinazioni e assicura che l’agente agisca in modo tempestivo e appropriato, e Generazione di Azioni Coerenti che prevenisce il problema di commutazione panica quando si incontrano avversari potenti.












