Modelli e piattaforme di IA
EUREKA: Progettazione di Ricompense a Livello Umano tramite Codifica di Modelli Linguistici di Grande Scala
Con i progressi che i Modelli Linguistici di Grande Scala (LLM) hanno fatto negli ultimi anni, non è sorprendente che questi framework LLM eccellano come pianificatori semantici per compiti di decisione sequenziale ad alto livello. Tuttavia, gli sviluppatori trovano ancora difficile utilizzare appieno le potenzialità dei framework LLM per l’apprendimento di compiti di manipolazione a basso livello complessi. Nonostante la loro efficienza, i Modelli Linguistici di Grande Scala attuali richiedono una notevole esperienza di dominio e di soggetto per apprendere anche semplici abilità o costruire promemoria testuali, creando un divario significativo tra le loro prestazioni e la destrezza umana.
Per colmare questo divario, gli sviluppatori di Nvidia (NVDA ), CalTech, UPenn e altri hanno introdotto EUREKA, un algoritmo di progettazione umano-livello alimentato da LLM. EUREKA mira a sfruttare le varie capacità dei framework LLM, tra cui la scrittura di codice, il miglioramento in contesto e la generazione di contenuti zero-shot, per eseguire un’ottimizzazione senza precedenti dei codici di ricompensa. Questi codici di ricompensa, combinati con l’apprendimento per rinforzo, consentono ai framework di apprendere abilità complesse o eseguire compiti di manipolazione.
In questo articolo, esamineremo il framework EUREKA da una prospettiva di sviluppo, esplorandone la struttura, il funzionamento e i risultati che raggiunge nella generazione di funzioni di ricompensa. Queste funzioni, come affermano gli sviluppatori, superano quelle generate dagli esseri umani. Esamineremo anche come il framework EUREKA apra la strada a un nuovo approccio all’apprendimento per rinforzo con feedback umano (RLHF) consentendo l’apprendimento in contesto senza gradiente. Iniziamo.
EUREKA: Un’introduzione
Oggi, i framework LLM di stato dell’arte come GPT-3 e GPT-4 forniscono risultati eccezionali quando fungono da pianificatori semantici per compiti di decisione sequenziale ad alto livello, ma gli sviluppatori stanno ancora cercando modi per migliorare le loro prestazioni quando si tratta di apprendere compiti di manipolazione a basso livello come la destrezza di far girare una penna. Inoltre, gli sviluppatori hanno osservato che l’apprendimento per rinforzo può essere utilizzato per ottenere risultati sostenibili in condizioni di destrezza e in altri domini, a condizione che le funzioni di ricompensa siano costruite con cura da progettisti umani e che queste funzioni di ricompensa siano in grado di fornire i segnali di apprendimento per comportamenti favorevoli. Quando paragonati a compiti di apprendimento per rinforzo nel mondo reale che accettano ricompense sparse, rende difficile per il modello apprendere i modelli, plasmando queste ricompense fornisce i segnali di apprendimento incrementali necessari. Inoltre, le funzioni di ricompensa, nonostante la loro importanza, sono estremamente difficili da progettare e progetti subottimali di queste funzioni spesso portano a comportamenti inintenzionali.

Per affrontare queste sfide e massimizzare l’efficienza di questi gettoni di ricompensa, il framework EUREKA o Evoluzione guidata Universale REward Kit per Agente mira a fare le seguenti contribuzioni.
- Raggiungere prestazioni umane per la progettazione di funzioni di ricompensa.
- Risolvere efficacemente i compiti di manipolazione senza utilizzare l’ingegneria manuale della ricompensa.
- Generare funzioni di ricompensa più allineate con gli umani e più performanti introducendo un nuovo approccio di apprendimento in contesto senza gradiente invece del metodo tradizionale di apprendimento per rinforzo con feedback umano.
Ci sono tre scelte di progettazione algoritmica fondamentali che gli sviluppatori hanno scelto per migliorare la generalità di EUREKA: ricerca evolutiva, ambiente come contesto e riflessione della ricompensa. In primo luogo, il framework EUREKA prende il codice sorgente dell’ambiente come contesto per generare funzioni di ricompensa eseguibili in un ambiente zero-shot. Successivamente, il framework esegue una ricerca evolutiva per migliorare sostanzialmente la qualità delle sue ricompense, propone lotti di candidati per la ricompensa con ogni iterazione o epoca e raffina quelli che trova più promettenti. Nella terza e ultima fase, il framework utilizza l’approccio di riflessione della ricompensa per rendere più efficace il miglioramento in contesto delle ricompense, un processo che alla fine aiuta il framework a consentire la modifica della ricompensa mirata e automatizzata utilizzando un riassunto testuale della qualità di queste ricompense in base alle statistiche di formazione della politica. La figura seguente fornisce una breve panoramica di come funziona il framework EUREKA e nella sezione successiva parleremo dell’architettura e del funzionamento in maggior dettaglio.

EUREKA: Architettura del Modello e Impostazione del Problema
L’obiettivo principale della formazione della ricompensa è quello di restituire una funzione di ricompensa formata o curata per una funzione di ricompensa di base, che potrebbe presentare difficoltà quando viene ottimizzata direttamente come ricompense sparse. Inoltre, i progettisti possono accedere a queste funzioni di ricompensa di base solo tramite query, il che è il motivo per cui il framework EUREKA opta per la generazione della ricompensa, un’impostazione di sintesi del programma basata sul RDP o sul Problema di Progettazione della Ricompensa.
Il Problema di Progettazione della Ricompensa o RDP è una tupla che contiene un modello di mondo con uno spazio di stato, uno spazio per le funzioni di ricompensa, una funzione di transizione e uno spazio di azione. Un algoritmo di apprendimento ottimizza quindi le ricompense generando una politica che produce il processo di evoluzione scalare di qualsiasi politica e può essere acceduto solo utilizzando query di politica. L’obiettivo principale del RDP è quello di produrre una funzione di ricompensa in modo che la politica possa raggiungere il punteggio di idoneità massimo. Nell’impostazione del problema di EUREKA, gli sviluppatori hanno specificato ogni componente nel Problema di Progettazione della Ricompensa utilizzando il codice. Inoltre, per una stringa data che specifica i dettagli del compito, l’obiettivo principale del problema di generazione della ricompensa è quello di generare un codice di funzione di ricompensa per massimizzare il punteggio di idoneità.
Proseguendo, alla base del framework EUREKA ci sono tre componenti algoritmici fondamentali. Ricerca evolutiva (proponendo e raffinando candidati iterativamente), ambiente come contesto (generando ricompense eseguibili in un ambiente zero-shot) e riflessione della ricompensa (per abilitare il miglioramento fine-granulare delle ricompense). Il codice pseudo dell’algoritmo è illustrato nell’immagine seguente.

Ambiente come Contesto
Attualmente, i framework LLM necessitano di specifiche dell’ambiente come input per la progettazione delle ricompense, mentre il framework EUREKA propone di alimentare direttamente il codice sorgente dell’ambiente come contesto, senza il codice di ricompensa, consentendo ai framework LLM di prendere il modello di mondo come contesto. L’approccio seguito da EUREKA ha due vantaggi principali. In primo luogo, i framework LLM per la codifica sono stati addestrati su set di codici nativi scritti in linguaggi di programmazione esistenti come C, C++, Python, Java e altri, il che è il motivo fondamentale per cui sono migliori nella produzione di output di codice quando sono autorizzati a comporre codice direttamente nella sintassi e nello stile in cui sono stati originariamente addestrati. In secondo luogo, l’utilizzo del codice sorgente dell’ambiente rivela generalmente gli ambienti coinvolti semanticamente e le variabili che sono adatte per l’uso nell’output di una funzione di ricompensa in conformità con il compito specificato. Sulla base di queste informazioni, il framework EUREKA istruisce il LLM per restituire un codice Python più eseguibile direttamente con l’aiuto di solo suggerimenti di formattazione e progettazione generica della ricompensa.
Ricerca Evolutiva
L’inclusione della ricerca evolutiva nel framework EUREKA mira a presentare una soluzione naturale alle sfide di subottimalità e errori durante l’esecuzione menzionati in precedenza. Con ogni iterazione o epoca, il framework produce vari output indipendenti dal Large Language Model e, poiché le generazioni sono tutte i.i.d, riduce esponenzialmente la probabilità che le funzioni di ricompensa durante le iterazioni siano difettose dato il numero di campioni che aumenta con ogni epoca.
Nel passaggio successivo, il framework EUREKA utilizza le funzioni di ricompensa eseguibili dall’iterazione precedente per eseguire una mutazione della ricompensa in contesto e quindi propone una nuova e migliorata funzione di ricompensa in base al feedback testuale. Il framework EUREKA, combinato con le capacità di miglioramento in contesto e di esecuzione di istruzioni dei Large Language Model, è in grado di specificare l’operatore di mutazione come un prompt testuale e suggerisce un metodo per utilizzare il riassunto testuale della formazione della politica per modificare i codici di ricompensa esistenti.
Riflessione della Ricompensa
Per fondare la mutazione della ricompensa in contesto, è essenziale valutare la qualità delle ricompense generate e, più importante, metterle in parole, e il framework EUREKA affronta questo utilizzando la semplice strategia di fornire i punteggi numerici come valutazione della ricompensa. Quando la funzione di idoneità del compito serve come metrica olistica per il ground-truth, manca di assegnazione del credito e non fornisce alcuna informazione preziosa su perché la funzione di ricompensa funziona o perché non funziona. Quindi, per fornire una diagnosi della ricompensa più mirata e intricata, il framework propone di utilizzare feedback automatizzati per riassumere la dinamica di formazione della politica in testi. Inoltre, nel programma di ricompensa, le funzioni di ricompensa nel framework EUREKA sono invitate a esporre i loro componenti individualmente, consentendo al framework di tracciare i valori scalari di ogni componente di ricompensa univoco nei checkpoint della politica durante l’intera fase di formazione.

Sebbene la procedura della funzione di ricompensa seguita dal framework EUREKA sia semplice da costruire, è essenziale a causa della natura algoritmica della dipendenza dell’ottimizzazione delle ricompense. Ciò significa che l’efficacia di una funzione di ricompensa è direttamente influenzata dalla scelta di un algoritmo di apprendimento per rinforzo e con un cambiamento dei parametri iper, la ricompensa può comportarsi diversamente anche con lo stesso ottimizzatore. Quindi, il framework EUREKA è in grado di modificare i record più efficacemente e selettivamente mentre sintetizza funzioni di ricompensa che sono in sinergia migliorata con l’algoritmo di apprendimento per rinforzo.
Formazione e Linea di Base
Ci sono due componenti di formazione principali del framework EUREKA: Apprendimento della Politica e Metri di Valutazione della Ricompensa.
Apprendimento della Politica
Le funzioni di ricompensa finali per ogni compito individuale vengono ottimizzate con l’aiuto dello stesso algoritmo di apprendimento per rinforzo utilizzando lo stesso set di iperparametri che vengono regolati per far funzionare bene le ricompense progettate dagli umani.
Metri di Valutazione della Ricompensa
Poiché la metrica del compito varia in termini di scala e significato semantico con ogni compito, il framework EUREKA riporta il punteggio normalizzato umano, una metrica che fornisce una misura olistica per il framework per confrontare come si comporta rispetto alle ricompense generate dagli esperti umani in conformità con le metriche di base.
Proseguendo, ci sono tre linee di base principali: L2R, Umano, e Sparse.
L2R
L2R è una soluzione di prompt di modello linguistico a due fasi che aiuta nella generazione di ricompense template. In primo luogo, un framework LLM riempie un modello di linguaggio naturale per l’ambiente e il compito specificati in linguaggio naturale e quindi un secondo framework LLM converte questa “descrizione del movimento” in un codice che scrive una funzione di ricompensa chiamando un set di primitive API di ricompensa scritte manualmente.
Umano
La linea di base Umano sono le funzioni di ricompensa originali scritte da ricercatori di apprendimento per rinforzo, rappresentando così i risultati dell’ingegneria della ricompensa umana a un livello senza precedenti.
Sparse
La linea di base Sparse assomiglia alle funzioni di idoneità e vengono utilizzate per valutare la qualità delle ricompense generate dal framework.
Risultati e Esiti
Per analizzare le prestazioni del framework EUREKA, lo valuteremo su diversi parametri, tra cui le prestazioni rispetto alle ricompense umane, il miglioramento dei risultati nel tempo, la generazione di nuove ricompense, l’abilitazione del miglioramento mirato, e il lavoro con feedback umani.
EUREKA Supera le Ricompense Umane
La figura seguente illustra i risultati aggregati su diversi benchmark e, come si può chiaramente osservare, il framework EUREKA supera o si comporta allo stesso livello delle ricompense umane su entrambi i compiti di destrezza e Issac. Al contrario, la linea di base L2R fornisce prestazioni simili sui compiti a bassa dimensionalità, ma quando si tratta di compiti a alta dimensionalità, il divario nelle prestazioni è piuttosto sostanziale.

Miglioramento Costante nel Tempo
Uno dei principali punti di forza del framework EUREKA è la sua capacità di migliorare costantemente le sue prestazioni nel tempo con ogni iterazione e i risultati sono dimostrati nella figura seguente.

Come si può chiaramente vedere, il framework genera costantemente ricompense migliori con ogni iterazione e supera anche le prestazioni delle ricompense umane, grazie all’utilizzo dell’approccio di ricerca evolutiva della ricompensa in contesto.
Generazione di Nuove Ricompense
La novità delle ricompense del framework EUREKA può essere valutata calcolando la correlazione tra le ricompense umane e quelle di EUREKA su tutti i compiti di Issac. Queste correlazioni vengono quindi tracciate su un grafico o mappa contro i punteggi normalizzati umani, con ogni punto nel grafico che rappresenta una singola ricompensa di EUREKA per ogni compito individuale. Come si può chiaramente vedere, il framework EUREKA genera prevalentemente funzioni di ricompensa debolmente correlate che superano le funzioni di ricompensa umana.

Abilitazione del Miglioramento Mirato
Per valutare l’importanza dell’aggiunta della riflessione della ricompensa nel feedback della ricompensa, gli sviluppatori hanno valutato un’ablatore, un framework EUREKA senza riflessione della ricompensa che riduce i prompt di feedback a consistere solo di valori di snapshot. Quando si eseguono compiti di Issac, gli sviluppatori hanno osservato che senza la riflessione della ricompensa, il framework EUREKA ha subito un calo del 29% nel punteggio normalizzato medio.
Lavoro con Feedback Umani
Per incorporare agevolmente una vasta gamma di input per generare funzioni di ricompensa allineate con gli umani e più performanti, il framework EUREKA, oltre alla progettazione automatizzata della ricompensa, introduce un nuovo approccio di apprendimento in contesto senza gradiente all’apprendimento per rinforzo con feedback umano e ci sono state due importanti osservazioni.
- EUREKA può trarre vantaggio e migliorare dalle funzioni di ricompensa umane.
- L’utilizzo del feedback umano per la riflessione della ricompensa induce un comportamento allineato.

La figura sopra dimostra come il framework EUREKA mostri un sostanziale aumento delle prestazioni e dell’efficienza utilizzando l’inizializzazione della ricompensa umana, indipendentemente dalla qualità della ricompensa umana, suggerendo che la qualità della ricompensa di base non ha un impatto significativo sulle capacità di miglioramento in contesto della ricompensa del framework.

La figura sopra illustra come il framework EUREKA possa non solo indurre politiche più allineate con gli umani, ma anche modificare le ricompense incorporando il feedback umano.
Pensieri Finali
In questo articolo, abbiamo parlato di EUREKA, un algoritmo di progettazione umano-livello alimentato da LLM, che tenta di sfruttare le varie capacità dei framework LLM, tra cui la scrittura di codice, le capacità di miglioramento in contesto e la generazione di contenuti zero-shot, per eseguire un’ottimizzazione senza precedenti dei codici di ricompensa. Il codice di ricompensa, insieme all’apprendimento per rinforzo, può quindi essere utilizzato da questi framework per apprendere abilità complesse o eseguire compiti di manipolazione. Senza intervento umano o progettazione di prompt specifica del compito, il framework fornisce capacità di generazione di ricompense umano-livello su una vasta gamma di compiti e la sua forza principale risiede nell’apprendimento di compiti complessi con un approccio di apprendimento della curva.
Nel complesso, le prestazioni sostanziali e la versatilità del framework EUREKA indicano il potenziale di combinare algoritmi evolutivi con modelli linguistici di grande scala potrebbe risultare in un approccio scalabile e generale per la progettazione delle ricompense e questa intuizione potrebbe essere applicabile ad altri problemi di ricerca aperta.












