Modele și platforme AI
EUREKA: Proiectare a recompenselor la nivel uman prin codarea modelelor de limbaj mari
Având în vedere progresele realizate de modelele de limbaj mari în ultimii ani, nu este de mirare că aceste cadre LLM excelează ca planificatori semantici pentru sarcinile de luare a deciziilor secvențiale de nivel înalt. Cu toate acestea, dezvoltatorii încă găsesc dificil să utilizeze pe deplin potențialul cadrelor LLM pentru învățarea unor sarcini complexe de manipulare de nivel scăzut. În ciuda eficienței lor, modelele de limbaj mari de astăzi necesită o experiență și o expertiză semnificativă în domeniu și în subiect pentru a învăța chiar și abilități simple sau pentru a construi prompturi textuale, creând o lacună semnificativă între performanța lor și abilitățile umane.
Pentru a acoperi această lacună, dezvoltatori de la Nvidia (NVDA ), CalTech, UPenn și alții au introdus EUREKA, un algoritm de proiectare umană bazat pe LLM. EUREKA își propune să valorifice diversele capacități ale cadrelor LLM, inclusiv scrierea de cod, îmbunătățirea contextuală și generarea de conținut fără zero-shot, pentru a realiza o optimizare fără precedent a codurilor de recompensă. Aceste coduri de recompensă, combinate cu învățarea prin întărire, permit cadrelor să învețe abilități complexe sau să execute sarcini de manipulare.
În acest articol, vom examina cadrul EUREKA dintr-o perspectivă de dezvoltare, explorând structura, funcționarea și rezultatele sale în generarea de funcții de recompensă. Aceste funcții, după cum afirmă dezvoltatorii, depășesc pe cele generate de oameni. Vom explora, de asemenea, modul în care cadrul EUREKA deschide calea pentru o nouă abordare a RLHF (Învățarea prin Întărire cu Feedback Uman) prin permiterea învățării fără gradient în context. Să începem.
EUREKA : O Introducere
Astăzi, cadrele LLM de ultimă generație precum GPT-3 și GPT-4 oferă rezultate remarcabile atunci când servesc ca planificatori semantici pentru sarcinile de luare a deciziilor secvențiale de nivel înalt, dar dezvoltatorii încă caută modalități de a-și îmbunătăți performanța atunci când vine vorba de învățarea unor sarcini de manipulare de nivel scăzut, cum ar fi abilitățile de a roti o pixură. Mai mult, dezvoltatorii au observat că învățarea prin întărire poate fi utilizată pentru a obține rezultate durabile în condiții dextere și în alte domenii, cu condiția ca funcțiile de recompensă să fie construite cu atenție de designeri umani și să fie capabile să furnizeze semnale de învățare pentru comportamente favorabile. Atunci când sunt comparate cu sarcinile de învățare prin întărire din lumea reală care acceptă recompense rare, acestea fac dificilă pentru modelul de a învăța modelele, iar modelarea acestor recompense oferă semnalele de învățare incrementale necesare. Mai mult, funcțiile de recompensă, în ciuda importanței lor, sunt extrem de dificil de proiectat, iar proiectările suboptimale ale acestor funcții conduc adesea la comportamente nedorite.

Pentru a aborda aceste provocări și a maximiza eficiența acestor tokenuri de recompensă, EUREKA sau Evoluția condusă de Universală REcompensă Kit pentru Agent își propune să facă următoarele contribuții.
- Atingerea performanței umane pentru proiectarea funcțiilor de recompensă.
- Rezolvarea eficientă a sarcinilor de manipulare fără a utiliza ingineria manuală a recompenselor.
- Generarea de funcții de recompensă mai aliniate cu oamenii și mai performante prin introducerea unei noi abordări de învățare fără gradient în context, în locul metodei tradiționale RLHF sau Învățarea prin Întărire din Feedback Uman.
Există trei alegeri algoritmice fundamentale pe care dezvoltatorii le-au adoptat pentru a îmbunătăți generalitatea EUREKA: căutarea evolutivă, contextul de mediu și reflectarea recompensei. Mai întâi, cadrul EUREKA ia codul sursă al mediului ca context pentru a genera funcții de recompensă executabile într-un mediu fără zero-shot. Apoi, cadrul efectuează o căutare evolutivă pentru a îmbunătăți calitatea recompenselor sale în mod semnificativ, propune loturi de candidați pentru recompense la fiecare iterație sau epocă și rafinează cele pe care le consideră cele mai promițătoare. În ultima etapă, cadrul utilizează reflectarea recompensei pentru a face îmbunătățirea contextuală a recompenselor mai eficientă, un proces care ajută în final cadrul să permită editarea țintită și automată a recompenselor prin utilizarea unui rezumat textual al calității acestor recompense pe baza statisticilor de antrenare a politicii. Următoarea figură oferă o scurtă prezentare a modului în care funcționează cadrul EUREKA și, în secțiunea următoare, vom discuta arhitectura și funcționarea în mai multe detalii.

EUREKA : Arhitectura Modelului și Setarea Problemei
Scopul principal al modelării recompenselor este de a returna o funcție de recompensă modelată pentru o funcție de recompensă de bază, care poate prezenta dificultăți atunci când este optimizată direct, cum ar fi recompensele rare. Mai mult, designerii pot accesa aceste funcții de recompensă de bază doar prin intermediul unor întrebări, ceea ce este motivul pentru care cadrul EUREKA optează pentru generarea recompenselor, un mediu de sinteză a programului bazat pe RDP sau Problema Proiectării Recompensei.
Problema Proiectării Recompensei sau RDP este un tuplu care conține un model de lume cu un spațiu de stare, un spațiu pentru funcții de recompensă, o funcție de tranziție și un spațiu de acțiune. Un algoritm de învățare optimizează apoi recompensele prin generarea unei politici care rezultă într-un proces de decizie Markov, care produce evoluția scalară a oricărei politici și poate fi accesat doar prin intermediul unor întrebări de politică. Scopul principal al RDP este de a produce o funcție de recompensă astfel încât politica să poată atinge scorul de fitness maxim. În setarea problemei EUREKA, dezvoltatorii au specificat fiecare componentă a Problemei Proiectării Recompensei utilizând cod. Mai mult, pentru o anumită șir care specifică detalii despre sarcină, obiectivul principal al problemei de generare a recompenselor este de a genera un cod de funcție de recompensă pentru a maximiza scorul de fitness.
În continuare, la baza cadrului EUREKA există trei componente algoritmice fundamentale. Căutarea evolutivă (propunerea și rafinarea candidaților în mod iterativ), contextul de mediu (generarea de recompense executabile într-un mediu fără zero-shot) și reflectarea recompensei (pentru a permite îmbunătățirea fină a recompenselor). Codul pseudo pentru algoritmul este ilustrat în imaginea de mai jos.

Contextul de Mediu
În prezent, cadrele LLM necesită specificații de mediu ca intrări pentru proiectarea recompenselor, în timp ce cadrul EUREKA propune să furnizeze direct codul sursă al mediului ca context, fără codul de recompensă, permițând cadrelor LLM să ia modelul de lume ca context. Abordarea urmată de EUREKA are două beneficii majore. Mai întâi, cadrele LLM pentru scopuri de codare sunt antrenate pe seturi de cod native scrise în limbaje de programare existente, cum ar fi C, C++, Python, Java și altele, ceea ce este motivul pentru care sunt mai bune la producerea de ieșiri de cod atunci când li se permite să compună cod în sintaxa și stilul în care au fost antrenate inițial. În al doilea rând, utilizarea codului sursă al mediului dezvăluie în mod obișnuit mediile implicate semantic și variabilele care sunt potrivite pentru utilizare în încercarea de a produce o funcție de recompensă în conformitate cu sarcina specificată. Pe baza acestor insighturi, cadrul EUREKA instruiește LLM-ul să returneze un cod Python executabil direct, cu ajutorul unor sfaturi de formatare și proiectări generice de recompense.
Căutarea Evolutivă
Includerea căutării evolutive în cadrul EUREKA își propune să ofere o soluție naturală pentru provocările suboptimale și erorile care apar în timpul execuției, așa cum s-a menționat anterior. La fiecare iterație sau epocă, cadrul generează ieșiri independente din modelul de limbaj mare și, dacă generările sunt toate independente și identic distribuite, reduce exponențial probabilitatea ca funcțiile de recompensă să fie defectuoase în timpul iterațiilor, dat fiind că numărul de mostre crește cu fiecare epocă.
În următoarea etapă, cadrul EUREKA utilizează funcțiile de recompensă executabile din iterația anterioară pentru a efectua o mutație a recompensei în context și apoi propune o nouă și îmbunătățită funcție de recompensă pe baza feedback-ului textual. Cadrul EUREKA, combinat cu îmbunătățirea contextuală și capacitățile de urmărire a instrucțiunilor ale modelelor de limbaj mare, este capabil să specifice operatorul de mutație ca prompt textual și sugerează o metodă de a utiliza rezumatul textual al antrenării politicii pentru a modifica codul de recompensă existent.
Reflectarea Recompensei
Pentru a ancora mutațiile contextuale ale recompenselor, este esențial să se evalueze calitatea recompenselor generate și, mai important, să se pună în cuvinte, iar cadrul EUREKA abordează acest lucru prin utilizarea strategiei simple de a furniza scoruri numerice ca evaluare a recompensei. Atunci când funcția de fitness a sarcinii servește ca o metrică holistică pentru adevărul de bază, ea lipsește de atribuirea creditului și nu poate oferi nicio informație valoroasă despre de ce funcția de recompensă funcționează sau de ce nu funcționează. Astfel, pentru a oferi o diagnosticare mai țintită și mai detaliată a recompenselor, cadrul propune să utilizeze feedback-uri automate pentru a rezuma dinamica de antrenare a politicii în texte. Mai mult, în programul de recompensă, funcțiile de recompensă din cadrul EUREKA sunt solicitate să expună componentele lor individual, permițând cadrului să urmărească valorile scalare ale fiecărui component de recompensă unic la punctele de control ale politicii în timpul întregii faze de antrenare.

Deși procedura de recompensă urmată de cadrul EUREKA este simplă de construit, ea este esențială datorită naturii algoritmice a optimizării recompenselor. Aceasta înseamnă că eficacitatea unei funcții de recompensă este direct influențată de alegerea unui algoritm de învățare prin întărire și, cu o schimbare a hiperparametrilor, recompensa poate performa diferit, chiar și cu același optimizator. Astfel, cadrul EUREKA poate edita înregistrările într-un mod mai eficient și mai selectiv, în timp ce sintetizează funcții de recompensă care sunt într-o sinergie îmbunătățită cu algoritmul de învățare prin întărire.
Antrenarea și Baza de Referință
Există două componente majore de antrenare ale cadrului EUREKA: Învățarea Politicii și Metricele de Evaluare a Recompensei.
Învățarea Politicii
Funcțiile de recompensă finale pentru fiecare sarcină individuală sunt optimizate cu ajutorul aceluiași algoritm de învățare prin întărire, utilizând același set de hiperparametri care sunt ajustați pentru a face ca recompensele proiectate de oameni să funcționeze bine.
Metricele de Evaluare a Recompensei
Deoarece metrica sarcinii variază în ceea ce privește scala și înțelesul semantic de la o sarcină la alta, cadrul EUREKA raportează scorul normalizat uman, o metrică care oferă o măsură holistică pentru a compara modul în care funcționează în raport cu recompensele generate de experți umani, în conformitate cu metricile de bază.
În continuare, există trei baze de referință principale: L2R, Uman, și Rare.
L2R
L2R este o soluție de promptare a modelului de limbaj mare în două etape care ajută la generarea de recompense modelate. Mai întâi, un cadru LLM completează o șablon de limbaj natural pentru mediu și sarcină specificate în limbaj natural, iar apoi un al doilea cadru LLM convertește această “descriere a mișcării” într-un cod care scrie o funcție de recompensă prin apelarea unui set de primitive de recompensă scrise manual.
Uman
Baza de referință Umană constă în funcțiile de recompensă originale scrise de cercetători în învățarea prin întărire, reprezentând astfel rezultatele ingineriei recompenselor umane la un nivel fără precedent.
Rare
Baza de referință Rare seamănă cu funcțiile de fitness și sunt utilizate pentru a evalua calitatea recompenselor generate de cadrul.
Rezultate și Rezultate
Pentru a analiza performanța cadrului EUREKA, vom evalua acesta pe diverse parametri, inclusiv performanța în raport cu recompensele umane, îmbunătățirea rezultatelor în timp, generarea de recompense noi, permisivitatea îmbunătățirii țintite, și lucrul cu feedback-urile umane.
EUREKA Depășește Recompensele Umane
Următoarea figură ilustrează rezultatele agregate pe diverse benchmark-uri, și, așa cum se poate observa clar, cadrul EUREKA depășește sau funcționează la nivelul recompenselor umane atât pe sarcinile de dexteritate, cât și pe cele de Issac. În comparație, baza de referință L2R oferă o performanță similară pe sarcinile de dimensiuni mici, dar atunci când vine vorba de sarcini de dimensiuni mari, diferența de performanță este destul de semnificativă.

Îmbunătățire Constantă în Timp
Una dintre principalele puncte forte ale cadrului EUREKA este capacitatea sa de a-și îmbunătăți constant performanța în timp, cu fiecare iterație, și rezultatele sunt demonstrate în figura de mai jos.

Așa cum se poate observa clar, cadrul generează constant recompense mai bune cu fiecare iterație și, de asemenea, îmbunătățește și depășește în cele din urmă performanța recompenselor umane, datorită utilizării sale a abordării de căutare evolutivă a recompenselor în context.
Generarea de Recompense Noi
Noutatea recompenselor cadrului EUREKA poate fi evaluată prin calcularea corelației dintre recompensele umane și cele EUREKA pe întreaga sarcină de Issac. Aceste corelații sunt apoi reprezentate pe un grafic împotriva scorurilor normalizate umane, cu fiecare punct de pe grafic reprezentând o recompensă EUREKA individuală pentru fiecare sarcină. Așa cum se poate observa clar, cadrul EUREKA generează în principal funcții de recompensă slab corelate care depășesc funcțiile de recompensă umane.

Permisivitatea Îmbunătățirii Țintite
Pentru a evalua importanța adăugării reflectării recompensei în feedback-ul de recompensă, dezvoltatorii au evaluat o ablație, un cadru EUREKA fără reflectare a recompensei, care reduce prompt-urile de feedback pentru a include doar valorile instantanee. Atunci când rulează sarcinile de Issac, dezvoltatorii au observat că, fără reflectarea recompensei, cadrul EUREKA a înregistrat o scădere de aproximativ 29% în scorul normalizat mediu.
Lucrul cu Feedback-urile Umane
Pentru a integra cu ușurință o gamă largă de intrări pentru a genera funcții de recompensă aliniate cu oamenii și mai performante, cadrul EUREKA, pe lângă proiectarea automată a recompenselor, introduce o nouă abordare de învățare fără gradient în context pentru Învățarea prin Întărire din Feedback Uman, și au fost observate două aspecte semnificative.
- EUREKA poate beneficia și se poate îmbunătăți de la funcțiile de recompensă umane.
- Utilizarea feedback-ului uman pentru reflectarea recompensei induce un comportament aliniat.

Figura de mai sus demonstrează modul în care cadrul EUREKA demonstrează o îmbunătățire semnificativă a performanței și eficienței utilizând inițializarea recompensei umane, indiferent de calitatea recompenselor umane, sugerând că calitatea recompenselor de bază nu are un impact semnificativ asupra capacităților de îmbunătățire a recompenselor în context ale cadrului.

Figura de mai sus ilustrează modul în care cadrul EUREKA nu numai că induce politici mai aliniate cu oamenii, dar poate și modifica recompensele prin integrarea feedback-ului uman.
Gânduri Finale
În acest articol, am discutat despre EUREKA, un algoritm de proiectare umană bazat pe LLM, care își propune să valorifice diversele capacități ale cadrelor LLM, inclusiv scrierea de cod, îmbunătățirea contextuală și generarea de conținut fără zero-shot, pentru a realiza o optimizare fără precedent a codurilor de recompensă. Codul de recompensă, combinat cu învățarea prin întărire, poate fi utilizat de cadrele pentru a învăța abilități complexe sau pentru a executa sarcini de manipulare. Fără intervenție umană sau inginerie de prompt specifică sarcinii, cadrul oferă capacități de generare de recompense la nivel uman pe o gamă largă de sarcini, iar punctul său forte principal constă în învățarea sarcinilor complexe cu o abordare de învățare a curriculum-ului.
În general, performanța substanțială și versatilitatea cadrului EUREKA indică faptul că combinarea algoritmilor evolutivi cu modelele de limbaj mare ar putea duce la o abordare scalabilă și generală pentru proiectarea recompenselor, iar această idee ar putea fi aplicabilă și altor probleme de căutare deschise.












