AI-modeller og platforme

EUREKA: Menneske-niveau Belønningsdesign via Kodning af Store Sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Med de fremskridt, der er gjort i store sprogmodeller i de seneste år, er det ikke overraskende, at disse LLM-rammer excellerer som semantiske planlæggere for sekventielle højniveaudesignopgaver. Dog finder udviklere det stadig udfordrende at udnytte det fulde potentiale af LLM-rammerne for at lære komplekse lavniveaumanipulationsopgaver. Trods deres effektivitet kræver dagens store sprogmodeller betydelig domæne- og faglig ekspertise for at lære selv simple færdigheder eller konstruere tekstuelle prompts, hvilket skaber en betydelig kløft mellem deres præstation og menneske-niveauets behændighed.

For at brokke denne kløft har udviklere fra Nvidia (NVDA ), CalTech, UPenn og andre introduceret EUREKA, en LLM-drevet menneske-niveau designalgoritme. EUREKA sigter mod at udnytte forskellige evner i LLM-rammerne, herunder kodning, kontekstforbedring og zero-shot-indholdsgenerering, for at udføre en udenforliggende optimering af belønningskoder. Disse belønningskoder kombineret med forstærket læring gør det muligt for rammerne at lære komplekse færdigheder eller udføre manipulationsopgaver.

I denne artikel vil vi undersøge EUREKA-rammen fra et udviklingsperspektiv, hvor vi udforsker dens ramme, funktionsmåde og resultaterne, den opnår i generering af belønningsfunktioner. Disse funktioner, som udviklerne hævder, overgår dem, der er genereret af mennesker. Vi vil også dykke ned i, hvordan EUREKA-rammen baner vejen for en ny tilgang til RLHF (Forstærket Læring med Menneskefeedback) ved at aktivere gradient-fri kontekstlæring.

EUREKA: En Introduktion

I dag leverer state of the art LLM-rammer som GPT-3 og GPT-4 fremragende resultater, når de fungerer som semantiske planlæggere for sekventielle højniveaudesignopgaver, men udviklere søger stadig efter måder at forbedre deres præstation, når det kommer til at lære lavniveaumanipulationsopgaver som pen-spinning-behændighed. Desuden har udviklere observeret, at forstærket læring kan bruges til at opnå bæredygtige resultater i behændige tilstande og andre domæner, hvis belønningsfunktionerne er konstrueret omhyggeligt af menneskelige designere, og disse belønningsfunktioner er i stand til at give læringssignaler for positive adfærd. Når sammenlignet med virkelige forstærkede læringstasks, der accepterer sparsomme belønninger, gør det svært for modellen at lære mønstre, og formning af disse belønninger giver de nødvendige inkrementelle læringssignaler. Desuden er belønningsfunktioner, trods deres betydning, ekstremt udfordrende at designe, og underoptimalt design af disse funktioner kan ofte føre til uventede adfærd.

For at tackle disse udfordringer og maksimere effektiviteten af disse belønnings tokens, sigter EUREKA eller Evolution-drevet Universal REward Kit for Agent til at bidrage med følgende:

  1. At opnå menneske-niveau præstation for design af belønningsfunktioner.
  2. At løse manipulationsopgaver uden brug af manuel belønningsingeniørarbejde.
  3. At generere mere menneske-tilpassede og mere performante belønningsfunktioner ved at introducere en ny gradient-fri kontekstlæringstilgang i stedet for traditionel RLHF eller Forstærket Læring fra Menneskefeedback-metoden.

Der er tre nøglealgorithmiske designvalg, som udviklerne har valgt for at forbedre EUREKAs generality: evolutionær søgning, kontekst som miljø og belønningsrefleksion. Først tager EUREKA-rammen miljøkilden som kontekst for at generere eksekverbare belønningsfunktioner i en zero-shot-indstilling. Herefter udfører rammen en evolutionær søgning for at forbedre kvaliteten af sine belønninger væsentligt, foreslår batches af belønningskandidater med hver iteration eller epoch, og forfiner dem, som den finder at være de mest lovende. I den tredje og sidste fase bruger rammen belønningsrefleksion til at gøre kontekstforbedring af belønninger mere effektiv, en proces, der ultimativt hjælper rammen med at aktivere målrettet og automatiseret belønningsredigering ved at bruge en tekstuel sammenfatning af kvaliteten af disse belønninger på basis af politiktræningsstatistik.

EUREKA: Modelarkitektur og Probleminstilling

Det primære mål med belønningsformning er at returnere en formet eller kurateret belønningsfunktion for en ground-truth-belønningsfunktion, som kan være vanskeligt at optimere direkte som sparsomme belønninger. Desuden kan designere kun bruge forespørgsler til at få adgang til disse ground-truth-belønningsfunktioner, hvilket er årsagen til, at EUREKA-rammen vælger belønningsgenerering, en programsynteseindstilling baseret på RDP eller Belønningsdesignproblemet.

Belønningsdesignproblemet eller RDP er en tuple, der indeholder en verdenmodel med en tilstandsmængde, rum for belønningsfunktioner, en overgangsfunktion og en handlingsmængde. En læringsalgoritme optimerer herefter belønninger ved at generere en politik, der resulterer i en MDP eller Markov Design Process, der producerer den skalare udvikling af enhver politik, og kan kun tilgås ved hjælp af politikforespørgsler. Det primære mål med RDP er at udgive en belønningsfunktion på en måde, så politikken kan opnå den maksimale fitness-score.

Kontekst som Miljø

I øjeblikket har LLM-rammer brug for miljøspecifikationer som input for at designe belønninger, mens EUREKA-rammen foreslår at feede den rå miljøkode direkte som kontekst, uden belønningskoden, hvilket giver LLM-rammerne mulighed for at tage verdenmodellen som kontekst.

Evolutionær Søgning

Inklusionen af evolutionær søgning i EUREKA-rammen sigter mod at præsentere en naturlig løsning på underoptimalitetsudfordringerne og fejl, der opstår under udførelse, som nævnt tidligere. Med hver iteration eller epoch udeler rammen forskellige uafhængige output fra den store sprogmodel, og hvis generationerne er alle uafhængige, reducerer det eksponentielt sandsynligheden for, at belønningsfunktionerne under iterationerne er fejlbehæftede, givet antallet af prøver, der øges med hver epoch.

Belønningsrefleksion

For at grundlægge kontekstbelønningsmutationer er det essentiel at evaluere kvaliteten af de genererede belønninger og mere vigtigt, sætte dem i ord, og EUREKA-rammen tackler dette ved at bruge den simple strategi med at give numeriske score som belønningsvurdering.

Træning og Baseline

Der er to primære træningskomponenter i EUREKA-rammen: Politiklæring og Belønningsvurderingsmetrik.

Politiklæring

Den endelige belønningsfunktion for hver enkelt opgave er optimeret med hjælp af den samme forstærkede læringsalgoritme ved hjælp af det samme sæt af hyperparametre, der er finjusteret for at gøre menneskeingeniørerede belønninger fungere godt.

Belønningsvurderingsmetrik

Da opgavemålet varierer i skala og semantisk betydning med hver opgave, rapporterer EUREKA-rammen den menneske-normaliserede score, en metrik, der giver en holistisk måde for rammen at sammenligne, hvordan den præsterer i forhold til ekspert-menneskegenererede belønninger i overensstemmelse med ground-truth-metrikkerne.

Resultater og Udfald

For at analysere EUREKA-rammens præstation vil vi evaluere den på forskellige parametre, herunder dens præstation i forhold til menneskebelønninger, forbedring over tid, generering af nye belønninger, aktivering af målrettet forbedring og samarbejde med menneskefeedback.

EUREKA Overgår Menneskebelønninger

Følgende figur illustrerer de samlede resultater over forskellige benchmarks, og som det kan ses, overgår eller præsterer EUREKA-rammen på niveau med menneske-niveau belønninger på både Dexterity og Issac-opgaver.

Konstant Forbedring Over Tid

En af de primære højdepunkter i EUREKA-rammen er dens evne til konstant at forbedre og forbedre sin præstation over tid med hver iteration, og resultaterne demonstreres i figuren nedenfor.

Generering af Nye Belønninger

Nuværdien af EUREKA-rammens belønninger kan vurderes ved at beregne korrelationen mellem menneske- og EUREKA-belønninger på hele Issac-opgaven. Disse korrelationer er herefter plotteret på en scatterplot eller kort mod menneske-normaliserede score, hvor hvert punkt på plotten repræsenterer en enkelt EUREKA-belønning for hver enkelt opgave.

Aktivering af Målrettet Forbedring

For at evaluere betydningen af at tilføje belønningsrefleksion i belønningsfeedback, evaluerede udviklerne en ablation, en EUREKA-ramme uden belønningsrefleksion, der reducerer feedback-prompterne til at bestå kun af snapshot-værdier.

Samarbejde med Menneskefeedback

For at let integrere en bred vifte af input for at generere menneske-tilpassede og mere performante belønningsfunktioner, introducerer EUREKA-rammen også en ny gradient-fri kontekstlæringstilgang til Forstærket Læring fra Menneskefeedback, og der var to væsentlige observationer.

  1. EUREKA kan drage fordel af og forbedre menneskebelønninger.
  2. Brug af menneskefeedback til belønningsrefleksion inducerer tilpasset adfærd.

Endelige Tanker

I denne artikel har vi talt om EUREKA, en LLM-drevet menneske-niveau designalgoritme, der forsøger at udnytte forskellige evner i LLM-rammerne, herunder kodning, kontekstforbedring og zero-shot-indholdsgenerering, for at udføre en udenforliggende optimering af belønningskoder. Belønningskoden sammen med forstærket læring kan herefter bruges af disse rammer til at lære komplekse færdigheder eller udføre manipulationsopgaver.

I alt viser EUREKA-rammens betydelige præstation og fleksibilitet, at kombinationen af evolutionære algoritmer og store sprogmodeller kan resultere i en skalerbar og generel tilgang til at designe belønninger, og denne indsigt kan være anvendelig på andre åbne søgeproblemer.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.