AI-modeller och plattformar

EUREKA: Mänsklig nivå för belöningsdesign via kodning av stora språkmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Med de framsteg som stora språkmodeller har gjort under de senaste åren är det inte förvånande att dessa ramverk utmärker sig som semantiska planerare för sekventiella högnivåbeslutsuppgifter. Men utvecklare har fortfarande svårt att utnyttja det fulla potentialen hos stora språkmodeller för att lära sig komplexa lågnivåmanipulationsuppgifter. Trots deras effektivitet kräver dagens stora språkmodeller betydande domän- och ämneskunskap för att lära sig även enkla färdigheter eller konstruera textprompts, vilket skapar en betydande klyfta mellan deras prestation och mänsklig skicklighet.

För att överbrygga denna klyfta har utvecklare från Nvidia (NVDA ), CalTech, UPenn och andra introducerat EUREKA, ett LLM-baserat mänskligt nivådesignalgoritm. EUREKA syftar till att utnyttja olika förmågor hos stora språkmodeller, inklusive kodskrivning, kontextuell förbättring och nollskottsgenerering av innehåll, för att utföra en utanmotlig optimering av belöningskoder. Dessa belöningskoder, i kombination med förstärkt inlärning, möjliggör för ramverken att lära sig komplexa färdigheter eller utföra manipulationsuppgifter.

I den här artikeln kommer vi att undersöka EUREKA-ramverket ur ett utvecklingsperspektiv, med fokus på dess ramverk, funktioner och de resultat det uppnår vid generering av belöningsfunktioner. Dessa funktioner, som utvecklarna hävdar, överträffar de som genereras av människor. Vi kommer också att undersöka hur EUREKA-ramverket banar väg för en ny tillvägagångssätt för RLHF (Förstärkt inlärning med mänsklig återkoppling) genom att möjliggöra gradientfri kontextuell inlärning. Låt oss komma igång.

EUREKA: En introduktion

Idag, state of the art LLM-ramverk som GPT-3 och GPT-4 levererar utmärkta resultat när de fungerar som semantiska planerare för sekventiella högnivåbeslutsuppgifter, men utvecklare letar fortfarande efter sätt att förbättra deras prestanda när det gäller att lära sig lågnivåmanipulationsuppgifter som pennspinningsfärdighet. Dessutom har utvecklare observerat att förstärkt inlärning kan användas för att uppnå hållbara resultat i färdighetsbetingade villkor och andra domäner, förutsatt att belöningsfunktionerna konstrueras omsorgsfullt av mänskliga designers, och att dessa belöningsfunktioner kan tillhandahålla inlärningssignaler för gynnsamma beteenden. När man jämför med verkliga förstärkta inlärningsuppgifter som accepterar glesa belöningar, gör det svårt för modellen att lära sig mönstren, och formandet av dessa belöningar tillhandahåller de nödvändiga inkrementella inlärningssignalerna. Dessutom är belöningsfunktioner, trots deras betydelse, extremt svåra att utforma, och underoptimala utformningar av dessa funktioner kan leda till oönskade beteenden.

För att tackla dessa utmaningar och maximera effektiviteten hos dessa belönings-token, syftar EUREKA eller Evolution-driven Universal REward Kit för Agent till att göra följande bidrag.

  1. Uppnå mänsklig nivå för belöningsfunktioner.
  2. Lösa manipulationsuppgifter utan manuell belöningskonstruktion.
  3. Generera mer mänskligt anpassade och mer presterande belöningsfunktioner genom att introducera en ny gradientfri kontextuell inlärningsansats istället för traditionell RLHF eller förstärkt inlärning från mänsklig återkoppling.

Det finns tre nyckelalgoritmiska designval som utvecklarna har valt för att förbättra EUREKA:s allmänhet: evolutionär sökning, miljö som kontext och belöningsreflektion. Först tar EUREKA-ramverket miljökällkoden som kontext för att generera exekverbara belöningsfunktioner i en nollskottssättning. Därefter utför ramverket en evolutionär sökning för att förbättra kvaliteten på sina belöningar avsevärt, föreslår batchar av belöningskandidater med varje iteration eller epok, och finslipar de som den finner vara de mest lovande. I den tredje och sista etappen använder ramverket belöningsreflektion för att göra den kontextuella förbättringen av belöningar mer effektiv, en process som slutligen hjälper ramverket att möjliggöra riktad och automatiserad belöningsredigering med hjälp av en textuell sammanfattning av kvaliteten på dessa belöningar baserat på policyträningsstatistik. Följande figur ger en kort översikt över hur EUREKA-ramverket fungerar, och i den kommande avsnittet kommer vi att diskutera arkitekturen och funktionerna i större detalj.

EUREKA: Modellarkitektur och problemställning

Det primära målet med belöningsformning är att returnera en formad eller kuraterad belöningsfunktion för en grundtruthsbelöningsfunktion, vilket kan vara svårt att optimera direkt som glesa belöningar. Dessutom kan designers endast använda frågor för att komma åt dessa grundtruthsbelöningsfunktioner, vilket är anledningen till att EUREKA-ramverket väljer belöningsgenerering, en programsyntes som baseras på RDP eller belöningsdesignproblemet.

Belöningsdesignproblemet eller RDP är en tupel som innehåller en världmodell med ett tillståndsrum, ett rum för belöningsfunktioner, en övergångsfunktion och ett handlingsutrymme. En inlärningsalgoritm optimerar sedan belöningar genom att generera en policy som resulterar i en MDP eller Markovbeslutsprocess, som endast kan nås med hjälp av policyfrågor. Det primära målet med RDP är att producera en belöningsfunktion på ett sätt så att policyn kan uppnå den maximala fitnesspoängen. I EUREKA:s problemställning har utvecklarna specificerat varje komponent i belöningsdesignproblemet med hjälp av kod. Dessutom är det primära målet med belöningsgenereringsproblemet att generera en belöningsfunktionskod för att maximera fitnesspoängen för en given sträng som specificerar uppgiftsdetaljer.

Vidare finns det tre grundläggande algoritmiska komponenter i EUREKA-ramverket: evolutionär sökning (förslag och förfining av kandidater iterativt), miljö som kontext (generering av exekverbara belöningar i nollskottssättning) och belöningsreflektion (för att möjliggöra finjusterad förbättring av belöningar). Pseudokoden för algoritmen visas i följande bild.

Miljö som kontext

För närvarande behöver LLM-ramverk miljöspecifikationer som indata för att utforma belöningar, medan EUREKA-ramverket föreslår att mata in den råa miljökoden direkt som kontext, utan belöningskod, vilket tillåter LLM-ramverken att ta världen som kontext. Tillvägagångssättet som följs av EUREKA har två stora fördelar. Först är LLM-ramverk för kodningsändamål tränade på naturliga koduppsättningar som skrivits i befintliga programmeringsspråk som C, C++, Python, Java och mer, vilket är den grundläggande anledningen till att de är bättre på att producera kodutdata när de tillåts komponera kod i syntaxen och stilen som de ursprungligen tränats på. För det andra avslöjar miljökällkoden vanligtvis miljöerna som är involverade semantiskt och variablerna som är lämpliga för användning i ett försök att producera en belöningsfunktion i enlighet med den specificerade uppgiften. Utifrån dessa insikter instruerar EUREKA-ramverket LLM att returnera en mer exekverbar Pythonkod direkt med hjälp av endast formateringstips och generiska belöningsdesign.

Evolutionär sökning

Inklusionen av evolutionär sökning i EUREKA-ramverket syftar till att presentera en naturlig lösning på de suboptimala utmaningarna och felen som nämns tidigare. Med varje iteration eller epok, genererar ramverket olika oberoende utdata från det stora språkmodellen, och om generationerna är alla oberoende och identiskt fördelade, minskar sannolikheten för belöningsfunktioner under iterationerna som är buggiga, givet att antalet prover ökar med varje epok.

I nästa steg använder EUREKA-ramverket de exekverbara belöningsfunktionerna från föregående iteration för att utföra en kontextuell belöningsmutation, och sedan föreslår en ny och förbättrad belöningsfunktion baserat på textuell återkoppling. EUREKA-ramverket, i kombination med den kontextuella förbättringen och instruktionsföljande förmågor hos stora språkmodeller, kan specificera mutationsoperatorn som en textprompt och föreslår en metod för att använda den textuella sammanfattningen av policyträning för att modifiera befintliga belöningskod.

Belöningsreflektion

För att grundlägga kontextuell belöningsmutation är det nödvändigt att bedöma kvaliteten på de genererade belöningarna och, mer viktigt, sätta dem i ord, och EUREKA-ramverket tacklar detta genom att använda den enkla strategin att tillhandahålla numeriska poäng som belöningsutvärdering. När uppgiftsfitnessfunktionen fungerar som en holistisk mått för grundtruth, saknar den kredit tilldelning och kan inte tillhandahålla någon värdefull information om varför belöningsfunktionen fungerar eller varför den inte fungerar. Så, i ett försök att tillhandahålla en mer riktad och intrikat belöningsdiagnos, föreslår ramverket att använda automatiserad återkoppling för att sammanfatta policyträningsdynamiken i text.

Även om belöningsfunktionen som följs av EUREKA-ramverket är enkel att konstruera, är den viktig på grund av den algoritmberoende naturen hos att optimera belöningar. Det betyder att effektiviteten hos en belöningsfunktion direkt påverkas av valet av en förstärkt inlärningsalgoritm, och med en förändring i hyperparametrar, kan belöningen fungera annorlunda, även med samma optimerare. Så, EUREKA-ramverket kan redigera posterna mer effektivt och selektivt medan det syntetiserar belöningsfunktioner som är i förbättrad samverkan med den förstärkta inlärningsalgoritmen.

Träning och baslinje

Det finns två huvudsakliga träningskomponenter i EUREKA-ramverket: Policyinlärning och Belöningsutvärderingsmått.

Policyinlärning

De slutliga belöningsfunktionerna för varje enskild uppgift optimeras med hjälp av samma förstärkta inlärningsalgoritm med samma uppsättning hyperparametrar som är finjusterade för att göra de mänskligt konstruerade belöningarna fungera väl.

Belöningsutvärderingsmått

Eftersom uppgiftsmåttet varierar i skala och semantisk betydelse med varje uppgift, rapporterar EUREKA-ramverket den mänskligt normaliserade poängen, ett mått som tillhandahåller en holistisk mått för ramverket att jämföra hur det presterar mot de expertmänskligt genererade belöningarna i enlighet med grundtruthsmåtten.

Vidare finns det tre primära baslinjer: L2R, Mänsklig, och Gles.

L2R

L2R är en dubbelstegs stor språkmodell som hjälper till att generera mallbaserade belöningar. Först fyller ett LLM-ramverk i en naturlig språkmall för miljö och uppgift som specificeras i naturligt språk, och sedan konverterar en andra LLM-ramverk denna “rörelsebeskrivning” till en kod som skriver en belöningsfunktion genom att anropa en uppsättning manuellt skrivna belönings-API-primitiver.

Mänsklig

Mänsklig baslinje är de ursprungliga belöningsfunktionerna skrivna av förstärkt inlärningsforskare, vilket representerar resultaten av mänsklig belöningskonstruktion på en aldrig tidigare skådad nivå.

Gles

Gles baslinjen liknar fitnessfunktionerna och används för att utvärdera kvaliteten på de belöningar som ramverket genererar.

Resultat och utfall

För att analysera prestandan hos EUREKA-ramverket, kommer vi att utvärdera det på olika parametrar, inklusive dess prestanda mot mänskliga belöningar, förbättring av resultat över tid, generering av nya belöningar, möjliggörande av riktad förbättring, och arbete med mänsklig återkoppling.

EUREKA överträffar mänskliga belöningar

Följande figur illustrerar de sammanslagna resultaten över olika benchmark, och som det kan ses, överträffar eller presterar EUREKA-ramverket på samma nivå som mänskliga belöningar på både Dexterity och Issac-uppgifter. I jämförelse levererar L2R-baslinjen en liknande prestanda på lågnivåuppgifter, men när det gäller högnivåuppgifter är gapet i prestandan ganska betydande.

Konsekvent förbättring över tid

En av de stora höjdpunkterna i EUREKA-ramverket är dess förmåga att konsekvent förbättra och förbättra sin prestanda över tid med varje iteration, och resultaten visas i figuren nedan.

Som det kan ses, genererar ramverket konsekvent bättre belöningar med varje iteration, och det förbättrar och överträffar till och med prestandan hos mänskliga belöningar, tack vare sin användning av kontextuell evolutionär belöningsökning.

Generering av nya belöningar

Nya belöningar i EUREKA-ramverket kan utvärderas genom att beräkna korrelationen mellan mänskliga och EUREKA-belöningar på hela Issac-uppgifter. Dessa korrelationer visas sedan på en scatterplot eller karta mot de mänskligt normaliserade poängen, där varje punkt på plotten representerar en enskild EUREKA-belöningsfunktion för varje enskild uppgift. Som det kan ses, genererar EUREKA-ramverket i huvudsak svagt korrelerade belöningsfunktioner som överträffar de mänskliga belöningsfunktionerna.

Möjliggörande av riktad förbättring

För att utvärdera betydelsen av att lägga till belöningsreflektion i belöningsåterkoppling, utvärderade utvecklarna en ablation, en EUREKA-ramverk utan belöningsreflektion som reducerar återkopplingsprompten till att endast bestå av ögonblicksbilder. När de körde Issac-uppgifter, observerade utvecklarna att utan belöningsreflektion, upplevde EUREKA-ramverket en minskning på cirka 29% i den genomsnittliga normaliserade poängen.

Arbete med mänsklig återkoppling

För att lätt inkorporera en bred uppsättning indata för att generera mänskligt anpassade och mer presterande belöningsfunktioner, introducerar EUREKA-ramverket, förutom automatiserad belöningskonstruktion, en ny gradientfri kontextuell inlärningsansats till förstärkt inlärning från mänsklig återkoppling, och det fanns två betydande observationer.

  1. EUREKA kan dra nytta av och förbättra mänskliga belöningsfunktioner.
  2. Användning av mänsklig återkoppling för belöningsreflektion inducerar anpassat beteende.

Följande figur visar hur EUREKA-ramverket visar en betydande förbättring av prestanda och effektivitet med hjälp av mänsklig belöningsinitialisering, oavsett kvaliteten på de mänskliga belöningarna, vilket tyder på att kvaliteten på de grundläggande belöningarna inte har en betydande inverkan på den kontextuella belöningsförbättringsförmågan hos ramverket.

Följande figur visar hur EUREKA-ramverket inte bara kan inducera mer mänskligt anpassade policyer, utan också modifiera belöningar genom att inkorporera mänsklig återkoppling.

Slutliga tankar

I den här artikeln har vi diskuterat EUREKA, ett LLM-baserat mänskligt nivådesignalgoritm, som försöker utnyttja olika förmågor hos stora språkmodeller, inklusive kodskrivning, kontextuell förbättring och nollskottsgenerering av innehåll, för att utföra en utanmotlig optimering av belöningskoder. Belöningskoden, i kombination med förstärkt inlärning, kan sedan användas av ramverken för att lära sig komplexa färdigheter eller utföra manipulationsuppgifter.

Sammanfattningsvis, den betydande prestandan och flexibiliteten hos EUREKA-ramverket tyder på att kombinationen av evolutionära algoritmer och stora språkmodeller kan resultera i en skalbar och allmän tillvägagångssätt för att utforma belöningar, och denna insikt kan vara tillämplig på andra öppna sökningsproblem.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.