AI-modellen en platforms
EUREKA: Menselijke Niveau Beloningsontwerp via Coding Large Language Models
Met de vooruitgang die Large Language Models in recente jaren hebben geboekt, is het niet verwonderlijk dat deze LLM-kaders uitstekend presteren als semantische planners voor sequentiële hoog-niveau beslissingstaken. Echter, ontwikkelaars vinden het nog steeds moeilijk om het volledige potentieel van LLM-kaders te benutten voor het leren van complexe laag-niveau manipulatietaken. Ondanks hun efficiëntie, vereisen hedendaagse Large Language Models aanzienlijke domein- en onderwerpspecifieke expertise om zelfs eenvoudige vaardigheden te leren of tekstuele prompts te construeren, waardoor een aanzienlijke kloof ontstaat tussen hun prestaties en menselijke vaardigheid.
Om deze kloof te overbruggen, hebben ontwikkelaars van Nvidia (NVDA ), CalTech, UPenn en anderen EUREKA geïntroduceerd, een LLM-gepowered menselijk-niveau ontwerpalgoritme. EUREKA heeft tot doel om verschillende mogelijkheden van LLM-kaders te benutten, waaronder code-schrijven, in-context verbetering en zero-shot inhoudsgeneratie, om ongekende optimalisatie van beloningscodes te bereiken. Deze beloningscodes, in combinatie met versterking van het leren, stellen de kaders in staat om complexe vaardigheden te leren of manipulatietaken uit te voeren.
In dit artikel zullen we het EUREKA-kader vanuit een ontwikkelingsperspectief onderzoeken, waarbij we zijn kader, werking en resultaten onder de loep nemen bij het genereren van beloningsfuncties. Deze functies, zoals beweerd door de ontwikkelaars, presteren beter dan die gegenereerd door mensen. We zullen ook ingaan op hoe het EUREKA-kader de weg vrijmaakt voor een nieuwe benadering van RLHF (Versterking van het leren met menselijke feedback) door het mogelijk maken van gradient-vrije in-context leren. Laten we beginnen.
EUREKA: Een Inleiding
Vandaag de dag leveren state-of-the-art LLM-kaders zoals GPT-3 en GPT-4 uitstekende resultaten wanneer ze dienen als semantische planners voor sequentiële hoog-niveau beslissingstaken, maar ontwikkelaars zoeken nog steeds naar manieren om hun prestaties te verbeteren wanneer het gaat om het leren van laag-niveau manipulatietaken zoals pen-spinning vaardigheid. Bovendien hebben ontwikkelaars opgemerkt dat versterking van het leren kan worden gebruikt om duurzame resultaten te behalen in vaardige omstandigheden en andere domeinen, mits de beloningsfuncties zorgvuldig zijn ontworpen door menselijke ontwerpers en deze beloningsfuncties in staat zijn om de leer signalen voor gunstige gedragingen te bieden. Wanneer deze wordt vergeleken met echte versterking van het leren taken die spaarzame beloningen accepteren, maakt het moeilijk voor het model om de patronen te leren, vormt het vormen van deze beloningen de noodzakelijke incrementele leer signalen. Bovendien zijn beloningsfuncties, ondanks hun belang, extreem moeilijk te ontwerpen en leiden suboptimale ontwerpen van deze functies vaak tot ongewenst gedrag.

Om deze uitdagingen aan te pakken en de efficiëntie van deze belonings tokens te maximaliseren, streeft het EUREKA-kader, of Evolution-driven Universal REward Kit voor Agent, naar de volgende bijdragen.
- Het bereiken van menselijk-niveau prestaties voor het ontwerpen van beloningsfuncties.
- Effectief oplossen van manipulatietaken zonder het gebruik van handmatige beloningsengineering.
- Het genereren van meer mens-georiënteerde en presterende beloningsfuncties door het introduceren van een nieuwe gradient-vrije in-context leren benadering in plaats van traditionele RLHF of versterking van het leren van menselijke feedback methode.
Er zijn drie belangrijke algoritme-ontwerpkeuzes die de ontwikkelaars hebben gekozen om de universaliteit van EUREKA te vergroten: evolutionaire zoekopdracht, omgeving als context en beloningsreflectie. Ten eerste neemt het EUREKA-kader de omgevingsbroncode als context om uitvoerbare beloningsfuncties te genereren in een zero-shot setting. Vervolgens voert het kader een evolutionaire zoekopdracht uit om de kwaliteit van zijn beloningen aanzienlijk te verbeteren, stelt het voorstellen van beloningskandidaten voor met elke iteratie of epoch en verfijnt degenen die het meest veelbelovend zijn. In de derde en laatste fase gebruikt het kader de beloningsreflectie benadering om de in-context verbetering van beloningen effectiever te maken, een proces dat uiteindelijk helpt om het kader in staat te stellen om gerichte en geautomatiseerde beloningsbewerking te ermöglichen door het gebruik van een tekstuele samenvatting van de kwaliteit van deze beloningen op basis van beleidsopleidingsstatistieken. De volgende figuur geeft u een korte overzicht van hoe het EUREKA-kader werkt en in de komende sectie zullen we het ontwerp en de werking in meer detail bespreken.

EUREKA: Model Architectuur en Probleem Instelling
Het primaire doel van beloningsvorming is om een gevormde of gecurdeerde beloningsfunctie te retourneren voor een grondwaarheid beloningsfunctie, wat moeilijkheden kan opleveren wanneer het rechtstreeks wordt geoptimaliseerd, zoals spaarzame beloningen. Bovendien kunnen ontwerpers alleen queries gebruiken om toegang te krijgen tot deze grondwaarheid beloningsfuncties, wat de reden is waarom het EUREKA-kader kiest voor beloningsgeneratie, een programmasynthese instelling op basis van RDP of het Reward Design Problem.
Het Reward Design Problem of RDP is een tuple die een wereldmodel bevat met een toestandsruimte, ruimte voor beloningsfuncties, een overgangsfunctie en een actieruimte. Een leer algoritme optimaliseert dan beloningen door een beleid te genereren dat resulteert in een MDP of Markov Design Process, dat de scalaire evolutie van elk beleid produceert en alleen toegankelijk is met behulp van beleidsqueries. Het primaire doel van de RDP is om een beloningsfunctie uit te voeren op een manier zodat het beleid in staat is om de maximale fitheidsscore te bereiken. In de probleeminstelling van EUREKA hebben de ontwikkelaars elk onderdeel in het Reward Design Problem gespecificeerd met behulp van code. Bovendien is het primaire doel van het beloningsgeneratieprobleem, voor een gegeven string die de details van de taak specificeert, om een beloningsfunctie code te genereren om de fitheidsscore te maximaliseren.
Verder, aan de basis van het EUREKA-kader, zijn er drie fundamentele algoritme-onderdelen. Evolutionaire zoekopdracht (voorstel en beloningsverfijning iteratief), omgeving als context (genereren van uitvoerbare beloningen in zero-shot setting) en beloningsreflectie (om de fijne verbetering van beloningen mogelijk te maken). De pseudocode voor het algoritme wordt geïllustreerd in de volgende afbeelding.

Omgeving als Context
Momenteel hebben LLM-kaders omgevingspecificaties nodig als invoer voor het ontwerpen van beloningen, terwijl het EUREKA-kader voorstelt om de ruwe omgevingscode rechtstreeks als context te gebruiken, zonder de beloningscode, waardoor de LLM-kaders de wereldmodel als context kunnen nemen. De benadering die door EUREKA wordt gevolgd, heeft twee belangrijke voordelen. Ten eerste zijn LLM-kaders voor coderingsdoeleinden getraind op native code sets die zijn geschreven in bestaande programmeertalen zoals C, C++, Python, Java en meer, wat de reden is waarom ze beter zijn in het produceren van code-uitvoer wanneer ze rechtstreeks toegestaan zijn om code te componeren in de syntaxis en stijl waarop ze oorspronkelijk zijn getraind. Ten tweede onthult het gebruik van de omgevingsbroncode meestal de omgevingen die betrokken zijn semantisch en de variabelen die geschikt zijn voor gebruik bij het uitvoeren van een beloningsfunctie in overeenstemming met de gespecificeerde taak. Op basis van deze inzichten, instrueert het EUREKA-kader de LLM om een meer uitvoerbare Python-code rechtstreeks terug te geven met behulp van alleen formatteringstips en generieke beloningsontwerpen.
Evolutionaire Zoekopdracht
De inclusie van evolutionaire zoekopdracht in het EUREKA-kader heeft tot doel om een natuurlijke oplossing te bieden voor de suboptimaliteit uitdagingen en fouten die optreden tijdens de uitvoering, zoals eerder vermeld. Met elke iteratie of epoch, produceert het kader verschillende onafhankelijke uitvoer van de Large Language Model en, aangezien de generaties allemaal i.i.d zijn, reduceert het exponentieel de kans op beloningsfuncties tijdens de iteraties die buggy zijn, gegeven het aantal samples dat toeneemt met elke epoch.
In de volgende stap, gebruikt het EUREKA-kader de uitvoerbare beloningsfuncties van de vorige iteratie om een in-context beloningsmutatie uit te voeren en stelt het vervolgens een nieuwe en verbeterde beloningsfunctie voor op basis van tekstuele feedback. Het EUREKA-kader, in combinatie met de in-context verbetering en instructie-volgende mogelijkheden van Large Language Models, is in staat om de mutatie-operator te specificeren als een tekstprompt en suggereert een methode om de tekstuele samenvatting van beleidsopleiding te gebruiken om bestaande beloningscodes te modificeren.
Beloningsreflectie
Om in-context beloningsmutaties te ondersteunen, is het essentieel om de kwaliteit van de gegenereerde beloningen te beoordelen en, nog belangrijker, om ze in woorden te zetten, en het EUREKA-kader tackelt dit door het gebruik van de eenvoudige strategie van het verstrekken van numerieke scores als beloningsbeoordeling. Wanneer de taakfitheidfunctie dient als een holistische meting voor grondwaarheid, ontbreekt het aan credittoewijzing en kan het geen waardevolle informatie bieden over waarom de beloningsfunctie werkt of waarom het niet werkt. Dus, in een poging om een meer gerichte en ingewikkelde beloningsdiagnose te bieden, stelt het kader voor om geautomatiseerde feedback te gebruiken om de beleidsopleidingsdynamica te samenvatten in teksten. Bovendien, in het beloningsprogramma, worden de beloningsfuncties in het EUREKA-kader gevraagd om hun componenten individueel te exposeren, waardoor het kader de scalaire waarden van elke unieke beloningscomponent kan volgen op beleidscontrolepunten tijdens de hele opleidingsfase.

Hoewel het beloningsfunctieproces dat door het EUREKA-kader wordt gevolgd eenvoudig is om te construeren, is het essentieel vanwege de algoritme-afhankelijke aard van het optimaliseren van beloningen. Dit betekent dat de effectiviteit van een beloningsfunctie rechtstreeks wordt beïnvloed door de keuze van een versterking van het leren algoritme en dat, met een verandering in hyperparameters, de beloning anders kan presteren, zelfs met dezelfde optimizer. Dus, het EUREKA-kader kan de records effectiever en selectiever bewerken bij het synthetiseren van beloningsfuncties die in verbeterde synergiefunctie staan met het versterking van het leren algoritme.
Training en Baseline
Er zijn twee belangrijke trainingscomponenten van het EUREKA-kader: Beleidsleren en Beloningsbeoordelingsmetrieken.
Beleidsleren
De definitieve beloningsfuncties voor elke individuele taak worden geoptimaliseerd met behulp van hetzelfde versterking van het leren algoritme met behulp van dezelfde set hyperparameters die zijn afgestemd om menselijk-geëngineerde beloningsfuncties goed te laten werken.
Beloningsbeoordelingsmetrieken
Aangezien de taakmetriek varieert in termen van schaal en semantische betekenis met elke taak, rapporteert het EUREKA-kader de menselijke genormaliseerde score, een meting die een holistische maatstaf biedt voor het kader om te vergelijken hoe het presteert ten opzichte van de expert-menselijke gegenereerde beloningen in overeenstemming met de grondwaarheidmetrieken.
Verder, zijn er drie primaire baselines: L2R, Mens, en Spaars.
L2R
L2R is een dual-stage Large Language Model prompting oplossing die helpt bij het genereren van gesjabloneerde beloningen. Eerst, vult een LLM-kader een natuurlijke taal sjabloon in voor omgeving en taak gespecificeerd in natuurlijke taal, en vervolgens converteert een tweede LLM-kader deze “bewegingsbeschrijving” in een code die een beloningsfunctie schrijft door een set handmatig geschreven belonings-API-primitieven aan te roepen.
Mens
De Mens-baseline zijn de oorspronkelijke beloningsfuncties geschreven door versterking van het leren onderzoekers, waardoor ze de resultaten van menselijke beloningsengineering op een ongekend niveau vertegenwoordigen.
Spaars
De Spaars-baseline lijkt op de fitheidfuncties en wordt gebruikt om de kwaliteit van de beloningen die het kader genereert te evalueren.
Resultaten en Uitkomsten
Om de prestaties van het EUREKA-kader te analyseren, zullen we het evalueren op verschillende parameters, waaronder zijn prestaties tegenover menselijke beloningen, verbetering in resultaten over tijd, genereren van nieuwe beloningen, mogelijk maken van gerichte verbetering, en werken met menselijke feedback.
EUREKA Presteert Beter dan Menselijke Beloningen
De volgende figuur illustreert de geaggregeerde resultaten over verschillende benchmarks en, zoals duidelijk te zien is, presteert het EUREKA-kader ofwel beter dan of op gelijke hoogte met menselijk-niveau beloningen op zowel Dexterity als Issac taken. In vergelijking, levert de L2R-baseline een soortgelijke prestatie op lage-dimensionale taken, maar wanneer het gaat om hoge-dimensionale taken, is de kloof in de prestaties aanzienlijk.

Consistent Verbeteren Over Tijd
Een van de belangrijkste highlights van het EUREKA-kader is zijn vermogen om constant te verbeteren en zijn prestaties over tijd te verhogen met elke iteratie en de resultaten worden gedemonstreerd in de onderstaande figuur.

Zoals duidelijk te zien is, genereert het kader constant betere beloningen met elke iteratie en het presteert ook beter dan en uiteindelijk overstijgt het de prestaties van menselijke beloningen, dankzij het gebruik van de in-context evolutionaire beloningszoekopdracht benadering.
Genereren van Nieuwe Beloningen
De originaliteit van de beloningen van het EUREKA-kader kan worden beoordeeld door de correlatie te berekenen tussen menselijke en EUREKA-beloningen op de gehele Issac taken. Deze correlaties worden vervolgens geplot op een scatter-plot of kaart tegen de menselijke genormaliseerde scores, met elk punt op de plot dat een individuele EUREKA-beloning voor elke individuele taak vertegenwoordigt. Zoals duidelijk te zien is, genereert het EUREKA-kader overwegend zwak gecorreleerde beloningsfuncties die menselijke beloningsfuncties overtreffen.

Mogelijk Maken van Gerichte Verbetering
Om de belangrijkheid van het toevoegen van beloningsreflectie in beloningsfeedback te evalueren, hebben ontwikkelaars een ablatie geëvalueerd, een EUREKA-kader zonder beloningsreflectie dat de feedback prompts reduceert tot alleen snapshot waarden. Wanneer Issac taken worden uitgevoerd, hebben ontwikkelaars opgemerkt dat, zonder beloningsreflectie, het EUREKA-kader een daling van ongeveer 29% in de gemiddelde genormaliseerde score heeft meegemaakt.
Werken met Menselijke Feedback
Om gemakkelijk een breed scala aan invoer te incorporeren om mens-georiënteerde en presterende beloningsfuncties te genereren, introduceert het EUREKA-kader, naast geautomatiseerde beloningsontwerpen, een nieuwe gradient-vrije in-context leren benadering voor versterking van het leren van menselijke feedback en er waren twee belangrijke observaties.
- EUREKA kan profiteren van en verbeteren van menselijke beloningsfuncties.
- Het gebruik van menselijke feedback voor beloningsreflectie induceert gealigneerd gedrag.

De bovenstaande figuur demonstreert hoe het EUREKA-kader een aanzienlijke verbetering in prestaties en efficiëntie toont met behulp van menselijke beloningsinitialisatie, ongeacht de kwaliteit van de menselijke beloningen, wat suggereert dat de kwaliteit van de basisbeloningen geen significante invloed heeft op de in-context beloningsverbeteringsmogelijkheden van het kader.

De bovenstaande figuur illustreert hoe het EUREKA-kader niet alleen meer mens-georiënteerde beleidsregels kan induceren, maar ook beloningen kan modificeren door menselijke feedback te incorporeren.
Slotopmerkingen
In dit artikel hebben we het over EUREKA, een LLM-gepowered menselijk-niveau ontwerpalgoritme, dat probeert om verschillende mogelijkheden van LLM-kaders te benutten, waaronder code-schrijven, in-context verbetering en zero-shot inhoudsgeneratie, om ongekende optimalisatie van beloningscodes te bereiken. De beloningscode, in combinatie met versterking van het leren, kan dan worden gebruikt door deze kaders om complexe vaardigheden te leren of manipulatietaken uit te voeren.
Over het algemeen, de aanzienlijke prestaties en veelzijdigheid van het EUREKA-kader geven aan dat het combineren van evolutionaire algoritmen met grote taalmodellen mogelijk een schaalbare en algemene benadering kan zijn voor het ontwerpen van beloningen en deze inzicht kan ook van toepassing zijn op andere open-eindige zoekproblemen.












