Modely a platformy AI
EUREKA: Navrhování odměn na úrovni člověka pomocí kódování velkých jazykových modelů
S velkými pokroky, kterých dosáhly velké jazykové modely v posledních letech, není překvapivé, že tyto rámce LLM vynikají jako sémantické plánovače pro sekvenční úkoly rozhodování na vysoké úrovni. Přesto vývojáři stále považují za výzvu využít plný potenciál rámců LLM pro učení komplexních úkolů na nízké úrovni. Navzdory jejich efektivitě vyžadují dnešní velké jazykové modely značné znalosti domény a předmětu, aby se naučily i jednoduché dovednosti nebo vytvořily textové výzvy, což vytváří značnou mezеру mezi jejich výkonem a lidskou obratností.
Aby se tato mezera zmenšila, vývojáři z Nvidia (NVDA ), CalTech, UPenn a dalších představili EUREKA, algoritmus navrhování odměn poháněný LLM. EUREKA má za cíl využít různých schopností rámců LLM, včetně psaní kódu, v kontextu zlepšování a generování obsahu bez přípravy, aby dosáhl bezprecedentní optimalizace kódů odměn. Tyto kódy odměn, v kombinaci s učení posílením, umožňují rámcům učit se komplexní dovednosti nebo provádět úkoly manipulace.
V tomto článku prozkoumáme rámec EUREKA z perspektivy vývoje, zkoumající jeho architekturu, fungování a výsledky, kterých dosahuje při generování funkcí odměn. Tyto funkce, jak tvrdí vývojáři, překonávají ty, které jsou generovány lidmi. Také se budeme zabývat tím, jak rámec EUREKA otevírá novou cestu pro RLHF (učení posílením s lidskou zpětnou vazbou) umožňující gradient-free učení v kontextu. Pojďme začít.
EUREKA : Úvod
Dnes, špičkové rámce LLM jako GPT-3 a GPT-4 dosahují vynikajících výsledků, když slouží jako sémantické plánovače pro sekvenční úkoly rozhodování na vysoké úrovni, ale vývojáři stále hledají způsoby, jak vylepšit jejich výkon, pokud jde o učení úkolů manipulace na nízké úrovni, jako je obratnost při otáčení pera. Kromě toho vývojáři pozorovali, že učení posílením lze použít k dosažení udržitelných výsledků v obratných podmínkách a dalších doménách, pokud jsou funkce odměn pečlivě navrženy lidskými designéry a tyto funkce odměn jsou schopny poskytovat signály učení pro příznivé chování. Když jsou tyto úkoly srovnány s úkoly učení posílením v reálném světě, které přijímají řídké odměny, činí to obtížné pro model, aby se naučil vzorce, a tvarování těchto odměn poskytuje nezbytné.incrementální signály učení. Kromě toho jsou funkce odměn, navzdory jejich důležitosti, extrémně obtížné navrhnout a suboptimální návrhy těchto funkcí často vedou k neúmyslnému chování.

Aby se tyto výzvy zvládly a maximalizovala efektivita těchto tokenů odměn, rámec EUREKA nebo Evolutivní Univerzální REward Kit pro Agent má za cíl učinit následující příspěvky.
- Dosáhnout lidské úrovně výkonu pro návrh funkcí odměn.
- Úspěšně řešit úkoly manipulace bez použití ručního inženýrství odměn.
- Generovat více lidsky orientované a výkonnější funkce odměn zavedením nového přístupu učení bez gradientu v kontextu místo tradiční RLHF nebo učení posílením s lidskou zpětnou vazbou.
Existují tři klíčové algoritmické designové volby, které vývojáři zvolili pro zlepšení obecnosti EUREKA: evoluční vyhledávání, prostředí jako kontext a reflexe odměn. Nejprve rámec EUREKA bere zdrojový kód prostředí jako kontext, aby generoval spustitelné funkce odměn v nastavení bez přípravy. Následně rámec provede evoluční vyhledávání, aby podstatně zlepšil kvalitu svých odměn, navrhuje dávky kandidátů na odměny s každou iterací nebo epochou a rafinuje ty, které považuje za nejperspektivnější. Ve třetí a poslední fázi rámec používá reflexi odměn, aby učinil vylepšení odměn v kontextu více účinným, proces, který nakonec pomáhá rámcům umožnit cílené a automatizované úpravy odměn pomocí textového souhrnu kvality těchto odměn na základě statistik školení politik. Následující obrázek poskytuje stručný přehled o tom, jak rámec EUREKA funguje, a v následující sekci budeme hovořit o architektuře a fungování podrobněji.

EUREKA : Architektura modelu a nastavení problému
Hlavním cílem tvarování odměn je vrátit tvarovanou nebo kurátorskou funkci odměn pro funkci odměn ground-truth, která může být obtížná, pokud je přímo optimalizována, jako řídké odměny. Kromě toho mohou designéři přistupovat k těmto funkcím odměn ground-truth pouze pomocí dotazů, což je důvod, proč rámec EUREKA volí generování odměn, nastavení syntézy programu založené na RDP nebo Problematice návrhu odměn.
Problematika návrhu odměn nebo RDP je tuple, který obsahuje model světa s prostorem stavů, prostorem funkcí odměn, přechodovou funkcí a prostorem akcí. Algoritmus učení pak optimalizuje odměny generováním politiky, která vede k procesu Markovova rozhodnutí, který produkuje skalární evoluci libovolné politiky a může být přístupný pouze pomocí dotazů na politiku. Hlavním cílem RDP je výstup funkce odměn takovým způsobem, aby politika dosáhla maximálního skóre fitness. V nastavení problému EUREKA vývojáři specifikovali každý komponent v Problematice návrhu odměn pomocí kódu. Kromě toho, pro danou řetězec, který specifikuje detaily úkolu, hlavním cílem problému generování odměn je vygenerovat kód funkce odměn pro maximalizaci skóre fitness.
Pokračujeme, ve své podstatě existují tři základní algoritmické komponenty v rámci EUREKA. Evoluční vyhledávání (navrhování a rafinování kandidátů iterativně), prostředí jako kontext (generování spustitelných odměn v nastavení bez přípravy) a reflexe odměn (umožňující jemné vylepšení odměn). Pseudo-kód pro algoritmus je znázorněn na následujícím obrázku.

Prostředí jako kontext
V současné době rámce LLM vyžadují specifikace prostředí jako vstup pro návrh odměn, zatímco rámec EUREKA navrhuje krmit raw zdroj kódu prostředí přímo jako kontext, bez kódu odměn, což umožňuje rámcům LLM vzít model světa jako kontext. Přístup, který následuje EUREKA, má dvě hlavní výhody. První, rámce LLM pro kódování jsou trénovány na nativních sadách kódu napsaných v existujících programovacích jazycích, jako je C, C++, Python, Java a další, což je základní důvod, proč jsou lepší při produkci kódu, když jsou přímo umožněny komponovat kód v syntaxi a stylu, na kterém byli původně trénováni. Druhý, použití zdrojového kódu prostředí obvykle odhaluje prostředí zapojená sémanticky a proměnné, které jsou vhodné pro použití při výstupu funkce odměn v souladu se specifikovaným úkolem. Na základě těchto poznatků rámec EUREKA instruuje LLM, aby vrátil více spustitelný Python kód přímo s pomocí pouze formátovacích tipů a generických návrhů odměn.
Evoluční vyhledávání
Zahrnutí evolučního vyhledávání do rámce EUREKA má za cíl představit přirozené řešení problémů suboptimality a chyb, ke kterým dochází během provádění, jak je zmíněno dříve. S každou iterací nebo epochou rámec EUREKA poskytuje různé nezávislé výstupy z velkého jazykového modelu a poskytuje, že generace jsou všechny i.i.d, což exponenciálně snižuje pravděpodobnost, že funkce odměn během iterací budou chybné, a to v závislosti na počtu vzorků, které se zvyšují s každou epochou.
V další fázi rámec EUREKA používá spustitelné funkce odměn z předchozí iterace, aby provedl v kontextu mutaci odměn, a poté navrhuje novou a vylepšenou funkci odměn na základě textové zpětné vazby. Rámec EUREKA, v kombinaci s vylepšením v kontextu a schopnostmi následování instrukcí velkých jazykových modelů, je schopen specifikovat operátor mutace jako textový prompt a navrhuje metodu, jak použít textový souhrn školení politiky pro úpravu existujících kódů odměn.
Reflexe odměn
Aby se zakotvily mutace odměn v kontextu, je nezbytné posoudit kvalitu generovaných odměn a ještě důležitější, vyjádřit je slovy, a rámec EUREKA řeší to pomocí jednoduché strategie poskytování numerických skórů jako hodnocení odměn. Když funkce fitness úkolu slouží jako holistický metrický údaj pro ground-truth, postrádá přiřazení kreditu a není schopna poskytnout žádné cenné informace o tom, proč funkce odměn funguje nebo proč nefunguje. Proto, aby se poskytla více cílená a jemná diagnóza odměn, rámec navrhuje použít automatizované zpětné vazby, aby souhrn dynamiky školení politiky v textech. Kromě toho, v programu odměn, funkce odměn v rámci EUREKA jsou požádány, aby vystavily své komponenty jednotlivě, což umožňuje rámcům sledovat skalární hodnoty každé jedinečné komponenty odměn na kontrolních bodech během celé fáze školení.

Ačkoli postup funkce odměn, který následuje rámec EUREKA, je jednoduchý na konstrukci, je nezbytný kvůli algoritmicky závislé povaze optimalizace odměn. To znamená, že účinnost funkce odměn je přímo ovlivněna volbou algoritmu učení posílením a se změnou hyperparametrů může odměna fungovat jinak, i se stejným optimalizátorem. Proto je rámec EUREKA schopen editovat záznamy více účinně a selektivně, zatímco syntetizuje funkce odměn, které jsou vylepšené synergii s algoritmem učení posílením.
Školení a referenční hodnoty
Existují dvě hlavní komponenty školení v rámci EUREKA: Učení politiky a Metriky hodnocení odměn.
Učení politiky
Konečné funkce odměn pro každý jednotlivý úkol jsou optimalizovány pomocí stejného algoritmu učení posílením s použitím stejné sady hyperparametrů, které jsou jemně naladěny, aby fungovaly dobře s lidsky navrhovanými funkcemi odměn.
Metriky hodnocení odměn
Jelikož metrika úkolu se liší ve smyslu měřítka a sémantického významu s každým úkolem, rámec EUREKA hlásí normalizovaný skór lidského, metriku, která poskytuje holistický měřítko pro srovnání, jak rámec funguje ve srovnání s odborníky, lidsky generovanými funkcemi odměn, v souladu s metrikami ground-truth.
Pokračujeme, existují tři primární referenční hodnoty: L2R, Lidský, a Řídký.
L2R
L2R je dvojstupňové řešení Large Language Model pro generování šablon odměn. První LLM rámec vyplňuje šablonu přirozeného jazyka pro prostředí a úkol specifikovaný v přirozeném jazyce a druhý LLM rámec převádí tuto „popis pohybu“ do kódu, který píše funkci odměn voláním sady ručně napsaných API primitiv odměn.
Lidský
Referenční hodnota Lidský jsou původní funkce odměn napsané výzkumníky učení posílením, reprezentující výsledky lidského inženýrství odměn na bezprecedentní úrovni.
Řídký
Referenční hodnota Řídký se podobá funkcím fitness a jsou používány pro hodnocení kvality odměn, které rámec generuje.
Výsledky a důsledky
Abychom analyzovali výkon rámce EUREKA, budeme jej hodnotit na různých parametrech, včetně jeho výkonu proti lidským odměnám, zlepšení výsledků over time, generování nových odměn, umožnění cíleného zlepšení, a práce s lidskou zpětnou vazbou.
EUREKA překonává lidské odměny
Následující obrázek ilustruje agregované výsledky přes různé benchmarky a jak je zřejmé, rámec EUREKA buď překonává nebo funguje na stejné úrovni jako lidské odměny na úkolech Dexterity a Issac. V porovnání referenční hodnota L2R dodává podobný výkon na úkolech s nízkou dimenzí, ale když jde o úkoly s vysokou dimenzí, je mezera ve výkonu poměrně podstatná.

Přetrvávající zlepšování over time
Jednou z hlavních výhod rámce EUREKA je jeho schopnost neustále zlepšovat a zvyšovat svůj výkon over time s každou iterací a výsledky jsou demonstrovány na následujícím obrázku.

Jak je zřejmé, rámec neustále generuje lepší odměny s každou iterací a také zlepšuje a nakonec překonává výkon lidských odměn, díky svému použití evolučního vyhledávání odměn v kontextu.
Generování nových odměn
Novost odměn rámce EUREKA může být hodnocena výpočtem korelace mezi lidskými a EUREKA odměnami na všech úkolech Issac. Tyto korelace jsou poté zobrazeny na scatter-plotu nebo mapě proti normalizovaným skórům lidského, přičemž každý bod na plotu reprezentuje jednotlivou odměnu EUREKA pro každý úkol. Jak je zřejmé, rámec EUREKA převážně generuje slabě korelované funkce odměn, které překonávají lidské funkce odměn.

Umožnění cíleného zlepšení
Abychom hodnotili důležitost přidání reflexe odměn do zpětné vazby odměn, vývojáři hodnotili ablacii, rámec EUREKA bez reflexe odměn, který snižuje zpětnou vazbu na snapshot hodnoty. Když běžel úkoly Issac, vývojáři pozorovali, že bez reflexe odměn rámec EUREKA zaznamenal pokles o asi 29% v průměrném normalizovaném skóre.
Práce s lidskou zpětnou vazbou
Abychom mohli snadno zahrnout širokou škálu vstupů pro generování lidsky orientovaných a výkonnějších funkcí odměn, rámec EUREKA kromě automatizovaného návrhu odměn také představuje nový přístup učení bez gradientu v kontextu pro učení posílením s lidskou zpětnou vazbou a byly dvě významné observace.
- EUREKA může těžit a zlepšit se z lidských funkcí odměn.
- Použití lidské zpětné vazby pro reflexi odměn indukuje orientované chování.

Následující obrázek demonstruje, jak rámec EUREKA demonstruje podstatný nárůst výkonu a efektivity pomocí inicializace lidských odměn, bez ohledu na kvalitu lidských odměn, což naznačuje, že kvalita základních odměn nemá podstatný vliv na schopnosti vylepšení odměn v kontextu rámce.

Následující obrázek ilustruje, jak rámec EUREKA může nejen indukovat více lidsky orientované politiky, ale také modifikovat odměny zahrnutím lidské zpětné vazby.
Závěrečné myšlenky
V tomto článku jsme hovořili o EUREKA, algoritmu navrhování odměn na úrovni člověka, který se snaží využít různé schopnosti rámců LLM, včetně psaní kódu, vylepšování v kontextu a generování obsahu bez přípravy, aby dosáhl bezprecedentní optimalizace kódů odměn. Kód odměn, v kombinaci s učení posílením, může být použit rámcem pro učení komplexních dovedností nebo provádění úkolů manipulace. Bez lidského zásahu nebo úkolu-specifického inženýrství rámců EUREKA dodává lidskou úroveň generování odměn na široké škále úkolů a jeho hlavní síla spočívá v učení komplexních úkolů s přístupem kurikulárního učení.
Celkově, podstatný výkon a všestrannost rámce EUREKA naznačují, že kombinace evolučních algoritmů s velkými jazykovými modely může vést k škálovatelnému a obecnému přístupu k návrhu odměn a tato myšlenka může být aplikovatelná na další otevřené problémy vyhledávání.












