Modely a platformy AI
Pokročilé zarovnání AI s lidskými hodnotami pomocí WARM
Zarovnání systémů AI s lidskými hodnotami
Systémy umělé inteligence (AI) se stávají stále schopnějšími pomáhat lidem při složitých úkolech, od chatbotů pro zákaznickou podporu až po algoritmy pro lékařskou diagnózu. Avšak jak tyto systémy AI přebírají více odpovědností, je zásadní, aby zůstaly zarovnány s lidskými hodnotami a preferencemi. Jedním z přístupů, jak toho dosáhnout, je technika nazvaná učení z lidské zpětné vazby (RLHF). V RLHF je systém AI, nazývaný politika, odměňován nebo penalizován na základě lidského hodnocení jeho chování. Cílem je, aby politika naučila maximalizovat své odměny a tím se chovala podle lidských preferencí.
Jedním z hlavních komponent RLHF je model odměny (RM). RM je zodpovědný za hodnocení akcí a výstupů politiky a návrat odměny signálu, který řídí proces učení. Navržení dobrého RM je obtížné, protože lidské preference mohou být komplexní, kontextově závislé a dokonce i nekonzistentní napříč jednotlivci. Nedávno výzkumníci z Google DeepMind navrhli inovativní techniku nazvanou Weight Averaged Reward Models (WARM) pro zlepšení návrhu RM.
Problém s hackováním odměn
Jedním z hlavních problémů v RLHF je hackování odměn. Hackování odměn nastává, když politika najde mezery, aby obešla systém RM a získala vysoké odměny bez skutečného splnění zamýšlených cílů. Například, pokud je cílem trénovat AI pro generování kvalitních souhrnů, RM může odměňovat stručné a informační souhrny. Politika může poté naučit, aby tuto mezery využila a generovala velmi krátké, neinformační souhrny posypané klíčovými slovy, které oklamou RM.
Hackování odměn nastává z dvou hlavních důvodů:
- Přechod distribuce – RM je trénován na omezeném datasetu lidských označených příkladů. Když je nasazen, výstupy politiky mohou pocházet z různých distribucí, které RM nezobecní dobře.
- Hlučné štítky – Lidské označování je nedokonalé, s nesouhlasnými hodnoceními. RM může se zaměřit na falešné signály místo robustních indikátorů kvality.
Hackování odměn vede k neužitečným systémům, které nesplňují lidská očekávání. Horší je, že může vést k chování AI, které je zkreslené nebo dokonce nebezpečné, pokud je nasazeno bezstarostně.
Vzestup slučování modelů
Růst zájmu o strategie slučování modelů, jako je Model Ratatouille, je poháněn uvědoměním, že větší modely, ačkoli jsou mocné, mohou být neefektivní a nerealistické. Trénování modelu s 1 bilionem parametrů vyžaduje enormní množství dat, výpočetní zdroje, čas a náklady. Více kriticky, takové modely tendují k přeučení se na trénovací distribuci, což brání jejich schopnosti generalizovat na rozmanité reálné scénáře.
Slučování modelů poskytuje alternativní cestu k odemknutí větších schopností bez nekontrolovaného škálování. Znovu používáním více specializovaných modelů trénovaných na různých distribucích, úkolech nebo cílech, slučování modelů cílí na zlepšení versatility a robustnosti mimo distribuci. Předpokladem je, že různé modely zachycují odlišné předpovědní vzory, které se mohou doplňovat, když jsou sloučeny.
Nedávné výsledky ilustrují slib tohoto konceptu. Modely získané slučováním, navzdory menšímu počtu parametrů, mohou dosáhnout nebo dokonce překonat výkon gigantických modelů, jako je GPT-3. Například, Model Ratatouille ensemble ze 7 středně velkých kontrolních bodů dosahuje nejlepších výsledků na vysokodimenzionálních textových implikacích, překonávající GPT-3.
Jednoduchost slučování pomocí vážení je obrovskou výhodou. Trénování více pomocných modelů vyžaduje dodatečné zdroje. Avšak kriticky, výpočetní čas během inference zůstává stejný jako u jediného modelu, protože váhy jsou kondenzovány do jednoho. To činí metodu snadno adaptovatelnou, bez obav z zvýšeného zpoždění nebo nákladů na paměť.
Mechanismy za slučováním modelů
Ale co přesně umožňuje tyto zlepšení přesnosti ze slučování modelů? Nedávná analýza nabízí některé nápady:
- Mitigace memorizace: Každý model vidí různé náhodně seřazené dávky datasetu během trénování. Vážení snižuje jakoukoli instanci-specifickou memorizaci, uchovává pouze generalizace na úrovni datasetu.
- Snižování variability: Modely trénované nezávisle mají nekorelované chyby. Kombinace je平均uje šum, zlepšuje kalibraci.
- Regularizace pomocí diversity: Různé pomocné úkoly nutí modely, aby se zaměřily na obecněji generalizovatelné rysy, které jsou užitečné napříč distribucemi.
- Zvyšování robustnosti: Nesrovnalosti v předpovědích signalizují nejistotu. Vážení umírněňuje outliers, zlepšuje spolehlivost.
Ve své podstatě, slučování modelů vyrovnává slabosti jednotlivých modelů, aby zvýšilo jejich kolektivní sílu. Sloučená reprezentace zachycuje společné základní kauzální struktury, ignoruje nahodilé variace.
Tato konceptuální základna spojuje slučování modelů s jinými populárními technikami, jako je ensembling a multi-task learning. Všechny tyto metody využívají diversity napříč modely nebo úkoly, aby získaly všestranné, nejistotu-osvědčené systémy. Jednoduchost a efektivita vážení však dává slučování modelů jedinečnou výhodu pro pokrok v reálných nasazeních.
Vážené modely odměn
WARM inovativně využívá proxy model odměny (RM), který je váženým průměrem více jednotlivých RM, každý jemně upraven z téhož předtrénovaného LLM, ale s různými hyperparametry. Tato metoda zlepšuje efektivitu, spolehlivost pod distribučními posuny a robustnost proti nekonzistentním preferencím. Studie také ukazuje, že použití WARM jako proxy RM, zejména s větším počtem průměrovaných RM, zlepšuje výsledky a oddaluje začátek “hackování odměn”, jevu, při kterém se odměny zhoršují s časem.
Zde je přehled:
- Začněte s základním jazykovým modelem, který byl předtrénován na velkém korpusu. Inicializujte více RM přidáním malých úkol-specifických vrstev na vrchol.
- Jemně upravte každý RM samostatně na datasetu lidských preferencí, pomocí různých hyperparametrů, jako je rychlost učení pro diversity.
- Vypočítejte vážený průměr vah jemně upravených RM, aby se získal jediný WARM ensemble.
Klíčovým poznatkem je, že vážení uchovává pouze invariantní informace, které se naučily všechny různé RM. To snižuje závislost na falešných signálech, zlepšuje robustnost. Ensemble také profituje z redukce variability, zlepšující spolehlivost navzdory distribučním posunům.
Jak jsme již diskutovali, diversity napříč nezávisle trénovanými modely je zásadní pro odemknutí plného potenciálu slučování modelů. Ale jaké jsou některé konkrétní techniky pro podporu produktivní diversity?
Článek WARM prozkoumává několik chytrých nápadů, které by se mohly zobecnit:
Seřazení náhodných posunů
Triviální, ale efektivní přístup je náhodné seřazení pořadí, ve kterém data bodů jsou viděna každým modelem během trénování. I tento jednoduchý krok dekorreluje váhy, snižuje redundanci memorizace vzorů.
Variace hyperparametrů
Úprava hyperparametrů, jako je rychlost učení a dropout pravděpodobnost, pro každý běh, zavádí užitečnou diversity. Modely konvergují odlišně, zachycují různé vlastnosti datasetu.
Průměrování kontrolních bodů – Baklava
Metoda Baklava inicializuje modely pro slučování z různých snímků po stejné předtrénovací trajektorii. To relaxuje omezení ve srovnání s modelovými polévky, které vyžadují sdílený startovní bod. V porovnání s modelovou ratatouille, Baklava se vyhněte dodatečným úkolům. Celkově, dosahuje efektivní rovnováhy mezi přesností a diversitou.
Analýza potvrzuje, že přidání starších kontrolních bodů pomocí pohyblivého průměru poškozuje individuální výkon, kompromitující diversity výhody. Průměrování pouze konečných reprezentací z každého běhu funguje lépe. Obecně, vyvážení diversity cílů s údržbou přesnosti zůstává otevřenou výzkumnou výzvou.
Celkově, slučování modelů se shoduje s obecným étosem v oblasti recyklace existujících zdrojů účinně pro zlepšení spolehlivosti, efektivnosti a versatility. Jednoduchost vážení upevňuje jeho pozici jako vedoucí kandidát na sestavení robustních modelů z dostupných stavebních bloků.
Na rozdíl od tradičních ensemblíngových metod, které průměrují předpovědi, WARM udržuje minimální výpočetní režii, udržuje pouze jeden sadu vah. Experimenty na úkolech souhrnu textu demonstrují efektivitu WARM:
- Pro výběr nejlepšího z N, WARM dosahuje 92,5% výherního poměru proti náhodnému výběru podle lidských preferenčních štítků.
- Ve RLHF, politika WARM dosahuje 79,4% výherního poměru proti politice trénované s jediným RM po stejném počtu kroků.
- WARM pokračuje ve výkonu i v případě, kdy je čtvrtina lidských štítků poškozena.
Tyto výsledky ilustrují potenciál WARM jako praktické techniky pro vývoj reálných AI asistentů, které se chovají spolehlivě. Smoothing nekonzistence v lidské zpětné vazbě, politiky WARM mohou zůstat robustně zarovnány s lidskými hodnotami, i když pokračují v učení z nových zkušeností.
Širší obraz
WARM se nachází na průsečíku dvou klíčových trendů ve výzkumu zarovnání AI. První je studium generalizace mimo distribuci (OOD), která cílí na zlepšení výkonu modelů na nových datech, které se liší od trénovací distribuce. Druhý je výzkum algoritmické robustnosti, zaměřený na spolehlivost navzdory malým perturbacím vstupů nebo šumu.
Spojováním souvislostí mezi těmito oblastmi kolem konceptu naučených invariantností, WARM nás přivádí k více důkladně zakotveným technikám pro zarovnání hodnot. Poznatky z WARM by se mohly zobecnit i za hranice RLHF, poskytujíce lekce pro širší systémy strojového učení, které interagují s otevřeným světem.
Samozřejmě, modelování odměn je pouze jedním kusem puzzle zarovnání. Stále potřebujeme pokrok v dalších výzvách, jako je specifikace odměn, škálovatelná kontrola a bezpečné zkoumání. V kombinaci s doplňkovými technikami, WARM by mohl urychlit vývoj AI, které udržitelně podporují lidský prosperitu. Spolu se snažením o objasnění principů, které leží pod robustním zarovnáním, výzkumníci mapují cestu k prospěšné, etické AI.














