Modely a platformy AI

DIAMOND: Visual Details Matter in Atari a Diffuse for World Modeling

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

To bylo v roce 2018, kdy byla poprvé představena idea učení s posilováním v kontextu neuronové sítě jako modelu světa a brzy byla tato základní princip aplikována na modely světa. Některé z prominentních modelů, které implementují učení s posilováním, byly rámec Dreamer, který zavedl učení s posilováním z latentního prostoru rekurentního modelu stavu. DreamerV2 ukázal, že použití diskrétních latentů může vést ke snížení chyby sčítání a rámec DreamerV3 dosáhl lidské výkony na série úkolů napříč různými doménami s pevnými hyperparametry.

Dále lze vyvodit paralely mezi modely generování obrazů a modely světa, které naznačují, že pokrok učiněný v generativních modelech vidění by mohl být replikován pro výhodu modelů světa. Od doby, kdy použití transformátorů v rámcích zpracování přirozeného jazyka získalo popularitu, se objevily rámce DALL-E a VQGAN. Tyto rámce implementovaly diskrétní autoenkodéry pro převod obrazů na diskrétní tokeny a byly schopny postavit vysoce výkonné a efektivní text-obraz generativní modely využívající sekvencování autoregresivních transformátorů. Ve stejnou dobu získaly difuzní modely trakci a dnes se difuzní modely etablovaly jako dominantní paradigma pro generování vysokého rozlišení obrazů. Díky schopnostem nabízeným difuzními modely a učení s posilováním se snaží kombinovat tyto dva přístupy, s cílem využít flexibility difuzních modelů jako trajektorií modelů, odměňovacího modelu, plánovače a zásady pro datovou augmentaci v offline učení s posilováním.

Modely světa nabízejí slibný způsob pro školení agentů učení s posilováním bezpečně a efektivně. Tradičně tyto modely používají sekvence diskrétních latentních proměnných pro simulaci dynamiky prostředí. Nicméně tato komprese může přehlédnout vizuální detaily, které jsou pro učení s posilováním kritické. Ve stejnou dobu difuzní modely získaly popularitu pro generování obrazů, které zpochybňují tradiční metody, které používají diskrétní latenty. Inspirováni touto změnou, v tomto článku budeme mluvit o DIAMONDU (DIffusion As a Model Of eNvironment Dreams), agentovi učení s posilováním, který je školen v difuzním modelu světa. Prozkoumáme nezbytné návrhové volby, aby difuze byla vhodná pro modelování světa a ukážeme, že vylepšené vizuální detaily vedou k lepšímu výkonu agenta. DIAMOND stanoví nový benchmark na soutěžním Atari 100k testu, dosahující průměrného lidského normalizovaného skóre 1,46, nejvyššího pro agenty školené entirely v modelu světa.

DIAMOND: DIffusion As a Model Of eNvironment Dreams

Modely světa nebo generativní modely prostředí se objevují jako jeden z důležitějších komponentů pro generativní agenty, aby mohli plánovat a uvažovat o svých prostředích. Ačkoli použití učení s posilováním dosáhlo značného úspěchu v posledních letech, modely, které implementují učení s posilováním, jsou známé tím, že jsou vzorkově neefektivní, což výrazně omezuje jejich reálné aplikace. Na druhé straně modely světa prokázaly svou schopnost efektivně školovat agenty učení s posilováním napříč různými prostředími se značně vylepšenou vzorkovou efektivitou, což umožňuje modelu učit se z reálných zkušeností. Nedávné rámce modelování světa obvykle modelují dynamiku prostředí jako sekvenci diskrétních latentních proměnných, přičemž model diskrétní latentní prostor, aby se zabránilo chybné akumulaci přes vícestupňové časové horizonty. Ačkoli tento přístup může přinést podstatné výsledky, je také spojen se ztrátou informací, vedoucí ke ztrátě kvality rekonstrukce a ztrátě obecnosti. Ztráta informací může se stát významnou překážkou pro reálné scénáře, které vyžadují, aby informace byly dobře definovány, jako je školení autonomních vozidel. V takových úkolech mohou malé změny nebo detaily ve vizuálním vstupu, jako je barva semaforu nebo směrovací ukazatel vozidla vpředu, změnit politiku agenta. Ačkoli zvýšení počtu diskrétních latentů může pomoci zabránit ztrátě informací, výrazně zvyšuje výpočetní náklady.

Dále, v posledních letech, difuzní modely se objevily jako dominantní přístup pro generování obrazů s vysokým rozlišením, protože rámce postavené na difuzních modelech se naučily invertovat proces šumu a přímo soutěží s některými z více etablovaných přístupů modelujících diskrétní tokeny, a proto nabízí slibnou alternativu pro eliminaci potřeby diskrétního modelování ve světě. Difuzní modely jsou známé svou schopností být snadno kondicionovány a flexibilně modelovat komplexní, multimodální distribuce bez kolapsu módu. Tyto atributy jsou kritické pro modelování světa, protože kondicionování umožňuje modelu světa přesně odrážet akce agenta, vedoucí k více spolehlivému přiřazování kreditu. Kromě toho modelování multimodálních distribucí nabízí větší rozmanitost tréninkových scénářů pro agenta, zlepšující jeho celkový výkon.

Vycházející z těchto charakteristik, DIAMOND, (DIffusion As a Model Of eNvironment Dreams), agent učení s posilováním, který je školen v difuzním modelu světa. Rámec DIAMOND dělá pečlivé návrhové volby, aby zajistil, že jeho difuzní model světa zůstává efektivní a stabilní přes dlouhé časové horizonty. Rámec poskytuje kvalitativní analýzu, aby demonstroval důležitost těchto návrhových voleb. DIAMOND stanoví nový stav umění s průměrným lidským normalizovaným skóre 1,46 na dobře etablovaném Atari 100k benchmarku, nejvyšší pro agenty školené entirely v modelu světa. Provoz v obrazovém prostoru umožňuje difuznímu modelu světa DIAMONDu nahradit prostředí bezproblémově, nabízející větší vhled do chování modelu světa a agenta. Značně, vylepšený výkon v určitých hrách je připsán lepšímu modelování kritických vizuálních detailů. Rámec DIAMOND modeluje prostředí jako standardní POMDP nebo Částečně Pozorovatelný Markovský Proces s množinou stavů, množinou diskrétních akcí a množinou obrazových pozorování. Přechodové funkce popisují dynamiku prostředí a odměňovací funkce mapuje přechody na skalární odměny. Pozorovací funkce popisuje pravděpodobnosti pozorování a emituje obrazová pozorování, která jsou poté použita agenty, aby viděli prostředí, protože nemohou přímo přistupovat ke stavům. Primárním cílem přístupu bylo získat politiku, která mapuje pozorování na akce se snahou maximalizovat očekávanou slevu s diskontním faktorem. Modely světa jsou generativními modely prostředí a modely světa lze použít k vytvoření simulovaných prostředí pro školení agentů učení s posilováním v reálném prostředí a školení agentů učení s posilováním v modelu světa. Obrázek 1 demonstruje rozvinutou představu rámce DIAMOND v čase.

DIAMOND: Metodologie a Architektura

V jádru, difuzní modely jsou třídou generativních modelů, které generují vzorek invertováním procesu šumu a čerpají inspiraci z termodynamiky nerovnováhy. Rámec DIAMOND zvažuje difuzní proces indexovaný kontinuální časovou proměnnou s odpovídajícími marginály a okrajovými podmínkami s traktovatelnou nestrukturovanou předchozí distribucí. Kromě toho, aby získal generativní model, který mapuje ze šumu na data, rámec DIAMOND musí invertovat proces, přičemž reverzní proces je také difuzním procesem, běžícím pozpátku v čase. Kromě toho, v každém daném bodě času, není triviální odhadnout skórovací funkci, protože rámec DIAMOND nemá přístup k skutečné skórovací funkci a model překonává tuto překážku implementací cíle skórování, přístupu, který umožňuje rámcovému školení skórovacího modelu bez znalosti podkladové skórovací funkce. Skórovací difuzní model poskytuje nezávislý generativní model. Nicméně, podmíněný generativní model dynamiky prostředí je vyžadován pro službu jako model světa a pro tento účel rámec DIAMOND zkoumá obecný případ POMDP přístupu, ve kterém rámec může využít minulých pozorování a akcí, aby aproximoval neznámý markovský stav. Jak je demonstrováno na Obrázku 1, rámec DIAMOND využívá tuto historii pro kondicionování difuzního modelu, aby odhadl a vygeneroval další pozorování přímo. Ačkoli rámec DIAMOND může teoreticky využít jakýkoli SDE nebo ODE řešič, existuje kompromis mezi NFE nebo Počet Funkčních Evaluací a kvalitou vzorku, který významně ovlivňuje náklady na inferenci difuzních modelů.

Vycházející z výše uvedených znalostí, pojďme se nyní podívat na praktickou realizaci rámce DIAMOND difuzního modelu světa, včetně driftu a difuzních koeficientů odpovídajících konkrétnímu výběru difuzního přístupu. Místo toho, aby zvolil DDPM, přirozeně vhodného kandidáta pro úkol, rámec DIAMOND staví na EDM formulaci a zvažuje perturbační jádro s reálnou funkcí difuzního času nazývanou harmonogramem šumu. Rámec vybírá preconditionery, aby udržoval vstupní a výstupní varianci pro jakoukoli úroveň hlasitosti. Síťové školení kombinuje signál a šum adaptivně v závislosti na úrovni degradace a když je šum nízký, cílem se stává rozdíl mezi čistým a perturbovaným signálem, tj. přidáným gaussovským šumem. Intuitivně to brání tomu, aby se tréninkový cíl stal triviálním v režimu nízkého šumu. V praxi je tento cíl vysoký při extrémech harmonogramu šumu, takže model vzorkuje úroveň šumu z log-normální distribuce zvolené empiricky, aby spojil trénink kolem středních oblastí šumu. Rámec DIAMOND využívá standardní 2D komponentu U-Net pro vektorové pole a udržuje buffer minulých pozorování a akcí, které rámec využívá pro kondicionování. Rámec DIAMOND pak spojuje tato minulá pozorování s následujícími šumovými pozorováními a vstupními akcemi prostřednictvím adaptivních skupinových normalizačních vrstev v reziduálních blocích U-Net.

DIAMOND: Experimenty a Výsledky

Pro komplexní hodnocení, rámec DIAMOND volí Atari 100k benchmark. Atari 100k benchmark se skládá z 26 her, které jsou navrženy pro testování širokého spektra schopností agenta. V každé hře je agent omezen na 100k akcí v prostředí, což je přibližně ekvivalentní 2 hodinám lidské hry, aby se naučil hru před hodnocením. Pro srovnání, neomezené agenty Atari typicky trénují 50 milionů kroků, což představuje 500násobné zvýšení zkušeností. Školovali jsme DIAMOND od začátku pomocí 5 náhodných semen pro každou hru. Každý tréninkový běh vyžadoval přibližně 12 GB VRAM a trval přibližně 2,9 dny na jediném Nvidia RTX 4090, což představuje 1,03 GPU roku celkem. Následující tabulka poskytuje skóre pro všechny hry, průměr a IQM nebo interkvartilní průměr humanizovaných skórů.

Následující obrázek srovnává jednostupňové (horní řádek) a vícestupňové (spodní řádek) vzorkování v Boxingu. Pohyby černého hráče jsou nepředvídatelné, což vede k tomu, že jednostupňové vyhlazování interpoluje mezi možnými výsledky, vedoucí k rozmazaným předpovědím. Naopak, vícestupňové vzorkování produkuje jasný obraz, směrující generaci směrem k specifickému módu. Zajímavé je, že, protože politika kontroluje bílého hráče, jeho akce jsou známy modelu světa, eliminující ambiguitu. Proto, jak jednostupňové, tak vícestupňové vzorkování správně předpovídají pozici bílého hráče.

V výše uvedeném obrázku, trajektorie představené DIAMONDEM obecně vykazují vyšší vizuální kvalitu a jsou věrnější skutečnému prostředí ve srovnání s těmi, které jsou představeny IRIS. Trajektorie generované IRIS obsahují vizuální nesrovnalosti mezi snímky (zvýrazněny bílými rámečky), jako jsou nepřátelé zobrazení jako odměny a naopak. Ačkoli tyto nesrovnalosti mohou ovlivnit pouze několik pixelů, mohou mít významný dopad na učení s posilováním. Například, agent typicky cílí na odměny a vyhýbá se nepřátelům, takže tyto malé vizuální nesrovnalosti mohou učinit obtížnější naučit se optimální politiku. Obrázek ukazuje po sobě jdoucí snímky představené IRIS (vlevo) a DIAMONDEM (vpravo). Bílé rámečky zvýrazňují nesrovnalosti mezi snímky, které se objevují pouze v trajektoriích generovaných IRIS.

Závěr

V tomto článku, jsme mluvili o DIAMONDU, agentovi učení s posilováním, který je školen v difuzním modelu světa. Rámec DIAMOND dělá pečlivé návrhové volby, aby zajistil, že jeho difuzní model světa zůstává efektivní a stabilní přes dlouhé časové horizonty. Rámec poskytuje kvalitativní analýzu, aby demonstroval důležitost těchto návrhových voleb. DIAMOND stanoví nový stav umění s průměrným lidským normalizovaným skóre 1,46 na dobře etablovaném Atari 100k benchmarku, nejvyšší pro agenty školené entirely v modelu světa. Provoz v obrazovém prostoru umožňuje difuznímu modelu světa DIAMONDu nahradit prostředí bezproblémově, nabízející větší vhled do chování modelu světa a agenta. Značně, vylepšený výkon v určitých hrách je připsán lepšímu modelování kritických vizuálních detailů. Rámec DIAMOND modeluje prostředí jako standardní POMDP nebo Částečně Pozorovatelný Markovský Proces s množinou stavů, množinou diskrétních akcí a množinou obrazových pozorování. Přechodové funkce popisují dynamiku prostředí a odměňovací funkce mapuje přechody na skalární odměny.

Kunal Kejriwal je backendový inženýr specializující se na Python, PostgreSQL, Redis a cloudovou infrastrukturu na GCP a AWS. Má tři roky zkušeností s vývojem a škálováním produkčních systémů a píše o AI infrastruktuře, distribuovaných systémech a architektuře nasazování pracovních zátěží strojového učení.