Modely a platformy AI

DeepMind uvádí novou metodu školení učení s posilováním AI bezpečně

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Učení s posilováním je slibnou cestou vývoje umělé inteligence, která produkuje AI schopné zvládat extrémně složité úkoly. Algoritmy učení s posilováním se používají při vytváření mobilních robotických systémů a samořiditelných aut mezi jinými aplikacemi. Nicméně, kvůli tomu, jak je učení s posilováním školené, mohou občas manifestovat podivné a neočekávané chování. Tato chování mohou být nebezpečná a výzkumníci AI se na tento problém odkazují jako na “problém bezpečného průzkumu”, kde se AI zasekne v průzkumu nebezpečných stavů.

Nedávno laboratoř Google (GOOGL ) pro výzkum AI DeepMind vydala článek, který navrhuje nové metody pro řešení problému bezpečného průzkumu a školení učení s posilováním v bezpečnějším způsobem. Metoda navrhovaná DeepMindem také opravuje odměňovací hackování nebo mezery v kritériích odměn.

Nová metoda DeepMindu má dva různé systémy určené k vedení chování AI v situacích, kde by mohlo vzniknout nebezpečné chování. Tyto dva systémy používané technikou školení DeepMindu jsou generativní model a model dopředné dynamiky. Oba tyto modely jsou školeny na různých datech, jako jsou demonstrace odborníky na bezpečnost a zcela náhodné vozidlové trajektorie. Data jsou označena supervizorem s konkrétními hodnotami odměn a agent AI se naučí rozpoznávat vzorce chování, které mu umožní získat největší odměnu. Nebezpečné stavy jsou také označeny a jednou, co model úspěšně předpoví odměny a nebezpečné stavy, je nasazen k provedení cílených akcí.

Výzkumný tým vysvětluje v článku, že myšlenka spočívá v tom, vytvořit možné chování od začátku, navrhnout požadované chování a mít tyto hypotetické scénáře co nejvíce informativní, zatímco současně se vyhnout přímému zásahu do prostředí učení. Tým DeepMindu se na tento přístup odkazuje jako ReQueST, nebo syntéza dotazu odměny prostřednictvím optimalizace trajektorie.

ReQueST je schopný vést k čtyřem různým typům chování. První typ chování se snaží maximalizovat nejistotu ohledně souboru modelů odměn. Zatímco chování dva a tři se snaží minimalizovat a maximalizovat předpovězené odměny. Předpovězené odměny jsou minimalizovány, aby vedly k objevu chování, která model může nesprávně předpovídat. Na druhou stranu, předpovězená odměna je maximalizována, aby vedla k chování, která mají nejvyšší informační hodnotu. Nakonec, čtvrtý typ chování se snaží maximalizovat novost trajektorií, aby model pokračoval v průzkumu, bez ohledu na projekční odměny.

Jakmile model dosáhne požadované úrovně sběru odměn, používá se plánovací agent k rozhodování na základě naučených odměn. Tento model-předpovědní kontrolní schéma umožňuje agentům naučit se vyhnout nebezpečným stavům pomocí dynamického modelu a předpovídání možných důsledků, na rozdíl od chování algoritmů, které se učí pouze prostřednictvím pokusů a omylů.

Jak uvádí VentureBeat, výzkumníci DeepMindu věří, že jejich projekt je prvním systémem učení s posilováním, který se učí v kontrolovaném, bezpečném způsobem:

„Naše znalosti, ReQueST je prvním algoritmem modelování odměn, který bezpečně učí o nebezpečných stavech a škáluje na školení neuronových sítí modelů odměn v prostředích s vysokodimenzionálními, kontinuálními stavy. Dosud jsme prokázali účinnost ReQueST pouze v simulovaných doménách s relativně jednoduchou dynamikou. Jedním směrem pro budoucí práci je testovat ReQueST v 3D doménách s více realistickou fyzikou a dalšími agenty, kteří jednají v prostředí.”

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.