AI-modellen en platforms

DeepMind en Google Brain streven naar methoden om de efficiëntie van versterking lerende modellen te verbeteren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Versterking lerende systemen kunnen krachtig en robuust zijn, in staat om extreem complexe taken uit te voeren door duizenden iteraties van training. Terwijl versterking lerende algoritmen in staat zijn om geavanceerd en soms verrassend gedrag mogelijk te maken, nemen ze veel tijd in beslag om te trainen en vereisen ze enorme hoeveelheden gegevens. Deze factoren maken versterking lerende technieken vrij inefficiënt, en onlangs hebben onderzoeksteams van Alphabet (GOOG ) (GOOGL ) DeepMind en Google Brain geprobeerd om efficiëntere methoden te vinden om versterking lerende systemen te creëren.

Volgens VentureBeat heeft de gecombineerde onderzoeksgroep onlangs methoden voorgesteld om de training van versterking lerende modellen efficiënter te maken. Een van de voorgestelde verbeteringen was een algoritme genaamd Adaptive Behavior Policy Sharing (ABPS), terwijl de andere een framework was genaamd Universal Value Function Approximators (UVFA). ABPS laat pools van AI-agents hun adaptief geselecteerde ervaringen delen, terwijl UVFA hen tegelijkertijd toelaat om gerichte exploratiebeleidsregels te onderzoeken.

ABPS is bedoeld om de aanpassing van hyperparameters te versnellen bij het trainen van een model. ABPS maakt het vinden van de optimale hyperparameters sneller door meerdere agents met verschillende hyperparameters toe te laten hun beleidservaringen te delen. Om precies te zijn, laat ABPS versterking lerende agents acties selecteren uit acties die een beleid heeft goedgekeurd en vervolgens wordt een beloning en observatie op basis van de volgende staat toegekend.

AI-versterking agents worden getraind met verschillende combinaties van mogelijke hyperparameters, zoals decay rate en learning rate. Bij het trainen van een model is het doel dat het model convergeert naar de combinatie van hyperparameters die het de beste prestaties levert, en in dit geval ook de data-efficiëntie verbetert. De efficiëntie wordt verhoogd door meerdere agents tegelijk te trainen en de gedraging van slechts één agent te selecteren om te worden ingezet tijdens de volgende tijdstap. Het beleid dat de doelagent heeft, wordt gebruikt om acties te selecteren. De overgangen worden vervolgens in een gedeelde ruimte geregistreerd, en deze ruimte wordt constant geëvalueerd zodat beleidsselectie niet zo vaak hoeft plaats te vinden. Aan het einde van de training wordt een ensemble van agents geselecteerd en worden de top-presterende agents geselecteerd om de finale inzet te ondergaan.

Wat UVFA betreft, probeert het een van de veelvoorkomende problemen van versterking lerende modellen aan te pakken, namelijk dat zwak versterkte agents vaak taken niet leren. UVFA probeert dit probleem op te lossen door de agent een aparte set van exploitatie- en exploratiebeleidsregels tegelijk te laten leren. Het scheiden van de taken creëert een framework dat het mogelijk maakt voor de exploratiebeleidsregels om de omgeving te blijven verkennen, terwijl de exploitatiebeleidsregels proberen de beloning voor de huidige taak te maximaliseren. De exploratiebeleidsregels van UVFA dienen als een basisarchitectuur die zal blijven verbeteren, zelfs als er geen natuurlijke beloningen worden gevonden. In een dergelijke situatie wordt een functie die overeenkomt met intrinsieke beloningen, benaderd, die de agents aanzet om alle staten in een omgeving te verkennen, zelfs als ze vaak terugkeren naar vertrouwde staten.

Volgens VentureBeat worden, wanneer het UVFA-framework in werking is, de intrinsieke beloningen van het systeem rechtstreeks aan de agent gegeven als invoer. De agent houdt vervolgens een weergave van alle invoer (zoals beloningen, acties en staten) tijdens een bepaalde episode bij. Het resultaat is dat de beloning over tijd wordt behouden en het beleid van de agent ten minste enigszins wordt geïnformeerd door het.

Dit wordt bereikt met behulp van een “episodische nieuwheid” en een “levenslange nieuwheid” module. De functie van de eerste module is om het huidige, episodische geheugen te behouden en de huidige bevindingen toe te wijzen aan de eerder genoemde weergave, waardoor de agent een intrinsieke episodische beloning voor elke trainingsstap kan bepalen. Vervolgens wordt de staat die is gekoppeld aan de huidige observatie, toegevoegd aan het geheugen. Ondertussen is de levenslange nieuwheidmodule verantwoordelijk voor het beïnvloeden van hoe vaak de agent de omgeving verkent over een lange periode.

Volgens de Alphabet/Google-teams hebben de nieuwe trainingsmethoden al het potentieel getoond voor een aanzienlijke verbetering bij het trainen van een versterking lerende systeem. UVFA was in staat om de prestaties van sommige basisagents te verdubbelen die verschillende Atari-spellen speelden. Ondertussen was ABPS in staat om de prestaties van sommige van dezelfde Atari-spellen te verbeteren, de variantie onder de top-presterende agents te verlagen met ongeveer 25%. Het UVFA-getrainde algoritme was in staat om een hoge score te behalen in Pitfall op zichzelf, zonder enige door de mens ontworpen functies van menselijke demos.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.