AI-modeller og platforme

DeepMind og Google Brain sigter mod at oprette metoder til at forbedre effektiviteten af forstærkninglæring

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forstærkninglæringssystemer kan være kraftfulde og robuste, i stand til at udføre ekstremt komplekse opgaver gennem tusinder af iterationer af træning. Mens forstærkninglæreningsalgoritmer er i stand til at aktivere sofistikerede og lejlighedsvis overraskende adfærd, tager de lang tid at træne og kræver enorme mængder data. Disse faktorer gør forstærkninglæringsteknikker ret ineffektive, og nyligt har forskningsteams fra Alphabet (GOOG ) (GOOGL ) DeepMind og Google Brain forsøgt at finde mere effektive metoder til at oprette forstærkninglæringssystemer.

Som rapporteret af VentureBeat, foreslog den kombinerede forskningsgruppe nyligt metoder til at gøre forstærkninglæringstræning mere effektiv. En af de foreslåede forbedringer var en algoritme kaldet Adaptive Behavior Policy Sharing (ABPS), mens den anden var et framework kaldet Universal Value Function Approximators (UVFA). ABPS låter pools af AI-agenter dele deres adaptivt valgte erfaringer, mens UVFA låter disse AI-agenter samtidig undersøge rettet eksplorationspolitik.

ABPS er beregnet til at fremskynde tilpasningen af hyperparametre, når man træner en model. ABPS gør det hurtigere at finde de optimale hyperparametre ved at låte flere forskellige agenter med forskellige hyperparametre dele deres adfærds politik-erfaringer. For at være mere præcis, låter ABPS forstærkninglæring-agenter vælge handlinger fra de handlinger, som en politik har vurderet som okay, og derefter gives en belønning og observation baseret på den efterfølgende tilstand.

AI-forstærkning-agenter trænes med forskellige kombinationer af mulige hyperparametre, som f.eks. decay rate og learning rate. Når man træner en model, er målet, at modellen konvergerer på den kombination af hyperparametre, der giver den bedste præstation, og i dette tilfælde også forbedrer dataeffektiviteten. Effektiviteten øges ved at træne mange agenter på én gang og vælge adfærden af kun én agent til at blive udrullet under den næste tidsstep. Politikken, som målagenten har, bruges til at sample handlinger. Overgangene logges derefter i et fælles rum, og dette rum vurderes konstant, så politikvalg ikke behøver at ske så ofte. Ved afslutningen af træningen vælges en ensemble af agenter, og de bedst præsterende agenter vælges til at undergå endelig udrulning.

I forhold til UVFA, forsøger det at tackle en af de almindelige problemer med forstærkninglæring, nemlig at svagt forstærkede agenter ofte ikke lærer opgaver. UVFA forsøger at løse problemet ved at låte agenten lære en separat sæt af udnyttelses- og eksplorationspolitikker på samme tid. Adskillelsen af opgaver skaber et framework, der låter eksplorationspolitikkerne fortsætte med at udforske miljøet, mens udnyttelsespolitikkerne fortsætter med at prøve at maksimere belønningen for den aktuelle opgave. Eksplorationspolitikkerne i UVFA fungerer som en baseline-arkitektur, der vil fortsætte med at forbedre sig, selv om der ikke er naturlige belønninger, der findes. I en sådan situation approximeres en funktion, der svarer til intrinsiske belønninger, hvilket driver agenten til at udforske alle tilstande i et miljø, selv om den ofte returnerer til velkendte tilstande.

Som VentureBeat forklarede, når UVFA-frameworket er i spil, gives de intrinsiske belønninger i systemet direkte til agenten som inputs. Agenten holder derefter styr på en repræsentation af alle inputs (såsom belønninger, handlinger og tilstand) under en given episode. Resultatet er, at belønningen bevares over tid, og agentens politik er i hvert fald noget informeret af den på alle tidspunkter.

Dette opnås ved hjælp af en “episodisk nytænkning” og en “livslang nytænkning”-modul. Funksjonen af den første modul er at holde den aktuelle, episodiske hukommelse og kortlægge de aktuelle fund til den tidligere nævnte repræsentation, hvilket låter agenten bestemme en intrinsisk episodisk belønning for hvert træningsstep. Derefter føjes den tilstandslinked med den aktuelle observation til hukommelsen. Mens “livslang nytænkning”-modulen er ansvarlig for at påvirke, hvor ofte agenten udforsker over mange episoder.

Ifølge Alphabet/Google-holdene har de nye træningsteknikker allerede demonstreret potentialet for betydelige forbedringer under træning af et forstærkninglæringssystem. UVFA var i stand til at fordoble præstationen af nogle af de grundlæggende agenter, der spillede forskellige Atari-spil. Mens ABPS var i stand til at forbedre præstationen på nogle af de samme Atari-spil, reducerede variansen blandt de bedst præsterende agenter med cirka 25%. UVFA-trænet algoritme var i stand til at opnå et højt score i Pitfall på egen hånd, uden nogen konstruerede funktioner af menneskelige demos.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.