AI-modeller og plattformer
DeepMind rapporterer en ny metode for å trene forsterkingslæring AI trygt
Forsterkingslæring er en lovende vei for AI-utvikling, som produserer AI som kan håndtere ekstremt komplekse oppgaver. Forsterkingslæring algoritmer brukes i skapelsen av mobile robotikk-systemer og selvkjørende biler blant andre anvendelser. Imidlertid, på grunn av måten forsterkingslæring er trent, kan de av og til manifestere merkelige og uventede atferd. Disse atferdene kan være farlige, og AI-forskere refererer til dette problemet som “sikker utforsking”-problemet, som er der AI blir fast i utforskingen av usikre tilstander.
Nylig ga Google (GOOGL ) sin AI-forskningslab DeepMind ut en rapport som foreslo nye metoder for å håndtere det sikre utforsking-problemet og trene forsterkingslæring AI på en tryggere måte. Metoden foreslått av DeepMind korrigerte også for belønningshacking eller løp i belønningskriteriene.
DeepMinds nye metode har to forskjellige systemer som er ment å guide AI-atferden i situasjoner der usikker atferd kan oppstå. De to systemene brukt av DeepMinds treningsmetode er en generativ modell og en fremover-dynamisk modell. Begge disse modellene er trenet på en rekke data, som demonstrasjoner av sikkerhetseksperten og helt tilfeldige kjøretøysbevegelser. Dataene er merket av en overvåker med spesifikke belønningverdier, og AI-agenten vil plukke opp mønster av atferd som vil enable det å samle den største belønningen. De usikre tilstandene er også merket, og når modellen har klart å forutsi belønninger og usikre tilstander, blir den deployert for å utføre de målrettede handlingene.
Forskningsgruppen forklarer i rapporten at ideen er å skape mulige atferd fra scratch, å foreslå de ønskede atferdene, og å ha disse hypotetiske scenariene være så informative som mulig samtidig som de unngår direkte innblanding med læringsmiljøet. DeepMind-teamet refererer til denne tilnærmingen som ReQueST, eller belønningsspørsmål-syntese via trajektorioptimisering.
ReQueST er i stand til å føre til fire forskjellige typer atferd. Den første type atferd prøver å maksimere usikkerheten med hensyn til ensemblet av belønningmodeller. Mens atferd to og tre prøver å både minimere og maksimere forutsagte belønninger. Forutsagte belønninger blir minimert for å føre til oppdagelsen av atferd som modellen kan være feil i å forutsi. På den andre siden, blir forutsagte belønninger maksimert for å føre til atferd som har den høyeste informasjonsverdien. Til slutt prøver den fjerde type atferd å maksimere nyskapningen av trajektorier, slik at modellen fortsetter å utforske uavhengig av belønningene som projiseres.
Når modellen har nådd det ønskede nivået av belønningssamling, brukes en planleggingsagent til å ta beslutninger basert på de lært belønningene. Denne modell-prediktive kontrollskjema lar agenter lære å unngå usikre tilstander ved å bruke den dynamiske modellen og forutsi mulige konsekvenser, i motsetning til atferden til algoritmer som lærer gjennom ren prøving og feiling.
Som rapportert av VentureBeat, tror DeepMind-forskerne at deres prosjekt er det første forsterkingslæringssystemet som kan lære på en kontrollert og trygg måte:
“Til vår kjennskap er ReQueST det første belønningmodell-algoritmen som trygt lærer om usikre tilstander og skalerer til å trene neurale nettverksbelønningmodeller i miljøer med høydimensjonale, kontinuerlige tilstander. Så langt har vi bare demonstrert effektiviteten av ReQueST i simuleringsdomener med relativt enkle dynamikker. En retning for fremtidig arbeid er å teste ReQueST i 3D-domener med mer realistiske fysikk og andre agenter som handler i miljøet.”












