AI-modeller og platforme
DeepMind rapporterer en ny metode til sikker træning af forstærkninglærings-AI
Forstærkninglærning er en lovende vej for AI-udvikling, der producerer AI, der kan håndtere ekstremt komplekse opgaver. Forstærkningsalgoritmer bruges til oprettelse af mobile robotiksystemer og selvkørende biler blandt andre anvendelser. Dog kan forstærknings-AI på grund af træningsmetoden af og til manifestere bizarre og uventede adfærdsmønstre. Disse adfærdsmønstre kan være farlige, og AI-forskere henviser til dette problem som “sikker udviklingsproblemet”, hvor AI’en fastlåser i udspekulerede tilstande.
For nylig offentliggjorde Google’s AI-forskningslaboratorium DeepMind en artikel, der foreslog nye metoder til at tackle sikkerhedsudviklingsproblemet og træne forstærkninglærings-AI på en sikrere måde. Metoden foreslået af DeepMind korrekturerer også for belønningshacking eller løkker i belønningskriterierne.
DeepMinds nye metode har to separate systemer, der er designet til at guide AI’ens adfærd i situationer, hvor usikker adfærd kan opstå. De to systemer, der bruges af DeepMinds træningsteknik, er en generativ model og en fremadrettede dynamisk model. Begge modeller er trænet på en række data, såsom demonstrationer af sikkerhedseksperter og fuldstændigt tilfældige køretøjsbaner. Dataene er mærket af en supervisor med bestemte belønningsværdier, og AI-agenten vil opfange mønstre af adfærd, der vil enable det at samle den største belønning. De usikre tilstande er også mærket, og når modellen har kunnet forudsige belønnings- og usikre tilstande, deployeres den til at udføre de målrettede handlinger.
Forskningsholdet forklarer i artiklen, at idéen er at skabe mulige adfærdsmønstre fra scratch, at foreslå de ønskede adfærdsmønstre og at have disse hypotetiske scenarier være så informative som muligt, samtidig med at de undgår direkte indgriben i læringsmiljøet. DeepMind-holdet henviser til denne tilgang som ReQueST, eller belønningsforespørgsel via baneeoptimering.
ReQueST kan føre til fire forskellige typer adfærd. Den første type adfærd forsøger at maksimere usikkerheden omkring ensemble-belønningsmodeller. Imens forsøger adfærd nummer to og tre at minimere og maksimere forudsigede belønningsværdier. Forudsigede belønningsværdier minimiseres for at føre til opdagelsen af adfærd, som modellen muligvis forkert forudsiger. På den anden side maksimeres forudsigede belønningsværdier for at føre til adfærdsmærker, der besidder den højeste informationsværdi. Endelig forsøger den fjerde type adfærd at maksimere nytten af baner, så modellen kan fortsætte med at udforske, uanset de projekterede belønningsværdier.
Når modellen har nået det ønskede niveau af belønningsindsamling, bruges en planlægningsagent til at træffe beslutninger baseret på de lærende belønningsværdier. Dette modelprædiktive kontrolsystem låter agenterne lære at undgå usikre tilstande ved at bruge den dynamiske model og forudsige mulige konsekvenser, i modsætning til adfærdsmønstrene hos algoritmer, der lærer gennem ren prøvning og fejl.
Som rapporteret af VentureBeat, mener DeepMind-forskere, at deres projekt er det første forstærkninglæringsystem, der kan lære på en kontrolleret og sikker måde:
“Ifølge vores viden er ReQueST den første belønningsmodelalgoritme, der sikkert lærer om usikre tilstande og kan skalere til træning af neurale netværksbelønningsmodeller i miljøer med højdimensionelle, kontinuerte tilstande. Indtil nu har vi kun demonstreret effektiviteten af ReQueST i simulerede domæner med relativt simple dynamikker. En fremtidig arbejdsretning er at teste ReQueST i 3D-domæner med mere realistiske fysik og andre agenter, der handler i miljøet.”












