AI-modeller och plattformar
DeepMind rapporterar en ny metod för att träna förstärkt inlärning AI på ett säkert sätt
Förstärkt inlärning är en lovande väg för AI-utveckling, som producerar AI som kan hantera extremt komplexa uppgifter. Förstärkt inlärningsalgoritmer används i skapandet av mobila robotiksystem och självkörande bilar, bland annat. Men på grund av hur förstärkt inlärning tränas, kan de ibland manifestera sig som underliga och oväntade beteenden. Dessa beteenden kan vara farliga, och AI-forskare kallar detta problem för “säker utforskning”-problemet, där AI:n fastnar i utforskningen av osäkra tillstånd.
Nyligen släppte Google (GOOGL ):s AI-forskningslaboratorium DeepMind en rapport som föreslog nya metoder för att hantera det säkra utforskningproblemet och träna förstärkt inlärning AI på ett säkrare sätt. Metoden som föreslogs av DeepMind korrektur för belöningshacking eller kryphål i belöningskriterierna.
DeepMinds nya metod har två olika system som är avsedda att styra AI:s beteende i situationer där osäkert beteende kan uppstå. De två systemen som används av DeepMinds träningsmetod är en generativ modell och en framåtriktad dynamisk modell. Båda modellerna tränas på en mängd data, såsom demonstrationer av säkerhetsexperter och helt slumpmässiga fordonstrajektorier. Datat märks av en handledare med specifika belöningsvärden, och AI-agenten kommer att lära sig mönster av beteenden som kommer att möjliggöra den att samla den största belöningen. De osäkra tillstånden har också märkts, och när modellen har lyckats förutsäga belöningar och osäkra tillstånd, deployeras den för att utföra de målinriktade åtgärderna.
Forskningsgruppen förklarar i rapporten att idén är att skapa möjliga beteenden från scratch, för att föreslå de önskade beteendena och för att ha dessa hypotetiska scenarier vara så informativa som möjligt, samtidigt som de undviker direkt inblandning i inlärningsmiljön. DeepMind-teamet kallar denna metod ReQueST, eller belöningsfrågesyntes via banaoptimering.
ReQueST kan leda till fyra olika typer av beteende. Den första typen av beteende försöker maximera osäkerheten gällande ensemble-belöningsmodeller. Medan beteende två och tre försöker minimera och maximera förutsagda belöningar. Förutsagda belöningar minimeras för att leda till upptäckten av beteenden som modellen kan vara felaktigt förutsäga. Å andra sidan maximeras den förutsagda belöningen för att leda till beteendemärkningar som besitter den högsta informationsvärdet. Slutligen försöker den fjärde typen av beteende maximera banans nyhet, så att modellen fortsätter att utforska oavsett de projicerade belöningarna.
När modellen har nått den önskade nivån av belöningsinsamling, används en planeringsagent för att fatta beslut baserat på de inlärda belöningarna. Denna modell-prediktiva kontrollschema låter agenter lära sig att undvika osäkra tillstånd genom att använda den dynamiska modellen och förutsäga möjliga konsekvenser, i kontrast till beteendet hos algoritmer som lär sig genom rent försök och misstag.
Som rapporterats av VentureBeat, tror DeepMind-forskarna att deras projekt är det första förstärkt inlärningssystemet som kan lära sig på ett kontrollerat och säkert sätt:
“Till vår kännedom är ReQueST den första belöningsmodelleringsalgoritmen som säkert lär sig om osäkra tillstånd och skaleras till att träna neuronnätverksbelöningsmodeller i miljöer med högdimensionella, kontinuerliga tillstånd. Hittills har vi bara demonstrerat effektiviteten av ReQueST i simulerade domäner med relativt enkla dynamiska. En riktning för framtida arbete är att testa ReQueST i 3D-domäner med mer realistiska fysik och andra agenter som agerar i miljön.”












