AI-modellen en platforms
DeepMind rapporteert nieuwe methode voor het trainen van versterkingsleren AI op een veilige manier
Versterkingsleren is een veelbelovende richting in de ontwikkeling van AI, waardoor AI kan omgaan met extreem complexe taken. Versterkingsalgoritmen voor AI worden gebruikt bij de creatie van mobiele robotica-systemen en zelfrijdende auto’s, onder andere. Echter, vanwege de manier waarop versterkings-AI getraind wordt, kunnen ze soms vreemde en onverwachte gedragingen vertonen. Deze gedragingen kunnen gevaarlijk zijn en AI-onderzoekers noemen dit probleem het “veilige exploratie”-probleem, waarbij de AI vast komt te zitten in de exploratie van onveilige staten.
Onlangs heeft Google’s AI-onderzoekscentrum DeepMind een paper gepubliceerd waarin nieuwe methoden worden voorgesteld voor het omgaan met het veilige exploratieprobleem en het trainen van versterkingsleren AI op een veiligere manier. De methode die door DeepMind wordt voorgesteld, corrigeert ook voor beloningshacken of lussen in de beloningscriteria.
DeepMind’s nieuwe methode heeft twee verschillende systemen die bedoeld zijn om het gedrag van de AI te leiden in situaties waarin onveilig gedrag kan ontstaan. De twee systemen die door DeepMind’s trainingsmethode worden gebruikt, zijn een generatief model en een voorwaartse dynamisch model. Beide modellen worden getraind op een verscheidenheid aan gegevens, zoals demonstraties door veiligheidsexperts en compleet willekeurige voertuigtrajecten. De gegevens worden gelabeld door een supervisor met specifieke beloningswaarden en de AI-agent zal patronen van gedrag oppikken die het mogelijk maken om de grootste beloning te verzamelen. De onveilige staten zijn ook gelabeld en zodra het model erin geslaagd is om beloningen en onveilige staten succesvol te voorspellen, wordt het ingezet om de gerichte acties uit te voeren.
Het onderzoeksteam legt in het paper uit dat het idee is om mogelijke gedragingen van scratch te creëren, om het gewenste gedrag voor te stellen en om deze hypothetische scenario’s zo informatief mogelijk te maken, zonder directe inmenging in de leeromgeving. Het DeepMind-team noemt deze benadering ReQueST, of beloningsvraag-synthese via trajectoptimalisatie.
ReQueST kan leiden tot vier verschillende soorten gedrag. Het eerste type gedrag probeert de onzekerheid over ensemble-beloningsmodellen te maximaliseren. Ondertussen proberen gedrag twee en drie zowel de voorspelde beloningen te minimaliseren als te maximaliseren. Voorspelde beloningen worden geminimaliseerd om de ontdekking van gedragingen te leiden die het model mogelijk incorrect voorspelt. Aan de andere kant wordt de voorspelde beloning gemaximaliseerd om gedraglabels te verkrijgen met de hoogste informatiewaarde. Ten slotte probeert het vierde type gedrag de nieuwheid van trajecten te maximaliseren, zodat het model blijft exploreren ongeacht de voorspelde beloningen.
Zodra het model het gewenste niveau van beloningsverzameling heeft bereikt, wordt een planningsagent gebruikt om beslissingen te nemen op basis van de geleerde beloningen. Deze model-predicatieve controle-scheme laat agents leren om onveilige staten te vermijden door het dynamische model te gebruiken en de mogelijke gevolgen te voorspellen, in tegenstelling tot de gedragingen van algoritmen die leren door pure trial en error.
Zoals gerapporteerd door VentureBeat, geloven de onderzoekers van DeepMind dat hun project het eerste versterkingsleren-systeem is dat in staat is om te leren in een gecontroleerde, veilige manier:
“Volgens onze kennis is ReQueST de eerste beloningsmodelleringsalgoritme die veilig leert over onveilige staten en schaalt tot het trainen van neurale netwerkbeloningsmodellen in omgevingen met hoge-dimensionale, continue staten. Tot nu toe hebben we alleen de effectiviteit van ReQueST aangetoond in gesimuleerde domeinen met relatief eenvoudige dynamica. Een richting voor toekomstig onderzoek is om ReQueST te testen in 3D-domeinen met meer realistische fysica en andere agenten die in de omgeving handelen.”












