AI-modellen en platforms
Onderzoekers van AI creëren een model voor het spelen van videospellen dat zich vorige gebeurtenissen kan herinneren

Een team van onderzoekers bij het AI-lab van Uber heeft onlangs een systeem van AI-algoritmen ontwikkeld dat zowel menselijke spelers als andere AI-systemen overtrof bij klassieke Atari-videospellen. Het AI-systeem dat door de onderzoekers is ontwikkeld, is in staat om eerder succesvolle strategieën te onthouden, nieuwe strategieën te creëren op basis van wat in het verleden werkte. Het onderzoek van het onderzoeksteam gelooft dat de algoritmen die ze hebben ontwikkeld, potentieel toepasbaar zijn in andere technische velden zoals taalverwerking en robotica.
De typische methode om AI-systemen te creëren die in staat zijn om videospellen te spelen, is om een versterkingsleeralgoritme te gebruiken. Versterkingsleeralgoritmen leren hoe ze een taak kunnen uitvoeren door een reeks van mogelijke acties te verkennen, en na elke actie worden ze voorzien van een soort versterking (een beloning of straf). Na verloop van tijd leert het AI-model welke acties tot grotere beloningen leiden, en wordt het waarschijnlijker dat het deze acties uitvoert. Helaas lopen versterkingsleermodellen tegen problemen aan wanneer ze geconfronteerd worden met gegevenspunten die incongruent zijn met andere in de dataset.
Volgens het onderzoeksteam is de reden dat hun aanpak nog niet door andere AI-onderzoekers is overwogen, dat de strategie afwijkt van de “intrinsieke motivatie”-aanpak die typisch wordt gebruikt in versterkingsleer. Het probleem met een intrinsieke motivatie-aanpak is dat het model gevoelig kan zijn voor “vergeten” van potentieel belonende gebieden die nog steeds onderzocht moeten worden. Dit fenomeen wordt “loskoppeling” genoemd. Als gevolg hiervan kan het model, wanneer het onverwachte gegevens tegenkomt, vergeten over gebieden die nog steeds onderzocht moeten worden.
Volgens TechXplore heeft het onderzoeksteam een leermodel willen creëren dat flexibeler was en in staat was om te reageren op onverwachte gegevens. De onderzoekers losten dit probleem op door een algoritme te introduceren dat alle acties van een eerder model kon onthouden toen het probeerde een probleem op te lossen. Wanneer het AI-model een gegevenspunt tegenkomt dat niet consistent is met wat het tot nu toe heeft geleerd, controleert het model zijn geheugenkaart. Het model zal dan identificeren welke strategieën succesvol waren en welke niet, en strategieën dienovereenkomstig kiezen.
Wanneer het model een videospel speelt, verzamelt het screenshots van het spel terwijl het speelt, en maakt het een log van zijn acties. De afbeeldingen worden gegroepeerd op basis van overeenkomst, waardoor duidelijke punten in de tijd ontstaan waarop het model kan terugkijken. Het algoritme kan de geregistreerde afbeeldingen gebruiken om terug te keren naar een interessant punt in de tijd en van daaruit verder te verkennen. Wanneer het model ontdekt dat het verliest, zal het terugkijken naar de gemaakte screenshots en een andere strategie proberen.
Zoals uitgelegd door de BBC, is er ook het probleem van het omgaan met gevaarlijke scenario’s voor het AI-agent dat het spel speelt. Als de agent een gevaar tegenkomt dat het kan doden, zou dat voorkomen dat het terugkeert naar gebieden die verdere verkenning verdienen, een probleem dat “ontsporing” wordt genoemd. Het AI-model lost ontsporingproblemen op via een apart proces van het proces dat wordt gebruikt om de verkenning van oude gebieden aan te moedigen.
Het onderzoeksteam liet het model 55 Atari-spellen spelen. Deze spellen worden vaak gebruikt om de prestaties van AI-modellen te benchmarken, maar de onderzoekers voegden een twist toe aan hun model. De onderzoekers voegden extra regels toe aan de spellen, waarbij het model werd geïnstrueerd om niet alleen de hoogste score te behalen, maar ook om elke keer een hogere score te behalen. Toen de resultaten van de prestaties van het model werden geanalyseerd, ontdekte het onderzoeksteam dat hun AI-systeem andere AI’s overtrof bij de spellen ongeveer 85% van de tijd. Het AI-model presteerde vooral goed bij het spel Montezuma’s Revenge, een platformspel waarin de speler gevaarlijke situaties ontwijkt en schatten verzamelt. Het spel versloeg het record van een menselijke speler en scoorde hoger dan enig ander AI-systeem.
Volgens de Uber AI-onderzoekers hebben de strategieën die door het onderzoeksteam zijn gebruikt, toepassingen in industrieën zoals robotica. Robots profiteren van de mogelijkheid om te onthouden welke acties succesvol waren, welke niet werkten en welke nog niet zijn geprobeerd.












