AI-modeller och plattformar

AI-forskare skapar modell för videospel som kan komma ihåg tidigare händelser

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ett team av forskare på Ubers AI-laboratorium har nyligen utvecklat ett system av AI-algoritmer som överträffade både mänskliga spelare och andra AI-system i klassiska Atari-videospel. Det AI-system som utvecklats av forskarna kan komma ihåg tidigare lyckade strategier och skapa nya strategier baserat på vad som fungerade i det förflutna. Studiens forskningsteam tror att de algoritmer de utvecklat har potential att användas inom andra tekniska områden som språkbehandling och robotik.

Den vanliga metoden för att skapa AI-system som kan spela videospel är att använda en förstärkningsinlärningsalgoritm. Förstärkningsinlärningsalgoritmer lär sig att utföra en uppgift genom att utforska en mängd möjliga åtgärder, och efter varje åtgärd får de en typ av förstärkning (en belöning eller bestraffning). Med tiden lär sig AI-modellen vilka åtgärder som leder till större belöningar, och den blir mer benägen att utföra dessa åtgärder. Tyvärr har förstärkningsinlärningsmodeller problem när de stöter på datapunkter som inte är konsekventa med andra i datamängden.

Enligt forskningsteamet är anledningen till att deras tillvägagångssätt inte har övervägts av andra AI-forskare att strategin skiljer sig från den “inre motivation” som vanligtvis används i förstärkningsinlärning. Problemet med en inre motivationsansats är att modellen kan vara benägen att “glömma” potentiellt belönande områden som fortfarande förtjänar att utforskas. Detta fenomen kallas “avkoppling”. Som en följd kan modellen glömma områden som fortfarande bör utforskas när den stöter på oväntade data.

Enligt TechXplore satte forskningsteamet upp ett mål att skapa en inlärningsmodell som var mer flexibel och kunde svara på oväntade data. Forskarna övervann detta problem genom att införa en algoritm som kunde komma ihåg alla åtgärder som tidigare versioner av modellen hade tagit när den försökte lösa ett problem. När AI-modellen stöter på en datapunkt som inte är konsekvent med vad den har lärt sig hittills, kontrollerar den sin minneskarta. Modellen identifierar sedan vilka strategier som lyckades och misslyckades och väljer strategier på lämpligt sätt.

När modellen spelar ett videospel samlar den in skärmdumpar av spelet medan den spelar, och skapar en logg över sina åtgärder. Bilderna grupperas tillsammans baserat på likhet, och bildar tydliga punkter i tiden som modellen kan hänvisa till. Algoritmen kan använda de loggade bilderna för att återvända till en intressant punkt i tiden och fortsätta utforska från där.

Som förklarats av BBC finns det också problemet med att hantera farliga scenarier för AI-agenten som spelar spelet. Om agenten springer in i en fara som kan döda den, skulle det förhindra den från att återvända till områden som förtjänar mer utforskning, ett problem som kallas “avspåring”. AI-modellen hanterar avspåring genom en separat process från den som används för att uppmuntra utforskning av gamla områden.

Forskningsteamet lät modellen spela igenom 55 Atari-spel. Dessa spel används vanligtvis för att benchmarka prestandan hos AI-modeller, men forskarna lade till en twist för sin modell. Forskarna införde ytterligare regler i spelen, och instruerade modellen att inte bara uppnå den högsta poängen möjligt, utan också att försöka uppnå en ännu högre poäng varje gång. När resultaten av modellens prestanda analyserades, fann forskarna att deras AI-system överträffade andra AI-system i spelen cirka 85 procent av tiden. AI-modellen presterade särskilt bra i spelet Montezuma’s Revenge, ett plattformsspel där spelaren undviker faror och samlar på sig skatter. Spelet slog rekordet för en mänsklig spelare och poängade också högre än något annat AI-system har.

Enligt Uber AI-forskarna har de strategier som forskningsteamet använde potential att användas inom industrier som robotik. Robotar har nytta av förmågan att komma ihåg vilka åtgärder som var lyckade, vilka som inte fungerade och vilka som inte har provats ännu.

Blogger och programmerare med specialområden inom Machine Learning och Deep Learning ämnen. Daniel hoppas på att hjälpa andra att använda kraften från AI för socialt väl.