AI-modeller og plattformer

AI-forskere utvikler videospillmodell som kan huske tidligere hendelser

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et team av forskere ved Ubers AI-laboratorium har nylig utviklet et system av AI-algoritmer som overgikk både menneskelige spillere og andre AI-systemer i klassiske Atari-videospill. AI-systemet utviklet av forskerne er i stand til å huske tidligere suksessfulle strategier og skape nye strategier basert på hva som fungerte tidligere. Studien sine forskerteam tror at algoritmene de har utviklet har potensielle anvendelser i andre tekniske felt som språkbehandling og robotikk.

Den typiske metoden som brukes for å skape AI-systemer som kan spille videospill er å bruke en forsterkingslæring-algoritme. Forsterkingslæring-algoritmer lærer hvordan de kan utføre en oppgave ved å utforske en rekke mulige handlinger, og etter hver handling, blir de gitt en type forsterkning (en belønning eller straff). Over tid, lærer AI-modellen hvilke handlinger som leder til større belønninger, og den blir mer sannsynlig til å utføre disse handlingene. Dessverre, møter forsterkingslæring-modeller vanskeligheter når de møter datapunkter som ikke er i overensstemmelse med andre i datasettet.

Ifølge forskerteamet, er grunnen til at deres tilnærming ikke hadde blitt vurdert av andre AI-forskere, er at strategien skiller seg fra den “innbygde motivasjon” -tilnærmingen som vanligvis brukes i forsterkingslæring. Problemet med en innbygd motivasjon-tilnærming er at modellen kan være utsatt for “glemsel” om potensielt belønnende områder som fortsatt fortjener å utforskes. Dette fenomenet kalles “avkobling”. Som en konsekvens, når modellen møter uventet data, kan den glemme områder som fortsatt bør utforskes.

Ifølge TechXplore, satte forskerteamet ut til å skape en læremodell som var mer fleksibel og kunne respondere på uventet data. Forskerne overvant dette problemet ved å introdusere en algoritme som kunne huske alle handlinger utført av en tidligere versjon av modellen når den prøvde å løse et problem. Når AI-modellen møter et datapunkt som ikke er i overensstemmelse med hva den har lært så langt, sjekker den sin minnekart. Modellen vil deretter identifisere hvilke strategier som lyktes og mislyktes og velge strategier på en passende måte.

Når modellen spiller et videospill, samler den skjermbilder av spillet mens det spilles, og lager en logg over sine handlinger. Bildene grupperes sammen basert på likhet, og danner klare punkter i tid som modellen kan referere tilbake til. Algoritmen kan bruke de loggete bildene til å returnere til et interessant punkt i tid og fortsette å utforske fra der. Når modellen finner ut at den taper, vil den referere tilbake til skjermbildene tatt og prøve en annen strategi.

Som forklart av BBC, er det også problemet med å håndtere farlige scenarioer for AI-agenten som spiller spillet. Hvis agenten møter en fare som kan drepe den, ville det forhindre den fra å returnere til områder som fortjener mer utforsking, et problem som kalles “avsporing”. AI-modellen håndterer avsporing-problemer gjennom en separat prosess fra den som brukes til å oppmuntre til utforsking av gamle områder.

Forskerlaget lot modellen spille gjennom 55 Atari-spill. Disse spillene brukes vanligvis til å benchmarkere ytelsen til AI-modeller, men forskerne la til en vending for deres modell. Forskerne introduserte ekstra regler til spillene, og instruerte modellen til ikke bare å oppnå den høyeste poengsummen mulig, men også å prøve å oppnå en enda høyere poengsum hver gang. Når resultater av modellens ytelse ble analysert, fant forskerne ut at deres AI-system overgikk andre AI-systemer i spillene omkring 85% av tiden. AI-en utførte spesielt godt i spillet Montezuma’s Revenge, et plattformspill hvor spilleren unngår farer og samler skatter. Spillet slo rekorden for en menneskelig spiller og også scoret høyere enn noen annen AI-system har.

Ifølge Uber AI-forskerne, har strategiene som ble brukt av forskerteamet potensielle anvendelser i industrier som robotikk. Robotene kan dra nytte av evnen til å huske hvilke handlinger som var suksessfulle, hvilke som ikke fungerte, og hvilke som ikke har blitt prøvd ennå.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.