AI-modeller og platforme

AI-forskere udvikler videospilspillende model, der kan huske tidligere begivenheder

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et hold af forskere på Ubers AI-laboratorium har nyligt udviklet et system af AI-algoritmer, der overgår både menneskelige spillere og andre AI-systemer i klassiske Atari-videospil. Det AI-system, som forskerne har udviklet, er i stand til at huske tidligere succesfulde strategier og oprette nye strategier baseret på, hvad der fungerede i fortiden. Studiet af forskningsholdet mener, at de algoritmer, de har udviklet, har potentiale i andre tekniske felter som sprogbehandling og robotteknik.

Den typiske metode, der bruges til at oprette AI-systemer, der kan spille videospil, er at bruge en forstærkningslæringsalgoritme. Forstærkningslæringsalgoritmer lærer, hvordan de kan udføre en opgave ved at udforske en række mulige handlinger, og efter hver handling gives de en form for forstærkning (en belønning eller straf). Over tid lærer AI-modellen, hvilke handlinger, der fører til større belønninger, og den bliver mere sandsynlig at udføre disse handlinger. Desværre løber forstærkningslæringsmodeller ind i problemer, når de støder på datapunkter, der er inkonsistente med andre datapunkter i datasættet.

Ifølge forskningsholdet er årsagen til, at deres tilgang ikke er blevet overvejet af andre AI-forskere, at strategien afviger fra den “intrinsiske motivation” tilgang, der typisk bruges i forstærkningslæring. Problemet med en intrinsisk motivation tilgang er, at modellen kan være tilbøjelig til at “glemme” om potentielt belønnende områder, der stadig fortjener at blive udforsket. Dette fænomen kaldes “afkobling”. Som følge heraf kan modellen, når den støder på uventede data, glemme områder, der stadig burde udforskes.

Ifølge TechXplore satte forskningsholdet sig for at oprette en læringsmodel, der var mere fleksibel og kunne reagere på uventede data. Forskerne overvandt dette problem ved at introducere en algoritme, der kunne huske alle handlinger, der var udført af en tidligere version af modellen, da den prøvede at løse et problem. Når AI-modellen støder på et datapunkt, der ikke er konsistent med, hvad den har lært indtil nu, kontrollerer modellen sin hukommelseskort. Modellen vil derefter identificere, hvilke strategier der lykkedes og mislykkedes, og vælge strategier herefter.

Når modellen spiller et videospil, indsamler den skærmbilleder af spillet, mens det spilles, og laver en log over sine handlinger. Billederne grupperes sammen baseret på lighed, og danner klare punkter i tid, som modellen kan referere til. Algoritmen kan bruge de loggede billeder til at vende tilbage til et interessant punkt i tid og fortsætte med at udforske derefter. Når modellen finder ud af, at den taber, vil den referere tilbage til de skærmbilleder, der er taget, og prøve en anden strategi.

Som forklaret af BBC er der også problemet med at håndtere farlige situationer for den AI-agent, der spiller spillet. Hvis agenten støder på en fare, der kan dræbe den, ville det forhindre den i at vende tilbage til områder, der fortjener mere udforskning, et problem kaldet “afsporing”. AI-modellen håndterer afsporingproblemer gennem en separat proces fra den, der bruges til at opmuntre til udforskning af gamle områder.

Forskningsholdet havde modellen spille gennem 55 Atari-spil. Disse spil bruges normalt til at benchmarkere AI-modellers præstation, men forskerne tilføjede en twist til deres model. Forskerne introducerede ekstra regler til spillet, og instruerede modellen til ikke kun at opnå den højeste score mulig, men også at prøve at opnå en endnu højere score hver gang. Når resultaterne af modellens præstation blev analyseret, fandt forskerne ud af, at deres AI-system overgik andre AI-systemer i spillet omkring 85% af tiden. AI-modellen udførte sig særlig godt i spillet Montezuma’s Revenge, et platformspil, hvor spilleren undgår farer og samler skatte. Spillet slog rekorden for en menneskelig spiller og scorede også højere end noget andet AI-system har.

Ifølge Uber AI-forskerne har de strategier, som forskningsholdet har brugt, anvendelser i industrier som robotteknik. Robotter har fordel af at kunne huske, hvilke handlinger der er succesfulde, hvilke der ikke virkede, og hvilke der endnu ikke er blevet prøvet.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.