AI-modeller og plattformer
DeepMinds nye AI kan lære reglene i et spill mens det spiller

Alphabets datterselskap DeepMind har nylig utviklet et AI-system som kan lære reglene i et spill mens det spiller. Mens DeepMind tidligere har laget imponerende AI-modeller som kan mestre spill som sjakk, shogi, go og videospill, måtte disse modellene være forsynt med reglene for spillet på forhånd. Derfor representerer DeepMinds nye AI en betydelig forbedring over tidligere AI-algoritmer som lærer å spille spill via forsterkning.
AI-System – MuZero
I en artikkel publisert i tidsskriftet Nature har DeepMind detaljert hvordan deres nye AI-system opererer. Det nye AI-systemet, kalt MuZero, kan lære reglene i et spill mens det spiller takket være en prinsipp kalt “look-ahead search”. Som rapportert av Engadget, bruker MuZero look-ahead search for å bestemme hvilke trekk som skal utføres basert på de mest sannsynlige responsene fra motstanderne.
Når man ser på alle mulige trekk som kan gjøres i spill som sjakk, kan MuZero prioritere og begrense trekkene til bare de mest sannsynlige og relevante trekkene. MuZero vil så lære av både vellykkede og mislykkede manøvrer. I stedet for å modellere alle mulige faktorer, tar den kun hensyn til faktorer som er mest relevante for avgjørelsen. MuZero tar i praksis de mange mulige variablene som kan vurderes og destillerer dem ned til bare de mest relevante og betydningsfulle egenskapene. Disse egenskapene representeres i en trebasert søkealgoritme. Mulighetene i treet kombineres deretter med en lært modell basert på egenskapene i testmiljøet. Look-ahead-søket utføres etter at de mest relevante aspektene av en miljø er identifisert.
For å komme til en endelig avgjørelse, vurderes tre faktorer.
MuZero vurderer resultatet av det foregående valget, den nåværende posisjonen det innehar, og de potensielle handlinger det kan utføre neste. Dette tilnærmingen slår ut tilnærmingene som tidligere er brukt av DeepMind, inkludert grunnleggende look-ahead-søk og trebaserte modeller. MuZero viste seg å være minst like god i sjakk, shogi og go som AlphaZero var, og når det spilte spillet Ms. Pac-Man, kunne MuZero bare vurdere rundt seks eller syv trekk om gangen. Til tross for denne begrensningen, var AI-en fortsatt i stand til å prestere ganske bra. DeepMind eksperimenterte også med MuZeros evner ved å begrense antallet simuleringer det kunne fullføre før det måtte binde seg til et trekk. Generelt presterte programmet bedre jo mer tid det fikk til å vurdere mulige trekk.
Den ledende forskningsscientisten i DeepMind, David Silver, forklarte via TechXplore at MuZero er den første AI-modellen som kan generere sin egen representasjon av reglene i en miljø, og bruke denne representasjonen til å planlegge handlinger.
“For første gang har vi faktisk et system som kan bygge sin egen forståelse av hvordan verden fungerer og bruke denne forståelsen til å gjøre denne sofistikerte look-ahead-planleggingen som du tidligere har sett for spill som sjakk,” sa Silver. “(MuZero) kan starte fra ingenting og bare gjennom prøving og feiling, både oppdage reglene i verden og bruke disse reglene til å oppnå en slags overmenneskelig prestasjon.”
Mulige Anvendelser
En AI som virkelig kan lære begrensningene i en oppgave og operere innenfor disse begrensningene, har en rekke mulige anvendelser. MuZero kan brukes til oppgaver som videokomprimering, som har vært vanskelig å automatisere med AI tidligere, på grunn av de mange forskjellige mulige videoformatene og komprimeringsmodusene. MuZero klarte å oppnå omtrent 5% komprimeringsforbedring. Dette kan ha implikasjoner for det store antallet videoer som er vertet av Google (GOOGL ) og YouTube. Foruten videoer ser DeepMind også på å bruke de samme MuZero-teknikkene for proteinarkitekturdesign og robotprogrammering.
Ifølge Wendy Hall, professor i datavitenskap ved University of Southampton, representerer MuZero “et betydelig skritt fremover” for forsterkninglæring-algoritmer. Men Hall er bekymret for at algoritmene kan misbrukes. For eksempel har det amerikanske flyvåpenet allerede referert til tidlige forskningsartikler som dekker MuZero for å lage et AI-system som kan skyte missiler fra U-2-spionfly. Dette er til tross for at DeepMinds forskere har uttrykt sin motstand mot å bruke deres algoritmer til noen dødelig våpen, og har signert Lethal Autonomous Weapons Pledge for å argumentere for at alle dødelige teknologier bør forbli under menneskelig kontroll.
Silver forklarte at DeepMind ser fremover mot fremtiden, med mål om å utvikle algoritmer som er like kraftfulle og fleksible som hjernen. Det første skrittet i å lage fleksible algoritmer er å forstå hva det betyr for et system å være intelligent, og intelligens er knyttet til evnen til å skjelne mønster og regler i et komplekst miljø.












