AI-modeller och plattformar
DeepMinds nya AI kan lära sig spelreglerna medan den spelar

Alphabets dotterbolag DeepMind har nyligen utvecklat ett AI-system som kan lära sig spelreglerna medan det spelar. Medan DeepMind tidigare har skapat imponerande AI-modeller som kan bemästra spel som schack, shogi, go och videospel, måste dessa modeller tillhandahållas med spelreglerna i förväg. DeepMinds nya AI representerar därför en betydande förbättring jämfört med tidigare AI-algoritmer som lär sig spela spel via förstärkt inlärning.
AI-system – MuZero
I en nyligen publicerad artikel i tidskriften Nature beskrev DeepMind hur deras nya AI-system fungerar. Den nya AI:n, som kallas MuZero, kan lära sig spelreglerna medan den spelar tack vare en princip som kallas “look-ahead search”. Enligt Engadget använder MuZero look-ahead search för att bestämma vilka drag som ska utföras baserat på de mest sannolika responserna från motståndare.
När MuZero överväger alla möjliga drag som kan göras i spel som schack, kan den prioritera och begränsa dragen till de mest sannolika och relevanta. MuZero lär sig sedan av både lyckade och misslyckade manövrer. Istället för att modellera alla möjliga faktorer, överväger den bara de faktorer som är mest relevanta för beslutet. MuZero tar det stora antalet potentiella variabler som kan övervägas och destillerar dem ner till de mest betydelsefulla och inflytelserika funktionerna. Dessa funktioner representeras i en träd-baserad sökalgoritm. Möjligheterna i trädet kombineras sedan med en inlärningsmodell baserad på funktionerna i testmiljön. Look-ahead search utförs efter att de mest relevanta aspekterna av en miljö har identifierats.
För att komma till ett slutgiltigt beslut övervägs tre faktorer.
MuZero överväger resultatet av det föregående valet, den nuvarande positionen den befinner sig i och de potentiella åtgärder den kan vidta härnäst. Detta tillvägagångssätt slår ut tidigare använda tillvägagångssätt av DeepMind, inklusive grundläggande look-ahead search och träd-baserade modeller. MuZero visade sig vara minst lika bra på schack, shogi och go som AlphaZero, och när den spelade spelet Ms. Pac-Man, kunde MuZero bara överväga runt sex eller sju drag åt gången. Trots denna begränsning kunde AI:n fortfarande prestera ganska bra. DeepMind experimenterade också med MuZeros förmågor genom att begränsa antalet simuleringar den kunde utföra innan den måste göra ett drag. I allmänhet, ju mer tid programmet fick för att överväga möjliga drag, desto bättre presterade det.
Den huvudsakliga forskningsvetenskapsmannen på DeepMind, David Silver, förklarade via TechXplore att MuZero är den första AI-modellen som kan generera sin egen representation av spelreglerna i en miljö och använda den representationen för att planera åtgärder.
“För första gången har vi faktiskt ett system som kan bygga sin egen förståelse för hur världen fungerar och använda den förståelsen för att göra den här sortens sofistikerad look-ahead planering som du tidigare sett för spel som schack”, sa Silver. “(MuZero) kan börja från scratch och, genom trial and error, både upptäcka reglerna i världen och använda dessa regler för att uppnå en sorts övermänsklig prestation.”
Möjliga tillämpningar
En AI som verkligen kan lära sig begränsningarna för en uppgift och fungera inom dessa begränsningar har en mängd olika möjliga tillämpningar. MuZero kunde användas för uppgifter som videokompression, som historiskt sett har varit svårt att automatisera med AI, på grund av de många olika möjliga videformaten och kompressionslägena. MuZero kunde uppnå ungefär 5% kompressionsförbättring. Detta kunde ha implikationer för det stora antalet videor som finns på Google (GOOGL ) och YouTube. Utöver videor undersöker DeepMind också möjligheten att använda samma MuZero-tekniker för proteinarkitekturdesign och robotprogrammering.
Enligt Wendy Hall, professor i datavetenskap vid University of Southampton, representerar MuZero “ett betydande steg framåt” för förstärkt inlärningsalgoritmer. Hall är dock orolig för att algoritmerna kan missbrukas. Till exempel har den amerikanska flygvapnet redan hänvisat till tidiga forskningsartiklar om MuZero för att skapa ett AI-system som kan skjuta missiler från U-2 spaningsplan. Detta trots att DeepMinds forskare uttryckt sitt motstånd mot att använda sina algoritmer för något dödligt vapen och undertecknat Lethal Autonomous Weapons Pledge för att argumentera för att all dödlig teknik bör förbli under mänsklig kontroll.
Silver förklarade att DeepMind ser framåt mot framtiden, med målet att utveckla algoritmer som är lika kraftfulla och flexibla som hjärnan. Det första steget mot att skapa flexibla och kraftfulla algoritmer är att förstå vad det innebär för ett system att vara intelligent, och intelligens är kopplat till förmågan att urskilja mönster och regler i en komplex miljö.












