AI-modeller og platforme
DeepMinds nye AI kan lære reglerne for et spil, mens det spiller

Alphabets datterselskab DeepMind har nylig udviklet et AI-system, der kan lære reglerne for et spil, mens det spiller. Mens DeepMind tidligere har skabt imponerende AI-modeller, der kan mestre spil som skak, shogi, go og videospil, skal disse modeller være forsynet med reglerne for spillet på forhånd. DeepMinds nye AI repræsenterer derfor en betydelig forbedring i forhold til tidligere AI-algoritmer, der lærer at spille spil via forstærkning.
AI-System – MuZero
I en artikel, der nylig er offentliggjort i tidsskriftet Nature, har DeepMind beskrevet, hvordan deres nye AI-system fungerer. Den nye AI, der er døbt MuZero, kan lære reglerne for et spil, mens det spiller, takket være en princip kaldet “look-ahead search”. Ifølge Engadget bruger MuZero look-ahead search til at bestemme, hvilke træk der skal udføres, baseret på de mest sandsynlige svar fra modstanderne.
Når MuZero overvejer alle mulige træk, der kan udføres i spil som skak, kan det prioritere og begrænse trækene til kun de mest sandsynlige og relevante. MuZero vil derefter lære af både succesfulde og mislykkede manøvrer. I stedet for at modellere alle mulige faktorer, overvejer det kun faktorer, der er mest relevante for beslutningen. MuZero kan således tage de mange mulige variable, der kan overvejes, og destillere dem ned til kun de mest betydningsfulde og indflydelsesrige funktioner. Disse funktioner repræsenteres i en træbaseret søgealgoritme. Mulighederne i træet kombineres derefter med en lært model baseret på funktionerne i testmiljøet. Look-ahead search udføres efter, at de mest relevante aspekter af en miljø er blevet identificeret.
For at komme til en endelig beslutning, overvejes tre faktorer.
MuZero overvejer resultatet af den foregående valg, den nuværende position det besætter, og de potentielle handlinger, det kan udføre herefter. Denne tilgang overgår tidligere anvendte tilgange af DeepMind, herunder grundlæggende look-ahead search og træbaserede modeller. MuZero viste sig at være mindst lige så god til skak, shogi og go som AlphaZero, og da det spillede spillet Ms. Pac-Man, kunne MuZero kun overveje omkring seks eller syv træk ad gangen. Trods denne begrænsning kunne AI’en stadig opnå en ret god præstation. DeepMind eksperimenterede også med MuZeros evner ved at begrænse antallet af simulationer, det kunne udføre, før det skulle binde sig til et træk. Generelt opnåede programmet bedre resultater, jo mere tid det fik til at overveje mulige træk.
Den ledende forskningsvidenskabelige medarbejder hos DeepMind, David Silver, forklarede via TechXplore, at MuZero er den første AI-model, der kan generere sin egen repræsentation af reglerne for en miljø og bruge denne repræsentation til at planlægge handlinger.
“For første gang har vi faktisk et system, der kan bygge sin egen forståelse af, hvordan verden fungerer, og bruge denne forståelse til at udføre denne sofistikerede look-ahead planlægning, som du tidligere har set for spil som skak,” sagde Silver. “(MuZero) kan starte fra ingenting og kun gennem prøve og fejl opdage reglerne for verden og bruge disse regler til at opnå en overmenneskelig præstation.”
Mulige Anvendelser
En AI, der virkelig kan lære begrænsningerne for en opgave og fungere inden for disse begrænsninger, har en bred vifte af mulige anvendelser. MuZero kunne bruges til opgaver som video-kompression, der historisk set har været svær at automatisere med AI, på grund af de mange forskellige mulige video-formater og kompressionsmodi. MuZero kunne opnå en kompressionsforbedring på omkring 5%. Dette kunne have implikationer for det store antal videoer, der er hostet af Google (GOOGL ) og YouTube. Ud over videoer ser DeepMind også på at bruge de samme MuZero-teknikker til proteinarkitektur-design og robotprogrammering.
Ifølge Wendy Hall, professor i datalogi ved University of Southampton, repræsenterer MuZero “et betydeligt skridt fremad” for forstærkning-læringsalgoritmer. Hall er dog bekymret for, at algoritmerne kan misbruges. For eksempel har det amerikanske luftvåben allerede refereret til tidlige forskningsartikler om MuZero for at skabe et AI-system, der kan lancere missiler fra U-2 spionfly. Dette er trods DeepMinds forskeres udtalelse om, at de er imod at bruge deres algoritmer til nogen dødelig våben, og har underskrevet Lethal Autonomous Weapons Pledge for at argumentere for, at enhver dødelig teknologi skal forblive under menneskelig kontrol.
Silver forklarede, at DeepMind ser frem til fremtiden og søger at udvikle algoritmer, der er lige så kraftfulde og fleksible som hjernen. Det første skridt til at skabe fleksible algoritmer er at forstå, hvad det betyder for et system at være intelligent, og intelligens er forbundet med evnen til at opdage mønstre og regler i en kompleks miljø.












