AI-modellen en platforms

DeepMinds nieuwe AI kan de regels van een spel leren terwijl het speelt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Alphabet’s (GOOGL ) dochteronderneming DeepMind heeft onlangs een AI-systeem ontwikkeld dat de regels van een spel kan leren terwijl het speelt. Hoewel DeepMind indrukwekkende AI-modellen heeft gemaakt die spellen zoals schaken, shogi, go en videospellen kunnen beheersen, moeten deze modellen van tevoren de regels van het spel krijgen. DeepMinds nieuwe AI vertegenwoordigt dus een opmerkelijke verbetering ten opzichte van eerdere AI-algoritmen die spellen leren via versterking van het leren.

AI-systeem – MuZero

In een onlangs in het tijdschrift Nature gepubliceerde paper heeft DeepMind uitgelegd hoe hun nieuwe AI-systeem werkt. De nieuwe AI, genaamd MuZero, kan de regels van een spel leren terwijl het speelt dankzij een principe genaamd “look-ahead search”. Volgens Engadget gebruikt MuZero look-ahead search om te bepalen welke zetten moeten worden uitgevoerd op basis van de meest waarschijnlijke reacties van tegenstanders.

Wanneer alle mogelijke zetten in spellen zoals schaken worden overwogen, kan MuZero prioriteit geven en de zetten beperken tot alleen de meest waarschijnlijke en relevante zetten. MuZero zal dan leren van zowel succesvolle als niet-succesvolle manoeuvres. In plaats van alle mogelijke factoren te modelleren, worden alleen factoren overwogen die het meest relevant zijn voor de beslissing. MuZero neemt de vele potentiële variabelen die kunnen worden overwogen en reduceert ze tot alleen de meest relevante, impactvolle kenmerken. Deze kenmerken worden weergegeven in een tree-based zoekalgoritme. De mogelijkheden binnen de boom worden vervolgens gecombineerd met een geleerd model op basis van de kenmerken van de testomgeving. De look-ahead search wordt uitgevoerd nadat de meest relevante aspecten van een omgeving zijn geïdentificeerd.

Om tot een definitieve beslissing te komen, worden drie factoren overwogen.

MuZero overweegt de uitkomst van de vorige keuze, de huidige positie die het inneemt en de potentiële acties die het de volgende keer kan nemen. Deze aanpak is beter dan eerdere benaderingen die door DeepMind zijn gebruikt, waaronder basis look-ahead search en tree-based modellen. MuZero bleek minstens zo goed te zijn in schaken, shogi en go als AlphaZero, en toen het het spel Ms. Pac-Man speelde, kon MuZero alleen ongeveer zes of zeven zetten tegelijk overwegen. Ondanks deze beperking kon de AI nog steeds goed presteren. DeepMind heeft ook MuZero’s mogelijkheden getest door het aantal simulaties te beperken dat het kon uitvoeren voordat het een zet moest doen. In het algemeen presteerde het programma beter naarmate het meer tijd kreeg om mogelijke zetten te overwegen.

De hoofdonderzoeker bij DeepMind, David Silver, heeft via TechXplore uitgelegd dat MuZero het eerste AI-model is dat zijn eigen representatie van de regels van een omgeving kan genereren en deze representatie kan gebruiken om acties te plannen.

“Voor het eerst hebben we echt een systeem dat in staat is om zijn eigen begrip van hoe de wereld werkt te bouwen en dat begrip te gebruiken om dat soort geavanceerde look-ahead planning te doen dat je eerder hebt gezien voor spellen zoals schaken,” zei Silver. “(MuZero) kan beginnen met niets en alleen door trial and error, zowel de regels van de wereld ontdekken als die regels gebruiken om superhumane prestaties te bereiken.”

Mogelijke toepassingen

Een AI die echt in staat is om de beperkingen van een taak te leren en binnen die beperkingen te werken, heeft een breed scala aan mogelijke toepassingen. MuZero kan worden gebruikt voor taken zoals videocompressie, die historisch moeilijk was om te automatiseren met AI vanwege de vele verschillende mogelijke videiformaten en compressiemodi. MuZero kon ongeveer 5% compressieverbetering bereiken. Dit kan gevolgen hebben voor het grote aantal video’s dat wordt gehost door Google en YouTube. Naast video’s onderzoekt DeepMind ook het gebruik van dezelfde MuZero-technieken voor proteïne-architectuurontwerp en robotprogrammering.

Volgens Wendy Hall, professor in de computerwetenschappen aan de University of Southampton, vertegenwoordigt MuZero “een significante stap voorwaarts” voor versterkingsleeralgoritmen. Hall maakt zich echter zorgen dat de algoritmen misbruikt kunnen worden. Zo heeft de Amerikaanse luchtmacht al naar vroeg onderzoek verwezen dat MuZero dekt om een AI-systeem te maken dat raketten van U-2-spionagetoestellen kan lanceren. Dit is ondanks het feit dat onderzoekers van DeepMind hebben verklaard dat ze tegen het gebruik van hun algoritmen voor dodelijke wapens zijn en de Lethal Autonomous Weapons Pledge hebben ondertekend om aan te geven dat elke dodelijke technologie onder menselijke controle moet blijven.

Silver legde uit dat DeepMind vooruitkijkt naar de toekomst, met als doel algoritmen te ontwikkelen die even krachtig en veelzijdig zijn als de hersenen. De eerste stap in het creëren van flexibele, veelzijdige algoritmen is om te begrijpen wat het betekent voor een systeem om intelligent te zijn, en intelligentie is gekoppeld aan de mogelijkheid om de patronen en regels van een complexe omgeving te onderscheiden.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.