AI-modeller och plattformar

AI kämpar för att bemästra Minecraft genom imitation-inlärning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Under de senaste månaderna har Microsoft (MSFT ) och andra företag som forskar i maskinlärning utmanat team av AI-utvecklare att skapa ett AI-system som kan spela Minecraft och hitta en diamant inom spelet. Enligt BBC har AI-plattformar lyckats dominera schack och go, men de har kämpat för att bemästra en uppgift i Minecraft.

Microsofts Minecraft-baserade AI-utmaning kallades MineRL, och tävlingens resultat meddelades officiellt på den nyligen hållna NeurIPS-konferensen. Tävlingens syfte var att träna en AI med en “imitation-inlärningsmetod”. Imitation-inlärning är en metod där en AI tränas genom att observera. Imitation-inlärning syftar till att låta AI-system lära sig handlingar genom att titta på hur människor utför dessa handlingar, och lära sig genom att observera. Imitation-inlärning är, i jämförelse med förstärkningsinlärning, en mycket mindre datorintensiv och mer effektiv metod för att träna en AI.

Förstärkningsinlärning kräver ofta många kraftfulla datorer som är kopplade till varandra och hundratals eller tusentals timmars träning för att bli effektiv på en uppgift. I kontrast kan en AI som tränas med en imitation-inlärningsmetod tränas mycket snabbare, eftersom AI:n redan har en grundläggande kunskap att arbeta med tack vare de mänskliga operatörerna som har föregått den.

Imitation-inlärning har praktiska tillämpningar i träning av en AI där AI:n inte kan utforska på ett säkert sätt tills den har lärt sig de rätta handlingarna. Sådana scenarier skulle inkludera träning av ett autonomt fordon, eftersom bilen inte kan låtas vandra runt på en gata tills den har lärt sig önskade beteenden. Att använda en mänsklig demonstrators data för att träna fordonet kunde potentiellt göra processen snabbare och säkrare.

Att hitta en diamant i Minecraft kräver att man utför många steg i följd, såsom att hugga ner träd för att göra verktyg, utforska grottor som innehåller diamanter och faktiskt hitta en diamant inom grottan. Trots uppgiftens komplexitet borde en mänsklig spelare som är bekant med spelet kunna hitta en diamant på cirka 20 minuter.

Över 660 olika AI-agenter skickades in till tävlingen, men inte en enda av AI:na kunde hitta en diamant. Datamängden som tillhandahölls för att träna AI:n bestod av över 60 miljoner spelramar som samlats in från många mänskliga spelare. Diamanternas platser är slumpmässigt fördelade när en instans av spelet startas, så detta betyder att AI:na inte kan enbart titta var de mänskliga spelarna hittade diamanterna. Med andra ord måste AI:na bilda en förståelse för hur koncept som att göra verktyg, använda verktyg, utforska och hitta resurser är sammanlänkade.

Trots att ingen av AI-agenter lyckades hitta en diamant var tävlingsorganisationen fortfarande nöjd med tävlingens resultat, och att mycket lärdes från experimentet. Forskningen som AI-lagen genomförde kan hjälpa till att främja AI-området och hitta alternativ till förstärkningsinlärningsstrategier.

Förstärkningsinlärning ger ofta överlägsen prestanda jämfört med imitation-inlärning, med en noterbar framgång för förstärkningsinlärning som DeepMinds AlphaGo. Men, som tidigare nämnts, kräver förstärkningsinlärning massiva datorresurser, vilket begränsar dess användning av organisationer som inte kan köpa datorprocessorer i stor skala.

William Guss, doktorand vid Carnegie Mellon University och tävlingens huvudorganisatör, berättade för BBC att MineRL-tävlingen syftade till att undersöka alternativ till datorintensiv AI. Guss sa:

“…Att kasta massiv datoranvändning på problem är inte nödvändigtvis rätt sätt för oss att driva på fältets utveckling… Det fungerar direkt mot att demokratisera tillgången till dessa förstärkningsinlärningssystem, och lämnar förmågan att träna agenter i komplexa miljöer till företag med stora mängder datoranvändning.”

Blogger och programmerare med specialområden inom Machine Learning och Deep Learning ämnen. Daniel hoppas på att hjälpa andra att använda kraften från AI för socialt väl.