Modely a platformy AI
AI zápasí s ovládnutím Minecraftu prostřednictvím imitačního učení

Před několika měsíci vyzvaly společnosti Microsoft (MSFT ) a další výzkumné týmy v oblasti strojového učení týmy vývojářů AI, aby vytvořily systém AI, který by mohl hrát Minecraft a najít diamant внутри hry. Jak uvádí BBC, zatímco platformy AI se podařilo ovládnout šachy a go, ale měly problémy s ovládnutím úkolu v Minecraftu.
Microsoftova výzva založená na Minecraftu se nazývala MineRL, a výsledky soutěže byly oficiálně oznámeny na recentní konferenci NeurIPS. Cílem soutěže bylo vyškolit AI pomocí “imitačního učení”. Imitační učení je metoda, při které se AI učí pomocí pozorování. Imitační učení umožňuje AI systémům učit se akce pozorováním lidského chování, učení se prostřednictvím pozorování. Imitační učení je ve srovnání s učení posílením mnohem méně výpočetně náročné a podstatně účinnější způsob školení AI.
Učení posílením často vyžaduje mnoho výkonných počítačů propojených dohromady a stovky nebo tisíce hodin školení, aby se stalo efektivní pro úkol. Naopak, AI školená pomocí imitačního učení může být školená mnohem rychleji, protože AI již má základní znalosti, které získala od lidských operátorů, kteří ji předcházeli.
Imitační učení má praktické aplikace při školení AI, kde AI nemůže bezpečně prozkoumat, dokud nevyřeší správné akce. Takové scénáře by zahrnovaly školení autonomního vozidla, protože auto nemůže být dovoleno prostě bloudit po ulici, dokud nevyřeší požadované chování. Použití dat lidského demonstrátora k školení vozidla by mohlo potenciálně učinit proces rychlejším a bezpečnějším.
Akt finding diamantu v Minecraftu vyžaduje provedení mnoha kroků v pořadí, jako je pokácení stromů, aby se vyrobily nástroje, prozkoumání jeskyň, které obsahují diamanty, a skutečné nalezení diamantu uvnitř jeskyně. Navzdory složitosti úkolu by měl lidský hráč, který je obeznámen s hrou, být schopen najít diamant za khoảng 20 minut.
Do soutěže bylo přihlášeno více než 660 různých agentů AI, ale žádný z nich nebyl schopen najít diamant. Data poskytnutá k školení AI obsahovala více než 60 milionů snímků herního procesu, shromážděných z mnoha lidských hráčů. Poloha diamantů je náhodně generována při spuštění instance hry, takže to znamená, že AI nemohou simplemente hledat tam, kde lidský hráč našel diamanty. Jinými slovy, AI musí vytvořit pochopení, jak jsou koncepce, jako je výroba nástrojů, použití nástrojů, prozkoumání a nalezení zdrojů, propojeny.
Přestože žádný z agentů AI nebyl schopen úspěšně najít diamant, byl tým organizátorů soutěže stále spokojen s výsledky soutěže a mnoho se naučilo z experimentu. Výzkum, který provedly týmy AI, může pomoci pokročit v oblasti AI, najít alternativy k strategiím učení posílením.
Učení posílením často poskytuje lepší výkon než imitační učení, s jednou pozoruhodnou úspěchem učení posílením being DeepMind’s AlphaGo. Nicméně, jak bylo dříve uvedeno, učení posílením vyžaduje masivní výpočetní zdroje, což omezuje jeho použití organizacemi, které si nemohou dovolit počítačové procesory ve velkém měřítku.
William Guss, PhD Student na Carnegie Mellon University a vedoucí organizátor soutěže, vyjádřil se pro BBC, že soutěž MineRL byla určena k prozkoumání alternativ k výpočetně náročnému AI. Řekl Guss:
“…Házet masivní výpočetní zdroje na problémy není nutně správným způsobem, jak bychom měli pokročit ve stavu umění jako oboru… Pracuje přímo proti demokratizaci přístupu k těmto systémům učení posílením a ponechává schopnost školení agentů v komplexních prostředích korporacím s rozsáhlými výpočetními zdroji.”












