Modely a platformy AI

Nová AI od DeepMindu se dokáže naučit pravidla hry, zatímco hraje

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Dceřiná společnost Alphabetu, DeepMind, nedávno vyvinula systém AI, který se dokáže naučit pravidla hry, zatímco hraje. Zatímco DeepMind vytvořil dříve působivé modely AI, které mohou zvládnout hry jako Šachy, Šógi, Go a videohry, tyto modely musí být předem vybaveny pravidly hry. Nový AI systém DeepMindu tedy představuje významné zlepšení oproti předchozím algoritmům AI, které se učí hrát hry pomocí učení s posilováním.

AI Systém – MuZero

V článku nedávno zveřejněném v časopise Nature DeepMind popsal, jak funguje jejich nový AI systém. Nový AI, nazvaný MuZero, se dokáže naučit pravidla hry, zatímco hraje, díky principu nazvanému „look-ahead search“. Podle Engadgetu MuZero používá look-ahead search k určení, které tahy by měly být provedeny na základě nejpravděpodobnějších reakcí soupeřů.

Když zvažujeme všechny možné tahy, které lze udělat v hrách jako šachy, MuZero je schopen priorizovat a zúžit tahy na ty nejpravděpodobnější a nejrelevantnější. MuZero se pak učí z úspěšných i neúspěšných manévrů. Místo modelování všech možných faktorů zvažuje pouze ty, které jsou nejrelevantnější pro rozhodnutí. MuZero vlastně bere množství potenciálních proměnných, které lze zvažovat, a redukuje je na ty nejzásadnější, nejvlivnější rysy. Tyto rysy jsou reprezentovány v algoritmu založeném na stromu. Možnosti uvnitř stromu jsou pak kombinovány s naučeným modelem založeným na rysech testovacího prostředí. Look-ahead search je proveden poté, co jsou identifikovány nejrelevantnější aspekty prostředí.

Pro konečné rozhodnutí jsou zvažovány tři faktory.

MuZero zvažuje výsledek předchozí volby, aktuální pozici, kterou zaujímá, a potenciální akce, které může podniknout dále. Tento přístup překonává předchozí přístupy používané DeepMindem, včetně základního look-ahead search a modelů založených na stromu. MuZero se ukázal být alespoň stejně dobrý v šachách, šógi a go jako AlphaZero a když hrál hru Ms. Pac-Man, MuZero mohl zvažovat pouze kolem šesti nebo sedmi tahů najednou. Přes tento limit byl AI schopen dosáhnout velmi dobrých výsledků. DeepMind také experimentoval s možnostmi MuZero omezením počtu simulací, které musel provést předtím, než musel provést tah. Obecně, čím více času měl program k dispozici, tím lépe fungoval.

Vedoucí výzkumný pracovník DeepMindu, David Silver, vyjádřil se prostřednictvím TechXplore, že MuZero je první model AI, který může generovat svou vlastní reprezentaci pravidel prostředí a použít ji k plánování akcí.

“Poprvé máme systém, který může vytvořit své vlastní pochopení, jak svět funguje, a použít toto pochopení pro tento druh sofistikovaného look-ahead plánování, který jste dříve viděli u her jako šachy,” řekl Silver. “(MuZero) může začít od ničeho a pouze prostřednictvím pokusů a omylů objevit pravidla světa a použít tato pravidla k dosažení nadlidských výkonů.”

Možné Aplikace

AI, který je skutečně schopen naučit se omezení úkolu a fungovat v rámci těchto omezení, má širokou škálu možných aplikací. MuZero by mohl být použit pro úkoly, jako je komprese videa, která byla historicky obtížná pro automatizaci pomocí AI, kvůli mnoha různým možným formátům videa a režimům komprese. MuZero dosáhl přibližně 5% zlepšení komprese. To by mohlo mít důsledky pro velké množství videí hostovaných Googlem a YouTube. Kromě videí DeepMind také zkoumá použití stejných technik MuZero pro návrh proteinové architektury a programování robotiky.

Podle Wendy Hall, profesorky počítačových věd na University of Southampton, MuZero představuje „významný krok vpřed“ pro algoritmy učení s posilováním. Hall je však znepokojena tím, že algoritmy mohou být zneužity. Například letectvo USA již odkázalo na rané výzkumné články o MuZero, aby vytvořilo AI systém, který by mohl spustit rakety z letadel U-2. To je navzdory tomu, že výzkumníci DeepMindu vyjádřili svůj nesouhlas s použitím svých algoritmů pro jakékoli smrtící zbraně a podepsali Lethal Autonomous Weapons Pledge, aby argumentovali, že jakékoli smrtící technologie by měly zůstat pod lidskou kontrolou.

Silver vysvětlil, že DeepMind se dívá dopředu do budoucnosti, snažící se vyvinout algoritmy, které jsou stejně mocné a všestranné jako mozek. První krok k vytvoření všestranných, flexibilních algoritmů spočívá v pochopení, co to znamená, aby byl systém inteligentní, a inteligence je spojena se schopností rozlišovat vzory a pravidla komplexního prostředí. DeepMind chce jít vpřed do budoucnosti, snažící se vyvinout algoritmy, které jsou stejně mocné a všestranné jako mozek. První krok k vytvoření všestranných, flexibilních algoritmů spočívá v pochopení, co to znamená, aby byl systém inteligentní, a inteligence je spojena se schopností rozlišovat vzory a pravidla komplexního prostředí.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.