Modele i platformy AI
Nowy system AI DeepMind potrafi uczyć się reguł gry podczas jej rozgrywania

Spółka zależna Alphabet (GOOG ) (GOOGL ), DeepMind, opracowała niedawno system AI, który potrafi uczyć się reguł gry podczas jej rozgrywania. Chociaż DeepMind stworzył już imponujące modele AI, które potrafią opanować gry takie jak szachy, shogi, go i gry wideo, modele te muszą być wcześniej zaopatrzone w reguły gry. Dlatego nowy system AI DeepMind reprezentuje znaczącą poprawę w stosunku do poprzednich algorytmów AI, które uczą się grać w gry za pomocą uczenia wzmacniania.
System AI – MuZero
W artykule opublikowanej w czasopiśmie Nature, DeepMind opisał, jak działa ich nowy system AI. Nowy system AI, nazwany MuZero, potrafi uczyć się reguł gry podczas jej rozgrywania dzięki zasadzie “przyszukiwania do przodu”. Jak donosi Engadget, MuZero wykorzystuje przeszukiwanie do przodu, aby określić, które ruchy powinny być wykonane na podstawie najbardziej prawdopodobnych odpowiedzi przeciwników.
Gdy weźmiemy pod uwagę wszystkie możliwe ruchy, które można wykonać w grach takich jak szachy, MuZero jest w stanie priorytetowo traktować ruchy, ograniczając je do najbardziej prawdopodobnych i istotnych. MuZero będzie następnie uczyć się z zarówno udanych, jak i nieudanych manewrów. Zamiast modelować wszystkie możliwe czynniki, bierze pod uwagę tylko te, które są najbardziej istotne dla podejmowanego decyzji. MuZero w zasadzie bierze olbrzymią ilość potencjalnych zmiennych, które mogą być brane pod uwagę, i redukuje je do najbardziej istotnych, wpływowych cech. Te cechy są reprezentowane w algorytmie wyszukiwania opartym na drzewie. Możliwości wewnątrz drzewa są następnie łączone z modelem nauczonym na podstawie cech środowiska testowego. Przeszukiwanie do przodu jest przeprowadzane po zidentyfikowaniu najbardziej istotnych aspektów środowiska.
Aby podjąć ostateczną decyzję, brane są pod uwagę trzy czynniki.
MuZero bierze pod uwagę wynik poprzedniego wyboru, bieżącą pozycję, którą zajmuje, oraz potencjalne działania, które może wykonać jako następne. Ten podejście bije poprzednie podejścia używane przez DeepMind, w tym podstawowe przeszukiwanie do przodu i modele oparte na drzewie. MuZero okazał się być co najmniej tak dobry w szachach, shogi i go, jak AlphaZero, a gdy grał w grę Ms. Pac-Man, MuZero mógł rozważyć tylko około sześć lub siedem ruchów na raz. Pomimo tego ograniczenia, AI wciąż radził sobie bardzo dobrze. DeepMind również eksperymentował z możliwościami MuZero, ograniczając liczbę symulacji, które mógł wykonać przed podjęciem decyzji. Ogólnie, im więcej czasu program miał na rozważenie możliwych ruchów, tym lepiej się sprawował.
Główny naukowiec badawczy w DeepMind, David Silver, wyjaśnił za pośrednictwem TechXplore, że MuZero jest pierwszym modelem AI, który potrafi wygenerować własną reprezentację reguł środowiska, używając tej reprezentacji do planowania działań.
“Po raz pierwszy, mamy system, który jest w stanie zbudować własne zrozumienie, jak działa świat i użyć tego zrozumienia do tego rodzaju zaawansowanego planowania, jakie wcześniej widzieliśmy w grach takich jak szachy”, powiedział Silver. “(MuZero) może zacząć od zera i po prostu przez próbę i błąd, odkryć reguły świata i użyć tych reguł do osiągnięcia nadludzkich wyników.”
Mozliwe zastosowania
AI, który jest naprawdę w stanie nauczyć się ograniczeń zadania i działać w ramach tych ograniczeń, ma szeroki zakres możliwych zastosowań. MuZero mógłby być użyty do zadań takich jak kompresja wideo, które historycznie było trudne do zautomatyzowania za pomocą AI, ze względu na wiele różnych możliwych formatów wideo i trybów kompresji. MuZero był w stanie osiągnąć około 5% poprawę kompresji. To mogłoby mieć implikacje dla dużej liczby filmów hostowanych przez Google i YouTube. Poza wideo, DeepMind również bada możliwość użycia tych samych technik MuZero do projektowania architektury białek i programowania robotów.
Zdaniem Wendy Hall, profesora informatyki na Uniwersytecie w Southampton, MuZero reprezentuje “znaczący krok do przodu” dla algorytmów uczenia wzmacniania. Jednak Hall jest zaniepokojony, że algorytmy mogą być używane w sposób niewłaściwy. Na przykład, amerykańskie siły powietrzne już odniosły się do wczesnych prac badawczych dotyczących MuZero, aby stworzyć system AI, który mógłby wystrzelić rakiety z samolotów szpiegowskich U-2. To mimo że badacze DeepMind wyrazili swoją opozycję wobec użycia ich algorytmów do jakiegokolwiek zabójczego uzbrojenia, podpisując Lethal Autonomous Weapons Pledge, aby argumentować, że jakakolwiek zabójcza technologia powinna pozostać pod kontrolą ludzi.
Silver wyjaśnił, że DeepMind patrzy w przyszłość, mając na celu rozwój algorytmów tak potężnych i wszechstronnych jak mózg. Pierwszym krokiem do stworzenia wszechstronnych, elastycznych algorytmów jest zrozumienie, co oznacza, że system jest inteligentny, a inteligencja jest związana z możliwością rozróżniania wzorców i reguł złożonego środowiska. DeepMind spogląda do przodu, mając na celu rozwój algorytmów tak potężnych i wszechstronnych jak mózg, pierwszym krokiem jest zrozumienie, co oznacza, że system jest inteligentny, a inteligencja jest związana z możliwością rozróżniania wzorców i reguł złożonego środowiska.












