Modele i platformy AI

Badacze AI tworzą model gry wideo, który może pamiętać wydarzenia z przeszłości

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Zespół badaczy z laboratorium AI Ubera opracował niedawno system algorytmów AI, który przewyższa zarówno ludzkich graczy, jak i inne systemy AI w klasycznych grach wideo Atari. System AI opracowany przez badaczy jest w stanie pamiętać wcześniej udane strategie, tworzyć nowe strategie na podstawie tego, co działało w przeszłości. Zespół badawczy uważa, że algorytmy, które opracowali, mają potencjalne zastosowania w innych dziedzinach techniki, takich jak przetwarzanie języka i robotyka.

Typowy sposób tworzenia systemów AI zdolnych do gry w gry wideo polega na użyciu algorytmu uczenia wzmacniania. Algorytmy uczenia wzmacniania uczą się, jak wykonywać zadanie, eksplorując zakres możliwych działań, a po każdym działaniu są im przyznawane wzmocnienia (nagrody lub kary). Z czasem model AI uczy się, które działania prowadzą do większych nagród i staje się bardziej prawdopodobne, że będzie je wykonywał. Niestety, modele uczenia wzmacniania mają trudności, gdy napotkają dane, które nie są spójne z innymi danymi w zbiorze.

Zdaniem zespołu badawczego powodem, dla którego ich podejście nie zostało wcześniej rozważone przez innych badaczy AI, jest to, że strategia różni się od podejścia “wewnętrznej motywacji” typowo stosowanego w uczeniu wzmacnianym. Problemem z podejściem wewnętrznej motywacji jest to, że model może być skłonny do “zapominania” o potencjalnie nagradzanych obszarach, które nadal zasługują na eksplorację. Zjawisko to nazywane jest “odłączeniem”. W konsekwencji, gdy model napotka nieoczekiwane dane, może zapomnieć o obszarach, które powinny nadal być eksplorowane.

Według TechXplore, zespół badawczy postanowił stworzyć model uczenia, który byłby bardziej elastyczny i mógłby reagować na nieoczekiwane dane. Badacze pokonali ten problem, wprowadzając algorytm, który mógł pamiętać wszystkie działania podejmowane przez poprzednią wersję modelu, gdy próbował rozwiązać problem. Gdy model AI napotka dane, które nie są spójne z tym, czego nauczył się do tej pory, model sprawdza swoją mapę pamięci. Następnie model identyfikuje, które strategie powiodły się i które nie, i wybiera strategie odpowiednio.

Gdy model gra w grę wideo, zbiera zrzuty ekranu gry, tworząc dziennik swoich działań. Obrazy są grupowane razem na podstawie podobieństwa, tworząc wyraźne punkty w czasie, do których model może się odnieść. Algorytm może użyć zalogowanych obrazów, aby wrócić do interesującego punktu w czasie i kontynuować eksplorację. Gdy model stwierdzi, że przegrywa, odnosi się do zrobionych zrzutów ekranu i próbuje innej strategii.

Jak wyjaśnia BBC, istnieje również problem radzenia sobie z niebezpiecznymi sytuacjami dla agenta AI grającego w grę. Jeśli agent napotka niebezpieczeństwo, które może go zabić, uniemożliwi mu to powrót do obszarów, które zasługują na dalszą eksplorację, co jest problemem zwanym “wykolejeniem”. Model AI radzi sobie z problemami wykolejenia za pomocą oddzielnego procesu od tego, który jest używany do zachęcania do eksploracji starych obszarów.

Zespół badawczy miał model, który przeszedł przez 55 gier Atari. Gry te są powszechnie używane do oceny wydajności modeli AI, ale badacze dodali nowy element do swojego modelu. Badacze wprowadzili dodatkowe reguły do gier, nakazując modelowi nie tylko osiągnąć najwyższy możliwy wynik, ale także próbować osiągnąć jeszcze wyższy wynik za każdym razem. Gdy wyniki wykonania modelu zostały przeanalizowane, badacze stwierdzili, że ich system AI przewyższa inne AI w grach około 85% czasu. Model AI radził sobie szczególnie dobrze w grze Montezuma’s Revenge, platformowej grze, w której gracz unika niebezpieczeństw i zbiera skarby. Gra pobiła rekord dla ludzkiego gracza i również uzyskała wynik wyższy niż jakikolwiek inny system AI.

Zdaniem badaczy AI z Ubera strategie stosowane przez zespół badawczy mają zastosowania w branżach takich jak robotyka. Roboty korzystają z możliwości pamiętania, które działania były udane, które nie powiodły się i które jeszcze nie zostały wypróbowane.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.