Modele i platformy AI

Agenci AI Demonstrują Własności Inteligencji Wirtualnej Gry Ukryj Się I Szukaj

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Jednym z ciekawych faktów o badaniach nad sztuczną inteligencją jest to, że może ona często wykonywać działania i stosować strategie, które zaskakują samych badaczy, którzy ją projektują. Stało się to podczas niedawnego wirtualnego meczu w ukrywanie się, w którym wzięło udział kilku agentów sztucznej inteligencji. Naukowcy z OpenAI, firmy zajmującej się sztuczną inteligencją z siedzibą w San Francisco, byli zaskoczeni, gdy odkryli, że ich agenci sztucznej inteligencji rozwinęli strategie w świecie gry, których nie znali nawet sami badacze.

OpenAI wyszkoliło grupę agentów sztucznej inteligencji do gry w ukrywanie się. Programy sztucznej inteligencji są szkolone przy użyciu techniki uczenia wzmacniania, gdzie pożądane zachowanie jest wywoływane przez algorytmy sztucznej inteligencji poprzez zapewnienie im informacji zwrotnej. Agenci sztucznej inteligencji zaczynają od losowych działań, a każde działanie, które przybliża ich do celu, jest nagradzane. Agenci sztucznej inteligencji dążą do uzyskania jak największej ilości nagród, więc eksperymentują, aby zobaczyć, które działania przyniosą im najwięcej nagród. Poprzez próby i błędy agenci sztucznej inteligencji są w stanie odróżnić strategie, które doprowadzą ich do zwycięstwa, te, które dadzą im najwięcej nagród.

Uczenie wzmacnianie już wykazało imponujący sukces w nauce zasad gier. OpenAI niedawno wyszkoliło zespół agentów sztucznej inteligencji do gry w MMORPG DOTA 2, a agenci sztucznej inteligencji pokonali zespół mistrzów świata w zeszłym roku. Podobna sytuacja miała miejsce w grze StarCraft, gdy agenci sztucznej inteligencji zostali wyszkoleni w grze przez DeepMind. Uczenie wzmacnianie zostało również wykorzystane do nauczenia programów sztucznej inteligencji gry w Pictionary z ludźmi, ucząc się interpretować obrazy i stosować podstawowe rozumowanie.

W wirtualnej grze w ukrywanie się stworzonej przez badaczy, kilku agentów sztucznej inteligencji zostało postawionych przeciwko sobie. Wynikiem była rodzaj wyścigu zbrojeń, w którym każdy agent chce przewyższyć innych i uzyskać najwięcej punktów nagród. Nowa strategia przyjęta przez jednego agenta spowoduje, że jego przeciwnik będzie szukał nowej strategii, by ją pokonać, i vice versa. Igor Mordatch, badacz z OpenAI, wyjaśnił magazynowi IEEE Spectrum, że ten proces prób i błędów między agentami „jest wystarczający, aby agenci nauczyli się zaskakujących zachowań samodzielnie – to jak dzieci bawiące się ze sobą”.

Jakie były dokładnie te zaskakujące zachowania? Badacze mieli cztery podstawowe strategie, których oczekiwali, że agenci sztucznej inteligencji nauczą się, i agenci sztucznej inteligencji nauczyli się ich dość szybko, stając się kompetentni w nich już po 25 milionach symulowanych gier. Gra odbywała się w środowisku 3D pełnym ramp, bloków i ścian. Agenci sztucznej inteligencji nauczyli się gonić się nawzajem, przesuwać bloki, aby zbudować forty, w których mogliby się ukryć, i przesuwać rampy. Agenci sztucznej inteligencji, którzy szukali, nauczyli się ciągnąć rampy, aby dostać się do fortów ukrywających się, podczas gdy agenci sztucznej inteligencji, którzy ukrywali się, nauczyli się próbować wciągnąć rampy do swoich fortów, aby szukający nie mogli ich użyć.

Jednak około 380 milionów gier coś nieoczekiwanego się stało. Agenci sztucznej inteligencji nauczyli się używać dwóch strategii, których badacze nie oczekiwali. Agenci sztucznej inteligencji, którzy szukali, nauczyli się, że skacząc na skrzynkę i przechylając ją w kierunku pobliskiego fortu, mogli skoczyć do fortu i znaleźć ukrywającego się. Badacze nie zdawali sobie nawet sprawy, że jest to możliwe w fizyce środowiska gry. Agenci sztucznej inteligencji, którzy ukrywali się, nauczyli się radzić sobie z tym problemem, przeciągając skrzynki do miejsca w swoim forcie.

Pomimo że nieoczekiwane zachowania agentów sztucznej inteligencji wyszkolonych przy użyciu algorytmów uczenia wzmacniania są nieszkodliwe w tym przypadku, to jednak podnoszą pewne potencjalne obawy dotyczące zastosowania uczenia wzmacniania w innych sytuacjach. Członek zespołu badawczego OpenAI, Bowen Baker, wyjaśnił magazynowi IEEE Spectrum, że te nieoczekiwane zachowania mogą być potencjalnie niebezpieczne. Co się stanie, jeśli roboty zaczną zachowywać się w nieoczekiwany sposób?

„Budowanie tych środowisk jest trudne”, wyjaśnił Baker. „Agenci będą przychodzić z tymi nieoczekiwanymi zachowaniami, które będą problemem bezpieczeństwa w przyszłości, gdy zostaną umieszczeni w bardziej złożonych środowiskach.”

Jednak Baker wyjaśnił również, że strategie wzmacniania mogą prowadzić do innowacyjnych rozwiązań bieżących problemów. Systemy sztucznej inteligencji wyszkolone przy użyciu uczenia wzmacniania mogą rozwiązać szeroki zakres problemów z rozwiązaniami, których nawet nie możemy sobie wyobrazić.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.