Modele i platformy AI
Trudności AI z opanowaniem gry Minecraft za pomocą uczenia przez naśladownictwo

W ciągu ostatnich kilku miesięcy Microsoft (MSFT ) i inne firmy badające uczenie maszynowe wyzwały zespoły deweloperów AI do stworzenia systemu AI, który mógłby grać w grę Minecraft i znaleźć diament w grze. Jak donosi BBC, chociaż platformy AI zdołały zdominować szachy i go, to jednak mają trudności z opanowaniem zadania w Minecraft.
Wyzwanie Microsoftu oparte na Minecraft, nazwane MineRL, zostało oficjalnie ogłoszone na niedawnej konferencji NeurIPS. Celem wyzwania było przeszkolenie AI za pomocą podejścia “uczenia przez naśladownictwo”. Uczenie przez naśladownictwo to metoda, w której AI jest szkolona za pomocą obserwacji. Uczenie przez naśladownictwo ma na celu umożliwienie systemom AI nauki działań przez obserwację ludzi wykonujących te działania, ucząc się przez akt obserwacji. Uczenie przez naśladownictwo, w porównaniu z uczeniem przez wzmocnienie, jest o wiele mniej kosztowne obliczeniowo i znacznie bardziej efektywny sposób szkolenia AI.
Uczenie przez wzmocnienie często wymaga wielu potężnych komputerów połączonych sieciowo i setek lub tysięcy godzin szkolenia, aby zostać skutecznym w zadaniu. W przeciwieństwie do tego, AI szkolona za pomocą metody uczenia przez naśladownictwo może być szkolona znacznie szybciej, ponieważ AI ma już pewną wiedzę do pracy, dzięki operatorom ludzkim, którzy ją poprzedzili.
Uczenie przez naśladownictwo ma praktyczne zastosowania w szkoleniu AI, gdzie AI nie może bezpiecznie eksplorować, dopóki nie odkryje prawidłowych działań. Takie scenariusze obejmują szkolenie samochodu autonomicznego, ponieważ samochód nie mógłby po prostu jeździć po ulicy, dopóki nie nauczyłby się pożądanych zachowań. Używanie danych demonstratora ludzkiego do szkolenia pojazdu mogłoby potencjalnie uczynić proces szybszym i bezpieczniejszym.
Czynność znalezienia diamentu w Minecraft wymaga wykonania wielu kroków w sekwencji, takich jak wycięcie drzew, aby zrobić narzędzia, eksploracja jaskiń zawierających diamenty i rzeczywiste znalezienie diamentu w jaskini. Pomimo złożoności zadania, gracz ludzki znający grę powinien być w stanie znaleźć diament w około 20 minut.
Zostało zgłoszonych ponad 660 różnych agentów AI, ale żaden z nich nie był w stanie znaleźć diamentu. Dane dostarczone do szkolenia AI składały się z zestawu danych zawierającego ponad 60 milionów klatek gry zebranych z wielu graczy ludzkich. Lokalizacje diamentów są losowo generowane, gdy rozpoczyna się instancja gry, co oznacza, że AI nie mogą po prostu szukać tam, gdzie ludzcy gracze znaleźli diamenty. Innymi słowy, AI muszą sformułować zrozumienie, jak pojęcia, takie jak tworzenie narzędzi, używanie narzędzi, eksploracja i znajdowanie zasobów, są ze sobą powiązane.
Pomimo faktu, że żaden z agentów AI nie był w stanie pomyślnie znaleźć diamentu, zespół organizacyjny był nadal zadowolony z wyników wyzwania i wiele się nauczył z tego eksperymentu. Badania przeprowadzone przez zespoły AI mogą pomóc w rozwoju pola AI, znajdując alternatywy dla strategii uczenia przez wzmocnienie.
Uczenie przez wzmocnienie często daje lepsze wyniki niż uczenie przez naśladownictwo, z jednym z najbardziej znaczących sukcesów uczenia przez wzmocnienie, jakim jest AlphaGo DeepMind. Jednak, jak wcześniej wspomniano, uczenie przez wzmocnienie wymaga ogromnych zasobów obliczeniowych, co ogranicza jego użycie przez organizacje, które nie mogą sobie pozwolić na procesory komputerowe w dużym stopniu.
William Guss, student doktorancki na Uniwersytecie Carnegie Mellon i główny organizator wyzwania, wyjaśnił BBC, że wyzwanie MineRL miało na celu zbadanie alternatyw dla AI, które są obciążone obliczeniowo. Guss powiedział:
“… Rzucanie ogromnych obliczeń na problemy nie jest koniecznie słuszny sposób, abyśmy jako pole przesunęli stan sztuki… Działa to bezpośrednio przeciwko demokratyzacji dostępu do tych systemów uczenia przez wzmocnienie i pozostawia możliwość szkolenia agentów w złożonych środowiskach korporacjom z ogromnymi zasobami obliczeniowymi.”












