AI-mallit ja alustat

Tekoälyagentit osoittavat emergenttiä älykkyyttä virtuaalisessa piiloleikissä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Yksi mielenkiintoisista asioista tekoälyn tutkimisessa on, että se voi usein suorittaa toimintoja ja noudattaa strategioita, jotka yllättävät jopa niiden tutkijoita, jotka suunnittelivat ne. Tämä tapahtui äskettäin virtuaalipelissä, jossa useita tekoälyagenteja asetettiin toisiaan vastaan. OpenAI:n tutkijat, joilla on kotipaikka San Franciscossa, olivat yllättynyt havaitessaan, että heidän tekoälyagenttinsa olivat kehittäneet strategioita pelimaailmassa, joita tutkijat eivät edes tienneet olemassaolosta.

OpenAI on kouluttanut ryhmän tekoälyagenteja pelaamaan toisiaan vastaan piiloleikkiä. Tekoälyohjelmat on koulutettu vahvistusoppimisella, jossa toivottu käyttäytyminen saadaan aikaan antamalla tekoälyalgoritmeille palautetta. Tekoäly aloittaa satunnaisilla toimilla, ja jokaisella kerralla, kun se suorittaa toiminnon, joka vie sen lähemmäs tavoitettaan, agentti palkitaan. Tekoäly haluaa saavuttaa mahdollisimman paljon palkintoja, joten se kokeilee, mitkä toiminnot tuottavat sille enemmän palkintoja. Koettua ja virhettä tekoäly pystyy erottamaan strategiat, jotka johtavat voittoon, ne, jotka antavat sille enemmän palkintoja.

Vahvistusoppiminen on jo osoittanut vaikuttavansa sääntöjen oppimiseen peleissä. OpenAI koulutti äskettäin joukon tekoälyjä pelaamaan MMORPG-peliä DOTA 2, ja tekoäly voitti maailmanmestaruuden saavuttaneen joukkueen viime vuonna. Samanlainen asia tapahtui myös StarCraft-pelissä, kun DeepMind koulutti tekoälyä peliin. Vahvistusoppimista on myös käytetty opettamaan tekoälyohjelmia pelaamaan Pictionarya ihmisten kanssa, jolloin ne oppivat tulkkaamaan kuvia ja käyttämään perustavaa yleistä päättelyä.

Tutkijoiden luomassa piiloleikkivideopelissä useita tekoälyagenteja asetettiin toisiaan vastaan. Tuloksena oli jonkinlainen asevarustelukilpailu, jossa kunkin agentin tavoitteena oli suorittaa paremmin kuin toiset ja saada enemmän palkintopisteitä. Uusi strategia, jonka yksi agentti omaksui, sai vastapuolen etsimään uuden strategian, jolla se voisi vastata, ja päinvastoin. OpenAI:n tutkija Igor Mordatch selitti IEEE Spectrumille, että kokeilu osoittaa, että tämä virheiden ja kokeilun prosessi agenttien välillä “on tarpeeksi sille, että agentit oppivat yllättäviä käyttäytymisiä itsestään — se on kuin lapset leikkivät toistensa kanssa”.

Mitkä olivat nämä yllättävät käyttäytymiset? Tutkijat odottivat, että tekoälyagentit oppisivat neljä perusstrategiaa, ja ne oppivat ne melko nopeasti, tullessa niistä taitaviksi vain 25 miljoonan simuloitujen pelien jälkeen. Peli tapahtui 3D-ympäristössä, joka oli täynnä ramppeja, esteitä ja seiniä. Tekoälyagentit oppivat jahtaamaan toisiaan, liikuttamaan esteitä rakentaakseen linnoituksia, joissa ne voivat piillä, ja liikuttamaan ramppeja. Tekoälyetsijät oppivat raahaamaan ramppeja sisään linnoituksiin, kun taas piilijät oppivat yrittämään raahaamaan ramppeja linnoituksiinsa, jotta etsijät eivät voisi käyttää niitä.

Kuitenkin noin 380 miljoonan pelin kohdalla tapahtui odottamaton asia. Tekoälyagentit oppivat käyttämään kahta strategiaa, joita tutkijat eivät odottaneet. Etsijäagentit oppivat hyppimään laatikolle ja kallistamaan/ajamaan laatikkoa lähelle linnaketta, jolloin ne pystyivät hyppimään linnakkeeseen ja löytämään piilijän. Tutkijat eivät edes tienneet, että tämä oli mahdollista peliympäristön fysiikan puitteissa. Piilijät oppivat ratkaisemaan tämän ongelman raahaamalla laatikot paikoilleen linnakkeessaan.

Vaikka tekoälyagenttien odottamaton käyttäytyminen vahvistusoppimisalgoritmeilla on vaaraton tässä tapauksessa, se herättää joitain potentiaalisia huolenaiheita siitä, miten vahvistusoppimista sovelletaan muihin tilanteisiin. OpenAI:n tutkimustiimin jäsen Bowen Baker selitti IEEE Spectrumille, että nämä odottamattomat käyttäytymiset voivat olla potentiaalisesti vaarallisia. Mitä jos robotit alkavat käyttäytyä odottamattomalla tavalla?

“Näiden ympäristöjen rakentaminen on vaikeaa”, Baker selitti. “Agentit tulevat keksimään nämä odottamattomat käyttäytymiset, jotka tulevat olemaan turvallisuusongelma myöhemmin, kun ne asetetaan monimutkaisempiin ympäristöihin.”

OpenAI:n tutkija Bowen Baker selitti kuitenkin myös, että vahvistusstrategiat voivat johtaa innovatiivisiin ratkaisuihin nykyisiin ongelmiin. Vahvistusoppimisella koulutetut järjestelmät voivat ratkaista laajan valikoiman ongelmia, joilla on ratkaisuja, joita emme voi edes kuvitella.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.