AI-mallit ja alustat
Tekniikka mahdollistaa tekoälylle ajattelun kauas tulevaisuuteen
MIT:n, MIT-IBM Watson AI Lab:n ja muiden laitosten tutkijaryhmä on kehittänyt uuden lähestymistavan, joka mahdollistaa tekoälyagenttien saavuttamisen kauas näkevän näkemyksen. Toisin sanoen tekoäly voi ajatella kauas tulevaisuuteen, kun se ottaa huomioon muiden tekoälyagenttien käyttäytymisen suorittaessaan tehtävän.
Tutkimus on tarkoitus esittää Conference on Neural Information Processing Systems -konferenssissa.
Teckoäly ottaa huomioon muiden agenttien tulevaisuuden toiminnan
Tutkijaryhmän luoma koneoppimisen viitekehyksessä mahdollistaa yhteistyössä tai kilpailussa olevien tekoälyagenttien huomioon ottamisen, mitä muut agentit tulevat tekemään. Tämä ei ole vain seuraavien askelten suhteen, vaan myös ajan lähestyessä ääretöntä. Agentit sopeuttavat käyttäytymistään vastaavasti vaikuttaakseen muiden agenttien tulevaisuuden käyttäytymiseen, jotta ne voivat saavuttaa optimaalisen, pitkän aikavälin ratkaisun.
Tutkijaryhmän mukaan viitekehyksestä voidaan hyötyä esimerkiksi ryhmästä itsestään ohjautuvista droneista, jotka työskentelevät yhdessä etsimään eksyneen retkeilijän. Sitä voidaan myös käyttää itsestään ohjautuvissa ajoneuvoissa, jotta ne voivat ennakoida muiden ajoneuvojen tulevia liikkeitä ja parantaa matkustajien turvallisuutta.
Dong-Ki Kim on jatko-opiskelija MIT:n Laboratory for Information and Decision Systems (LIDS) -laitoksessa ja tutkimusartikkelin ensisijainen kirjoittaja.
”Kun tekoälyagentit tekevät yhteistyötä tai kilpailevat, se, mitä heidän käyttäytymisensä lopulta tulee olemaan, on se, mistä me olemme kiinnostuneita”, Kim sanoo. ”On paljon väliaikaisia käyttäytymismalleja, jotka eivät ole kovin tärkeitä pitkällä aikavälillä. Tavoitteemme on saavuttaa tämä lopullinen käyttäytyminen, ja nyt meillä on matemaattinen tapa tehdä se.”
Tutkijat ovat ratkaisseet moniagenttisen vahvistusoppimisen ongelman, jossa vahvistusoppiminen on koneoppimisen muoto, jossa tekoälyagentit oppivat kokeilemalla ja virheiden kautta.
Kun on useita yhteistyössä tai kilpailussa olevia agentteja, jotka oppivat samanaikaisesti, prosessi voi tulla paljon monimutkaisemmaksi. Kun agentit ottaa huomioon enemmän tulevia askelia muissa agenteissa sekä omassa käyttäytymisessään ja sen vaikutuksessa muihin, ongelma vaatii liian paljon laskentakapasiteettia.
Teckoäly ajattelee ääretöntä
”Teckoäly haluaa ajatella pelin loppua, mutta eivät tiedä, milloin peli päättyy”, Kim sanoo. ”Heidän on ajateltava, miten sopeuttaa käyttäytymistään äärettömyyteen, jotta he voivat voittaa jonain kaukaisena tulevaisuudessa. Tutkimusartikkeli esittää uuden tavoitteen, joka mahdollistaa tekoälylle ajattelun ääretöntä.”
On mahdotonta integroida ääretöntä algoritmiin, joten tutkijaryhmä suunnitteli järjestelmän siten, että agentit keskittyvät tulevaisuuden pisteeseen, jossa heidän käyttäytymisensä tulee yhdistymään muiden agenttien kanssa. Tätä kutsutaan tasapainopisteeksi, ja tasapainopiste määrittää agenttien pitkän aikavälin suorituskyvyn.
On mahdollista, että useita tasapainopisteitä voi olla moniagenttisessa tilanteessa, ja kun tehokas agentti vaikuttaa muiden agenttien tulevaisuuden käyttäytymiseen, he voivat saavuttaa toivottavan tasapainopisteen agentin näkökulmasta. Kun kaikki agentit vaikuttavat toisiinsa, he tulevat yhteen yleiseen käsitteeseen, jota kutsutaan ”aktiiviseksi tasapainopisteeksi”.
FURTHER-viitekehyksessä
Tutkijaryhmän luoma koneoppimisen viitekehyksessä on nimeltään FURTHER, ja se mahdollistaa agenteille oppimisen sopeuttamisesta käyttäytymistään muiden agenttien kanssa vuorovaikutuksen kautta saavuttaakseen aktiivisen tasapainopisteen.
Viitekehyksessä riippuu kahdesta koneoppimisen moduulista. Ensimmäinen on deduktiomoduuli, joka mahdollistaa agentin arvauksen muiden agenttien tulevasta käyttäytymisestä ja oppimisalgoritmeista, jotka perustuvat aiempiin toimiin. Tiedot syötetään sitten vahvistusoppimismoduuliin, jota agentti käyttää sopeuttamaan käyttäytymistään ja vaikuttamaan muihin agenteihin.
”Haaste oli ajattelu ääretöntä. Meidän piti käyttää paljon erilaisia matemaattisia työkaluja mahdollistaaksemme sen, ja tehdä joitakin oletuksia, jotta se toimisi käytännössä”, Kim sanoo.
Tutkijaryhmä testasi menetelmäänsä muiden moniagenttisen vahvistusoppimisen viitekehyksien kanssa erilaisissa tilanteissa, joissa tekoälyagentit, jotka käyttivät FURTHER:ia, menestyivät.
Lähestymistapa on hajautettu, joten agentit oppivat itsenäisesti. Sen lisäksi se on paremmin suunniteltu skaalautumaan verrattuna muihin menetelmiin, jotka vaativat keskuslaitteen ohjaamaan agenteja.
Tutkijaryhmän mukaan FURTHER:ia voidaan käyttää laajasti moniagenttisissa ongelmissa. Kim on erityisen toiveikas sen soveltamisesta taloustieteessä, jossa sitä voidaan soveltaa kehittämään järkevää politiikkaa tilanteissa, joissa on useita vuorovaikutuksessa olevia entiteettejä, joiden käyttäytyminen ja edut muuttuvat ajan myötä.












