AI-mallit ja alustat

Älymallit antavat näkymän siihen, miten aivot prosessoi kieltä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Massachusettsin teknillisen korkeakoulun tutkimusryhmä on löytänyt, että ‘seuraavan sanan ennustamiseen’ perustuvien laskemallien toimintaperiaate muistuttaa ihmisaivojen kielellisten prosessointikeskusten toimintaa.

Kielen merkitys

Uusimmat ennustavat kielimallit voivat olla oppimassa jotain kielen perimmäisestä merkityksestä, mikä olisi suuri askel eteenpäin alalla. Mallit ennustavat seuraavan sanan, mutta ne suorittavat myös tehtäviä, jotka vaativat jonkinlaista aitoa ymmärrystä. Nämä tehtävät sisältävät kysymyksiin vastaamisen, asiakirjojen tiivistämisen ja tarinoiden täydentämisen.

Mallit suunniteltiin optimoimaan suorituskykyä tekstin ennustamisessa ilman yritystä jäljitellä mitään ihmisaivojen kielen ymmärtämiseen liittyvää. MIT:n neurotieteen tutkimusryhmä kuitenkin esittää, että jokin on tapahtumassa tässä suhteessa.

Yksi tutkimuksen mielenkiintoisimmista havainnoista on, että tietokonemallit, jotka suorittavat hyvin muita kielitehtäviä, eivät näytä tätä samankaltaisuutta ihmisaivojen kanssa. Tämä nähdään todisteena siitä, että ihmisaivot voivat käyttää seuraavan sanan ennustamista kielen prosessointiin.

Nancy Kanwisher on Walter A. Rosenblithin kognitiivisen neurotieteen professori. Hän on myös MIT:n McGovern-instituutin ja Center for Brains, Minds, and Machines (CBMM) jäsen ja tutkimuksen tekijä.

“Mitä paremmin malli ennustaa seuraavan sanan, sitä läheisemmin se vastaa ihmisaivoja”, Kanwisher sanoo. “On hämmästyttävää, että mallit sopivat niin hyvin, ja se viittaa epäsuoraan siihen, että ihmisen kielijärjestelmä saattaa olla ennustamassa, mitä tapahtuu seuraavaksi.”

Tutkimus julkaistiin Proceedings of the National Academy of Sciences -julkaisussa.

Siihen osallistuivat myös seniorikirjailijat Joshue Tenenbaum, kognitiivisen tieteen professori MIT:ssä ja CBMM:n ja MIT:n tekoälytutkimuskeskuksen jäsen; ja Eveline Fedorenko, Frederick A. ja Carole J. Middletonin urakehitysprofessori neurotieteen alalla ja McGovern-instituutin jäsen. Tutkimuksen ensimmäinen kirjailija oli Martin Schrimpf, MIT:n jatko-opiskelija.

Tutkimus

MIT:n tutkimusryhmä vertasi ihmisaivojen kielten prosessointikeskuksia kielten prosessointimalleihin. He analysoivat 43 eri kielimalleja, mukaan lukien ne, jotka on optimoitu seuraavan sanan ennustamiseen, kuten GPT-3. Muut mallit oli suunniteltu suorittamaan eri kielitehtäviä, kuten täyttämään tyhjiä kohtia.

Kunkin mallin esitettiin sanajonot, ja tutkijat mitasivat solmujen aktiivisuutta, jotka muodostavat verkon. Kuviot verrattiin aivojen aktiivisuuteen, joka mitattiin koehenkilöiden suorittaessa kolmea kielitehtävää: kuuntelemalla tarinoita, lukiessa lauseita yksi kerrallaan ja lukiessa lauseita, joissa yksi sana paljastettiin kerrallaan.

Ihmisaivojen aineistot sisälsivät toiminnallisen magneettikuvausdatan (fMRI) ja intrakranielisen elektrokortikografisen mittauksen, jotka otettiin potilailta, jotka olivat sairaalassa aivokirurgiaa sairastamansa epilepsian vuoksi.

Tutkijat totesivat, että parhaiten suorittavat seuraavan sanan ennustamismallit olivat aktiivisuuskuviot, jotka muistuttivat läheisesti niitä, mitä havaittiin ihmisaivoissa. Nämä mallit osoittivat myös aktiivisuutta, joka oli voimakkaasti korreloivaa ihmisen käyttäytymisen mittausten kanssa, kuten siinä, kuinka nopeasti ihmiset voivat lukea tekstiä.

“Havaitsemme, että mallit, jotka ennustavat hyvin neurologisia vastauksia, ovat myös parhaita ennustamaan ihmisen käyttäytymisen vastauksia, esimerkiksi lukuaikoja. Ja molemmat näistä ovat selitettävissä mallin suorituskyvyllä seuraavan sanan ennustamisessa. Tämä kolmio yhdistää kaiken yhteen”, Schrimpf sanoo.

Tutkijat aikovat nyt rakentaa kielten prosessointimallien variantteja, jotka voisivat mahdollistaa heidän näkemisen, miten pienet muutokset mallien arkkitehtuurissa vaikuttavat suorituskykyyn ja kykyyn sovittaa ihmisaivojen neurologisiin tietoihin.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.