Modely a platformy AI

Modely AI poskytují přehled o tom, jak mozek zpracovává jazyk

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Massachusettského technologického institutu naznačuje, že základní funkce výpočetních modelů „předpovědi dalšího slova“ se podobají funkci center zpracovávajících jazyk v lidském mozku.

Význam jazyka

Nejnovější předpovědní jazykové modely by mohly dozvědět něco o základním významu jazyka, což by byl obrovský krok vpřed v tomto oboru. Tyto modely předpovídají slovo, které následuje, ale také plní úkoly, které vyžadují určitou míru skutečného porozumění. Tyto úkoly zahrnují zodpovězení otázek, souhrn dokumentů a dokončení příběhu.

Modely byly navrženy tak, aby optimalizovaly výkon pro předpověď textu bez pokusu o napodobení toho, jak lidský mozek rozumí jazyku. Nicméně, tým neurovědců z MIT naznačuje, že se zde děje něco zajímavého.

Jedním z nejzajímavějších poznatků tohoto výzkumu je, že počítačové modely, které fungují dobře u jiných typů jazykových úkolů, nevykazují tuto podobnost s lidským mozkem. To je považováno za důkaz, že lidský mozek by mohl používat předpověď dalšího slova k provádění jazykového zpracování.

Nancy Kanwisher je Walter A. Rosenblith Professor of Cognitive Neuroscience. Je také členkou McGovern Institute for Brain Research a Center for Brains, Minds, and Machines (CBMM) na MIT a autorkou studie.

“Čím lépe je model schopen předpovědět následující slovo, tím více se podobá lidskému mozku,” říká Kanwisher. “Je úžasné, že modely tak dobře sedí, a to velmi nepřímo naznačuje, že možná to, co dělá lidský jazykový systém, je předpověď, co se stane dál.”

Studie byla zveřejněna v Proceedings of the National Academy of Sciences.

Studie také zahrnovala seniorní autory Joshue Tenenbauma, profesora kognitivní vědy na MIT a člena CBMM a MIT’s Artificial Intelligence (CSAIL); a Eveline Fedorenko, Frederick A. a Carole J. Middleton Career Development Associate Professor of Neuroscience a členku McGovern Institute. První autor studie byl Martin Schrimpf, student MIT.

Studie

Tým z MIT porovnal centra zpracovávající jazyk v lidském mozku s jazykovými modely. Analyzovali 43 různých jazykových modelů, včetně těch, které jsou optimalizovány pro předpověď dalšího slova, jako je GPT-3. Další modely byly navrženy pro plnění různých jazykových úkolů, jako je vyplňování mezer.

Každý model byl představen s řetězcem slov a výzkumníci měřili aktivitu uzlů, které tvoří síť. Vzorce byly poté porovnány s aktivitou v mozku, která byla měřena u subjektů, které plnily tři jazykové úkoly: poslouchání příběhů, čtení vět jeden po druhém a čtení vět, ve kterých je jeden slovo odhaleno najednou.

Lidské datové sady zahrnovaly funkční magnetickou rezonanci (fMRI) a intrakraniální elektrokortikografická měření, která byla odebrána od lidí, kteří podstoupili mozkovou operaci pro epilepsii.

Výzkumníci zjistili, že nejlepší modely pro předpověď dalšího slova měly vzorce aktivity, které se podobaly těm, které se vyskytují v lidském mozku. Tyto modely také prokázaly aktivitu, která byla silně korelována s měřením lidského chování, jako je rychlost, s jakou lidé mohou číst text.

“Zjistili jsme, že modely, které předpovídají neuronální odpovědi dobře, také tendenci předpovídat lidské chování, ve formě čtenářských časů. A obě tyto jsou vysvětleny výkonem modelu na předpovědi dalšího slova. Tento trojúhelník opravdu spojuje všechno dohromady,” říká Schrimpf.

Výzkumníci se nyní budou snažit vyvinout varianty jazykových modelů, které by jim umožnily vidět, jak malé změny v jejich architektuře ovlivňují výkon a jejich schopnost přizpůsobit se lidským neuronálním datům.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.