Modely a platformy AI

Nová AI Model Pracuje s Širším Spektrem Lidských Jazyků

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z University of Waterloo vyvinuli AI model, který umožňuje počítačům zpracovávat širší spektrum lidských jazyků. Jedná se o důležitý krok vpřed v tomto oboru, zejména když uvážíme, kolik jazyků je často opomíjeno při programování. Africké jazyky se často nedostávají do popředí pozornosti počítačových vědců, což vedlo k omezením možností zpracování přirozeného jazyka (NLP) na tomto kontinentu.

Nový jazykový model byl vyvinut týmem výzkumníků z David R. Cheriton School of Computer Science na University of Waterloo.

Výzkum byl prezentován na Multilingual Representation Learning Workshop na konferenci Empirical Methods in Natural Language Processing v roce 2021.

Model hraje klíčovou roli při analýze textu v afrických jazycích pro mnoho užitečných úkolů a je nazýván AfriBERTa. Používá hluboké učení k dosažení působivých výsledků pro jazyky s omezenými zdroji.

Práce s 11 Africkými Jazyky

AfriBERTa pracuje s 11 konkrétními africkými jazyky, včetně amharštiny, hauské a swahilštiny, které mluví kombinovaně více než 400 milionů lidí. Model prokázal kvalitu výstupu, která je srovnatelná s nejlepšími existujícími modely, a to při použití pouze jednoho gigabytu textu. Jiné podobné modely často vyžadují tisíckrát více dat.

Kelechi Ogueji je student magisterského studia počítačové vědy na Waterloo.

„Předtrénované jazykové modely změnily způsob, jakým počítače zpracovávají a analyzují textová data pro úkoly od strojového překladu po zodpovězení otázek,“ řekl Ogueji. „Bohužel, africké jazyky dostaly málo pozornosti od výzkumné komunity.“

„Jednou z výzev je, že neuronové sítě jsou ohromně náročné na text a počítače při budování. A na rozdíl od angličtiny, která má enormní množství dostupného textu, většina z 7 000 jazyků, které se mluví po celém světě, může být charakterizována jako jazyky s omezenými zdroji, protože chybí data, která by mohla být použita pro neuronové sítě.“

Technika Předtrénování

Většina těchto modelů spoléhá na techniku předtrénování, která zahrnuje představení modelu textu, ve kterém jsou některé slova skryté nebo maskované. Model pak musí uhodnout skrytá slova a tento proces se opakuje miliardykrát. Nakonec se naučí statistické asociace mezi slovy, což je podobné lidskému poznání jazyka.

Jimmy Lin je Cheriton Chair v počítačové vědě a Oguejiho poradce.

„Být schopni předtrénovat modely, které jsou stejně přesné pro určité úkoly, ale vyžadují mnohem menší množství dat, má mnoho výhod,“ řekl Lin. „Potřebovat méně dat k trénování jazykového modelu znamená, že je vyžadována méně výpočetní kapacity a následně nižší emise uhlíku spojené s provozem velkých datových center. Menší datové sady také使ují kuraci dat praktičtější, což je jeden z přístupů, jak snížit předpojatosti přítomné v modelech.“

„Tato práce představuje malý, ale důležitý krok k přinesení možností zpracování přirozeného jazyka více než 1,3 miliardám lidí na africkém kontinentu.“

Výzkum se také účastnil Yuxin Zhu, který nedávno dokončil bakalářské studium počítačové vědy na univerzitě.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.