AI-modeller og platforme
Ny AI-model arbejder med en bredere variation af menneskesprog
Forskere ved University of Waterloo har udviklet en AI-model, der giver computere mulighed for at behandle en bredere variation af menneskesprog. Dette er et vigtigt skridt fremad i feltet, da mange sprog ofte bliver overset i programmeringsprocessen. Afrikanske sprog bliver ofte ikke fokuseret på af computerforskere, hvilket har ført til, at naturligt sprogbehandling (NLP) kapaciteterne er begrænsede på kontinentet.
Den nye sprogmodel er udviklet af et hold af forskere ved University of Waterloos David R. Cheriton School of Computer Science.
Den forskning blev præsenteret på Multilingual Representation Learning Workshop på 2021 Conference on Empirical Methods in Natural Language Processing.
Modellen spiller en nøglerolle i at hjælpe computere med at analysere tekst på afrikanske sprog til mange nyttige opgaver, og den kaldes AfriBERTa. Den bruger dyb-lærings-teknikker til at opnå imponerende resultater for lav-resurs-sprog.
Arbejde med 11 afrikanske sprog
AfriBERTa arbejder med 11 specifikke afrikanske sprog lige nu, herunder Amharic, Hausa og Swahili, som tales af en kombineret 400+ millioner mennesker. Modellen har demonstreret output-kvalitet, der er sammenlignelig med de bedste eksisterende modeller, og den gjorde det, mens den kun lærte fra en gigabyte tekst. Andre lignende modeller kræver ofte tusinder af gange mere data.
Kelechi Ogueji er en master-student i computervidenskab ved Waterloo.
“Forudtrænede sprogmodeller har forandret måden, computere behandler og analyserer tekstdata for opgaver, der strækker sig fra maskinoversættelse til spørgsmålssvar,” sagde Ogueji. “Desværre har afrikanske sprog fået lidt opmærksomhed fra forskningssamfundet.”
“En af udfordringerne er, at neurale netværk er forbløffende tekst- og computer-intensive at bygge. Og til forskel fra engelsk, der har enorme mængder af tilgængelig tekst, kan de fleste af de 7.000 eller så sprog, der tales verden over, karakteriseres som lav-resurs, i og med der er en mangel på data tilgængelig for at føde data-sultne neurale netværk.”
Forudtræningsteknik
De fleste af disse modeller afhænger af en forudtræningsteknik, der indebærer, at forskeren præsenterer modellen med tekst, der har nogle af ordene skjult eller maskeret. Modellen skal så gætte de skjulte ord og gentage processen milliarder af gange. Den lærer til sidst de statistiske associationer mellem ord, der er lignende med menneskets viden om sprog.
Jimmy Lin er Cheriton Chair i Computer Science og Oguejis vejleder.
“At kunne forudtræne modeller, der er lige så nøjagtige for visse downstream-opgaver, men bruger langt mindre data, har mange fordele,” sagde Lin. “At behøve mindre data til at træne sprogmodellen betyder, at der kræves mindre beregning og følgelig lavere kulstofemissioner forbundet med drift af massive datacentre. Mindre datasets gør det også mere praktisk at kuraterer data, hvilket er en tilgang til at reducere fordommene, der er til stede i modellerne.”
“Dette arbejde tager et lille, men vigtigt skridt mod at bringe naturlig sprogbehandlingsevner til over 1,3 milliarder mennesker på den afrikanske kontinent.”
Forskningen involverede også Yuxin Zhu, der nylig afsluttede en bacheloruddannelse i computervidenskab ved universitetet.












