AI-modellen en platforms
Nieuw AI-model werkt met een bredere variëteit aan menselijke talen
Onderzoekers aan de Universiteit van Waterloo hebben een AI-model ontwikkeld dat computers in staat stelt om een bredere variëteit aan menselijke talen te verwerken. Dit is een belangrijke stap vooruit in het veld, gezien het feit dat veel talen vaak worden achtergelaten in het programmeringsproces. Afrikaanse talen krijgen vaak geen aandacht van computerwetenschappers, wat heeft geleid tot beperkte natuurlijke taalverwerking (NLP) mogelijkheden op het continent.
Het nieuwe taalmodel is ontwikkeld door een team van onderzoekers aan de David R. Cheriton School of Computer Science van de Universiteit van Waterloo.
Het onderzoek werd gepresenteerd op de Multilingual Representation Learning Workshop op de 2021 Conference on Empirical Methods in Natural Language Processing.
Het model speelt een sleutelrol in het helpen van computers om tekst in Afrikaanse talen te analyseren voor veel nuttige taken, en het wordt AfriBERTa genoemd. Het gebruikt diepe leer technieken om indrukwekkende resultaten te behalen voor talen met weinig bronnen.
Samenwerking met 11 Afrikaanse talen
AfriBERTa werkt met 11 specifieke Afrikaanse talen, waaronder Amharic, Hausa en Swahili, die door een combinatie van 400+ miljoen mensen worden gesproken. Het model heeft een uitvoer kwaliteit aangetoond die vergelijkbaar is met de bestaande modellen, en het deed dit terwijl het alleen leerde van één gigabyte aan tekst. Andere vergelijkbare modellen vereisen vaak duizenden keer meer gegevens.
Kelechi Ogueji is een masterstudent in computerwetenschappen aan Waterloo.
“Voorgeprogrammeerde taalmodellen hebben de manier waarop computers tekstuele gegevens verwerken en analyseren voor taken zoals machinevertaling en vraagbeantwoording, getransformeerd,” zei Ogueji. “Helaas hebben Afrikaanse talen weinig aandacht gekregen van de onderzoekscommunity.”
“Een van de uitdagingen is dat neurale netwerken verbijsterend tekst- en computerintensief zijn om te bouwen. En in tegenstelling tot het Engels, dat enorme hoeveelheden beschikbare tekst heeft, kunnen de meeste van de 7.000 talen die wereldwijd worden gesproken, worden gekarakteriseerd als talen met weinig bronnen, omdat er een gebrek is aan gegevens om de data-hongerige neurale netwerken te voeden.”
Pre-training techniek
De meeste van deze modellen vertrouwen op een pre-training techniek, die inhoudt dat de onderzoeker het model voorlegt aan tekst met sommige woorden verborgen of gemaskeerd. Het model moet dan de verborgen woorden raden, en het herhaalt dit proces miljarden keren. Het leert uiteindelijk de statistische associaties tussen woorden, die vergelijkbaar zijn met de menselijke kennis van taal.
Jimmy Lin is de Cheriton Chair in Computer Science en Ogueji’s adviseur.
“Het kunnen pretrainen van modellen die even nauwkeurig zijn voor bepaalde downstream taken, maar met veel kleinere hoeveelheden gegevens, heeft veel voordelen,” zei Lin. “Minder gegevens nodig om het taalmodel te trainen betekent minder berekening en gevolglijk lagere koolstofemissies die samenhangen met het exploiteren van enorme gegevenscentra. Kleinere datasets maken het ook praktischer om gegevens te cureren, wat een benadering is om de vooroordelen in de modellen te verminderen.”
“Dit werk zet een kleine maar belangrijke stap naar het brengen van natuurlijke taalverwerking mogelijkheden naar meer dan 1,3 miljard mensen op het Afrikaanse continent.”
Het onderzoek werd ook uitgevoerd door Yuxin Zhu, die onlangs een undergraduate diploma in computerwetenschappen aan de universiteit behaalde.












