Modele i platformy AI
Nowy model AI współpracuje z większą różnorodnością języków ludzkich
Naukowcy z Uniwersytetu w Waterloo opracowali model AI, który umożliwia komputerom przetwarzanie większej różnorodności języków ludzkich. Jest to ważny krok naprzód w tej dziedzinie, biorąc pod uwagę, ile języków często pozostaje pomijanych w procesie programowania. Języki afrykańskie często nie są brane pod uwagę przez naukowców komputerowych, co doprowadziło do ograniczeń w zakresie przetwarzania języka naturalnego (NLP) na kontynencie.
Nowy model językowy został opracowany przez zespół naukowców z Wydziału Informatyki Uniwersytetu w Waterloo.
Badania były przedstawione na warsztacie Multilingual Representation Learning Workshop na Konferencji Empirical Methods in Natural Language Processing w 2021 roku.
Model odgrywa kluczową rolę w pomocy komputerom w analizie tekstu w językach afrykańskich w wielu przydatnych zadaniach, a nazywa się AfriBERTa. Wykorzystuje techniki głębokiego uczenia, aby osiągnąć imponujące wyniki dla języków o niskich zasobach.
Współpraca z 11 językami afrykańskimi
AfriBERTa współpracuje z 11 konkretnymi językami afrykańskimi, w tym z językiem amharskim, hausa i suahili, którym posługuje się łącznie ponad 400 milionów ludzi. Model wykazał jakość wyjściową porównywalną do najlepszych istniejących modeli, a wszystko to osiągnął, ucząc się z jednego gigabajta tekstu. Inne podobne modele często wymagają tysiąc razy więcej danych.
Kelechi Ogueji jest studentem studiów magisterskich na kierunku informatyka na Uniwersytecie w Waterloo.
„Wstępnie wytrenowane modele językowe zmieniły sposób, w jaki komputery przetwarzają i analizują dane tekstowe w zadaniach od tłumaczenia maszynowego do odpowiedzi na pytania”, powiedział Ogueji. „Niestety, języki afrykańskie otrzymały niewielką uwagę ze strony społeczności badawczej.”
„Jednym z wyzwań jest to, że sieci neuronowe są niezwykle wymagające pod względem tekstu i komputera przy budowaniu. A w przeciwieństwie do języka angielskiego, który ma ogromne ilości dostępnego tekstu, większość z 7 000 języków mówionych na świecie może być określona jako o niskich zasobach, co oznacza brak danych do karmienia głodnych sieci neuronowych.”
Technika wstępnego szkolenia
Większość tych modeli opiera się na technice wstępnego szkolenia, która polega na tym, że badacz przedstawia modelowi tekst, w którym niektóre słowa są ukryte lub zamaskowane. Model musi następnie odgadnąć ukryte słowa, a proces ten powtarza się miliardy razy. W końcu uczy się on statystycznych zależności między słowami, co jest podobne do ludzkiej wiedzy o języku.
Jimmy Lin jest przewodniczącym katedry informatyki i doradcą Ogueji.
„Możliwość wstępnego szkolenia modeli, które są równie dokładne w określonych zadaniach, ale przy użyciu znacznie mniejszych ilości danych, ma wiele zalet”, powiedział Lin. „Potrzeba mniejszej ilości danych do szkolenia modelu językowego oznacza, że wymagana jest mniej obliczeń i w konsekwencji niższe emisje dwutlenku węgla związane z eksploatacją wielkich centrów danych. Mniejsze zestawy danych również sprawiają, że kuracja danych staje się bardziej praktyczna, co jest jednym ze sposobów redukcji uprzedzeń obecnych w modelach.”
„Praca ta stanowi niewielki, ale ważny krok w kierunku udostępnienia możliwości przetwarzania języka naturalnego ponad 1,3 miliardowi ludzi na kontynencie afrykańskim.”
W badaniach uczestniczył również Yuxin Zhu, który niedawno ukończył studia licencjackie na kierunku informatyka na uniwersytecie.












