Моделі та платформи ШІ
Нова модель штучного інтелекту працює з більшим різноманіттям людських мов
Дослідники Університету Ватерлоо створили модель штучного інтелекту, яка дозволяє комп’ютерам обробляти більший діапазон людських мов. Це важливий крок вперед у галузі, враховуючи, скільки мов часто залишаються позаду в процесі програмування. Африканські мови часто не стають об’єктом уваги вчених-комп’ютерників, що призвело до обмеження можливостей обробки природної мови (NLP) на континенті.
Нова мова модель була розроблена командою дослідників школи комп’ютерних наук Девіда Р. Черитона Університету Ватерлоо.
Дослідження було представлено на семінарі з багатомовної обробки мови на конференції з емпіричних методів обробки природної мови 2021 року.
Модель грає ключову роль у допомозі комп’ютерам аналізувати тексти африканських мов для багатьох корисних завдань, і її називають AfriBERTa. Вона використовує техніки глибокого навчання для досягнення вражаючих результатів для мов з обмеженими ресурсами.
Робота з 11 африканськими мовами
AfriBERTa працює з 11 конкретними африканськими мовами на даний момент, включаючи амхарську, хаусу та суахілі, які розмовляють понад 400 мільйонів людей. Модель продемонструвала якість виводу, порівнянну з найкращими існуючими моделями, і зробила це, навчившись лише на одному гігабайті тексту. Інші подібні моделі часто вимагають тисяч разів більше даних.
Келечі Огеджі – студент магістратури комп’ютерних наук у Ватерлоо.
“Предварительно навчені мовні моделі змінили спосіб, у який комп’ютери обробляють і аналізують текстові дані для завдань, що варіюються від машинного перекладу до відповідей на питання”, – сказав Огеджі. “На жаль, африканські мови отримали мало уваги від дослідницької спільноти.”
“Однією з проблем є те, що нейронні мережі є дивовижними текстово- та обчислювально-інтенсивними для побудови. І на відміну від англійської, яка має величезну кількість доступного тексту, більшість з 7 000 мов, що говорять у світі, можна охарактеризувати як мови з обмеженими ресурсами, тобто немає достатньої кількості даних для годування даних-жадібних нейронних мереж.”
Техніка попереднього навчання
Більшість цих моделей залежить від техніки попереднього навчання, яка полягає в тому, що дослідник представляє модель тексту з деякими словами, які приховані або маскуються. Модель повинна вгадати приховані слова, і вона продовжує повторювати цей процес мільярди разів. Вона врешті-решт вчиться статистичних асоціацій між словами, що подібно до людського знання мови.
Джиммі Лін – голова кафедри комп’ютерних наук Черитона та науковий керівник Огеджі.
“Здатність попередньо навчити моделі, які є такими ж точними для певних завдань, але використовують значно менше даних, має багато переваг”, – сказав Лін. “Потрібно менше даних для навчання мовної моделі означає, що менше обчислень потрібно і, як наслідок, нижчі викиди вуглекислого газу, пов’язані з експлуатацією великих центрів обробки даних. Менші набори даних також роблять кураторство даних більш практичним, що є одним із підходів до зменшення упереджень, присутніх у моделях.”
“Ця робота робить малий, але важливий крок до надання можливостей обробки природної мови більш ніж 1,3 мільярдам людей на африканському континенті.”
У дослідженнях також брали участь Юксін Чжу, який недавно закінчив бакалаврат комп’ютерних наук у університеті.












