Моделі та платформи ШІ

Нова модель штучного інтелекту працює з більшим різноманіттям людських мов

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники Університету Ватерлоо створили модель штучного інтелекту, яка дозволяє комп’ютерам обробляти більший діапазон людських мов. Це важливий крок вперед у галузі, враховуючи, скільки мов часто залишаються позаду в процесі програмування. Африканські мови часто не стають об’єктом уваги вчених-комп’ютерників, що призвело до обмеження можливостей обробки природної мови (NLP) на континенті.

Нова мова модель була розроблена командою дослідників школи комп’ютерних наук Девіда Р. Черитона Університету Ватерлоо.

Дослідження було представлено на семінарі з багатомовної обробки мови на конференції з емпіричних методів обробки природної мови 2021 року.

Модель грає ключову роль у допомозі комп’ютерам аналізувати тексти африканських мов для багатьох корисних завдань, і її називають AfriBERTa. Вона використовує техніки глибокого навчання для досягнення вражаючих результатів для мов з обмеженими ресурсами.

Робота з 11 африканськими мовами

AfriBERTa працює з 11 конкретними африканськими мовами на даний момент, включаючи амхарську, хаусу та суахілі, які розмовляють понад 400 мільйонів людей. Модель продемонструвала якість виводу, порівнянну з найкращими існуючими моделями, і зробила це, навчившись лише на одному гігабайті тексту. Інші подібні моделі часто вимагають тисяч разів більше даних.

Келечі Огеджі – студент магістратури комп’ютерних наук у Ватерлоо.

“Предварительно навчені мовні моделі змінили спосіб, у який комп’ютери обробляють і аналізують текстові дані для завдань, що варіюються від машинного перекладу до відповідей на питання”, – сказав Огеджі. “На жаль, африканські мови отримали мало уваги від дослідницької спільноти.”

“Однією з проблем є те, що нейронні мережі є дивовижними текстово- та обчислювально-інтенсивними для побудови. І на відміну від англійської, яка має величезну кількість доступного тексту, більшість з 7 000 мов, що говорять у світі, можна охарактеризувати як мови з обмеженими ресурсами, тобто немає достатньої кількості даних для годування даних-жадібних нейронних мереж.”

Техніка попереднього навчання

Більшість цих моделей залежить від техніки попереднього навчання, яка полягає в тому, що дослідник представляє модель тексту з деякими словами, які приховані або маскуються. Модель повинна вгадати приховані слова, і вона продовжує повторювати цей процес мільярди разів. Вона врешті-решт вчиться статистичних асоціацій між словами, що подібно до людського знання мови.

Джиммі Лін – голова кафедри комп’ютерних наук Черитона та науковий керівник Огеджі.

“Здатність попередньо навчити моделі, які є такими ж точними для певних завдань, але використовують значно менше даних, має багато переваг”, – сказав Лін. “Потрібно менше даних для навчання мовної моделі означає, що менше обчислень потрібно і, як наслідок, нижчі викиди вуглекислого газу, пов’язані з експлуатацією великих центрів обробки даних. Менші набори даних також роблять кураторство даних більш практичним, що є одним із підходів до зменшення упереджень, присутніх у моделях.”

“Ця робота робить малий, але важливий крок до надання можливостей обробки природної мови більш ніж 1,3 мільярдам людей на африканському континенті.”

У дослідженнях також брали участь Юксін Чжу, який недавно закінчив бакалаврат комп’ютерних наук у університеті.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.