Моделі та платформи ШІ

Нова модель штучного інтелекту працює з більшим різноманіттям людських мов

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники Університету Ватерлоо створили модель штучного інтелекту, яка дозволяє комп’ютерам обробляти більший діапазон людських мов. Це важливий крок вперед у галузі, враховуючи, скільки мов часто залишаються позаду в процесі програмування. Африканські мови часто не стають об’єктом уваги вчених-комп’ютерників, що призвело до обмеження можливостей обробки природної мови (NLP) на континенті.

Нова мова модель була розроблена командою дослідників школи комп’ютерних наук Девіда Р. Черитона Університету Ватерлоо.

Дослідження було представлено на семінарі з багатомовної обробки мови на конференції з емпіричних методів обробки природної мови 2021 року.

Модель грає ключову роль у допомозі комп’ютерам аналізувати тексти африканських мов для багатьох корисних завдань, і її називають AfriBERTa. Вона використовує техніки глибокого навчання для досягнення вражаючих результатів для мов з обмеженими ресурсами.

Робота з 11 африканськими мовами

AfriBERTa працює з 11 конкретними африканськими мовами на даний момент, включаючи амхарську, хаусу та суахілі, які розмовляють понад 400 мільйонів людей. Модель продемонструвала якість виводу, порівнянну з найкращими існуючими моделями, і зробила це, навчившись лише на одному гігабайті тексту. Інші подібні моделі часто вимагають тисяч разів більше даних.

Келечі Огеджі – студент магістратури комп’ютерних наук у Ватерлоо.

“Предварительно навчені мовні моделі змінили спосіб, у який комп’ютери обробляють і аналізують текстові дані для завдань, що варіюються від машинного перекладу до відповідей на питання”, – сказав Огеджі. “На жаль, африканські мови отримали мало уваги від дослідницької спільноти.”

“Однією з проблем є те, що нейронні мережі є дивовижними текстово- та обчислювально-інтенсивними для побудови. І на відміну від англійської, яка має величезну кількість доступного тексту, більшість з 7 000 мов, що говорять у світі, можна охарактеризувати як мови з обмеженими ресурсами, тобто немає достатньої кількості даних для годування даних-жадібних нейронних мереж.”

Техніка попереднього навчання

Більшість цих моделей залежить від техніки попереднього навчання, яка полягає в тому, що дослідник представляє модель тексту з деякими словами, які приховані або маскуються. Модель повинна вгадати приховані слова, і вона продовжує повторювати цей процес мільярди разів. Вона врешті-решт вчиться статистичних асоціацій між словами, що подібно до людського знання мови.

Джиммі Лін – голова кафедри комп’ютерних наук Черитона та науковий керівник Огеджі.

“Здатність попередньо навчити моделі, які є такими ж точними для певних завдань, але використовують значно менше даних, має багато переваг”, – сказав Лін. “Потрібно менше даних для навчання мовної моделі означає, що менше обчислень потрібно і, як наслідок, нижчі викиди вуглекислого газу, пов’язані з експлуатацією великих центрів обробки даних. Менші набори даних також роблять кураторство даних більш практичним, що є одним із підходів до зменшення упереджень, присутніх у моделях.”

“Ця робота робить малий, але важливий крок до надання можливостей обробки природної мови більш ніж 1,3 мільярдам людей на африканському континенті.”

У дослідженнях також брали участь Юксін Чжу, який недавно закінчив бакалаврат комп’ютерних наук у університеті.

Alex очолює новинні операції Unite.AI, що працюють на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію, щоб підтримувати своєчасне та масштабоване висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок у сфері ШІ, зберігаючи редакційні стандарти видання.