Моделі та платформи ШІ

MOSEL: Розширення збору мовних даних для всіх європейських мов

mm
Додайте Unite.AI до бажаних джерел у Google

Розробка мовних моделей штучного інтелекту в основному була домінована англійською, залишаючи багато європейських мов недопредставленими. Це створило значальну нерівновагу у тому, як технології штучного інтелекту розуміють і реагують на різні мови та культури. MOSEL має на меті змінити цю ситуацію, створивши повну, відкриту колекцію мовних даних для 24 офіційних мов Європейського Союзу. Надавши різноманітні мовні дані, MOSEL прагне забезпечити, щоб моделі штучного інтелекту були більш інклюзивними та представницькими для багатої лінгвістичної карти Європи.

Розмаїття мов є важливим для забезпечення інклюзивності у розвитку штучного інтелекту. Надмірна залежність від англомовних моделей може призвести до технологій, які є менш ефективними або навіть недоступними для мовців інших мов. Багатомовні набори даних допомагають створити системи штучного інтелекту, які служать усім, незалежно від мови, якою вони говорять. Прийняття мовного розмаїття підвищує доступність технологій та забезпечує справедливе представництво різних культур і спільнот. Заохочуючи лінгвістичну інклюзивність, штучний інтелект може дійсно відображати різноманітні потреби та голоси своїх користувачів.

Огляд MOSEL

MOSEL, або Масивна відкрита мовна колекція для європейських мов, є новаторським проєктом, який має на меті створити повну, відкриту колекцію мовних даних, що охоплює всі 24 офіційні мови Європейського Союзу. Розроблений міжнародною командою дослідників, MOSEL інтегрує дані з 18 різних проєктів, таких як CommonVoice, LibriSpeech і VoxPopuli. Ця колекція включає як транскрибовані мовні записи, так і необроблені аудіодані, пропонуючи значний ресурс для розвитку багатомовного штучного інтелекту.

Одним з ключових внесків MOSEL є включення як транскрибованих, так і необроблених даних. Транскрибовані дані забезпечують надійну основу для навчання моделей штучного інтелекту, тоді як необроблені аудіодані можуть бути використані для подальших досліджень і експериментів, особливо для мов з обмеженими ресурсами. Комбінація цих наборів даних створює унікальну можливість розробки мовних моделей, які є більш інклюзивними та здатними зрозуміти різноманітну лінгвістичну картину Європи.

Закриття мовної прогалини для недопредставлених мов

Розподіл мовних даних по європейським мовам є дуже нерівномірним, з англійською, яка домінує у більшості доступних наборів даних. Ця нерівновага представляє значні виклики для розробки моделей штучного інтелекту, які можуть зрозуміти і точно відповісти на менш представлені мови. Багато офіційних мов ЄС, таких як мальтійська або ірландська, мають дуже обмежені дані, що ускладнює можливість технологій штучного інтелекту ефективно служити цим мовним спільнотам.

MOSEL має на меті закрити цю мовну прогалину, використовуючи модель Whisper від OpenAI для автоматичної транскрипції 441 000 годин раніше необроблених аудіоданих. Цей підхід значно розширив доступність навчальних матеріалів, особливо для мов, які раніше мали обмежені транскрибовані дані. Хоча автоматична транскрипція не є досконалою, вона забезпечує цінну основу для подальшого розвитку, дозволяючи створювати більш інклюзивні мовні моделі.

Однак виклики особливо очевидні для певних мов. Наприклад, модель Whisper мала труднощі з мальтійською, досягнувши рівня помилок у словах понад 80 відсотків. Такі високі рівні помилок підкреслюють необхідність додаткової роботи, включаючи покращення моделей транскрипції та збору більш високоякісних, ручних транскрипцій. Команда MOSEL присвячена продовжуванню цих зусиль, забезпечуючи, щоб навіть мови з обмеженими ресурсами могли виграти від досягнень у галузі штучного інтелекту.

Роль відкритого доступу у розвитку інновацій штучного інтелекту

Відкрита доступність MOSEL є ключовим фактором у розвитку інновацій у європейських дослідженнях штучного інтелекту. Надавши вільний доступ до мовних даних, MOSEL дозволяє дослідникам і розробникам працювати з розширеними, високоякісними наборами даних, які раніше були недоступні або обмежені. Ця доступність заохочує співробітництво та експериментування, створюючи спільноту, яка рухає розвиток технологій штучного інтелекту для всіх європейських мов.

Дослідники та розробники можуть використовувати дані MOSEL для навчання, тестування та вдосконалення мовних моделей штучного інтелекту, особливо для мов, які раніше були недопредставлені у ландшафті штучного інтелекту. Відкрита природа цих даних також дозволяє меншим організаціям та академічним установам брати участь у передових дослідженнях штучного інтелекту, розбиваючи бар’єри, які часто віддають перевагу великим технологічним компаніям з ексклюзивними ресурсами.

Майбутні напрямки та дорога вперед

Оглядаючи майбутнє, команда MOSEL планує продовжувати розширювати набір даних, особливо для недопредставлених мов. Збираючи більше даних та покращуючи точність автоматичних транскрипцій, MOSEL має на меті створити більш збалансований та інклюзивний ресурс для розвитку штучного інтелекту. Ці зусилля є важливими для забезпечення того, щоб усі європейські мови, незалежно від кількості мовців, мали місце у розвитку ландшафту штучного інтелекту.

Успіх MOSEL також може надихнути подібні ініціативи по всьому світу, просуваючи лінгвістичне розмаїття у штучному інтелекті за межами Європи. Закладаючи прецедент для відкритого доступу та спільного розвитку, MOSEL прокладає шлях для майбутніх проєктів, які ставлять інклюзивність та представництво у штучному інтелекті на перше місце, в кінцевому підсумку сприяючи більш справедливому технологічному майбутньому.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.