Моделі та платформи ШІ

Дослідники намагаються розширити автоматичне розпізнавання мови до 2000 мов

mm
Додайте Unite.AI до бажаних джерел у Google

Група дослідників з Університету Карнегі-Меллона намагається розширити автоматичне розпізнавання мови до 2000 мов. На даний момент лише частина з приблизно 7000 до 8000 мов, що використовуються у світі, можуть користуватися сучасними мовними технологіями, такими як транскрипція голосу у текст або автоматичне створення субтитрів.

Сіньцзянь Лі – аспірант Школи комп’ютерних наук Інституту мовних технологій (LTI).

“Багато людей у світі говорять різними мовами, але мовні технології не розробляються для всіх із них”, – сказав він. “Розробка технологій і хорошої мовної моделі для всіх людей – одна з цілей цього дослідження”.

Лі належить до команди експертів, які намагаються спростити вимоги до даних мов для розробки моделі розпізнавання мови.

У команду також входять члени факультету LTI Шінджі Ватанабе, Флоріан Метце, Девід Мортенсен і Алан Блек.

Дослідження під назвою “ASR2K: Розпізнавання мови для близько 2000 мов без аудіо” було представлено на конференції Interspeech 2022 у Південній Кореї.

Більшість існуючих моделей розпізнавання мови вимагають наборів текстових і аудіоданих. Хоча текстові дані існують для тисяч мов, те ж саме не стосується аудіоданих. Команда хоче ліквідувати потребу в аудіоданих, зосередившись на лінгвістичних елементах, які є спільними для багатьох мов.

Технології розпізнавання мови зазвичай зосереджуються на фонемах мови, які є відмінними звуками, що відрізняють її від інших мов. Ці фонеми унікальні для кожної мови. Одночасно мови мають фонеми, які описують, як слово звучить фізично, і кілька фонем можуть відповідати одній фонемі. Хоча окремі мови можуть мати різні фонеми, підлеглі фонеми можуть бути однаковими.

Команда працює над моделлю розпізнавання мови, яка менше залежить від фонем і більше від інформації про те, як фонеми спільно використовуються між мовами. Це giúp зменшити зусилля, необхідні для побудови окремих моделей для кожної окремої мови. Паруючись модель з філогенетичним деревом, яке є діаграмою, що відображає відносини між мовами, допомагає з правилами вимови. Модель команди і структура дерева дозволили їм наблизити модель мови для тисяч мов навіть без аудіоданих.

“Ми намагаємося ліквідувати цю вимогу до аудіоданих, що допомагає нам перейти від 100 до 200 мов до 2000”, – сказав Лі. “Це перше дослідження, яке націлене на таку велику кількість мов, і ми перша команда, яка намагається розширити мовні інструменти до такого масштабу”.

Дослідження, хоча ще на ранній стадії, покращило існуючі інструменти наближення мови на 5%.

“Кожна мова є дуже важливим фактором її культури. Кожна мова має свою власну історію, і якщо ви не намагаєтеся зберегти мови, ці історії можуть бути втрачені”, – сказав Лі. “Розробка такого типу системи розпізнавання мови і цього інструменту – це крок, щоб спробувати зберегти ці мови”.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.