Модели и платформы ИИ
Исследователи стремятся расширить автоматическое распознавание речи до 2000 языков
Группа исследователей из Университета Карнеги-Меллона стремится расширить автоматическое распознавание речи до 2000 языков. На данный момент только часть из примерно 7000-8000 языков, на которых говорят в мире, могут воспользоваться современными языковыми технологиями, такими как транскрипция голоса в текст или автоматическая субтитрация.
Синьцзянь Ли – аспирант Школы компьютерных наук Института языковых технологий (LTI).
«Многие люди в мире говорят на различных языках, но языковые технологии не разрабатываются для всех из них», – сказал он. «Разработка технологий и хорошей языковой модели для всех людей является одной из целей этого исследования».
Ли входит в состав команды экспертов, которые стремятся упростить требования к данным, необходимым для разработки модели распознавания речи.
В команду также входят преподаватели LTI Синдзи Ватанабе, Флориян Метце, Дэвид Мортенсен и Алан Блэк.
Исследование под названием «ASR2K: Распознавание речи для около 2000 языков без аудио» было представлено на конференции Interspeech 2022 в Южной Корее.
Большинство существующих моделей распознавания речи требуют наборов текстовых и аудиоданных. Хотя текстовые данные существуют для тысяч языков, то же самое не верно для аудиоданных. Команда хочет исключить необходимость аудиоданных, сосредоточившись на лингвистических элементах, которые являются общими для многих языков.
Технологии распознавания речи обычно фокусируются на фонеме языка, которая представляет собой отдельные звуки, отличающие его от других языков. Эти фонемы уникальны для каждого языка. В то же время языки имеют фонеты, которые описывают, как слово звучит физически, и несколько фонет могут соответствовать одной фонеме. Хотя отдельные языки могут иметь разные фонемы, лежащие в основе фонеты могут быть одинаковыми.
Команда работает над моделью распознавания речи, которая опирается меньше на фонемы и больше на информацию о том, как фонеты делятся между языками. Это помогает уменьшить усилия, необходимые для создания отдельных моделей для каждого отдельного языка. При парировании модели с филогенетическим деревом, которое представляет собой диаграмму, отображающую отношения между языками, это помогает с правилами произношения. Модель команды и структура дерева позволили им приблизить модель речи для тысяч языков, даже без аудиоданных.
«Мы пытаемся исключить это требование аудиоданных, что помогает нам перейти от 100 до 200 языков к 2000», – сказал Ли. «Это первое исследование, целью которого является такое большое количество языков, и мы первая команда, которая стремится расширить языковые инструменты до этого объема».
Исследование, хотя оно еще находится на ранней стадии, уже улучшило существующие инструменты приближения языка на 5%.
«Каждый язык является очень важным фактором своей культуры. Каждый язык имеет свою собственную историю, и если вы не попытаетесь сохранить языки, эти истории могут быть утеряны», – сказал Ли. «Разработка такой системы распознавания речи и этого инструмента является шагом к попытке сохранить эти языки».












