Модели и платформы ИИ

Исследователи разрабатывают модель распознавания человеческой речи с помощью глубоких нейронных сетей

mm
Добавьте Unite.AI в избранные источники в Google

Группа исследователей из Германии изучает новую модель распознавания человеческой речи на основе машинного обучения и глубоких нейронных сетей. Эта новая модель может существенно улучшить распознавание человеческой речи.

Алгоритмы слуховых аппаратов обычно используются для улучшения распознавания человеческой речи и оцениваются через различные эксперименты, которые определяют отношение сигнала к шуму, при котором распознается определенное количество слов. Однако эти эксперименты часто являются длительными и дорогими.

Новая модель была описана в исследовании, опубликованном в Журнале Акустического Общества Америки.

Прогнозы для слушателей с нарушениями слуха

Яна Рёссбах является одним из авторов из Университета Карла фон Оссицкого.

“Новизна нашей модели заключается в том, что она обеспечивает хорошие прогнозы для слушателей с нарушениями слуха для шумов с очень разной сложностью и показывает как низкие ошибки, так и высокую корреляцию с измеренными данными”, сказала Рёссбах.

Команда исследователей рассчитала, сколько слов в предложении мог понять слушатель через автоматическое распознавание речи (ASR). Инструменты распознавания речи, такие как Alexa и Siri, полагаются на это ASR, которое широко доступно.

Исследование и результаты

Исследование, проведенное командой, включало восемь людей с нормальным слухом и 20 человек с нарушениями слуха. Слушатели были подвергнуты воздействию многих разных сложных шумов, которые скрывали речь, и люди с нарушениями слуха были разделены на три группы в зависимости от уровня возрастного ухудшения слуха.

Благодаря новой модели исследователи смогли предсказать производительность распознавания человеческой речи для слушателей с различными степенями нарушений слуха. Они смогли сделать эти прогнозы для различных маскирующих шумов с разной сложностью во временной модуляции и их подобием реальной речи. Все это позволило каждому человеку быть наблюдаемым и проанализированным индивидуально в отношении возможных нарушений слуха.

“Мы были наиболее удивлены тем, что прогнозы хорошо сработали для всех типов шума. Мы ожидали, что модель будет иметь проблемы при использовании одного конкурирующего говорящего. Однако этого не произошло”, сказала Рёссбах.

Поскольку модель была сосредоточена на односidedном слухе, команда теперь будет работать над созданием бинауральной модели для двухушного слуха. Они также говорят, что новая модель может быть использована для предсказания усилий слушания или качества речи.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.