Моделі та платформи ШІ

Дослідники розробили модель розпізнавання людської мови з використанням глибоких нейронних мереж

mm
Додайте Unite.AI до бажаних джерел у Google

Група дослідників з Німеччини розробляє нову модель розпізнавання людської мови на основі машинного навчання та глибоких нейронних мереж. Ця нова модель може суттєво покращити розпізнавання людської мови.

Алгоритми слухових апаратів зазвичай використовуються для покращення розпізнавання людської мови, і їх оцінюють за допомогою різних експериментів, які визначають співвідношення сигналу до шуму, при якому розпізнається певна кількість слів. Однак ці експерименти часто є тривалими та дорогими.

Нова модель була детально описана у дослідженнях, опублікованих у Журналі Акустичного товариства Америки.

Прогнози для слухових порушень

Яна Роßбах є однією з авторів університету Карла фон Оссієцького.

“Новизна нашої моделі полягає в тому, що вона забезпечує хороші прогнози для слухових порушень для шумів з різною складністю та показує низькі помилки та високу кореляцію з виміряними даними”, – сказала Роßбах.

Команда дослідників розрахувала, скільки слів за речення слухач може зрозуміти за допомогою автоматичного розпізнавання мови (ASR). Інструменти розпізнавання мови, такі як Alexa та Siri, залежать від цього ASR, яке широко доступне.

Дослідження та результати

Дослідження, проведене командою, включало вісім осіб з нормальним слухом та 20 осіб зі слуховими порушеннями. Слухачів піддавали впливу багатьох різних складних шумів, які маскували мову, а слухові порушення були розділені на три групи залежно від рівня вікової втрати слуху.

За допомогою нової моделі дослідники змогли передбачити результати розпізнавання людської мови для слухових порушень з різними ступенями втрати слуху. Вони змогли зробити ці прогнози для різних маскуючих шумів з різною складністю у часовій модуляції та їхньої подібності до реальної мови. Все це дозволило спостерігати та аналізувати кожну особу окремо щодо можливої втрати слуху.

“Нас найvíce здивувало, що прогнози добре працювали для всіх типів шуму. Ми очікували, що модель матиме проблеми при використанні одного конкуруючого мовця. Однак цього не сталося”, – сказала Роßбах.

Оскільки модель була орієнтована на односторонній слух, команда тепер планує створити бінауральну модель для двостороннього слуху. Вони також стверджують, що нова модель може бути використана для передбачення зусиль слухання або якості мови.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.