Modelos y plataformas de IA
Investigadores desarrollan un modelo de reconocimiento del habla humana con redes neuronales profundas
Un grupo de investigadores de Alemania está explorando un nuevo modelo de reconocimiento del habla humana basado en el aprendizaje automático y las redes neuronales profundas. El nuevo modelo podría ayudar a mejorar significativamente el reconocimiento del habla humana.
Los algoritmos de audífonos suelen utilizarse para mejorar el reconocimiento del habla humana, y se evalúan a través de varios experimentos que determinan la relación señaligen/ruido a la que se reconocen un cierto número de palabras. Sin embargo, estos experimentos suelen ser largos y costosos.
El nuevo modelo se detalló en una investigación publicada en The Journal of the Acoustical Society of America.
Predicciones para oyentes con discapacidad auditiva
Jana Roßbach es una de las autoras de la Universidad Carl Von Ossietzky.
“La novedad de nuestro modelo es que proporciona buenas predicciones para oyentes con discapacidad auditiva para tipos de ruido con muy diferente complejidad y muestra tanto errores bajos como alta correlación con los datos medidos”, dijo Roßbach.
El equipo de investigadores calculó cuántas palabras por oración un oyente podría entender a través del reconocimiento automático del habla (ASR). Las herramientas de reconocimiento del habla como Alexa y Siri dependen de este ASR, que está ampliamente disponible.
El estudio y los resultados
El estudio realizado por el equipo involucró a ocho personas con audición normal y 20 con discapacidad auditiva. Los oyentes fueron expuestos a muchos ruidos complejos que ocultaban el habla, y los oyentes con discapacidad auditiva se categorizaron en tres grupos según su nivel de pérdida de audición relacionada con la edad.
A través del nuevo modelo, los investigadores pudieron predecir el rendimiento del reconocimiento del habla humana de oyentes con discapacidad auditiva con diferentes grados de pérdida de audición. Pudieron hacer estas predicciones para varios enmascaradores de ruido con diferentes complejidades en la modulación temporal y cómo se asemejaban al habla real. Todo esto permitió que cada persona fuera observada y analizada individualmente en cuanto a la posible pérdida de audición.
“Estuvimos más sorprendidos de que las predicciones funcionaran bien para todos los tipos de ruido. Esperábamos que el modelo tuviera problemas cuando se utilizara un solo hablante competidor. Sin embargo, no fue el caso”, dijo Roßbach.
Dado que el modelo se centró en la audición con un solo oído, el equipo ahora buscará crear un modelo binaural para la audición con dos oídos. También dicen que el nuevo modelo podría utilizarse para predecir el esfuerzo de escucha o la calidad del habla.












