Modelos y plataformas de IA

Auriculares de IA que te permiten escuchar a una persona en una multitud

mm
Añade Unite.AI a tus fuentes preferidas en Google

En un entorno ruidoso y concurrido, ¿alguna vez has deseado poder silenciar todo el murmullo de fondo y centrarte únicamente en la persona con la que estás tratando de hablar? Aunque los auriculares con cancelación de ruido han avanzado mucho en la creación de una especie de “pizarra en blanco” auditiva, todavía luchan por permitir que sonidos específicos del entorno del usuario filtren a través. Pero, ¿qué pasa si tus auriculares pudieran ser entrenados para detectar y amplificar la voz de una sola persona, incluso mientras te mueves por una habitación llena de otras conversaciones?

Target Speech Hearing (TSH), un sistema de IA innovador desarrollado por investigadores de la Universidad de Washington, está avanzando en este ámbito.

Cómo funciona Target Speech Hearing

Para utilizar TSH, una persona que lleva auriculares especialmente equipados solo necesita mirar a la persona que quiere escuchar durante unos segundos. Este breve período de “inscripción” permite que el sistema de IA aprenda y se enganche a los patrones vocales únicos del hablante objetivo.

Aquí está cómo funciona bajo la superficie:

  1. El usuario presiona un botón mientras dirige su cabeza hacia el hablante deseado durante 3-5 segundos.
  2. Los micrófonos en ambos lados del auricular capturan las ondas sonoras de la voz del hablante simultáneamente (con un margen de error de 16 grados).
  3. Los auriculares transmiten esta señal de audio a un ordenador integrado.
  4. El software de aprendizaje automático analiza la voz y crea un modelo de las características vocales distintivas del hablante.
  5. El sistema de IA utiliza este modelo para aislar y amplificar la voz del hablante inscrito en tiempo real, incluso mientras el usuario se mueve en un entorno ruidoso.

Cuanto más hable el hablante objetivo, más datos de entrenamiento recibe el sistema, lo que le permite centrarse y aclarar la voz deseada. Este enfoque innovador de “audición selectiva” abre un mundo de posibilidades para mejorar la comunicación y la accesibilidad en entornos auditivos desafiantes.

Shyam Gollakota es el autor principal del artículo y profesor de la Universidad de Washington en la Escuela de Ciencias y Ingeniería de la Computadora Paul G. Allen

“Tendemos a pensar en la IA ahora como chatbots basados en la web que responden preguntas. Pero en este proyecto, desarrollamos la IA para modificar la percepción auditiva de cualquier persona que lleve auriculares, según sus preferencias. Con nuestros dispositivos, ahora puedes escuchar a un solo hablante con claridad, incluso si estás en un entorno ruidoso con muchas otras personas hablando.” – Gollakota

Probando auriculares de IA con TSH

Para poner a prueba Target Speech Hearing, el equipo de investigación llevó a cabo un estudio con 21 participantes. Cada sujeto llevó los auriculares habilitados con TSH y se inscribió en un hablante objetivo en un entorno ruidoso. Los resultados fueron impresionantes: en promedio, los usuarios calificaron la claridad de la voz del hablante inscrito como casi el doble en comparación con la señal de audio sin filtrar.

Este avance se basa en el trabajo anterior del equipo sobre “audición semántica”, que permitió a los usuarios filtrar su entorno auditivo según clasificaciones de sonido predefinidas, como el canto de los pájaros o las voces humanas. TSH lleva este concepto un paso más allá al permitir la amplificación selectiva de la voz de un individuo específico.

Las implicaciones son significativas, desde mejorar las conversaciones personales en entornos ruidosos hasta mejorar la accesibilidad para aquellos con discapacidades auditivas. A medida que la tecnología se desarrolla, podría cambiar fundamentalmente cómo experimentamos e interactuamos con nuestro mundo auditivo.

Mejorando auriculares de IA y superando limitaciones

Aunque Target Speech Hearing representa un gran avance en la IA auditiva, el sistema tiene algunas limitaciones en su forma actual:

  • Inscripción de un solo hablante: actualmente, TSH solo puede ser entrenado para centrarse en un hablante a la vez. La inscripción de múltiples hablantes simultáneamente no es posible aún.
  • Interferencia de fuentes de audio similares: si otra voz fuerte proviene de la misma dirección que el hablante objetivo durante el proceso de inscripción, el sistema puede luchar por aislar los patrones vocales del individuo deseado.
  • Reinscripción manual: si el usuario no está satisfecho con la calidad del audio después del entrenamiento inicial, debe reinscribir manualmente al hablante objetivo para mejorar la claridad.

A pesar de estas limitaciones, el equipo de la Universidad de Washington está trabajando activamente en refinar y expandir las capacidades de TSH. Uno de sus objetivos principales es miniaturizar la tecnología, lo que permitiría integrarla sin problemas en productos de consumo como auriculares y audífonos.

A medida que los investigadores siguen empujando los límites de lo que es posible con la IA auditiva, las aplicaciones potenciales son vastas, desde mejorar la productividad en entornos de oficina distractores hasta facilitar una comunicación más clara para los primeros respondientes y el personal militar en situaciones de alto riesgo. El futuro de la audición selectiva se ve brillante, y Target Speech Hearing está en posición de desempeñar un papel fundamental en su configuración.

Alex McFarland es un periodista y escritor de inteligencia artificial que explora los últimos desarrollos en inteligencia artificial. Ha colaborado con numerosas startups y publicaciones de inteligencia artificial en todo el mundo.