Modelos y plataformas de IA
Investigadores de IA diseñan programa para generar efectos de sonido para películas y otros medios
Investigadores de la Universidad de Texas en San Antonio han creado una aplicación basada en IA capaz de observar las acciones que tienen lugar en un video y crear efectos de sonido artificiales para acompañar esas acciones. Los efectos de sonido generados por el programa son tan realistas que, cuando se les pidió a observadores humanos que los evaluaran, la mayoría pensó que los efectos de sonido eran legítimos.
El programa responsable de generar los efectos de sonido, AudioFoley, se describió en un estudio publicado recientemente en IEEE Transactions on Multimedia. Según IEEE Spectrum, el programa de IA fue desarrollado por Jeff Provost, profesor de la Universidad de Texas en San Antonio, y la estudiante de doctorado Sanchita Ghose. Los investigadores crearon el programa utilizando varios modelos de aprendizaje automático combinados.
La primera tarea para generar efectos de sonido adecuados para las acciones en la pantalla fue reconocer esas acciones y asignarlas a efectos de sonido. Para lograr esto, los investigadores diseñaron dos modelos de aprendizaje automático diferentes y probaron sus enfoques diferentes. El primer modelo opera extrayendo fotogramas de los videos que se le proporcionan y analizando esos fotogramas en busca de características relevantes como movimientos y colores. Luego, se empleó un segundo modelo para analizar cómo cambia la posición de un objeto a lo largo de los fotogramas, para extraer información temporal. Esta información temporal se utiliza para anticipar las próximas acciones probables en el video. Los dos modelos tienen métodos diferentes para analizar las acciones en el clip, pero ambos utilizan la información contenida en el clip para adivinar qué sonido acompañaría mejor.
La siguiente tarea es sintetizar el sonido, y esto se logra emparejando actividades/movimientos predichos con posibles muestras de sonido. Según Ghose y Prevost, AutoFoley se utilizó para generar sonido para 1000 clips cortos, que presentaban acciones y objetos como un incendio, un caballo corriendo, relojes de péndulo y lluvia cayendo sobre plantas. Si bien AutoFoley tuvo más éxito al crear sonido para clips donde no necesitaba una coincidencia perfecta entre las acciones y los sonidos, y tuvo dificultades para emparejar clips donde las acciones ocurrían con más variación, el programa aún pudo engañar a muchos observadores humanos para que eligieran sus sonidos generados sobre el sonido que originalmente acompañaba al clip.
Prevost y Ghose reclutaron a 57 estudiantes universitarios y les pidieron que vieran diferentes clips. Algunos clips contenían el audio original, mientras que otros contenían audio generado por AutoFoley. Cuando se probó el primer modelo, aproximadamente el 73% de los estudiantes seleccionó el audio sintetizado como el audio original, descartando el sonido real que acompañaba al clip. El otro modelo funcionó ligeramente peor, con solo el 66% de los participantes seleccionando el audio generado sobre el audio original.
Prevost explicó que AutoFoley podría utilizarse potencialmente para agilizar el proceso de producción de películas, televisión y otros medios. Prevost señala que una pista de Foley realista es importante para hacer que los medios sean atractivos y creíbles, pero que el proceso de Foley a menudo lleva mucho tiempo. Tener un sistema automatizado que pueda manejar la creación de elementos de Foley básicos podría hacer que la producción de medios sea más barata y rápida.
Actualmente, AutoFoley tiene algunas limitaciones notables. Por un lado, mientras que el modelo parece funcionar bien al observar eventos con movimientos estables y predecibles, sufre cuando intenta generar audio para eventos con variación en el tiempo (como tormentas). Además, también requiere que el sujeto de clasificación esté presente en todo el clip y no abandone el marco. El equipo de investigación está trabajando para abordar estos problemas en futuras versiones de la aplicación.












