Ángulo de Anderson

Investigación de inteligencia artificial que contempla controles de volumen separados para diálogo, música y efectos de sonido

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una nueva colaboración de investigación liderada por Mitsubishi investiga la posibilidad de extraer tres soundtracks separados de una fuente de audio original, descomponiendo la pista de audio en habla, música y efectos de sonido (es decir, ruido ambiental).

Dado que este es un marco de procesamiento post-facto, ofrece potencial para que las plataformas de visualización de multimedia de generaciones posteriores, incluido el equipo de consumo, ofrezcan controles de volumen de tres puntos, lo que permite al usuario aumentar el volumen del diálogo o disminuir el volumen de una banda sonora.

En el clip corto a continuación del video acompañante de la investigación (ver final del artículo para el video completo), vemos diferentes facetas de la banda sonora resaltadas a medida que el usuario arrastra un control sobre un triángulo con cada uno de los tres componentes de audio en una esquina:

Un clip corto del video que acompaña al documento (ver incrustación al final del artículo). A medida que el usuario arrastra el cursor hacia una de las tres facetas extraídas en la interfaz de triángulo (a la derecha), el audio resalta esa parte de la banda sonora tripartita. Aunque el video más largo cita varios ejemplos adicionales en YouTube, estos parecen estar actualmente no disponibles. Fuente: https://vimeo.com/634073402

El documento se titula El problema del tenedor de cóctel: separación de audio de tres tallos para bandas sonoras del mundo real, y proviene de investigadores de los Laboratorios de Investigación de Mitsubishi Electric (MERL) en Cambridge, MA, y del Departamento de Ingeniería de Sistemas Inteligentes de la Universidad de Indiana en Illinois.

Separar facetas de una banda sonora

Los investigadores han bautizado el desafío como ‘El problema de la fiesta de cóctel’ porque implica aislar elementos severamente enmarañados de una banda sonora, lo que crea un mapa de carreteras que se asemeja a un tenedor (ver imagen a continuación). En la práctica, las bandas sonoras multicanal (es decir, estéreo y más) pueden tener diferentes cantidades de tipos de contenido, como diálogo, música y ambiente, particularmente desde que el diálogo tiende a dominar el canal central en mezclas Dolby 5.1. Actualmente, sin embargo, el campo de investigación de audio activo de la separación se centra en capturar estos hilos de una sola banda sonora horneada, como lo hace la investigación actual.

El tenedor de cóctel – derivando tres soundtracks distintos de una banda sonora fusionada y única. Fuente: https://arxiv.org/pdf/2110.09958.pdf

El tenedor de cóctel – derivando tres soundtracks distintos de una banda sonora fusionada y única. Fuente: https://arxiv.org/pdf/2110.09958.pdf

La investigación reciente se ha centrado en extraer el habla en varios entornos, a menudo con fines de desenoising del audio del habla para el posterior compromiso con los sistemas de Procesamiento de Lenguaje Natural (NLP), pero también en la aislamiento de voces cantadas de archivo, ya sea para crear versiones sintéticas de cantantes reales (incluso muertos), o para facilitar aislamiento de música al estilo Karaoke.

Un conjunto de datos para cada faceta

Hasta la fecha, se ha dado poca consideración a utilizar este tipo de tecnología de inteligencia artificial para dar a los usuarios más control sobre la mezcla de una banda sonora. Por lo tanto, los investigadores han formalizado el problema y generado un nuevo conjunto de datos como ayuda para la investigación continua en la separación de soundtracks de varios tipos, así como para probarlo en varios marcos de separación de audio existentes.

El nuevo conjunto de datos que los autores han desarrollado se llama Divide and Remaster (DnR), y se deriva de conjuntos de datos anteriores LibriSpeech, Free Music Archive y el Freesound Dataset 50k (FSD50K). Para aquellos que deseen trabajar con DnR desde cero, el conjunto de datos debe reconstruirse a partir de las tres fuentes; de lo contrario, pronto estará disponible en Zenodo, afirman los autores. Sin embargo, en el momento de la redacción, el enlace de GitHub para las utilidades de extracción de fuentes no está actualmente activo, por lo que aquellos interesados pueden tener que esperar un poco.

Los investigadores han encontrado que la arquitectura de mezcla sin mezclar CrossNet (XUMX) propuesta por Sony en mayo funciona particularmente bien con DnR.

Arquitectura de audio CrossNet de Sony.

Arquitectura de audio CrossNet de Sony.

Los autores afirman que sus modelos de extracción de aprendizaje automático funcionan bien en soundtracks de YouTube, aunque las evaluaciones presentadas en el documento se basan en datos sintéticos, y el video principal de apoyo suministrado (incrustado a continuación) es actualmente el único que parece estar disponible.

Los tres conjuntos de datos utilizados cada uno comprenden una colección del tipo de salida que debe separarse de una banda sonora: FSD50K se ocupa de efectos de sonido y cuenta con 50,000 clips de audio mono de 44,1 kHz etiquetados con 200 etiquetas de clase de la ontología de AudioSet de Google; el Free Music Archive cuenta con 100,000 canciones estéreo que cubren 161 géneros musicales, aunque los autores han utilizado un subconjunto que contiene 25,000 canciones, para igualar con FSD50K; y LibriSpeech proporciona a DnR 100 horas de muestras de audio de libros como archivos de audio mp3 de 44,1 kHz.

Trabajo futuro

Los autores anticipan más trabajo en el conjunto de datos y una combinación de los modelos separados desarrollados para investigación adicional en marcos de reconocimiento de habla y clasificación de sonido, con generación automática de subtítulos para habla y sonidos no hablados. También pretenden evaluar posibilidades para enfoques de remezcla que puedan reducir artefactos perceptuales, que sigue siendo el problema central al dividir una banda sonora de audio fusionada en sus componentes constituyentes.

Este tipo de separación podría estar disponible en el futuro como una mercancía de consumo en televisores inteligentes que incorporen redes de inferencia altamente optimizadas, aunque parece probable que las implementaciones iniciales necesiten algún nivel de tiempo de preprocesamiento y espacio de almacenamiento. Samsung ya usa redes neuronales locales para escalado, mientras que el Procesador Cognitivo XR de Sony, utilizado en la gama Bravia de la empresa, analiza y reinterpreta las bandas sonoras en vivo a través de inteligencia artificial integrada ligera.

Las llamadas a un mayor control sobre la mezcla de una banda sonora se repiten periódicamente, y la mayoría de las soluciones ofrecidas tienen que lidiar con el hecho de que la banda sonora ya ha sido bajada de acuerdo con los estándares actuales (y suposiciones sobre lo que los espectadores desean) en las industrias cinematográfica y televisiva.

Un espectador, enfadado por la desigualdad asombrosa de los niveles de volumen entre los diversos elementos de las bandas sonoras de las películas, se volvió lo suficientemente desesperado como para desarrollar un ajustador de volumen automático basado en hardware capaz de equalizar el volumen para películas y televisión.

Aunque los televisores inteligentes ofrecen una variedad de métodos para intentar aumentar el volumen del diálogo contra niveles de volumen grandiosos para la música, todos luchan contra las decisiones tomadas en el momento de la mezcla, y, argumentablemente, las visiones de los productores de contenido que desean que la audiencia experimente sus bandas sonoras exactamente como se configuraron.

Los productores de contenido parecen probablemente irritarse contra esta posible adición a la ‘cultura de remezcla’, ya que varios luminares de la industria ya han expresado su descontento contra algoritmos de post-procesamiento de televisión basados en suavizado de movimiento.

https://vimeo.com/634073402

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai