Modelos y plataformas de IA

AudioSep: Separa cualquier cosa que describas

mm
Añade Unite.AI a tus fuentes preferidas en Google

LASS o Separación de fuentes de audio consultada por lenguaje es el nuevo paradigma para CASA o Análisis de escena auditiva computacional que tiene como objetivo separar un sonido objetivo de una mezcla de audio dada utilizando una consulta de lenguaje natural que proporciona una interfaz escalable y natural para tareas y aplicaciones de audio digital. Aunque los marcos de LASS han avanzado significativamente en los últimos años en términos de lograr el rendimiento deseado en fuentes de audio específicas como instrumentos musicales, no pueden separar el audio objetivo en el dominio abierto.

AudioSep, es un modelo fundamental que tiene como objetivo resolver las limitaciones actuales de los marcos de LASS al permitir la separación de audio objetivo utilizando consultas de lenguaje natural. Los desarrolladores del marco de AudioSep han entrenado el modelo exhaustivamente en una amplia variedad de conjuntos de datos multimodales a gran escala y han evaluado el rendimiento del marco en una amplia gama de tareas de audio, incluida la separación de instrumentos musicales, la separación de eventos de audio y la mejora del habla, entre otras. El rendimiento inicial de AudioSep satisface los benchmarks, ya que demuestra capacidades de aprendizaje cero impresionantes y entrega un fuerte rendimiento de separación de audio.

En este artículo, profundizaremos en el funcionamiento del marco de AudioSep, evaluaremos la arquitectura del modelo, los conjuntos de datos utilizados para el entrenamiento y la evaluación, y los conceptos esenciales involucrados en el funcionamiento del modelo AudioSep. Así que comencemos con una introducción básica al marco de CASA.

CASA, USS, QSS, LASS Frameworks: La base para AudioSep

El marco de CASA o Análisis de escena auditiva computacional es un marco utilizado por los desarrolladores para diseñar sistemas de escucha de máquina que tienen la capacidad de percibir entornos de sonido complejos de una manera similar a como los humanos perciben el sonido utilizando sus sistemas auditivos. La separación de sonido, con un enfoque especial en la separación de sonido objetivo, es un área fundamental de investigación dentro del marco de CASA, y tiene como objetivo resolver el “problema de la fiesta” o separar grabaciones de audio reales de grabaciones de fuentes de audio individuales o archivos. La importancia de la separación de sonido se puede atribuir principalmente a sus aplicaciones generalizadas, incluida la separación de fuentes de música, la separación de fuentes de audio, la mejora del habla, la identificación de sonido objetivo y mucho más.

La mayoría del trabajo sobre separación de sonido realizado en el pasado se centra principalmente en la separación de una o más fuentes de audio, como la separación de música o la separación de habla. Un nuevo modelo llamado USS o Separación de sonido universal tiene como objetivo separar sonidos arbitrarios en grabaciones de audio reales. Sin embargo, es una tarea desafiante y restrictiva separar todas las fuentes de sonido de una mezcla de audio, principalmente debido a la amplia gama de fuentes de sonido diferentes que existen en el mundo, lo que es la razón principal por la que el método USS no es factible para aplicaciones reales que funcionan en tiempo real.

Una alternativa factible al método USS es el método QSS o Separación de sonido basada en consultas, que tiene como objetivo separar una fuente de sonido individual o objetivo de la mezcla de audio basada en un conjunto específico de consultas. Gracias a esto, el marco de QSS permite a los desarrolladores y usuarios extraer las fuentes de audio deseables de la mezcla según sus necesidades, lo que hace que el método QSS sea una solución más práctica para aplicaciones digitales reales, como la edición de contenido multimedia o la edición de audio.

Además, los desarrolladores han propuesto recientemente una extensión del marco de QSS, el marco de LASS o Separación de fuentes de audio consultada por lenguaje, que tiene como objetivo separar fuentes de sonido arbitrarias de una mezcla de audio utilizando descripciones de lenguaje natural de la fuente de sonido objetivo. Como el marco de LASS permite a los usuarios extraer las fuentes de audio objetivo utilizando un conjunto de instrucciones de lenguaje natural, puede convertirse en una herramienta poderosa con aplicaciones generalizadas en aplicaciones de audio digitales. En comparación con los métodos tradicionales de consulta de audio o visión, el uso de instrucciones de lenguaje natural para la separación de audio ofrece un mayor grado de ventaja, ya que agrega flexibilidad y facilita la adquisición de información de consulta. Además, en comparación con los marcos de separación de audio basados en etiquetas que utilizan un conjunto predefinido de instrucciones o consultas, el marco de LASS no limita el número de consultas de entrada y tiene la flexibilidad de generalizarse a dominios abiertos de manera fluida.

Originalmente, el marco de LASS se basa en el aprendizaje supervisado, en el que el modelo se entrena en un conjunto de datos de texto-audio emparejados etiquetados. Sin embargo, el problema principal con este enfoque es la disponibilidad limitada de datos de texto-audio etiquetados y anotados. Para reducir la dependencia del marco de LASS en datos de texto-audio etiquetados, los modelos se entrenan utilizando el enfoque de aprendizaje de supervisión multimodal. El objetivo principal detrás del uso de un enfoque de supervisión multimodal es utilizar modelos de preentrenamiento de contraste multimodal como el modelo CLIP o Contraste de lenguaje de preentrenamiento de imagen como codificador de consulta para el marco. Dado que el modelo CLIP tiene la capacidad de alinear incrustaciones textuales con otras modalidades como el audio o la visión, permite a los desarrolladores entrenar los modelos de LASS utilizando datos ricos en modalidades y permite la interferencia con los datos textuales en un entorno de cero disparos. Los marcos de LASS actuales, sin embargo, utilizan conjuntos de datos a pequeña escala para el entrenamiento, y las aplicaciones del marco de LASS en cientos de dominios potenciales aún no se han explorado.

Para resolver las limitaciones actuales que enfrentan los marcos de LASS, los desarrolladores han introducido AudioSep, un modelo fundamental que tiene como objetivo separar el sonido de una mezcla de audio utilizando descripciones de lenguaje natural. El enfoque actual para AudioSep es desarrollar un modelo de separación de sonido preentrenado que aproveche los conjuntos de datos multimodales a gran escala existentes para permitir la generalización de los modelos de LASS en aplicaciones de dominio abierto. En resumen, el modelo AudioSep es: “Un modelo fundamental para la separación de sonido universal en dominio abierto utilizando consultas o descripciones de lenguaje natural entrenadas en conjuntos de datos de audio y multimodales a gran escala”.

AudioSep: Componentes clave y arquitectura

La arquitectura del marco de AudioSep consta de dos componentes clave: un codificador de texto y un modelo de separación.

El codificador de texto

El marco de AudioSep utiliza un codificador de texto del modelo CLIP o Contraste de lenguaje de preentrenamiento de imagen o el modelo CLAP o Contraste de lenguaje de preentrenamiento de audio para extraer incrustaciones de texto dentro de una consulta de lenguaje natural. La consulta de texto de entrada consta de una secuencia de “N” tokens que se procesa mediante el codificador de texto para extraer las incrustaciones de texto para la consulta de lenguaje de entrada. El codificador de texto utiliza una pila de bloques de transformador para codificar los tokens de texto de entrada, y las representaciones de salida se agregan después de pasar por las capas de transformador, lo que da como resultado el desarrollo de una representación vectorial de dimensión D con longitud fija, donde D corresponde a las dimensiones de los modelos CLAP o CLIP, mientras que el codificador de texto se mantiene congelado durante el período de entrenamiento.

El modelo CLIP se preentrena en un conjunto de datos a gran escala de pares de datos de imagen-texto utilizando aprendizaje de contraste, lo que es la razón principal por la que su codificador de texto aprende a mapear descripciones textuales en el espacio semántico que también es compartido por las representaciones visuales. La ventaja que AudioSep obtiene al utilizar el codificador de texto de CLIP es que ahora puede escalar o entrenar el modelo de LASS desde datos de audio-visuales no etiquetados utilizando las incrustaciones visuales como una alternativa, lo que permite el entrenamiento de los modelos de LASS sin la necesidad de datos de texto-audio etiquetados.

El modelo CLAP funciona de manera similar al modelo CLIP y utiliza un objetivo de aprendizaje de contraste, ya que utiliza un codificador de texto y un codificador de audio para conectar el audio y el lenguaje, lo que permite a los desarrolladores entrenar los modelos de LASS utilizando datos ricos en modalidades y permite la interferencia con los datos textuales en un entorno de cero disparos.

Modelo de separación

El marco de AudioSep utiliza un modelo ResUNet de dominio de frecuencia que se alimenta de una mezcla de clips de audio como la columna vertebral de separación para el marco. El marco funciona aplicando primero una transformada de Fourier de tiempo corto (STFT) en la forma de onda para extraer un espectrograma complejo, el espectrograma de magnitud y la fase de X. El modelo sigue luego la misma configuración y construye una red de codificador-decodificador para procesar el espectrograma de magnitud.

La red de codificador-decodificador ResUNet consta de 6 bloques de codificador, 6 bloques de decodificador y 4 bloques de cuello de botella. El espectrograma en cada bloque de codificador utiliza 4 bloques convolucionales residuales para muestrear el espectrograma en una característica de cuello de botella, mientras que los bloques de decodificador utilizan 4 bloques de decodificación convolucionales para obtener los componentes de separación al muestrear las características. Luego, cada uno de los bloques de codificador y sus bloques de decodificador correspondientes establecen una conexión de salto que opera a la misma tasa de muestreo o submuestreo. El bloque residual del marco consta de 2 capas de activación Leaky-ReLU, 2 capas de normalización de lote y 2 capas de convolución, y además, el marco introduce una conexión de atajo residual adicional que conecta la entrada y la salida de cada bloque residual individual. El modelo ResUNet toma el espectrograma complejo X como entrada y produce la máscara de magnitud M como salida con el residual de fase condicionado en las incrustaciones de texto que controla la magnitud de escalado y la rotación del ángulo del espectrograma. El espectrograma complejo separado se puede extraer multiplicando la máscara de magnitud predicha y el residual de fase con la transformada de Fourier de tiempo corto (STFT) de la mezcla.

En su marco, AudioSep utiliza una capa FiLm o capa de modulación lineal de características para conectar el modelo de separación y el codificador de texto después de la implementación de los bloques convolucionales en el ResUNet.

Entrenamiento y pérdida

Durante el entrenamiento del modelo AudioSep, los desarrolladores utilizan el método de aumento de sonoridad y entrenan el marco de AudioSep de extremo a extremo utilizando una función de pérdida L1 entre las formas de onda reales y predichas.

Conjuntos de datos y benchmarks

Como se mencionó en secciones anteriores, AudioSep es un modelo fundamental que tiene como objetivo resolver la dependencia actual de los modelos de LASS en conjuntos de datos de texto-audio emparejados etiquetados. El modelo AudioSep se entrena en una amplia variedad de conjuntos de datos para equiparlo con capacidades de aprendizaje multimodal, y aquí se presenta una descripción detallada del conjunto de datos y los benchmarks utilizados por los desarrolladores para entrenar el marco de AudioSep.

AudioSet

AudioSet es un conjunto de datos de audio grande y etiquetado débilmente que comprende más de 2 millones de fragmentos de audio de 10 segundos extraídos directamente de YouTube. Cada fragmento de audio en el conjunto de datos de AudioSet se categoriza por la presencia o ausencia de clases de sonido sin detalles de temporización específicos de los eventos de sonido. El conjunto de datos de AudioSet tiene más de 500 clases de audio distintas, incluyendo sonidos naturales, sonidos humanos, sonidos de vehículos y muchos más.

VGGSound

El conjunto de datos de VGGSound es un conjunto de datos de audio y visuales a gran escala que, al igual que AudioSet, se ha obtenido directamente de YouTube y contiene más de 200.000 clips de video, cada uno con una duración de 10 segundos. El conjunto de datos de VGGSound se categoriza en más de 300 clases de sonido, incluyendo sonidos humanos, sonidos naturales, sonidos de pájaros y más. El uso del conjunto de datos de VGGSound garantiza que el objeto responsable de producir el sonido objetivo también sea describible en el clip de video correspondiente.

AudioCaps

AudioCaps es el conjunto de datos de subtítulos de audio más grande disponible públicamente y comprende más de 50.000 clips de audio de 10 segundos extraídos del conjunto de datos de AudioSet. Los datos en AudioCaps se dividen en tres categorías: datos de entrenamiento, datos de prueba y datos de validación, y los clips de audio están anotados con descripciones de lenguaje natural utilizando la plataforma de Amazon (AMZN ) Mechanical Turk. Es importante destacar que cada clip de audio en el conjunto de datos de entrenamiento tiene una sola leyenda, mientras que los datos en los conjuntos de prueba y validación tienen 5 leyendas reales cada uno.

ClothoV2

ClothoV2 es un conjunto de datos de subtítulos de audio que consiste en clips obtenidos de la plataforma de FreeSound, y al igual que AudioCaps, cada clip de audio está anotado con descripciones de lenguaje natural utilizando la plataforma de Amazon Mechanical Turk.

WavCaps

Al igual que AudioSet, WavCaps es un conjunto de datos de audio grande y etiquetado débilmente que comprende más de 400.000 clips de audio con subtítulos y un tiempo de ejecución total que se aproxima a 7568 horas de datos de entrenamiento. Los clips de audio en el conjunto de datos de WavCaps se obtienen de una amplia variedad de fuentes de audio, incluyendo BBC Sound Effects, AudioSet, FreeSound, SoundBible y más.

Detalles de entrenamiento

Durante la fase de entrenamiento, el modelo AudioSep muestrea aleatoriamente dos segmentos de audio de dos clips de audio diferentes del conjunto de datos de entrenamiento y luego los mezcla para crear una mezcla de entrenamiento, donde la longitud de cada segmento de audio es de aproximadamente 5 segundos. El modelo luego extrae el espectrograma complejo de la señal de forma de onda utilizando una ventana de Hann de tamaño 1024 con un tamaño de salto de 320.

El modelo luego utiliza el codificador de texto de los modelos CLIP/CLAP para extraer las incrustaciones textuales con supervisión de texto como configuración predeterminada para AudioSep. Para el modelo de separación, el marco de AudioSep utiliza una capa ResUNet que consta de 30 capas, 6 bloques de codificador y 6 bloques de decodificador, similar a la arquitectura seguida en el marco de separación de sonido universal. Además, cada bloque de codificador tiene dos capas convolucionales con un tamaño de kernel de 3×3, y el número de mapas de características de salida de los bloques de codificador es 32, 64, 128, 256, 512 y 1024, respectivamente. Los bloques de decodificador comparten simetría con los bloques de codificador, y los desarrolladores aplican el optimizador Adam para entrenar el modelo AudioSep con un tamaño de lote de 96.

Resultados de evaluación

En conjuntos de datos vistos

La siguiente figura compara el rendimiento del marco de AudioSep en conjuntos de datos vistos durante la fase de entrenamiento, incluyendo los conjuntos de datos de entrenamiento. La figura siguiente representa los resultados de evaluación de los benchmarks del marco de AudioSep en comparación con los sistemas de referencia, incluyendo modelos de mejora del habla, LASS y CLIP. El modelo AudioSep con codificador de texto CLIP se representa como AudioSep-CLIP, mientras que el modelo AudioSep con codificador de texto CLAP se representa como AudioSep-CLAP.

Como se puede ver en la figura, el marco de AudioSep funciona bien cuando se utilizan subtítulos de audio o etiquetas de texto como consultas de entrada, y los resultados indican un rendimiento superior del marco de AudioSep en comparación con los modelos de separación de sonido y consulta de audio anteriores.

En conjuntos de datos no vistos

Para evaluar el rendimiento de AudioSep en un entorno de cero disparos, los desarrolladores continuaron evaluando el rendimiento en conjuntos de datos no vistos, y el marco de AudioSep entrega un rendimiento de separación impresionante en un entorno de cero disparos, y los resultados se muestran en la figura siguiente.

Además, la imagen siguiente muestra los resultados de la evaluación del modelo AudioSep contra la mejora del habla de Voicebank-Demand.

La evaluación del marco de AudioSep indica un rendimiento fuerte y deseado en conjuntos de datos no vistos en un entorno de cero disparos, lo que permite realizar tareas de operación de sonido en nuevas distribuciones de datos.

Visualización de resultados de separación

La figura siguiente muestra los resultados obtenidos cuando los desarrolladores utilizaron el marco de AudioSep-CLAP para realizar visualizaciones de espectrogramas para fuentes de audio objetivo reales, mezclas de audio y fuentes de audio separadas utilizando consultas de texto de audio diverso. Los resultados permitieron a los desarrolladores observar que el patrón de fuente separada del espectrograma está cerca de la fuente de la verdad, lo que respalda aún más los resultados objetivos obtenidos durante los experimentos.

Comparación de consultas de texto

Los desarrolladores evalúan el rendimiento de AudioSep-CLAP y AudioSep-CLIP en AudioCaps Mini, y los desarrolladores utilizan las etiquetas de eventos de AudioSet, las leyendas de AudioCaps y las descripciones de lenguaje natural reanotadas para examinar los efectos de diferentes consultas, y la figura siguiente muestra un ejemplo de AudioCaps Mini en acción.

Conclusión

AudioSep es un modelo fundamental que se ha desarrollado con el objetivo de ser un marco de separación de sonido universal en dominio abierto que utiliza descripciones de lenguaje natural para la separación de audio. Como se observó durante la evaluación, el marco de AudioSep es capaz de realizar aprendizaje cero y no supervisado de manera fluida al utilizar subtítulos de audio o etiquetas de texto como consultas. Los resultados y el rendimiento de evaluación de AudioSep indican un rendimiento fuerte que supera a los marcos de separación de sonido actuales como LASS, y puede ser lo suficientemente capaz como para resolver las limitaciones actuales de los marcos de separación de sonido populares.

Un ingeniero por profesión, un escritor por corazón. Kunal es un escritor técnico con un profundo amor y comprensión de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a través de su documentación atractiva e informativa.