Modelos y plataformas de IA
AudioSep: Separa cualquier cosa que describas

LASS o SeparaciÃģn de fuentes de audio consultada por lenguaje es el nuevo paradigma para CASA o AnÃĄlisis de escena auditiva computacional que tiene como objetivo separar un sonido objetivo de una mezcla de audio dada utilizando una consulta de lenguaje natural que proporciona una interfaz escalable y natural para tareas y aplicaciones de audio digital. Aunque los marcos de LASS han avanzado significativamente en los Últimos aÃąos en tÃĐrminos de lograr el rendimiento deseado en fuentes de audio especÃficas como instrumentos musicales, no pueden separar el audio objetivo en el dominio abierto.
AudioSep, es un modelo fundamental que tiene como objetivo resolver las limitaciones actuales de los marcos de LASS al permitir la separaciÃģn de audio objetivo utilizando consultas de lenguaje natural. Los desarrolladores del marco de AudioSep han entrenado el modelo exhaustivamente en una amplia variedad de conjuntos de datos multimodales a gran escala y han evaluado el rendimiento del marco en una amplia gama de tareas de audio, incluida la separaciÃģn de instrumentos musicales, la separaciÃģn de eventos de audio y la mejora del habla, entre otras. El rendimiento inicial de AudioSep satisface los benchmarks, ya que demuestra capacidades de aprendizaje cero impresionantes y entrega un fuerte rendimiento de separaciÃģn de audio.
En este artÃculo, profundizaremos en el funcionamiento del marco de AudioSep, evaluaremos la arquitectura del modelo, los conjuntos de datos utilizados para el entrenamiento y la evaluaciÃģn, y los conceptos esenciales involucrados en el funcionamiento del modelo AudioSep. Asà que comencemos con una introducciÃģn bÃĄsica al marco de CASA.
CASA, USS, QSS, LASS Frameworks: La base para AudioSep
El marco de CASA o AnÃĄlisis de escena auditiva computacional es un marco utilizado por los desarrolladores para diseÃąar sistemas de escucha de mÃĄquina que tienen la capacidad de percibir entornos de sonido complejos de una manera similar a como los humanos perciben el sonido utilizando sus sistemas auditivos. La separaciÃģn de sonido, con un enfoque especial en la separaciÃģn de sonido objetivo, es un ÃĄrea fundamental de investigaciÃģn dentro del marco de CASA, y tiene como objetivo resolver el âproblema de la fiestaâ o separar grabaciones de audio reales de grabaciones de fuentes de audio individuales o archivos. La importancia de la separaciÃģn de sonido se puede atribuir principalmente a sus aplicaciones generalizadas, incluida la separaciÃģn de fuentes de mÚsica, la separaciÃģn de fuentes de audio, la mejora del habla, la identificaciÃģn de sonido objetivo y mucho mÃĄs.
La mayorÃa del trabajo sobre separaciÃģn de sonido realizado en el pasado se centra principalmente en la separaciÃģn de una o mÃĄs fuentes de audio, como la separaciÃģn de mÚsica o la separaciÃģn de habla. Un nuevo modelo llamado USS o SeparaciÃģn de sonido universal tiene como objetivo separar sonidos arbitrarios en grabaciones de audio reales. Sin embargo, es una tarea desafiante y restrictiva separar todas las fuentes de sonido de una mezcla de audio, principalmente debido a la amplia gama de fuentes de sonido diferentes que existen en el mundo, lo que es la razÃģn principal por la que el mÃĐtodo USS no es factible para aplicaciones reales que funcionan en tiempo real.
Una alternativa factible al mÃĐtodo USS es el mÃĐtodo QSS o SeparaciÃģn de sonido basada en consultas, que tiene como objetivo separar una fuente de sonido individual o objetivo de la mezcla de audio basada en un conjunto especÃfico de consultas. Gracias a esto, el marco de QSS permite a los desarrolladores y usuarios extraer las fuentes de audio deseables de la mezcla segÚn sus necesidades, lo que hace que el mÃĐtodo QSS sea una soluciÃģn mÃĄs prÃĄctica para aplicaciones digitales reales, como la ediciÃģn de contenido multimedia o la ediciÃģn de audio.
AdemÃĄs, los desarrolladores han propuesto recientemente una extensiÃģn del marco de QSS, el marco de LASS o SeparaciÃģn de fuentes de audio consultada por lenguaje, que tiene como objetivo separar fuentes de sonido arbitrarias de una mezcla de audio utilizando descripciones de lenguaje natural de la fuente de sonido objetivo. Como el marco de LASS permite a los usuarios extraer las fuentes de audio objetivo utilizando un conjunto de instrucciones de lenguaje natural, puede convertirse en una herramienta poderosa con aplicaciones generalizadas en aplicaciones de audio digitales. En comparaciÃģn con los mÃĐtodos tradicionales de consulta de audio o visiÃģn, el uso de instrucciones de lenguaje natural para la separaciÃģn de audio ofrece un mayor grado de ventaja, ya que agrega flexibilidad y facilita la adquisiciÃģn de informaciÃģn de consulta. AdemÃĄs, en comparaciÃģn con los marcos de separaciÃģn de audio basados en etiquetas que utilizan un conjunto predefinido de instrucciones o consultas, el marco de LASS no limita el nÚmero de consultas de entrada y tiene la flexibilidad de generalizarse a dominios abiertos de manera fluida.
Originalmente, el marco de LASS se basa en el aprendizaje supervisado, en el que el modelo se entrena en un conjunto de datos de texto-audio emparejados etiquetados. Sin embargo, el problema principal con este enfoque es la disponibilidad limitada de datos de texto-audio etiquetados y anotados. Para reducir la dependencia del marco de LASS en datos de texto-audio etiquetados, los modelos se entrenan utilizando el enfoque de aprendizaje de supervisiÃģn multimodal. El objetivo principal detrÃĄs del uso de un enfoque de supervisiÃģn multimodal es utilizar modelos de preentrenamiento de contraste multimodal como el modelo CLIP o Contraste de lenguaje de preentrenamiento de imagen como codificador de consulta para el marco. Dado que el modelo CLIP tiene la capacidad de alinear incrustaciones textuales con otras modalidades como el audio o la visiÃģn, permite a los desarrolladores entrenar los modelos de LASS utilizando datos ricos en modalidades y permite la interferencia con los datos textuales en un entorno de cero disparos. Los marcos de LASS actuales, sin embargo, utilizan conjuntos de datos a pequeÃąa escala para el entrenamiento, y las aplicaciones del marco de LASS en cientos de dominios potenciales aÚn no se han explorado.
Para resolver las limitaciones actuales que enfrentan los marcos de LASS, los desarrolladores han introducido AudioSep, un modelo fundamental que tiene como objetivo separar el sonido de una mezcla de audio utilizando descripciones de lenguaje natural. El enfoque actual para AudioSep es desarrollar un modelo de separaciÃģn de sonido preentrenado que aproveche los conjuntos de datos multimodales a gran escala existentes para permitir la generalizaciÃģn de los modelos de LASS en aplicaciones de dominio abierto. En resumen, el modelo AudioSep es: âUn modelo fundamental para la separaciÃģn de sonido universal en dominio abierto utilizando consultas o descripciones de lenguaje natural entrenadas en conjuntos de datos de audio y multimodales a gran escalaâ.
AudioSep: Componentes clave y arquitectura
La arquitectura del marco de AudioSep consta de dos componentes clave: un codificador de texto y un modelo de separaciÃģn.
El codificador de texto
El marco de AudioSep utiliza un codificador de texto del modelo CLIP o Contraste de lenguaje de preentrenamiento de imagen o el modelo CLAP o Contraste de lenguaje de preentrenamiento de audio para extraer incrustaciones de texto dentro de una consulta de lenguaje natural. La consulta de texto de entrada consta de una secuencia de âNâ tokens que se procesa mediante el codificador de texto para extraer las incrustaciones de texto para la consulta de lenguaje de entrada. El codificador de texto utiliza una pila de bloques de transformador para codificar los tokens de texto de entrada, y las representaciones de salida se agregan despuÃĐs de pasar por las capas de transformador, lo que da como resultado el desarrollo de una representaciÃģn vectorial de dimensiÃģn D con longitud fija, donde D corresponde a las dimensiones de los modelos CLAP o CLIP, mientras que el codificador de texto se mantiene congelado durante el perÃodo de entrenamiento.
El modelo CLIP se preentrena en un conjunto de datos a gran escala de pares de datos de imagen-texto utilizando aprendizaje de contraste, lo que es la razÃģn principal por la que su codificador de texto aprende a mapear descripciones textuales en el espacio semÃĄntico que tambiÃĐn es compartido por las representaciones visuales. La ventaja que AudioSep obtiene al utilizar el codificador de texto de CLIP es que ahora puede escalar o entrenar el modelo de LASS desde datos de audio-visuales no etiquetados utilizando las incrustaciones visuales como una alternativa, lo que permite el entrenamiento de los modelos de LASS sin la necesidad de datos de texto-audio etiquetados.
El modelo CLAP funciona de manera similar al modelo CLIP y utiliza un objetivo de aprendizaje de contraste, ya que utiliza un codificador de texto y un codificador de audio para conectar el audio y el lenguaje, lo que permite a los desarrolladores entrenar los modelos de LASS utilizando datos ricos en modalidades y permite la interferencia con los datos textuales en un entorno de cero disparos.
Modelo de separaciÃģn
El marco de AudioSep utiliza un modelo ResUNet de dominio de frecuencia que se alimenta de una mezcla de clips de audio como la columna vertebral de separaciÃģn para el marco. El marco funciona aplicando primero una transformada de Fourier de tiempo corto (STFT) en la forma de onda para extraer un espectrograma complejo, el espectrograma de magnitud y la fase de X. El modelo sigue luego la misma configuraciÃģn y construye una red de codificador-decodificador para procesar el espectrograma de magnitud.
La red de codificador-decodificador ResUNet consta de 6 bloques de codificador, 6 bloques de decodificador y 4 bloques de cuello de botella. El espectrograma en cada bloque de codificador utiliza 4 bloques convolucionales residuales para muestrear el espectrograma en una caracterÃstica de cuello de botella, mientras que los bloques de decodificador utilizan 4 bloques de decodificaciÃģn convolucionales para obtener los componentes de separaciÃģn al muestrear las caracterÃsticas. Luego, cada uno de los bloques de codificador y sus bloques de decodificador correspondientes establecen una conexiÃģn de salto que opera a la misma tasa de muestreo o submuestreo. El bloque residual del marco consta de 2 capas de activaciÃģn Leaky-ReLU, 2 capas de normalizaciÃģn de lote y 2 capas de convoluciÃģn, y ademÃĄs, el marco introduce una conexiÃģn de atajo residual adicional que conecta la entrada y la salida de cada bloque residual individual. El modelo ResUNet toma el espectrograma complejo X como entrada y produce la mÃĄscara de magnitud M como salida con el residual de fase condicionado en las incrustaciones de texto que controla la magnitud de escalado y la rotaciÃģn del ÃĄngulo del espectrograma. El espectrograma complejo separado se puede extraer multiplicando la mÃĄscara de magnitud predicha y el residual de fase con la transformada de Fourier de tiempo corto (STFT) de la mezcla.

En su marco, AudioSep utiliza una capa FiLm o capa de modulaciÃģn lineal de caracterÃsticas para conectar el modelo de separaciÃģn y el codificador de texto despuÃĐs de la implementaciÃģn de los bloques convolucionales en el ResUNet.
Entrenamiento y pÃĐrdida
Durante el entrenamiento del modelo AudioSep, los desarrolladores utilizan el mÃĐtodo de aumento de sonoridad y entrenan el marco de AudioSep de extremo a extremo utilizando una funciÃģn de pÃĐrdida L1 entre las formas de onda reales y predichas.
Conjuntos de datos y benchmarks
Como se mencionÃģ en secciones anteriores, AudioSep es un modelo fundamental que tiene como objetivo resolver la dependencia actual de los modelos de LASS en conjuntos de datos de texto-audio emparejados etiquetados. El modelo AudioSep se entrena en una amplia variedad de conjuntos de datos para equiparlo con capacidades de aprendizaje multimodal, y aquà se presenta una descripciÃģn detallada del conjunto de datos y los benchmarks utilizados por los desarrolladores para entrenar el marco de AudioSep.
AudioSet
AudioSet es un conjunto de datos de audio grande y etiquetado dÃĐbilmente que comprende mÃĄs de 2 millones de fragmentos de audio de 10 segundos extraÃdos directamente de YouTube. Cada fragmento de audio en el conjunto de datos de AudioSet se categoriza por la presencia o ausencia de clases de sonido sin detalles de temporizaciÃģn especÃficos de los eventos de sonido. El conjunto de datos de AudioSet tiene mÃĄs de 500 clases de audio distintas, incluyendo sonidos naturales, sonidos humanos, sonidos de vehÃculos y muchos mÃĄs.
VGGSound
El conjunto de datos de VGGSound es un conjunto de datos de audio y visuales a gran escala que, al igual que AudioSet, se ha obtenido directamente de YouTube y contiene mÃĄs de 200.000 clips de video, cada uno con una duraciÃģn de 10 segundos. El conjunto de datos de VGGSound se categoriza en mÃĄs de 300 clases de sonido, incluyendo sonidos humanos, sonidos naturales, sonidos de pÃĄjaros y mÃĄs. El uso del conjunto de datos de VGGSound garantiza que el objeto responsable de producir el sonido objetivo tambiÃĐn sea describible en el clip de video correspondiente.
AudioCaps
AudioCaps es el conjunto de datos de subtÃtulos de audio mÃĄs grande disponible pÚblicamente y comprende mÃĄs de 50.000 clips de audio de 10 segundos extraÃdos del conjunto de datos de AudioSet. Los datos en AudioCaps se dividen en tres categorÃas: datos de entrenamiento, datos de prueba y datos de validaciÃģn, y los clips de audio estÃĄn anotados con descripciones de lenguaje natural utilizando la plataforma de Amazon (AMZN ) Mechanical Turk. Es importante destacar que cada clip de audio en el conjunto de datos de entrenamiento tiene una sola leyenda, mientras que los datos en los conjuntos de prueba y validaciÃģn tienen 5 leyendas reales cada uno.
ClothoV2
ClothoV2 es un conjunto de datos de subtÃtulos de audio que consiste en clips obtenidos de la plataforma de FreeSound, y al igual que AudioCaps, cada clip de audio estÃĄ anotado con descripciones de lenguaje natural utilizando la plataforma de Amazon Mechanical Turk.
WavCaps
Al igual que AudioSet, WavCaps es un conjunto de datos de audio grande y etiquetado dÃĐbilmente que comprende mÃĄs de 400.000 clips de audio con subtÃtulos y un tiempo de ejecuciÃģn total que se aproxima a 7568 horas de datos de entrenamiento. Los clips de audio en el conjunto de datos de WavCaps se obtienen de una amplia variedad de fuentes de audio, incluyendo BBC Sound Effects, AudioSet, FreeSound, SoundBible y mÃĄs.

Detalles de entrenamiento
Durante la fase de entrenamiento, el modelo AudioSep muestrea aleatoriamente dos segmentos de audio de dos clips de audio diferentes del conjunto de datos de entrenamiento y luego los mezcla para crear una mezcla de entrenamiento, donde la longitud de cada segmento de audio es de aproximadamente 5 segundos. El modelo luego extrae el espectrograma complejo de la seÃąal de forma de onda utilizando una ventana de Hann de tamaÃąo 1024 con un tamaÃąo de salto de 320.
El modelo luego utiliza el codificador de texto de los modelos CLIP/CLAP para extraer las incrustaciones textuales con supervisiÃģn de texto como configuraciÃģn predeterminada para AudioSep. Para el modelo de separaciÃģn, el marco de AudioSep utiliza una capa ResUNet que consta de 30 capas, 6 bloques de codificador y 6 bloques de decodificador, similar a la arquitectura seguida en el marco de separaciÃģn de sonido universal. AdemÃĄs, cada bloque de codificador tiene dos capas convolucionales con un tamaÃąo de kernel de 3Ã3, y el nÚmero de mapas de caracterÃsticas de salida de los bloques de codificador es 32, 64, 128, 256, 512 y 1024, respectivamente. Los bloques de decodificador comparten simetrÃa con los bloques de codificador, y los desarrolladores aplican el optimizador Adam para entrenar el modelo AudioSep con un tamaÃąo de lote de 96.
Resultados de evaluaciÃģn
En conjuntos de datos vistos
La siguiente figura compara el rendimiento del marco de AudioSep en conjuntos de datos vistos durante la fase de entrenamiento, incluyendo los conjuntos de datos de entrenamiento. La figura siguiente representa los resultados de evaluaciÃģn de los benchmarks del marco de AudioSep en comparaciÃģn con los sistemas de referencia, incluyendo modelos de mejora del habla, LASS y CLIP. El modelo AudioSep con codificador de texto CLIP se representa como AudioSep-CLIP, mientras que el modelo AudioSep con codificador de texto CLAP se representa como AudioSep-CLAP.

Como se puede ver en la figura, el marco de AudioSep funciona bien cuando se utilizan subtÃtulos de audio o etiquetas de texto como consultas de entrada, y los resultados indican un rendimiento superior del marco de AudioSep en comparaciÃģn con los modelos de separaciÃģn de sonido y consulta de audio anteriores.
En conjuntos de datos no vistos
Para evaluar el rendimiento de AudioSep en un entorno de cero disparos, los desarrolladores continuaron evaluando el rendimiento en conjuntos de datos no vistos, y el marco de AudioSep entrega un rendimiento de separaciÃģn impresionante en un entorno de cero disparos, y los resultados se muestran en la figura siguiente.

AdemÃĄs, la imagen siguiente muestra los resultados de la evaluaciÃģn del modelo AudioSep contra la mejora del habla de Voicebank-Demand.

La evaluaciÃģn del marco de AudioSep indica un rendimiento fuerte y deseado en conjuntos de datos no vistos en un entorno de cero disparos, lo que permite realizar tareas de operaciÃģn de sonido en nuevas distribuciones de datos.
VisualizaciÃģn de resultados de separaciÃģn
La figura siguiente muestra los resultados obtenidos cuando los desarrolladores utilizaron el marco de AudioSep-CLAP para realizar visualizaciones de espectrogramas para fuentes de audio objetivo reales, mezclas de audio y fuentes de audio separadas utilizando consultas de texto de audio diverso. Los resultados permitieron a los desarrolladores observar que el patrÃģn de fuente separada del espectrograma estÃĄ cerca de la fuente de la verdad, lo que respalda aÚn mÃĄs los resultados objetivos obtenidos durante los experimentos.

ComparaciÃģn de consultas de texto
Los desarrolladores evalÚan el rendimiento de AudioSep-CLAP y AudioSep-CLIP en AudioCaps Mini, y los desarrolladores utilizan las etiquetas de eventos de AudioSet, las leyendas de AudioCaps y las descripciones de lenguaje natural reanotadas para examinar los efectos de diferentes consultas, y la figura siguiente muestra un ejemplo de AudioCaps Mini en acciÃģn.

ConclusiÃģn
AudioSep es un modelo fundamental que se ha desarrollado con el objetivo de ser un marco de separaciÃģn de sonido universal en dominio abierto que utiliza descripciones de lenguaje natural para la separaciÃģn de audio. Como se observÃģ durante la evaluaciÃģn, el marco de AudioSep es capaz de realizar aprendizaje cero y no supervisado de manera fluida al utilizar subtÃtulos de audio o etiquetas de texto como consultas. Los resultados y el rendimiento de evaluaciÃģn de AudioSep indican un rendimiento fuerte que supera a los marcos de separaciÃģn de sonido actuales como LASS, y puede ser lo suficientemente capaz como para resolver las limitaciones actuales de los marcos de separaciÃģn de sonido populares.












