Modelos e plataformas de IA

AudioSep: Separe Anything que VocÊ Descreve

mm
Adicione Unite.AI às suas fontes preferidas no Google

LASS ou SeparaçÃĢo de Fonte de Áudio por Consulta de Linguagem ÃĐ o novo paradigma para CASA ou AnÃĄlise de Cena Auditiva Computacional que visa separar um som alvo de uma mistura de ÃĄudio usando uma consulta de linguagem natural que fornece uma interface escalÃĄvel e natural para tarefas e aplicaçÃĩes de ÃĄudio digital. Embora os frameworks LASS tenham avançado significativamente nos Últimos anos em termos de alcançar o desempenho desejado em fontes de ÃĄudio específicas, como instrumentos musicais, eles nÃĢo conseguem separar o ÃĄudio alvo no domínio aberto.

AudioSep, ÃĐ um modelo fundamental que visa resolver as limitaçÃĩes atuais dos frameworks LASS, permitindo a separaçÃĢo de ÃĄudio alvo usando consultas de linguagem natural. Os desenvolvedores do framework AudioSep treinaram o modelo extensivamente em uma ampla variedade de conjuntos de dados multimodais em larga escala e avaliaram o desempenho do framework em uma ampla gama de tarefas de ÃĄudio, incluindo separaçÃĢo de instrumentos musicais, separaçÃĢo de eventos de ÃĄudio e melhoria da fala, entre outros. O desempenho inicial do AudioSep atende aos benchmarks, demonstrando impressionantes capacidades de aprendizado zero-shot e entregando um forte desempenho de separaçÃĢo de ÃĄudio.

Neste artigo, vamos mergulhar mais profundamente no funcionamento do framework AudioSep, avaliando a arquitetura do modelo, os conjuntos de dados usados para treinamento e avaliaçÃĢo e os conceitos essenciais envolvidos no funcionamento do modelo AudioSep. Vamos começar com uma introduçÃĢo bÃĄsica ao framework CASA.

CASA, USS, QSS, LASS Frameworks: A FundaçÃĢo para AudioSep

O framework CASA ou AnÃĄlise de Cena Auditiva Computacional ÃĐ um framework usado por desenvolvedores para projetar sistemas de escuta de mÃĄquina que tÊm a capacidade de perceber ambientes sonoros complexos de uma maneira semelhante à forma como os humanos percebem o som usando seus sistemas auditivos. A separaçÃĢo de som, com foco especial na separaçÃĢo de som alvo, ÃĐ uma ÃĄrea fundamental de pesquisa dentro do framework CASA, e visa resolver o “problema do coquetel” ou separar gravaçÃĩes de ÃĄudio reais de gravaçÃĩes de fontes de ÃĄudio individuais ou arquivos. A importÃĒncia da separaçÃĢo de som pode ser atribuída principalmente às suas aplicaçÃĩes generalizadas, incluindo separaçÃĢo de fontes de mÚsica, separaçÃĢo de fontes de ÃĄudio, melhoria da fala, identificaçÃĢo de som alvo e muito mais.

A maioria do trabalho sobre separaçÃĢo de som feito no passado gira principalmente em torno da separaçÃĢo de uma ou mais fontes de ÃĄudio, como separaçÃĢo de mÚsica ou separaçÃĢo de fala. Um novo modelo chamado USS ou SeparaçÃĢo Universal de Som visa separar sons arbitrÃĄrios em gravaçÃĩes de ÃĄudio do mundo real. No entanto, ÃĐ uma tarefa desafiadora e restritiva separar todas as fontes de som de uma mistura de ÃĄudio, principalmente devido à ampla gama de fontes de som diferentes que existem no mundo, o que ÃĐ a principal razÃĢo pela qual o mÃĐtodo USS nÃĢo ÃĐ viÃĄvel para aplicaçÃĩes do mundo real que funcionam em tempo real.

Uma alternativa viÃĄvel ao mÃĐtodo USS ÃĐ o mÃĐtodo QSS ou SeparaçÃĢo de Som Baseada em Consulta, que visa separar uma fonte de som individual ou alvo de uma mistura de ÃĄudio com base em um conjunto específico de consultas. Graças a isso, o framework QSS permite que os desenvolvedores e usuÃĄrios extraiam as fontes de ÃĄudio desejadas da mistura com base em suas necessidades, o que torna o mÃĐtodo QSS uma soluçÃĢo mais prÃĄtica para aplicaçÃĩes digitais do mundo real, como ediçÃĢo de conteÚdo multimídia ou ediçÃĢo de ÃĄudio.

AlÃĐm disso, os desenvolvedores propuseram recentemente uma extensÃĢo do framework QSS, o framework LASS ou SeparaçÃĢo de Fonte de Áudio por Consulta de Linguagem, que visa separar fontes de som arbitrÃĄrias de uma mistura de ÃĄudio usando descriçÃĩes de linguagem natural da fonte de som alvo. Como o framework LASS permite que os usuÃĄrios extraiam as fontes de ÃĄudio alvo usando um conjunto de instruçÃĩes de linguagem natural, ele pode se tornar uma ferramenta poderosa com aplicaçÃĩes generalizadas em aplicaçÃĩes de ÃĄudio digital. Em comparaçÃĢo com mÃĐtodos tradicionais de consulta de ÃĄudio ou visÃĢo, usar instruçÃĩes de linguagem natural para separaçÃĢo de ÃĄudio oferece um grau maior de vantagem, pois adiciona flexibilidade e torna a aquisiçÃĢo de informaçÃĩes de consulta muito mais fÃĄcil e conveniente. AlÃĐm disso, em comparaçÃĢo com frameworks de separaçÃĢo de ÃĄudio baseados em rÃģtulos que usam um conjunto prÃĐ-definido de instruçÃĩes ou consultas, o framework LASS nÃĢo limita o nÚmero de consultas de entrada e tem a flexibilidade de ser generalizado para o domínio aberto de forma transparente.

Originalmente, o framework LASS depende do aprendizado supervisionado, no qual o modelo ÃĐ treinado em um conjunto de dados de ÃĄudio-texto etiquetados. No entanto, o principal problema com essa abordagem ÃĐ a limitada disponibilidade de dados de ÃĄudio-texto etiquetados e anotados. Para reduzir a dependÊncia do framework LASS em dados de ÃĄudio-texto etiquetados, os modelos sÃĢo treinados usando a abordagem de aprendizado de supervisÃĢo multimodal. O objetivo principal por trÃĄs do uso de uma abordagem de supervisÃĢo multimodal ÃĐ usar modelos de prÃĐ-treinamento de contraste multimodal, como o CLIP ou o modelo de prÃĐ-treinamento de linguagem e imagem contrastiva, como codificador de consulta para o framework. Como o modelo CLIP tem a capacidade de alinhar embeddings de texto com outras modalidades, como ÃĄudio ou visÃĢo, ele permite que os desenvolvedores treinem os modelos LASS usando dados ricos em modalidades e permita a interferÊncia com os dados textuais em um ambiente de zero-shot. Os frameworks LASS atuais, no entanto, usam conjuntos de dados em pequena escala para treinamento, e as aplicaçÃĩes do framework LASS em centenas de domínios potenciais ainda precisam ser exploradas.

Para resolver as limitaçÃĩes atuais enfrentadas pelos frameworks LASS, os desenvolvedores introduziram o AudioSep, um modelo fundamental que visa separar som de uma mistura de ÃĄudio usando descriçÃĩes de linguagem natural. O foco atual para o AudioSep ÃĐ desenvolver um modelo de separaçÃĢo de som prÃĐ-treinado que aproveite os conjuntos de dados multimodais em larga escala existentes para permitir a generalizaçÃĢo dos modelos LASS em aplicaçÃĩes de domínio aberto. Para resumir, o modelo AudioSep ÃĐ: “Um modelo fundamental para separaçÃĢo universal de som em domínio aberto usando consultas ou descriçÃĩes de linguagem natural treinado em conjuntos de dados de ÃĄudio e multimodais em larga escala”.

AudioSep: Componentes Chave e Arquitetura

A arquitetura do framework AudioSep compreende dois componentes principais: um codificador de texto e um modelo de separaçÃĢo.

O Codificador de Texto

O framework AudioSep usa um codificador de texto do modelo CLIP ou do modelo de prÃĐ-treinamento de linguagem e imagem contrastiva, ou do modelo CLAP ou do modelo de prÃĐ-treinamento de linguagem e ÃĄudio contrastiva, para extrair embeddings de texto dentro de uma consulta de linguagem natural. A consulta de texto de entrada consiste em uma sequÊncia de “N” tokens que ÃĐ processada pelo codificador de texto para extrair os embeddings de texto para a consulta de linguagem de entrada. O codificador de texto usa uma pilha de blocos de transformador para codificar os tokens de texto de entrada, e as representaçÃĩes de saída sÃĢo agregadas apÃģs serem passadas pelas camadas de transformador, o que resulta no desenvolvimento de uma representaçÃĢo de vetor de dimensÃĢo D com comprimento fixo, onde D corresponde às dimensÃĩes do modelo CLAP ou CLIP, enquanto o codificador de texto ÃĐ congelado durante o período de treinamento.

O modelo CLIP ÃĐ prÃĐ-treinado em um conjunto de dados de imagem-texto em larga escala usando aprendizado contrastivo, o que ÃĐ a principal razÃĢo pela qual o codificador de texto do CLIP aprende a mapear descriçÃĩes textuais no espaço semÃĒntico que tambÃĐm ÃĐ compartilhado pelas representaçÃĩes visuais. A vantagem que o AudioSep ganha ao usar o codificador de texto do CLIP ÃĐ que ele pode agora escalar ou treinar o modelo LASS a partir de dados de ÃĄudio-visÃĢo nÃĢo anotados, usando as embeddings visuais como uma alternativa, permitindo assim o treinamento de modelos LASS sem a necessidade de dados de ÃĄudio-texto anotados.

O modelo CLAP funciona de forma semelhante ao modelo CLIP e usa um objetivo de aprendizado contrastivo, pois usa um codificador de texto e um codificador de ÃĄudio para conectar ÃĄudio e linguagem, trazendo assim descriçÃĩes de texto e ÃĄudio para um espaço latente de ÃĄudio-texto unido.

Modelo de SeparaçÃĢo

O framework AudioSep usa um modelo ResUNet de domínio de frequÊncia que ÃĐ alimentado com uma mistura de cliques de ÃĄudio como a espinha dorsal da separaçÃĢo para o framework. O framework funciona aplicando uma transformada de Fourier de tempo curto (STFT) no sinal de onda para extrair um espectrograma complexo, o espectrograma de magnitude e a Fase de X. O modelo entÃĢo segue a mesma configuraçÃĢo e constrÃģi uma rede codificador-decodificador para processar o espectrograma de magnitude.

A rede codificador-decodificador ResUNet consiste em 6 blocos residuais, 6 blocos decodificadores e 4 blocos de gargalo. O espectrograma em cada bloco codificador usa 4 blocos convolucionais residuais para diminuir a si mesmo em um recurso de gargalo, enquanto os blocos decodificadores usam 4 blocos deconvolucionais residuais para obter os componentes de separaçÃĢo ao aumentar a escala dos recursos. Em seguida, cada um dos blocos codificadores e seus blocos decodificadores correspondentes estabelece uma conexÃĢo de skip que opera na mesma taxa de aumento ou diminuiçÃĢo. O bloco residual do framework consiste em 2 camadas de ativaçÃĢo Leaky-ReLU, 2 camadas de normalizaçÃĢo de lote e 2 camadas de CNN, e, alÃĐm disso, o framework tambÃĐm introduz um atalho residual adicional que conecta a entrada e a saída de cada bloco residual individual. O modelo ResUNet recebe o espectrograma complexo X como entrada e produz a mÃĄscara de magnitude M como saída, com o resíduo de fase condicionado nos embeddings de texto que controla a magnitude de escala e a rotaçÃĢo do ÃĒngulo do espectrograma. O espectrograma separado complexo pode entÃĢo ser extraído multiplicando a mÃĄscara de magnitude prevista e o resíduo de fase com a transformada de Fourier de tempo curto (STFT) da mistura.

No seu framework, o AudioSep usa uma camada FiLm ou Feature-wise Linearly modulated para conectar o modelo de separaçÃĢo e o codificador de texto apÃģs a implantaçÃĢo dos blocos convolucionais no ResUNet.

Treinamento e Perda

Durante o treinamento do modelo AudioSep, os desenvolvedores usam o mÃĐtodo de aumento de volume e treinam o framework AudioSep de ponta a ponta usando uma funçÃĢo de perda L1 entre as ondas de forma de verdade e previstas.

Conjuntos de Dados e Benchmarks

Como mencionado em seçÃĩes anteriores, o AudioSep ÃĐ um modelo fundamental que visa resolver a dependÊncia atual dos modelos LASS em conjuntos de dados de ÃĄudio-texto anotados. O modelo AudioSep ÃĐ treinado em uma ampla variedade de conjuntos de dados para equipÃĄ-lo com capacidades de aprendizado multimodal, e aqui estÃĄ uma descriçÃĢo detalhada do conjunto de dados e benchmarks usados pelos desenvolvedores para treinar o framework AudioSep.

AudioSet

O AudioSet ÃĐ um conjunto de dados de ÃĄudio grande e fracamente rotulado, composto por mais de 2 milhÃĩes de cliques de ÃĄudio de 10 segundos extraídos diretamente do YouTube. Cada clique de ÃĄudio no conjunto de dados AudioSet ÃĐ categorizado pela presença ou ausÊncia de classes de som, sem detalhes específicos de tempo dos eventos de som. O conjunto de dados AudioSet tem mais de 500 classes de som distintas, incluindo sons naturais, sons humanos, sons de veículos e muito mais.

VGGSound

O conjunto de dados VGGSound ÃĐ um conjunto de dados de ÃĄudio-visÃĢo grande que, assim como o AudioSet, foi extraído diretamente do YouTube e contÃĐm mais de 200.000 cliques de vídeo, cada um com 10 segundos de duraçÃĢo. O conjunto de dados VGGSound ÃĐ categorizado em mais de 300 classes de som, incluindo sons humanos, sons naturais, sons de pÃĄssaros e mais. O uso do conjunto de dados VGGSound garante que o objeto responsÃĄvel por produzir o som alvo tambÃĐm seja descritível no clipe de vídeo correspondente.

AudioCaps

O AudioCaps ÃĐ o maior conjunto de dados de legendas de ÃĄudio disponível publicamente e ÃĐ composto por mais de 50.000 cliques de ÃĄudio de 10 segundos extraídos do conjunto de dados AudioSet. Os dados no AudioCaps sÃĢo divididos em trÊs categorias: dados de treinamento, dados de teste e dados de validaçÃĢo, e os cliques de ÃĄudio sÃĢo anotados com descriçÃĩes de linguagem natural usando a plataforma Amazon (AMZN ) Mechanical Turk. É importante notar que cada clique de ÃĄudio no conjunto de dados de treinamento tem uma legenda Única, enquanto os dados nos conjuntos de teste e validaçÃĢo tÊm 5 legendas de verdade.

ClothoV2

O ClothoV2 ÃĐ um conjunto de dados de legendas de ÃĄudio que consiste em cliques extraídos da plataforma FreeSound, e, assim como o AudioCaps, cada clique de ÃĄudio ÃĐ anotado com descriçÃĩes de linguagem natural usando a plataforma Amazon Mechanical Turk.

WavCaps

Assim como o AudioSet, o WavCaps ÃĐ um conjunto de dados de ÃĄudio grande e fracamente rotulado, composto por mais de 400.000 cliques de ÃĄudio com legendas, e um tempo de execuçÃĢo total aproximado de 7568 horas de dados de treinamento. Os cliques de ÃĄudio no conjunto de dados WavCaps sÃĢo extraídos de uma ampla variedade de fontes de ÃĄudio, incluindo BBC Sound Effects, AudioSet, FreeSound, SoundBible e mais.

Detalhes de Treinamento

Durante a fase de treinamento, o modelo AudioSep amostra aleatoriamente dois segmentos de ÃĄudio de dois cliques de ÃĄudio diferentes do conjunto de dados de treinamento e os mistura para criar uma mistura de treinamento, onde o comprimento de cada segmento de ÃĄudio ÃĐ de cerca de 5 segundos. O modelo entÃĢo extrai o espectrograma complexo do sinal de onda usando uma janela Hann de tamanho 1024 com um tamanho de pulso de 320.

O modelo entÃĢo usa o codificador de texto dos modelos CLIP/CLAP para extrair os embeddings de texto com supervisÃĢo de texto como a configuraçÃĢo padrÃĢo para o AudioSep. Para o modelo de separaçÃĢo, o framework AudioSep usa uma camada ResUNet composta por 30 camadas, 6 blocos codificadores e 6 blocos decodificadores, semelhante à arquitetura seguida no framework de separaçÃĢo universal de som. AlÃĐm disso, cada bloco codificador tem duas camadas convolucionais com um tamanho de kernel de 3×3, com o nÚmero de mapas de recursos de saída dos blocos codificadores sendo 32, 64, 128, 256, 512 e 1024, respectivamente. Os blocos decodificadores compartilham simetria com os blocos codificadores, e os desenvolvedores aplicam o otimizador Adam para treinar o modelo AudioSep com um tamanho de lote de 96.

Resultados de AvaliaçÃĢo

Em Conjuntos de Dados Vistos

A figura a seguir compara o desempenho do framework AudioSep em conjuntos de dados vistos durante a fase de treinamento, incluindo os conjuntos de dados de treinamento. A figura a seguir representa os resultados de avaliaçÃĢo do framework AudioSep em comparaçÃĢo com sistemas de referÊncia, incluindo modelos de melhoria de fala e CLIP. O modelo AudioSep com codificador de texto CLIP ÃĐ representado como AudioSep-CLIP, enquanto o modelo AudioSep com codificador de texto CLAP ÃĐ representado como AudioSep-CLAP.

Como pode ser visto na figura, o framework AudioSep apresenta um desempenho superior quando usando legendas de ÃĄudio ou rÃģtulos de texto como consultas de entrada, e os resultados indicam o desempenho superior do framework AudioSep em comparaçÃĢo com os modelos de separaçÃĢo de som e LASS anteriores.

Em Conjuntos de Dados NÃĢo Vistos

Para avaliar o desempenho do AudioSep em um ambiente de zero-shot, os desenvolvedores continuaram a avaliar o desempenho em conjuntos de dados nÃĢo vistos, e o framework AudioSep entrega um desempenho de separaçÃĢo impressionante em um ambiente de zero-shot, e os resultados sÃĢo exibidos na figura a seguir.

AlÃĐm disso, a imagem a seguir mostra os resultados da avaliaçÃĢo do modelo AudioSep contra a melhoria de fala Voicebank-Demand.

A avaliaçÃĢo do framework AudioSep indica um desempenho forte e desejado em conjuntos de dados nÃĢo vistos em um ambiente de zero-shot, e assim abre caminho para realizar tarefas de operaçÃĢo de som em novas distribuiçÃĩes de dados.

VisualizaçÃĢo dos Resultados de SeparaçÃĢo

A figura a seguir mostra os resultados obtidos quando os desenvolvedores usaram o framework AudioSep-CLAP para realizar visualizaçÃĩes de espectrogramas para fontes de ÃĄudio alvo de verdade, misturas de ÃĄudio e fontes de ÃĄudio separadas usando consultas de texto de ÃĄudios ou sons diversos. Os resultados permitiram que os desenvolvedores observassem que o padrÃĢo de fonte separada do espectrograma estÃĄ prÃģximo da fonte de verdade, o que apoia os resultados objetivos obtidos durante os experimentos.

ComparaçÃĩes de Consultas de Texto

Os desenvolvedores avaliam o desempenho do AudioSep-CLAP e do AudioSep-CLIP no AudioCaps Mini, e os desenvolvedores usam as legendas de eventos do AudioSet, as legendas do AudioCaps e as descriçÃĩes de linguagem natural reanotadas para examinar os efeitos de diferentes consultas, e a figura a seguir mostra um exemplo do AudioCaps Mini em açÃĢo.

ConclusÃĢo

AudioSep ÃĐ um modelo fundamental que foi desenvolvido com o objetivo de ser um framework de separaçÃĢo universal de som em domínio aberto que usa descriçÃĩes de linguagem natural para separaçÃĢo de ÃĄudio. Como observado durante a avaliaçÃĢo, o framework AudioSep ÃĐ capaz de realizar aprendizado zero-shot e nÃĢo supervisionado de forma transparente, usando legendas de ÃĄudio ou rÃģtulos de texto como consultas. Os resultados e o desempenho de avaliaçÃĢo do AudioSep indicam um desempenho forte que supera os frameworks de separaçÃĢo de som atuais, como o LASS, e pode ser capaz de resolver as limitaçÃĩes atuais dos frameworks de separaçÃĢo de som populares.

Um engenheiro por profissÃĢo, um escritor por coraçÃĢo. Kunal ÃĐ um escritor tÃĐcnico com um amor e compreensÃĢo profundos de AI e ML, dedicado a simplificar conceitos complexos nestes campos por meio de sua documentaçÃĢo envolvente e informativa.