Modelos e plataformas de IA

Geração de Música por IA: Estabilidade de Áudio, MusicLM do Google e Mais

mm
Adicione Unite.AI às suas fontes preferidas no Google

A música, uma forma de arte que ressoa com a alma humana, sempre foi uma companheira constante de todos nós. A criação de música usando inteligência artificial começou há várias décadas. Inicialmente, as tentativas eram simples e intuitivas, com algoritmos básicos criando melodias monótonas. No entanto, à medida que a tecnologia avançou, também aumentou a complexidade e as capacidades dos geradores de música de IA, abrindo caminho para o aprendizado profundo e o processamento de linguagem natural (NLP) desempenharem papéis fundamentais nessa tecnologia.

Hoje, plataformas como o Spotify estão utilizando a IA para aprimorar as experiências de escuta dos usuários. Esses algoritmos de aprendizado profundo analisam as preferências individuais com base em vários elementos musicais, como tempo e humor, para criar sugestões de músicas personalizadas. Eles também analisam padrões de escuta mais amplos e vasculham a internet em busca de discussões sobre músicas para criar perfis de músicas detalhados.

A Origem da IA na Música: Uma Jornada da Composição Algorítmica ao Modelagem Gerativa

Nos estágios iniciais da mistura da IA no mundo da música, que abrangiam dos anos 1950 aos 1970, o foco estava principalmente na composição algorítmica. Esse era um método onde os computadores usavam um conjunto definido de regras para criar música. A primeira criação notável durante esse período foi a Suíte Illiac para Quarteto de Cordas em 1957. Ela usou o algoritmo de Monte Carlo, um processo envolvendo números aleatórios para dictar o pitch e o ritmo dentro dos limites da teoria musical tradicional e probabilidades estatísticas.

Imagem gerada pelo autor usando Midjourney

Imagem gerada pelo autor usando Midjourney

Durante esse tempo, outro pioneiro, Iannis Xenakis, utilizou processos estocásticos, um conceito envolvendo distribuições de probabilidade aleatórias, para criar música. Ele usou computadores e a linguagem FORTRAN para conectar múltiplas funções de probabilidade, criando um padrão onde diferentes representações gráficas correspondiam a espaços sonoros diversos.

A Complexidade de Traduzir Texto em Música

A música é armazenada em um formato de dados rico e multidimensional que abrange elementos como melodia, harmonia, ritmo e tempo, tornando a tarefa de traduzir texto em música altamente complexa. Uma música padrão é representada por quase um milhão de números em um computador, uma figura significativamente maior do que outros formatos de dados como imagem, texto, etc.

O campo da geração de áudio está testemunhando abordagens inovadoras para superar os desafios de criar som realista. Um método envolve gerar um espectrograma e, em seguida, convertê-lo de volta em áudio.

Outra estratégia aproveita a representação simbólica da música, como partituras, que podem ser interpretadas e tocadas por músicos. Esse método foi digitizado com sucesso, com ferramentas como o Chamber Ensemble Generator da Magenta, criando música no formato MIDI, um protocolo que facilita a comunicação entre computadores e instrumentos musicais.

Embora essas abordagens tenham avançado no campo, elas vêm com suas próprias limitações, destacando a natureza complexa da geração de áudio.

Modelos autoregressivos baseados em Transformer e modelos de difusão baseados em U-Net, como o modelo de difusão, estão à frente da tecnologia, produzindo resultados de estado da arte (SOTA) na geração de áudio, texto, música e muito mais. A série GPT da OpenAI e quase todos os outros LLMs atuais são alimentados por transformadores que utilizam arquiteturas de codificador, decodificador ou ambas. No lado de arte/imagem, MidJourney, Stability AI e DALL-E 2 todos aproveitam frameworks de difusão. Essas duas tecnologias centrais foram fundamentais para alcançar resultados de SOTA no setor de áudio também. Neste artigo, vamos mergulhar no MusicLM do Google (GOOGL ) e no Stable Audio, que são testemunhas das notáveis capacidades dessas tecnologias.

MusicLM do Google

O MusicLM do Google foi lançado em maio deste ano. O MusicLM pode gerar peças musicais de alta fidelidade que ressoam com o sentimento exato descrito no texto. Usando modelagem de sequência para sequência hierárquica, o MusicLM tem a capacidade de transformar descrições de texto em música que ressoa a 24 kHz por durações estendidas.

O modelo opera em um nível multidimensional, não apenas aderindo às entradas textuais, mas também demonstrando a capacidade de ser condicionado em melodias. Isso significa que ele pode pegar uma melodia cantarolada ou assobiada e transformá-la de acordo com o estilo delineado em uma legenda de texto.

Insights Técnicos

O MusicLM aproveita os princípios do AudioLM, uma estrutura introduzida em 2022 para geração de áudio. O AudioLM sintetiza áudio como uma tarefa de modelagem de linguagem dentro de um espaço de representação discreta, utilizando uma hierarquia de unidades de áudio discretas de grosso para fino, também conhecidas como tokens. Essa abordagem garante alta fidelidade e coerência de longo prazo por durações substanciais.

Para facilitar o processo de geração, o MusicLM estende as capacidades do AudioLM para incorporar condicionamento de texto, uma técnica que alinha o áudio gerado com as nuances da entrada de texto. Isso é alcançado por meio de um espaço de incorporação compartilhado criado usando MuLan, um modelo de música-texto conjunto treinado para projetar música e suas descrições de texto correspondentes próximas umas das outras em um espaço de incorporação. Essa estratégia elimina efetivamente a necessidade de legendas durante o treinamento, permitindo que o modelo seja treinado em corpora de áudio apenas.

O modelo MusicLM também usa SoundStream como seu tokenizador de áudio, que pode reconstruir música de 24 kHz a 6 kbps com fidelidade impressionante, aproveitando a quantização vetorial residual (RVQ) para compressão de áudio eficiente e de alta qualidade.

Ilustração do processo de pré-treinamento para os modelos fundamentais do MusicLM: SoundStream, w2v-BERT e MuLan

Ilustração do processo de pré-treinamento do MusicLM: SoundStream, w2v-BERT e MuLan | Fonte da imagem: aqui

Além disso, o MusicLM expande suas capacidades permitindo condicionamento de melodia. Essa abordagem garante que mesmo uma melodia simples cantarolada possa ser a base para uma experiência auditiva magnífica, ajustada às descrições de estilo textual exatas.

Os desenvolvedores do MusicLM também liberaram o MusicCaps, um conjunto de dados com 5.5k pares de música-texto, cada um acompanhado de descrições de texto ricas criadas por especialistas humanos. Você pode conferir aqui.

Pronto para criar trilhas sonoras de IA com o MusicLM do Google? Aqui está como começar:

  1. Visite o site oficial do MusicLM e clique em “Começar.”
  2. Se inscreva na lista de espera selecionando “Registrar seu interesse.”
  3. Faça login usando sua conta do Google.
  4. Uma vez que tenha acesso, clique em “Experimentar agora” para começar.

Aqui estão alguns prompts de exemplo que experimentei:

“Canção meditativa, calma e suave, com flautas e violões. A música é lenta, com foco em criar uma sensação de paz e tranquilidade.”

“jazz com saxofone”

Quando comparado a modelos SOTA anteriores, como Riffusion e Mubert, em uma avaliação qualitativa, o MusicLM foi preferido mais do que os outros, com os participantes avaliando favoravelmente a compatibilidade das legendas de texto com cliques de áudio de 10 segundos.

Comparação de desempenho do MusicLM

Comparação de desempenho do MusicLM, Fonte da imagem: aqui

Estabilidade de Áudio

A Stability AI introduziu recentemente o “Áudio Estável”, uma arquitetura de modelo de difusão latente condicionada em metadados de texto, além da duração do arquivo de áudio e do tempo de início. Essa abordagem, como o MusicLM do Google, tem controle sobre o conteúdo e a duração do áudio gerado, permitindo a criação de cliques de áudio com comprimentos especificados de até o tamanho da janela de treinamento.

Insights Técnicos

O Áudio Estável compreende vários componentes, incluindo um Autoencoder Variacional (VAE) e um modelo de difusão condicionado baseado em U-Net, trabalhando juntos com um codificador de texto.

Ilustração mostrando a integração de um autoencoder variacional (VAE), um codificador de texto e um modelo de difusão condicionado baseado em U-Net

Arquitetura do Áudio Estável, Fonte da imagem: aqui

O VAE facilita a geração mais rápida e o treinamento, comprimindo áudio estéreo em uma codificação de dados comprimida, resistente a ruídos e invertível, eliminando a necessidade de trabalhar com amostras de áudio brutos.

O codificador de texto, derivado de um modelo CLAP, desempenha um papel fundamental na compreensão das relações intricadas entre palavras e sons, oferecendo uma representação informativa do texto tokenizado. Isso é alcançado por meio da utilização de recursos de texto da camada penúltima do codificador de texto CLAP, que são então integrados ao U-Net por meio de camadas de atenção cruzada.

Um aspecto importante é a incorporação de incorporações de temporização, que são calculadas com base em duas propriedades: o segundo de início do chunk de áudio e a duração total do arquivo de áudio original. Esses valores, traduzidos em incorporações discretas aprendidas por segundo, são combinados com os tokens de prompt e alimentados nas camadas de atenção cruzada do U-Net, permitindo que os usuários dictam o comprimento geral do áudio de saída.

O modelo de Áudio Estável foi treinado utilizando um conjunto de dados extenso de mais de 800.000 arquivos de áudio, por meio de uma colaboração com o provedor de música de estoque AudioSparx.

Comerciais de áudio estável

Comerciais de áudio estável

O Áudio Estável oferece uma versão gratuita, permitindo 20 gerações de faixas de até 20 segundos por mês, e um plano Pro de $12/mês, permitindo 500 gerações de faixas de até 90 segundos.

Aqui está um clipe de áudio que criei usando o áudio estável.

Imagem gerada pelo autor usando Midjourney

Imagem gerada pelo autor usando Midjourney

“Cinematográfico, Trilha Sonora Chuva Suave, Ambiente, Calmo, Cães Distantes Latindo, Folhas Calmas, Vento Sutil, 40 BPM”

 

As aplicações de tais peças de áudio finamente elaboradas são infinitas. Cineastas podem aproveitar essa tecnologia para criar paisagens sonoras ricas e imersivas. No setor comercial, anunciantes podem utilizar essas faixas de áudio personalizadas. Além disso, essa ferramenta abre caminhos para criadores e artistas individuais experimentarem e inovarem, oferecendo uma tela de potencial ilimitado para criar peças sonoras que narram histórias, evocam emoções e criam atmosferas com uma profundidade que antes era difícil de alcançar sem um orçamento substancial ou expertise técnica.

Dicas de Prompt

Crie o áudio perfeito usando prompts de texto. Aqui está um guia rápido para começar:

  1. Seja Detalhado: Especifique gêneros, humores e instrumentos. Por exemplo: Cinematográfico, Selvagem Oeste, Percussão, Tenso, Atmosférico
  2. Configuração de Humor: Combine termos musicais e emocionais para transmitir o humor desejado.
  3. Escolha de Instrumento: Aumente os nomes de instrumentos com adjetivos, como “Guitarra Reverberada” ou “Coral Poderoso”.
  4. BPM: Alinhe o tempo com o gênero para uma saída harmoniosa, como “170 BPM” para uma faixa de Drum and Bass.

Notas de Encerramento

Imagem gerada pelo autor usando Midjourney

Imagem gerada pelo autor usando Midjourney

Neste artigo, mergulhamos na geração de música por IA, desde as composições algorítmicas até os sofisticados frameworks de IA gerativa de hoje, como o MusicLM do Google e o Áudio Estável. Essas tecnologias, aproveitando o aprendizado profundo e os modelos de compressão de estado da arte, não apenas aprimoram a geração de música, mas também refinam as experiências dos ouvintes.

No entanto, é um domínio em constante evolução, com desafios como manter a coerência de longo prazo e o debate em curso sobre a autenticidade da música criada por IA desafiando os pioneiros nesse campo. Há apenas uma semana, o assunto era sobre uma música criada por IA que canalizava os estilos de Drake e The Weeknd, que havia inicialmente ganhado destaque online no início do ano. No entanto, enfrentou a remoção da lista de indicações do Grammy, demonstrando o debate em curso sobre a legitimidade da música gerada por IA na indústria (fonte). À medida que a IA continua a pontuar as lacunas entre a música e os ouvintes, certamente está promovendo um ecossistema onde a tecnologia coexiste com a arte, fomentando a inovação enquanto respeita a tradição.

Eu passei os últimos cinco anos me imergindo no fascinante mundo de Aprendizado de Máquina e Aprendizado Profundo. Minha paixão e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua também me levou em direção ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.