Modelos e plataformas de IA

StyleTTS 2: Síntese de Fala de Nível Humano com Grandes Modelos de Linguagem de Fala

mm
Adicione Unite.AI às suas fontes preferidas no Google

Devido ao aumento de abordagens de síntese de fala natural e sintética, um dos principais avanços que a indústria de IA alcançou nos últimos anos é a síntese eficaz de frameworks de texto para fala com aplicações potenciais em diferentes indústrias, incluindo livros de áudio, assistentes virtuais, narrações de voz e muito mais, com alguns modelos de ponta entregando desempenho e eficiência de nível humano em uma ampla gama de tarefas relacionadas à fala. No entanto, apesar de seu forte desempenho, ainda há espaço para melhoria para tarefas devido à fala expressiva e diversa, à necessidade de uma grande quantidade de dados de treinamento para otimizar frameworks de texto para fala zero-shot, e à robustez para textos Fora de Distribuição (OOD) ou Fora de Distribuição, levando os desenvolvedores a trabalhar em um framework de texto para fala mais robusto e acessível.

Neste artigo, vamos falar sobre o StyleTTS-2, um framework de texto para fala robusto e inovador que é construído sobre as fundações do framework StyleTTS, e visa apresentar o próximo passo em direção a sistemas de texto para fala de ponta. O framework StyleTTS2 modela estilos de fala como variáveis aleatórias latentes, e usa um modelo de difusão probabilístico para amostrar esses estilos de fala ou variáveis aleatórias, permitindo que o framework StyleTTS2 sintetize fala realista de forma eficaz sem usar entradas de áudio de referência. Devido à abordagem, o framework StyleTTS2 é capaz de entregar melhores resultados e mostra alta eficiência quando comparado a frameworks de texto para fala atuais de ponta, mas também é capaz de aproveitar a síntese de fala diversa oferecida por frameworks de difusão. Vamos discutir o framework StyleTTS2 em maior detalhe, e falar sobre sua arquitetura e metodologia, enquanto também damos uma olhada nos resultados alcançados pelo framework. Então, vamos começar.

StyleTTS2 para Síntese de Fala de Texto: Uma Introdução

O StyleTTS2 é um modelo de síntese de fala de texto inovador que dá o próximo passo em direção à construção de frameworks de TTS de nível humano, e é construído sobre o StyleTTS, um modelo de geração de fala baseado em estilo. O framework StyleTTS2 modela estilos de fala como variáveis aleatórias latentes, e usa um modelo de difusão probabilístico para amostrar esses estilos de fala ou variáveis aleatórias, permitindo que o framework StyleTTS2 sintetize fala realista de forma eficaz sem usar entradas de áudio de referência. Modelar estilos como variáveis aleatórias latentes é o que separa o framework StyleTTS2 de seu predecessor, o framework StyleTTS, e visa gerar o estilo de fala mais adequado para o texto de entrada sem precisar de uma entrada de áudio de referência, e é capaz de alcançar difusões latentes eficazes, aproveitando as capacidades de síntese de fala diversa oferecidas por modelos de difusão. Além disso, o framework StyleTTS2 também emprega um modelo de linguagem de fala grande pré-treinado como discriminador, como o framework WavLM, e o combina com sua própria abordagem de modelagem de duração diferenciável para treinar o framework de ponta a ponta, e, em última análise, gerar fala com naturalidade aprimorada. Graças à abordagem que segue, o framework StyleTTS2 supera os frameworks atuais de ponta para tarefas de geração de fala, e é um dos frameworks mais eficientes para pré-treinamento de modelos de fala em larga escala em configuração zero-shot para tarefas de adaptação de falante.

Em seguida, para entregar síntese de fala de texto de nível humano, o framework StyleTTs2 incorpora os conhecimentos de trabalhos existentes, incluindo modelos de difusão para síntese de fala e grandes modelos de linguagem de fala. Modelos de difusão são usualmente usados para tarefas de síntese de fala devido às suas habilidades de controle de fala em detalhes e capacidades de amostragem de fala diversa. No entanto, modelos de difusão não são tão eficientes quanto frameworks baseados em GAN não iterativos, e um dos principais motivos para isso é a necessidade de amostrar representações latentes, formas de onda e mel-espectrogramas iterativamente até a duração alvo da fala.

Por outro lado, trabalhos recentes em torno de grandes modelos de linguagem de fala indicaram sua capacidade de melhorar a qualidade de tarefas de geração de fala de texto, e adaptar-se bem ao falante. Grandes modelos de linguagem de fala normalmente convertem a entrada de texto em representações quantizadas ou contínuas derivadas de frameworks de linguagem de fala pré-treinados para tarefas de reconstrução de fala. No entanto, as características desses modelos de linguagem de fala não são otimizadas para síntese de fala diretamente. Em contraste, o framework StyleTTS2 aproveita os conhecimentos adquiridos por grandes modelos de linguagem de fala usando treinamento adversarial para sintetizar características de modelos de linguagem de fala sem usar mapas de espaço latente, e, portanto, aprendendo um espaço latente otimizado para síntese de fala diretamente.

StyleTTS2: Arquitetura e Metodologia

Em sua essência, o StyleTTS2 é construído sobre seu predecessor, o framework StyleTTS, que é um framework de texto para fala não autoregressivo que usa um codificador de estilo para derivar um vetor de estilo da áudio de referência, permitindo a geração de fala natural e expressiva. O vetor de estilo usado no framework StyleTTS é incorporado diretamente no codificador, duração e preditores usando a Normalização de Instância Adaptativa (AdaIN), permitindo que o modelo StyleTTS gere saídas de fala com prosódia, duração e até emoções variadas. O framework StyleTTS consiste em 8 modelos ao todo, divididos em três categorias

  1. Modelos Acústicos ou Sistema de Geração de Fala com um codificador de estilo, um codificador de texto e um decodificador de fala.
  2. Um Sistema de Previsão de Fala de Texto que usa preditores de prosódia e duração.
  3. Um Sistema de Utilidade que inclui um alinhador de texto, um extrator de tom e um discriminador para fins de treinamento.

Graças à sua abordagem, o framework StyleTTS entrega desempenho de ponta relacionado à síntese de fala controlável e diversa. No entanto, esse desempenho tem suas desvantagens, como degradação da qualidade da amostra, limitações expressivas e dependência de aplicações de fala em tempo real.

Melhorando o framework StyleTTS, o modelo StyleTTS2 resulta em tarefas de texto para fala expressivas aprimoradas com um desempenho fora de distribuição melhorado, e uma qualidade de nível humano. O framework StyleTTS2 usa um processo de treinamento de ponta a ponta que otimiza os diferentes componentes com treinamento adversarial, e síntese de forma de onda direta em conjunto. Diferentemente do framework StyleTTS, o framework StyleTTS2 modela o estilo de fala como uma variável latente, e o amostra por meio de modelos de difusão, gerando assim amostras de fala diversa sem usar uma áudio de referência. Vamos dar uma olhada detalhada nesses componentes.

Treinamento de Ponta a Ponta para Interferência

No framework StyleTTS2, uma abordagem de treinamento de ponta a ponta é utilizada para otimizar vários componentes de texto para fala para interferência sem precisar depender de componentes fixos. O framework StyleTTS2 alcança isso modificando o decodificador para gerar a forma de onda diretamente a partir do vetor de estilo, curvas de tom e energia, e representações alinhadas. O framework então remove a última camada de projeção do decodificador e a substitui por um decodificador de forma de onda. O framework StyleTTS2 usa dois codificadores: um decodificador baseado em HifiGAN para gerar a forma de onda diretamente, e um decodificador baseado em iSTFT para produzir fase e magnitude que são convertidas em formas de onda para interferência e treinamento mais rápidos.

A figura acima representa os modelos acústicos usados para pré-treinamento e treinamento conjunto. Para reduzir o tempo de treinamento, os módulos são primeiro otimizados na fase de pré-treinamento, seguidos da otimização de todos os componentes, exceto o extrator de tom, durante o treinamento conjunto. O motivo pelo qual o treinamento conjunto não otimiza o extrator de tom é porque ele é usado para fornecer a verdadeira curva de tom.

A figura acima representa o treinamento adversarial do modelo de linguagem de fala e interferência com o framework WavLM pré-treinado, mas não pré-ajustado. O processo difere do mencionado acima, pois pode levar entradas de texto variadas, mas acumula os gradientes para atualizar os parâmetros em cada lote.

Difusão de Estilo

O framework StyleTTS2 visa modelar a fala como uma distribuição condicional por meio de uma variável latente que segue a distribuição condicional, e essa variável é chamada de estilo de fala generalizado, e representa qualquer característica na amostra de fala além do escopo de qualquer conteúdo fonético, incluindo estresse lexical, prosódia, taxa de fala e até transições de formantes.

Discriminadores de Modelo de Linguagem de Fala

Modelos de linguagem de fala são renomados por suas habilidades gerais de codificar informações valiosas em uma ampla gama de semântica e aspectos acústicos, e as representações de SLM têm tradicionalmente sido capazes de imitar percepções humanas para avaliar a qualidade da fala sintetizada gerada. O framework StyleTTS2 usa uma abordagem de treinamento adversarial para utilizar a capacidade dos codificadores de SLM de realizar tarefas gerativas, e emprega um framework WavLM de 12 camadas como o discriminador. Essa abordagem permite que o framework habilite o treinamento em textos Fora de Distribuição (OOD) que podem ajudar a melhorar o desempenho. Além disso, para prevenir problemas de ajuste excessivo, o framework amostra textos OOD e em distribuição com probabilidade igual.

Modelagem de Duração Diferenciável

Tradicionalmente, um preditor de duração é usado em frameworks de texto para fala que produz durações de fonemas, mas os métodos de upsampling que esses preditores de duração usam frequentemente bloqueiam o fluxo de gradientes durante o processo de treinamento de ponta a ponta, e o framework NaturalSpeech emprega um upsampler baseado em atenção para conversão de texto para fala de nível humano. No entanto, o framework StyleTTS2 considera essa abordagem instável durante o treinamento adversarial, pois o StyleTTS2 é treinado usando upsampling diferenciável com treinamento adversarial sem perda de termos extras devido a diferenças de comprimento devido a desvios. Embora usar uma abordagem de tempo de guerra dinâmico suave possa ajudar a mitigar essa diferença, usá-la não é apenas computacionalmente caro, mas sua estabilidade também é uma preocupação ao trabalhar com objetivos adversariais ou tarefas de reconstrução de mel. Portanto, para alcançar desempenho de nível humano com treinamento adversarial e estabilizar o processo de treinamento, o framework StyleTTC2 usa uma abordagem de upsampling não paramétrico. O upsampling gaussiano é uma abordagem de upsampling não paramétrico popular para converter as durações previstas, embora tenha suas limitações devido ao comprimento fixo dos kernels gaussianos pré-determinados. Essa restrição para o upsampling gaussiano limita sua capacidade de modelar alinhamentos com diferentes comprimentos.

Para enfrentar essa limitação, o framework StyleTTC2 propõe usar uma nova abordagem de upsampling não paramétrico sem treinamento adicional, e capaz de contabilizar comprimentos variados de alinhamentos. Para cada fonema, o framework StyleTTC2 modela o alinhamento como uma variável aleatória, e indica o índice do quadro de fala com o qual o fonema se alinha.

Treinamento e Avaliação do Modelo

O framework StyleTTC2 é treinado e experimentado em três conjuntos de dados: VCTK, LibriTTS e LJSpeech. O componente de falante único do framework StyleTTS2 é treinado usando o conjunto de dados LJSpeech, que contém cerca de 13.000 amostras de áudio, divididas em 12.500 amostras de treinamento, 100 amostras de validação e cerca de 500 amostras de teste, com o tempo total de execução totalizando cerca de 24 horas. O componente de vários falantes do framework é treinado no conjunto de dados VCTK, que consiste em mais de 44.000 clipes de áudio com mais de 100 falantes nativos com diferentes sotaques, e é dividido em 43.500 amostras de treinamento, 100 amostras de validação e cerca de 500 amostras de teste. Finalmente, para equipar o framework com capacidades de adaptação zero-shot, o framework é treinado no conjunto de dados combinado LibriTTS, que consiste em clipes de áudio totalizando cerca de 250 horas de áudio com mais de 1.150 falantes. Para avaliar seu desempenho, o modelo emprega duas métricas: MOS-N ou Escore de Opinião Média de Naturalidade, e MOS-S ou Escore de Opinião Média de Semelhança.

Resultados

A abordagem e a metodologia usadas no framework StyleTTS2 são demonstradas em seu desempenho, pois o modelo supera vários frameworks de TTS de ponta, especialmente no conjunto de dados NaturalSpeech, e, ao longo do caminho, estabelece um novo padrão para o conjunto de dados. Além disso, o framework StyleTTS2 supera o framework VITS de ponta no conjunto de dados VCTK, e os resultados são demonstrados na figura a seguir.

O modelo StyleTTS2 também supera os modelos anteriores no conjunto de dados LJSpeech, e não exibe nenhum grau de degradação de qualidade em textos Fora de Distribuição (OOD) como exibido por frameworks anteriores nas mesmas métricas. Além disso, em configuração zero-shot, o modelo StyleTTC2 supera o framework Vall-E existente em naturalidade, embora fique atrás em termos de semelhança. No entanto, é importante notar que o framework StyleTTS2 é capaz de alcançar desempenho competitivo, apesar de ser treinado apenas em 245 horas de amostras de áudio, quando comparado a mais de 60.000 horas de treinamento para o framework Vall-E, provando assim que o StyleTTC2 é uma alternativa eficiente em termos de dados para os métodos de pré-treinamento existentes, como os usados no Vall-E.

Em seguida, devido à falta de dados de áudio rotulados com emoção, o framework StyleTTC2 usa o modelo GPT-4 para gerar mais de 500 instâncias em diferentes emoções para a visualização dos vetores de estilo que o framework cria usando seu processo de difusão.

Na primeira figura, estilos emocionais em resposta a sentimentos de texto de entrada são ilustrados pelos vetores de estilo do modelo LJSpeech, e demonstram a capacidade do framework StyleTTC2 de sintetizar fala expressiva com emoções variadas. A segunda figura mostra clusters distintos formados para cada um dos cinco falantes individuais, demonstrando uma ampla gama de diversidade proveniente de um único arquivo de áudio. A figura final demonstra o cluster solto de emoções do falante 1, e revela que, apesar de algumas sobreposições, os clusters de emoção são proeminentes, indicando a possibilidade de manipular o tom emocional de um falante, independentemente da amostra de áudio de referência e de seu tom de entrada. Apesar de usar uma abordagem baseada em difusão, o framework StyleTTS2 consegue superar os frameworks existentes de ponta, incluindo VITS, ProDiff e FastDiff.

Pensamentos Finais

Neste artigo, falamos sobre o StyleTTS2, um framework de texto para fala inovador e robusto que é construído sobre as fundações do framework StyleTTS, e visa apresentar o próximo passo em direção a sistemas de texto para fala de ponta. O framework StyleTTS2 modela estilos de fala como variáveis aleatórias latentes, e usa um modelo de difusão probabilístico para amostrar esses estilos de fala ou variáveis aleatórias, permitindo que o framework StyleTTS2 sintetize fala realista de forma eficaz sem usar entradas de áudio de referência. O framework StyleTTS2 usa a difusão de estilo e discriminadores de SLM para alcançar desempenho de nível humano em tarefas de texto para fala, e consegue superar os frameworks existentes de ponta em uma ampla gama de tarefas de fala.

Um engenheiro por profissão, um escritor por coração. Kunal é um escritor técnico com um amor e compreensão profundos de AI e ML, dedicado a simplificar conceitos complexos nestes campos por meio de sua documentação envolvente e informativa.