Modelos e plataformas de IA
HierSpeech++ : Inferência Variacional Hierárquica para Síntese de Fala Zero-Shot
Os recentes desenvolvimentos e o progresso nas capacidades dos grandes modelos de linguagem desempenharam um papel crucial nos avanços dos quadros baseados em LLM para geração de áudio e tarefas de síntese de fala, especialmente no cenário de zero-shot. Os quadros tradicionais de síntese de fala testemunharam avanços significativos como resultado da integração de recursos adicionais, como codificadores de áudio neurais para unidades de áudio e fala discretas. Embora esses quadros de síntese de fala e áudio forneçam resultados satisfatórios, ainda há espaço para melhoria, pois os atuais quadros de áudio baseados em LLM têm as seguintes três limitações principais
- Eles tendem a auto-gerar saída de áudio que, por fim, causa falta de robustez e velocidade de interferência lenta, resultando em pronúncia errada, pulando ou repetindo.
- Eles tendem a confiar demais em unidades de fala discretas ou em um codificador de áudio neural pré-treinado.
- Eles frequentemente exigem uma grande quantidade de dados de treinamento.
Para lidar com os problemas mencionados acima e melhorar as capacidades dos modelos de síntese de fala e áudio baseados em LLM, os desenvolvedores criaram o HierSpeech++, um sintetizador de fala zero-shot robusto e eficiente para conversões de voz e texto para fala ou TTS. O quadro HierSpeech++ se baseia nos conhecimentos dos quadros de síntese de fala hierárquica que não apenas aumentam a robustez, mas também adicionam expressividade à saída de fala sintética, além de aumentar a naturalidade e a semelhança do falante da fala artificial, mesmo em um cenário de zero-shot.
Neste artigo, vamos discutir o quadro HierSpeech++ em detalhes e analisar a arquitetura do modelo, seu funcionamento e os resultados quando comparados a modelos de geração de texto e áudio de última geração. Vamos começar.
HierSpeech++ : Inferência Variacional Hierárquica para Síntese de Fala Zero-Shot
O HierSpeech++ é um quadro de síntese de fala zero-shot rápido, robusto e eficiente que usa um pipeline de síntese de fala hierárquica e, ao adotar esse quadro de síntese de fala de ponta a ponta, o modelo HierSpeech++ é capaz de maximizar o potencial de geração de forma de onda de alta qualidade para hierarquicamente preencher a lacuna entre as representações semântica e acústica, adotando uma representação de fala auto-supervisionada como representação de fala semântica e, assim, tenta resolver as limitações atuais de adaptação de estilo. O quadro de síntese de fala de ponta a ponta foi introduzido pela primeira vez pelo modelo VITS e adota um VAE ou Auto-Encoder Variacional aumentado com treinamento adversarial e fluxo normalizador. Além disso, os quadros baseados em VAE com um pipeline de treinamento de ponta a ponta têm a capacidade de gerar áudio de forma de onda de alta qualidade, com a qualidade de síntese de fala perceptual sendo significativamente melhor do que a dos outros quadros de síntese de fala.
A qualidade de reconstrução de áudio desses quadros pode ser aprimorada ainda mais usando um Auto-Encoder Variacional Condicional Hierárquico, como usado no quadro HierSpeech. Apesar de seu potencial, os modelos baseados em pipeline de treinamento de ponta a ponta têm certas limitações, especialmente em um cenário de zero-shot, pois, embora possam sintetizar amostras de fala com áudio de alta qualidade, a semelhança do falante em tarefas de clonagem de voz zero-shot ainda é afetada por alta complexidade computacional. Por outro lado, modelos de síntese de fala baseados em difusão performam bem em termos de adaptação de falante, mas ainda estão longe da perfeição, pois usam um processo de geração interativo que desacelera a velocidade de inferência, são frequentemente vulneráveis a dados ruins e, como resultado da discordância entre o treinamento e a inferência do processo de geração de duas etapas entre o Mel-espectrograma e o áudio de verdade gerado, a qualidade do áudio não é satisfatória.
Para lidar com os problemas enfrentados por seus antecessores, o modelo HierSpeech++ emprega um sintetizador de fala hierárquico, uma super-resolução de fala e um componente de texto para vetor, e introduz um sintetizador de fala hierárquico aprimorado baseado no Auto-Encoder Variacional Condicional Hierárquico. Em uma tentativa de aprimorar a qualidade do áudio além da qualidade perceptual, o quadro HierSpeech++ adota um áudio dual para aumentar a posterior acústica e melhora a generalização fora da distribuição, empregando um gerador adaptativo hierárquico equipado com geração condicional e incondicional. Além disso, para desembaraçar os componentes da fala e aprimorar as informações semânticas relacionadas ao falante e ao falante-agnóstico, o quadro HierSpeech++ também adota uma codificação de teoria de fonte e filtro baseada em multi-caminho. Como resultado de empregar um Auto-Encoder Variacional, o modelo HierSpeech++ pode conectar e aprender representações hierarquicamente e se adaptar progressivamente ao estilo de voz alvo para inferir o áudio de forma de onda. Além disso, o quadro HierSpeech++ também implanta uma rede bidirecional de Transformadores de fluxo normalizador em uma tentativa de aprimorar a adaptação e reduzir a discordância entre o treinamento e a inferência.
No geral, o modelo HierSpeech++ é um quadro de síntese de fala hierárquica totalmente paralelo, novo e robusto, visando sintetizar amostras de fala em um cenário de zero-shot e tenta fazer as seguintes contribuições
- Usar um quadro de síntese de fala hierárquica para controlar e transferir estilos de voz e prosódia.
- Habilitar escalabilidade de dados e síntese de fala de alta resolução, amostrando o áudio de forma de onda de 16 para 48 kHz.
- Alcançar habilidade de nível humano em conversões de voz zero-shot e tarefas de texto para fala.
HierSpeech++ : Componentes do Modelo e Arquitetura
Como discutido, o HierSpeech++ é um modelo de síntese de fala zero-shot que tenta alcançar precisão de nível humano em termos de semelhança de voz e naturalidade da fala.

O modelo HierSpeech++ consiste em diferentes componentes, incluindo um sintetizador de fala hierárquico, uma super-resolução de fala e um texto para vetor, que trabalham em sincronia para facilitar o treinamento de cada modelo que pode efetivamente utilizar uma grande quantidade de dados de fala de baixa resolução para clonagem de voz. Vamos quebrar o quadro e discutir cada componente.
Representações de Fala
Como a faixa de frequência humana está abaixo de 4 kHz, para síntese de fala, o quadro HierSpeech++ reduz a amostra de áudio para 16 kHz. Além disso, para reconstruir o sinal de voz, é vital usar pelo menos o dobro da componente de frequência de voz mais alta, além de reduzir a amostra de áudio. Para obter uma qualidade perceptual aprimorada, o quadro HierSpeech++ usa um componente de super-resolução de fala ou SpeechSR para amostrar a amostra de áudio de 16 para 48 kHz e usa representações de baixa resolução para representações semânticas e acústicas.

Para representações acústicas, um quadro de fala tradicional para texto emprega um Mel-espectrograma como sua característica acústica intermediária, que é então transformada da forma de onda com a ajuda de uma Transformada de Fourier de Tempo Curto ou STFT. No entanto, é worth notar que, como as características acústicas são representações ricas que compreendem vários atributos, incluindo conteúdo e pronúncia, informações de voz e mais, isso torna difícil para o quadro inferir essas representações, uma situação que frequentemente leva a pronúncias erradas, falta de semelhança ou suavização excessiva da fala.
Continuando, para extrair uma representação semântica contínua de uma forma de onda, o quadro HierSpeech++ utiliza um quadro Wav2Vec em contraste com a abordagem de representação de fala auto-supervisionada popular para representações semânticas. Embora a abordagem faça um bom substituto para um modelo monolíngue rico, ela afeta as habilidades de clonagem de voz zero-shot do modelo em termos de robustez e expressividade, especialmente em tarefas de síntese de fala multilíngue.
Sintetizador de Fala Hierárquico
O componente do Sintetizador de Fala Hierárquico é a pedra angular do quadro HierSpeech++, pois permite treinar o módulo sem usar rótulos como transcritos de texto ou ID do falante, e confiando apenas em dados de fala. Para aumentar a capacidade acústica, os modelos de síntese de fala de última geração substituíram o Mel-espectrograma por um espectrograma linear, no entanto, a abordagem minimiza a pontuação de divergência de KL em termos de periodicidade de tom, PESQ, pontuação de voz e não voz, e até a distância do Mel-espectrograma. O Sintetizador de Fala Hierárquico emprega um Codificador Acústico Dual-Áudio para resolver os desafios apresentados pelo uso de um espectrograma linear projetado para capturar representações acústicas mais ricas e abrangentes. O quadro também emprega um codificador de forma de onda para destilar informações de uma forma de onda de áudio bruta e as concatena com a representação do espectrograma linear, e, finalmente, projeta a representação acústica como uma representação concatenada.

Além disso, para lidar com representações semânticas relacionadas ao falante e ao falante-agnóstico, o quadro HierSpeech++ utiliza uma representação de fala auto-supervisionada de multi-caminho, onde cada representação individual é usada para adaptação de estilo hierárquico com as representações semânticas extraídas para obter informações linguísticas da camada média do MMS. O quadro também utiliza uma frequência fundamental para aprimorar a desembaraçação da fala, o que permite controlar o contorno de tom manualmente. O quadro também usa uma representação linguística como informação condicional para gerar áudio de forma de onda hierarquicamente e usa uma representação linguística aprimorada da representação auto-supervisionada. É também worth notar que as representações acústicas extraídas durante o treinamento, usando uma forma de onda e um espectrograma linear, são usadas para reconstruir o áudio de forma de onda bruta, e uma inferência variacional hierárquica é usada para vincular as representações acústicas com as representações linguísticas de multi-caminho. O quadro também emprega um gerador adaptativo hierárquico (HAG) para gerar amostras de forma de onda para semântica, e as representações geradas, que compreendem uma representação de estilo e uma representação acústica, são alimentadas aos geradores de fonte e forma de onda.
Texto para Vetor
Para síntese de fala de texto, o quadro HierSpeech++ emprega um modelo de texto para vetor ou TTV que gera uma frequência fundamental e uma representação semântica de uma sequência de texto e utiliza uma busca de alinhamento monótona acoplada com um Auto-Encoder Variacional para alinhar a fala e o texto internamente. O quadro HierSpeech++ então substitui o espectrograma linear por uma representação linear auto-supervisionada e reconstrói a mesma representação para servir como a saída para o TTV.

Além disso, o quadro HierSpeech++ prevê a frequência fundamental com resoluções quatro vezes maiores em comparação com as representações de fala auto-supervisionadas e usa uma representação de texto condicional como informação de prioridade. Como resultado da informação semântica das representações de fala auto-supervisionadas, o quadro é capaz de transferir o estilo de prosódia no modelo de texto para vetor e alimenta uma representação latente ao codificador de fonema para aprimorar as capacidades linguísticas da representação.
SpeechSR ou Super Resolução de Fala
O quadro HierSpeech++ é treinado em um conjunto de dados de resolução relativamente baixa em termos de eficiência de dados e disponibilidade e amostra uma forma de onda de fala de baixa resolução para uma forma de onda de fala de alta resolução de 16 para 48 kHz. O quadro também substitui uma convolução transposta por um interpolador de vizinho mais próximo que foi previamente conhecido por aliviar artefatos como resultado de convoluções transpostas.

Arquitetura
O codificador de conteúdo do modelo de texto para vetor consiste em 16 camadas de WaveNet não-causais com um tamanho de kernel de 5 e um tamanho oculto de 256, enquanto o decodificador de conteúdo consiste em 8 camadas de WaveNet não-causais com um tamanho de kernel de 5 e um tamanho oculto de 512. O componente do codificador de texto consiste em três redes de Transformadores condicionais de prosódia e três redes de Transformadores incondicionais com um tamanho de kernel de 9, tamanho de filtro de 1024 e um tamanho oculto de 256, com o codificador de texto tendo uma taxa de dropout de 0,2. Para codificar informações adjacentes e aprimorar a adaptação de estilo de prosódia, o quadro adota uma CNN com um tamanho de kernel de 5 nas blocos de Transformador. O SpeechSR, por outro lado, compreende um único bloco AMP com 32 canais iniciais sem a presença de uma camada de amostragem. O quadro usa um interpolador de vizinho mais próximo para amostrar as representações ocultas e utiliza um MPD como o discriminador com seis tamanhos de janela diferentes e quatro discriminadores de sub-banda.

A figura acima demonstra o pipeline de inferência do quadro HierSpeech++ que começa com a extração de representações semânticas do áudio em uma frequência de 16 kHz e na frequência fundamental, usando o algoritmo YAPPT. Antes que a frequência fundamental possa ser alimentada ao Sintetizador Hierárquico, ela é normalizada usando os desvios padrão e média da fonte de áudio, e a frequência fundamental normalizada é então desnormalizada usando os desvios padrão e média do áudio de destino. Para extrações de texto para fala, o quadro HierSpeech++ extrai representações textuais em vez de representações de fala e emprega o modelo de texto para vetor para gerar uma representação semântica a partir do prompt de prosódia.
Experimento e Resultados
O quadro utiliza o conjunto de dados LibriTTS disponível publicamente para treinar o componente do sintetizador hierárquico, com a primeira etapa sendo o treinamento do modelo com os subconjuntos de treinamento limpo do conjunto de dados e utilizando os dados restantes para permitir a transferência aprimorada do estilo de voz. Além disso, para melhorar a diversidade e a robustez, o quadro amplia o conjunto de dados para 1 kHz, como demonstrado na figura a seguir.

Reconstrução, Tarefas de Resíntese e Conversão de Voz
Para avaliar o desempenho do quadro HierSpeech++ em tarefas de reconstrução e resíntese, os desenvolvedores realizaram sete métricas objetivas e os resultados são demonstrados nas figuras a seguir para tarefas de reconstrução e resíntese, respectivamente.


Para tarefas de conversão de voz, o quadro usa duas métricas subjetivas para avaliação: semelhança de voz MOS ou sMOS e pontuação de opinião de naturalidade média ou nMOS, com três métricas de naturalidade objetivas e duas métricas de semelhança objetivas.

Continuando, o objetivo principal do quadro HierSpeech++ é permitir a síntese de fala zero-shot e, para avaliar seu desempenho em zero-shot, ele é comparado a outros modelos base, como AutoVC, VoiceMixer, modelos baseados em difusão e muitos mais, com os resultados sendo demonstrados na figura a seguir.

As figuras a seguir demonstram os resultados de síntese de texto para fala zero-shot com prompts barulhentos e muito barulhentos, respectivamente.


Pensamentos Finais
Neste artigo, discutimos o modelo HierSpeech++, uma abordagem nova para permitir a síntese de fala robusta e eficaz em um cenário de zero-shot e superar as limitações enfrentadas pelos quadros de síntese de fala atuais, incluindo sua dependência excessiva de grandes quantidades de dados de treinamento, dependência de unidades de fala discretas ou codificadores de áudio neural pré-treinados e sua tendência a auto-gerar saída de áudio que, por fim, causa falta de robustez e velocidade de interferência lenta, resultando em pronúncia errada, pulando ou repetindo. O modelo HierSpeech++ é um quadro de síntese de fala hierárquica totalmente paralelo, novo e robusto, visando sintetizar amostras de fala em um cenário de zero-shot e tenta fazer as seguintes contribuições
- Usar um quadro de síntese de fala hierárquica para controlar e transferir estilos de voz e prosódia.
- Habilitar escalabilidade de dados e síntese de fala de alta resolução, amostrando o áudio de forma de onda de 16 para 48 kHz.
- Alcançar habilidade de nível humano em conversões de voz zero-shot e tarefas de texto para fala.












