Modelli e piattaforme di IA
HierSpeech++ : Inferenza Variazionale Gerarchica per Sintesi di Voce Zero-Shot
Gli sviluppi recenti e i progressi nelle capacità dei grandi modelli linguistici hanno svolto un ruolo cruciale nei progressi dei framework basati su LLM per la generazione di audio e la sintesi di voce, in particolare nell’impostazione zero-shot. I framework tradizionali di sintesi di voce hanno assistito a notevoli progressi a seguito dell’integrazione di funzionalità aggiuntive come codec audio neurali per unità audio e voce discrete. Sebbene questi framework di sintesi di voce e audio forniscono risultati soddisfacenti, c’è ancora spazio per il miglioramento, poiché gli attuali framework audio basati su LLM hanno le seguenti tre limitazioni principali
- Tendono ad auto-generare output audio che alla fine causa una mancanza di robustezza e velocità di interferenza lenta e si traduce in errori di pronuncia, salti o ripetizioni.
- Tendono a fare affidamento eccessivo su unità di voce discrete o codec audio neurali pre-addestrati.
- Richiedono spesso una grande quantità di dati di addestramento.
Per affrontare i problemi sopra menzionati e migliorare le capacità dei modelli di sintesi di voce e audio basati su LLM, gli sviluppatori hanno creato HierSpeech++, un sintetizzatore di voce zero-shot robusto ed efficiente per conversioni di voce e testo in voce o TTS. Il framework HierSpeech++ si basa sulle conoscenze dei framework di sintesi di voce gerarchica che non solo aumentano la robustezza, ma aggiungono anche espressività all’output di voce sintetica e migliorano la naturalità e la somiglianza del parlato artificiale, anche in un’impostazione zero-shot.
In questo articolo, parleremo del framework HierSpeech++ nel dettaglio e esamineremo l’architettura del modello, il funzionamento e i risultati quando confrontati con i modelli di generazione di testo e audio attuali. Quindi, iniziamo.
HierSpeech++ : Inferenza Variazionale Gerarchica per Sintesi di Voce Zero-Shot
HierSpeech++ è un framework di sintesi di voce zero-shot veloce, robusto ed efficiente che utilizza una pipeline di sintesi di voce gerarchica e, adottando questo framework di sintesi di voce end-to-end, il modello HierSpeech++ è in grado di massimizzare il potenziale della generazione di forma d’onda di alta qualità per collegare gerarchicamente il divario tra rappresentazioni semantiche e acustiche adottando una rappresentazione di voce auto-supervisionata come rappresentazione di voce semantica e tenta di risolvere le limitazioni attuali di adattamento di stile. Il framework di sintesi di voce end-to-end è stato introdotto per la prima volta dal modello VITS e adotta un VAE o Auto-Encoder Variazionale aumentato con addestramento avversario e flusso di normalizzazione. Inoltre, i framework VAE-based con una pipeline di addestramento end-to-end hanno la capacità di generare forma d’onda audio di alta qualità con una qualità di sintesi di voce percettiva significativamente migliore di quella generata da altri framework di sintesi di voce.
La qualità di ricostruzione audio di questi framework può essere ulteriormente migliorata utilizzando un Auto-Encoder Variazionale condizionale gerarchico come utilizzato nel framework HierSpeech. Nonostante il loro potenziale, i modelli con pipeline di addestramento end-to-end hanno alcune limitazioni, in particolare in un’impostazione zero-shot, poiché anche se possono sintetizzare campioni di voce con audio di alta qualità, la somiglianza del parlante nelle attività di clonazione di voce zero-shot è ancora afflitta da alta complessità computazionale. D’altra parte, i modelli di sintesi di voce basati su diffusione si comportano bene in termini di adattamento del parlante, ma sono ancora lontani dalla perfezione poiché utilizzano un processo di generazione interattivo che rallenta la velocità di inferenza, sono spesso vulnerabili ai dati rumorosi e, a causa della mancanza di corrispondenza tra l’addestramento e l’inferenza del processo di generazione a due stadi tra il Mel-spettrogramma e il campione di voce generato, la qualità audio non è all’altezza.
Per affrontare i problemi affrontati dai suoi predecessori, il modello HierSpeech++ impiega un sintetizzatore di voce gerarchico, una super-risoluzione di voce e un componente testo-vec, e introduce un sintetizzatore di voce gerarchico migliorato basato sull’Auto-Encoder Variazionale condizionale gerarchico. Nel tentativo di migliorare la qualità audio oltre la qualità percettiva, il framework HierSpeech++ adotta un dual-audio per aumentare la posteriore acustica e migliora la generalizzazione fuori dalla distribuzione utilizzando un generatore adattivo gerarchico dotato di generazione condizionale e non condizionale. Inoltre, per scindere i componenti di voce e migliorare le informazioni semantiche relative al parlante e agnostiche al parlante, il framework HierSpeech++ adotta anche una teoria del filtro a multi-percorso basata su un codificatore semantico. Come risultato dell’impiego di un Auto-Encoder Variazionale, il modello HierSpeech++ può collegare e apprendere rappresentazioni in modo gerarchico e adattarsi progressivamente allo stile di voce del bersaglio per inferire la forma d’onda audio. Inoltre, il framework HierSpeech++ dispiega anche una rete bidirezionale di Trasformatori di flusso di normalizzazione nel tentativo di migliorare l’adattamento e ridurre la mancanza di corrispondenza tra l’addestramento e l’inferenza.
Nel complesso, il modello HierSpeech++ è un framework di sintesi di voce gerarchica completamente parallelo, nuovo e robusto finalizzato alla sintesi di campioni di voce in un’impostazione zero-shot e tenta di apportare i seguenti contributi
- Utilizzare un framework di sintesi di voce gerarchico per controllare e trasferire stili di voce e prosodia.
- Abilitare la scalabilità dei dati e la sintesi di voce ad alta risoluzione campionando la forma d’onda audio da 16 a 48 kHz.
- Raggiungere un’abilità umana attraverso la conversione di voce zero-shot e le attività di testo-in-voce.
HierSpeech++ : Componenti del Modello e Architettura
Come discusso, HierSpeech++ è un modello di sintesi di voce zero-shot che tenta di raggiungere un’accuratezza umana in termini di somiglianza di voce e naturalità di voce.

Il modello HierSpeech++ consiste di diversi componenti, tra cui un sintetizzatore di voce gerarchico, una super-risoluzione di voce e un testo-vec per TTV che lavorano in sincronia per facilitare l’addestramento di ciascun modello che può effettivamente utilizzare una grande quantità di dati di voce a bassa risoluzione per il clonaggio di voce. Analizziamo il framework e parliamo di ciascun componente.
Rappresentazioni di Voce
Poiché la banda di frequenza umana è inferiore a 4 kHz, per la sintesi di voce, il framework HierSpeech++ campiona l’audio a 16 kHz. Inoltre, per ricostruire il segnale di voce, è fondamentale utilizzare almeno il doppio della frequenza di voce più alta in aggiunta al campionamento dell’audio. Per ottenere una qualità percettiva migliorata, il framework HierSpeech++ utilizza un componente di super-risoluzione di voce o SpeechSR per campionare la forma d’onda audio da 16 a 48 kHz e utilizza rappresentazioni a bassa risoluzione per rappresentazioni semantiche e acustiche.

Per le rappresentazioni acustiche, un framework di sintesi di voce tradizionale utilizza un Mel-spettrogramma come caratteristica acustica intermedia che viene poi trasformato dalla forma d’onda con l’aiuto di una STFT o Trasformata di Fourier a tempo breve. Tuttavia, è degno di nota che poiché le caratteristiche acustiche sono rappresentazioni ricche che comprendono vari attributi, tra cui contenuto e pronuncia, informazioni di voce e altro, ciò rende difficile per il framework inferire queste rappresentazioni, una situazione che spesso porta a errori di pronuncia, mancanza di somiglianza o eccessiva levigatura della voce.
Proseguendo, per estrarre una rappresentazione semantica continua da una forma d’onda, il framework HierSpeech++ utilizza un framework Wav2Vec in contrasto con l’approccio di rappresentazione di voce auto-supervisionata popolare per rappresentazioni semantiche. Sebbene l’approccio faccia una buona alternativa per un modello monolingue ricco, influisce sulle capacità di clonaggio di voce zero-shot del modello in termini di robustezza ed espressività, specialmente sulle attività di sintesi di voce multilingue.
Sintetizzatore di Voce Gerarchico
Il componente del Sintetizzatore di Voce Gerarchico è la pietra angolare del framework HierSpeech++ poiché consente l’addestramento del modulo senza utilizzare etichette come trascrizioni di testo o ID del parlante e facendo affidamento solo sui dati di voce. Per aumentare la capacità acustica, i modelli di sintesi di voce attuali sostituiscono il Mel-spettrogramma con uno spettrogramma lineare, tuttavia, l’approccio minimizza il punteggio di divergenza KL in termini di periodicità del pitch, PESQ, punteggio di voce e non voce e anche distanza dello spettrogramma di Mel. Il Sintetizzatore di Voce Gerarchico impiega un Encodatore Acustico Dual-audio per risolvere le sfide presentate dall’utilizzo di uno spettrogramma lineare progettato per catturare rappresentazioni acustiche più ricche e complete. Il framework utilizza anche un encodatore di forma d’onda per distillare le informazioni da una forma d’onda audio grezza e le concatena con la rappresentazione dello spettrogramma lineare e, infine, proietta la rappresentazione acustica come rappresentazione concatenata.

Inoltre, per affrontare le rappresentazioni semantiche agnostiche e relative al parlante, il framework HierSpeech++ utilizza una rappresentazione di voce auto-supervisionata a multi-percorso in cui ogni rappresentazione individuale viene utilizzata per l’adattamento di stile gerarchico con le rappresentazioni semantiche estratte per ottenere informazioni linguistiche dal livello medio della MMS. Il framework utilizza anche una frequenza fondamentale per migliorare la disarticolazione della voce, che consente il controllo manuale del contorno del pitch. Il framework utilizza anche una rappresentazione linguistica come informazione condizionale per generare forma d’onda audio in modo gerarchico e utilizza una rappresentazione linguistica migliorata della rappresentazione auto-supervisionata. È anche degno di nota che le rappresentazioni acustiche estratte durante l’addestramento utilizzando una forma d’onda e uno spettrogramma lineare vengono utilizzate per ricostruire la forma d’onda audio grezza e un’inferenza variazionale gerarchica viene utilizzata per collegare le rappresentazioni acustiche con le rappresentazioni linguistiche a multi-percorso. Il framework utilizza anche un generatore adattivo gerarchico (HAG) per generare campioni di forma d’onda da semantica e le rappresentazioni generate, che comprendono una rappresentazione di stile e una rappresentazione acustica, vengono alimentate ai generatori di forma d’onda e di sorgente.
Testo-Vec
Per la sintesi di voce del testo, il framework HierSpeech++ impiega un modello testo-vec o TTV che genera una frequenza fondamentale e una rappresentazione semantica da una sequenza di testo e utilizza una ricerca di allineamento monotono accoppiata con un Auto-Encoder Variazionale per allineare la voce e il testo internamente. Il framework HierSpeech++ sostituisce poi lo spettrogramma lineare con una rappresentazione lineare auto-supervisionata e ricostruisce la stessa rappresentazione per servire come output per il TTV.

Inoltre, il framework HierSpeech++ prevede la frequenza fondamentale con risoluzioni quattro volte più grandi rispetto alle rappresentazioni di voce auto-supervisionate e utilizza una rappresentazione di testo condizionale come informazione di priorità. Come risultato delle informazioni semantiche delle rappresentazioni di voce auto-supervisionate, il framework è in grado di trasferire lo stile di prosodia nel modello testo-vec e alimenta una rappresentazione latente all’encodatore di fonemi per migliorare le capacità linguistiche della rappresentazione.
SpeechSR o Super-Risoluzione di Voce
Il framework HierSpeech++ si addestra su un set di dati relativamente a bassa risoluzione in termini di efficienza dei dati e disponibilità e campiona una forma d’onda di voce a bassa risoluzione in una forma d’onda di voce ad alta risoluzione da 16 a 48 kHz. Il framework sostituisce anche una convoluzione trasposta con un campionatore del vicino più vicino che è stato precedentemente noto per alleviare gli artefatti a causa delle convoluzioni trasposte.

Architettura
L’encodatore di contenuto del modello testo-vec consiste di 16 layer WaveNet non casuali con una dimensione del kernel di 5 e una dimensione nascosta di 256, mentre il decodificatore di contenuto consiste di 8 layer WaveNet non casuali con una dimensione del kernel di 5 e una dimensione nascosta di 512. Il componente dell’encodatore di testo consiste di tre reti neurali Transformer condizionali di prosodia e tre reti neurali Transformer non condizionali con una dimensione del kernel di 9, una dimensione del filtro di 1024 e una dimensione nascosta di 256 con un tasso di dropout dell’encodatore di testo del 20%. Per codificare le informazioni adiacenti e migliorare l’adattamento di stile di prosodia, il framework adotta una CNN con una dimensione del kernel di 5 nei blocchi Transformer. La SpeechSR, d’altra parte, comprende un singolo blocco AMP con 32 canali iniziali senza la presenza di un livello di campionamento. Il framework utilizza un campionatore del vicino più vicino per campionare le rappresentazioni nascoste e utilizza un MPD come discriminatore con sei dimensioni di finestra diverse e quattro discriminatori di sottobanda.

La figura sopra mostra la pipeline di inferenza del framework HierSpeech++ che inizia con l’estrazione delle rappresentazioni semantiche dall’audio a una frequenza di 16 kHz e alla frequenza fondamentale utilizzando l’algoritmo YAPPT. Prima che la frequenza fondamentale possa essere alimentata al Sintetizzatore Gerarchico, viene normalizzata utilizzando le deviazioni standard e la media dell’audio di origine e la frequenza fondamentale normalizzata viene quindi denormalizzata utilizzando le deviazioni standard e la media dell’audio di destinazione. Per l’estrazione del testo in voce, il framework HierSpeech++ estrae rappresentazioni testuali invece di rappresentazioni di voce e utilizza il modello testo-vec per generare una rappresentazione semantica dalla prosodia del prompt.
Esperimento e Risultati
Il framework utilizza il set di dati LibriTTS pubblicamente disponibile per addestrare il componente del sintetizzatore gerarchico con il primo passo che consiste nell’addestrare il modello con i sottinsiemi di addestramento pulito del set di dati e utilizzare i dati rimanenti per abilitare un trasferimento migliorato dello stile di voce. Inoltre, per migliorare la diversità e la robustezza, il framework scala il set di dati a 1 kHz come mostrato nella figura seguente.

Ricostruzione, Attività di Risintesi e Conversione di Voce
Per valutare le prestazioni del framework HierSpeech++ sulle attività di ricostruzione e risintesi, gli sviluppatori hanno condotto sette metriche oggettive e i risultati sono mostrati nelle figure seguenti per le attività di ricostruzione e risintesi rispettivamente.


Per le attività di conversione di voce, il framework utilizza due metriche soggettive per la valutazione: la somiglianza della voce MOS o sMOS e il punteggio di opinione medio di naturalità o nMOS con tre metriche di naturalità oggettive e due metriche di somiglianza oggettive.

Proseguendo, l’obiettivo principale del framework HierSpeech++ è abilitare la sintesi di voce zero-shot e per valutare le sue prestazioni in zero-shot, viene confrontato con altri modelli di base come AutoVC, VoiceMixer, modelli basati su diffusione e molti altri con i risultati mostrati nella figura seguente.

Le figure seguenti mostrano i risultati di sintesi di testo in voce zero-shot con prompt rumorosi e molto rumorosi rispettivamente.


Pensieri Finali
In questo articolo, abbiamo parlato del modello HierSpeech++, un approccio nuovo per abilitare una sintesi di voce robusta ed efficace in un’impostazione zero-shot e superare le limitazioni attuali dei framework di sintesi di voce, tra cui la loro dipendenza eccessiva da grandi quantità di dati di addestramento, la dipendenza da unità di voce discrete o codec audio neurali pre-addestrati e la tendenza ad auto-generare output audio che alla fine causa una mancanza di robustezza e velocità di interferenza lenta e si traduce in errori di pronuncia, salti o ripetizioni. Il modello HierSpeech++ è un framework di sintesi di voce gerarchica completamente parallelo, nuovo e robusto finalizzato alla sintesi di campioni di voce in un’impostazione zero-shot e tenta di apportare i seguenti contributi
- Utilizzare un framework di sintesi di voce gerarchico per controllare e trasferire stili di voce e prosodia.
- Abilitare la scalabilità dei dati e la sintesi di voce ad alta risoluzione campionando la forma d’onda audio da 16 a 48 kHz.
- Raggiungere un’abilità umana attraverso la conversione di voce zero-shot e le attività di testo-in-voce.












