Modelli e piattaforme di IA

StyleTTS 2: Sintesi vocale di livello umano con grandi modelli di linguaggio

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

A causa dell’aumento di approcci di sintesi vocale naturale e sintetica, uno dei principali risultati che l’industria dell’intelligenza artificiale ha raggiunto negli ultimi anni è stato quello di sintetizzare efficacemente framework di testo-vocale con potenziali applicazioni in diversi settori, tra cui audiolibri, assistenti virtuali, narrazioni vocali e molto altro, con alcuni modelli di stato dell’arte che forniscono prestazioni di livello umano ed efficienza in una vasta gamma di attività relative alla sintesi vocale. Tuttavia, nonostante le loro forti prestazioni, c’è ancora spazio per il miglioramento delle attività grazie alla sintesi vocale espressiva e diversificata, alla richiesta di una grande quantità di dati di formazione per ottimizzare i framework di testo-vocale zero-shot e alla robustezza per i testi fuori distribuzione, portando gli sviluppatori a lavorare su un framework di testo-vocale più robusto e accessibile.

In questo articolo, parleremo di StyleTTS-2, un framework di testo-vocale robusto e innovativo costruito sulle fondamenta del framework StyleTTS, e che mira a presentare il prossimo passo verso i sistemi di testo-vocale di stato dell’arte. Il framework StyleTTS2 modella gli stili di voce come variabili casuali latenti e utilizza un modello di diffusione probabilistico per campionare questi stili di voce o variabili casuali, consentendo al framework StyleTTS2 di sintetizzare la voce realistica in modo efficace senza utilizzare input audio di riferimento. Grazie all’approccio, il framework StyleTTS2 è in grado di fornire risultati migliori e mostra un’alta efficienza rispetto ai framework di testo-vocale di stato dell’arte attuali, ma è anche in grado di sfruttare la sintesi vocale diversificata offerta dai framework di diffusione. Discuteremo il framework StyleTTS2 in maggior dettaglio e parleremo della sua architettura e metodologia, esaminando anche i risultati raggiunti dal framework. Quindi, iniziamo.

StyleTTS2 per la sintesi vocale: un’introduzione

StyleTTS2 è un modello di sintesi vocale innovativo che rappresenta il prossimo passo verso la costruzione di framework di testo-vocale di livello umano, e si basa sul modello StyleTTS, un modello generativo di testo-vocale basato su stili. Il framework StyleTTS2 modella gli stili di voce come variabili casuali latenti e utilizza un modello di diffusione probabilistico per campionare questi stili di voce o variabili casuali, consentendo al framework StyleTTS2 di sintetizzare la voce realistica in modo efficace senza utilizzare input audio di riferimento. La modellazione degli stili come variabili casuali latenti è ciò che distingue il framework StyleTTS2 dal suo predecessore, il framework StyleTTS, e mira a generare lo stile di voce più adatto al testo di input senza necessità di un input audio di riferimento, e riesce a raggiungere una diffusione latente efficace sfruttando le capacità di sintesi vocale diversificata offerte dai modelli di diffusione. Inoltre, il framework StyleTTS2 utilizza anche un modello di linguaggio pre-addestrato come discriminatore, come il framework WavLM, e lo accoppia con un approccio di modellazione della durata differenziabile per addestrare il framework in modo end-to-end, generando infine una voce con una naturalità migliorata. Grazie all’approccio seguito, il framework StyleTTS2 supera le prestazioni dei framework di stato dell’arte attuali per le attività di generazione vocale, e rappresenta uno dei framework più efficienti per la formazione di larga scala di modelli vocali in setting zero-shot per le attività di adattamento del parlante.

Proseguendo, per fornire una sintesi vocale di livello umano, il framework StyleTTs2 incorpora le conoscenze acquisite da lavori esistenti, tra cui i modelli di diffusione per la sintesi vocale e i grandi modelli di linguaggio. I modelli di diffusione vengono solitamente utilizzati per le attività di sintesi vocale grazie alle loro capacità di controllo fine-grana della voce e alle loro capacità di campionamento vocale diversificato. Tuttavia, i modelli di diffusione non sono così efficienti come i framework basati su GAN non iterativi, e un motivo principale di ciò è la necessità di campionare rappresentazioni latenti, forme d’onda e mel-spettrogrammi in modo iterativo fino alla durata del target della voce.

D’altra parte, lavori recenti sui grandi modelli di linguaggio hanno indicato la loro capacità di migliorare la qualità della generazione di testo-vocale, e di adattarsi bene al parlante. I grandi modelli di linguaggio convertono solitamente l’input di testo in rappresentazioni quantizzate o continue derivate da framework di linguaggio pre-addestrati per le attività di ricostruzione vocale. Tuttavia, le caratteristiche di questi modelli di linguaggio non sono state ottimizzate direttamente per la sintesi vocale. Al contrario, il framework StyleTTS2 sfrutta le conoscenze acquisite dai grandi modelli di linguaggio utilizzando un addestramento avversario per sintetizzare le caratteristiche dei modelli di linguaggio senza utilizzare mappe dello spazio latente, e quindi, imparando uno spazio latente ottimizzato per la sintesi vocale direttamente.

StyleTTS2: Architettura e Metodologia

Al suo nucleo, il framework StyleTTS2 si basa sul suo predecessore, il framework StyleTTS, che è un framework di testo-vocale non autoregressivo che utilizza un encoder di stile per derivare un vettore di stile dall’audio di riferimento, consentendo così la generazione di voce naturale ed espressiva. Il vettore di stile utilizzato nel framework StyleTTS viene incorporato direttamente nell’encoder, nella durata e nei predittori utilizzando l’AdaIN o la normalizzazione delle istanze adattiva, consentendo così al modello StyleTTS di generare output vocali con prosodia, durata ed emozioni variabili. Il framework StyleTTS consiste di 8 modelli in totale, divisi in tre categorie

  1. Modelli acustici o sistema di generazione vocale con un encoder di stile, un encoder di testo e un decoder vocale.
  2. Sistema di previsione testo-vocale che utilizza predittori di prosodia e durata.
  3. Sistema di utilità che include un allineatore di testo, un estrattore di pitch e un discriminatore per l’addestramento.

Grazie al suo approccio, il framework StyleTTS fornisce prestazioni di stato dell’arte relative alla sintesi vocale controllabile e diversificata. Tuttavia, questa prestazione ha i suoi svantaggi, come la degradazione della qualità del campione, le limitazioni espressive e la dipendenza da applicazioni vocali dannose in tempo reale.

Migliorando il framework StyleTTS, il modello StyleTTS2 produce attività di testo-vocale espressive migliorate con una prestazione fuori distribuzione migliorata e una qualità di livello umano. Il framework StyleTTS2 utilizza un processo di addestramento end-to-end che ottimizza i diversi componenti con l’addestramento avversario e la sintesi diretta delle forme d’onda congiuntamente. A differenza del framework StyleTTS, il framework StyleTTS2 modella lo stile di voce come una variabile latente e lo campiona tramite modelli di diffusione, generando così campioni vocali diversificati senza utilizzare un audio di riferimento. Analizziamo questi componenti in dettaglio.

Addestramento End-to-End per l’Interferenza

Nel framework StyleTTS2, viene utilizzato un approccio di addestramento end-to-end per ottimizzare i diversi componenti di testo-vocale per l’interferenza senza dover fare affidamento su componenti fissi. Il framework StyleTTS2 raggiunge ciò modificando il decoder per generare la forma d’onda direttamente dal vettore di stile, dalle curve di pitch ed energia e dalle rappresentazioni allineate. Il framework quindi rimuove l’ultimo livello di proiezione del decoder e lo sostituisce con un decoder di forma d’onda. Il framework StyleTTS2 utilizza due encoder: un decoder basato su HifiGAN per generare la forma d’onda direttamente e un decoder basato su iSTFT per produrre fase e magnitudine che vengono convertite in forme d’onda per un’interferenza e un addestramento più veloci.

La figura sopra rappresenta i modelli acustici utilizzati per la formazione pre-addestrata e congiunta. Per ridurre il tempo di addestramento, i moduli vengono prima ottimizzati nella fase di pre-addestramento, seguiti dall’ottimizzazione di tutti i componenti tranne l’estraettore di pitch durante l’addestramento congiunto. Il motivo per cui l’addestramento congiunto non ottimizza l’estraettore di pitch è che viene utilizzato per fornire la verità di pitch per le curve di pitch.

La figura sopra rappresenta l’addestramento avversario del modello di linguaggio e l’interferenza con il framework WavLM pre-addestrato ma non pre-ottimizzato. Il processo differisce da quello menzionato sopra in quanto può accettare input di testo diversi ma accumula i gradienti per aggiornare i parametri in ogni batch.

Diffusione di Stile

Il framework StyleTTS2 mira a modellare la voce come una distribuzione condizionale attraverso una variabile latente che segue la distribuzione condizionale, e questa variabile è chiamata stile di voce generalizzato, e rappresenta qualsiasi caratteristica nel campione vocale al di là dell’ambito di qualsiasi contenuto fonetico, tra cui stress lessicale, prosodia, velocità di parlato e anche transizioni formantiche.

Discriminatori del Modello di Linguaggio

I modelli di linguaggio sono noti per la loro capacità generale di codificare informazioni preziose su una vasta gamma di aspetti semantici e acustici, e le rappresentazioni del modello di linguaggio sono tradizionalmente state in grado di imitare le percezioni umane per valutare la qualità della voce sintetica generata. Il framework StyleTTS2 utilizza un approccio di addestramento avversario per sfruttare la capacità degli encoder del modello di linguaggio di eseguire attività generative, e impiega un framework WavLM a 12 livelli come discriminatore. Questo approccio consente al framework di abilitare l’addestramento su testi fuori distribuzione che possono aiutare a migliorare le prestazioni. Inoltre, per prevenire problemi di sovrapprendimento, il framework campiona testi fuori distribuzione e in-distribuzione con probabilità uguali.

Modellazione della Durata Differenziabile

Tradizionalmente, un predittore di durata viene utilizzato nei framework di testo-vocale che produce durate di fonemi, ma i metodi di upsampling che questi predittori di durata utilizzano spesso bloccano il flusso di gradienti durante il processo di addestramento end-to-end, e il framework NaturalSpeech impiega un upsampler basato sull’attenzione per la conversione di testo-vocale di livello umano. Tuttavia, il framework StyleTTS2 trova che questo approccio sia instabile durante l’addestramento avversario, poiché il framework StyleTTS2 si addestra utilizzando un upsampling differenziabile con un addestramento avversario diverso senza la perdita di termini extra a causa della discordanza nella lunghezza a causa delle deviazioni. Sebbene l’utilizzo di un approccio di warping temporale dinamico possa aiutare a mitigare questa discordanza, utilizzarlo non è solo computazionalmente costoso, ma la sua stabilità è anche una preoccupazione quando si lavora con obiettivi avversari o attività di ricostruzione del mel.

Per affrontare questa limitazione, il framework StyleTTC2 propone di utilizzare un nuovo approccio di upsampling non parametrico senza ulteriore addestramento, e in grado di gestire lunghezze di allineamento diverse. Per ogni fonema, il framework StyleTTC2 modella l’allineamento come una variabile casuale e indica l’indice del frame vocale con cui il fonema si allinea.

Addestramento e Valutazione del Modello

Il framework StyleTTC2 viene addestrato e sperimentato su tre dataset: VCTK, LibriTTS e LJSpeech. La componente a parlante singolo del framework StyleTTS2 viene addestrata utilizzando il dataset LJSpeech, che contiene circa 13.000 campioni audio, divisi in 12.500 campioni di addestramento, 100 campioni di validazione e circa 500 campioni di test, con un tempo di esecuzione totale di circa 24 ore. La componente multi-parlante del framework viene addestrata sul dataset VCTK, che consiste di oltre 44.000 clip audio con oltre 100 parlanti nativi con accenti diversi, e viene diviso in 43.500 campioni di addestramento, 100 campioni di validazione e circa 500 campioni di test. Infine, per dotare il framework di capacità di adattamento zero-shot, il framework viene addestrato sul dataset LibriTTS combinato, che consiste di clip audio per un totale di circa 250 ore di audio con oltre 1.150 parlanti. Per valutare le sue prestazioni, il modello utilizza due metriche: MOS-N o Punteggio di Opinione Medio di Naturalità, e MOS-S o Punteggio di Opinione Medio di Somiglianza.MOS-N e MOS-S.

Risultati

L’approccio e la metodologia utilizzati nel framework StyleTTS2 sono dimostrati dalle sue prestazioni, poiché il modello supera diverse prestazioni di stato dell’arte dei framework di testo-vocale, in particolare sul dataset NaturalSpeech, e stabilisce un nuovo standard per il dataset. Inoltre, il framework StyleTTS2 supera il framework di stato dell’arte VITS sul dataset VCTK, e i risultati sono dimostrati nella figura seguente.

Il modello StyleTTS2 supera anche i modelli precedenti sul dataset LJSpeech, e non mostra alcun grado di degradazione della qualità su testi fuori distribuzione, come mostrato dai framework precedenti sulle stesse metriche. Inoltre, in setting zero-shot, il modello StyleTTC2 supera il framework esistente Vall-E in termini di naturalità, anche se rimane indietro in termini di somiglianza. Tuttavia, è importante notare che il framework StyleTTS2 è in grado di raggiungere prestazioni competitive nonostante sia stato addestrato solo su 245 ore di campioni audio, rispetto alle oltre 60.000 ore di addestramento per il framework Vall-E, dimostrando così di essere un’alternativa efficiente in termini di dati ai metodi di pre-addestramento larga scala esistenti come quelli utilizzati nel framework Vall-E.

Proseguendo, a causa della mancanza di dati audio etichettati con emozioni, il framework StyleTTC2 utilizza il modello GPT-4 per generare oltre 500 istanze in diverse emozioni per la visualizzazione dei vettori di stile che il framework crea utilizzando il suo processo di diffusione.

Nella prima figura, gli stili emotivi in risposta ai sentimenti del testo di input sono illustrati dai vettori di stile del modello LJSpeech, e dimostrano la capacità del framework StyleTTC2 di sintetizzare voce espressiva con emozioni variabili. La seconda figura mostra cluster distinti per ciascuno dei cinque parlanti individuali, mostrando così una vasta gamma di diversità derivata da un singolo file audio. La figura finale mostra un cluster lasco di emozioni del parlante 1, e rivela che, nonostante alcune sovrapposizioni, i cluster basati sulle emozioni sono prominenti, indicando così la possibilità di manipolare il tono emotivo di un parlante indipendentemente dal campione audio di riferimento e dal suo tono di input. Nonostante utilizzi un approccio basato sulla diffusione, il framework StyleTTS2 riesce a superare i framework di stato dell’arte esistenti, tra cui VITS, ProDiff e FastDiff.

Pensieri Finali

In questo articolo, abbiamo parlato del framework StyleTTS2, un framework di testo-vocale innovativo e robusto costruito sulle fondamenta del framework StyleTTS, e che mira a presentare il prossimo passo verso i sistemi di testo-vocale di stato dell’arte. Il framework StyleTTS2 modella gli stili di voce come variabili casuali latenti e utilizza un modello di diffusione probabilistico per campionare questi stili di voce o variabili casuali, consentendo così al framework StyleTTS2 di sintetizzare la voce realistica in modo efficace senza utilizzare input audio di riferimento. Il framework StyleTTS2 utilizza la diffusione di stile e i discriminatori del modello di linguaggio per raggiungere prestazioni di livello umano nelle attività di testo-vocale, e riesce a superare i framework di stato dell’arte esistenti in una vasta gamma di attività vocali.

Un ingegnere per professione, uno scrittore per passione. Kunal è uno scrittore tecnico con un profondo amore e comprensione di AI e ML, dedicato a semplificare concetti complessi in questi campi attraverso la sua documentazione coinvolgente e informativa.