Modele și platforme AI

HierSpeech++ : Inferență Variatională Ierarhică pentru Sinteză de Vorbire Zero-Shot

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Dezvoltările recente și progresele în capacitățile modelelor de limbaj mare au jucat un rol crucial în avansurile cadrelor bazate pe LLM pentru generarea audio și sinteza vorbirii, în special în setarea zero-shot. Cadrele tradiționale de sinteză a vorbirii au fost martorii unor avansuri semnificative ca urmare a integrării unor caracteristici suplimentare, cum ar fi codificatoarele audio neurale pentru unități de vorbire și sunet discrete. Chiar dacă aceste cadre de sinteză a vorbirii și audio oferă rezultate satisfăcătoare, există încă loc pentru îmbunătățiri, deoarece cadrele actuale de audio bazate pe LLM au următoarele trei limitări majore

  1. Tind să auto-genereze ieșiri audio care, în final, cauzează o lipsă de robustețe și viteze de interferență lente și conduc la pronunții greșite, sărituri sau repetiții.
  2. Tind să se bazeze prea mult pe unități de vorbire discrete sau pe codificatoare audio neurale pre-antrenate.
  3. De obicei, necesită o cantitate mare de date de antrenare.

Pentru a aborda problemele menționate mai sus și pentru a îmbunătăți capacitățile modelelor de sinteză a vorbirii și audio bazate pe LLM, dezvoltatorii au creat HierSpeech++, un sintetizator de vorbire zero-shot robust și eficient pentru conversii de voce și text-vorbire sau TTS. Cadru HierSpeech++ se bazează pe învățămintele cadrelor de sinteză a vorbirii ierarhice care nu numai că îmbunătățește robustețea, dar adaugă și expresivitatea vorbirii sintetice, îmbunătățind în același timp naturalitatea și asemănarea vorbirii artificiale, chiar și într-un mediu zero-shot.

În acest articol, vom discuta despre cadru HierSpeech++ în detaliu și vom examina arhitectura modelului, funcționarea și rezultatele în comparație cu modelele de generare de text și audio de ultimă generație. Deci, hai să începem.

HierSpeech++ : Inferență Variatională Ierarhică pentru Sinteză de Vorbire Zero-Shot

HierSpeech++ este un cadru de sinteză a vorbirii zero-shot rapid, robust și eficient care utilizează o conductă de sinteză a vorbirii ierarhice și, prin adoptarea acestui cadru de sinteză a vorbirii de la capăt la capăt, modelul HierSpeech++ poate maximiza potențialul generării de valuri de înaltă calitate pentru a podi distanța dintre reprezentările semantice și acustice prin adoptarea unei reprezentări de vorbire autonome ca reprezentare semantică a vorbirii și, astfel, încearcă să rezolve limitările actuale ale adaptărilor de stil. Cadru de sinteză a vorbirii de la capăt la capăt a fost introdus pentru prima dată de modelul VITS și adoptă un VAE sau un Auto-Encoder Variational, îmbunătățit cu antrenament adversarial și flux normalizator. În plus, cadrele VAE cu o conductă de antrenament de la capăt la capăt au capacitatea de a genera valuri audio de înaltă calitate, calitatea percepției sintezei vorbirii fiind semnificativ mai bună decât cea generată de alte cadre de sinteză a vorbirii.

Calitatea reconstrucției audio a acestor cadre poate fi îmbunătățită și mai mult prin utilizarea unui Auto-Encoder Variational condițional ierarhic, așa cum se utilizează în cadru HierSpeech. În ciuda potențialului lor, modelele cu conductă de antrenament de la capăt la capăt au anumite limitări, în special într-un mediu zero-shot, deoarece, chiar dacă pot sintetiza mostre de vorbire cu audio de înaltă calitate, asemănarea vorbirii în sarcinile de clonare a vocii zero-shot este încă afectată de complexitatea computațională ridicată. Pe de altă parte, modelele de sinteză a vorbirii bazate pe difuzie se descurcă bine în ceea ce privește adaptările vorbirii, dar sunt încă departe de a fi perfecte, deoarece utilizează un proces de generare interactiv care încetinește viteza de inferență, sunt adesea vulnerabile la date zgomotoase și, ca urmare a neconcordanței dintre antrenament și inferență a procesului de generare în două etape între mel-spectrogramă și audio generat, calitatea audio nu este la nivelul dorit.

Pentru a aborda problemele cu care se confruntă predecesorii săi, modelul HierSpeech++ utilizează un sintetizator de vorbire ierarhic, o super-rezoluție a vorbirii și o componentă text-vec, și introduce un sintetizator de vorbire ierarhic îmbunătățit, construit pe baza Auto-Encoder-ului Variational condițional. În încercarea de a îmbunătăți calitatea audio dincolo de calitatea percepției, cadru HierSpeech++ adoptă un dual-audio pentru a îmbunătăți posteriorul acustic și îmbunătățește generalizarea din afara distribuției prin utilizarea unui generator adaptiv ierarhic, echipat atât cu generare condiționată, cât și cu generare necondiționată. În plus, pentru a disocia componentele vorbirii și pentru a îmbunătăți informațiile semantice legate de vorbire și independente de vorbire, cadru HierSpeech++ adoptă și o teorie a sursei și a filtrelor bazată pe un codator semantic multi-canal. Ca urmare a utilizării unui Auto-Encoder Variational, modelul HierSpeech++ poate conecta și învăța reprezentări ierarhic și se poate adapta progresiv la stilul de voce țintă pentru a infera audio-ul valului. În plus, cadru HierSpeech++ utilizează și o rețea bidirecțională de transformatori de flux normalizator pentru a îmbunătăți adaptarea și pentru a reduce neconcordanța dintre antrenament și inferență.

În general, modelul HierSpeech++ este un cadru de sinteză a vorbirii ierarhic, complet paralel, nou și robust, destinat sintezei de mostre de vorbire într-un mediu zero-shot și încearcă să facă următoarele contribuții

  • Utilizarea unui cadru de sinteză a vorbirii ierarhice pentru a controla și transfera stiluri de voce și prozodie.
  • Permite scalabilitatea datelor și sinteza vorbirii de înaltă rezoluție prin împământarea valului audio de la 16 la 48 kHz.
  • Atinge abilități la nivel uman în conversii de voce zero-shot și sarcini de text-vorbire.

HierSpeech++ : Componente ale Modelului și Arhitectură

Așa cum s-a discutat, HierSpeech++ este un model de sinteză a vorbirii zero-shot care încearcă să atingă acuratețe la nivel uman în ceea ce privește asemănarea vocii și naturalitatea vorbirii.

Modelul HierSpeech++ constă din componente diferite, inclusiv un sintetizator de vorbire ierarhic, o super-rezoluție a vorbirii și text-vec pentru a facilita antrenamentul fiecărui model care poate utiliza eficient o cantitate mare de date de vorbire de joasă rezoluție pentru clonarea vocii. Să descompunem cadru și să discutăm despre fiecare component.

Reprezentări de Vorbire

Deoarece banda de frecvență umană este sub 4 kHz, pentru sinteza vorbirii, cadru HierSpeech++ downsamplerează audio la 16 kHz. În plus, pentru a reconstrui semnalul de voce, este vital să se utilizeze cel puțin dublul frecvenței componente a vocii, în plus față de downsampling-ul audio. Pentru a obține o calitate percepțională îmbunătățită, cadru HierSpeech++ utilizează o componentă de super-rezoluție a vorbirii sau SpeechSR pentru a împământa mostrele audio de la 16 la 48 kHz și utilizează reprezentări de joasă rezoluție pentru reprezentări semantice și acustice.

Pentru reprezentări acustice, un cadru tradițional de text-vorbire utilizează o mel-spectrogramă ca caracteristică acustică intermediară, care este apoi transformată din valul cu ajutorul unei transformări Fourier cu timp scurt. Cu toate acestea, este demn de remarcat faptul că, deoarece caracteristicile acustice sunt reprezentări bogate care cuprind diverse atribute, inclusiv conținut și pronunție, informații despre voce și multe altele, ceea ce face dificilă pentru cadru să inferă aceste reprezentări, o situație care adesea duce la pronunții greșite, lipsă de asemănare sau netezire excesivă a vorbirii.

În continuare, pentru a extrage o reprezentare semantică continuă dintr-un val, cadru HierSpeech++ utilizează un cadru Wav2Vec, în contrast cu abordarea de reprezentare a vorbirii autonome pentru reprezentări semantice. Deși abordarea face o alternativă bună pentru un model monolingvistic bogat, afectează capacitățile de clonare a vocii zero-shot ale modelului, atât în ceea ce privește robustețea, cât și expresivitatea, în special în sarcinile de sinteză a vorbirii multilingve.

Sintetizator de Vorbire Ierarhic

Componenta Sintetizatorului de Vorbire Ierarhic este piatra de temelie a cadru HierSpeech++, deoarece permite antrenarea modulelor fără a utiliza etichete, cum ar fi transcrieri de text sau ID-uri de vorbitor, și se bazează exclusiv pe date de vorbire. Pentru a crește capacitatea acustică, modelele de sinteză a vorbirii de ultimă generație au înlocuit mel-spectrograma cu o spectrogramă liniară, însă abordarea minimizează scorul de divergență KL în ceea ce privește periodicitatea pitch-ului, PESQ, scorul de voce și nevoce și chiar distanța mel-spectrogramă. Sintetizatorul de Vorbire Ierarhic utilizează un codator acustic dual-audio pentru a rezolva provocările prezentate de utilizarea unei spectrograme liniare, proiectate pentru a captura reprezentări acustice mai bogate și mai cuprinzătoare. Cadru utilizează și un codator de val pentru a distila informații dintr-un val brut și le concatenează cu reprezentarea spectrogramă liniară și, în final, proiectează reprezentarea acustică ca o reprezentare concatenată.

În plus, pentru a face față reprezentărilor semantice independente de vorbire și legate de vorbire, cadru HierSpeech++ utilizează o reprezentare de vorbire autonome multi-canal, unde fiecare reprezentare individuală este utilizată pentru adaptarea stilului ierarhic cu reprezentările semantice extrase pentru a obține informații lingvistice din stratul mijlociu al MMS. Cadru utilizează și o frecvență fundamentală pentru a îmbunătăți disocierea vorbirii, ceea ce permite controlul manual al conturului de pitch. Cadru utilizează și o reprezentare lingvistică ca informație condiționată pentru a genera valuri audio ierarhic și utilizează o reprezentare lingvistică îmbunătățită a reprezentării autonome. Este, de asemenea, demn de remarcat faptul că reprezentările acustice extrase în timpul antrenamentului prin utilizarea unui val și a unei spectrograme liniare sunt utilizate pentru a reconstrui valul audio brut și o inferență variatională ierarhică este utilizată pentru a lega reprezentările acustice de reprezentările lingvistice multi-canal. Cadru utilizează și un generator adaptiv ierarhic (HAG) pentru a genera mostre de la semantic la val și reprezentările generate, care cuprind o reprezentare de stil și o reprezentare acustică, sunt alimentate cu generatoarele de sursă și val.

Text-Vec

Pentru sinteza text-vorbire, cadru HierSpeech++ utilizează un model text-vec care generează o frecvență fundamentală și o reprezentare semantică dintr-o secvență de text și utilizează o căutare de aliniere monotonă, cuplată cu un Auto-Encoder variational, pentru a alinia vorbirea și textul intern. Apoi, cadru HierSpeech++ înlocuiește spectrograma liniară cu o reprezentare liniară autonome și reconstruieste aceeași reprezentare pentru a servi ca ieșire pentru text-vec.

În plus, cadru HierSpeech++ prezice frecvența fundamentală cu rezoluții de patru ori mai mari decât reprezentările de vorbire autonome și utilizează o reprezentare de text condiționată ca informație prioritară. Ca urmare a informațiilor semantice ale reprezentărilor de vorbire autonome, cadru este capabil să transfere stilul de prozodie din text-vec și alimentează o reprezentare latentă cu codatorul de foneme pentru a îmbunătăți capacitățile lingvistice ale reprezentării.

SpeechSR sau Super-Rezoluție a Vorbirii

Cadru HierSpeech++ se antrenează pe un set de date relativ de joasă rezoluție în ceea ce privește eficiența și disponibilitatea datelor și împământează un val de vorbire de joasă rezoluție la un val de vorbire de înaltă rezoluție de la 16 la 48 kHz. Cadru înlocuiește, de asemenea, o convoluție transpusă cu un interpolator de vecinul cel mai apropiat, care a fost cunoscut anterior pentru a atenua artefactele cauzate de convoluțiile transpuse.

Arhitectură

Codatorul de conținut al modelului text-vec constă din 16 straturi WaveNet ne-cazuale cu o dimensiune a kernel-ului de 5 și o dimensiune ascunsă de 256, în timp ce decodatorul de conținut constă din 8 straturi WaveNet ne-cazuale cu o dimensiune a kernel-ului de 5 și o dimensiune ascunsă de 512. Componenta codatorului de text constă din trei rețele neuronale Transformer condiționate de prozodie și trei rețele neuronale Transformer necondiționate cu o dimensiune a kernel-ului de 9, o dimensiune a filtrului de 1024 și o dimensiune ascunsă de 256, cu codatorul de text având o rată de abandon de 0,2. Pentru a codifica informații adiacente și pentru a îmbunătăți adaptarea stilului de prozodie, cadru adoptă o rețea neuronală convoluvională (CNN) cu o dimensiune a kernel-ului de 5 în blocurile Transformer. SpeechSR, pe de altă parte, constă dintr-un singur bloc AMP cu 32 de canale inițiale, fără prezența unui strat de împământare. Cadru utilizează un interpolator de vecinul cel mai apropiat pentru a împământa reprezentările ascunse și utilizează un MPD ca discriminator cu șase dimensiuni de fereastră diferite și patru discriminatoare de sub-benzile.

Figura de mai sus demonstrează conducta de inferență a cadru HierSpeech++, care începe cu extragerea reprezentărilor semantice din audio la o frecvență de 16 kHz și la frecvența fundamentală, utilizând algoritmul YAPPT. Înainte de a fi alimentată cu Sintetizatorul Ierarhic, frecvența fundamentală este normalizată utilizând deviația standard și media deviației sursei audio, iar frecvența fundamentală normalizată este apoi denormalizată utilizând deviația standard și media deviației audio-țintă. Pentru extragerea text-vorbire, cadru HierSpeech++ extrage reprezentări textuale în loc de reprezentări de vorbire și utilizează modelul text-vec pentru a genera o reprezentare semantică dintr-o prompt de prozodie.

Experiment și Rezultate

Cadru utilizează setul de date LibriTTS disponibil public pentru a antrena componenta sintetizatorului ierarhic, prima etapă fiind antrenarea modelului cu subseturile trainclean ale setului de date și utilizarea datelor rămase pentru a permite o transferare îmbunătățită a stilului de voce. În plus, pentru a îmbunătăți diversitatea și robustețea, cadru mărește setul de date la 1 kHz, așa cum se arată în figura de mai jos.

Reconstrucție, Sarcini de Resinteză și Conversie de Voce

Pentru a evalua performanța cadru HierSpeech++ în ceea ce privește reconstrucția și resinteza, dezvoltatorii au efectuat șapte metrice obiective, iar rezultatele sunt demonstrate în figurile de mai jos pentru sarcinile de reconstrucție și resinteză, respectiv.

Pentru sarcinile de conversie de voce, cadru utilizează două metrice subiective de evaluare: similaritatea vocii MOS sau sMOS și scorul de opinie al naturalității nMOS, cu trei metrice obiective de naturalitate și două metrice obiective de similaritate.

În continuare, obiectivul principal al cadru HierSpeech++ este de a permite sinteza de vorbire zero-shot și pentru a evalua performanța sa în zero-shot, este comparat cu alte modele de bază, cum ar fi AutoVC, VoiceMixer, modele bazate pe difuzie și multe altele, iar rezultatele sunt demonstrate în figura de mai jos.

Figurile de mai jos demonstrează rezultatele sintezei text-vorbire zero-shot cu prompturi zgomotoase și foarte zgomotoase, respectiv.

Gânduri Finale

În acest articol, am discutat despre modelul HierSpeech++, o abordare nouă pentru a permite o sinteză de vorbire robustă și eficientă într-un mediu zero-shot și pentru a depăși limitările actuale ale cadrelor de sinteză a vorbirii, inclusiv dependența lor de cantități mari de date de antrenare, de unități de vorbire discrete sau de codificatoare audio neurale pre-antrenate și tendința de a auto-genera ieșiri audio care cauzează o lipsă de robustețe și viteze de interferență lente, ceea ce duce la pronunții greșite, sărituri sau repetiții. Modelul HierSpeech++ este un cadru de sinteză a vorbirii ierarhic, complet paralel, nou și robust, destinat sintezei de mostre de vorbire într-un mediu zero-shot și încearcă să facă următoarele contribuții

  • Utilizarea unui cadru de sinteză a vorbirii ierarhice pentru a controla și transfera stiluri de voce și prozodie.
  • Permite scalabilitatea datelor și sinteza vorbirii de înaltă rezoluție prin împământarea valului audio de la 16 la 48 kHz.
  • Atinge abilități la nivel uman în conversii de voce zero-shot și sarcini de text-vorbire.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.