AI-modeller og platforme

StyleTTS 2: Menneske-niveau Text-til-Tale med Store Tale-Sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

På grund af en øgning i naturlige og syntetiske tale-syntese-tilgange, er en af de største opnåelser, som AI-industrien har opnået i de seneste år, at effektivt syntetisere tekst-til-tale-rammer med potentiale til anvendelse på tværs af forskellige industrier, herunder lydbøger, virtuelle assistenter, stemme-oversættelser og mere, hvor nogle state of the art-modeller leverer menneske-niveau-præstation og effektivitet på tværs af en bred vifte af tale-relaterede opgaver. Men, på trods af deres stærke præstation, er der stadig plads til forbedring for opgaver takket være udtryksfuld og divers tale, krav om en stor mængde træningsdata til optimering af zero-shot tekst-til-tale-rammer og robusthed for OOD eller Udenfor- Distributionstekster, hvilket får udviklere til at arbejde på en mere robust og tilgængelig tekst-til-tale-ramme.

I denne artikel, vil vi tale om StyleTTS-2, en robust og innovativ tekst-til-tale-ramme, der er bygget på fundamentet af StyleTTS-rammen, og sigter mod at præsentere det næste skridt mod state of the art tekst-til-tale-systemer. StyleTTS2-rammen modellerer tale-stilarter som latente tilfældige variable, og bruger en sandsynligheds-baseret diffusion-model til at prøve disse tale-stilarter eller tilfældige variable, hvilket giver StyleTTS2-rammen mulighed for at syntetisere realistisk tale effektivt uden brug af reference-lyd-indgange. Takket være denne tilgang, kan StyleTTS2-rammen levere bedre resultater og viser høj effektivitet i forhold til nuværende state of the art tekst-til-tale-rammer, men kan også udnytte den diverse tale-syntese, der tilbydes af diffusion-model-rammer. Vi vil diskutere StyleTTS2-rammen i større detalje og tale om dens arkitektur og metode, samt kaste et blik på resultaterne, der er opnået af rammen. Så lad os komme i gang.

StyleTTS2 til Tekst-til-Tale-Syntese: En Introduktion

StyleTTS2 er en innovativ Tekst-til-Tale-syntese-model, der tager det næste skridt mod at bygge menneske-niveau TTS-rammer, og det er bygget på StyleTTS, en stil-baseret tekst-til-tale-generativ model. StyleTTS2-rammen modellerer tale-stilarter som latente tilfældige variable, og bruger en sandsynligheds-baseret diffusion-model til at prøve disse tale-stilarter eller tilfældige variable, hvilket giver StyleTTS2-rammen mulighed for at syntetisere realistisk tale effektivt uden brug af reference-lyd-indgange. At modellere stilarter som latente tilfældige variable er, hvad der adskiller StyleTTS2-rammen fra dens forgænger, StyleTTS-rammen, og sigter mod at generere den mest passende tale-stil for input-teksten uden behov for en reference-lyd-indgang, og kan opnå effektiv latent diffusion, samtidig med at den udnytter den diverse tale-syntese, der tilbydes af diffusion-modeller. Derudover bruger StyleTTS2-rammen også en forudtrænet stor SLM eller Tale-Sprogmodel som diskriminatorene, såsom WavLM-rammen, og kombinerer det med sin egen ny differentiable varigheds-modelering til at træne rammen fra ende til ende, og ultimativt genererer tale med forbedret naturlighed. Takket være denne tilgang, kan StyleTTS2-rammen overgå nuværende state of the art-rammer for tale-generering-opgaver, og er en af de mest effektive rammer for forudtræning af store skala tale-modeller i zero-shot-indstilling for speaker-tilpasning-opgaver.

Ved at gå videre, for at levere menneske-niveau tekst-til-tale-syntese, inkorporerer StyleTTs2-rammen lærdomme fra eksisterende arbejder, herunder diffusion-modeller for tale-syntese, og store tale-sprogmodeller. Diffusion-modeller bruges normalt til tale-syntese-opgaver takket være deres evne til at give fine-grained tale-kontrol og diverse tale-prøvning. Men, diffusion-modeller er ikke så effektive som GAN-baserede ikke-iterative rammer, og en stor årsag til dette er kravet om at prøve latente repræsentationer, bølgeformer og mel-spektrogrammer iterativt til målet for tale-varighed.

På den anden side, har nylige arbejder omkring store Tale-Sprogmodeller indikeret deres evne til at forbedre kvaliteten af tekst-til-tale-generering-opgaver, og tilpasse sig godt til taleren. Store Tale-Sprogmodeller konverterer normalt tekst-input enten til kvantificerede eller kontinuerte repræsentationer, der er afledt fra forudtrænede tale-sprog-rammer til tale-rekonstruktion-opgaver. Men, funktionerne af disse Tale-Sprogmodeller er ikke optimeret til tale-syntese direkte. I modsætning hertil, udnytter StyleTTS2-rammen den viden, der er opnået af store SLM-rammer ved at bruge adversarial-træning til at syntetisere tale-sprog-modellens funktioner uden brug af latent-rum-kort, og dermed lærer en tale-syntese-optimeret latent-rum direkte.

StyleTTS2: Arkitektur og Metode

I sin kerne, er StyleTTS2 bygget på sin forgænger, StyleTTS-rammen, som er en ikke-autoregressiv tekst-til-tale-ramme, der bruger en stil-encoder til at aflede en stil-vektor fra reference-lyden, hvilket giver mulighed for udtryksfuld og naturlig tale-generering. Stil-vektoren, der bruges i StyleTTS-rammen, inkorporeres direkte i encoderen, varigheds- og predictor-erne ved at bruge AdaIN eller Adaptiv Instans-Normalisering, hvilket giver StyleTTS-modellen mulighed for at generere tale-outputs med varierende prosodi, varighed og endda emotioner. StyleTTS-rammen består af 8 modeller i alt, der er inddelt i tre kategorier

  1. Akustiske modeller eller Tale-Genererings-System med en stil-encoder, en tekst-encoder og en tale-decoder.
  2. En Tekst-til-Tale-Prædiktion-System, der bruger prosodi og varigheds-prædiktorer.
  3. Et Utility-System, der inkluderer en tekst-aligner, en pitch-ekstraktor og en diskriminator til trænings-formål.

Takket være denne tilgang, leverer StyleTTS-rammen state of the art-præstation i forhold til kontrollerbar og divers tale-syntese. Men, denne præstation har sine ulemper, såsom nedgang i prøve-kvalitet, udtryksfulde begrænsninger og afhængighed af tale-hæmmende anvendelser i realtid.

Ved at forbedre StyleTTS-rammen, resulterer StyleTTS2-modellen i forbedret udtryksfuld tekst-til-tale-opgaver med forbedret ud af distributions-præstation og høj menneske-niveau-kvalitet. StyleTTS2-rammen bruger en ende-til-ende-trænings-proces, der optimerer de forskellige komponenter med adversarial-træning og direkte bølgeform-syntese sammen. I modsætning til StyleTTS-rammen, modellerer StyleTTS2-rammen tale-stilen som en latent variabel og prøver den via diffusion-modeller, hvilket giver mulighed for at generere diverse tale-prøver uden brug af reference-lyd.

Ende-til-Ende-Træning for Interferens

I StyleTTS2-rammen, bruges en ende-til-ende-trænings-tilgang til at optimere forskellige tekst-til-tale-komponenter til interferens uden at skulle stole på faste komponenter. StyleTTS2-rammen opnår dette ved at modificere decoderen til at generere bølgeformen direkte fra stil-vektoren, pitch- og energi-kurver og alignede repræsentationer. Rammen fjerner derefter den sidste projekterings-lag i decoderen og erstatter den med en bølgeform-decoder. StyleTTS2-rammen bruger to encodere: HifiGAN-baseret decoder til at generere bølgeformen direkte og en iSTFT-baseret decoder til at producere fase- og magnitude, der konverteres til bølgeformer til hurtigere interferens- og træning.

Figuren ovenfor repræsenterer de akustiske modeller, der bruges til forudtræning og fælles træning. For at reducere træningstiden, optimeres modulerne først i forudtrænings-fasen, efterfulgt af optimering af alle komponenterne minus pitch-ekstraktoren under fælles træning. Årsagen til, at fælles træning ikke optimerer pitch-ekstraktoren, er, at den bruges til at give grund-sandheden for pitch-kurver.

Figuren ovenfor repræsenterer Tale-Sprogmodel-adversarial-træning og interferens med WavLM-rammen forudtrænet, men ikke forud-justeret. Processen adskiller sig fra den ovenfor, da den kan tage varierende input-tekster, men akkumulerer gradienterne til at opdatere parametrene i hver batch.

Stil-Diffusion

StyleTTS2-rammen sigter mod at modellere tale som en betinget distribution gennem en latent variabel, der følger den betingede distribution, og denne variabel kaldes den generaliserede tale-stil, og repræsenterer enhver egenskab i tale-prøven ud over omfanget af enhver fonetisk indhold, herunder leksikalsk stress, prosodi, tale-hastighed og endda formant-overgange.

Tale-Sprogmodel-Diskriminatore

Tale-Sprogmodeller er berømte for deres generelle evne til at kode værdifuld information om en bred vifte af semantik og akustiske aspekter, og SLM-repræsentationer har traditionelt været i stand til at efterligne menneskelige perceptioner til at evaluere kvaliteten af den genererede syntetiserede tale. StyleTTS2-rammen bruger en adversarial-trænings-tilgang til at udnytte evnen af SLM-encodere til at udføre generative opgaver, og anvender en 12-lag WavLM-ramme som diskriminator. Denne tilgang giver rammen mulighed for at aktivere træning på OOD eller Udenfor-Distributionstekster, der kan hjælpe med at forbedre præstationen. Derudover, for at forhindre over-tilpasning-problemer, sampler rammen OOD-tekster og in-distribution med ligelig sandsynlighed.

Differentiable Varigheds-Modellering

Traditionelt, bruges en varigheds-prædiktor i tekst-til-tale-rammer, der producerer fonem-varigheder, men upsampling-metoderne, disse varigheds-prædiktorer bruger, blokerer ofte gradient-flows under E2E-trænings-processen, og NaturalSpeech-rammen anvender en attention-baseret upsampler til menneske-niveau tekst-til-tale-konvertering. Men, StyleTTS2-rammen finder denne tilgang ustabil under adversarial-træning, da StyleTTS2 træner ved hjælp af differentiable upsampling med forskellige adversarial-træning uden tab af ekstra termer på grund af længde-forskelle. Selvom brug af en soft dynamisk tid-vægt-tilgang kan hjælpe med at mitigere denne forskel, er det ikke kun komputermæssigt dyrt, men også en bekymring, når det kommer til stabilitet, når man arbejder med adversarial-objektiver eller mel-rekonstruktion-opgaver. Derfor, for at opnå menneske-niveau-præstation med adversarial-træning og stabilisere trænings-processen, bruger StyleTTC2-rammen en ikke-parametrisk upsampling-tilgang.

For at imødekomme denne begrænsning, foreslår StyleTTC2-rammen at bruge en ny ikke-parametrisk upsampling-tilgang uden ekstra træning, og som kan tage højde for varierende længder af alignmenterne. For hver fonem, modellerer StyleTTC2-rammen alignmentet som en tilfældig variabel og angiver indekset for tale-rammen, som fonemet alignerer med.

Model-Træning og Evaluering

StyleTTC2-rammen trænes og eksperimenteres på tre datasæt: VCTK, LibriTTS og LJSpeech. Den enkelt-taler-komponent af StyleTTS2-rammen trænes ved hjælp af LJSpeech-datasættet, der indeholder omkring 13.000+ lyd-prøver fordelt på 12.500 trænings-prøver, 100 validerings-prøver og næsten 500 test-prøver, med deres kombinerede løbetid på omkring 24 timer. Den multi-taler-komponent af rammen trænes på VCTK-datasættet, der består af over 44.000 lyd-klip med over 100 enkelt-talere med varierende accenter og er fordelt på 43.500 trænings-prøver, 100 validerings-prøver og næsten 500 test-prøver. Endelig, for at udstyre rammen med zero-shot-tilpasningsevne, trænes rammen på det kombinerede LibriTTS-datasæt, der består af lyd-klip på omkring 250 timers lyd med over 1.150 enkelt-talere. For at evaluere dens præstation, anvender modellen to metrikker: MOS-N eller Mean Opinion Score of Naturalness og MOS-S eller Mean Opinion Score of Similarity.MOS-N eller Mean Opinion Score of Naturalness, og MOS-S eller Mean Opinion Score of Similarity.

Resultater

Tilgangen og metoden, der bruges i StyleTTS2-rammen, kommer til udtryk i dens præstation, da modellen overgår flere state of the art TTS-rammer, især på NaturalSpeech-datasættet, og sætter en ny standard for datasættet. Derudover overgår StyleTTS2-rammen state of the art VITS-rammen på VCTK-datasættet, og resultaterne vises i følgende figur.

StyleTTS2-modellen overgår også tidligere modeller på LJSpeech-datasættet og viser ikke nogen nedgang i kvalitet på OOD eller Udenfor-Distributionstekster, som tidligere rammer har vist på samme metrik. Derudover, i zero-shot-indstilling, overgår StyleTTC2-modellen den eksisterende Vall-E-ramme i naturlighed, selvom den falder bagud i forhold til lighed. Men, det er værd at bemærke, at StyleTTS2-rammen kan opnå konkurrencedygtig præstation, på trods af at den kun trænes på 245 timers lyd-prøver i forhold til over 60.000 timers træning for Vall-E-rammen, hvilket gør StyleTTC2 til en data-effektiv alternativ til eksisterende store forudtrænings-metoder, som anvendes i Vall-E.

Ved at gå videre, på grund af manglen på emotion-labeled lyd-tekst-data, bruger StyleTTC2-rammen GPT-4-modellen til at generere over 500 eksempler på tværs af forskellige emotioner til visualisering af stil-vektorer, som rammen opretter ved hjælp af sin diffusion-proces.

I den første figur, illustreres emotionelle stilarter i respons til input-tekst-sentimenter af stil-vektorerne fra LJSpeech-modellen, og det demonstrerer evnen af StyleTTC2-rammen til at syntetisere udtryksfuld tale med varierende emotioner. Den anden figur viser distinkte kluster, der dannes for hver af de fem enkelt-talere, og viser en bred vifte af diversitet, der stammer fra en enkelt lyd-fil. Den sidste figur viser det løse kluster af emotioner fra taler 1, og afslører, at, på trods af nogen overlap, emotion-baserede kluster er fremtrædende, og indikerer muligheden for at manipulere den emotionelle tone af en taler, uanset reference-lyd-prøven og dens input-tone. På trods af at bruge en diffusion-baseret tilgang, overgår StyleTTS2-rammen eksisterende state of the art-rammer, herunder VITS, ProDiff og FastDiff.

Endelige Tanker

I denne artikel, har vi talt om StyleTTS2, en ny, robust og innovativ tekst-til-tale-ramme, der er bygget på fundamentet af StyleTTS-rammen, og sigter mod at præsentere det næste skridt mod state of the art tekst-til-tale-systemer. StyleTTS2-rammen modellerer tale-stilarter som latente tilfældige variable, og bruger en sandsynligheds-baseret diffusion-model til at prøve disse tale-stilarter eller tilfældige variable, hvilket giver StyleTTS2-rammen mulighed for at syntetisere realistisk tale effektivt uden brug af reference-lyd-indgange. StyleTTS2-rammen bruger stil-diffusion og SLM-diskriminatore til at opnå menneske-niveau-præstation på tekst-til-tale-opgaver og overgår eksisterende state of the art-rammer på en bred vifte af tale-opgaver.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.