AI-modeller och plattformar

StyleTTS 2: Mänsklig nivå för text-till-tal-syntes med stora tal-språksmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

På grund av den ökade användningen av naturliga och syntetiska tal-syntesmetoder har en av de stora framstegen inom AI-branschen under de senaste åren varit att effektivt syntetisera text-till-tal-ramverk med potential för tillämpningar inom olika branscher, inklusive ljudböcker, virtuella assistenter, röstberättelser och mer, med vissa state-of-the-art-modeller som levererar mänsklig nivå och effektivitet över ett brett spektrum av tal-relaterade uppgifter. Men trots deras starka prestationer finns det fortfarande utrymme för förbättring för uppgifter tack vare uttrycksfull och varierad tal, krav på stor mängd träningsdata för att optimera nollskott-text-till-tal-ramverk och robusthet för OOD eller Out of Distribution-texter, vilket leder utvecklare att arbeta på ett mer robust och tillgängligt text-till-tal-ramverk.

I den här artikeln kommer vi att prata om StyleTTS-2, ett robust och innovativt text-till-tal-ramverk som bygger på grunderna av StyleTTS-ramverket och syftar till att presentera nästa steg mot state-of-the-art-text-till-tal-system. StyleTTS2-ramverket modellerar talsätt som latenta slumpmässiga variabler och använder en sannolikhetsbaserad diffusionsmodell för att sampla dessa talsätt eller slumpmässiga variabler, vilket tillåter StyleTTS2-ramverket att syntetisera realistiskt tal effektivt utan att använda referensljudinmatningar. På grund av tillvägagångssättet kan StyleTTS2-ramverket leverera bättre resultat och visa hög effektivitet jämfört med nuvarande state-of-the-art-text-till-tal-ramverk, men kan också dra nytta av den varierade tal-syntes som erbjuds av diffusionsmodellsramverk. Vi kommer att diskutera StyleTTS2-ramverket i större detalj och tala om dess arkitektur och metodik medan vi också tittar på resultaten som uppnåtts av ramverket. Så låt oss komma igång.

StyleTTS2 för text-till-tal-syntes: En introduktion

StyleTTS2 är ett innovativt text-till-tal-syntesmodell som tar nästa steg mot att bygga mänsklig nivå TTS-ramverk och bygger på StyleTTS, en stilbaserad text-till-tal-generativ modell. StyleTTS2-ramverket modellerar talsätt som latenta slumpmässiga variabler och använder en sannolikhetsbaserad diffusionsmodell för att sampla dessa talsätt eller slumpmässiga variabler, vilket tillåter StyleTTS2-ramverket att syntetisera realistiskt tal effektivt utan att använda referensljudinmatningar. Att modellera stilar som latenta slumpmässiga variabler är vad som skiljer StyleTTS2-ramverket från dess föregångare, StyleTTS-ramverket, och syftar till att generera den mest lämpliga talsättet för inmatningstexten utan att behöva en referensljudinmatning, och kan uppnå effektiv latent diffusionsmedan man drar nytta av den varierade tal-synteskapsaciteten som erbjuds av diffusionsmodeller. Dessutom använder StyleTTS2-ramverket också en förtränad stor SLM eller tal-språksmodell som diskriminatörer, som WavLM-ramverket, och kopplar det med sin egen nya differentierbara varaktighetsmodelleringstillvägagångssätt för att träna ramverket från slut till slut och slutligen generera tal med förbättrad naturlighet. Tack vare tillvägagångssättet kan StyleTTS2-ramverket överträffa nuvarande state-of-the-art-ramverk för talgenereringsuppgifter och är ett av de mest effektiva ramverken för förträning av storskaliga talmodeller i nollskott-inställning för talareanpassningsuppgifter.

Vidare, för att leverera mänsklig nivå text-till-tal-syntes, inkorporerar StyleTTs2-ramverket lärdomar från befintliga arbeten, inklusive diffusionsmodeller för tal-syntes och stora tal-språksmodeller. Diffusionsmodeller används vanligtvis för tal-syntesuppgifter tack vare deras förmåga att kontrollera tal i detalj och varierad tal-sampling. Men diffusionsmodeller är inte lika effektiva som GAN-baserade icke-iterativa ramverk, och en stor anledning till detta är kravet på att sampla latenta representationer, vågformer och mel-spektrogram iterativt till måltiden för talet.

Å andra sidan har nyliga arbeten runt stora tal-språksmodeller indikerat deras förmåga att förbättra kvaliteten på text-till-tal-genereringsuppgifter och anpassa sig väl till talaren. Stora tal-språksmodeller omvandlar vanligtvis textinmatning antingen till kvantiserade eller kontinuerliga representationer som härrör från förtränade tal-språksmodeller för tal-rekonstruktionsuppgifter. Men funktionerna i dessa tal-språksmodeller är inte optimerade för tal-syntes direkt. I kontrast till detta använder StyleTTS2-ramverket kunskapen som vunnits av stora SLM-ramverk med hjälp av adversarial träning för att syntetisera tal-språksmodellens funktioner utan att använda latenta rymdkartor, och därmed lära sig en tal-syntesoptimerad latent rymd direkt.

StyleTTS2: Arkitektur och metodik

I sin kärna byggs StyleTTS2 på sin föregångare, StyleTTS-ramverket, som är ett icke-autoregressivt text-till-tal-ramverk som använder en stil-encoder för att hämta en stilvektor från referensljudet, vilket tillåter uttrycksfull och naturlig talgenerering. Stilvektorn som används i StyleTTS-ramverket inkorporeras direkt i encodern, varaktigheten och predictorn med hjälp av AdaIN eller adaptiv instansnormalisering, vilket tillåter StyleTTS-modellen att generera talutgångar med varierad prosodi, varaktighet och till och med känslor. StyleTTS-ramverket består av 8 modeller i totalt som delas in i tre kategorier

  1. Akustiska modeller eller talgenereringssystem med en stil-encoder, en text-encoder och en tal-decoder.
  2. Ett text-till-tal-prediktionsystem som använder prosodi och varaktighetspredictorer.
  3. Ett användarsystem som inkluderar en text-justerare, en pitch-extraktor och en diskriminatör för träningsändamål.

Tack vare sitt tillvägagångssätt levererar StyleTTS-ramverket state-of-the-art-prestationer relaterade till kontrollerbar och varierad tal-syntes. Men denna prestation har sina nackdelar, som försämring av sampelkvalitet, uttrycksfulla begränsningar och beroende av tal-hindrande applikationer i realtid.

Genom att förbättra StyleTTS-ramverket resulterar StyleTTS2-modellen i förbättrad uttrycksfull text-till-tal-uppgifter med förbättrad utomdistributionprestanda och hög mänsklig nivå. StyleTTS2-ramverket använder en slut-till-slut-träningsprocess som optimerar de olika komponenterna med adversarial träning och direkt vågformsyntes gemensamt. Till skillnad från StyleTTS-ramverket modellerar StyleTTS2-ramverket talsättet som en latent variabel och sampar det via diffusionsmodeller, vilket genererar varierade talsamples utan att använda en referensljud. Låt oss ta en detaljerad titt på dessa komponenter.

Slut-till-slut-träning för interferens

I StyleTTS2-ramverket används en slut-till-slut-träningsansats för att optimera olika text-till-tal-komponenter för interferens utan att behöva förlita sig på fasta komponenter. StyleTTS2-ramverket uppnår detta genom att modifiera decodern för att generera vågformen direkt från stilvektorn, pitch- och energikurvor och justerade representationer. Ramverket tar sedan bort den sista projiceringsskiktet av decodern och ersätter det med en vågformsdecoder. StyleTTS2-ramverket använder två encodrar: HifiGAN-baserad decoder för att generera vågformen direkt och en iSTFT-baserad decoder för att producera fas och amplitud som konverteras till vågformer för snabbare interferens och träning.

Figuren ovan representerar de akustiska modellerna som används för förträning och gemensam träning. För att minska tränningstiden optimeras modulerna först i förträningsfasen följt av optimering av alla komponenter minus pitch-extraktorn under gemensam träning. Anledningen till att gemensam träning inte optimerar pitch-extraktorn är att den används för att tillhandahålla grundvärdet för pitch-kurvor.

Figuren ovan representerar tal-språksmodellens adversarial träning och interferens med WavLM-ramverket förtränat men inte förfinat. Processen skiljer sig från den som nämns ovan eftersom den kan ta varierande inmatningstexter men ackumulerar gradienterna för att uppdatera parametrarna i varje batch.

Stil-diffusion

StyleTTS2-ramverket syftar till att modellera tal som en villkorlig fördelning genom en latent variabel som följer den villkorliga fördelningen, och denna variabel kallas den allmänna talsättet, och representerar vilken egenskap som helst i talsamplet utöver omfattningen av någon fonetisk innehåll, inklusive lexikalisk stress, prosodi, talfrekvens och till och med formantövergångar.

Tal-språksmodell-diskriminatörer

Tal-språksmodeller är kända för sin allmänna förmåga att koda värdefull information om ett brett spektrum av semantik och akustiska aspekter, och SLM-representationer har traditionellt kunnat imitera mänskliga perceptioner för att utvärdera kvaliteten på den genererade syntetiserade talet. StyleTTS2-ramverket använder en adversarial träningansats för att utnyttja förmågan hos SLM-encodrar för att utföra generativa uppgifter och använder en 12-lagers WavLM-ramverk som diskriminatör. Denna ansats tillåter ramverket att möjliggöra träning på OOD eller Out of Distribution-texter som kan hjälpa till att förbättra prestanda. Dessutom, för att förhindra överanpassningsproblem, sampar ramverket OOD-texter och inomdistribution med lika sannolikhet.

Differentierbar varaktighetsmodellering

Traditionellt används en varaktighetsprediktor i text-till-tal-ramverk som producerar fonemvaraktigheter, men upsampling-metoderna som dessa varaktighetspredictorer använder ofta blockerar gradientflödet under E2E-träningsprocessen, och NaturalSpeech-ramverket använder en attention-baserad upsampler för mänsklig nivå text-till-tal-omvandling. Men StyleTTS2-ramverket finner denna ansats vara instabil under adversarial träning eftersom StyleTTS2 tränar med differentierbar upsampling med olika adversarial träning utan förlust av extra termer på grund av längdskillnader. Även om användning av en mjuk dynamisk tid-väg-ansats kan hjälpa till att mildra denna skillnad, är användning av den inte bara beräkningsmässigt dyrt, utan dess stabilitet är också ett problem när man arbetar med adversariala objektiva eller mel-rekonstruktionsuppgifter. Därför, för att uppnå mänsklig nivå och stabilisera träningsprocessen, använder StyleTTC2-ramverket en icke-parametrisk upsampling-ansats. Gaussian-upsampling är en populär icke-parametrisk upsampling-ansats för att konvertera de predikterade varaktigheterna, men den har sina begränsningar tack vare den fasta längden på de Gaussian-kernel som förutbestäms. Denna begränsning för Gaussian-upsampling begränsar dess förmåga att exakt modellera justeringar med olika längder.

För att möta denna begränsning föreslår StyleTTC2-ramverket att använda en ny icke-parametrisk upsampling-ansats utan någon extra träning och som kan hantera varierande längder på justeringarna. För varje fonem modellerar StyleTTC2-ramverket justeringen som en slumpmässig variabel och indikerar indexet för talramen som den justerar med.

Modellträning och utvärdering

StyleTTC2-ramverket tränas och experimenteras på tre dataset: VCTK, LibriTTS och LJSpeech. Den enskilda talarens komponent i StyleTTS2-ramverket tränas med hjälp av LJSpeech-datasetet som innehåller cirka 13 000+ ljudexempel uppdelade i 12 500 träningsexempel, 100 valideringsexempel och nästan 500 testexempel, med en total löptid på nästan 24 timmar. Den multi-talarens komponent i ramverket tränas på VCTK-datasetet som består av över 44 000 ljudklipp med över 100 enskilda infödda talare med varierande accenter och är uppdelat i 43 500 träningsexempel, 100 valideringsexempel och nästan 500 testexempel. Slutligen, för att utrusta ramverket med nollskott-anpassningsförmåga, tränas ramverket på det kombinerade LibriTTS-datasetet som består av ljudklipp som totalt uppgår till cirka 250 timmar av ljud med över 1 150 enskilda talare. För att utvärdera dess prestanda använder modellen två mått: MOS-N eller Medel Opinion Score för Naturlighet och MOS-S eller Medel Opinion Score för Likhet.

Resultat

Tillvägagångssättet och metodiken som används i StyleTTS2-ramverket visas i dess prestanda, eftersom modellen överträffar flera state-of-the-art-TTS-ramverk, särskilt på NaturalSpeech-datasetet, och därmed sätter en ny standard för datasetet. Dessutom överträffar StyleTTS2-ramverket state-of-the-art-VITS-ramverket på VCTK-datasetet och resultaten visas i figuren nedan.

StyleTTS2-modellen överträffar också tidigare modeller på LJSpeech-datasetet och visar ingen kvalitetsförsämring på OOD eller Out of Distribution-texter som visas av tidigare ramverk på samma mått. Dessutom, i nollskott-inställning, överträffar StyleTTC2-modellen den befintliga Vall-E-ramverket i naturlighet, men ligger efter i likhet. Men det är värt att notera att StyleTTS2-ramverket kan uppnå konkurrenskraftig prestanda trots att det endast tränas på 245 timmar av ljudexempel jämfört med över 60 000 timmar av träning för Vall-E-ramverket, vilket visar att StyleTTC2 är en data-effektiv alternativ till befintliga stora förträningsmetoder som används i Vall-E.

Vidare, på grund av bristen på emotionellt märkt ljudtextdata, använder StyleTTC2-ramverket GPT-4-modellen för att generera över 500 instanser över olika emotioner för visualisering av stilvektorer som ramverket skapar med hjälp av sin diffusionsprocess.

I den första figuren visas emotionella stilar i svar på inmatningstextsentiment med hjälp av stilvektorerna från LJSpeech-modellen och visar ramverkets förmåga att syntetisera uttrycksfullt tal med varierande känslor. Den andra figuren visar distinkta kluster som bildas för var och en av de fem enskilda talarna, vilket visar en stor variation som härrör från en enda ljudfil. Den tredje figuren visar den lösare klustret av känslor från talare 1 och visar att, trots vissa överlappningar, känslobaserade kluster är framträdande, vilket indikerar möjligheten att manipulera den emotionella tonen hos en talare oavsett referensljudexempel och dess inmatningston. Trots att StyleTTS2-ramverket använder en diffusionsbaserad ansats, överträffar det befintliga state-of-the-art-ramverk, inklusive VITS, ProDiff och FastDiff.

Slutliga tankar

I den här artikeln har vi talat om StyleTTS2, ett nytt, robust och innovativt text-till-tal-ramverk som bygger på grunderna av StyleTTS-ramverket och syftar till att presentera nästa steg mot state-of-the-art-text-till-tal-system. StyleTTS2-ramverket modellerar talsätt som latenta slumpmässiga variabler och använder en sannolikhetsbaserad diffusionsmodell för att sampla dessa talsätt eller slumpmässiga variabler, vilket tillåter StyleTTS2-ramverket att syntetisera realistiskt tal effektivt utan att använda referensljudinmatningar. StyleTTS2-ramverket använder stil-diffusion och SLM-diskriminatörer för att uppnå mänsklig nivå på text-till-tal-uppgifter och överträffar befintliga state-of-the-art-ramverk på ett brett spektrum av taluppgifter.

Kunal Kejriwal är en backend‑ingenjör som specialiserar sig på Python, PostgreSQL, Redis och molninfrastruktur på GCP och AWS. Med tre års erfarenhet av att bygga och skala produktionssystem skriver han om AI‑infrastruktur, distribuerade system och arkitekturen bakom distribution av maskininlärningsarbetsbelastningar.