AI-modeller och plattformar

StyleTTS 2: MÃĪnsklig nivÃĨ fÃķr text-till-tal-syntes med stora tal-sprÃĨksmodeller

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

PÃĨ grund av den Ãķkade anvÃĪndningen av naturliga och syntetiska tal-syntesmetoder har en av de stora framstegen inom AI-branschen under de senaste ÃĨren varit att effektivt syntetisera text-till-tal-ramverk med potential fÃķr tillÃĪmpningar inom olika branscher, inklusive ljudbÃķcker, virtuella assistenter, rÃķstberÃĪttelser och mer, med vissa state-of-the-art-modeller som levererar mÃĪnsklig nivÃĨ och effektivitet Ãķver ett brett spektrum av tal-relaterade uppgifter. Men trots deras starka prestationer finns det fortfarande utrymme fÃķr fÃķrbÃĪttring fÃķr uppgifter tack vare uttrycksfull och varierad tal, krav pÃĨ stor mÃĪngd trÃĪningsdata fÃķr att optimera nollskott-text-till-tal-ramverk och robusthet fÃķr OOD eller Out of Distribution-texter, vilket leder utvecklare att arbeta pÃĨ ett mer robust och tillgÃĪngligt text-till-tal-ramverk.

I den hÃĪr artikeln kommer vi att prata om StyleTTS-2, ett robust och innovativt text-till-tal-ramverk som bygger pÃĨ grunderna av StyleTTS-ramverket och syftar till att presentera nÃĪsta steg mot state-of-the-art-text-till-tal-system. StyleTTS2-ramverket modellerar talsÃĪtt som latenta slumpmÃĪssiga variabler och anvÃĪnder en sannolikhetsbaserad diffusionsmodell fÃķr att sampla dessa talsÃĪtt eller slumpmÃĪssiga variabler, vilket tillÃĨter StyleTTS2-ramverket att syntetisera realistiskt tal effektivt utan att anvÃĪnda referensljudinmatningar. PÃĨ grund av tillvÃĪgagÃĨngssÃĪttet kan StyleTTS2-ramverket leverera bÃĪttre resultat och visa hÃķg effektivitet jÃĪmfÃķrt med nuvarande state-of-the-art-text-till-tal-ramverk, men kan ocksÃĨ dra nytta av den varierade tal-syntes som erbjuds av diffusionsmodellsramverk. Vi kommer att diskutera StyleTTS2-ramverket i stÃķrre detalj och tala om dess arkitektur och metodik medan vi ocksÃĨ tittar pÃĨ resultaten som uppnÃĨtts av ramverket. SÃĨ lÃĨt oss komma igÃĨng.

StyleTTS2 fÃķr text-till-tal-syntes: En introduktion

StyleTTS2 ÃĪr ett innovativt text-till-tal-syntesmodell som tar nÃĪsta steg mot att bygga mÃĪnsklig nivÃĨ TTS-ramverk och bygger pÃĨ StyleTTS, en stilbaserad text-till-tal-generativ modell. StyleTTS2-ramverket modellerar talsÃĪtt som latenta slumpmÃĪssiga variabler och anvÃĪnder en sannolikhetsbaserad diffusionsmodell fÃķr att sampla dessa talsÃĪtt eller slumpmÃĪssiga variabler, vilket tillÃĨter StyleTTS2-ramverket att syntetisera realistiskt tal effektivt utan att anvÃĪnda referensljudinmatningar. Att modellera stilar som latenta slumpmÃĪssiga variabler ÃĪr vad som skiljer StyleTTS2-ramverket frÃĨn dess fÃķregÃĨngare, StyleTTS-ramverket, och syftar till att generera den mest lÃĪmpliga talsÃĪttet fÃķr inmatningstexten utan att behÃķva en referensljudinmatning, och kan uppnÃĨ effektiv latent diffusionsmedan man drar nytta av den varierade tal-synteskapsaciteten som erbjuds av diffusionsmodeller. Dessutom anvÃĪnder StyleTTS2-ramverket ocksÃĨ en fÃķrtrÃĪnad stor SLM eller tal-sprÃĨksmodell som diskriminatÃķrer, som WavLM-ramverket, och kopplar det med sin egen nya differentierbara varaktighetsmodelleringstillvÃĪgagÃĨngssÃĪtt fÃķr att trÃĪna ramverket frÃĨn slut till slut och slutligen generera tal med fÃķrbÃĪttrad naturlighet. Tack vare tillvÃĪgagÃĨngssÃĪttet kan StyleTTS2-ramverket ÃķvertrÃĪffa nuvarande state-of-the-art-ramverk fÃķr talgenereringsuppgifter och ÃĪr ett av de mest effektiva ramverken fÃķr fÃķrtrÃĪning av storskaliga talmodeller i nollskott-instÃĪllning fÃķr talareanpassningsuppgifter.

Vidare, fÃķr att leverera mÃĪnsklig nivÃĨ text-till-tal-syntes, inkorporerar StyleTTs2-ramverket lÃĪrdomar frÃĨn befintliga arbeten, inklusive diffusionsmodeller fÃķr tal-syntes och stora tal-sprÃĨksmodeller. Diffusionsmodeller anvÃĪnds vanligtvis fÃķr tal-syntesuppgifter tack vare deras fÃķrmÃĨga att kontrollera tal i detalj och varierad tal-sampling. Men diffusionsmodeller ÃĪr inte lika effektiva som GAN-baserade icke-iterativa ramverk, och en stor anledning till detta ÃĪr kravet pÃĨ att sampla latenta representationer, vÃĨgformer och mel-spektrogram iterativt till mÃĨltiden fÃķr talet.

Å andra sidan har nyliga arbeten runt stora tal-sprÃĨksmodeller indikerat deras fÃķrmÃĨga att fÃķrbÃĪttra kvaliteten pÃĨ text-till-tal-genereringsuppgifter och anpassa sig vÃĪl till talaren. Stora tal-sprÃĨksmodeller omvandlar vanligtvis textinmatning antingen till kvantiserade eller kontinuerliga representationer som hÃĪrrÃķr frÃĨn fÃķrtrÃĪnade tal-sprÃĨksmodeller fÃķr tal-rekonstruktionsuppgifter. Men funktionerna i dessa tal-sprÃĨksmodeller ÃĪr inte optimerade fÃķr tal-syntes direkt. I kontrast till detta anvÃĪnder StyleTTS2-ramverket kunskapen som vunnits av stora SLM-ramverk med hjÃĪlp av adversarial trÃĪning fÃķr att syntetisera tal-sprÃĨksmodellens funktioner utan att anvÃĪnda latenta rymdkartor, och dÃĪrmed lÃĪra sig en tal-syntesoptimerad latent rymd direkt.

StyleTTS2: Arkitektur och metodik

I sin kÃĪrna byggs StyleTTS2 pÃĨ sin fÃķregÃĨngare, StyleTTS-ramverket, som ÃĪr ett icke-autoregressivt text-till-tal-ramverk som anvÃĪnder en stil-encoder fÃķr att hÃĪmta en stilvektor frÃĨn referensljudet, vilket tillÃĨter uttrycksfull och naturlig talgenerering. Stilvektorn som anvÃĪnds i StyleTTS-ramverket inkorporeras direkt i encodern, varaktigheten och predictorn med hjÃĪlp av AdaIN eller adaptiv instansnormalisering, vilket tillÃĨter StyleTTS-modellen att generera talutgÃĨngar med varierad prosodi, varaktighet och till och med kÃĪnslor. StyleTTS-ramverket bestÃĨr av 8 modeller i totalt som delas in i tre kategorier

  1. Akustiska modeller eller talgenereringssystem med en stil-encoder, en text-encoder och en tal-decoder.
  2. Ett text-till-tal-prediktionsystem som anvÃĪnder prosodi och varaktighetspredictorer.
  3. Ett anvÃĪndarsystem som inkluderar en text-justerare, en pitch-extraktor och en diskriminatÃķr fÃķr trÃĪningsÃĪndamÃĨl.

Tack vare sitt tillvÃĪgagÃĨngssÃĪtt levererar StyleTTS-ramverket state-of-the-art-prestationer relaterade till kontrollerbar och varierad tal-syntes. Men denna prestation har sina nackdelar, som fÃķrsÃĪmring av sampelkvalitet, uttrycksfulla begrÃĪnsningar och beroende av tal-hindrande applikationer i realtid.

Genom att fÃķrbÃĪttra StyleTTS-ramverket resulterar StyleTTS2-modellen i fÃķrbÃĪttrad uttrycksfull text-till-tal-uppgifter med fÃķrbÃĪttrad utomdistributionprestanda och hÃķg mÃĪnsklig nivÃĨ. StyleTTS2-ramverket anvÃĪnder en slut-till-slut-trÃĪningsprocess som optimerar de olika komponenterna med adversarial trÃĪning och direkt vÃĨgformsyntes gemensamt. Till skillnad frÃĨn StyleTTS-ramverket modellerar StyleTTS2-ramverket talsÃĪttet som en latent variabel och sampar det via diffusionsmodeller, vilket genererar varierade talsamples utan att anvÃĪnda en referensljud. LÃĨt oss ta en detaljerad titt pÃĨ dessa komponenter.

Slut-till-slut-trÃĪning fÃķr interferens

I StyleTTS2-ramverket anvÃĪnds en slut-till-slut-trÃĪningsansats fÃķr att optimera olika text-till-tal-komponenter fÃķr interferens utan att behÃķva fÃķrlita sig pÃĨ fasta komponenter. StyleTTS2-ramverket uppnÃĨr detta genom att modifiera decodern fÃķr att generera vÃĨgformen direkt frÃĨn stilvektorn, pitch- och energikurvor och justerade representationer. Ramverket tar sedan bort den sista projiceringsskiktet av decodern och ersÃĪtter det med en vÃĨgformsdecoder. StyleTTS2-ramverket anvÃĪnder tvÃĨ encodrar: HifiGAN-baserad decoder fÃķr att generera vÃĨgformen direkt och en iSTFT-baserad decoder fÃķr att producera fas och amplitud som konverteras till vÃĨgformer fÃķr snabbare interferens och trÃĪning.

Figuren ovan representerar de akustiska modellerna som anvÃĪnds fÃķr fÃķrtrÃĪning och gemensam trÃĪning. FÃķr att minska trÃĪnningstiden optimeras modulerna fÃķrst i fÃķrtrÃĪningsfasen fÃķljt av optimering av alla komponenter minus pitch-extraktorn under gemensam trÃĪning. Anledningen till att gemensam trÃĪning inte optimerar pitch-extraktorn ÃĪr att den anvÃĪnds fÃķr att tillhandahÃĨlla grundvÃĪrdet fÃķr pitch-kurvor.

Figuren ovan representerar tal-sprÃĨksmodellens adversarial trÃĪning och interferens med WavLM-ramverket fÃķrtrÃĪnat men inte fÃķrfinat. Processen skiljer sig frÃĨn den som nÃĪmns ovan eftersom den kan ta varierande inmatningstexter men ackumulerar gradienterna fÃķr att uppdatera parametrarna i varje batch.

Stil-diffusion

StyleTTS2-ramverket syftar till att modellera tal som en villkorlig fÃķrdelning genom en latent variabel som fÃķljer den villkorliga fÃķrdelningen, och denna variabel kallas den allmÃĪnna talsÃĪttet, och representerar vilken egenskap som helst i talsamplet utÃķver omfattningen av nÃĨgon fonetisk innehÃĨll, inklusive lexikalisk stress, prosodi, talfrekvens och till och med formantÃķvergÃĨngar.

Tal-sprÃĨksmodell-diskriminatÃķrer

Tal-sprÃĨksmodeller ÃĪr kÃĪnda fÃķr sin allmÃĪnna fÃķrmÃĨga att koda vÃĪrdefull information om ett brett spektrum av semantik och akustiska aspekter, och SLM-representationer har traditionellt kunnat imitera mÃĪnskliga perceptioner fÃķr att utvÃĪrdera kvaliteten pÃĨ den genererade syntetiserade talet. StyleTTS2-ramverket anvÃĪnder en adversarial trÃĪningansats fÃķr att utnyttja fÃķrmÃĨgan hos SLM-encodrar fÃķr att utfÃķra generativa uppgifter och anvÃĪnder en 12-lagers WavLM-ramverk som diskriminatÃķr. Denna ansats tillÃĨter ramverket att mÃķjliggÃķra trÃĪning pÃĨ OOD eller Out of Distribution-texter som kan hjÃĪlpa till att fÃķrbÃĪttra prestanda. Dessutom, fÃķr att fÃķrhindra Ãķveranpassningsproblem, sampar ramverket OOD-texter och inomdistribution med lika sannolikhet.

Differentierbar varaktighetsmodellering

Traditionellt anvÃĪnds en varaktighetsprediktor i text-till-tal-ramverk som producerar fonemvaraktigheter, men upsampling-metoderna som dessa varaktighetspredictorer anvÃĪnder ofta blockerar gradientflÃķdet under E2E-trÃĪningsprocessen, och NaturalSpeech-ramverket anvÃĪnder en attention-baserad upsampler fÃķr mÃĪnsklig nivÃĨ text-till-tal-omvandling. Men StyleTTS2-ramverket finner denna ansats vara instabil under adversarial trÃĪning eftersom StyleTTS2 trÃĪnar med differentierbar upsampling med olika adversarial trÃĪning utan fÃķrlust av extra termer pÃĨ grund av lÃĪngdskillnader. Även om anvÃĪndning av en mjuk dynamisk tid-vÃĪg-ansats kan hjÃĪlpa till att mildra denna skillnad, ÃĪr anvÃĪndning av den inte bara berÃĪkningsmÃĪssigt dyrt, utan dess stabilitet ÃĪr ocksÃĨ ett problem nÃĪr man arbetar med adversariala objektiva eller mel-rekonstruktionsuppgifter. DÃĪrfÃķr, fÃķr att uppnÃĨ mÃĪnsklig nivÃĨ och stabilisera trÃĪningsprocessen, anvÃĪnder StyleTTC2-ramverket en icke-parametrisk upsampling-ansats. Gaussian-upsampling ÃĪr en populÃĪr icke-parametrisk upsampling-ansats fÃķr att konvertera de predikterade varaktigheterna, men den har sina begrÃĪnsningar tack vare den fasta lÃĪngden pÃĨ de Gaussian-kernel som fÃķrutbestÃĪms. Denna begrÃĪnsning fÃķr Gaussian-upsampling begrÃĪnsar dess fÃķrmÃĨga att exakt modellera justeringar med olika lÃĪngder.

FÃķr att mÃķta denna begrÃĪnsning fÃķreslÃĨr StyleTTC2-ramverket att anvÃĪnda en ny icke-parametrisk upsampling-ansats utan nÃĨgon extra trÃĪning och som kan hantera varierande lÃĪngder pÃĨ justeringarna. FÃķr varje fonem modellerar StyleTTC2-ramverket justeringen som en slumpmÃĪssig variabel och indikerar indexet fÃķr talramen som den justerar med.

ModelltrÃĪning och utvÃĪrdering

StyleTTC2-ramverket trÃĪnas och experimenteras pÃĨ tre dataset: VCTK, LibriTTS och LJSpeech. Den enskilda talarens komponent i StyleTTS2-ramverket trÃĪnas med hjÃĪlp av LJSpeech-datasetet som innehÃĨller cirka 13 000+ ljudexempel uppdelade i 12 500 trÃĪningsexempel, 100 valideringsexempel och nÃĪstan 500 testexempel, med en total lÃķptid pÃĨ nÃĪstan 24 timmar. Den multi-talarens komponent i ramverket trÃĪnas pÃĨ VCTK-datasetet som bestÃĨr av Ãķver 44 000 ljudklipp med Ãķver 100 enskilda infÃķdda talare med varierande accenter och ÃĪr uppdelat i 43 500 trÃĪningsexempel, 100 valideringsexempel och nÃĪstan 500 testexempel. Slutligen, fÃķr att utrusta ramverket med nollskott-anpassningsfÃķrmÃĨga, trÃĪnas ramverket pÃĨ det kombinerade LibriTTS-datasetet som bestÃĨr av ljudklipp som totalt uppgÃĨr till cirka 250 timmar av ljud med Ãķver 1 150 enskilda talare. FÃķr att utvÃĪrdera dess prestanda anvÃĪnder modellen tvÃĨ mÃĨtt: MOS-N eller Medel Opinion Score fÃķr Naturlighet och MOS-S eller Medel Opinion Score fÃķr Likhet.

Resultat

TillvÃĪgagÃĨngssÃĪttet och metodiken som anvÃĪnds i StyleTTS2-ramverket visas i dess prestanda, eftersom modellen ÃķvertrÃĪffar flera state-of-the-art-TTS-ramverk, sÃĪrskilt pÃĨ NaturalSpeech-datasetet, och dÃĪrmed sÃĪtter en ny standard fÃķr datasetet. Dessutom ÃķvertrÃĪffar StyleTTS2-ramverket state-of-the-art-VITS-ramverket pÃĨ VCTK-datasetet och resultaten visas i figuren nedan.

StyleTTS2-modellen ÃķvertrÃĪffar ocksÃĨ tidigare modeller pÃĨ LJSpeech-datasetet och visar ingen kvalitetsfÃķrsÃĪmring pÃĨ OOD eller Out of Distribution-texter som visas av tidigare ramverk pÃĨ samma mÃĨtt. Dessutom, i nollskott-instÃĪllning, ÃķvertrÃĪffar StyleTTC2-modellen den befintliga Vall-E-ramverket i naturlighet, men ligger efter i likhet. Men det ÃĪr vÃĪrt att notera att StyleTTS2-ramverket kan uppnÃĨ konkurrenskraftig prestanda trots att det endast trÃĪnas pÃĨ 245 timmar av ljudexempel jÃĪmfÃķrt med Ãķver 60 000 timmar av trÃĪning fÃķr Vall-E-ramverket, vilket visar att StyleTTC2 ÃĪr en data-effektiv alternativ till befintliga stora fÃķrtrÃĪningsmetoder som anvÃĪnds i Vall-E.

Vidare, pÃĨ grund av bristen pÃĨ emotionellt mÃĪrkt ljudtextdata, anvÃĪnder StyleTTC2-ramverket GPT-4-modellen fÃķr att generera Ãķver 500 instanser Ãķver olika emotioner fÃķr visualisering av stilvektorer som ramverket skapar med hjÃĪlp av sin diffusionsprocess.

I den fÃķrsta figuren visas emotionella stilar i svar pÃĨ inmatningstextsentiment med hjÃĪlp av stilvektorerna frÃĨn LJSpeech-modellen och visar ramverkets fÃķrmÃĨga att syntetisera uttrycksfullt tal med varierande kÃĪnslor. Den andra figuren visar distinkta kluster som bildas fÃķr var och en av de fem enskilda talarna, vilket visar en stor variation som hÃĪrrÃķr frÃĨn en enda ljudfil. Den tredje figuren visar den lÃķsare klustret av kÃĪnslor frÃĨn talare 1 och visar att, trots vissa Ãķverlappningar, kÃĪnslobaserade kluster ÃĪr framtrÃĪdande, vilket indikerar mÃķjligheten att manipulera den emotionella tonen hos en talare oavsett referensljudexempel och dess inmatningston. Trots att StyleTTS2-ramverket anvÃĪnder en diffusionsbaserad ansats, ÃķvertrÃĪffar det befintliga state-of-the-art-ramverk, inklusive VITS, ProDiff och FastDiff.

Slutliga tankar

I den hÃĪr artikeln har vi talat om StyleTTS2, ett nytt, robust och innovativt text-till-tal-ramverk som bygger pÃĨ grunderna av StyleTTS-ramverket och syftar till att presentera nÃĪsta steg mot state-of-the-art-text-till-tal-system. StyleTTS2-ramverket modellerar talsÃĪtt som latenta slumpmÃĪssiga variabler och anvÃĪnder en sannolikhetsbaserad diffusionsmodell fÃķr att sampla dessa talsÃĪtt eller slumpmÃĪssiga variabler, vilket tillÃĨter StyleTTS2-ramverket att syntetisera realistiskt tal effektivt utan att anvÃĪnda referensljudinmatningar. StyleTTS2-ramverket anvÃĪnder stil-diffusion och SLM-diskriminatÃķrer fÃķr att uppnÃĨ mÃĪnsklig nivÃĨ pÃĨ text-till-tal-uppgifter och ÃķvertrÃĪffar befintliga state-of-the-art-ramverk pÃĨ ett brett spektrum av taluppgifter.

En ingenjÃķr till yrket, en fÃķrfattare av hjÃĪrtat. Kunal ÃĪr en teknisk skribent med ett djupt kÃĪrlek och fÃķrstÃĨelse fÃķr AI och ML, dedikerad till att fÃķrenkla komplexa begrepp inom dessa omrÃĨden genom sin engagerande och informativa dokumentation.