AI-mallit ja alustat

HierSpeech++: Hierarkkinen Variational Inference Zero-Shot Puheen Synteesiin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viimeaikaiset kehitysaskeleet ja edistysaskelit suurten kielimallien kyvyssä ovat olleet avainasemassa äänen generoinnissa ja puheen synteesitehtävissä, erityisesti zero-shot-asetelmissa. Perinteiset puheen synteesirunkoiset ovat kokeneet merkittäviä edistysaskelia lisäämällä ominaisuuksia kuten neuronaalisia ääni-koodekkeja diskreeteille ääni- ja puheyksiköille. Vaikka nämä puhe- ja äänisynteesirunkoiset tarjoavat tyydyttäviä tuloksia, on edelleen parantamisen varaa, sillä nykyiset LLM-pohjaiset ääni-runkoiset ovat seuraavilla kolmella suurella rajoituksella

  1. Ne taipuvat itsestään generoimaan äänilähtöä, joka lopulta johtaa robustisuuden puutteeseen ja hitaaseen interferenssinopeuteen, josta seuraa ääntämisen virheitä, puheen hyppäämistä tai toistoa.
  2. Ne ovat taipuvaisia riippuvaisuuteen diskreeteista puheyksiköistä tai esikoulutetusta neuronaalisesta ääni-koodekista.
  3. Ne vaativat usein suuren määrän koulutusdataa.

Edellä mainittujen ongelmien ratkaisemiseksi ja LLM-pohjaisen ääni- ja puheen synteesimallien kykyjen parantamiseksi kehittäjät ovat luoneet HierSpeech++:n, vankkaan ja tehokkaan zero-shot puheen synteesirungon äänen ja tekstin muuntamiseen tai TTS-muunnoksille. HierSpeech++-runko perustuu hierarkkisen puheen synteesirunko-opetuksiin, jotka eivät ainoastaan lisää robustisuutta, vaan myös lisäävät synteettisen puheen lausumisen ilmaisukykyä ja luonnollisuutta sekä puhujan samankaltaisuutta jopa zero-shot-tilanteissa.

Tässä artikkelissa tarkastelemme HierSpeech++-runkoa yksityiskohtaisesti ja tarkastelemme mallin arkkitehtuuri, toimintaa ja tuloksia verrattuna valtiollisiin teksti- ja äänigeneneraattorimalleihin. Aloita siis.

HierSpeech++: Hierarkkinen Variational Inference Zero-Shot Puheen Synteesiin

HierSpeech++ on nopea, vankka ja tehokas zero-shot puheen synteesirunko, joka käyttää hierarkkista puheen synteesiputkea, ja omaksuu tämän loppupään puheen synteesirungon, HierSpeech++-malli pystyy maksimoimaan korkealaatuisen aaltoalueen generoinnin potentiaalia hierarkkisesti siltaamalla kuilun semanttisen ja akustisen edustamisen ottamalla itsesääteisen puheen edustamisen semanttisena puheen edustamisena ja yrittää ratkaista nykyisten tyylin sovittamisen rajoitukset. Loppupään puheen synteesirunko esiteltiin ensimmäisen kerran VITS-mallissa, ja se ottaa Variational Auto-Encoderin, joka on täydennetty vastakkaisella koulutuksella ja normaloivalla virralla. Lisäksi VAE-pohjaiset rungot loppupään koulutusputkella kykenevät generoimaan korkealaatuisia aaltoalueita, joilla havaintoarvoinen puheen synteesilaatu on merkittävästi parempi kuin muiden puheen synteesirunkojen tuottamissa.

Näiden runkojen äänilaadun voi parantaa edelleen käyttämällä hierarkkista ehdollista Variational AutoEncoderia, kuten HierSpeech-rungossa. Vaikka ne ovat potentiaalisia, loppupään koulutusputkella perustuvat mallit ovat tiettyjä rajoituksia, erityisesti zero-shot-tilanteissa, vaikka ne voivat synteettisiä puhetta näytteitä korkealaatuisella äänellä, puhujan samankaltaisuus zero-shot-äänen kloonaus tehtävissä on edelleen suuri laskennallinen monimutkaisuus. Toisaalta diffusio-pohjaiset puheen synteesimallit suoriutuvat hyvin puhujan sovittamisessa, mutta ne ovat edelleen täydellisiä, sillä ne käyttävät interaktiivista generointiprosessia, joka hidastaa sen interferenssinopeutta, ne ovat usein alttiita meluisille tiedoille, ja tuloksena epätarkkuudesta koulutuksen ja inference-vaiheen välillä Mel-spectrogramin ja generoidun perustodistuksen välillä äänen laatu ei ole merkittävä.

Ratkaisemaan edellä mainittuja ongelmia, HierSpeech++-malli käyttää hierarkkista puheen synteesoria, puheen super-resoluutiota ja teksti-vec-komponenttia, ja esittää parannetun hierarkkisen puheen synteesorin, joka perustuu hierarkkiseen ehdolliseen Variational AutoEncoderiin. Yrittääkseen parantaa äänen laatua havaintoarvoa, HierSpeech++-runko ottaa kaksoisäänen posteriorin ja parantaa jakautumisen yleistämistä käyttämällä hierarkkista adapatiivista generoijaa, joka on varustettu sekä ehdollisella että ehdottomalla generoinnilla. Lisäksi, puheen komponenttien erottamiseksi ja puhujan liittyvän ja puhujasta riippumattoman semanttisen tiedon parantamiseksi, HierSpeech++-runko ottaa lähde- ja suodatin-teorian perustuvan monipolisen semanttisen kooderin. Tuloksena Variational AutoEncoderin käytöstä, HierSpeech++-malli voi yhdistää ja oppia edustamia hierarkkisesti ja progressiivisesti sopeutua kohdeäänen tyyliin äänen aaltoalueen inferenceen. Lisäksi, HierSpeech++-runko käyttää bidirectional-verkkoa normaloivaa virtausta Transformerssa yrittääkseen parantaa sopeutumista ja vähentää koulutuksen ja inference-vaiheen välistä epätarkkuutta.

Yleisesti ottaen, HierSpeech++-malli on täysin rinnakkainen, uusi ja vankka hierarkkinen puheen synteesirunko, joka on tarkoitettu synteettisten puhetta näytteiden luomiseen zero-shot-tilanteissa, ja yrittää tehdä seuraavat avustukset

  • Käyttämällä hierarkkista puheen synteesirunkoa äänen tyylejä ja prosodiaa ohjaamaan ja siirtämään.
  • Mahdollistamalla datan skaalautuvuuden ja korkearesoluutioisen puheen synteesin äänen aaltoalueen ylösotamalla 16 kHz:sta 48 kHz:iin.
  • Saavuttamalla ihmisen taso zero-shot-äänen muunnos- ja teksti-puhe-tehtävissä.

HierSpeech++: Mallin Komponentit ja Arkkitehtuuri

Kuten mainittiin, HierSpeech++ on zero-shot puheen synteesimalli, joka yrittää saavuttaa ihmisen tason tarkkuuden äänen samankaltaisuuden ja puheen luonnollisuuden suhteen.

HierSpeech++-malli koostuu eri komponenteista, mukaan lukien hierarkkinen puheen synteesori, puheen super-resoluutio ja teksti-vec-malli, jotka toimivat yhdessä mahdollistaakseen koulutuksen jokaiselle mallille, joka voi tehokkaasti hyödyntää suuren määrän matalaresoluutioista puhe-dataa äänen kloonaamiseen. Tarkastellaan mallin arkkitehtuuri ja puhutaan kustakin komponentista.

Puheen Edustamiset

Koska ihmisen taajuusalue on alle 4 kHz, puheen synteesille HierSpeech++-runko ottaa äänen näytteen 16 kHz:sta. Lisäksi äänen signaalin rekonstruoimiseksi on tärkeää käyttää vähintään kaksinkertaista äänen taajuuden korkeinta komponenttia, lisäksi äänen näytteen alennusta. Saavuttaakseen parannetun havaintoarvon, HierSpeech++-runko käyttää puheen super-resoluutiokomponenttia äänen näytteen ylösotamiseen 16 kHz:sta 48 kHz:iin, ja käyttää matalaresoluutioisia edustamia semanttisille ja akustisille edustamisille.

Akustisille edustamisille, perinteinen teksti-puhe-runko käyttää Mel-spectrografia akustisena väliaikaisena ominaisuutena, joka muunnetaan aalloalueesta STFT:n avulla. On kuitenkin huomattava, että koska akustiset ominaisuudet ovat rikkaat edustamiset, jotka sisältävät useita ominaisuuksia, mukaan lukien sisällön ja ääntämisen, äänen tiedon ja muun, se on vaikea mallille havaita nämä edustamiset, mikä usein johtaa ääntämisen virheisiin, puutteeseen samankaltaisuudesta tai yli-sileitä puheesta.

Jatkaen, jotta voidaan poistaa jatkuva semanttinen edustaminen aalloalueesta, HierSpeech++-runko käyttää Wav2Vec-runkoa, toisin kuin suosittu itsesääteinen puheen edustamisen lähestymistapa semanttisille edustamisille. Vaikka lähestymistapa on hyvä vaihtoehto rikkaalle monikieliselle mallille, se vaikuttaa mallin zero-shot-äänen kloonaamiskykyyn sekä robustisuuteen että ilmaisukykyyn erityisesti monikielisissä puheen synteesitehtävissä.

Hierarkkinen Puheen Synteesori

Hierarkkinen puheen synteesorin komponentti on HierSpeech++-runkoon perustuva kivi, joka mahdollistaa mallin koulutuksen ilman teksti-transkriptioita tai puhujan tunnistetta, ja riippuu ainoastaan puhe-datasta. Lisätäkseen akustisen kapasiteetin, aiemmat valtiolliset puheen synteesimallit korvasivat Mel-spectrografiaan lineaarisella spectrografialla, mutta lähestymistapa vähentää KL-divergenssi- arvoa äänen jaksoittaisuuden, PESQ:n, äänen ja äänettömän äänen suhteen ja Mel-spectrografia-etäisyyden suhteen. Hierarkkinen puheen synteesori käyttää kaksoisäänen akustista kooderia ratkaisemaan haasteita, jotka liittyvät lineaarisen spectrografia-käyttöön.

Lisäksi, puhujasta riippumattomien ja puhujasta riippuvien semanttisten edustamisten kanssa, HierSpeech++-runko käyttää monipolista itsesääteistä puheen edustamista, jossa jokainen yksittäinen edustaminen käytetään hierarkkiselle tyylin sovittamiselle semanttisten edustamisten kanssa, jotka poistetaan saadakseen kielellisen tiedon MMS:n keskikerroksesta. Runko käyttää myös perusääntä puheen erottamiseen, joka mahdollistaa äänen korkeuden manuaalisen säätämisen. Runko käyttää myös kielellistä edustamista ehdollisena tiedona generoimaan aalloalueen hierarkkisesti ja parantaa itsesääteistä edustamista. On myös huomattava, että akustiset edustamiset, jotka poistetaan koulutuksen aikana käyttämällä aalloalueen ja lineaarisen spectrografia-edustamisen, käytetään aalloalueen rekonstruoimiseen, ja hierarkkinen variational inference käytetään akustisten edustamisten ja monipolisen kielellisen edustamisen yhdistämiseen. Runko käyttää myös hierarkkista adapatiivista generoijaa (HAG) generoimaan semanttisista aalloalueisiin näytteitä, ja generoidut edustamiset, jotka koostuvat tyylin edustamisesta ja akustisesta edustamisesta, syötetään lähde- ja aalloalueen generoijiin.

Teksti-Vec

Teksti-puhe-synteesille, HierSpeech++-runko käyttää teksti-vec-mallia, joka generoi perusääntä ja semanttisen edustamisen tekstisekvenssistä, ja käyttää monotonista etsintää ja variational autoencoderia teksti- ja puheen sisäistä koodaamiseen. HierSpeech++-runko sitten korvaa lineaarisen spectrografiaan itsesääteisen lineaarisella edustamisella ja rekonstruoaa saman edustamisen, joka toimii teksti-vec-mallin tuloksena.

Lisäksi, HierSpeech++-runko ennustaa perusääntä neljä kertaa suuremmalla resoluutiolla verrattuna itsesääteisiin puheen edustamisiin, ja käyttää ehdollista tekstiedustamista priori-tiedona. Semanttisen tiedon ansiosta itsesääteisistä puheen edustamisista, runko pystyy siirtämään tyylin tekstiin vec-mallissa, ja syöttää latentin edustamisen fonemi-kooderiin kielellisen edustamisen kielellisten kykyjen parantamiseksi.

Puheen Super-Resoluutio

HierSpeech++-runko koulutetaan suhteellisen matalaresoluutioisella datasetillä datan tehokkuuden ja saatavuuden suhteen, ja ylösottaa matalaresoluutioisen puheen aalloalueen korkearesoluutioiseen puheen aalloalueeseen 16 kHz:sta 48 kHz:iin. Runko korvaa myös transpoosin konvoluution lähimmän naapurin ylösottimella, joka on aiemmin tunnettu vähentävän transpoosin konvoluution aiheuttamia virheitä.

Arkkitehtuuri

Teksti-vec-mallin sisältökooderin koostuu 16:sta non-kausaalisista WaveNet-kerroksista, joissa on ydin kokoa 5 ja piilokoko 256, kun taas sisältödekooderi koostuu 8:sta non-kausaalisista WaveNet-kerroksista, joissa on ydin kokoa 5 ja piilokoko 512. Teksti-kooderin komponentti koostuu kolmesta prosodia-ehtoisesta Transformer-verkosta ja kolmesta ehdottomasta Transformer-verkosta, joissa on ydin kokoa 9, suodatin kokoa 1024 ja piilokoko 256, teksti-kooderilla on myös 0,2: n dropout-arvo. Jotta voidaan koodata lähellä olevaa tietoa ja parantaa prosodian tyylin sovittamista, runko käyttää CNN:ää ydin kokoa 5 Transformer-lohkoissa. Puheen super-resoluutio puolestaan koostuu yhdestä AMP-lohkosta 32:lla alkukanavilla ilman ylösottimisen läsnäoloa. Runko käyttää lähimmän naapurin ylösottimella ylösottamaan piilokoodauksia ja käyttää MPD:ää diskriminaattorina kuudella eri ikkuna-kokoisella ja neljällä aliverkkodiskriminaattorilla.

Yllä oleva kuva havainnollistaa HierSpeech++-runkoon perustuvan inference-pipeline, joka alkaa semanttisten edustamisten poistamisella äänen taajuudella 16 kHz ja perusäännällä YAPPT-algoritmin avulla. Ennen kuin perusääntä voidaan syöttää hierarkkiseen synteesoriin, se normalisoidaan lähteen äänen keskiarvon ja keskihajonnan avulla, ja normalisoitu perusääntä denormalisoidaan kohdeäänen keskiarvon ja keskihajonnan avulla. Teksti-puhe-ekstraktoinnille, HierSpeech++-runko poistaa tekstiedustamiset puheen edustamisten sijaan ja käyttää teksti-vec-mallia semanttisen edustamisen generoimiseen prosodian vihjeestä.

Kokeet ja Tulokset

Runko käyttää julkisesti saatavilla olevaa LibriTTS-datasetiä kouluttamaan hierarkkista synteesorin komponenttia, ja ensimmäinen askel on kouluttaa malli trainclean-alijoukolla datasetistä, ja käyttää loput dataa äänen tyylin siirtämiseen.

Rekonstruktio, Resynteesi-tehtävät ja Äänen Muunnos

Arvioidakseen HierSpeech++-runkoon perustuvan suorituskyvyn rekonstruktio- ja resynteesitehtävissä, kehittäjät suorittivat seitsemän objektiivista mittaria, ja tulokset on esitetty seuraavissa kuvissa rekonstruktio- ja resynteesitehtävissä.

Äänen muunnos-tehtävissä, runko käyttää kahta subjektiivista mittaria arviointiin: äänen samankaltaisuus MOS tai sMOS ja luonnollisuus keskiarvo nMOS kolmella luonnollisuuden objektiivisella mittarilla ja kahdella samankaltaisuuden objektiivisella mittarilla.

Jatkaen, HierSpeech++-runkoon perustuvan ensisijainen tavoite on mahdollistaa zero-shot puheen synteesi, ja arvioidakseen sen suorituskykyä zero-shot-tilanteissa, se verrataan muihin perusmalleihin kuten AutoVC, VoiceMixer, diffusio-pohjaisiin malleihin ja moniin muihin, ja tulokset on esitetty seuraavassa kuvassa.

Seuraavat kuvat havainnollistavat zero-shot teksti-puhe-tulokset meluisilla vihjeillä ja erittäin meluisilla vihjeillä.

Lopputajat

Tässä artikkelissa olemme puhuneet HierSpeech++-mallista, joka on uusi lähestymistapa robustille ja tehokkaalle puheen synteesille zero-shot-tilanteissa, ja yrittää ratkaista nykyisten puheen synteesirunkojen rajoitukset, mukaan lukien riippuvuus suuresta määrästä koulutusdataa, riippuvuus diskreeteistä puheyksiköistä tai esikoulutetusta neuronaalisesta ääni-koodekista, ja taipumus itsestään generoimaan äänilähtöä, joka johtaa robustisuuden puutteeseen ja hitaaseen interferenssinopeuteen. HierSpeech++-malli on täysin rinnakkainen, uusi ja vankka hierarkkinen puheen synteesirunko, joka on tarkoitettu synteettisten puhetta näytteiden luomiseen zero-shot-tilanteissa, ja yrittää tehdä seuraavat avustukset

  • Käyttämällä hierarkkista puheen synteesirunkoa äänen tyylejä ja prosodiaa ohjaamaan ja siirtämään.
  • Mahdollistamalla datan skaalautuvuuden ja korkearesoluutioisen puheen synteesin äänen aalloalueen ylösotamalla 16 kHz:sta 48 kHz:iin.
  • Saavuttamalla ihmisen taso zero-shot-äänen muunnos- ja teksti-puhe-tehtävissä.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.