AI-modeller og plattformer

HierSpeech++ : Hierarkisk Variasjonsinferens for Zero-shot TaleSynthese

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

De nylige utviklingene og fremgangen i evnen til store språkmodeller har spilt en avgjørende rolle i fremgangen av LLM-baserte rammer for audiogenerering og talesyntese, spesielt i nullskuddsettingen. Tradisjonelle talesyntse rammer har vært vitne til betydelige fremgang på grunn av integrering av ytterligere funksjoner som neurale audiokodere for diskret audio og taleenheter. Selv om disse talesyntse rammer leverer tilfredsstillende resultater, er det fortsatt rom for forbedring, da de nåværende LLM-baserte audi rammer har følgende tre største begrensninger

  1. De tenderer til å auto-generere lydutgang som ultimate resulterer i manglende robusthet og langsom interferansehastighet og resulterer i feiluttale, hopping eller gjentakelse.
  2. De tenderer til å over-gjøre på diskrete taleenheter eller forhånds trente neurale audiokodere.
  3. De ofte krever en stor mengde treningsdata.

For å takle problemene nevnt ovenfor, og forbedre evnene til LLM-baserte audi og talesyntse modeller, har utviklere kommet opp med HierSpeech++, en robust og effektiv nullskudd talesynteser for stemme og tekst-til-tale eller TTS-omforminger. HierSpeech++-rammen bygger på læringen fra hierarkiske talesyntse rammer som ikke bare øker robustheten, men også legger til uttrykkskraften til syntetisk taleutgang og også øker naturligheten og talelikheten til kunstig generert tale, selv i en nullskuddsetting.

I denne artikkelen, skal vi snakke om HierSpeech++-rammen i detalj, og se på modellens arkitektur, funksjon og resultater når sammenlignet med andre tekst- og audiogenereringsmodeller. Så la oss begynne.

HierSpeech++ : Hierarkisk Variasjonsinferens for Zero-shot TaleSyntese

HierSpeech++ er en rask, robust og effektiv nullskudd talesyntse ramme som bruker en hierarkisk talesyntse pipeline, og ved å adoptere denne sluttløse talesyntse rammen, er HierSpeech++-modellen i stand til å maksimere potensialet for høykvalitets bølgeformgenerering til å hierarkisk å bridge gapet mellom semantiske og akustiske representasjoner ved å adoptere en selv-overvåket talerepresentasjon som en semantisk talerepresentasjon, og dermed forsøker å løse de nåværende begrensningene til stiltilpasninger. Den sluttløse talesyntse rammen ble først introdusert av VITS-modellen, og den adopterer en VAE eller VariasjonsAutoEncoder med adversarial trening og normaliserende flyt. Videre, VAE-baserte rammer med en sluttløs treningspipeline har evnen til å generere høykvalitets bølgeformaudio med perceptuell talesyntse kvalitet som er betydelig bedre enn de som genereres av andre talesyntse rammer.

Den audio-gjenopbyggingskvaliteten til disse rammer kan forbedres videre ved å bruke en hierarkisk betinget VariasjonsAutoEncoder som brukes i HierSpeech-rammen. Til tross for deres potensial, har sluttløse treningspipeline-baserte modeller visse begrensninger, spesielt i en nullskuddsetting, da selv om de kan syntetisere talesprøver med høykvalitets audio, er talelikheten i nullskudd stemme-kloning oppgaver fortsatt preget av høy beregningskompleksitet. På den andre siden,

For å takle problemene som møter sine forgjengere, bruker HierSpeech++-modellen en hierarkisk talesynteser, en tale-super-resolusjon og en tekst-til-vec komponent, og introduserer en forbedret hierarkisk talesynteser bygget på den hierarkiske betingede VAE eller VariasjonsAutoEncoder. I et forsøk på å forbedre lydkvaliteten utover den perceptuelle kvaliteten, adopterer HierSpeech++-rammen en dual-audio for å øke den akustiske posterior, og forbedrer ut av distribusjons generalisering ved å bruke en hierarkisk adaptiv generator utstyrt med både betinget og ubetinget generering. Videre, for å løse talekomponenter og forbedre tale-relatert og tale-agnostisk semantisk informasjon, adopterer HierSpeech++-rammen også en kilde-filter teori-basert multi-path semantisk encoder. Som et resultat av å bruke en VariasjonsAutoEncoder, kan HierSpeech++-modellen koble og lære representasjoner hierarkisk, og progressivt tilpasse seg mål-stemestilen for å inferere bølgeformaudio.

Totalt sett, er HierSpeech++-modellen en fullstendig parallell, ny og robust hierarkisk talesyntse ramme rettet mot å syntetisere talesprøver i en nullskuddsetting, og forsøker å gjøre følgende bidrag

  • Bruke en hierarkisk talesyntse ramme for å kontrollere og overføre stemmestiler og prosodi.
  • Aktivere data-skalerbarhet og høyoppløselig talesyntese ved å oppsamle bølgeformaudio fra 16 til 48 kHz.
  • Oppnå menneske-nivå evne over nullskudd stemme-omforming og tekst-til-tale oppgaver.

HierSpeech++ : Modellkomponenter og Arkitektur

Som diskutert, er HierSpeech++ en nullskudd talesyntse modell som forsøker å oppnå menneske-nivå nøyaktighet i talelikhet og naturlighet.

HierSpeech++-modellen består av ulike komponenter, inkludert en hierarkisk talesynteser, en tale-super-resolusjon og en tekst-til-vec til TTV som fungerer i samspill med hverandre for å fasilitere treningsmodellen som kan effektivt utnytte en stor mengde lavoppløselig talesdata for stemme-kloning. La oss bryte ned rammen og snakke om hver komponent.

TaleRepresentasjoner

Da det menneskelige frekvensbåndet er under 4 kHz, for talesyntese, nedprøver HierSpeech++-rammen audioen til 16 kHz. Videre, for å rekonstruere stemmesignalet, er det viktig å bruke minst dobbelt den høyeste komponenten av stemmefrekvensen i tillegg til å nedprøve audioen. For å oppnå forbedret perceptuell kvalitet, bruker HierSpeech++-rammen en tale-super-resolusjon eller SpeechSR-komponent for å oppsamle audioen fra 16 til 48 kHz, og bruker lavoppløselige representasjoner for semantiske og akustiske representasjoner.

For akustiske representasjoner, bruker en tradisjonell tekst-til-tale eller TTS-ramme en Mel-spectrogram som sin midlertidige akustiske funksjon som deretter transformeres fra bølgeformen med hjelp av en STFT eller Short-Time Fourier Transform. Det er imidlertid verdt å merke seg at siden akustiske funksjoner er rike representasjoner som omfatter ulike attributter, inkludert innhold og uttale, stemmeinformasjon og mer, gjør det vanskelig for rammen å inferere disse representasjoner, en situasjon som ofte fører til feiluttale, manglende likhet eller over-smoothing av tale.

Videre, for å ekstrahere en kontinuerlig semantisk representasjon fra en bølgeform, bruker HierSpeech++-rammen en Wav2Vec-ramme i motsetning til den populære selv-overvåkede tale-representasjons tilnærmingen for semantiske representasjoner. Selv om tilnærmingen gjør en god alternativ for en rik monolingual modell, påvirker den nullskudd stemme-kloning evnene til modellen i begge robusthet og uttrykkskraft, spesielt på multilinguale talesyntse oppgaver.

Hierarkisk Talesynteser

Hierarkisk Talesynteser-komponenten er grunnstenen for HierSpeech++-rammen, da den tillater treningsmodulen uten å bruke noen merker som tekst-transkripter eller stemme-id, og kun basert på talesdata. For å øke den akustiske kapasiteten, erstattet tidligere state-of-the-art talesyntse modeller Mel-spectrogrammet med en lineær spectrogram, men tilnærmingen minimiserer KL-divergensen i forhold til tone-periodisitet, PESQ, stemme- og ikke-stemme-score, og selv Mel-spectrogram-avstand. Hierarkisk Talesynteser bruker en Dual-audio Akustisk Encoder for å løse utfordringene presentert ved å bruke en lineær spectrogram designet for å fange rikere og mer omfattende akustiske representasjoner. Rammen bruker også en bølgeform-encoder for å destillere informasjon fra en rå bølgeform-audio, og konkatenerer det med den lineære spectrogram-representasjonen, og projiserer deretter den akustiske representasjonen som en konkateneringsrepresentasjon.

Videre, for å takle tale-agnostiske og tale-relaterte semantiske representasjoner, bruker HierSpeech++-rammen en multi-path selv-overvåket tale-representasjon hvor hver enkelt representasjon brukes for hierarkisk stiltilpasning med de semantiske representasjoner som ekstraheres for å få lingvistisk informasjon fra midt-laget av MMS. Rammen bruker også en grunnfrekvens for å forbedre tale-løsning som muliggjør manuell kontroll over tone-konturen. Rammen bruker også en lingvistisk representasjon som betinget informasjon for å generere bølgeform-audio hierarkisk, og bruker en forbedret lingvistisk representasjon av den selv-overvåkede representasjonen. Det er også verdt å merke seg at de akustiske representasjoner som ekstraheres under treningsprosessen ved å bruke en bølgeform og lineær spectrogram, brukes for å rekonstruere den rå bølgeform-audio, og en hierarkisk variasjonsinferens brukes for å koble den akustiske representasjonen med den multi-path lingvistiske representasjonen. Rammen bruker også en

Tekst til Vec

For tekst-til-tale syntese, bruker HierSpeech++-rammen en tekst-til-vec eller TTV-modell som genererer en grunnfrekvens og en semantisk representasjon fra en tekstsekvens, og bruker en monotonisk alignmentsøkning koblet med en variasjonsautoencoder for å justere tale og tekst internt. HierSpeech++-rammen erstatter deretter den lineære spectrogrammen med en selv-overvåket lineær representasjon, og rekonstruerer samme representasjon for å fungere som utgangen for TTV.

Videre, for å forbedre semantisk informasjon, forutsier HierSpeech++-rammen grunnfrekvensen med fire ganger større oppløsning enn selv-overvåkede tale-representasjoner, og bruker en betinget tekst-representasjon som prior-informasjon. Som et resultat av den semantiske informasjonen til selv-overvåkede tale-representasjoner, er rammen i stand til å overføre prosodi-stilen i tekst-til-vec modellen, og matet en latent representasjon til fonem-encoderen for å forbedre de lingvistiske evnene til representasjonen.

TaleSR eller Tale Super Resolusjon

HierSpeech++-rammen trenes på en relativt lavoppløselig datasett i forhold til data-effektivitet og tilgjengelighet, og oppsampler en lavoppløselig tale-bølgeform til en høyoppløselig tale-bølgeform fra 16 til 48 kHz. Rammen erstatter også en transponert konvolusjon med den nærmeste nabo-opp-samleren som tidligere har vært kjent for å lette artefakter som et resultat av transponerte konvolusjoner.

Arkitektur

Innhold-encoderen til tekst-til-vec modellen består av 16 ikke-kasuelle WaveNet-lag med en kernel-størrelse på 5 og en skjult størrelse på 256, mens innhold-decoderen består av 8 ikke-kasuelle WaveNet-lag med en kernel-størrelse på 5 og en skjult størrelse på 512. Tekst-encoder-komponenten består av tre prosodi-betingede Transformer-nettverk og tre ubetingede Transformer-nettverk med en kernel-størrelse på 9, filter-størrelse på 1024 og en skjult størrelse på 256 med tekst-encoderen som har en dropout-rate på 0,2. For å kode nærliggende informasjon og forbedre prosodi-stiltilpasning, adopterer rammen en CNN med en kernel-størrelse på 5 i Transformer-blokkene. TaleSR på den andre siden består av en enkelt AMP-blokk med 32 initielle kanaler uten noen oppsamling-lag. Rammen bruker en nærmeste nabo-opp-samler for å oppsamle de skjulte representasjonene og bruker en MPD som diskriminatoren med seks forskjellige vindu-størrelser og fire sub-bånd diskriminatorene.

Figuren ovenfor demonstrerer inferens-pipeline til HierSpeech++-rammen som starter med å ekstrahere semantiske representasjoner fra audioen ved en frekvens på 16 kHz og ved grunnfrekvensen ved å bruke YAPPT-algoritmen. Før grunnfrekvensen kan mates til Hierarkisk Synthesizer, er den normalisert ved å bruke standard- og middelavvik fra kilde-audioen, og den normaliserte grunnfrekvensen er deretter denormalisert ved å bruke standard- og middelavvik fra mål-audioen. For tekst-til-tale-ekstraksjon, bruker HierSpeech++-rammen tekst-representasjoner i stedet for tale-representasjoner og bruker tekst-til-vec modellen for å generere en semantisk representasjon fra prosodi-prompten.

Eksperiment og Resultater

Rammen bruker den offentlig tilgjengelige LibriTTS-datasett for å trene den hierarkiske synthesizer-komponenten med den første steget som er å trene modellen med trainclean-undersettene av datasett og å bruke resten av dataene for å aktivere forbedret overføring av stemmestilen. Videre, for å forbedre mangfold og robusthet, skalerer rammen opp datasett til 1 kHz som demonstrert i figuren nedenfor.

Rekonstruksjon, Resyntese-oppgaver og Stemme-omforming

For å evaluere prestasjonen til HierSpeech++-rammen på rekonstruksjon og resyntese-oppgaver, utførte utviklerne syv objektive metrikker, og resultater demonstreres i figurene nedenfor for rekonstruksjon og resyntese-oppgaver.

For stemme-omforming oppgaver, bruker rammen to subjektive metrikker for evaluering: stemme-likhet MOS eller sMOS og naturlighet gjennomsnittlig mening-score eller nMOS med tre naturlige objektive metrikker og to likhets objektive metrikker.

Videre, er det primære målet til HierSpeech++-rammen å aktivere nullskudd talesyntese, og for å evaluere dens prestasjon i nullskudd, sammenlignes den mot andre basis-modeller som AutoVC, VoiceMixer,

Figurene nedenfor demonstrerer

Slutt tanker

I denne artikkelen, har vi snakket om HierSpeech++-modellen, en ny tilnærming for å aktivere robust og effektiv talesyntese i en nullskuddsetting, og overvinne begrensningene som møter nåværende talesyntse rammer, inkludert deres over-avhengighet av store mengder treningsdata, avhengighet av diskrete tale-enheter eller forhånds-trente neurale audiokodere og deres tendens til å auto-generere lyd-utgang som ultimate resulterer i manglende robusthet og langsom interferanse-hastighet og resulterer i feiluttale, hopping eller gjentakelse. HierSpeech++-modellen er en fullstendig parallell, ny og robust hierarkisk talesyntse ramme rettet mot å syntetisere talesprøver i en nullskuddsetting, og forsøker å gjøre følgende bidrag

  • Bruke en hierarkisk talesyntse ramme for å kontrollere og overføre stemmestiler og prosodi.
  • Aktivere data-skalerbarhet og høyoppløselig talesyntese ved å oppsamle bølgeform-audio fra 16 til 48 kHz.
  • Oppnå menneske-nivå evne over nullskudd stemme-omforming og tekst-til-tale oppgaver.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.