AI-modeller og platforme
HierSpeech++ : Hierarkisk Variational Inferens til Zero-shot Tale-Syntese
De seneste udviklinger og fremskridt i større sprogmodellers evner har spillet en afgørende rolle i fremgangen for LLM-baserede rammer til audio-generering og tale-synteseopgaver, især i zero-shot-sammenhæng. Traditionelle tale-syntese-rammer har oplevet betydelige fremskridt som følge af integration af yderligere funktioner som neurale audio-codecs til diskret audio og tale-enheder. Selvom disse tale- og audio-syntese-rammer leverer tilfredsstillende resultater, er der stadig plads til forbedring, da de nuværende LLM-baserede audio-rammer har følgende tre store begrænsninger
- De har tendens til at auto-generere audio-udgang, der ultimativt resulterer i mangel på robusthed og langsom interferenshastighed og resulterer i misudtal, spring eller gentagelse.
- De har tendens til at over-afhænge af diskrete tale-enheder eller forudtrænede neurale audio-codecs.
- De kræver ofte en stor mængde træningsdata.
For at tacklede problemerne ovenfor og forbedre evnerne for LLM-baserede audio- og tale-syntese-modeller, har udviklere lavet HierSpeech++, en robust og effektiv zero-shot tale-syntese-ramme til stemme- og tekst-til-tale-konverteringer. HierSpeech++-rammen bygger på læringen fra hierarkiske tale-syntese-rammer, der ikke kun øger robustheden, men også tilføjer udtryksfuldhed til syntetisk tale-udgang og øger naturligheden og taler-ligheden af kunstigt genereret tale, selv i en zero-shot-sammenhæng.
I denne artikel vil vi tale om HierSpeech++-rammen i detaljer og se på modellens arkitektur, funktionsmåde og resultater i sammenligning med state-of-the-art tekst- og audio-genereringsmodeller. Så lad os komme i gang.
HierSpeech++ : Hierarkisk Variational Inferens til Zero-shot Tale-Syntese
HierSpeech++ er en hurtig, robust og effektiv zero-shot tale-syntese-ramme, der bruger en hierarkisk tale-syntese-pipeline, og ved at antage denne slut-til-slut tale-syntese-ramme, kan HierSpeech++-modellen maksimere potentialet for høj-kvalitets bølgeform-generering til at brobygge mellem semantiske og akustiske repræsentationer ved at antage en selv-superviseret tale-repræsentation som en semantisk tale-repræsentation, og således forsøge at løse de nuværende begrænsninger for stil-tilpasninger. Den slut-til-slut tale-syntese-ramme blev først introduceret af VITS-modellen, og den antager en VAE eller Variational Auto-Encoder med adversarial træning og normaliserende flow. Desuden har VAE-baserede rammer med en slut-til-slut trænings-pipeline evnen til at generere høj-kvalitets bølgeform-audio med en perceptuel tale-syntese-kvalitet, der er betydeligt bedre end dem, der genereres af andre tale-syntese-rammer.
Kvaliteten af audio-rekonstruktion for disse rammer kan yderligere forbedres ved at bruge en hierarkisk betinget Variational AutoEncoder, som bruges i HierSpeech-rammen. Trods deres potentiale har modeller med en slut-til-slut trænings-pipeline visse begrænsninger, især i en zero-shot-sammenhæng, selvom de kan syntetisere tale-prøver med høj-kvalitets audio, er taler-ligheden i zero-shot stemme-kloning-opgaver stadig omgivet af høj beregningskompleksitet. På den anden side performer diffusion-baserede tale-syntese-modeller godt i forhold til taler-tilpasninger, men de er stadig langt fra perfekte, da de bruger en interaktiv generations-proces, der langsomerer deres inferens-hastighed, de er ofte sårbare over for støjende data, og som følge af misforholdet mellem træning og inferens af de to-trins generations-proces mellem Mel-spectrogram og genereret grund-sandhed er audio-kvaliteten ikke op til mærket.
For at tacklede problemerne, som forgængerne havde, bruger HierSpeech++-modellen en hierarkisk tale-syntetisator, en tale-super-resolution og en tekst-til-vec-komponent, og introducerer en forbedret hierarkisk tale-syntetisator bygget på den hierarkiske betingede VAE eller Variational AutoEncoder. I et forsøg på at forbedre audio-kvaliteten ud over den perceptuelle kvalitet, antager HierSpeech++-rammen en dual-audio for at booste den akustiske posterior, og forbedrer ud af distributions-generalisering ved at bruge en hierarkisk adaptiv generator udstyret med både betinget og ubetinget generation. Desuden til at afkoble tale-komponenter og forbedre taler-relateret og taler-agnostisk semantisk information, bruger HierSpeech++-rammen også en kilde-filter-teori-baseret multi-path semantisk encoder. Som følge af at bruge en Variational AutoEncoder, kan HierSpeech++-modellen forbinde og lære repræsentationer hierarkisk og progressivt tilpasse sig mål-stemme-stilen for at slutte waveform-audio. Desuden bruger HierSpeech++-rammen også en bidirectional netværk af normaliserende flow-Transformere i et forsøg på at forbedre tilpasning og reducere misforholdet mellem træning og inferens.
Samlet set er HierSpeech++-modellen en fuldt-parallell, ny og robust hierarkisk tale-syntese-ramme, der sigter mod at syntetisere tale-prøver i en zero-shot-sammenhæng, og forsøger at bidrage med følgende
- At bruge en hierarkisk tale-syntese-ramme til at kontrollere og overføre stemme-stilarter og prosodi.
- At aktivere data-skalerbarhed og højopløst tale-syntese ved at opsample waveform-audio fra 16 til 48 kHz.
- At opnå menneske-niveau-evne på tværs af zero-shot stemme-konvertering og tekst-til-tale-opgaver.
HierSpeech++ : Model Komponenter og Arkitektur
Som diskuteret, er HierSpeech++ en zero-shot tale-syntese-model, der forsøger at opnå menneske-niveau-nøjagtighed i forhold til stemme-lighed og tale-naturlighed.

HierSpeech++-modellen består af forskellige komponenter, herunder en hierarkisk tale-syntetisator, en tale-super-resolution og tekst-til-vec til TTV, der arbejder sammen for at facilitere træningen af hver model, der kan effektivt udnytte en stor mængde lavopløst tale-data til stemme-kloning. Lad os bryde rammen ned og tale om hver komponent.
Tale-Repræsentationer
Da det menneskelige frekvens-bånd er under 4 kHz, er det for tale-syntese vigtigt at bruge en ned-sampling af audio på 16 kHz. Desuden er det vigtigt at bruge mindst dobbelt den højeste komponent af tale-frekvens samt ned-sampling af audio-prøven for at genskabe stemme-signalet. For at opnå forbedret perceptuel kvalitet, bruger HierSpeech++-rammen en tale-super-resolution eller SpeechSR-komponent til at opsample audio-prøven fra 16 til 48 kHz og bruger lavopløste repræsentationer for semantiske og akustiske repræsentationer.

For akustiske repræsentationer, bruger en traditionel tekst-til-tale-ramme en Mel-spectrogram som sin intermediate akustiske funktion, der derefter transformeres fra waveform med hjælp af en STFT eller Short-Time Fourier Transform. Det er dog værd at bemærke, at da akustiske funktioner er rige repræsentationer, der består af forskellige attributter, herunder indhold og udtale, stemme-information og mere, gør det svært for rammen at slutte disse repræsentationer, en situation, der ofte fører til misudtal, mangel på lighed eller over-smoothing af tale.
Ved at fortsætte, til at trække en kontinuierlig semantisk repræsentation fra en waveform, bruger HierSpeech++-rammen en Wav2Vec-ramme i modsætning til den populære selv-superviserede tale-repræsentations-tilgang for semantiske repræsentationer. Selvom tilgangen giver en god alternativ til en rig monolingual model, påvirker den zero-shot stemme-kloning-evnerne af en model i forhold til både robusthed og udtryksfuldhed, især på multilinguale tale-syntese-opgaver.
Hierarkisk Tale-Syntetisator
Den hierarkiske tale-syntetisator-komponent er grundstenen for HierSpeech++-rammen, da den tillader træning af modulen uden at bruge nogen mærker som tekst-transkriptioner eller stemme-id, og kun afhænger af tale-data. For at øge den akustiske kapacitet, erstattede tidligere state-of-the-art tale-syntese-modeller Mel-spectrogrammet med et lineært spectrogram, men tilgangen minimiserer KL-divergens-scoren i forhold til tone-periodicitet, PESQ, stemme og u-stemme-score og selv Mel-spectrogram-afstand. Den hierarkiske tale-syntetisator bruger en dual-audio akustisk encoder til at løse udfordringerne, der følger med at bruge et lineært spectrogram, designet til at fange rigere og mere omfattende akustiske repræsentationer. Rammen bruger også en waveform-encoder til at destillere information fra en rå waveform-audio og konkatenerer det med det lineære spectrogram-repræsentation og projekterer derefter den akustiske repræsentation som en konkateneret repræsentation.

Desuden til at håndtere taler-agnostiske og taler-relaterede semantiske repræsentationer, bruger HierSpeech++-rammen en multi-path selv-superviseret tale-repræsentation, hvor hver enkelt repræsentation bruges til hierarkisk stil-tilpasning med de semantiske repræsentationer, der trækkes til at få linguistisk information fra midten af MMS. Rammen bruger også en grundfrekvens til at forbedre tale-afkobling, der giver mulighed for at kontrollere tone-konturen manuelt. Rammen bruger også en linguistisk repræsentation som betinget information til at generere waveform-audio hierarkisk og bruger en forbedret linguistisk repræsentation af den selv-superviserede repræsentation. Det er også værd at bemærke, at de akustiske repræsentationer, der trækkes under træning ved at bruge en waveform og et lineært spectrogram, bruges til at genskabe den rå waveform-audio, og en hierarkisk variational inferens bruges til at forbinde de akustiske repræsentationer med de multi-path linguistiske repræsentationer. Rammen bruger også en hierarkisk adaptiv generator (HAG) til at generere semantisk-til-waveform-prøver, og de genererede repræsentationer, der består af en stil-repræsentation og en akustisk repræsentation, føres til kilde- og waveform-generatorene.
Tekst til Vec
For tekst-til-tale-syntese, bruger HierSpeech++-rammen en tekst-til-vec eller TTV-model, der genererer en grundfrekvens og en semantisk repræsentation fra en tekst-sekvens, og bruger en monotonisk alignments-søgning kombineret med en variational autoencoder til at aligne tale og tekst internt. HierSpeech++-rammen erstatter derefter det lineære spectrogram med en selv-superviseret lineær repræsentation og genskaber derefter samme repræsentation til at fungere som output for TTV.

Desuden forudser HierSpeech++-rammen grundfrekvensen med fire gange større opløsning i forhold til de selv-superviserede tale-repræsentationer og bruger en betinget tekst-repræsentation som prior-information. Som følge af den semantiske information af selv-superviserede tale-repræsentationer, kan rammen overføre prosodi-stilen i tekst-til-vec-modellen og føder en latent repræsentation til fonem-encoderen til at forbedre de linguistiske evner af repræsentationen.
Tale-SR eller Tale-Super-Resolution
HierSpeech++-rammen træner på en relativt lavopløst dataset i forhold til data-effektivitet og tilgængelighed og op-sampler en lavopløst tale-waveform til en højopløst tale-waveform fra 16 til 48 kHz. Rammen erstatter også en transponeret convolution med den nærmeste nabo-opsampler, der tidligere er kendt for at lette artefakter som følge af transponerede convolutioner.

Arkitektur
Indhold-encoderen i tekst-til-vec-modellen består af 16 ikke-kasuelle WaveNet-lag med en kernel-størrelse på 5 og en skjult størrelse på 256, mens indhold-decoderen består af 8 ikke-kasuelle WaveNet-lag med en kernel-størrelse på 5 og en skjult størrelse på 512. Tekst-encoder-komponenten består af tre prosodi-betingede Transformer-netværk og tre ubetingede Transformer-netværk med en kernel-størrelse på 9, filter-størrelse på 1024 og en skjult størrelse på 256 med en dropout-rate på 0,2. For at kodificere nærliggende information og forbedre prosodi-stil-tilpasning, bruger rammen en CNN med en kernel-størrelse på 5 i Transformer-blokke. Tale-SR består af en enkelt AMP-blok med 32 initial-kanaler uden en opsampling-lag. Rammen bruger en nærmeste nabo-opsampler til at opsample de skjulte repræsentationer og bruger en MPD som diskriminator med seks forskellige vindue-størrelser og fire sub-bånd-diskriminatore.

Figuren ovenfor demonstrerer inferens-pipeline for HierSpeech++-rammen, der starter med at trække semantiske repræsentationer fra audio på en frekvens på 16 kHz og på grundfrekvensen ved at bruge YAPPT-algoritmen. Før grundfrekvensen kan føres til den hierarkiske syntetisator, normaliseres den ved at bruge standard- og middel-afvigelserne for kilde-audio, og den normaliserede grundfrekvens kan derefter de-normaliseres ved at bruge standard- og middel-afvigelserne for mål-audio. For tekst-til-tale-ekstraktioner, trækker HierSpeech++-rammen tekstuelle repræsentationer i stedet for tale-repræsentationer og bruger tekst-til-vec-modellen til at generere en semantisk repræsentation fra prosodi-prompten.
Eksperiment og Resultater
Rammen bruger den offentligt tilgængelige LibriTTS-dataset til at træne den hierarkiske syntetisator-komponent med den første trin, der er at træne modellen med trainclean-undermængder af datasettet, og bruger den resterende data til at aktivere forbedret overføring af stemme-stilen. Desuden til at forbedre diversitet og robusthed, opskalerer rammen datasettet til 1 kHz, som demonstreret i følgende figur.

Rekonstruktion, Resyntese-opgaver og Stemme-Konvertering
For at evaluere HierSpeech++-rammens præstation på rekonstruktion og resyntese-opgaver, har udviklerne gennemført syv objektive metrikker, og resultaterne demonstreres i følgende figurer for rekonstruktion og resyntese-opgaver.


For stemme-konverterings-opgaver, bruger rammen to subjektive metrikker til evaluering: stemme-lighed MOS eller sMOS og naturlighed gennemsnitlig mening-score på nMOS med tre naturlighed-objektive metrikker og to ligheds-objektive metrikker.

Ved at fortsætte, er det primære mål for HierSpeech++-rammen at aktivere zero-shot tale-syntese, og for at evaluere dens præstation i zero-shot, sammenlignes den med andre baser-modeller som AutoVC, VoiceMixer, diffusion-baserede modeller og mange flere, med resultaterne demonstreret i følgende figur.

Følgende figurer demonstrerer zero-shot tekst-til-tale resultater med støjende prompts og meget støjende prompts.


Endelige Tanker
I denne artikel har vi talt om HierSpeech++-modellen, en ny tilgang til at aktivere robust og effektiv tale-syntese i en zero-shot-sammenhæng og overvinde begrænsningerne, der er forbundet med nuværende tale-syntese-rammer, herunder deres over-afhængighed af store mængder træningsdata, afhængighed af diskrete tale-enheder eller forudtrænede neurale audio-codecs og deres tendens til at auto-generere audio-udgang, der ultimativt resulterer i mangel på robusthed og langsom interferenshastighed og resulterer i misudtal, spring eller gentagelse. HierSpeech++-modellen er en fuldt-parallell, ny og robust hierarkisk tale-syntese-ramme, der sigter mod at syntetisere tale-prøver i en zero-shot-sammenhæng, og forsøger at bidrage med følgende
- At bruge en hierarkisk tale-syntese-ramme til at kontrollere og overføre stemme-stilarter og prosodi.
- At aktivere data-skalerbarhed og højopløst tale-syntese ved at opsample waveform-audio fra 16 til 48 kHz.
- At opnå menneske-niveau-evne på tværs af zero-shot stemme-konvertering og tekst-til-tale-opgaver.












