AI-modellen en platforms

HierSpeech++ : Hiërarchische Variational Inference voor Zero-shot Speech Synthese

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

De recente ontwikkelingen en de vooruitgang in de mogelijkheden van grote taalmodellen hebben een cruciale rol gespeeld in de vooruitgang van LLM-gebaseerde kaders voor audiogeneratie en spraaksynthese, vooral in de zero-shot-instelling. Traditionele spraaksynthesekaders hebben aanzienlijke vooruitgang geboekt als gevolg van het integreren van extra functies zoals neurale audiocodecs voor discreet audio en spraakeenheden. Hoewel deze spraak- en audiogenese-kaders bevredigende resultaten opleveren, is er nog steeds ruimte voor verbetering, aangezien de huidige LLM-gebaseerde audiokaders de volgende drie belangrijke beperkingen hebben

  1. Ze hebben de neiging om automatisch audio-uitvoer te genereren die uiteindelijk leidt tot een gebrek aan robuustheid en langzame interferentiesnelheden en resulteert in mispronunciatie, overslaan of herhalen.
  2. Ze hebben de neiging om te veel te vertrouwen op discrete spraakeenheden of vooraf getrainde neurale audiocodecs.
  3. Ze vereisen vaak een grote hoeveelheid trainingsgegevens.

Om de bovengenoemde problemen aan te pakken en de mogelijkheden van LLM-gebaseerde audiogenese- en spraaksynthesemodellen te verbeteren, hebben ontwikkelaars HierSpeech++ gemaakt, een robuust en efficiënt zero-shot spraaksynthesizer voor stem- en tekst-naar-spraak- of TTS-omzettingen. Het HierSpeech++-kader is gebaseerd op de kennis van hiërarchische spraaksynthesekaders die niet alleen de robuustheid verhogen, maar ook de expressiviteit van synthetische spraakuitvoer verhogen, evenals de natuurlijkheid en sprekerovereenkomst van kunstmatig gegenereerde spraak, zelfs in een zero-shot-instelling.

In dit artikel zullen we het HierSpeech++-kader in detail bespreken en een kijk nemen op de architectuur, werking en resultaten van het model in vergelijking met state-of-the-art tekst- en audiogenese-modellen. Laten we beginnen.

HierSpeech++ : Hiërarchische Variational Inference voor Zero-shot Speech Synthese

Het HierSpeech++ is een snel, robuust en efficiënt zero-shot spraaksynthesekader dat een hiërarchische spraaksynthesepijplijn gebruikt, en door het gebruik van deze eind-tot-eind spraaksynthesekader, kan het HierSpeech++-model het potentieel van hoge-kwaliteit waveformgeneratie maximaliseren om de kloof tussen semantische en akoestische representaties te overbruggen door het gebruik van een zelfsuperviserende spraakrepresentatie als semantische spraakrepresentatie, en probeert zo de huidige beperkingen van stijlaanpassingen op te lossen. Het eind-tot-eind spraaksynthesekader werd voor het eerst geïntroduceerd door het VITS-model, en het maakt gebruik van een VAE of Variational Auto-Encoder met adversariale training en normaliserende flow. Bovendien hebben VAE-gebaseerde kaders met een eind-tot-eind trainingspijplijn de mogelijkheid om hoge-kwaliteit waveformaudio te genereren met een perceptuele spraaksynthese-kwaliteit die aanzienlijk beter is dan die gegenereerd door andere spraaksynthesekaders.

De audioreconstructiekwaliteit van deze kaders kan verder worden verbeterd door het gebruik van een hiërarchische conditionele Variational AutoEncoder, zoals gebruikt in het HierSpeech-kader. Ondanks hun potentieel hebben eind-tot-eind trainingspijplijn-gebaseerde modellen bepaalde beperkingen, vooral in een zero-shot-instelling, aangezien ze, zelfs als ze spraakmonsters met hoge kwaliteit kunnen synthetiseren, de sprekerovereenkomst in zero-shot stemkloon-taken nog steeds wordt geplaagd door hoge computationele complexiteit. Aan de andere kant

Om de problemen van zijn voorgangers aan te pakken, maakt het HierSpeech++-model gebruik van een hiërarchische spraaksynthesizer, een spraaksuperresolutie en een tekst-naar-vec-component, en introduceert een verbeterde hiërarchische spraaksynthesizer gebaseerd op de hiërarchische conditionele VAE of Variational AutoEncoder. In een poging om de audiokwaliteit te verbeteren tot verder dan de perceptuele kwaliteit, maakt het HierSpeech++-kader gebruik van een dubbele audio om de akoestische posterior te verhogen, en verbetert de generalisatie buiten de distributie door het gebruik van een hiërarchische adaptieve generator die zowel conditionele als onconditionele generatie heeft. Bovendien maakt het HierSpeech++-kader gebruik van een bron-filtertheorie-gebaseerde multi-path semantische encoder om spraakcomponenten te ontwarren en spreker-gerelateerde en spreker-agnostische semantische informatie te verbeteren. Als gevolg van het gebruik van een Variational AutoEncoder, kan het HierSpeech++-model verbindingen maken en representaties leren hiërarchisch, en zich progressief aanpassen aan de doelstemstijl om de waveformaudio af te leiden. Bovendien maakt het HierSpeech++-kader gebruik van een bidirectionele netwerk van normaliserende flow-Transformers om de aanpassing te verbeteren en de mismatch tussen training en inferentie te verminderen.

Over het algemeen is het HierSpeech++-model een volledig parallel, nieuw en robuust hiërarchisch spraaksynthesekader dat is gericht op het synthetiseren van spraakmonsters in een zero-shot-instelling, en probeert de volgende bijdragen te leveren

  • Het gebruik van een hiërarchisch spraaksynthesekader om stemstijlen en prosodie te controleren en over te dragen.
  • Het mogelijk maken van gegevensschalabiliteit en hoge-resolutie spraaksynthese door de waveformaudio van 16 tot 48 kHz op te schalen.
  • Het bereiken van menselijke vaardigheid bij zero-shot stemomzetting en tekst-naar-spraak-taken.

HierSpeech++ : Modelcomponenten en Architectuur

Zoals besproken, is HierSpeech++ een zero-shot spraaksynthesemodel dat probeert om menselijke precisie te bereiken in termen van stemovereenkomst en spraaknatuurlijkheid.

Het HierSpeech++-model bestaat uit verschillende componenten, waaronder een hiërarchische spraaksynthesizer, een spraaksuperresolutie en een tekst-naar-vec naar TTV die samenwerken om de training van elk model te faciliteren dat effectief een grote hoeveelheid laagresolutie-spraakgegevens kan gebruiken voor stemkloning. Laten we het kader uiteenrafelen en praten over elke component.

Spraakrepresentaties

Aangezien de menselijke frequentieband onder de 4 kHz ligt, is het voor spraaksynthese noodzakelijk om de audio op 16 kHz af te monstersen. Bovendien is het voor het reconstrueren van de stemsignaal noodzakelijk om ten minste tweemaal de hoogste component van de stemfrequentie te gebruiken, naast het afmonstersen van de audiosample. Om een verbeterde perceptuele kwaliteit te bereiken, maakt het HierSpeech++-kader gebruik van een spraaksuperresolutie- of SpeechSR-component om de audiosample van 16 tot 48 kHz op te schalen, en maakt gebruik van laagresolutie-representaties voor semantische en akoestische representaties.

Voor akoestische representaties gebruikt een traditioneel tekst-naar-spraak- of TTS-kader een Mel-spectrogram als zijn tussenliggende akoestische functie die vervolgens wordt getransformeerd van de waveform met behulp van een STFT of Short-Time Fourier Transform. Het is echter de moeite waard om op te merken dat, aangezien akoestische functies rijke representaties zijn die verschillende attributen omvatten, waaronder inhoud en uitspraak, steminformatie en meer, het voor het kader moeilijk is om deze representaties af te leiden, een situatie die vaak leidt tot mispronunciaties, gebrek aan overeenkomst of over- gladmaking van de spraak.

Verder, om een continue semantische representatie van een waveform te extraheren, maakt het HierSpeech++-kader gebruik van een Wav2Vec-kader in tegenstelling tot de populaire zelfsuperviserende spraakrepresentatiebenadering voor semantische representaties. Hoewel deze benadering een goede alternatief is voor een rijke monolinguale model, beïnvloedt het de zero-shot stemkloon-mogelijkheden van een model in termen van zowel robuustheid als expressiviteit, vooral bij multilinguale spraaksynthesetaken.

Hiërarchische Spraaksynthesizer

De Hiërarchische Spraaksynthesizer-component is de basissteen voor het HierSpeech++-kader, aangezien het toelaat om het module te trainen zonder het gebruik van labels zoals teksttranscripten of spreker-id, en enkel te vertrouwen op spraakgegevens. Om de akoestische capaciteit te verhogen, vervingen voorgaande state-of-the-art spraaksynthesemodellen het Mel-spectrogram met een lineair spectrogram, maar deze benadering minimaliseert de KL-divergentiescore in termen van pitchperiodiciteit, PESQ, stem- en onstemscore, en zelfs Mel-spectrogramafstand. De Hiërarchische Spraaksynthesizer maakt gebruik van een Dubbele Audio Acoustic Encoder om de uitdagingen die worden gepresenteerd door het gebruik van een lineair spectrogram op te lossen, dat is ontworpen om rijkere en meer omvattende akoestische representaties te vangen. Het kader maakt ook gebruik van een waveform-encoder om informatie te destilleren van een ruwe waveform-audio, en concateneert het met de lineaire spectrogramrepresentatie, en projecteert tenslotte de akoestische representatie als een geconcateneerde representatie.

Verder, om te maken met spreker-agnostische en spreker-gerelateerde semantische representaties, maakt het HierSpeech++-kader gebruik van een multi-path zelfsuperviserende spraakrepresentatie waarbij elke individuele representatie wordt gebruikt voor hiërarchische stijlaanpassing met de semantische representaties die worden geëxtraheerd om linguïstische informatie te verkrijgen uit de middelste laag van de MMS. Het kader maakt ook gebruik van een fundamentele frequentie om spraakontwarren te verbeteren, waardoor het mogelijk is om de pitchcontour handmatig te controleren. Het kader maakt ook gebruik van een linguïstische representatie als conditionele informatie om waveform-audio hiërarchisch te genereren, en maakt gebruik van een verbeterde linguïstische representatie van de zelfsuperviserende representatie. Het is ook de moeite waard om op te merken dat de akoestische representaties die tijdens de training worden geëxtraheerd met behulp van een waveform en lineaire spectrogram, worden gebruikt om de ruwe waveform-audio te reconstrueren, en een hiërarchische variatie-inferentie wordt gebruikt om de akoestische representaties te koppelen aan de multi-path linguïstische representaties. Het kader maakt ook gebruik van een hiërarchische adaptieve generator om semantiek-naar-waveform-monsters te genereren, en de gegenereerde representaties, die bestaan uit een stijlrepresentatie en een akoestische representatie, worden gevoerd aan de bron- en waveform-generatoren.

Tekst-naar-Vec

Voor tekst-naar-spraak-synthese maakt het HierSpeech++-kader gebruik van een tekst-naar-vec- of TTV-model dat een fundamentele frequentie en een semantische representatie genereert van een tekstsequentie, en maakt gebruik van een monotonische aligneringzoekopdracht gekoppeld aan een variatie-auto-encoder om de spraak en tekst intern te aligneren. Het HierSpeech++-kader vervangt vervolgens het lineaire spectrogram met een zelfsuperviserende lineaire representatie, en reconstrueert dezelfde representatie om te dienen als de uitvoer voor de TTV.

Bovendien voorspelt het HierSpeech++-kader de fundamentele frequentie met vier keer grotere resoluties in vergelijking met de zelfsuperviserende spraakrepresentaties, en maakt gebruik van een conditionele tekstrepresentatie als prior-informatie. Als gevolg van de semantische informatie van zelfsuperviserende spraakrepresentaties, is het kader in staat om de prosodie-stijl over te dragen in het tekst-naar-vec-model, en voedt een latent-representatie aan de foneme-encoder om de linguïstische capaciteiten van de representatie te verbeteren.

SpraakSR of Spraak Super Resolutie

Het HierSpeech++-kader traint op een relatief laagresolutie-dataset in termen van gegevensefficiëntie en beschikbaarheid, en schaalt een laagresolutie-spraakwaveform op naar een hoogresolutie-spraakwaveform van 16 tot 48 kHz. Het kader vervangt ook een getransponeerde convolutie met de dichtstbijzijnde buur-upsampler die eerder bekend was om artifacts te verlichten als gevolg van getransponeerde convoluties.

Architectuur

De content-encoder van het tekst-naar-vec-model bestaat uit 16 niet-casuele WaveNet-lagen met een kernelgrootte van 5 en een verborgen grootte van 256, terwijl de content-decoder bestaat uit 8 niet-casuele WaveNet-lagen met een kernelgrootte van 5 en een verborgen grootte van 512. De tekst-encoder-component bestaat uit drie prosodie-conditionele Transformer-netwerken en drie onconditionele Transformer-netwerken met een kernelgrootte van 9, filtergrootte van 1024 en een verborgen grootte van 256, met de tekst-encoder die een dropout-rate van 0,2 heeft. Om aangrenzende informatie te coderen en prosodie-stijlaanpassing te verbeteren, maakt het kader gebruik van een CNN met een kernelgrootte van 5 in Transformer-blokken. De SpraakSR daarentegen bestaat uit een enkele AMP-blok met 32 initiële kanalen zonder de aanwezigheid van een upsampling-laag. Het kader maakt gebruik van een dichtstbijzijnde buur-upsampler om de verborgen representaties op te schalen en maakt gebruik van een MPD als de discriminator met zes verschillende venstergroottes en vier sub-band-discriminators.

De bovenstaande figuur toont de inferentiepijplijn van het HierSpeech++-kader, die begint met het extraheren van semantische representaties van de audio op een frequentie van 16 kHz en op de fundamentele frequentie met behulp van de YAPPT-algoritme. Voordat de fundamentele frequentie kan worden gevoerd aan de Hiërarchische Synthesizer, wordt het genormaliseerd met behulp van de standaard- en gemiddelde deviaties van de bron-audio, en de genormaliseerde fundamentele frequentie wordt vervolgens gedeblokkeerd met behulp van de standaard- en gemiddelde deviaties van de doel-audio. Voor tekst-naar-spraak-extractie, extracteert het HierSpeech++-kader tekstuele representaties in plaats van spraakrepresentaties, en maakt gebruik van het tekst-naar-vec-model om een semantische representatie te genereren van de prosodie-prompt.

Experiment en Resultaten

Het kader maakt gebruik van de openbaar beschikbare LibriTTS-dataset om de hiërarchische synthesizer-component te trainen, met de eerste stap die bestaat uit het trainen van het model met de trainclean-subsets van de dataset, en het gebruik van de resterende gegevens om de overdracht van de stemstijl te verbeteren. Bovendien, om de diversiteit en robuustheid te verbeteren, schaalt het kader de dataset op tot 1 kHz, zoals getoond in de volgende figuur.

Reconstructie, Resynthese-taken en Stemomzetting

Om de prestaties van het HierSpeech++-kader te evalueren op reconstructie- en resynthesetaak, voerden ontwikkelaars zeven objectieve metrieken uit, en de resultaten worden getoond in de volgende figuren voor reconstructie- en resynthesetaak respectievelijk.

Voor Stemomzetting-taken, maakt het kader gebruik van twee subjectieve metrieken voor evaluatie: stemovereenkomst MOS of sMOS en natuurlijkheid gemiddelde meningsscore van nMOS met drie natuurlijkheid objectieve metrieken en twee overeenkomst objectieve metrieken.

Verder, het primaire doel van het HierSpeech++-kader is om zero-shot spraaksynthese mogelijk te maken, en om de prestaties ervan in zero-shot te evalueren, wordt het vergeleken met andere basismodellen zoals AutoVC, VoiceMixer, Diffusion-gebaseerde modellen en vele anderen, met de resultaten die worden getoond in de volgende figuur.

De volgende figuren tonen de zero-shot tekst-naar-spraak resultaten met lawaaierige prompts en zeer lawaaierige prompts respectievelijk.

Slotbeschouwingen

In dit artikel hebben we het HierSpeech++-model besproken, een noviteit in de mogelijkheid om robuuste en effectieve spraaksynthese in een zero-shot-instelling te ermöglichen, en de beperkingen van de huidige spraaksynthesekaders te overwinnen, waaronder hun overmatige afhankelijkheid van grote hoeveelheden trainingsgegevens, hun afhankelijkheid van discrete spraakeenheden of vooraf getrainde neurale audiocodecs, en hun neiging om automatisch audio-uitvoer te genereren die uiteindelijk leidt tot een gebrek aan robuustheid en langzame interferentiesnelheden en resulteert in mispronunciatie, overslaan of herhalen. Het HierSpeech++-model is een volledig parallel, nieuw en robuust hiërarchisch spraaksynthesekader dat is gericht op het synthetiseren van spraakmonsters in een zero-shot-instelling, en probeert de volgende bijdragen te leveren

  • Het gebruik van een hiërarchisch spraaksynthesekader om stemstijlen en prosodie te controleren en over te dragen.
  • Het mogelijk maken van gegevensschalabiliteit en hoge-resolutie spraaksynthese door de waveformaudio van 16 tot 48 kHz op te schalen.
  • Het bereiken van menselijke vaardigheid bij zero-shot stemomzetting en tekst-naar-spraak-taken.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.