AI-modeller och plattformar

HierSpeech++ : Hierarkisk Variational Inferens för Zero-shot TalSynthes

mm
Lägg till Unite.AI bland dina föredragna källor på Google

De senaste utvecklingarna och framstegen i stora språkmodellers förmågor har spelat en avgörande roll i framstegen inom ramverk för ljudgenerering och talsyntes baserade på LLM, särskilt i zero-shot-inställningen. Traditionella talsyntesramverk har sett betydande framsteg som ett resultat av integrationen av ytterligare funktioner som neurala ljudkodare för diskret ljud och talfunktioner. Även om dessa talsyntes- och ljudsyntesramverk levererar tillfredsställande resultat, finns det fortfarande utrymme för förbättring eftersom de nuvarande LLM-baserade ljudramverken har följande tre stora begränsningar

  1. De tenderar att auto-generera ljudutdata som slutligen orsakar brist på robusthet och långsam interferenshastighet och resulterar i feluttal, hoppning eller upprepning.
  2. De tenderar att förlita sig för mycket på diskreta talfunktioner eller förtränade neurala ljudkodare.
  3. De kräver ofta en stor mängd träningsdata.

För att tackla de problem som nämns ovan och förbättra förmågan hos LLM-baserade ljud- och talsyntesmodeller har utvecklare kommit med HierSpeech++, ett robust och effektivt zero-shot-talsyntesramverk för röst- och text-till-tal-omvandling. HierSpeech++-ramverket bygger på den hierarkiska talsyntesens lärdomar som inte bara ökar robustheten utan också tillför uttrycksfullhet hos syntetisk taltillverkning samtidigt som den ökar naturligheten och talarens likhet hos konstgjord tal även i en zero-shot-inställning.

I den här artikeln kommer vi att diskutera HierSpeech++-ramverket i detalj och titta på modellens arkitektur, funktion och resultat i jämförelse med state-of-the-art-text- och ljudgenereringsmodeller. Så låt oss komma igång.

HierSpeech++ : Hierarkisk Variational Inferens för Zero-shot TalSyntes

HierSpeech++ är ett snabbt, robust och effektivt zero-shot-talsyntesramverk som använder en hierarkisk talsyntespipeline, och genom att anta detta slut-till-slut-talsyntesramverk kan HierSpeech++-modellen maximera potentialen för högkvalitativ vågformsgenerering för att hierarkiskt överbrygga gapet mellan semantiska och akustiska representationer genom att anta en självständig talsyntesrepresentation som en semantisk talsyntesrepresentation, och försöker därmed lösa de nuvarande begränsningarna för stiladaptation. Det slut-till-slut-talsyntesramverk som introducerades först av VITS-modellen antar en VAE eller Variational Auto-Encoder förstärkt med adversarial utbildning och normaliserande flöde. Dessutom har VAE-baserade ramverk med en slut-till-slut-utbildningspipeline förmågan att generera högkvalitativ vågformsaudio med perceptuell talsynteskvalitet som är betydligt bättre än de som genereras av andra talsyntesramverk.

Ljudrekonstruktionskvaliteten hos dessa ramverk kan förbättras ytterligare genom att använda en hierarkisk villkorlig Variational AutoEncoder som används i HierSpeech-ramverket. Trots deras potential har slut-till-slut-utbildningspipelinebaserade modeller vissa begränsningar, särskilt i en zero-shot-inställning, eftersom de kan syntetisera talsample med högkvalitativ audio, men talarens likhet i zero-shot-röstkloninguppgifter fortfarande är förknippad med hög beräkningskomplexitet. Å andra sidan utför diffusionsbaserade talsyntesmodeller bra när det gäller taladaptationer, men de är fortfarande långt ifrån perfekta, eftersom de använder en interaktiv genereringsprocess som saktar ner dess inferenshastighet, de är ofta sårbara för bullriga data, och som ett resultat av missmatchningen mellan utbildning och inferens av den tvåstegsgenereringsprocessen mellan Mel-spectrogram och genererad grund-sanning är ljudkvaliteten inte upp till märket.

För att tackla de problem som möter dess föregångare använder HierSpeech++-modellen en hierarkisk talsyntesare, en talsuperupplösning och en text-till-vektor-komponent, och introducerar en förbättrad hierarkisk talsyntesare byggd på den hierarkiska villkorliga VAE eller Variational AutoEncoder. I ett försök att förbättra ljudkvaliteten bortom den perceptuella kvaliteten antar HierSpeech++-ramverket en dubbel-ljud för att förstärka den akustiska posterior och förbättra ut ur distributionsgeneralisering genom att utrusta en hierarkisk adaptiv generator med både villkorlig och ovillkorlig generering. Dessutom använder HierSpeech++-ramverket en källfilterbaserad multi-path semantisk kodare för att lösgöra talfunktioner och förbättra talrelaterad och talagnostisk semantisk information. Som ett resultat av att använda en Variational AutoEncoder kan HierSpeech++-modellen ansluta och lära sig representationer hierarkiskt och progressivt anpassa sig till målröststilen för att härleda vågformsaudion. Dessutom använder HierSpeech++-ramverket en dubbelriktad nätverksnormaliseringsflödeTransformator i ett försök att förbättra anpassning och minska missmatchningen mellan utbildning och inferens.

Sammanfattningsvis är HierSpeech++-modellen ett fullständigt parallellt, nytt och robust hierarkiskt talsyntesramverk som syftar till att syntetisera talsample i en zero-shot-inställning, och försöker göra följande bidrag

  • Använda ett hierarkiskt talsyntesramverk för att kontrollera och överföra röststilar och prosodi.
  • Möjliggöra data skalbarhet och högupplöst talsyntes genom att översampla vågformsaudion från 16 till 48 kHz.
  • Uppnå mänsklig nivå över zero-shot-röstomvandling och text-till-tal-uppgifter.

HierSpeech++ : Modellkomponenter och Arkitektur

Som diskuterats är HierSpeech++ ett zero-shot-talsyntesmodell som försöker uppnå mänsklig nivå av noggrannhet när det gäller röstlikhet och talsynteskvalitet.

HierSpeech++-modellen består av olika komponenter, inklusive en hierarkisk talsyntesare, en talsuperupplösning och en text-till-vektor-till-TTV som fungerar i samverkan med varandra för att underlätta utbildningen av varje modell som kan effektivt utnyttja en stor mängd lågupplöst talsdata för röstkloning. Låt oss bryta ned ramverket och prata om varje komponent.

Talrepresentationer

Eftersom den mänskliga frekvensbandet ligger under 4 kHz, för talsyntes, nedsample HierSpeech++-ramverket ljudet vid 16 kHz. Dessutom är det viktigt att använda minst dubbelt den högsta komponenten av röstfrekvensen, plus nedsample ljudprovet. För att uppnå förbättrad perceptuell kvalitet använder HierSpeech++-ramverket en talsuperupplösning eller SpeechSR-komponent för att översampla ljudprovet från 16 till 48 kHz, och använder lågupplösta representationer för semantiska och akustiska representationer.

För akustiska representationer använder en traditionell text-till-tal- eller TTS-ramverk en Mel-spectrogram som sin mellanliggande akustiska funktion som sedan omvandlas från vågformen med hjälp av en STFT eller Short-Time Fourier Transform. Det är dock värt att notera att eftersom akustiska funktioner är rika representationer som består av olika attribut, inklusive innehåll och uttal, röstinformation och mer, vilket gör det svårt för ramverket att härleda dessa representationer, en situation som ofta leder till feluttal, brist på likhet eller över-smoothing av talet.

Fortsättning, för att extrahera en kontinuerlig semantisk representation från en vågform, använder HierSpeech++-ramverket ett Wav2Vec-ramverk i kontrast till den populära självständiga talsyntesrepresentationen för semantiska representationer. Även om tillvägagångssättet gör ett bra alternativ för en rik monolingual modell, påverkar det zero-shot-röstkloningförmågan hos en modell i termer av både robusthet och uttrycksfullhet, särskilt på multilingval talsyntesuppgifter.

Hierarkisk Talsyntesare

Den hierarkiska talsyntesarkomponenten är grundstenen för HierSpeech++-ramverket, eftersom den tillåter utbildning av modulen utan att använda några etiketter som texttranskriptioner eller talare-id, och förlitar sig enbart på talsdata. För att öka den akustiska kapaciteten ersatte tidigare state-of-the-art-talsyntesmodeller Mel-spectrogrammet med ett lineärt spectrogram, men tillvägagångssättet minskar KL-avvikelsescoren i termer av tonhöjd, PESQ, röst och icke-röstpoäng och även Mel-spectrogramavstånd. Den hierarkiska talsyntesaren använder en dubbel-ljudakustisk kodare för att lösa de utmaningar som presenteras av att använda ett lineärt spectrogram utformat för att fånga rikare och mer omfattande akustiska representationer. Ramverket använder också en vågformsencoder för att destillera information från en rå vågformsaudio och konkatenerar den med den lineära spectrogramrepresentationen och projicerar slutligen den akustiska representationen som en konkatenerad representation.

Dessutom, för att hantera talagnostiska och talrelaterade semantiska representationer, använder HierSpeech++-ramverket en multi-path självständig talsyntesrepresentation där varje enskild representation används för hierarkisk stiladaptation med de semantiska representationer som extraheras för att erhålla lingvistisk information från mittenlagret av MMS. Ramverket använder också en grundfrekvens för att förbättra talfördelning som möjliggör manuell kontroll av tonhöjds kontur. Ramverket använder också en lingvistisk representation som villkorlig information för att generera vågformsaudio hierarkiskt och använder en förbättrad lingvistisk representation av den självständiga representationen. Det är också värt att notera att de akustiska representationer som extraheras under utbildning med hjälp av en vågform och ett lineärt spectrogram används för att rekonstruera den råa vågformsaudion, och en hierarkisk variational inferens används för att länka de akustiska representationerna med de multi-path lingvistiska representationerna. Ramverket använder också en hierarkisk adaptiv generator (HAG) för att generera semantisk-till-vågformsprover, och de genererade representationerna som består av en stilrepresentation och en akustisk representation matas in i käll- och vågforms generatorerna.

Text till Vektor

För text-till-tal-syntes använder HierSpeech++-ramverket en text-till-vektor eller TTV-modell som genererar en grundfrekvens och en semantisk representation från en textsekvens, och använder en monotonisk sökning efter anpassning med en variational autoencoder för att anpassa talet och texten internt. HierSpeech++-ramverket ersätter sedan det lineära spectrogrammet med en självständig lineär representation och rekonstruerar samma representation för att fungera som utdata för TTV.

Dessutom förutsäger HierSpeech++-ramverket den grundläggande frekvensen med fyra gånger större upplösning jämfört med de självständiga talsyntesrepresentationerna, och använder en villkorlig textrepresentation som prior information. Som ett resultat av den semantiska informationen från de självständiga talsyntesrepresentationerna kan ramverket överföra prosodistilen i text-till-vektor-modellen och matar en latent representation till fonemkodaren för att förbättra de lingvistiska förmågorna hos representationen.

TalSR eller Tal Superupplösning

HierSpeech++-ramverket tränas på en relativt lågupplöst dataset i termer av dataeffektivitet och tillgänglighet, och översamplar en lågupplöst talsvågform till en högupplöst talsvågform från 16 till 48 kHz. Ramverket ersätter också en transponerad convolution med den närmaste granne-översamplaren som tidigare har visat sig lindra artefakter som ett resultat av transponerade convolutioner.

Arkitektur

Innehållskodaren i text-till-vektor-modellen består av 16 icke-kasella WaveNet-lager med en kärnstorlek på 5 och en dold storlek på 256, medan innehållsdekodaren består av 8 icke-kasella WaveNet-lager med en kärnstorlek på 5 och en dold storlek på 512. Textkodarkomponenten består av tre prosodi-villkorliga Transformer-nätverk och tre ovillkorliga Transformer-nätverk med en kärnstorlek på 9, filterstorlek på 1024 och en dold storlek på 256, med textkodaren som har en dropout-hastighet på 0,2. För att koda angränsande information och förbättra prosodistiladaptationen använder ramverket en CNN med en kärnstorlek på 5 i Transformer-block. TalSR å andra sidan består av en enda AMP-block med 32 initiala kanaler utan närvaro av en översamplingslager. Ramverket använder en närmaste granne-översamplare för att översampla de dolda representationerna och använder en MPD som diskriminatör med sex olika fönsterstorlekar och fyra sub-band diskriminatörer.

Ovanstående figur visar HierSpeech++-ramverkets inferenspipeline som börjar med att extrahera semantiska representationer från ljudet vid en frekvens på 16 kHz och vid den grundläggande frekvensen med hjälp av YAPPT-algoritmen. Innan den grundläggande frekvensen kan matas in i den hierarkiska syntetisatorn, normaliseras den med hjälp av standard- och medelavvikelserna för käll-ljudet, och den normaliserade grundläggande frekvensen normaliseras sedan med hjälp av standard- och medelavvikelserna för mål-ljudet. För text-till-tal-extraheringar extraherar HierSpeech++-ramverket textrepresentationer istället för talsrepresentationer och använder text-till-vektor-modellen för att generera en semantisk representation från prosodiprompten.

Experimenter och Resultat

Ramverket använder den offentligt tillgängliga LibriTTS-databasen för att träna den hierarkiska syntetisatorn med den första steget som är att träna modellen med trainclean-undersatser av databasen och använda den återstående datan för att möjliggöra förbättrad överföring av röststil. Dessutom, för att förbättra mångfalden och robustheten, ökar ramverket dataset till 1 kHz, som visas i följande figur.

Rekonstruktion, Resyntesuppgifter och Röstomvandling

För att utvärdera prestandan hos HierSpeech++-ramverket på rekonstruktion och resyntesuppgifter, genomförde utvecklare sju objektiva mått, och resultaten visas i följande figurer för rekonstruktion och resyntesuppgifter.

För röstomvandlingsuppgifter använder ramverket två subjektiva mått för utvärdering: röstlikhet MOS eller sMOS och naturlighet medelvärde av nMOS med tre naturlighet objektiva mått och två likhet objektiva mått.

Fortsättning, det primära målet med HierSpeech++-ramverket är att möjliggöra zero-shot-talsyntes, och för att utvärdera dess prestanda i zero-shot, jämförs det mot andra basmodeller som AutoVC, VoiceMixer, diffusionsbaserade modeller och många fler, med resultaten visas i följande figur.

Följande figurer visar zero-shot-text-till-tal resultaten med bullriga prompter och mycket bullriga prompter.

Slutliga Tankar

I den här artikeln har vi diskuterat HierSpeech++-modellen, en ny ansats för att möjliggöra robust och effektiv talsyntes i en zero-shot-inställning, och övervinna de begränsningar som möter nuvarande talsyntesramverk, inklusive deras överberoende av stora mängder träningsdata, beroende av diskreta talfunktioner eller förtränade neurala ljudkodare, och deras tendens att auto-generera ljudutdata som slutligen orsakar brist på robusthet och långsam interferenshastighet och resulterar i feluttal, hoppning eller upprepning. HierSpeech++-modellen är ett fullständigt parallellt, nytt och robust hierarkiskt talsyntesramverk som syftar till att syntetisera talsample i en zero-shot-inställning, och försöker göra följande bidrag

  • Använda ett hierarkiskt talsyntesramverk för att kontrollera och överföra röststilar och prosodi.
  • Möjliggöra data skalbarhet och högupplöst talsyntes genom att översampla vågformsaudion från 16 till 48 kHz.
  • Uppnå mänsklig nivå över zero-shot-röstomvandling och text-till-tal-uppgifter.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.