Modely a platformy AI
HierSpeech++: Hierarchická Variabilní Inference pro Zero-Shot Speech Synthesis
Poslední vývoj a pokrok v možnostech velkých jazykových modelů sehrály zásadní roli v pokroku rámců založených na LLM pro generování audia a syntézu řeči, zejména v nastavení zero-shot. Tradiční rámce syntézy řeči prošly významným pokrokem v důsledku integrace dalších funkcí, jako jsou neuronové audio kodeky pro diskrétní audio a řečové jednotky. Přestože tyto rámce syntézy řeči a audia poskytují uspokojivé výsledky, stále existuje prostor pro zlepšení, protože současné rámce založené na LLM mají tři hlavní omezení
- Mají tendenci automaticky generovat audio výstup, který nakonec způsobuje nedostatek robustnosti a pomalou interferenční rychlost a výsledkem jsou nesprávné výslovnosti, přeskočení nebo opakování.
- Mají tendenci příliš záviset na diskrétních řečových jednotkách nebo předem trénovaných neuronových audio kodecích.
- Často vyžadují velké množství trénovacího dat.
Abyste řešili výše uvedené problémy a zlepšili schopnosti rámců založených na LLM pro audio a syntézu řeči, vývojáři vytvořili HierSpeech++, robustní a efektivní zero-shot syntézátor řeči pro hlas a text na řeč nebo TTS konverze. Rámec HierSpeech++ vychází z poznatků z hierarchických rámců syntézy řeči, které nejenom zvyšují robustnost, ale také přidávají k expresivitě syntetického řečového výstupu a zvyšují přirozenost a podobnost mluvčího uměle generované řeči, dokonce i v nastavení zero-shot.
V tomto článku budeme hovořit o rámcu HierSpeech++ podrobně a prozkoumáme architekturu modelu, jeho fungování a výsledky ve srovnání se stávajícími modely generování textu a audia. Takže pojďme začít.
HierSpeech++: Hierarchická Variabilní Inference pro Zero-Shot Speech Synthesis
HierSpeech++ je rychlý, robustní a efektivní zero-shot syntézátor řeči, který využívá hierarchický syntézátor řeči a adoptuje koncový syntézátor řeči, HierSpeech++ model je schopen maximalizovat potenciál generování high-quality vlnové formy, aby hierarchicky přemostil mezery mezi sémantickými a akustickými reprezentacemi adoptováním samo-supervizované řečové reprezentace jako sémantické řečové reprezentace a tím se snaží vyřešit současné omezení stylů adaptace. Koncový syntézátor řeči byl poprvé představen modelem VITS a adoptuje VAE nebo Variabilní Auto-Encoder s adversariálním tréninkem a normalizujícím tokem. Kromě toho, rámce založené na VAE s koncovým tréninkovým tokem mají schopnost generovat high-quality vlnovou formu audia s percepční kvalitou syntézy řeči, která je významně lepší než ta, která je generována jinými rámci syntézy řeči.
Kvalita audio rekonstrukce těchto rámců lze dále zlepšit pomocí hierarchického podmíněného Variabilního Auto-Encoderu, jako je tomu v rámcu HierSpeech. Přestože mají potenciál, modely založené na koncovém tréninkovém toku mají určitá omezení, zejména v nastavení zero-shot, protože i když mohou syntetizovat vzorky řeči s vysokou kvalitou audia, podobnost mluvčího v úkolech zero-shot voice cloning je stále zatížena vysokou výpočetní složitostí. Na druhé straně, difúzní modely syntézy řeči fungují dobře z hlediska adaptace mluvčího, ale jsou stále daleko od dokonalosti, protože využívají interaktivního procesu generování, který zpomaluje rychlost inference, jsou často zranitelné vůči šumům a v důsledku nesouladu mezi tréninkem a inferencí dvoufázového procesu generování mezi Mel-spectrogramem a generovaným ground-truth je kvalita audia není na úrovni.
Abyste řešili problémy, kterým čelí jeho předchůdci, model HierSpeech++ využívá hierarchický syntézátor řeči, syntézátor super-rezoluce a komponent text-to-vec a zavádí vylepšený hierarchický syntézátor řeči postavený na hierarchickém podmíněném VAE nebo Variabilním Auto-Encoderu. V pokusů o zlepšení kvality audia za hranice percepční kvality, rámec HierSpeech++ adoptuje dual-audio, aby zvýšil akustický posteriorní a zlepšil generalizaci mimo distribuci, využívaje hierarchicky adaptivního generátoru vybaveného podmíněnou a nepodmíněnou generací. Kromě toho, aby rozlišil komponenty řeči a zlepšil mluvčího související a mluvčího agnostické sémantické informace, rámec HierSpeech++ také adoptuje teorii zdroje a filtru založenou na multi-path sémantickém kodéru. V důsledku využití Variabilního Auto-Encoderu, model HierSpeech++ může spojit a naučit se reprezentace hierarchicky a progresivně adaptovat na cílový styl hlasu, aby odvodil vlnovou formu audia. Kromě toho, rámec HierSpeech++ také nasazuje bidirekční síť normalizujících toků Transformérů, aby zlepšil adaptaci a snížil nesoulad mezi tréninkem a inferencí.
Celkově, model HierSpeech++ je plně paralelní, novým a robustním hierarchickým rámcem syntézy řeči, zaměřeným na syntézu vzorků řeči v nastavení zero-shot, a snaží se přispět následujícími způsoby
- Používáním hierarchického rámcu syntézy řeči ke kontrole a přenosu stylů hlasu a prozodie.
- Povolením škálovatelnosti dat a syntézou high-resolution audia upsampling vlnové formy audia z 16 na 48 kHz.
- Dosažením lidské úrovně přesnosti napříč úkoly zero-shot voice conversion a text-to-speech.
HierSpeech++: Komponenty modelu a architektura
Jak jsme diskutovali, HierSpeech++ je model syntézy řeči zero-shot, který se snaží dosáhnout lidské úrovně přesnosti z hlediska podobnosti hlasu a přirozenosti řeči.

Model HierSpeech++ se skládá z různých komponent, včetně hierarchického syntézátoru řeči, syntézátoru super-rezoluce a text-to-vec, které pracují společně, aby umožnily trénink každého modelu, který může efektivně využít velké množství nízkorozlišených dat řeči pro klonování hlasu. Pojďme rozebrat rámec a promluvme si o každé komponentě.
Reprezentace řeči
Jelikož lidská frekvenční pásma jsou pod 4 kHz, pro syntézu řeči, rámec HierSpeech++ downsamples audio na 16 kHz. Kromě toho, pro rekonstrukci signálu hlasu, je důležité použít alespoň dvojnásobnou nejvyšší komponentu frekvenční pásma, kromě downsamplingu audia. Abyste získali lepší percepční kvalitu, rámec HierSpeech++ využívá komponent syntézátoru super-rezoluce nebo SpeechSR, aby upsamploval audio vzorek z 16 na 48 kHz a využívá nízkorozlišené reprezentace pro sémantické a akustické reprezentace.

Pro akustické reprezentace, tradiční rámec text-to-speech nebo TTS využívá Mel-spectrogram jako mezilehlou akustickou funkci, která je poté transformována z vlnové formy s pomocí STFT nebo Short-Time Fourier Transform. Je však důležité poznamenat, že akustické funkce jsou bohaté reprezentace, které zahrnují různé atributy, včetně obsahu a výslovnosti, informace o hlasu a další, což činí obtížným pro rámec odvodit tyto reprezentace, situace, která často vede k nesprávným výslovnostem, nedostatku podobnosti nebo přehnanému vyhlazení řeči.
Pokračujeme, pro extrakci kontinuální sémantické reprezentace z vlnové formy, rámec HierSpeech++ využívá rámec Wav2Vec, na rozdíl od populární samo-supervizované řečové reprezentace pro sémantické reprezentace. Přestože tento přístup představuje dobrý alternativu pro bohatý monolingvální model, ovlivňuje zero-shot schopnosti klonování hlasu modelu, z hlediska jak robustnosti, tak expresivnosti, zejména u multilingválních úloh syntézy řeči.
Hierarchický syntézátor řeči
Komponent Hierarchického syntézátoru řeči je základem pro rámec HierSpeech++, protože umožňuje trénovat modul bez použití žádných štítků, jako jsou textové transkripty nebo identifikátory mluvčího, a spoléhá se pouze na data řeči. Abyste zvýšili akustickou kapacitu, předchozí modely syntézy řeči nahradily Mel-spectrogram lineárním spectrogramem, nicméně, tento přístup minimalizuje skóre KL divergence z hlediska periody tónu, PESQ, skóre hlasu a nehlasu a dokonce i vzdálenosti Mel-spectrogramu. Hierarchický syntézátor řeči využívá Dual-audio Akustický Encoder, aby vyřešil výzvy spojené s použitím lineárního spectrogramu, navrženého pro zachycení bohatších a komplexnějších akustických reprezentací. Rámec také využívá vlnový encoder, aby destiloval informace z raw vlnové formy audia a spojí ho s lineární spectrogramovou reprezentací a nakonec projektem akustické reprezentace jako spojenou reprezentaci.

Kromě toho, aby se vyrovnal s mluvčího agnostickými a mluvčího souvisejícími sémantickými reprezentacemi, rámec HierSpeech++ využívá multi-path samo-supervizované řečové reprezentace, kde každá jednotlivá reprezentace je použita pro hierarchickou adaptaci stylu s reprezentacemi extrahovanými pro získání lingvistické informace z prostřední vrstvy MMS. Rámec také využívá fundamentální frekvenci, aby zlepšil disentanglement řeči, což umožňuje ruční kontrolu kontury tónu. Rámec také využívá lingvistické reprezentace jako podmíněnou informaci, aby generoval vlnovou formu audia hierarchicky a využívá vylepšenou lingvistickou reprezentaci samo-supervizované reprezentace. Je také důležité poznamenat, že akustické reprezentace extrahované během tréninku pomocí vlnové formy a lineárního spectrogramu jsou použity pro rekonstrukci raw vlnové formy audia a hierarchická variabilní inference je použita pro spojení akustických reprezentací s multi-path lingvistickými reprezentacemi. Rámec také nasazuje hierarchicky adaptivní generátor (HAG), aby generoval sémantické-vzorky vlnové formy a generované reprezentace, které zahrnují reprezentaci stylu a akustickou reprezentaci, jsou krmeny do zdrojového a vlnového generátoru.
Text-to-vec
Pro syntézu text-to-speech, rámec HierSpeech++ využívá model text-to-vec nebo TTV, který generuje fundamentální frekvenci a sémantickou reprezentaci z textové sekvence a využívá monotonic alignment search spojený s variabilním auto-encoderem, aby zarovnal řeč a text interně. Rámec HierSpeech++ poté nahrazuje lineární spectrogram samo-supervizovanou lineární reprezentací a rekonstruuje stejnou reprezentaci, aby sloužila jako výstup pro TTV.

Kromě toho, rámec HierSpeech++ předpovídá fundamentální frekvenci se čtyřnásobně většími rozlišeními ve srovnání se samo-supervizovanými řečovými reprezentacemi a využívá podmíněnou textovou reprezentaci jako předchozí informaci. V důsledku sémantických informací samo-supervizovaných řečových reprezentací, rámec je schopen přenést styl prozodie v modelu text-to-vec a krmit latentní reprezentaci do fonémového encoderu, aby zlepšil lingvistické schopnosti reprezentace.
SpeechSR nebo Speech Super Resolution
Rámec HierSpeech++ trénuje na relativně nízkorozlišeném datasetu z hlediska efektivity dat a dostupnosti a upsampluje nízkorozlišenou vlnovou formu audia na high-rozlišenou vlnovou formu audia z 16 na 48 kHz. Rámec také nahrazuje transponovanou konvoluci s nejbližším sousedním upsamplarem, který byl dříve známý jako prostředek, aby se zmírnily artefakty způsobené transponovanými konvolucemi.

Architektura
Encoder obsahu modelu text-to-vec se skládá z 16 non-kasual WaveNet vrstev s velikostí jádra 5 a skrytou velikostí 256, zatímco decoder obsahu se skládá z 8 non-kasual WaveNet vrstev s velikostí jádra 5 a skrytou velikostí 512. Komponent textového encoderu se skládá ze tří prosody podmíněných Transformer sítí a tří nepodmíněných Transformer sítí s velikostí jádra 9, filter velikostí 1024 a skrytou velikostí 256 s textovým encoderem, který má dropout rate 0,2. Abyste zakódovávali sousední informace a zlepšili adaptaci stylu prozodie, rámec adoptuje CNN s velikostí jádra 5 v Transformer blocích. SpeechSR na druhé straně se skládá z jediného AMP bloku s 32 počátečními kanály bez přítomnosti upsampling vrstvy. Rámec využívá nejbližšího sousedního upsamplaru, aby upsamploval skryté reprezentace a využívá MPD jako diskriminátor s šesti různými velikostmi oken a čtyřmi sub-band diskriminátory.

Následující obrázek demonstruje inference pipeline rámce HierSpeech++, který začíná extrakcí sémantických reprezentací z audia na frekvenci 16 kHz a na fundamentální frekvenci pomocí algoritmu YAPPT. Předtím, než může být fundamentální frekvence krmena do Hierarchického syntézátoru, je normalizována pomocí standardních a moyen deviací zdrojového audia a normalizovaná fundamentální frekvence je poté denormalizována pomocí standardních a moyen deviací cílového audia. Pro extrakci text-to-speech, rámec HierSpeech++ extrahuje textové reprezentace místo řečových reprezentací a využívá model text-to-vec, aby generoval sémantickou reprezentaci z prosody promptu.
Experiment a výsledky
Rámec využívá veřejně dostupný dataset LibriTTS, aby trénoval komponent hierarchického syntézátoru, přičemž prvním krokem je trénování modelu s trainclean podmnožinou datasetu a využívání zbývajících dat, aby umožnil lepší přenos stylu hlasu. Kromě toho, aby se zlepšila diverzita a robustnost, rámec upsampluje dataset na 1 kHz, jak je ukázáno na následujícím obrázku.

Rekonstrukce, resyntéza úkolů a konverze hlasu
Abyste vyhodnotili výkon rámce HierSpeech++ na rekonstrukci a resyntéze úkolů, vývojáři provedli sedm objektivní metrik a výsledky jsou demonstrovány na následujících obrázcích pro rekonstrukci a resyntéze úkolů.


Pro úkoly konverze hlasu, rámec využívá dvě subjektivní metriky pro hodnocení: voice similarity MOS nebo sMOS a naturalness mean opinion score of nMOS s třemi objektivními metrikami naturalness a dvěma objektivními metrikami podobnosti.

Pokračujeme, primárním cílem rámce HierSpeech++ je umožnit zero-shot syntézu řeči a aby se vyhodnotila jeho výkon v zero-shot, je srovnán s jinými základními modely, jako je AutoVC, VoiceMixer, difúzními modely a mnoha dalšími, přičemž výsledky jsou demonstrovány na následujícím obrázku.

Následující obrázky demonstrují zero-shot text-to-speech výsledky s šumovými prompty a velmi šumovými prompty.


Závěrečné myšlenky
V tomto článku, jsme mluvili o modelu HierSpeech++, novém přístupu k umožnění robustní a efektivní syntézy řeči v nastavení zero-shot a překonání omezení, kterým čelí současné rámce syntézy řeči, včetně jejich závislosti na velkém množství trénovacího dat, závislosti na diskrétních řečových jednotkách nebo předem trénovaných neuronových audio kodecích a jejich tendence automaticky generovat audio výstup, který nakonec způsobuje nedostatek robustnosti a pomalou interferenční rychlost a výsledkem jsou nesprávné výslovnosti, přeskočení nebo opakování. Model HierSpeech++ je plně paralelní, novým a robustním hierarchickým rámcem syntézy řeči, zaměřeným na syntézu vzorků řeči v nastavení zero-shot, a snaží se přispět následujícími způsoby
- Používáním hierarchického rámcu syntézy řeči ke kontrole a přenosu stylů hlasu a prozodie.
- Povolením škálovatelnosti dat a syntézou high-resolution audia upsampling vlnové formy audia z 16 na 48 kHz.
- Dosažením lidské úrovně přesnosti napříč úkoly zero-shot voice conversion a text-to-speech.












