Modely a platformy AI
StyleTTS 2: Text-to-Speech Synthesis na Lidské Úrovni s Velkými Modely Jazyka Řeči
Vzhledem k růstu přírodních a syntetických přístupů k syntéze řeči je jedním z hlavních úspěchů, kterých dosáhla odvětví umělé inteligence v posledních letech, efektivní syntéza rámců text-to-speech s potenciálními aplikacemi v různých odvětvích, včetně audioknih, virtuálních asistentů, vyprávění a dalšího, přičemž některé modely současného stavu poskytují lidskou úroveň výkonu a efektivitu v širokém spektru úkolů souvisejících s řečí. Nicméně, navzdory jejich silnému výkonu, stále existuje prostor pro zlepšení úkolů díky expresivní a rozmanité řeči, požadavku na velké množství trénovacích dat pro optimalizaci rámců text-to-speech s nulovým výstřelem a odolnosti vůči textům OOD nebo mimo distribuci, což vede vývojáře k práci na více robustním a přístupném rámci text-to-speech.
V tomto článku budeme mluvit o StyleTTS-2, robustním a inovativním rámci text-to-speech, který je postaven na základech rámce StyleTTS a cílem je představit další krok směrem k rámcům text-to-speech na úrovni současného stavu. Rámec StyleTTS2 modeluje styly řeči jako latentní náhodné proměnné a používá probabilistický difuzní model pro vzorkování těchto stylů řeči nebo náhodných proměnných, což umožňuje rámcu StyleTTS2 syntetizovat realistickou řeč efektivně bez použití referenčních audio vstupů. Díky přístupu je rámec StyleTTS2 schopen poskytovat lepší výsledky a ukazuje vysokou efektivitu ve srovnání se současnými rámcemi text-to-speech, ale je také schopen využít rozmanité syntézy řeči nabízené rámcem difuzního modelu. Budeme diskutovat o rámcu StyleTTS2 v větší detail, a budeme se bavit o jeho architektuře a metodologii, zatímco také se podíváme na výsledky, kterých rámec dosáhl. Takže pojďme začít.
StyleTTS2 pro Syntézu Text-to-Speech: Úvod
StyleTTS2 je inovativní model syntézy text-to-speech, který představuje další krok směrem k budování rámců TTS na lidské úrovni, a je postaven na základě modelu StyleTTS, který je založen na stylu generativním modelu řeči. Rámec StyleTTS2 modeluje styly řeči jako latentní náhodné proměnné a používá probabilistický difuzní model pro vzorkování těchto stylů řeči nebo náhodných proměnných, což umožňuje rámcu StyleTTS2 syntetizovat realistickou řeč efektivně bez použití referenčních audio vstupů. Modelování stylů jako latentních náhodných proměnných je to, co odlišuje rámec StyleTTS2 od jeho předchůdce, rámce StyleTTS, a cílem je generovat nejvhodnější styl řeči pro vstupní text bez potřeby referenčního audio vstupu, a je schopen dosáhnout efektivní latentní difuze, zatímco využívá rozmanité syntézy řeči nabízené modely difuzní. Navíc rámec StyleTTS2 také využívá předtrénovaný velký model jazyka řeči jako diskriminátory, jako je rámec WavLM, a spojuje ho se svou novou diferenciální metodou modelování trvání pro trénink rámce koncového konce, a nakonec generuje řeč s vylepšenou přirozeností. Díky přístupu, který následuje, rámec StyleTTS2 překonává současné rámce současného stavu pro úkoly generace řeči, a je jedním z nejefektivnějších rámců pro předtrénování velkých modelů řeči v nulovém nastavení pro úkoly adaptace mluvčího.
Pokračujme, aby bylo možné dodat syntézu text-to-speech na lidské úrovni, rámec StyleTTs2 zahrnuje znalosti z existujících prací, včetně modelů difuzní pro syntézu řeči a velkých modelů jazyka řeči. Modely difuzní se obvykle používají pro úkoly syntézy řeči díky jejich schopnostem jemné kontroly řeči a rozmanité syntézy řeči. Nicméně, modely difuzní nejsou tak efektivní jako rámce GAN založené na neiterativních a jeden z hlavních důvodů je požadavek na vzorkování latentních reprezentací, vlnových tvarů a mel-spectrogramů iterativně do cílové délky řeči.
Na druhé straně, nedávné práce kolem velkých modelů jazyka řeči ukázaly jejich schopnost vylepšit kvalitu úkolů generace text-to-speech, a přizpůsobit se mluvčímu. Velké modely jazyka řeči obvykle převádějí vstupní text buď na kvantizované nebo kontinuální reprezentace odvozené z předtrénovaných modelů jazyka řeči pro úkoly rekonstrukce řeči. Nicméně, funkce těchto modelů jazyka řeči nejsou optimalizovány pro syntézu řeči přímo. Naopak, rámec StyleTTS2 využívá znalostí získaných velkými modely jazyka řeči pomocí tréninku s adversariálem pro syntézu funkcí modelů jazyka řeči bez použití map latentního prostoru, a tím se učí syntéza optimalizovaný latentní prostor přímo.
StyleTTS2: Architektura a Metodologie
V jádru je StyleTTS2 postaven na svém předchůdci, rámcu StyleTTS, který je neautoregresivním rámcem text-to-speech, který využívá kodéru stylu pro odvození vektoru stylu z referenčního audio, což umožňuje expresivní a přirozenou generaci řeči. Vektor stylu použitý v rámcu StyleTTS je začleněn přímo do kodéru, trvání a prediktorů pomocí adaptivní instance normalizace, což umožňuje rámcu StyleTTS generovat výstupy řeči s různou prozodií, trváním a dokonce emocemi. Rámec StyleTTS se skládá z 8 modelů celkem, které jsou rozděleny do tří kategorií
- Akustické modely nebo systém generace řeči se stylem kodéru, textovým kodérem a dekodérem řeči.
- Systém predikce text-to-speech, který využívá prediktory prozodie a trvání.
- Systém utility, který zahrnuje textový aligner, extraktor tónu a diskriminátor pro účely tréninku.
Díky svému přístupu, rámec StyleTTS dodává výkon současného stavu související s ovladatelnou a rozmanitou syntézou řeči. Nicméně, tento výkon má své nevýhody, jako je degradace kvality vzorku, expresivní omezení a závislost na aplikacích řeči v reálném čase.
Vylepšením rámce StyleTTS, model StyleTTS2 vede k vylepšené expresivní syntéze text-to-speech s vylepšeným výkonem mimo distribuci a vysokou lidskou úrovní kvality. Rámec StyleTTS2 využívá koncového koncového tréninku, který optimalizuje různé komponenty s tréninkem s adversariálem a přímou syntézou vlnové formy společně. Na rozdíl od rámce StyleTTS, rámec StyleTTS2 modeluje styl řeči jako latentní proměnnou a vzorkuje ji pomocí modelů difuzní, což generuje rozmanité vzorky řeči bez použití referenčního audio. Pojďme se podívat na tyto komponenty podrobněji.
Koncový Koncový Trénink pro Interferenci
V rámcu StyleTTS2 se využívá koncového koncového tréninku pro optimalizaci různých komponent text-to-speech pro interferenci bez závislosti na pevných komponentech. Rámec StyleTTS2 dosahuje tohoto cíle úpravou dekodéru pro generování vlnové formy přímo z vektoru stylu, křivky tónu a energie a zarovnaných reprezentací. Rámec poté odstraní poslední projekční vrstvu dekodéru a nahradí ji dekodérem vlnové formy. Rámec StyleTTS2 využívá dvou kodérů: dekodéru založeného na HifiGAN pro generování vlnové formy přímo a dekodéru založeného na iSTFT pro produkci fáze a velikosti, které jsou převedeny na vlnovou formu pro rychlejší interferenci a trénink.

Následující obrázek reprezentuje akustické modely použité pro předtrénování a společné trénování. Pro snížení doby tréninku jsou moduly nejprve optimalizovány v předtrénovacím stádiu, následované optimalizací všech komponent kromě extraktoru tónu během společného trénování. Důvod, proč společné trénování neoptimalizuje extraktor tónu, je ten, že je používán pro poskytování grund truth pro křivky tónu.

Následující obrázek reprezentuje trénink s adversariálem modelu jazyka řeči a interferenci s rámcem WavLM, který je předtrénován, ale neupraven. Proces se liší od toho, který je zmíněn výše, protože může přijímat různé vstupní texty, ale akumuluje gradienty pro aktualizaci parametrů v každém batchi.
Difuzní Styl
Rámec StyleTTS2 cílem je modelovat řeč jako podmíněnou distribuci prostřednictvím latentní proměnné, která následuje podmíněnou distribuci, a tato proměnná se nazývá generalizovaný styl řeči, a reprezentuje jakoukoli charakteristiku ve vzorku řeči za hranicemi rozsahu jakéhokoli fonetického obsahu, včetně lexikální zátěže, prozodie, tempa řeči a dokonce formantových přechodů.
Diskriminátory Modelu Jazyka Řeči
Modely jazyka řeči jsou proslulé svou obecnou schopností kódovat cenné informace o širokém spektru sémantiky a akustických aspektů, a reprezentace modelů jazyka řeči tradičně dokázaly napodobit lidská vnímání pro hodnocení kvality generované syntetizované řeči. Rámec StyleTTS2 využívá tréninku s adversariálem pro využití schopnosti kodérů modelů jazyka řeči pro generativní úkoly, a využívá 12vrstvého rámce WavLM jako diskriminátor. Tento přístup umožňuje rámcu umožnit trénink na textech OOD nebo mimo distribuci, což může pomoci zlepšit výkon. Navíc, pro prevenci problémů s přeučením, rámec vzorkuje texty OOD a v distribuci se stejnou pravděpodobností.
Diferenciální Modelování Trvání
Tradičně se v rámcích text-to-speech používá prediktor trvání, který produkuje délky fonémů, ale metody upsamplingu, které tyto prediktory trvání používají, často blokují tok gradientu během procesu koncového koncového trénování, a rámec NaturalSpeech využívá attention-based upsampler pro lidskou úroveň konverze text-to-speech. Nicméně, rámec StyleTTS2 považuje tento přístup za nestabilní během tréninku s adversariálem, protože StyleTTS2 trénuje pomocí diferenciálního upsamplingu s adversariálem bez ztráty dalších termínů kvůli nesouladu délky kvůli odchylkám. Ačkoli použití softwarového dynamického časového warpingu může pomoci zmírnit tento nesoulad, jeho použití je nejenom výpočetně nákladné, ale jeho stabilita je také problémem, když se pracuje s adversariálními objektivy nebo úkoly rekonstrukce melu. Proto, aby se dosáhlo lidské úrovně výkonu s tréninkem s adversariálem a stabilizovalo se tréninkový proces, rámec StyleTTC2 využívá neparametrický přístup k upsamplingu.
Gaussovský upsampling je populární neparametrický přístup k upsamplingu pro převod predikovaných délek, ačkoli má své omezení díky fixní délce Gaussovských jader, která jsou předem určena. Toto omezení pro Gaussovský upsampling omezuje jeho schopnost přesně modelovat zarovnání s různými délkami.
Trénování a Evaluace Modelu
Rámec StyleTTC2 je trénován a experimentován na třech datech: VCTK, LibriTTS a LJSpeech. Komponenta jednoho mluvčího rámce StyleTTS2 je trénována pomocí datové sady LJSpeech, která obsahuje přibližně 13 000+ audio vzorků rozdělených do 12 500 trénovacích vzorků, 100 validačních vzorků a přibližně 500 testovacích vzorků, s jejich kombinovaným časem běhu přibližně 24 hodin. Komponenta více mluvčích rámce je trénována na datové sadě VCTK, která se skládá z více než 44 000 audio klipů s více než 100 rodilými mluvčími s různými akcenty, a je rozdělena do 43 500 trénovacích vzorků, 100 validačních vzorků a přibližně 500 testovacích vzorků. Nakonec, aby se rámec vybavil schopnostmi nulového výstřelu pro úkoly adaptace mluvčího, je rámec trénován na kombinované datové sadě LibriTTS, která se skládá z audio klipů v celkové délce přibližně 250 hodin audio s více než 1 150 jednotlivými mluvčími. Pro hodnocení jeho výkonu, model využívá dvě metriky: MOS-N nebo Průměrné hodnocení přirozenosti, a MOS-S nebo Průměrné hodnocení podobnosti.

Výsledky
Přístup a metodologie použité v rámcu StyleTTS2 jsou demonstrovány v jeho výkonu, protože model překonává několik rámců současného stavu, zejména na datové sadě NaturalSpeech, a na cestě, nastavuje nový standard pro datovou sadu. Navíc, rámec StyleTTS2 překonává rámec současného stavu VITS na datové sadě VCTK, a výsledky jsou demonstrovány v následujícím obrázku.

Model StyleTTS2 také překonává předchozí modely na datové sadě LJSpeech, a neukazuje žádný stupeň degradace kvality na textech OOD nebo mimo distribuci, jak je ukázáno předchozími rámci na stejných metrikách. Navíc, v nastavení nulového výstřelu, model StyleTTC2 překonává existující rámec Vall-E v přirozenosti, ačkoli klesá za ním v podobnosti. Nicméně, je důležité poznamenat, že rámec StyleTTS2 je schopen dosáhnout konkurenčního výkonu, přestože je trénován pouze na 245 hodinách audio vzorků ve srovnání s více než 60 000 hodinami trénování pro rámec Vall-E, což dokazuje, že StyleTTC2 je datově efektivní alternativou k existujícím velkým metodám předtrénování, jako je rámec Vall-E.

Pokračujme, vzhledem k nedostatku emocionálně označených audio textových dat, rámec StyleTTC2 využívá model GPT-4 pro generování více než 500 instancí napříč různými emocemi pro vizualizaci vektorů stylu, které rámec vytváří pomocí svého difuzního procesu.

V prvním obrázku jsou emocionální styly v reakci na sentiment vstupního textu ilustrovány vektory stylu z modelu LJSpeech, a demonstrují schopnost rámce StyleTTC2 syntetizovat expresivní řeč s různými emocemi. Druhý obrázek znázorňuje distinktní klastry pro každého z pěti jednotlivých mluvčích, což demonstruje širokou škálu rozmanitosti zdrojů z jednoho audio souboru. Třetí obrázek demonstruje volné klastry emocí z mluvčího 1, a ukazuje, že, navzdory některým překryvům, emocionální klastry jsou prominentní, což naznačuje možnost manipulace s emocionálními tóny mluvčího, bez ohledu na referenční audio vzorek a jeho vstupní tón. Navzdory použití difuzního přístupu, rámec StyleTTS2 dokáže překonat existující rámce současného stavu, včetně VITS, ProDiff a FastDiff.

Závěrečné Myšlenky
V tomto článku jsme mluvili o StyleTTS2, novém, robustním a inovativním rámcu text-to-speech, který je postaven na základech rámce StyleTTS, a cílem je představit další krok směrem k rámcům text-to-speech na úrovni současného stavu. Rámec StyleTTS2 modeluje styly řeči jako latentní náhodné proměnné a používá probabilistický difuzní model pro vzorkování těchto stylů řeči nebo náhodných proměnných, což umožňuje rámcu StyleTTS2 syntetizovat realistickou řeč efektivně bez použití referenčních audio vstupů. Rámec StyleTTS2 využívá difuzní styl a diskriminátory modelu jazyka řeči pro dosažení lidské úrovně výkonu v úkolech text-to-speech, a dokáže překonat existující rámce současného stavu v širokém spektru úkolů souvisejících s řečí.












