Modele i platformy AI
StyleTTS 2: Synteza mowy na poziomie ludzkim z dużymi modelami języka mówionego
Dzięki wzrostowi naturalnych i syntetycznych podejść do syntezy mowy, jednym z głównych osiągnięć branży AI w ostatnich latach jest skuteczna synteza ram tekstowych do mowy z potencjalnymi zastosowaniami w różnych branżach, w tym audiobookach, asystentach wirtualnych, narracjach voice-over i innych, z niektórymi modełami stanu sztuki dostarczającymi wyniki na poziomie ludzkim i wydajności w szerokim zakresie zadań związanych z mową. Jednak pomimo ich silnej wydajności, nadal istnieje miejsce na poprawę zadań dzięki wyrazistemu i zróżnicowanemu mowom, wymogowi dużej ilości danych szkoleniowych do optymalizacji ram tekstowych do mowy zero-shot, oraz wytrzymałości na teksty poza dystrybucją, co prowadzi deweloperów do pracy nad bardziej wytrzymałym i dostępnym frameworkiem syntezy mowy.
W tym artykule będziemy rozmawiać o StyleTTS-2, wytrzymałym i innowacyjnym frameworku syntezy mowy, który jest zbudowany na podstawie frameworku StyleTTS i ma na celu przedstawienie następnego kroku w kierunku systemów syntezy mowy na poziomie ludzkim. Framework StyleTTS2 modeluje style mowy jako latentne zmienne losowe i wykorzystuje probabilistyczny model dyfuzji do próbkowania tych stylów mowy lub zmiennych losowych, co pozwala frameworkowi StyleTTS2 na skuteczną syntezę realistycznej mowy bez użycia danych wejściowych audio. Dzięki temu podejściu, framework StyleTTS2 jest w stanie dostarczyć lepsze wyniki i wykazać wysoką wydajność w porównaniu z obecnie stosowanymi frameworkami syntezy mowy, ale jest również w stanie skorzystać z zróżnicowanej syntezy mowy oferowanej przez frameworki modeli dyfuzji. Będziemy omawiać framework StyleTTS2 w większych szczegółach i będziemy rozmawiać o jego architekturze i metodologii, a także będziemy przyglądać się wynikom uzyskanym przez framework.
StyleTTS2 do syntezy mowy: Wprowadzenie
StyleTTS2 to innowacyjny model syntezy mowy, który jest następnym krokiem w kierunku budowy frameworków syntezy mowy na poziomie ludzkim i jest zbudowany na podstawie modelu StyleTTS, który jest modelem generatywnym mowy opartym na stylu. Framework StyleTTS2 modeluje style mowy jako latentne zmienne losowe i wykorzystuje probabilistyczny model dyfuzji do próbkowania tych stylów mowy lub zmiennych losowych, co pozwala frameworkowi StyleTTS2 na skuteczną syntezę realistycznej mowy bez użycia danych wejściowych audio. Modelowanie stylów jako zmiennych losowych latentnych jest tym, co odróżnia framework StyleTTS2 od jego poprzednika, frameworku StyleTTS, i ma na celu wygenerowanie najbardziej odpowiedniego stylu mowy dla tekstu wejściowego bez potrzeby danych audio referencyjnych, i jest w stanie osiągnąć skuteczną dyfuzję latentną, korzystając z zróżnicowanych możliwości syntezy mowy oferowanych przez modele dyfuzji. Dodatkowo, framework StyleTTS2 wykorzystuje również wstępnie wytrenowany duży model języka mówionego (SLM) jako dyskryminatory, takie jak framework WavLM, i łączy go ze swoim nowym podejściem do modelowania trwania, aby wytrenować framework w sposób końcowy, i ostatecznie generować mowę z podwyższoną naturalnością. Dzięki temu podejściu, framework StyleTTS2 przewyższa obecnie stosowane frameworki syntezy mowy, i jest jednym z najbardziej wydajnych frameworków do wstępnego szkolenia dużych modeli mowy w ustawieniu zero-shot dla zadań adaptacji mówcy.
Przechodząc dalej, aby dostarczyć syntezę mowy na poziomie ludzkim, framework StyleTTS2 wykorzystuje wiedzę z istniejących prac, w tym modeli dyfuzji do syntezy mowy i dużych modeli języka mówionego. Modele dyfuzji są zwykle wykorzystywane do zadań syntezy mowy dzięki ich zdolnościom do kontroli mowy i zróżnicowanego próbkowania mowy. Jednak modele dyfuzji nie są tak wydajne, jak frameworki GAN oparte na nieiteracyjnych frameworkach, a głównym powodem tego jest konieczność próbkowania reprezentacji latentnych, fal, i mel-spectrogramów w sposób iteracyjny do docelowego czasu trwania mowy.
Z drugiej strony, niedawne prace wokół dużych modeli języka mówionego wskazują na ich zdolność do poprawy jakości zadań syntezy mowy, i dostosowania się do mówcy. Duże modele języka mówionego zwykle konwertują dane wejściowe tekstowe na reprezentacje ilościowe lub ciągłe, pochodzące z wstępnie wytrenowanych frameworków języka mówionego do zadań rekonstrukcji mowy. Jednak cechy tych modeli języka mówionego nie są zoptymalizowane bezpośrednio do syntezy mowy. W przeciwieństwie do tego, framework StyleTTS2 wykorzystuje wiedzę zdobytą przez duże frameworki SLM, wykorzystując szkolenie adversarialne, aby syntetyzować cechy modeli języka mówionego bez użycia map przestrzeni latentnej, i tym samym, ucząc się przestrzeni latentnej zoptymalizowanej do syntezy mowy bezpośrednio.
StyleTTS2: Architektura i Metodologia
W swojej istocie, StyleTTS2 jest zbudowany na podstawie swojego poprzednika, frameworku StyleTTS, który jest nieautoregresyjnym frameworkiem syntezy mowy, wykorzystującym kodery stylu do pochodzenia wektora stylu z danych audio referencyjnych, co pozwala na generowanie naturalnej i wyrazistej mowy. Wektor stylu wykorzystywany w frameworku StyleTTS jest wbudowany bezpośrednio w kodery, trwanie, i predykatory, wykorzystując AdaIN lub adaptacyjną normalizację instancyjną, co pozwala frameworkowi StyleTTS na generowanie danych wyjściowych mowy z różnymi prozodiami, trwaniem, i nawet emocjami. Framework StyleTTS składa się z 8 modeli w sumie, które są podzielone na trzy kategorie
- Modele akustyczne lub systemy generacji mowy z kodera stylu, kodera tekstu, i dekodera mowy.
- System predykcji mowy do tekstu, wykorzystujący predykatory prozodii i trwania.
- System pomocniczy, w tym wyśrodkowarkę tekstu, ekstraktor pitchu, i dyskryminator do celów szkoleniowych.
Dzięki swojemu podejściu, framework StyleTTS dostarcza wyniki na poziomie stanu sztuki związane z kontrolowaną i zróżnicowaną syntezą mowy. Jednak ten wynik ma swoje wady, takie jak degradacja jakości próbek, ograniczenia wyraziste, i zależność od aplikacji mowy w czasie rzeczywistym.
Poprawiając framework StyleTTS, model StyleTTS2 daje w wyniku poprawione zadania syntezy mowy z podwyższoną wyrazistością, i wysoką jakością na poziomie ludzkim, oraz wysoką wydajnością. Framework StyleTTS2 wykorzystuje proces szkolenia końcowego, który optymalizuje różne komponenty z szkoleniem adversarialnym, i bezpośrednią syntezą fal wspólnie. W przeciwieństwie do frameworku StyleTTS, framework StyleTTS2 modeluje styl mowy jako zmienną latentną, i próbkuję ją za pomocą modeli dyfuzji, generując zróżnicowane próbki mowy bez użycia danych audio referencyjnych. Zobaczmy teraz te komponenty szczegółowo.
Szkolenie Końcowe do Interferencji
W frameworku StyleTTS2, wykorzystuje się podejście szkolenia końcowego, aby zoptymalizować różne komponenty syntezy mowy do interferencji bez konieczności polegania na stałych komponentach. Framework StyleTTS2 osiąga to, modyfikując dekoder, aby wygenerować falę bezpośrednio z wektora stylu, krzywych pitchu i energii, i reprezentacji wyśrodkowanych. Następnie usuwa ostatnią warstwę projekcyjną dekodera i zastępuje ją dekodera fal. Framework StyleTTS2 wykorzystuje dwa kodery: dekoder HifiGAN, aby wygenerować falę bezpośrednio, i dekoder iSTFT, aby wyprodukować fazę i wielkość, które są konwertowane w falę dla szybszej interferencji i szkolenia.

Powyższy rysunek reprezentuje modele akustyczne wykorzystywane do wstępnego szkolenia i szkolenia wspólnego. Aby zmniejszyć czas szkolenia, moduły są najpierw zoptymalizowane w fazie wstępnego szkolenia, a następnie zoptymalizowane są wszystkie komponenty, z wyjątkiem ekstraktora pitchu, podczas szkolenia wspólnego. Powodem, dla którego szkolenie wspólne nie optymalizuje ekstraktora pitchu, jest to, że jest on wykorzystywany do dostarczania danych wejściowych dla krzywych pitchu.

Powyższy rysunek reprezentuje szkolenie adversarialne modelu języka mówionego i interferencję z frameworkiem WavLM, który jest wstępnie wytrenowany, ale nie wytrenowany. Proces ten różni się od powyższego, ponieważ może przyjmować różne dane wejściowe tekstowe, ale akumuluje gradienty, aby zaktualizować parametry w każdej partii.
Dyfuzja Stylu
Framework StyleTTS2 ma na celu modelowanie mowy jako warunkowaną dystrybucję przez zmienną latentną, która podąża za dystrybucją warunkową, i ta zmienna jest nazywana uogólnionym stylem mowy, i reprezentuje każdą cechę w próbce mowy poza zakresem treści fonetycznej, w tym stres leksykalny, prozodię, szybkość mówienia i nawet przejścia formantów.
Dyskryminatory Modelu Języka Mówionego
Modele języka mówionego są znane ze swoich ogólnych zdolności do zakodowania cennych informacji na temat szerokiego zakresu semantyki i aspektów akustycznych, a reprezentacje SLM są tradycyjnie w stanie naśladować percepcję ludzką, aby ocenić jakość wygenerowanej mowy syntetycznej. Framework StyleTTS2 wykorzystuje podejście szkolenia adversarialnego, aby wykorzystać zdolność encoderów SLM do wykonywania zadań generatywnych, i zatrudnia 12-warstwowy framework WavLM jako dyskryminator. To podejście pozwala frameworkowi na szkolenie na tekstach poza dystrybucją, co może pomóc w poprawie wyników. Dodatkowo, aby zapobiec problemom przeszkolenia, framework próbkuję teksty poza dystrybucją i w dystrybucji z równym prawdopodobieństwem.
Modelowanie Trwania Różniczkowe
Tradycyjnie, predykator trwania jest wykorzystywany w frameworkach syntezy mowy, który produkuje trwania fonemów, ale metody upsamplingu, które te predykatory trwania wykorzystują, często blokują przepływ gradientu podczas procesu szkolenia końcowego, i framework NaturalSpeech wykorzystuje upsampler oparty na uwadze dla konwersji mowy na poziomie ludzkim. Jednak framework StyleTTS2 uważa to podejście za niestabilne podczas szkolenia adversarialnego, ponieważ StyleTTS2 trenuje za pomocą różniczkowego upsamplingu z różniczkowym szkoleniem adversarialnym bez utraty dodatkowych terminów z powodu niezgodności długości z powodu odchyleń. Chociaż wykorzystanie miękkiego dynamicznego czasowego upsamplingu może pomóc w złagodzeniu tej niezgodności, jego stabilność jest również problemem przy pracy z celami adversarialnymi lub zadaniami rekonstrukcji mel. Dlatego, aby osiągnąć wyniki na poziomie ludzkim z szkoleniem adversarialnym i stabilizować proces szkolenia, framework StyleTTC2 wykorzystuje podejście nieparametryczne do upsamplingu. Upsampling Gaussa jest popularnym podejściem nieparametrycznym do konwersji przewidywanych trwań, chociaż ma ono swoje ograniczenia dzięki stałej długości jąder Gaussa, które są predeterminowane. To ograniczenie dla upsamplingu Gaussa ogranicza jego zdolność do dokładnego modelowania wyrównań o różnych długościach.
Aby spotkać to ograniczenie, framework StyleTTC2 proponuje wykorzystanie nowego podejścia nieparametrycznego do upsamplingu bez dodatkowego szkolenia, i które może uwzględniać zmienne długości wyrównań. Dla każdego fonemu, framework StyleTTC2 modeluje wyrównanie jako zmienną losową, i wskazuje indeks ramki mowy, z którą fonem jest wyrównany.
Szkolenie i Ocena Modelu
Framework StyleTTC2 jest szkolony i eksperymentowany na trzech zestawach danych: VCTK, LibriTTS i LJSpeech. Komponent jednomówcy frameworku StyleTTS2 jest szkolony za pomocą zestawu danych LJSpeech, który zawiera około 13 000 próbek audio, podzielonych na 12 500 próbek szkoleniowych, 100 próbek walidacyjnych i około 500 próbek testowych, z łącznym czasem trwania wynoszącym około 24 godziny. Komponent wielomówcy frameworku jest szkolony na zestawie danych VCTK, składającym się z ponad 44 000 klipów audio, z ponad 100 rodzimymi mówcami o różnych akcentach, i podzielonych na 43 500 próbek szkoleniowych, 100 próbek walidacyjnych i około 500 próbek testowych. Wreszcie, aby wyposażyć framework w zdolności adaptacji zero-shot, framework jest szkolony na połączonym zestawie danych LibriTTS, składającym się z klipów audio o łącznym czasie trwania około 250 godzin, z ponad 1 150 mówcami. Aby ocenić jego wyniki, model wykorzystuje dwie metryki: MOS-N lub Średni Współczynnik Opinii o Naturalności, i MOS-S lub Średni Współczynnik Opinii o Podobieństwie.

Wyniki
Podejście i metodologia wykorzystywana w frameworku StyleTTS2 jest pokazana w jego wynikach, ponieważ model przewyższa wiele frameworków syntezy mowy, w tym framework VITS na zestawie danych VCTK, i wyniki są pokazane na poniższym rysunku.

Model StyleTTS2 również przewyższa poprzednie modele na zestawie danych LJSpeech, i nie wykazuje żadnego stopnia degradacji jakości na tekstach poza dystrybucją, w przeciwieństwie do poprzednich frameworków na tych samych metrykach. Dodatkowo, w ustawieniu zero-shot, model StyleTTC2 przewyższa istniejący framework Vall-E w naturalności, chociaż pozostaje w tyle pod względem podobieństwa. Jednak warto zauważyć, że framework StyleTTS2 jest w stanie osiągnąć konkurencyjne wyniki, pomimo szkolenia tylko na 245 godzinach danych audio, w porównaniu z ponad 60 000 godzinami szkolenia dla frameworku Vall-E, co dowodzi, że StyleTTC2 jest wydajnym alternatywą dla istniejących dużych metod wstępnego szkolenia, takich jak te wykorzystywane w frameworku Vall-E.

Przechodząc dalej, ze względu na brak danych audio z etykietami emocjonalnymi, framework StyleTTC2 wykorzystuje model GPT-4 do wygenerowania ponad 500 instancji w różnych emocjach do wizualizacji wektorów stylu, które framework tworzy za pomocą swojego procesu dyfuzji.

Na pierwszym rysunku, style emocjonalne w odpowiedzi na sentymenty tekstu wejściowego są ilustrowane przez wektory stylu z modelu LJSpeech, i demonstrują zdolność frameworku StyleTTC2 do syntezy wyrazistej mowy z różnymi emocjami. Drugi rysunek przedstawia odrębne klastry dla każdego z pięciu indywidualnych mówców, co wskazuje na szeroki zakres różnorodności pochodzącej z jednego pliku audio. Ostateczny rysunek demonstruje luźny klaster emocji od mówcy 1, i ujawnia, że pomimo pewnych nakładających się, klastry emocjonalne są wyraźne, co wskazuje na możliwość manipulowania tonem emocjonalnym mówcy niezależnie od danych audio referencyjnych i ich tonu wejściowego. Pomimo wykorzystania podejścia opartego na dyfuzji, framework StyleTTS2 jest w stanie przewyższać istniejące frameworki stanu sztuki, w tym VITS, ProDiff i FastDiff.

Końcowe Myśli
W tym artykule omawialiśmy framework StyleTTS2, nowy, wytrzymały i innowacyjny framework syntezy mowy, który jest zbudowany na podstawie frameworku StyleTTS i ma na celu przedstawienie następnego kroku w kierunku systemów syntezy mowy na poziomie ludzkim. Framework StyleTTS2 modeluje style mowy jako latentne zmienne losowe i wykorzystuje probabilistyczny model dyfuzji do próbkowania tych stylów mowy lub zmiennych losowych, co pozwala frameworkowi StyleTTS2 na skuteczną syntezę realistycznej mowy bez użycia danych audio referencyjnych. Framework StyleTTS2 wykorzystuje dyfuzję stylu i dyskryminatory SLM, aby osiągnąć wyniki na poziomie ludzkim w zadaniach syntezy mowy i przewyższa istniejące frameworki stanu sztuki w szerokim zakresie zadań związanych z mową.












