Modele i platformy AI
HierSpeech++: Hierarchiczna Inferencja Variacyjna dla Syntezy Mowy Zero-Shot
Ostatnie postępy w dziedzinie dużych modeli językowych odegrały kluczową rolę w rozwoju ramowych modeli opartych na LLM dla generacji audio i syntezy mowy, szczególnie w ustawieniach zero-shot. Tradycyjne ramowe modele syntezy mowy doświadczyły znaczących postępów dzięki integracji dodatkowych funkcji, takich jak neuronalne kodeki audio dla dyskretnych jednostek audio i mowy. Mimo że te ramowe modele syntezy mowy i audio dostarczają zadowalające wyniki, nadal istnieje pole do poprawy, ponieważ bieżące ramowe modele audio oparte na LLM mają trzy główne ograniczenia
- Mają tendencję do auto-generowania wyjścia audio, co powoduje brak wytrzymałości i wolne prędkości interferencji, co skutkuje błędną wymową, pominięciem lub powtarzaniem.
- Mają tendencję do nadmiernej zależności od dyskretnych jednostek mowy lub wstępnie wytrenowanych neuronalnych kodeków audio.
- Często wymagają dużej ilości danych szkoleniowych.
Aby rozwiązać powyższe problemy i poprawić możliwości modeli syntezy mowy i audio opartych na LLM, twórcy opracowali HierSpeech++, wydajny i efektywny syntezator mowy zero-shot dla konwersji głosu i tekstu na mowę. Ramowy model HierSpeech++ opiera się na wiedzy dotyczącej hierarchicznej syntezy mowy, co nie tylko zwiększa wytrzymałość, ale także dodaje ekspresyjności syntetycznego wyjścia mowy, a także zwiększa naturalność i podobieństwo mówcy sztucznie generowanej mowy, nawet w ustawieniach zero-shot.
W tym artykule omówimy ramowy model HierSpeech++ szczegółowo, a także przyjrzymy się architekturze modelu, jego działaniu i wynikom w porównaniu z modelem stanu sztuki dla generacji tekstu i audio. Zatem zacznijmy.
HierSpeech++: Hierarchiczna Inferencja Variacyjna dla Syntezy Mowy Zero-Shot
HierSpeech++ to szybki, wydajny i efektywny ramowy model syntezy mowy zero-shot, który wykorzystuje hierarchiczną linię syntezy mowy i przyjmując tę końcową linię syntezy mowy, model HierSpeech++ jest w stanie maksymalizować potencjał generacji wysokiej jakości fal dźwiękowych, aby hierarchicznie pomostować lukę między reprezentacjami semantycznymi i akustycznymi, przyjmując samonauczącą reprezentację mowy jako reprezentację semantyczną mowy i tym samym próbuje rozwiązać bieżące ograniczenia adaptacji stylu. Końcowa linia syntezy mowy została po raz pierwszy wprowadzona przez model VITS, a przyjmuje VAE lub Variational Auto-Encoder z wzmocnionym szkoleniem i normalizującym przepływem. Ponadto, ramowe modele VAE z końcową linią szkolenia mają możliwość generowania wysokiej jakości fal dźwiękowych z jakością percepcyjną syntezy mowy znacznie lepszą niż ta generowana przez inne ramowe modele syntezy mowy.
Jakość rekonstrukcji audio tych ram może być dalej poprawiona przez użycie warunkowego hierarchicznego Variational AutoEncoder, jak w ramowym modelu HierSpeech. Pomimo ich potencjału, ramowe modele z końcową linią szkolenia mają pewne ograniczenia, szczególnie w ustawieniach zero-shot, ponieważ nawet jeśli mogą syntetyzować próbki mowy o wysokiej jakości audio, podobieństwo mówcy w zadaniach klonowania głosu zero-shot nadal jest obciążone wysoką złożonością obliczeniową. Z drugiej strony, modele syntezy mowy oparte na dyfuzji radzą sobie dobrze pod względem adaptacji mówcy, ale nadal są dalekie od ideału, ponieważ wykorzystują interaktywny proces generowania, który spowalnia prędkość inferencji, są często podatne na szumy danych i w wyniku niezgodności między szkoleniem a inferencją dwuetapowego procesu generowania między Mel-spectrogramem a wygenerowanym podłożem, jakość audio nie jest na poziomie.
Aby rozwiązać problemy, z którymi borykają się jego poprzednicy, model HierSpeech++ wykorzystuje syntezator mowy hierarchiczny, super-rozwiązanie mowy i komponent text-to-vec, i wprowadza ulepszony syntezator mowy hierarchiczny oparty na warunkowym Variational AutoEncoder. W celu poprawy jakości audio poza percepcyjną, ramowy model HierSpeech++ przyjmuje dual-audio, aby zwiększyć akustyczną posterior, i poprawia generalizację poza dystrybucją przez zastosowanie hierarchicznego generatora adaptacyjnego wyposażonego w warunkową i niezwarunkowaną generację. Ponadto, aby rozłączyć składniki mowy i poprawić informację semantyczną związaną z mówcą i niezwiązaną z mówcą, ramowy model HierSpeech++ przyjmuje również teorię źródłowo-filtrową opartą na wielościeżkowej reprezentacji semantycznej. W wyniku zastosowania Variational AutoEncoder, model HierSpeech++ może łączyć i uczyć reprezentacji hierarchicznie i stopniowo adaptować się do stylu głosu docelowego, aby inferować falę dźwiękową. Dodatkowo, ramowy model HierSpeech++ wdrożony jest również siecią normalizujących transformatorów z dwukierunkowym przepływem, aby poprawić adaptację i zmniejszyć niezgodność między szkoleniem a inferencją.
…












