KI-Modelle und Plattformen
StyleTTS 2: Menschliches Text-to-Speech mit groÃen Sprachmodellen
Aufgrund der zunehmenden natÞrlichen und synthetischen Sprachsynthese-AnsÃĪtze ist eine der wichtigsten Errungenschaften der KI-Industrie in den letzten Jahren die effektive Synthese von Text-to-Speech-Frameworks mit potenziellen Anwendungen in verschiedenen Branchen, einschlieÃlich HÃķrbÞchern, virtuellen Assistenten, Voice-over-ErzÃĪhlungen und mehr, mit einigen State-of-the-Art-Modellen, die menschliches Leistungsniveau und Effizienz in einer Vielzahl von sprachbezogenen Aufgaben liefern. Allerdings gibt es trotz ihrer starken Leistung noch Raum fÞr Verbesserungen bei Aufgaben aufgrund von expressiver und vielfÃĪltiger Sprache, Anforderungen an groÃe Mengen an Trainingsdaten fÞr die Optimierung von Zero-Shot-Text-to-Speech-Frameworks und Robustheit fÞr OOD- oder Out-of-Distribution-Texte, was Entwickler dazu bringt, an einem robusteren und zugÃĪnglicheren Text-to-Speech-Framework zu arbeiten.
In diesem Artikel werden wir Þber StyleTTS-2 sprechen, einem robusten und innovativen Text-to-Speech-Framework, das auf den Grundlagen des StyleTTS-Frameworks aufbaut und das nÃĪchste Schritt towards State-of-the-Art-Text-to-Speech-Systeme darstellt. Das StyleTTS2-Framework modelliert Sprachstile als latente Zufallsvariablen und verwendet ein probabilistisches Diffusionsmodell, um diese Sprachstile oder Zufallsvariablen zu sampeln, wodurch das StyleTTS2-Framework realistische Sprache effektiv ohne Referenzaudio-Eingaben synthetisieren kann. Aufgrund des Ansatzes kann das StyleTTS2-Framework bessere Ergebnisse liefern und zeigt eine hohe Effizienz im Vergleich zu aktuellen State-of-the-Art-Text-to-Speech-Frameworks, aber es kann auch von der vielfÃĪltigen Sprachsynthese profitieren, die von Diffusionsmodell-Frameworks angeboten wird. Wir werden das StyleTTS2-Framework genauer betrachten und Þber seine Architektur und Methodik sprechen, wÃĪhrend wir auch auf die Ergebnisse des Frameworks eingehen. Also los gehtâs.
StyleTTS2 fÞr Text-to-Speech-Synthese: Eine EinfÞhrung
StyleTTS2 ist ein innovatives Text-to-Speech-Synthese-Modell, das den nÃĪchsten Schritt zur Entwicklung von menschlichen TTS-Frameworks darstellt und auf StyleTTS aufbaut, einem style-basierten Text-to-Speech-Generativmodell. Das StyleTTS2-Framework modelliert Sprachstile als latente Zufallsvariablen und verwendet ein probabilistisches Diffusionsmodell, um diese Sprachstile oder Zufallsvariablen zu sampeln, wodurch das StyleTTS2-Framework realistische Sprache effektiv ohne Referenzaudio-Eingaben synthetisieren kann. Das Modellieren von Stilen als latente Zufallsvariablen unterscheidet das StyleTTS2-Framework von seinem VorgÃĪnger, dem StyleTTS-Framework, und zielt darauf ab, den geeignetsten Sprachstil fÞr den Eingabetext ohne Referenzaudio-Eingabe zu generieren und effektive latente Diffusionen zu ermÃķglichen, wÃĪhrend es von den vielfÃĪltigen Sprachsynthese-FÃĪhigkeiten von Diffusionsmodellen profitiert. DarÞber hinaus verwendet das StyleTTS2-Framework auch vorgefertigte groÃe SLM- oder Sprachmodell-Diskriminatoren wie das WavLM-Framework und kombiniert es mit seinem eigenen neuartigen differentiellen Dauermodellierungsansatz, um das Framework von Ende zu Ende zu trainieren und letztendlich Sprache mit verbesserter NatÞrlichkeit zu generieren. Aufgrund des Ansatzes, den es verfolgt, Þbertrifft das StyleTTS2-Framework aktuelle State-of-the-Art-Frameworks fÞr Sprachgenerierungsaufgaben und ist eines der effizientesten Frameworks fÞr die Vorbereitung groÃer Sprachmodelle in Zero-Shot-Einstellungen fÞr Sprecheranpassungsaufgaben.
Weiterhin, um menschliches Text-to-Speech zu synthetisieren, integriert das StyleTTs2-Framework die Erkenntnisse aus bestehenden Arbeiten, einschlieÃlich Diffusionsmodellen fÞr Sprachsynthese und groÃen Sprachmodellen. Diffusionsmodelle werden normalerweise fÞr Sprachsynthese-Aufgaben aufgrund ihrer FÃĪhigkeiten zur Feinabstimmung von Sprache und vielfÃĪltigen Sprachsamplings verwendet. Allerdings sind Diffusionsmodelle nicht so effizient wie GAN-basierte nicht-iterative Frameworks, und ein Grund dafÞr ist die Anforderung, latente ReprÃĪsentationen, Wellenformen und Mel-Spektrogramme iterativ bis zur Ziel-Dauer der Sprache zu sampeln.
Andererseits haben jÞngste Arbeiten Þber groÃe Sprachmodelle ihre FÃĪhigkeit gezeigt, die QualitÃĪt von Text-to-Speech-Generierungsaufgaben zu verbessern und sich gut an den Sprecher anzupassen. GroÃe Sprachmodelle konvertieren normalerweise Texteingaben entweder in quantisierte oder kontinuierliche ReprÃĪsentationen, die von vorgefertigten Sprachmodell-Frameworks fÞr Sprachrekonstruktionsaufgaben abgeleitet werden. Allerdings sind die Merkmale dieser Sprachmodelle nicht direkt fÞr Sprachsynthese optimiert. Im Gegensatz dazu nutzt das StyleTTS2-Framework die Erkenntnisse, die von groÃen SLM-Frameworks durch adversariales Training gewonnen wurden, um Sprachmodell-Merkmale ohne latente Raumkarten zu synthetisieren und lernt somit einen sprachsynthese-optimierten latenten Raum direkt.
StyleTTS2: Architektur und Methodik
Im Kern basiert StyleTTS2 auf seinem VorgÃĪnger, dem StyleTTS-Framework, das ein nicht-autoregressives Text-to-Speech-Framework ist, das einen Stil-Encoder verwendet, um einen Stil-Vektor aus der Referenz-Audio abzuleiten, wodurch expressive und natÞrliche Sprachgenerierung ermÃķglicht wird. Der Stil-Vektor, der im StyleTTS-Framework verwendet wird, wird direkt in den Encoder, die Dauer und die PrÃĪdiktoren durch die Verwendung von AdaIN oder adaptiver Instanznormalisierung eingefÞgt, wodurch das StyleTTS-Modell Sprachausgaben mit variierender Prosodie, Dauer und sogar Emotionen generieren kann. Das StyleTTS-Framework besteht aus 8 Modellen, die in drei Kategorien unterteilt sind
- Akustische Modelle oder Sprachgenerierungssystem mit einem Stil-Encoder, einem Text-Encoder und einem Sprachdecoder.
- Ein Text-to-Speech-PrÃĪdiktions-System, das Prosodie und DauerprÃĪdiktoren verwendet.
- Ein Utility-System, das einen Text-Aligner, einen Pitch-Extractor und einen Diskriminator fÞr Trainingszwecke enthÃĪlt.
Aufgrund seines Ansatzes liefert das StyleTTS-Framework State-of-the-Art-Leistung in Bezug auf kontrollierbare und vielfÃĪltige Sprachsynthese. Allerdings hat diese Leistung ihre Nachteile, wie die Verschlechterung der Sample-QualitÃĪt, expressive EinschrÃĪnkungen und AbhÃĪngigkeit von sprachbehindernden Anwendungen in Echtzeit.
Das StyleTTS2-Modell verbessert das StyleTTS-Framework und liefert verbesserte expressive Text-to-Speech-Aufgaben mit verbesserter Out-of-Distribution-Leistung und hoher menschlicher QualitÃĪt. Das StyleTTS2-Framework verwendet ein End-to-End-Trainingsverfahren, das die verschiedenen Komponenten mit adversarialem Training und direkter Wellenform-Synthese gemeinsam optimiert. Im Gegensatz zum StyleTTS-Framework modelliert das StyleTTS2-Framework den Sprachstil als eine latente Variable und sampelt ihn durch Diffusionsmodelle, wodurch diverse Sprachsamples ohne Referenz-Audio generiert werden kÃķnnen. Lassen Sie uns diese Komponenten genauer betrachten.
End-to-End-Training fÞr Interferenz
Im StyleTTS2-Framework wird ein End-to-End-Trainingsansatz verwendet, um verschiedene Text-to-Speech-Komponenten fÞr Interferenz ohne festgelegte Komponenten zu optimieren. Das StyleTTS2-Framework erreicht dies, indem es den Decoder modifiziert, um die Wellenform direkt aus dem Stil-Vektor, Pitch- und Energie-Kurven und ausgerichteten ReprÃĪsentationen zu generieren. Das Framework entfernt dann die letzte Projektionsebene des Decoders und ersetzt sie durch einen Wellenform-Decoder. Das StyleTTS2-Framework verwendet zwei Encoder: einen HifiGAN-basierten Decoder, um die Wellenform direkt zu generieren, und einen iSTFT-basierten Decoder, um Phase und GrÃķÃe zu produzieren, die in Wellenformen fÞr schnelleres Training und Interferenz umgewandelt werden.

Die obige Abbildung stellt die akustischen Modelle dar, die fÞr die Vorbereitung und gemeinsame Ausbildung verwendet werden. Um die Trainingszeit zu reduzieren, werden die Module zunÃĪchst in der Vorbereitungsphase optimiert, gefolgt von der Optimierung aller Komponenten auÃer dem Pitch-Extractor wÃĪhrend der gemeinsamen Ausbildung. Der Grund, warum die gemeinsame Ausbildung den Pitch-Extractor nicht optimiert, liegt darin, dass er verwendet wird, um die Grundwahrheit fÞr Pitch-Kurven bereitzustellen.

Die obige Abbildung stellt die Sprachmodell-Adversarial-Ausbildung und Interferenz mit dem WavLM-Framework dar, das vorgefertigt, aber nicht vorgepasst ist. Der Prozess unterscheidet sich von dem oben genannten, da er unterschiedliche Eingabetexte verwenden kann, aber die Gradienten ansammelt, um die Parameter in jedem Batch zu aktualisieren.
Stil-Diffusion
Das StyleTTS2-Framework zielt darauf ab, Sprache als eine bedingte Verteilung durch eine latente Variable zu modellieren, die der bedingten Verteilung folgt, und diese Variable wird als generalisierter Sprachstil bezeichnet und reprÃĪsentiert jede Eigenschaft in der Sprachprobe, die Þber den Bereich von phonetischem Inhalt hinausgeht, einschlieÃlich lexikalischer Betonung, Prosodie, Sprechgeschwindigkeit und sogar FormantÞbergÃĪngen.
Sprachmodell-Diskriminatoren
Sprachmodelle sind bekannt fÞr ihre allgemeinen FÃĪhigkeiten, wertvolle Informationen Þber eine breite Palette von Semantiken und akustischen Aspekten zu kodieren, und SLM-ReprÃĪsentationen haben traditionell die FÃĪhigkeit, menschliche Wahrnehmungen zu imitieren, um die QualitÃĪt der generierten synthetischen Sprache zu bewerten. Das StyleTTS2-Framework verwendet einen adversarialen Trainingsansatz, um die FÃĪhigkeit von SLM-Encodern fÞr generative Aufgaben zu nutzen und verwendet ein 12-Schichten-WavLM-Framework als Diskriminator. Dieser Ansatz ermÃķglicht es dem Framework, Training auf OOD- oder Out-of-Distribution-Texten zu ermÃķglichen, was die Leistung verbessern kann. DarÞber hinaus sampelt das Framework OOD-Texte und In-Distribution-Texte mit gleicher Wahrscheinlichkeit, um Ãberanpassungsprobleme zu vermeiden.
Differenzielles Dauermodellierung
Traditionell wird in Text-to-Speech-Frameworks ein DauerprÃĪdiktor verwendet, der Phonem-Dauern produziert, aber die Aufsammlungsmethoden, die diese DauerprÃĪdiktoren verwenden, blockieren oft den Gradientenfluss wÃĪhrend des End-to-End-Trainingsprozesses, und das NaturalSpeech-Framework verwendet einen attention-basierten Upsampler fÞr menschliche Text-to-Speech-Konversion. Allerdings findet das StyleTTS2-Framework diesen Ansatz wÃĪhrend des adversarialen Trainings instabil, da das StyleTTS2-Training mit differenzieller Aufsammlung ohne Verlust von zusÃĪtzlichen Begriffen aufgrund von LÃĪngenunterschieden durchgefÞhrt wird. Obwohl die Verwendung eines weichen dynamischen Zeit-Warping-Ansatzes helfen kann, diesen Unterschied zu mildern, ist die Verwendung davon nicht nur rechenintensiv, sondern auch instabil, wenn es um adversarialen Objektive oder Mel-Rekonstruktionsaufgaben geht. Daher verwendet das StyleTTC2-Framework einen nicht-parametrischen Aufsammlungsansatz, um menschliches Leistungsniveau mit adversarialem Training zu erreichen und den Trainingsprozess zu stabilisieren.
Um diese EinschrÃĪnkung zu Þberwinden, schlÃĪgt das StyleTTC2-Framework vor, einen neuen nicht-parametrischen Aufsammlungsansatz ohne zusÃĪtzliches Training zu verwenden, der in der Lage ist, unterschiedliche LÃĪngen von Ausrichtungen zu berÞcksichtigen. FÞr jedes Phonem modelliert das StyleTTC2-Framework die Ausrichtung als eine Zufallsvariable und zeigt den Index des Sprachrahmens an, mit dem das Phonem ausgerichtet ist.
Modell-Training und Auswertung
Das StyleTTC2-Framework wird auf drei Datenbanken trainiert und experimentiert: VCTK, LibriTTS und LJSpeech. Die Single-Speaker-Komponente des StyleTTS2-Frameworks wird mit der LJSpeech-Datenbank trainiert, die etwa 13.000+ Audio-Beispiele enthÃĪlt, die in 12.500 Trainingsbeispiele, 100 Validierungsbeispiele und etwa 500 Testbeispiele unterteilt sind, mit einer Gesamtlaufzeit von etwa 24 Stunden. Die Multi-Speaker-Komponente des Frameworks wird auf der VCTK-Datenbank trainiert, die Þber 44.000 Audio-Clips mit Þber 100 einzelnen Muttersprachlern mit unterschiedlichen Akzenten enthÃĪlt und in 43.500 Trainingsbeispiele, 100 Validierungsbeispiele und etwa 500 Testbeispiele unterteilt ist. SchlieÃlich wird das Framework auf der kombinierten LibriTTS-Datenbank trainiert, die Audio-Clips enthÃĪlt, die etwa 250 Stunden Audio mit Þber 1.150 einzelnen Sprechern umfassen. Um seine Leistung zu bewerten, verwendet das Modell zwei Metriken: MOS-N oder Mean Opinion Score of Naturalness und MOS-S oder Mean Opinion Score of Similarity.

Ergebnisse
Der Ansatz und die Methodik, die im StyleTTS2-Framework verwendet werden, werden in seiner Leistung demonstriert, da das Modell mehrere State-of-the-Art-TTS-Frameworks Þbertrifft, insbesondere auf der NaturalSpeech-Datenbank, und dabei einen neuen Standard fÞr die Datenbank setzt. DarÞber hinaus Þbertrifft das StyleTTS2-Framework das State-of-the-Art-VITS-Framework auf der VCTK-Datenbank, und die Ergebnisse werden in der folgenden Abbildung dargestellt.

Das StyleTTS2-Modell Þbertrifft auch vorherige Modelle auf der LJSpeech-Datenbank und zeigt keine Verschlechterung der QualitÃĪt auf OOD- oder Out-of-Distribution-Texten, wie es bei vorherigen Frameworks auf denselben Metriken der Fall war. DarÞber hinaus Þbertrifft das StyleTTC2-Modell in Zero-Shot-Einstellungen das bestehende Vall-E-Framework in Bezug auf NatÞrlichkeit, obwohl es in Bezug auf Ãhnlichkeit zurÞckbleibt. Es ist jedoch zu beachten, dass das StyleTTS2-Framework eine wettbewerbsfÃĪhige Leistung erzielt, obwohl es nur 245 Stunden Audio-Beispiele trainiert hat, im Vergleich zu Þber 60.000 Stunden Training fÞr das Vall-E-Framework, was es zu einer dateneffizienten Alternative zu bestehenden groÃen Vorbereitungsmethoden macht, wie sie im Vall-E-Framework verwendet werden.

Weiterhin, aufgrund des Fehlens von Emotionen-kennzeichneten Audio-Text-Daten, verwendet das StyleTTC2-Framework das GPT-4-Modell, um Þber 500 Instanzen Þber verschiedene Emotionen fÞr die Visualisierung von Stil-Vektoren zu generieren, die das Framework mit seinem Diffusionsprozess erstellt.

In der ersten Abbildung werden emotionale Stile in Reaktion auf Text-Sentiments durch die Stil-Vektoren des LJSpeech-Modells illustriert und demonstrieren die FÃĪhigkeit des StyleTTC2-Frameworks, expressive Sprache mit verschiedenen Emotionen zu synthetisieren. Die zweite Abbildung zeigt deutliche Cluster fÞr jeden der fÞnf einzelnen Sprecher, was eine breite Palette von Vielfalt aus einer einzelnen Audio-Datei zeigt. Die finale Abbildung zeigt einen lockeren Cluster von Emotionen von Sprecher 1 und zeigt, dass, trotz einiger Ãberlappungen, emotionale Cluster prominent sind, was auf die MÃķglichkeit hinweist, die emotionale Note eines Sprechers unabhÃĪngig von der Referenz-Audio-Beispiel und ihrer EingabentonhÃķhe zu manipulieren. Trotz der Verwendung eines Diffusions-basierten Ansatzes Þbertrifft das StyleTTS2-Framework bestehende State-of-the-Art-Frameworks, einschlieÃlich VITS, ProDiff und FastDiff.

Letzte Gedanken
In diesem Artikel haben wir Þber StyleTTS2 gesprochen, einem neuen, robusten und innovativen Text-to-Speech-Framework, das auf den Grundlagen des StyleTTS-Frameworks aufbaut und das nÃĪchste Schritt towards State-of-the-Art-Text-to-Speech-Systeme darstellt. Das StyleTTS2-Framework modelliert Sprachstile als latente Zufallsvariablen und verwendet ein probabilistisches Diffusionsmodell, um diese Sprachstile oder Zufallsvariablen zu sampeln, wodurch das StyleTTS2-Framework realistische Sprache effektiv ohne Referenzaudio-Eingaben synthetisieren kann. Das StyleTTS2-Framework verwendet Stil-Diffusion und SLM-Diskriminatoren, um menschliches Leistungsniveau auf Text-to-Speech-Aufgaben zu erreichen und Þbertrifft bestehende State-of-the-Art-Frameworks auf einer breiten Palette von Sprachaufgaben.












