KI-Modelle und Plattformen
StyleTTS 2: Menschliches Text-to-Speech mit großen Sprachmodellen
Aufgrund der zunehmenden natürlichen und synthetischen Sprachsynthese-Ansätze ist eine der wichtigsten Errungenschaften der KI-Industrie in den letzten Jahren die effektive Synthese von Text-to-Speech-Frameworks mit potenziellen Anwendungen in verschiedenen Branchen, einschließlich Hörbüchern, virtuellen Assistenten, Voice-over-Erzählungen und mehr, mit einigen State-of-the-Art-Modellen, die menschliches Leistungsniveau und Effizienz in einer Vielzahl von sprachbezogenen Aufgaben liefern. Allerdings gibt es trotz ihrer starken Leistung noch Raum für Verbesserungen bei Aufgaben aufgrund von expressiver und vielfältiger Sprache, Anforderungen an große Mengen an Trainingsdaten für die Optimierung von Zero-Shot-Text-to-Speech-Frameworks und Robustheit für OOD- oder Out-of-Distribution-Texte, was Entwickler dazu bringt, an einem robusteren und zugänglicheren Text-to-Speech-Framework zu arbeiten.
In diesem Artikel werden wir über StyleTTS-2 sprechen, einem robusten und innovativen Text-to-Speech-Framework, das auf den Grundlagen des StyleTTS-Frameworks aufbaut und das nächste Schritt towards State-of-the-Art-Text-to-Speech-Systeme darstellt. Das StyleTTS2-Framework modelliert Sprachstile als latente Zufallsvariablen und verwendet ein probabilistisches Diffusionsmodell, um diese Sprachstile oder Zufallsvariablen zu sampeln, wodurch das StyleTTS2-Framework realistische Sprache effektiv ohne Referenzaudio-Eingaben synthetisieren kann. Aufgrund des Ansatzes kann das StyleTTS2-Framework bessere Ergebnisse liefern und zeigt eine hohe Effizienz im Vergleich zu aktuellen State-of-the-Art-Text-to-Speech-Frameworks, aber es kann auch von der vielfältigen Sprachsynthese profitieren, die von Diffusionsmodell-Frameworks angeboten wird. Wir werden das StyleTTS2-Framework genauer betrachten und über seine Architektur und Methodik sprechen, während wir auch auf die Ergebnisse des Frameworks eingehen. Also los geht’s.
StyleTTS2 für Text-to-Speech-Synthese: Eine Einführung
StyleTTS2 ist ein innovatives Text-to-Speech-Synthese-Modell, das den nächsten Schritt zur Entwicklung von menschlichen TTS-Frameworks darstellt und auf StyleTTS aufbaut, einem style-basierten Text-to-Speech-Generativmodell. Das StyleTTS2-Framework modelliert Sprachstile als latente Zufallsvariablen und verwendet ein probabilistisches Diffusionsmodell, um diese Sprachstile oder Zufallsvariablen zu sampeln, wodurch das StyleTTS2-Framework realistische Sprache effektiv ohne Referenzaudio-Eingaben synthetisieren kann. Das Modellieren von Stilen als latente Zufallsvariablen unterscheidet das StyleTTS2-Framework von seinem Vorgänger, dem StyleTTS-Framework, und zielt darauf ab, den geeignetsten Sprachstil für den Eingabetext ohne Referenzaudio-Eingabe zu generieren und effektive latente Diffusionen zu ermöglichen, während es von den vielfältigen Sprachsynthese-Fähigkeiten von Diffusionsmodellen profitiert. Darüber hinaus verwendet das StyleTTS2-Framework auch vorgefertigte große SLM- oder Sprachmodell-Diskriminatoren wie das WavLM-Framework und kombiniert es mit seinem eigenen neuartigen differentiellen Dauermodellierungsansatz, um das Framework von Ende zu Ende zu trainieren und letztendlich Sprache mit verbesserter Natürlichkeit zu generieren. Aufgrund des Ansatzes, den es verfolgt, übertrifft das StyleTTS2-Framework aktuelle State-of-the-Art-Frameworks für Sprachgenerierungsaufgaben und ist eines der effizientesten Frameworks für die Vorbereitung großer Sprachmodelle in Zero-Shot-Einstellungen für Sprecheranpassungsaufgaben.
Weiterhin, um menschliches Text-to-Speech zu synthetisieren, integriert das StyleTTs2-Framework die Erkenntnisse aus bestehenden Arbeiten, einschließlich Diffusionsmodellen für Sprachsynthese und großen Sprachmodellen. Diffusionsmodelle werden normalerweise für Sprachsynthese-Aufgaben aufgrund ihrer Fähigkeiten zur Feinabstimmung von Sprache und vielfältigen Sprachsamplings verwendet. Allerdings sind Diffusionsmodelle nicht so effizient wie GAN-basierte nicht-iterative Frameworks, und ein Grund dafür ist die Anforderung, latente Repräsentationen, Wellenformen und Mel-Spektrogramme iterativ bis zur Ziel-Dauer der Sprache zu sampeln.
Andererseits haben jüngste Arbeiten über große Sprachmodelle ihre Fähigkeit gezeigt, die Qualität von Text-to-Speech-Generierungsaufgaben zu verbessern und sich gut an den Sprecher anzupassen. Große Sprachmodelle konvertieren normalerweise Texteingaben entweder in quantisierte oder kontinuierliche Repräsentationen, die von vorgefertigten Sprachmodell-Frameworks für Sprachrekonstruktionsaufgaben abgeleitet werden. Allerdings sind die Merkmale dieser Sprachmodelle nicht direkt für Sprachsynthese optimiert. Im Gegensatz dazu nutzt das StyleTTS2-Framework die Erkenntnisse, die von großen SLM-Frameworks durch adversariales Training gewonnen wurden, um Sprachmodell-Merkmale ohne latente Raumkarten zu synthetisieren und lernt somit einen sprachsynthese-optimierten latenten Raum direkt.
StyleTTS2: Architektur und Methodik
Im Kern basiert StyleTTS2 auf seinem Vorgänger, dem StyleTTS-Framework, das ein nicht-autoregressives Text-to-Speech-Framework ist, das einen Stil-Encoder verwendet, um einen Stil-Vektor aus der Referenz-Audio abzuleiten, wodurch expressive und natürliche Sprachgenerierung ermöglicht wird. Der Stil-Vektor, der im StyleTTS-Framework verwendet wird, wird direkt in den Encoder, die Dauer und die Prädiktoren durch die Verwendung von AdaIN oder adaptiver Instanznormalisierung eingefügt, wodurch das StyleTTS-Modell Sprachausgaben mit variierender Prosodie, Dauer und sogar Emotionen generieren kann. Das StyleTTS-Framework besteht aus 8 Modellen, die in drei Kategorien unterteilt sind
- Akustische Modelle oder Sprachgenerierungssystem mit einem Stil-Encoder, einem Text-Encoder und einem Sprachdecoder.
- Ein Text-to-Speech-Prädiktions-System, das Prosodie und Dauerprädiktoren verwendet.
- Ein Utility-System, das einen Text-Aligner, einen Pitch-Extractor und einen Diskriminator für Trainingszwecke enthält.
Aufgrund seines Ansatzes liefert das StyleTTS-Framework State-of-the-Art-Leistung in Bezug auf kontrollierbare und vielfältige Sprachsynthese. Allerdings hat diese Leistung ihre Nachteile, wie die Verschlechterung der Sample-Qualität, expressive Einschränkungen und Abhängigkeit von sprachbehindernden Anwendungen in Echtzeit.
Das StyleTTS2-Modell verbessert das StyleTTS-Framework und liefert verbesserte expressive Text-to-Speech-Aufgaben mit verbesserter Out-of-Distribution-Leistung und hoher menschlicher Qualität. Das StyleTTS2-Framework verwendet ein End-to-End-Trainingsverfahren, das die verschiedenen Komponenten mit adversarialem Training und direkter Wellenform-Synthese gemeinsam optimiert. Im Gegensatz zum StyleTTS-Framework modelliert das StyleTTS2-Framework den Sprachstil als eine latente Variable und sampelt ihn durch Diffusionsmodelle, wodurch diverse Sprachsamples ohne Referenz-Audio generiert werden können. Lassen Sie uns diese Komponenten genauer betrachten.
End-to-End-Training für Interferenz
Im StyleTTS2-Framework wird ein End-to-End-Trainingsansatz verwendet, um verschiedene Text-to-Speech-Komponenten für Interferenz ohne festgelegte Komponenten zu optimieren. Das StyleTTS2-Framework erreicht dies, indem es den Decoder modifiziert, um die Wellenform direkt aus dem Stil-Vektor, Pitch- und Energie-Kurven und ausgerichteten Repräsentationen zu generieren. Das Framework entfernt dann die letzte Projektionsebene des Decoders und ersetzt sie durch einen Wellenform-Decoder. Das StyleTTS2-Framework verwendet zwei Encoder: einen HifiGAN-basierten Decoder, um die Wellenform direkt zu generieren, und einen iSTFT-basierten Decoder, um Phase und Größe zu produzieren, die in Wellenformen für schnelleres Training und Interferenz umgewandelt werden.

Die obige Abbildung stellt die akustischen Modelle dar, die für die Vorbereitung und gemeinsame Ausbildung verwendet werden. Um die Trainingszeit zu reduzieren, werden die Module zunächst in der Vorbereitungsphase optimiert, gefolgt von der Optimierung aller Komponenten außer dem Pitch-Extractor während der gemeinsamen Ausbildung. Der Grund, warum die gemeinsame Ausbildung den Pitch-Extractor nicht optimiert, liegt darin, dass er verwendet wird, um die Grundwahrheit für Pitch-Kurven bereitzustellen.

Die obige Abbildung stellt die Sprachmodell-Adversarial-Ausbildung und Interferenz mit dem WavLM-Framework dar, das vorgefertigt, aber nicht vorgepasst ist. Der Prozess unterscheidet sich von dem oben genannten, da er unterschiedliche Eingabetexte verwenden kann, aber die Gradienten ansammelt, um die Parameter in jedem Batch zu aktualisieren.
Stil-Diffusion
Das StyleTTS2-Framework zielt darauf ab, Sprache als eine bedingte Verteilung durch eine latente Variable zu modellieren, die der bedingten Verteilung folgt, und diese Variable wird als generalisierter Sprachstil bezeichnet und repräsentiert jede Eigenschaft in der Sprachprobe, die über den Bereich von phonetischem Inhalt hinausgeht, einschließlich lexikalischer Betonung, Prosodie, Sprechgeschwindigkeit und sogar Formantübergängen.
Sprachmodell-Diskriminatoren
Sprachmodelle sind bekannt für ihre allgemeinen Fähigkeiten, wertvolle Informationen über eine breite Palette von Semantiken und akustischen Aspekten zu kodieren, und SLM-Repräsentationen haben traditionell die Fähigkeit, menschliche Wahrnehmungen zu imitieren, um die Qualität der generierten synthetischen Sprache zu bewerten. Das StyleTTS2-Framework verwendet einen adversarialen Trainingsansatz, um die Fähigkeit von SLM-Encodern für generative Aufgaben zu nutzen und verwendet ein 12-Schichten-WavLM-Framework als Diskriminator. Dieser Ansatz ermöglicht es dem Framework, Training auf OOD- oder Out-of-Distribution-Texten zu ermöglichen, was die Leistung verbessern kann. Darüber hinaus sampelt das Framework OOD-Texte und In-Distribution-Texte mit gleicher Wahrscheinlichkeit, um Überanpassungsprobleme zu vermeiden.
Differenzielles Dauermodellierung
Traditionell wird in Text-to-Speech-Frameworks ein Dauerprädiktor verwendet, der Phonem-Dauern produziert, aber die Aufsammlungsmethoden, die diese Dauerprädiktoren verwenden, blockieren oft den Gradientenfluss während des End-to-End-Trainingsprozesses, und das NaturalSpeech-Framework verwendet einen attention-basierten Upsampler für menschliche Text-to-Speech-Konversion. Allerdings findet das StyleTTS2-Framework diesen Ansatz während des adversarialen Trainings instabil, da das StyleTTS2-Training mit differenzieller Aufsammlung ohne Verlust von zusätzlichen Begriffen aufgrund von Längenunterschieden durchgeführt wird. Obwohl die Verwendung eines weichen dynamischen Zeit-Warping-Ansatzes helfen kann, diesen Unterschied zu mildern, ist die Verwendung davon nicht nur rechenintensiv, sondern auch instabil, wenn es um adversarialen Objektive oder Mel-Rekonstruktionsaufgaben geht. Daher verwendet das StyleTTC2-Framework einen nicht-parametrischen Aufsammlungsansatz, um menschliches Leistungsniveau mit adversarialem Training zu erreichen und den Trainingsprozess zu stabilisieren.
Um diese Einschränkung zu überwinden, schlägt das StyleTTC2-Framework vor, einen neuen nicht-parametrischen Aufsammlungsansatz ohne zusätzliches Training zu verwenden, der in der Lage ist, unterschiedliche Längen von Ausrichtungen zu berücksichtigen. Für jedes Phonem modelliert das StyleTTC2-Framework die Ausrichtung als eine Zufallsvariable und zeigt den Index des Sprachrahmens an, mit dem das Phonem ausgerichtet ist.
Modell-Training und Auswertung
Das StyleTTC2-Framework wird auf drei Datenbanken trainiert und experimentiert: VCTK, LibriTTS und LJSpeech. Die Single-Speaker-Komponente des StyleTTS2-Frameworks wird mit der LJSpeech-Datenbank trainiert, die etwa 13.000+ Audio-Beispiele enthält, die in 12.500 Trainingsbeispiele, 100 Validierungsbeispiele und etwa 500 Testbeispiele unterteilt sind, mit einer Gesamtlaufzeit von etwa 24 Stunden. Die Multi-Speaker-Komponente des Frameworks wird auf der VCTK-Datenbank trainiert, die über 44.000 Audio-Clips mit über 100 einzelnen Muttersprachlern mit unterschiedlichen Akzenten enthält und in 43.500 Trainingsbeispiele, 100 Validierungsbeispiele und etwa 500 Testbeispiele unterteilt ist. Schließlich wird das Framework auf der kombinierten LibriTTS-Datenbank trainiert, die Audio-Clips enthält, die etwa 250 Stunden Audio mit über 1.150 einzelnen Sprechern umfassen. Um seine Leistung zu bewerten, verwendet das Modell zwei Metriken: MOS-N oder Mean Opinion Score of Naturalness und MOS-S oder Mean Opinion Score of Similarity.

Ergebnisse
Der Ansatz und die Methodik, die im StyleTTS2-Framework verwendet werden, werden in seiner Leistung demonstriert, da das Modell mehrere State-of-the-Art-TTS-Frameworks übertrifft, insbesondere auf der NaturalSpeech-Datenbank, und dabei einen neuen Standard für die Datenbank setzt. Darüber hinaus übertrifft das StyleTTS2-Framework das State-of-the-Art-VITS-Framework auf der VCTK-Datenbank, und die Ergebnisse werden in der folgenden Abbildung dargestellt.

Das StyleTTS2-Modell übertrifft auch vorherige Modelle auf der LJSpeech-Datenbank und zeigt keine Verschlechterung der Qualität auf OOD- oder Out-of-Distribution-Texten, wie es bei vorherigen Frameworks auf denselben Metriken der Fall war. Darüber hinaus übertrifft das StyleTTC2-Modell in Zero-Shot-Einstellungen das bestehende Vall-E-Framework in Bezug auf Natürlichkeit, obwohl es in Bezug auf Ähnlichkeit zurückbleibt. Es ist jedoch zu beachten, dass das StyleTTS2-Framework eine wettbewerbsfähige Leistung erzielt, obwohl es nur 245 Stunden Audio-Beispiele trainiert hat, im Vergleich zu über 60.000 Stunden Training für das Vall-E-Framework, was es zu einer dateneffizienten Alternative zu bestehenden großen Vorbereitungsmethoden macht, wie sie im Vall-E-Framework verwendet werden.

Weiterhin, aufgrund des Fehlens von Emotionen-kennzeichneten Audio-Text-Daten, verwendet das StyleTTC2-Framework das GPT-4-Modell, um über 500 Instanzen über verschiedene Emotionen für die Visualisierung von Stil-Vektoren zu generieren, die das Framework mit seinem Diffusionsprozess erstellt.

In der ersten Abbildung werden emotionale Stile in Reaktion auf Text-Sentiments durch die Stil-Vektoren des LJSpeech-Modells illustriert und demonstrieren die Fähigkeit des StyleTTC2-Frameworks, expressive Sprache mit verschiedenen Emotionen zu synthetisieren. Die zweite Abbildung zeigt deutliche Cluster für jeden der fünf einzelnen Sprecher, was eine breite Palette von Vielfalt aus einer einzelnen Audio-Datei zeigt. Die finale Abbildung zeigt einen lockeren Cluster von Emotionen von Sprecher 1 und zeigt, dass, trotz einiger Überlappungen, emotionale Cluster prominent sind, was auf die Möglichkeit hinweist, die emotionale Note eines Sprechers unabhängig von der Referenz-Audio-Beispiel und ihrer Eingabentonhöhe zu manipulieren. Trotz der Verwendung eines Diffusions-basierten Ansatzes übertrifft das StyleTTS2-Framework bestehende State-of-the-Art-Frameworks, einschließlich VITS, ProDiff und FastDiff.

Letzte Gedanken
In diesem Artikel haben wir über StyleTTS2 gesprochen, einem neuen, robusten und innovativen Text-to-Speech-Framework, das auf den Grundlagen des StyleTTS-Frameworks aufbaut und das nächste Schritt towards State-of-the-Art-Text-to-Speech-Systeme darstellt. Das StyleTTS2-Framework modelliert Sprachstile als latente Zufallsvariablen und verwendet ein probabilistisches Diffusionsmodell, um diese Sprachstile oder Zufallsvariablen zu sampeln, wodurch das StyleTTS2-Framework realistische Sprache effektiv ohne Referenzaudio-Eingaben synthetisieren kann. Das StyleTTS2-Framework verwendet Stil-Diffusion und SLM-Diskriminatoren, um menschliches Leistungsniveau auf Text-to-Speech-Aufgaben zu erreichen und übertrifft bestehende State-of-the-Art-Frameworks auf einer breiten Palette von Sprachaufgaben.












