KI-Modelle und Plattformen
HierSpeech++: Hierarchische Variationale Inferenz für Zero-Shot-Sprachsynthese
Die jüngsten Entwicklungen und Fortschritte in den Fähigkeiten großer Sprachmodelle haben eine wichtige Rolle bei der Weiterentwicklung von LLM-basierten Frameworks für Audio-Generierung und Sprachsynthese-Aufgaben gespielt, insbesondere im Zero-Shot-Szenario. Traditionelle Sprachsynthese-Frameworks haben aufgrund der Integration zusätzlicher Funktionen wie neuraler Audio-Codecs für diskrete Audio- und SprachEinheiten erhebliche Fortschritte gemacht. Obwohl diese Sprach- und Audio-Synthese-Frameworks zufriedenstellende Ergebnisse liefern, gibt es noch Raum für Verbesserungen, da die aktuellen LLM-basierten Audio-Frameworks die folgenden drei großen Einschränkungen aufweisen
- Sie neigen dazu, automatisch Audio-Ausgaben zu generieren, was letztendlich zu einem Mangel an Robustheit und langsamen Interferenzgeschwindigkeiten führt und zu Fehlern wie Falschprononciation, Auslassung oder Wiederholung führt.
- Sie neigen dazu, zu sehr auf diskrete SprachEinheiten oder vorgefertigte neurale Audio-Codecs zu vertrauen.
- Sie erfordern oft eine große Menge an Trainingsdaten.
Um die oben genannten Probleme zu lösen und die Fähigkeiten von LLM-basierten Audio- und Sprachsynthese-Modellen zu verbessern, haben Entwickler HierSpeech++ entwickelt, einen robusten und effizienten Zero-Shot-Sprachsynthesizer für Voice- und Text-to-Speech-Umwandlungen. Das HierSpeech++-Framework basiert auf den Erkenntnissen aus hierarchischen Sprachsynthese-Frameworks, die nicht nur die Robustheit, sondern auch die Ausdruckskraft der synthetischen Sprachausgabe erhöhen und die Natürlichkeit und Sprecherähnlichkeit der künstlich generierten Sprache, sogar in einem Zero-Shot-Szenario, verbessern.
In diesem Artikel werden wir uns mit dem HierSpeech++-Framework im Detail befassen und uns seine Architektur, Funktionsweise und Ergebnisse im Vergleich zu State-of-the-Art-Text- und Audio-Generierungsmodellen ansehen. Also los geht’s.
HierSpeech++: Hierarchische Variationale Inferenz für Zero-Shot-Sprachsynthese
HierSpeech++ ist ein schnelles, robustes und effizientes Zero-Shot-Sprachsynthese-Framework, das eine hierarchische Sprachsynthese-Pipeline verwendet und durch die Verwendung dieses End-to-End-Sprachsynthese-Frameworks das Potenzial hochwertiger Wellenform-Generierung maximiert, um die Lücke zwischen semantischen und akustischen Repräsentationen zu überbrücken, indem es eine selbstüberwachte Sprachrepräsentation als semantische Sprachrepräsentation verwendet und somit versucht, die aktuellen Einschränkungen der Stil-Anpassungen zu lösen. Das End-to-End-Sprachsynthese-Framework wurde erstmals vom VITS-Modell vorgestellt und verwendet eine VAE oder Variational Auto-Encoder mit adversarialer Ausbildung und Normalisierungsfluss. Darüber hinaus haben VAE-basierte Frameworks mit einem End-to-End-Trainings-Pipeline die Fähigkeit, hochwertige Wellenform-Audio mit einer wahrnehmbaren Sprachsynthese-Qualität zu generieren, die erheblich besser ist als die von anderen Sprachsynthese-Frameworks generierten.
Die Audio-Rekonstruktionsqualität dieser Frameworks kann durch die Verwendung eines hierarchischen bedingten Variationalen Auto-Encoders, wie er im HierSpeech-Framework verwendet wird, weiter verbessert werden. Trotz ihrer Potenziale haben End-to-End-Trainings-Pipeline-basierte Modelle bestimmte Einschränkungen, insbesondere in einem Zero-Shot-Szenario, da sie zwar Sprachproben mit hoher Audio-Qualität synthetisieren können, die Sprecherähnlichkeit bei Zero-Shot-Stimmen-Kloning-Aufgaben jedoch immer noch mit hoher Rechenkomplexität verbunden ist. Andererseits performen Diffusions-basierte Sprachsynthese-Modelle gut in Bezug auf Sprecher-Anpassungen, aber sie sind noch weit von perfekt entfernt, da sie einen interaktiven Generierungsprozess verwenden, der die Inferenzgeschwindigkeit verlangsamt, sie oft anfällig für verrauschte Daten sind und aufgrund der Diskrepanz zwischen Training und Inferenz des zweistufigen Generierungsprozesses zwischen dem Mel-Spektrogramm und dem generierten Ground-Truth die Audio-Qualität nicht markant ist.
Um die Probleme, die seine Vorgänger haben, zu lösen, verwendet das HierSpeech++-Modell einen hierarchischen Sprachsynthesizer, eine Sprach-Superauflösung und eine Text-zu-Vec-Komponente und führt einen verbesserten hierarchischen Sprachsynthesizer ein, der auf dem hierarchischen bedingten VAE oder Variationalen Auto-Encoder basiert. Um die Audio-Qualität über die wahrnehmbare Qualität hinaus zu verbessern, verwendet das HierSpeech++-Framework eine Dual-Audio, um den akustischen Posterior zu verstärken, und verbessert die Verallgemeinerung außerhalb der Verteilung, indem es einen hierarchischen adaptiven Generator mit bedingter und unbedingter Generierung verwendet. Darüber hinaus verwendet das HierSpeech++-Framework, um Sprachkomponenten zu entflechten und sprecherbezogene und sprecherunabhängige semantische Informationen zu verbessern, eine Quellen-Filter-Theorie-basierte Multi-Path-Semantik-Encoder. Als Ergebnis der Verwendung eines Variationalen Auto-Encoders kann das HierSpeech++-Modell Repräsentationen hierarchisch verbinden und verknüpfen und sich progressiv an den Ziel-Stimmen-Stil anpassen, um die Wellenform-Audio zu inferieren. Darüber hinaus setzt das HierSpeech++-Framework einen bidirektionalen Netzwerk von Normalisierungsfluss-Transformern ein, um die Anpassung zu verbessern und die Diskrepanz zwischen Training und Inferenz zu reduzieren.
Insgesamt ist das HierSpeech++-Modell ein vollständig paralleles, neuartiges und robustes hierarchisches Sprachsynthese-Framework, das darauf abzielt, Sprachproben in einem Zero-Shot-Szenario zu synthetisieren, und versucht, die folgenden Beiträge zu leisten
- Verwendung eines hierarchischen Sprachsynthese-Frameworks, um Stimmen-Stile und Prosodie zu kontrollieren und zu übertragen.
- Ermöglichung von Daten-Skalierbarkeit und hochauflösender Sprachsynthese durch Upsampling der Wellenform-Audio von 16 auf 48 kHz.
- Erreichung von menschlicher Fähigkeit bei Zero-Shot-Stimmen-Umwandlung und Text-to-Speech-Aufgaben.
HierSpeech++: Model-Komponenten und Architektur
Wie bereits besprochen, ist HierSpeech++ ein Zero-Shot-Sprachsynthese-Modell, das darauf abzielt, menschliche Genauigkeit in Bezug auf Stimmen-Ähnlichkeit und Sprach-Natürlichkeit zu erreichen.

Das HierSpeech++-Modell besteht aus verschiedenen Komponenten, einschließlich eines hierarchischen Sprachsynthesizers, einer Sprach-Superauflösung und einer Text-zu-Vec-Komponente, die zusammenarbeiten, um die Ausbildung jedes Modells zu ermöglichen, das effektiv eine große Menge an niedrigauflösenden Sprachdaten für Stimmen-Kloning nutzen kann. Lassen Sie uns das Framework auseinandernehmen und über jede Komponente sprechen.
Sprach-Repräsentationen
Da der menschliche Frequenzbereich unter 4 kHz liegt, wird für die Sprachsynthese das HierSpeech++-Framework die Audio-Daten bei 16 kHz heruntersamples. Darüber hinaus ist es wichtig, mindestens doppelt so hohe Komponenten der Stimmen-Frequenz zu verwenden, um die Stimmen-Signal zu rekonstruieren, und die Audio-Daten herunterzusamples. Um eine verbesserte wahrnehmbare Qualität zu erreichen, verwendet das HierSpeech++-Framework eine Sprach-Superauflösung oder SpeechSR-Komponente, um die Audio-Daten von 16 auf 48 kHz aufzusamples, und verwendet niedrigauflösende Repräsentationen für semantische und akustische Repräsentationen.

Für akustische Repräsentationen verwendet ein traditionelles Text-to-Speech-Framework ein Mel-Spektrogramm als Zwischen-Akustik-Feature, das dann mit Hilfe eines STFT oder Short-Time-Fourier-Transforms in die Wellenform umgewandelt wird. Es ist jedoch zu beachten, dass akustische Features reiche Repräsentationen sind, die verschiedene Attribute wie Inhalt und Aussprache, Stimmen-Informationen und mehr umfassen, was es dem Framework schwer macht, diese Repräsentationen zu inferieren, was oft zu Fehlern wie Falschprononciation, mangelnder Ähnlichkeit oder Überglättung der Sprache führt.
Weiterhin verwendet das HierSpeech++-Framework, um eine kontinuierliche semantische Repräsentation aus einer Wellenform zu extrahieren, ein Wav2Vec-Framework im Gegensatz zum popularen selbstüberwachten Sprach-Repräsentations-Ansatz für semantische Repräsentationen. Obwohl dieser Ansatz eine gute Alternative für ein reiches monolinguales Modell darstellt, beeinträchtigt er die Zero-Shot-Stimmen-Kloning-Fähigkeiten eines Modells in Bezug auf Robustheit und Ausdruckskraft, insbesondere bei multilingualen Sprachsynthese-Aufgaben.
Hierarchischer Sprachsynthesizer
Die Komponente des hierarchischen Sprachsynthesizers ist der Grundstein für das HierSpeech++-Framework, da sie es ermöglicht, das Modul ohne Verwendung von Labels wie Text-Transkripten oder Sprecher-IDs auszubilden und sich ausschließlich auf Sprachdaten zu verlassen. Um die akustische Kapazität zu erhöhen, haben vorherige State-of-the-Art-Sprachsynthese-Modelle das Mel-Spektrogramm durch ein lineares Spektrogramm ersetzt, jedoch minimiert dieser Ansatz die KL-Divergenz-Score in Bezug auf Pitch-Periodizität, PESQ, Stimme und unstimme Score und sogar Mel-Spektrogramm-Distanz. Der hierarchische Sprachsynthesizer verwendet einen Dual-Audio-Akustik-Encoder, um die Herausforderungen zu lösen, die durch die Verwendung eines linearen Spektrogramms entstehen, das darauf ausgelegt ist, reichere und umfassendere akustische Repräsentationen zu erfassen. Das Framework verwendet auch einen Wellenform-Encoder, um Informationen aus einer rohen Wellenform-Audio zu destillieren und sie mit der linearen Spektrogramm-Repräsentation zu verbinden und schließlich die akustische Repräsentation als eine verknüpfte Repräsentation zu projizieren.

Darüber hinaus verwendet das HierSpeech++-Framework, um sprecherunabhängige und sprecherbezogene semantische Repräsentationen zu bewältigen, eine Multi-Path-Selbstüberwachte-Sprach-Repräsentation, bei der jede einzelne Repräsentation für hierarchische Stil-Anpassung mit den semantischen Repräsentationen verwendet wird, die extrahiert werden, um linguistische Informationen aus der mittleren Schicht des MMS zu erhalten. Das Framework verwendet auch eine fundamentale Frequenz, um die Sprach-Entflechtung zu verbessern, die es ermöglicht, den Pitch-Verlauf manuell zu steuern. Das Framework verwendet auch eine linguistische Repräsentation als bedingte Information, um Wellenform-Audio hierarchisch zu generieren, und verwendet eine verbesserte linguistische Repräsentation der selbstüberwachten Repräsentation. Es ist auch zu beachten, dass die akustischen Repräsentationen, die während des Trainings durch die Verwendung einer Wellenform und eines linearen Spektrogramms extrahiert werden, verwendet werden, um die rohe Wellenform-Audio zu rekonstruieren, und eine hierarchische Variationale Inferenz wird verwendet, um die akustischen Repräsentationen mit den Multi-Path-linguistischen Repräsentationen zu verknüpfen. Das Framework verwendet auch einen hierarchischen adaptiven Generator (HAG), um semantische-zu-Wellenform-Beispiele zu generieren, und die generierten Repräsentationen, die eine Stil-Repräsentation und eine akustische Repräsentation umfassen, werden den Quellen- und Wellenform-Generatoren zugeführt.
Text-zu-Vec
Für Text-to-Speech-Synthese verwendet das HierSpeech++-Framework ein Text-zu-Vec- oder TTV-Modell, das eine fundamentale Frequenz und eine semantische Repräsentation aus einer Text-Sequenz generiert und ein monotonisches Alignierungs-Such-Verfahren mit einem Variationalen Auto-Encoder verwendet, um die Sprache und den Text intern zu alignieren. Das HierSpeech++-Framework ersetzt dann das lineare Spektrogramm durch eine selbstüberwachte lineare Repräsentation und rekonstruiert dieselbe Repräsentation, um als Ausgabe für das TTV zu dienen.

Darüber hinaus verwendet das HierSpeech++-Framework, um die fundamentale Frequenz mit viermal höherer Auflösung als die selbstüberwachte Sprach-Repräsentation zuvorherzusagen, und verwendet eine bedingte Text-Repräsentation als a priori-Information. Als Ergebnis der semantischen Informationen der selbstüberwachten Sprach-Repräsentationen ist das Framework in der Lage, den Prosodie-Stil im Text-zu-Vec-Modell zu übertragen und eine latente Repräsentation dem Phonem-Encoder zuzuführen, um die linguistischen Fähigkeiten der Repräsentation zu verbessern.
SpeechSR oder Sprach-Superauflösung
Das HierSpeech++-Framework trainiert auf einem relativ niedrigauflösenden Datensatz in Bezug auf Daten-Effizienz und Verfügbarkeit und upsampliert eine niedrigauflösende Sprach-Wellenform auf eine hochauflösende Sprach-Wellenform von 16 auf 48 kHz. Das Framework ersetzt auch eine transponierte Konvolution durch den nächsten Nachbarn-Aufampler, der zuvor bekannt war, um Artefakte aufgrund transponierter Konvolutionen zu lindern.

Architektur
Der Content-Encoder des Text-zu-Vec-Modells besteht aus 16 nicht-kasualen WaveNet-Schichten mit einer Kernel-Größe von 5 und einer versteckten Größe von 256, während der Content-Decoder aus 8 nicht-kasualen WaveNet-Schichten mit einer Kernel-Größe von 5 und einer versteckten Größe von 512 besteht. Die Text-Encoder-Komponente besteht aus drei Prosodie-Konditional-Transformer-Netzwerken und drei unbedingten Transformer-Netzwerken mit einer Kernel-Größe von 9, Filter-Größe von 1024 und einer versteckten Größe von 256, wobei der Text-Encoder eine Dropout-Rate von 0,2 hat. Um benachbarte Informationen zu kodieren und die Prosodie-Stil-Anpassung zu verbessern, verwendet das Framework einen CNN mit einer Kernel-Größe von 5 in Transformer-Blöcken. Die SpeechSR hingegen besteht aus einem einzelnen AMP-Block mit 32 initialen Kanälen ohne die Anwesenheit einer Aufsammlungsschicht. Das Framework verwendet einen nächsten Nachbarn-Aufampler, um die versteckten Repräsentationen aufzusamples, und verwendet ein MPD als Diskriminator mit sechs verschiedenen Fenstergrößen und vier Sub-Band-Diskriminatoren.

Die obige Abbildung zeigt die Inferenz-Pipeline des HierSpeech++-Frameworks, die mit der Extraktion der semantischen Repräsentationen aus der Audio-Daten bei einer Frequenz von 16 kHz und der fundamentalen Frequenz mit Hilfe des YAPPT-Algorithmus beginnt. Bevor die fundamentale Frequenz dem Hierarchischen Synthesizer zugeführt werden kann, wird sie normalisiert, indem die Standard- und Mittel-Abweichungen der Quell-Audio verwendet werden, und die normalisierte fundamentale Frequenz wird dann denormalisiert, indem die Standard- und Mittel-Abweichungen der Ziel-Audio verwendet werden. Für Text-to-Speech-Extraktionen verwendet das HierSpeech++-Framework textuelle Repräsentationen anstelle von Sprach-Repräsentationen und verwendet das Text-zu-Vec-Modell, um eine semantische Repräsentation aus einem Prosodie-Prompt zu generieren.
Experimente und Ergebnisse
Das Framework verwendet das öffentlich verfügbare LibriTTS-Datensatz, um den hierarchischen Synthesizer-Teil zu trainieren, wobei der erste Schritt darin besteht, das Modell mit den Trainclean-Teilmengen des Datensatzes zu trainieren und die verbleibenden Daten zu verwenden, um die Übertragung des Stimmen-Stils zu verbessern. Darüber hinaus wird der Datensatz auf 1 kHz aufgeskaliert, wie in der folgenden Abbildung gezeigt.

Rekonstruktion, Resynthese-Aufgaben und Stimmen-Umwandlung
Um die Leistung des HierSpeech++-Frameworks bei Rekonstruktion und Resynthese-Aufgaben zu bewerten, haben die Entwickler sieben objektive Metriken durchgeführt, und die Ergebnisse sind in den folgenden Abbildungen für Rekonstruktion und Resynthese-Aufgaben dargestellt.


Für Stimmen-Umwandlungs-Aufgaben verwendet das Framework zwei subjektive Metriken für die Bewertung: Stimmen-Ähnlichkeit MOS oder sMOS und Natürlichkeit-Mittel-Meinung-Score von nMOS mit drei Natürlichkeit-objektiven Metriken und zwei Ähnlichkeit-objektiven Metriken.

Weiterhin ist das primäre Ziel des HierSpeech++-Frameworks, Zero-Shot-Sprachsynthese zu ermöglichen, und um seine Leistung in Zero-Shot zu bewerten, wird es mit anderen Basismodellen wie AutoVC, VoiceMixer, Diffusions-basierten Modellen und vielen mehr verglichen, wobei die Ergebnisse in der folgenden Abbildung dargestellt sind.

Die folgenden Abbildungen zeigen die Zero-Shot-Text-to-Speech-Ergebnisse mit verrauschten Prompts und sehr verrauschten Prompts.


Endgültige Gedanken
In diesem Artikel haben wir über das HierSpeech++-Modell gesprochen, einen neuartigen Ansatz, um robuste und effektive Sprachsynthese in einem Zero-Shot-Szenario zu ermöglichen und die Einschränkungen zu überwinden, die die aktuellen Sprachsynthese-Frameworks haben, einschließlich ihrer Abhängigkeit von großen Mengen an Trainingsdaten, ihrer Abhängigkeit von diskreten Sprach-Einheiten oder vorgefertigten neuralen Audio-Codecs und ihrer Neigung, automatisch Audio-Ausgaben zu generieren, die letztendlich zu einem Mangel an Robustheit und langsamen Interferenzgeschwindigkeiten führen und zu Fehlern wie Falschprononciation, Auslassung oder Wiederholung führen. Das HierSpeech++-Modell ist ein vollständig paralleles, neuartiges und robustes hierarchisches Sprachsynthese-Framework, das darauf abzielt, Sprachproben in einem Zero-Shot-Szenario zu synthetisieren, und versucht, die folgenden Beiträge zu leisten
- Verwendung eines hierarchischen Sprachsynthese-Frameworks, um Stimmen-Stile und Prosodie zu kontrollieren und zu übertragen.
- Ermöglichung von Daten-Skalierbarkeit und hochauflösender Sprachsynthese durch Upsampling der Wellenform-Audio von 16 auf 48 kHz.
- Erreichung von menschlicher Fähigkeit bei Zero-Shot-Stimmen-Umwandlung und Text-to-Speech-Aufgaben.












