KI-Modelle und Plattformen

OpenVoice: Vielseitige Instant Voice Cloning

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Bei der Text-to-Speech-Synthese (TTS) ermÃķglicht die Instant Voice Cloning (IVC) dem TTS-Modell, die Stimme eines Referenzsprechers mithilfe eines kurzen Audio-Samples zu klonen, ohne dass eine zusÃĪtzliche Schulung fÞr den Referenzsprecher erforderlich ist. Diese Technik wird auch als Zero-Shot-Text-to-Speech-Synthese bezeichnet. Der Instant-Voice-Cloning-Ansatz ermÃķglicht eine flexible Anpassung der generierten Stimme und zeigt einen erheblichen Wert in einer Vielzahl von realen Situationen, einschließlich personalisierter Chatbots, Content-Erstellung und Interaktionen zwischen Menschen und großen Sprachmodellen (LLMs).

Obwohl die aktuellen Voice-Cloning-Frameworks ihre Arbeit gut erledigen, sind sie mit einigen Herausforderungen im Bereich konfrontiert, darunter Flexible Voice Style Control, d. h. Modelle fehlen die FÃĪhigkeit, Voice-Styles flexibel nach dem Klonen der Stimme zu manipulieren. Ein weiteres großes Hindernis, das von aktuellen Instant-Cloning-Frameworks aufgerufen wird, ist Zero-Shot-Cross-Lingual-Voice-Cloning, d. h. fÞr Schulungszwecke benÃķtigen aktuelle Modelle Zugang zu einer umfangreichen, massiven Sprecher-Mehrsprachendatenbank (MSML), unabhÃĪngig von der Sprache.

Um diese Probleme zu lÃķsen und zur Verbesserung von Instant-Voice-Cloning-Modellen beizutragen, haben Entwickler an OpenVoice gearbeitet, einem vielseitigen Instant-Voice-Cloning-Framework, das die Stimme eines Benutzers repliziert und Sprache in mehreren Sprachen mithilfe eines kurzen Audio-Clips des Referenzsprechers generiert. OpenVoice zeigt, dass Instant-Voice-Cloning-Modelle die Tonfarbe des Referenzsprechers replizieren und eine granulare Kontrolle Þber Voice-Styles einschließlich Akzent, Rhythmus, Intonation, Pausen und sogar Emotionen erreichen kÃķnnen. Was noch beeindruckender ist, ist, dass das OpenVoice-Framework auch bemerkenswerte FÃĪhigkeiten bei der Erreichung von Zero-Shot-Cross-Lingual-Voice-Cloning fÞr Sprachen außerhalb der MSML-Datenbank zeigt, was es OpenVoice ermÃķglicht, Stimmen in neue Sprachen zu klonen, ohne umfangreiche Vor-Schulung fÞr diese Sprache. OpenVoice liefert Þberlegene Instant-Voice-Cloning-Ergebnisse, wÃĪhrend es rechnerisch tragbar ist und Betriebskosten bis zu 10 Mal weniger als aktuell verfÞgbare APIs mit schlechterer Leistung aufweist.

In diesem Artikel werden wir Þber das OpenVoice-Framework im Detail sprechen und seine Architektur, die es ermÃķglicht, Þberlegene Leistung bei Instant-Voice-Cloning-Aufgaben zu erzielen, aufdecken. Also los geht’s.

OpenVoice: Vielseitige Instant Voice Cloning

Wie bereits erwÃĪhnt, ermÃķglicht Instant Voice Cloning, auch als Zero-Shot-Text-to-Speech-Synthese bezeichnet, dem TTS-Modell, die Stimme eines Referenzsprechers mithilfe eines kurzen Audio-Samples zu klonen, ohne dass eine zusÃĪtzliche Schulung fÞr den Referenzsprecher erforderlich ist. Instant Voice Cloning war immer ein heißes Forschungsthema, mit bestehenden Arbeiten, einschließlich XTTS- und VALLE-Frameworks, die Sprecher-Embeddings und/oder akustische Token aus dem Referenz-Audio extrahieren, das als Bedingung fÞr das auto-regressive Modell dient. Das auto-regressive Modell generiert dann akustische Token sequenziell und decodiert diese Token in ein rohes Audio-Signal.

Obwohl auto-regressive Instant-Voice-Cloning-Modelle die Tonfarbe bemerkenswert klonen, fehlt es ihnen an der FÃĪhigkeit, andere Stilparameter wie Akzent, Emotion, Pausen und Rhythmus zu manipulieren. DarÞber hinaus erleben auto-regressive Modelle eine niedrige Inferenzgeschwindigkeit, und ihre Betriebskosten sind ziemlich hoch. Bestehende AnsÃĪtze wie das YourTTS-Framework verwenden einen nicht-auto-regressiven Ansatz, der eine wesentlich schnellere Inferenzsprache Þber auto-regressive AnsÃĪtze zeigt, aber den Benutzern immer noch keine flexible Kontrolle Þber Stilparameter bietet. DarÞber hinaus benÃķtigen sowohl auto-regressive als auch nicht-auto-regressive Instant-Voice-Cloning-Frameworks Zugang zu einer großen MSML- oder massiven Sprecher-Mehrsprachendatenbank fÞr Cross-Lingual-Voice-Cloning.

Um die Herausforderungen, denen sich die aktuellen Instant-Voice-Cloning-Frameworks gegenÞbersehen, zu lÃķsen, haben Entwickler an OpenVoice gearbeitet, einer Open-Source-Instant-Voice-Cloning-Bibliothek, die darauf abzielt, die folgenden Herausforderungen zu lÃķsen, denen sich die aktuellen IVC-Frameworks gegenÞbersehen.

  1. Die erste Herausforderung besteht darin, IVC-Frameworks zu ermÃķglichen, flexible Kontrolle Þber Stilparameter zu haben, einschließlich Akzent, Rhythmus, Intonation und Pausen. Stilparameter sind entscheidend, um natÞrliche Konversationen und Sprache zu generieren, anstatt den Eingabetext monoton zu erzÃĪhlen.
  2. Die zweite Herausforderung besteht darin, IVC-Frameworks zu ermÃķglichen, Cross-Lingual-Stimmen in einer Zero-Shot-Umgebung zu klonen.
  3. Die dritte Herausforderung besteht darin, hohe Echtzeit-Inferenzgeschwindigkeiten zu erreichen, ohne die QualitÃĪt zu beeintrÃĪchtigen.

Um die ersten beiden HÞrden zu Þberwinden, ist die Architektur des OpenVoice-Frameworks so konzipiert, dass es die Komponenten in der Stimme bestmÃķglich entkoppelt. DarÞber hinaus generiert OpenVoice die Tonfarbe, die Sprache und andere Stimmeigenschaften unabhÃĪngig, was es dem Framework ermÃķglicht, individuelle Sprachtypen und Stimme-Stile flexibel zu manipulieren. Das OpenVoice-Framework Þberwindet die dritte HÞrde standardmÃĪßig, da die entkoppelte Struktur die rechnerische KomplexitÃĪt und die ModellgrÃķße reduziert.

OpenVoice: Methodik und Architektur

Das technische Framework des OpenVoice-Frameworks ist effektiv und Þberraschend einfach zu implementieren. Es ist kein Geheimnis, dass das Klonen der Tonfarbe fÞr jeden Sprecher, das HinzufÞgen einer neuen Sprache und die ErmÃķglichung flexibler Kontrolle Þber Stimme-Parameter gleichzeitig eine Herausforderung darstellen kann. Es liegt daran, dass die AusfÞhrung dieser drei Aufgaben gleichzeitig die kontrollierten Parameter erfordert, die mithilfe einer großen Menge kombinierter DatensÃĪtze Þberschneiden. DarÞber hinaus ist es in der regulÃĪren Einzelsprecher-Text-to-Speech-Synthese einfacher, Kontrolle Þber andere Stilparameter hinzuzufÞgen, wenn keine Stimmenklonierung erforderlich ist. Aufbauend auf diesen Erkenntnissen zielt das OpenVoice-Framework darauf ab, die Instant-Voice-Cloning-Aufgaben in UnterAufgaben zu unterteilen. Das Modell schlÃĪgt vor, ein Basis-Sprecher-Text-to-Speech-Modell zu verwenden, um die Sprache und die Stilparameter zu kontrollieren, und einen Tonfarben-Konverter, um die Referenz-Tonfarbe in die generierte Stimme einzubeziehen.

Im Kern verwendet das OpenVoice-Framework zwei Komponenten: einen Tonfarben-Konverter und ein Basis-Sprecher-Text-to-Speech- oder TTS-Modell. Das Basis-Sprecher-Text-to-Speech-Modell ist entweder ein Einzelsprecher- oder ein Mehrsprecher-Modell, das eine prÃĪzise Kontrolle Þber Stilparameter, Sprache und Akzent ermÃķglicht. Das Modell generiert eine Stimme, die dann an den Tonfarben-Konverter weitergeleitet wird, der die Basis-Sprecher-Tonfarbe in die Tonfarbe des Referenzsprechers ÃĪndert.

Das OpenVoice-Framework bietet eine Vielzahl von FlexibilitÃĪt, wenn es um das Basis-Sprecher-Text-to-Speech-Modell geht, da es das VITS-Modell mit leichten Modifikationen verwenden kann, um Sprache- und Stil-Embeddings in seinem Dauer-Predictor und Text-Encoder zu akzeptieren. Das Framework kann auch Modelle wie Microsoft (MSFT ) TTS verwenden, die kommerziell gÞnstig sind, oder Modelle wie InstructTTS, die in der Lage sind, Stil-Prompts zu akzeptieren. Derzeit verwendet das OpenVoice-Framework das VITS-Modell, obwohl die anderen Modelle auch eine gangbare Option sind.

Kommend auf die zweite Komponente, ist der Tonfarben-Konverter eine Encoder-Decoder-Komponente, die einen invertierbaren Normalisierungsfluss in der Mitte beherbergt. Die Encoder-Komponente im Tonfarben-Konverter ist ein eindimensionales CNN, das das kurzzeitige Fourier-Transformations-Spektrum des Basis-Sprecher-Text-to-Speech-Modells als Eingabe akzeptiert. Die Encoder-Komponente generiert dann Feature-Maps als Ausgabe. Der Tonfarben-Extraktor ist ein einfaches zweidimensionales CNN, das auf dem Mel-Spektrum der Eingabestimme operiert und einen einzelnen Feature-Vektor als Ausgabe generiert, der die Informationen der Tonfarbe codiert. Die Normalisierungsfluss-Schichten akzeptieren die Feature-Maps, die von der Encoder-Komponente generiert werden, als Eingabe und generieren eine Feature-ReprÃĪsentation, die alle Stil-Eigenschaften bewahrt, aber die Tonfarben-Informationen eliminiert. Das OpenVoice-Framework wendet dann die Normalisierungsfluss-Schichten in umgekehrter Richtung an und nimmt die Feature-ReprÃĪsentationen als Eingabe und gibt die Normalisierungsfluss-Schichten aus. Das Framework decodiert dann die Normalisierungsfluss-Schichten in rohe Wellenformen mithilfe eines Stapels transponierter eindimensionaler Konvolutionen.

Die gesamte Architektur des OpenVoice-Frameworks ist feed-forward, ohne die Verwendung von auto-regressiven Komponenten. Die Tonfarben-Konverter-Komponente ist konzeptionell ÃĪhnlich wie die Stimmenkonvertierung, aber unterscheidet sich in Bezug auf FunktionalitÃĪt, Trainingsziele und induktive Voreingenommenheit in der Modellstruktur. Die Normalisierungsfluss-Schichten teilen die gleiche Struktur wie flussbasierte Text-to-Speech-Modelle, aber unterscheiden sich in Bezug auf FunktionalitÃĪt und Trainingsziele.

DarÞber hinaus gibt es einen anderen Ansatz, um Feature-ReprÃĪsentationen zu extrahieren, die Methode, die vom OpenVoice-Framework implementiert wird, liefert eine bessere AudioqualitÃĪt. Es ist auch erwÃĪhnenswert, dass das OpenVoice-Framework keine Absicht hat, Komponenten in der Modellarchitektur zu erfinden, sondern dass beide Hauptkomponenten, nÃĪmlich der Tonfarben-Konverter und das Basis-Sprecher-TTS-Modell, aus bestehenden Arbeiten stammen. Das primÃĪre Ziel des OpenVoice-Frameworks ist es, ein entkoppeltes Framework zu bilden, das die Sprachsteuerung und die Stimme-Stile von der Tonfarben-Klonierung trennt. Obwohl der Ansatz ziemlich einfach ist, ist er ziemlich effektiv, insbesondere bei Aufgaben, die Stile und Akzente steuern oder neue Sprachgeneralisierungsaufgaben.

Im Kern ist die Hauptphilosophie des OpenVoice-Frameworks, die Generierung von Sprache und Stimme-Stilen von der Generierung der Tonfarbe zu trennen. Eine der grÃķßten StÃĪrken des OpenVoice-Frameworks ist, dass die geklonte Stimme flÞssig und von hoher QualitÃĪt ist, solange das Einzelsprecher-TTS-Modell flÞssig spricht.

OpenVoice: Experiment und Ergebnisse

Die Bewertung von Stimmenklonierungsaufgaben ist ein hartes Ziel aufgrund zahlreicher GrÞnde. ZunÃĪchst verwenden bestehende Arbeiten oft unterschiedliche Trainings- und Testdaten, was den Vergleich dieser Arbeiten intrinsisch unfair macht. Obwohl Crowdsourcing verwendet werden kann, um Metriken wie den Mittelwert der Meinungen zu bewerten, wird das Ergebnis erheblich von der Schwierigkeit und Vielfalt der Testdaten beeinflusst. Zweitens haben unterschiedliche Stimmenklonierungsmethoden unterschiedliche Trainingsdaten, und die Vielfalt und GrÃķße dieser Daten beeinflussen das Ergebnis erheblich. Schließlich unterscheiden sich die primÃĪren Ziele bestehender Arbeiten voneinander, daher unterscheiden sie sich in ihrer FunktionalitÃĪt.

Aufgrund der drei oben genannten GrÞnde ist es unfair, bestehende Stimmenklonierungsfameworks numerisch zu vergleichen. Stattdessen ist es sinnvoller, diese Methoden qualitativ zu vergleichen.

Genaue Tonfarben-Klonierung

Um seine Leistung zu analysieren, bauen Entwickler einen Testdatensatz mit anonymen Personen, Spielcharakteren und BerÞhmtheiten auf, der eine breite Stimmenverteilung einschließlich neutraler Proben und einzigartiger ausdrucksstarker Stimmen umfasst. Das OpenVoice-Framework kann die Referenz-Tonfarbe klonen und Sprache in mehreren Sprachen und Akzenten fÞr jeden der Referenzsprecher und die 4 Basis-Sprecher generieren.

Flexible Kontrolle Þber Stimme-Stile

Eines der Ziele des OpenVoice-Frameworks ist es, die Sprechstile flexibel mithilfe des Tonfarben-Konverters zu steuern, der die Tonfarbe ÃĪndern kann, wÃĪhrend alle anderen Stimme-Eigenschaften und -Merkmale erhalten bleiben.

Experimente zeigen, dass das Modell die Sprechstile nach der Umwandlung in die Referenz-Tonfarbe bewahrt. In einigen FÃĪllen jedoch neutralisiert das Modell die Emotionen leicht, ein Problem, das durch das Weiterleiten weniger Informationen an die Fluss-Schichten gelÃķst werden kann, sodass sie nicht in der Lage sind, die Emotion zu eliminieren. Das OpenVoice-Framework kann die Stile von der Basis-Stimme dank der Verwendung eines Tonfarben-Konverters bewahren. Es ermÃķglicht dem OpenVoice-Framework, das Basis-Sprecher-Text-to-Speech-Modell leicht zu manipulieren, um die Sprechstile zu steuern.

Cross-Lingual-Stimmen-Klonierung

Das OpenVoice-Framework umfasst keine massiven Sprecher-Daten fÞr eine unbekannte Sprache, kann jedoch nahezu Cross-Lingual-Stimmen-Klonierung in einer Zero-Shot-Umgebung erreichen. Die Cross-Lingual-Stimmen-KlonierungsfÃĪhigkeiten des OpenVoice-Frameworks sind zweifach:

  1. Das Modell kann die Tonfarbe des Referenzsprechers genau klonen, wenn die Sprache des Referenzsprechers in der MSML-Datenbank nicht vorhanden ist.
  2. DarÞber hinaus kann das OpenVoice-Framework in derselben Situation, in der die Sprache des Referenzsprechers nicht in der MSML-Datenbank vorhanden ist, die Stimme des Referenzsprechers klonen und in der Sprache sprechen, vorausgesetzt, dass das Basis-Sprecher-Text-to-Speech-Modell die Sprache unterstÞtzt.

Schlussgedanken

In diesem Artikel haben wir Þber OpenVoice gesprochen, ein vielseitiges Instant-Voice-Cloning-Framework, das die Stimme eines Benutzers repliziert und Sprache in mehreren Sprachen mithilfe eines kurzen Audio-Clips des Referenzsprechers generiert. Die primÃĪre Intuition hinter OpenVoice ist, dass solange ein Modell nicht die Tonfarbe des Referenzsprechers klonen muss, ein Framework ein Basis-Sprecher-TTS-Modell verwenden kann, um die Sprache und die Stimme-Stile zu steuern.

OpenVoice zeigt, dass Instant-Voice-Cloning-Modelle die Tonfarbe des Referenzsprechers replizieren und eine granulare Kontrolle Þber Stimme-Stile einschließlich Akzent, Rhythmus, Intonation, Pausen und sogar Emotionen erreichen kÃķnnen. OpenVoice liefert Þberlegene Instant-Voice-Cloning-Ergebnisse, wÃĪhrend es rechnerisch tragbar ist und Betriebskosten bis zu 10 Mal weniger als aktuell verfÞgbare APIs mit schlechterer Leistung aufweist.

Ein Ingenieur von Beruf, ein Schriftsteller von Herzen. Kunal ist ein technischer Schriftsteller mit einer tiefen Liebe und einem tiefen VerstÃĪndnis fÞr KI und ML, der sich der Aufgabe widmet, komplexe Konzepte in diesen Bereichen durch seine ansprechenden und informativen Dokumentationen zu vereinfachen.