AI-modellen en platforms
OpenVoice: Flexibele Instant Voice Cloning
Bij Text-to-Speech-synthese (TTS) maakt Instant Voice Cloning (IVC) het mogelijk voor het TTS-model om de stem van elke referentiespreker te klonen met behulp van een korte audiosample, zonder dat er extra training nodig is voor de referentiespreker. Deze techniek wordt ook wel Zero-Shot Text-to-Speech Synthese genoemd. De Instant Voice Cloning-benadering maakt het mogelijk om de gegenereerde stem flexibel aan te passen en toont een significante waarde in een breed scala aan real-world situaties, waaronder aangepaste chatbots, contentcreatie en interacties tussen mensen en Large Language Models (LLM’s).
Hoewel de huidige voice cloning-frameworks hun werk goed doen, worden ze geconfronteerd met enkele uitdagingen in het veld, waaronder Flexibele Stemstijlbeheersing, d.w.z. modellen ontbreken de mogelijkheid om stemstijlen flexibel te manipuleren na het klonen van de stem. Een andere belangrijke belemmering voor huidige instant cloning-frameworks is Zero-Shot Cross-Lingual Voice Cloning, d.w.z. voor trainingsdoeleinden, hebben huidige modellen toegang nodig tot een uitgebreid massive-speaker multi-linguaal of MSML-dataset, ongeacht de taal.
Om deze problemen aan te pakken en bij te dragen aan de verbetering van instant voice cloning-modellen, hebben ontwikkelaars gewerkt aan OpenVoice, een flexibele instant voice cloning-framework die de stem van elke gebruiker kan repliceren en spraak kan genereren in meerdere talen met behulp van een korte audiosample van de referentiespreker. OpenVoice toont aan dat Instant Voice Cloning-modellen de toonkleur van de referentiespreker kunnen repliceren en een granulaire controle over stemstijlen kunnen bereiken, waaronder accent, ritme, intonatie, pauzes en zelfs emoties. Wat nog indrukwekkender is, is dat de OpenVoice-framework ook een opmerkelijke capaciteit toont om zero-shot cross-lingual voice cloning te bereiken voor talen buiten het MSML-dataset, waardoor OpenVoice stemmen kan klonen in nieuwe talen zonder uitgebreide voorafgaande training voor die taal. OpenVoice weet superieure instant voice cloning-resultaten te leveren terwijl het computationeel haalbaar is met operationele kosten tot 10 keer lager dan de huidige beschikbare API’s met inferieure prestaties.
In dit artikel zullen we dieper ingaan op de OpenVoice-framework en zijn architectuur die het in staat stelt om superieure prestaties te leveren bij instant voice cloning-taken. Laten we beginnen.
OpenVoice: Flexibele Instant Voice Cloning
Zoals eerder vermeld, maakt Instant Voice Cloning, ook wel Zero-Shot Text-to-Speech Synthese genoemd, het mogelijk voor het TTS-model om de stem van elke referentiespreker te klonen met behulp van een korte audiosample, zonder dat er extra training nodig is voor de referentiespreker. Instant Voice Cloning is altijd een populaire onderzoeksgebied geweest met bestaande werken, waaronder XTTS- en VALLE-frameworks, die speaker-embedding en/of akoestische tokens uit de referentie-audio extracteren die als conditie voor het auto-regressieve model dienen. Het auto-regressieve model genereert vervolgens akoestische tokens sequentieel en decodeert deze tokens in een ruwe audio-golfvorm.
Hoewel auto-regressieve instant voice cloning-modellen de toonkleur opmerkelijk goed klonen, komen ze tekort in het manipuleren van andere stijlparameters, waaronder accent, emotie, pauzes en ritme. Bovendien ervaren auto-regressieve modellen een lage inferentiesnelheid en hebben ze hoge operationele kosten. Bestaande benaderingen, zoals de YourTTS-framework, maken gebruik van een niet-auto-regressieve benadering die aanzienlijk snellere inferentiespraak toont dan auto-regressieve benaderingen, maar kunnen hun gebruikers nog steeds geen flexibele controle over stijlparameters bieden. Bovendien hebben zowel auto-regressieve als niet-auto-regressieve instant voice cloning-frameworks toegang nodig tot een groot MSML- of massive-speaker multilingual dataset voor cross-lingual voice cloning.
Om de uitdagingen van huidige instant voice cloning-frameworks aan te pakken, hebben ontwikkelaars gewerkt aan OpenVoice, een open source instant voice cloning-bibliotheek die de volgende uitdagingen probeert aan te pakken die huidige IVC-frameworks tegenkomen.
- De eerste uitdaging is om IVC-frameworks in staat te stellen flexibele controle over stijlparameters te hebben, naast toonkleur, waaronder accent, ritme, intonatie en pauzes. Stijlparameters zijn cruciaal om natuurlijke conversaties en spraak te genereren in plaats van de invoertekst monotoon te vertellen.
- De tweede uitdaging is om IVC-frameworks in staat te stellen cross-lingual stemmen te klonen in een zero-shot-setting.
- De derde uitdaging is om hoge real-time inferentiesnelheden te bereiken zonder de kwaliteit te verminderen.
Om de eerste twee hindernissen te overwinnen, is de architectuur van de OpenVoice-framework ontworpen om componenten in de stem zo veel mogelijk te decoupleren. Bovendien genereert OpenVoice toonkleur, taal en andere stemkenmerken onafhankelijk, waardoor het framework in staat is om individuele taaltypes en stemstijlen flexibel te manipuleren. De OpenVoice-framework overwint de derde uitdaging als standaard, omdat de gedecoupeerde structuur de computationele complexiteit en modelgrootte-eisen vermindert.
OpenVoice: Methodologie en Architectuur
De technische framework van de OpenVoice-framework is effectief en verrassend eenvoudig om te implementeren. Het is geen geheim dat het klonen van de toonkleur voor elke spreker, het toevoegen van een nieuwe taal en het inschakelen van flexibele controle over stemparameters tegelijkertijd een uitdaging kan zijn. Dit komt omdat het uitvoeren van deze drie taken tegelijkertijd vereist dat de gecontroleerde parameters een grote hoeveelheid combinatorische datasets overlappen. Bovendien is het in reguliere single speaker text-to-speech synthesie, voor taken die geen stemkloning vereisen, gemakkelijker om controle over andere stijlparameters toe te voegen. Hierop voortbouwend, streeft de OpenVoice-framework ernaar om de Instant Voice Cloning-taken te decoupleren in subtaken. Het model stelt voor om een basis-spreker Text-to-Speech-model te gebruiken om de taal en stijlparameters te controleren en een toonkleur-omzetter te gebruiken om de referentie-toonkleur in de gegenereerde stem op te nemen.

In zijn kern gebruikt de OpenVoice-framework twee componenten: een toonkleur-omzetter en een basis-spreker Text-to-Speech- of TTS-model. Het basis-spreker Text-to-Speech-model is een single-spreker- of multi-sprekermodel dat precieze controle over stijlparameters, taal en accent mogelijk maakt. Het model genereert een stem die vervolgens naar de toonkleur-omzetter wordt doorgegeven, die de basis-spreker-toonkleur verandert in de toonkleur van de referentiespreker.
De OpenVoice-framework biedt veel flexibiliteit bij het basis-spreker Text-to-Speech-model, omdat het het VITS-model met kleine aanpassingen kan gebruiken, waardoor het taal- en stijl-embeddings in zijn duur-predictor en tekst-encoder kan accepteren. Het framework kan ook modellen zoals Microsoft (MSFT ) TTS gebruiken, die commercieel goedkoop zijn, of modellen zoals InstructTTS, die stijl-promptingen kunnen accepteren. Voorlopig gebruikt de OpenVoice-framework het VITS-model, hoewel de andere modellen ook een haalbare optie zijn.
Komend bij de tweede component, de Toonkleur-omzetter is een encoder-decoder-component met een invertible normalizing flow in het midden. De encoder-component in de toonkleur-omzetter is een één-dimensionale CNN die de short-time fourier-getransformeerde spectrum van het basis-spreker Text-to-Speech-model als invoer accepteert. De encoder genereert vervolgens feature-maps als uitvoer. De toonkleur-extractor is een eenvoudige tweedimensionale CNN die op de mel-spectrogram van de invoer-stem werkt en een enkele feature-vector genereert als uitvoer die de informatie van de toonkleur codeert. De normalizing flow-lagen accepteren de feature-maps gegenereerd door de encoder als invoer en genereren een feature-representatie die alle stijl-eigenschappen behoudt, maar de toonkleur-informatie elimineert. De OpenVoice-framework past vervolgens de normalizing flow-lagen in de inverse richting toe en neemt de feature-representaties als invoer en produceert de normalizing flow-lagen. De framework decodeert vervolgens de normalizing flow-lagen in ruwe waveforms met behulp van een stapel getransponeerde één-dimensionale convoluties.
De hele architectuur van de OpenVoice-framework is feed-forward zonder het gebruik van enige auto-regressieve component. De toonkleur-omzetter-component is vergelijkbaar met stemomzetting op conceptueel niveau, maar verschilt in functionaliteit, trainingsdoelen en inductieve bias in de modelstructuur. De normalizing flow-lagen delen dezelfde structuur als flow-gebaseerde text-to-speech-modellen, maar verschillen in functionaliteit en trainingsdoelen.
Bovendien bestaat er een andere benadering om feature-representaties te extraheren, de methode geïmplementeerd door de OpenVoice-framework levert betere audio-kwaliteit. Het is ook de moeite waard om op te merken dat de OpenVoice-framework geen intentie heeft om componenten in de modelarchitectuur uit te vinden, maar beide hoofdcomponenten, d.w.z. de toonkleur-omzetter en het basis-spreker TTS-model, zijn afkomstig van bestaande werken. Het primaire doel van de OpenVoice-framework is om een gedecoupeerde framework te vormen die de taalcontrole en de stemstijl van de toonkleur-kloning scheidt. Hoewel de benadering vrij eenvoudig is, is het effectief, vooral bij taken die stijlen en accenten controleren of nieuwe taalgeneralisatietaken.
In zijn kern is de hoofdfilosofie van de OpenVoice-framework om de generatie van taal en stemstijlen te decoupleren van de generatie van toonkleur. Een van de belangrijkste sterktes van de OpenVoice-framework is dat de gekloonde stem vloeiend en van hoge kwaliteit is, zolang de single-spreker TTS vloeiend spreekt.
OpenVoice: Experiment en Resultaten
Het evalueren van stemkloningtaken is een moeilijke objectieve taak vanwege verschillende redenen. Ten eerste gebruiken bestaande werken vaak verschillende trainings- en testgegevens, waardoor het oneerlijk is om deze werken intrinsiek te vergelijken. Hoewel crowdsourcing gebruikt kan worden om metrics zoals Mean Opinion Score te evalueren, zal de moeilijkheid en diversiteit van de testgegevens het totale resultaat aanzienlijk beïnvloeden. Ten tweede hebben verschillende stemkloningmethoden verschillende trainingsgegevens, en de diversiteit en schaal van deze gegevens beïnvloeden de resultaten aanzienlijk. Ten slotte verschillen de primaire doelen van bestaande werken van elkaar, waardoor ze verschillen in functionaliteit.
Vanwege de drie redenen die hierboven zijn genoemd, is het oneerlijk om bestaande stemkloning-frameworks numeriek te vergelijken. In plaats daarvan is het veel zinvoller om deze methoden kwalitatief te vergelijken.
Accurate Toonkleur Cloning
Om zijn prestaties te analyseren, bouwen ontwikkelaars een testset met anonieme personen, gamepersonages en beroemdheden die de referentiesprekerbasis vormen en een brede stemverdeling hebben, waaronder zowel neutrale als unieke expressieve stemmen. De OpenVoice-framework kan de referentie-toonkleur klonen en spraak genereren in meerdere talen en accenten voor elke referentiespreker en de 4 basis-sprekers.

Flexibele Controle over Stemstijlen
Een van de doelen van de OpenVoice-framework is om de spraakstijlen flexibel te controleren met behulp van de toonkleur-omzetter die de toonkleur kan wijzigen terwijl alle andere stemkenmerken en -eigenschappen behoudt.
Experimenten tonen aan dat het model de stemstijlen behoudt na het omzetten naar de referentie-toonkleur. In sommige gevallen neutraliseert het model de emoties echter licht, een probleem dat kan worden opgelost door minder informatie door te geven aan de flow-lagen, zodat ze niet in staat zijn om van de emotie af te komen. De OpenVoice-framework kan de stemstijlen van de basis-stem behouden dankzij het gebruik van een toonkleur-omzetter. Het stelt de OpenVoice-framework in staat om het basis-spreker Text-to-Speech-model gemakkelijk te manipuleren om de stemstijlen te controleren.

Cross-Lingual Stemkloning
De OpenVoice-framework bevat geen massive-speaker-gegevens voor een ongezien taal, maar kan toch bijna cross-lingual stemkloning bereiken in een zero-shot-setting. De cross-lingual stemkloning-mogelijkheden van de OpenVoice-framework zijn tweevoudig:
- Het model kan de toonkleur van de referentiespreker nauwkeurig klonen wanneer de taal van de referentiespreker ongezien is in het multi-speaker multi-taal of MSML-dataset.
- Bovendien, wanneer de taal van de referentiespreker ongezien is, kan de OpenVoice-framework de stem van de referentiespreker klonen en spreken in de taal, mits het basis-spreker Text-to-Speech-model de taal ondersteunt.
Slotgedachten
In dit artikel hebben we het over OpenVoice gehad, een flexibele instant stemkloning-framework die de stem van elke gebruiker kan repliceren en spraak kan genereren in meerdere talen met behulp van een korte audiosample van de referentiespreker. De primaire intuïtie achter OpenVoice is dat, zolang een model niet de toonkleur van de referentiespreker hoeft te klonen, een framework een basis-spreker TTS-model kan gebruiken om de taal en de stemstijlen te controleren.
OpenVoice toont aan dat Instant Voice Cloning-modellen de toonkleur van de referentiespreker kunnen repliceren en een granulaire controle over stemstijlen kunnen bereiken, waaronder accent, ritme, intonatie, pauzes en zelfs emoties. OpenVoice weet superieure instant stemkloning-resultaten te leveren terwijl het computationeel haalbaar is met operationele kosten tot 10 keer lager dan de huidige beschikbare API’s met inferieure prestaties.












