AI-modeller og platforme
OpenVoice: Fleksibelt Instant Voice Cloning
I Text-to-Speech-syntese (TTS) giver Instant Voice Cloning (IVC) TTS-modellen mulighed for at klone stemmen fra en hvilken som helst reference-speaker ved hjælp af et kort lydklippet, uden at der kræves yderligere træning for reference-speakeren. Denne teknik kaldes også Zero-Shot Text-to-Speech Synthese. Instant Voice Cloning-metoden giver mulighed for fleksibel tilpasning af den genererede stemme og demonstrerer værdi i en lang række virkelige situationer, herunder tilpassede chatbots, indholdsskabelse og interaktioner mellem mennesker og store sprogmodeller (LLM’er).
Selvom de nuværende stemme-kloning-rammer gør deres arbejde godt, er de fyldt med nogle udfordringer på området, herunder Fleksibel Stemme-Stil-Kontrol, dvs. modeller mangler evnen til at manipulere stemme-stilarter fleksibelt efter at have klonet stemmen. En anden større forhindring, som de nuværende instant-kloning-rammer står over for, er Zero-Shot Cross-Lingual Stemme-Kloning, dvs. til træningsformål kræver nuværende modeller adgang til en omfattende stor-speakermulti-lingual eller MSML-datasæt, uanset sprog.
For at tackle disse udfordringer og bidrage til forbedringen af instant-stemme-kloning-modeller, har udviklere arbejdet på OpenVoice, en fleksibel instant-stemme-kloning-ramme, der replikerer stemmen fra en hvilken som helst bruger og genererer tale i flere sprog ved hjælp af et kort lydklippet fra reference-speakeren. OpenVoice demonstrerer, at Instant Voice Cloning-modeller kan replikere tone-farven fra reference-speakeren og opnå granuleret kontrol over stemme-stilarter, herunder accent, rytme, intonation, pauser og endda følelser. Det er endnu mere imponerende, at OpenVoice-rammen også demonstrerer bemærkelsesværdige evner i at opnå zero-shot cross-lingual stemme-kloning for sprog uden for MSML-datasættet, hvilket giver OpenVoice mulighed for at klone stemmer til nye sprog uden omfattende forudgående træning for det pågældende sprog. OpenVoice kan levere overlegne instant-stemme-kloning-resultater, samtidig med at den er komputationelt bæredygtig med driftsomkostninger op til 10 gange mindre end nuværende tilgængelige API’er med ringere ydelse.
I denne artikel vil vi tale om OpenVoice-rammen i dybden og afsløre dens arkitektur, der giver den mulighed for at levere overlegen ydelse på tværs af instant-stemme-kloning-opgaver. Så lad os komme i gang.
OpenVoice: Fleksibelt Instant Voice Cloning
Som nævnt tidligere giver Instant Voice Cloning, også kendt som Zero-Shot Text-to-Speech Synthese, TTS-modellen mulighed for at klone stemmen fra en hvilken som helst reference-speaker ved hjælp af et kort lydklippet, uden at der kræves yderligere træning for reference-speakeren. Instant Voice Cloning har altid været et varmt forskningsemne med eksisterende arbejder, herunder XTTS- og VALLE-rammer, der udtrækker speaker-embedding og/eller akustiske tokens fra reference-lyden, der fungerer som en betingelse for den auto-regressive model. Den auto-regressive model genererer herefter akustiske tokens sekventielt og dekoder disse tokens til en rå lydbølge.
Selvom auto-regressive instant-stemme-kloning-modeller kloner tone-farven bemærkelsesværdigt, mangler de evnen til at manipulere andre stil-parametre, herunder accent, følelse, pauser og rytme. Desuden oplever auto-regressive modeller også lav inferens-hastighed, og deres driftsomkostninger er ret høje. Eksisterende tilgange som YourTTS-rammen anvender en ikke-auto-regressiv tilgang, der demonstrerer væsentligt hurtigere inferens-tale over auto-regressive ramme-tilgange, men kan stadig ikke give brugerne fleksibel kontrol over stil-parametre. Desuden har både auto-regressive-baserede og ikke-auto-regressive-baserede instant-stemme-kloning-rammer brug for adgang til et stort MSML- eller stor-speakermulti-lingual-datasæt til cross-lingual stemme-kloning.
For at tackle udfordringerne, som de nuværende instant-stemme-kloning-rammer står over for, har udviklere arbejdet på OpenVoice, en open source instant-stemme-kloning-bibliotek, der har til formål at løse følgende udfordringer, som de nuværende IVC-rammer står over for.
- Den første udfordring er at give IVC-rammerne mulighed for at have fleksibel kontrol over stil-parametre, herunder accent, rytme, intonation og pauser. Stil-parametre er afgørende for at generere naturlige samtaler og tale i stedet for at fortælle input-teksten monoton.
- Den anden udfordring er at give IVC-rammerne mulighed for at klone cross-lingual stemmer i en zero-shot-indstilling.
- Den tredje udfordring er at opnå høj real-tid inferens-hastighed uden at forringe kvaliteten.
For at tackle de to første hindringer er OpenVoice-rammens arkitektur designede til at afkoble komponenter i stemmen så godt som muligt. Desuden genererer OpenVoice tone-farve, sprog og andre stemme-funktioner uafhængigt, hvilket giver rammen mulighed for at fleksibelt manipulere enkelt sprog-typer og stemme-stilarter. OpenVoice-rammen tackler den tredje udfordring som standard, da den afkoblede struktur reducerer komputationel kompleksitet og model-størrelses-krav.
OpenVoice: Metodik og Arkitektur
Den tekniske ramme for OpenVoice-rammen er effektiv og overraskende simpel at implementere. Det er ingen hemmelighed, at kloning af tone-farven for en hvilken som helst speaker, tilføje nyt sprog og give fleksibel kontrol over stemme-parametre samtidigt kan være udfordrende. Det er sådan, fordi udførelse af disse tre opgaver samtidigt kræver, at de kontrollerede parametre intersecterer ved hjælp af en stor mængde kombinatoriske datasæt. Desuden er det i almindelig enkelt-speakertekst-til-tale-syntese, for opgaver, der ikke kræver stemme-kloning, lettere at tilføje kontrol over andre stil-parametre. Bygning på disse, har OpenVoice-rammen til formål at afkoble Instant Voice Cloning-opgaverne i underopgaver. Modellen foreslår at anvende en basis-speakertekst-til-tale-model til at kontrollere sproget og stil-parametrene og anvender en tone-farve-omvandler til at inkludere reference-tone-farven i den genererede stemme.

I sin kerne anvender OpenVoice-rammen to komponenter: en tone-farve-omvandler og en basis-speakertekst-til-tale-model. Den basis-speakertekst-til-tale-model er enten en enkelt-speakermodel eller en multi-speakermmodel, der giver præcis kontrol over stil-parametre, sprog og accent. Modellen genererer en stemme, der herefter overføres til tone-farve-omvandleren, der ændrer basis-speakertone-farven til tone-farven fra reference-speakeren.
OpenVoice-rammen giver en stor fleksibilitet, når det kommer til den basis-speakertekst-til-tale-model, da den kan anvende VITS-modellen med små ændringer, der giver den mulighed for at acceptere sprog- og stil-embedding i dens varigheds-predictor og tekst-encoder. Rammen kan også anvende modeller som Microsoft (MSFT ) TTS, der er kommercialt billige, eller den kan anvende modeller som InstructTTS, der kan acceptere stil-prompter. For tiden anvender OpenVoice-rammen VITS-modellen, selvom de andre modeller også er en mulig løsning.
Når det kommer til den anden komponent, tone-farve-omvandleren, er det en encoder-decoder-komponent, der indeholder en invers normaliserings-flow i midten. Encoder-komponenten i tone-farve-omvandleren er en en-dimensionel CNN, der accepterer den kort-tids-fourier-transformerede spektrum af den basis-speakertekst-til-tale-model som input. Encoderen genererer herefter feature-kort som output. Tone-farve-udtrækkeren er en simpel to-dimensionel CNN, der opererer på mel-spektrogrammet af input-lyden og genererer en enkelt feature-vektor som output, der indeholder information om tone-farven. Normaliserings-flow-lagene accepterer feature-kortene, der er genereret af encoderen, som input og genererer en feature-repræsentation, der bevare alle stil-egenskaber, men eliminerer tone-farve-informationen. OpenVoice-rammen anvender herefter normaliserings-flow-lagene i den inverse retning og tager feature-repræsentationerne som input og output normaliserings-flow-lagene. Rammen dekoder herefter normaliserings-flow-lagene til rå lydbølger ved hjælp af en stak af transponerede en-dimensionale konvolutioner.
Hele arkitekturen for OpenVoice-rammen er feed-forward uden brug af nogen auto-regressive komponent. Tone-farve-omvandler-komponenten ligner stemme-omvandling på et konceptuelt niveau, men adskiller sig i funktion, trænings-objektiver og induktiv bias i model-strukturen. Normaliserings-flow-lagene deler samme struktur som flow-baserede tekst-til-tale-modeller, men adskiller sig i funktion og trænings-objektiver.
Desuden findes der en anden tilgang til at udtrække feature-repræsentationer, og metoden, der er implementeret af OpenVoice-rammen, giver bedre lydkvalitet. Det er også værd at bemærke, at OpenVoice-rammen ikke har til hensigt at opfinde komponenter i model-arkitekturen, men begge hoved-komponenter, tone-farve-omvandleren og basis-speakertekst-til-tale-modellen, er begge hentet fra eksisterende arbejder. Det primære formål for OpenVoice-rammen er at danne en afkoblet ramme, der adskiller sprog-kontrol og stemme-stil fra tone-farve-kloning. Selvom tilgangen er ret simpel, er den ret effektiv, især på opgaver, der kontrollerer stilarter og accenter eller nye sprog-generering-opgaver. At opnå samme kontrol, når man anvender en koblet ramme, kræver en stor mængde beregning og data, og den generaliserer ikke godt til nye sprog.
I sin kerne er den primære filosofi for OpenVoice-rammen at afkoble generationen af sprog og stemme-stilarter fra generationen af tone-farve. En af de største styrker for OpenVoice-rammen er, at klon-stemmen er flydende og af høj kvalitet, så længe den enkelt-speakertekst-til-tale-model taler flydende.
OpenVoice: Eksperiment og Resultater
At evaluere stemme-kloning-opgaver er en svær opgave på grund af flere årsager. For det første anvender eksisterende arbejder ofte forskellige trænings- og test-data, hvilket gør det intrinsisk urimeligt at sammenligne disse arbejder. Selvom crowd-sourcing kan anvendes til at evaluere metrics som Mean Opinion Score, vil sværheden og diversiteten af test-dataet påvirke det samlede resultat betydeligt. For det andet har forskellige stemme-kloning-metoder forskellige trænings-data, og diversiteten og skalaen af disse data påvirker resultaterne betydeligt. Endelig adskiller sig de primære formål for eksisterende arbejder ofte fra hinanden, hvilket giver dem forskellige funktioner.
På grund af de tre årsager, det er urimeligt at sammenligne eksisterende stemme-kloning-rammer numerisk. I stedet giver det mere mening at sammenligne disse metoder kvalitativt.
Nøjagtig Tone-Farve-Kloning
For at analysere dens ydelse bygger udviklerne en test-sæt med anonyme personer, spil-personer og berømtheder, der danner reference-speakertypen, og har en bred stemme-fordeling, herunder både neutrale eksempler og unikke udtryksfulde stemmer. OpenVoice-rammen kan klone reference-tone-farven og generere tale i flere sprog og accenter for en hvilken som helst reference-speakere og de 4 basis-speakere.

Fleksibel Kontrol over Stemme-Stilarter
En af de objekter for OpenVoice-rammen er at kontrollere tale-stilarterne fleksibelt ved hjælp af tone-farve-omvandleren, der kan ændre tone-farven, mens den bevare alle andre stemme-funktioner og egenskaber.
Eksperimenter viser, at modellen bevare stemme-stilarterne efter at have konverteret til reference-tone-farven. I nogle tilfælde neutraliserer modellen dog følelserne lidt, et problem, der kan løses ved at give mindre information til flow-lagene, så de ikke kan fjerne følelsen. OpenVoice-rammen kan bevare stilarterne fra basis-stemmen takket være brugen af en tone-farve-omvandler. Det giver OpenVoice-rammen mulighed for at manipulere den basis-speakertekst-til-tale-model og let kontrollere stemme-stilarterne.

Cross-Lingual Stemme-Klon
OpenVoice-rammen inkluderer ikke nogen stor-speakermulti-lingual-data for et uset sprog, men kan alligevel opnå næsten cross-lingual stemme-kloning i en zero-shot-indstilling. Cross-lingual stemme-kloning-kapaciteterne for OpenVoice-rammen er to-fold:
- Modellen kan klone tone-farven af reference-speakeren nøjagtigt, når sproget for reference-speakeren ikke er set i det multi-speakermulti-lingual eller MSML-datasæt.
- Desuden, i samme tilfælde, hvor sproget for reference-speakeren ikke er set, kan OpenVoice-rammen klone stemmen af reference-speakeren og tale på sproget, hvis basis-speakertekst-til-tale-modellen understøtter sproget.
Endelige Tanker
I denne artikel har vi talt om OpenVoice, en fleksibel instant-stemme-kloning-ramme, der replikerer stemmen fra en hvilken som helst bruger og genererer tale i flere sprog ved hjælp af et kort lydklippet fra reference-speakeren. Den primære intuition bag OpenVoice er, at så længe en model ikke behøver at udføre tone-farve-kloning af reference-speakeren, kan en ramme anvende en basis-speakertekst-til-tale-model til at kontrollere sproget og stemme-stilarterne.
OpenVoice demonstrerer, at Instant Voice Cloning-modeller kan replikere tone-farven af reference-speakeren og opnå granuleret kontrol over stemme-stilarter, herunder accent, rytme, intonation, pauser og endda følelser. OpenVoice kan levere overlegne instant-stemme-kloning-resultater, samtidig med at den er komputationelt bæredygtig med driftsomkostninger op til 10 gange mindre end nuværende tilgængelige API’er med ringere ydelse.












