AI-modeller og plattformer
OpenVoice: Fleksibelt Instant Voice Cloning
I Text-to-Speech-syntese (TTS) gjør Instant Voice Cloning (IVC) det mulig for TTS-modellen å klone stemmen til en hvilken som helst referansespeaker ved hjelp av et kort lydklipp, uten å kreve ytterligere trening for referansespeakeren. Denne teknikken kalles også Zero-Shot Text-to-Speech Synthesis. Instant Voice Cloning-tilnærmingen gjør det mulig å tilpasse den genererte stemmen fleksibelt og demonstrerer betydelig verdi over en rekke virkelige situasjoner, inkludert tilpassede chatbots, innholdsskapning og interaksjoner mellom mennesker og store språkmodeller (LLM).
Selv om de nåværende stemme-kloning-rammeverkene gjør jobben sin godt, er de plaget av noen utfordringer i feltet, inkludert Fleksibel Stemme Stil Kontroll, dvs. modellene mangler evnen til å manipulere stemmestiler fleksibelt etter å ha klonet stemmen. En annen større hindring som møter nåværende instant-kloning-rammeverk er Zero-Shot Cross-Lingual Voice Cloning, dvs. for treningens skyld, krever nåværende modeller tilgang til en omfattende stor-speaker multi-lingual eller MSML-dataset, uavhengig av språket.
For å takle disse problemene og bidra til å forbedre instant-stemme-kloning-modellene, har utviklere arbeidet med OpenVoice, et fleksibelt instant-stemme-kloning-rammeverk som replikerer stemmen til en hvilken som helst bruker og genererer tale i flere språk ved hjelp av et kort lydklipp fra referansespeakeren. OpenVoice demonstrerer at Instant Voice Cloning-modellene kan replikere tonefargen til referansespeakeren og oppnå granulert kontroll over stemmestiler, inkludert aksent, rytme, intonasjon, pauser og selv følelser. Det som er enda mer imponerende er at OpenVoice-rammeverket også demonstrerer bemerkelsesverdige evner i å oppnå null-skudd-kors-lingvistisk stemme-kloning for språk utenfor MSML-datasettet, og lar OpenVoice klone stemmer til nye språk uten omfattende forhåndstrening for det språket. OpenVoice klarer å levere overlegne instant-stemme-kloning-resultater samtidig som det er komputasjonelt levedyktig med driftskostnader opptil 10 ganger mindre enn nåværende tilgjengelige API-er med dårligere ytelse.
I denne artikkelen vil vi snakke om OpenVoice-rammeverket i dybden og avdekke dens arkitektur som lar det levere overlegen ytelse over instant-stemme-kloning-oppgaver. Så la oss komme i gang.
OpenVoice: Enabling Fleksibelt Instant Voice Cloning
Som nevnt tidligere, Instant Voice Cloning, også kjent som Zero-Shot Text to Speech Synthesis, lar TTS-modellen klone stemmen til en hvilken som helst referansespeaker ved hjelp av et kort lydklipp, uten å kreve ytterligere trening for referansespeakeren. Instant Voice Cloning har alltid vært et populært forskningsemne med eksisterende arbeider som inkluderer XTTS- og VALLE-rammeverkene som trekker ut speaker-embedding og/eller akustiske token fra referanse-lyden som tjener som en betingelse for den auto-regressive modellen. Den auto-regressive modellen genererer deretter akustiske token sekvensielt og dekoderer disse tokenene til en rå lydbølge.
Selv om auto-regressive instant-stemme-kloning-modellene kloner tonefargen bemerkelsesverdig, mangler de evnen til å manipulere andre stilparametere, inkludert aksent, følelse, pauser og rytme. Videre erfaringer auto-regressive modeller også lav inferenshastighet og høye driftskostnader. Eksisterende tilnærminger som YourTTS-rammeverket anvender en ikke-auto-regressiv tilnærming som demonstrerer betydelig raskere inferens-tale enn auto-regressive rammeverk, men er fortsatt ikke i stand til å gi brukerne fleksibel kontroll over stilparametere. Dessuten trenger både auto-regressive-baserte og ikke-auto-regressive-baserte instant-stemme-kloning-rammeverk tilgang til et stort MSML- eller massive-speaker multi-lingual datasett for kors-lingvistisk stemme-kloning.
For å takle utfordringene som møter nåværende instant-stemme-kloning-rammeverk, har utviklere arbeidet med OpenVoice, et åpent kilde-instant-stemme-kloning-bibliotek som har som mål å løse følgende utfordringer som møter nåværende IVC-rammeverk.
- Den første utfordringen er å aktivere IVC-rammeverkene til å ha fleksibel kontroll over stilparametere i tillegg til tonefarge, inkludert aksent, rytme, intonasjon og pauser. Stilparametere er avgjørende for å generere naturlig samtale og tale i stedet for å fortelle innputt-teksten monotont.
- Den andre utfordringen er å aktivere IVC-rammeverkene til å klone kors-lingvistiske stemmer i en null-skudd-innstilling.
- Den tredje utfordringen er å oppnå høy sanntids-inferenshastighet uten å forringe kvaliteten.
For å takle de to første hindringene, er arkitekturen til OpenVoice-rammeverket designet for å frigjøre komponenter i stemmen så mye som mulig. Videre genererer OpenVoice tonefarge, språk og andre stemme-egenskaper uavhengig, og lar rammeverket fleksibelt manipulere individuelle språktyper og stemmestiler. OpenVoice-rammeverket takler den tredje utfordringen som standard, da den frigjorte strukturen reduserer komputasjonskompleksitet og modell-størrelse-krav.
OpenVoice: Metodologi og Arkitektur
Det tekniske rammeverket til OpenVoice er effektivt og overraskende enkelt å implementere. Det er ingen hemmelighet at å klone tonefargen for en hvilken som helst speaker, legge til et nytt språk og aktivere fleksibel kontroll over stemme-parametere samtidig kan være utfordrende. Det er fordi å utføre disse tre oppgavene samtidig krever at de kontrollerte parameterne må交叉 bruke en stor del av kombinatoriske datasett. Videre, i vanlige enkelt-speaker text-to-speech-syntese, for oppgaver som ikke krever stemme-kloning, er det enklere å legge til kontroll over andre stilparametere. Bygging på disse, har OpenVoice-rammeverket som mål å frigjøre Instant Voice Cloning-oppgavene til underoppgaver. Modellen foreslår å bruke en base-speaker Text-to-Speech-modell til å kontrollere språket og stilparametere, og anvender en tonefarge-omvandler til å inkludere referansetonefargen i den genererte stemmen.
I sin kerne, består OpenVoice-rammeverket av to komponenter: en tonefarge-omvandler og en base-speaker tekst-til-tale-modell. Base-speaker tekst-til-tale-modellen er enten en enkelt-speaker eller en multi-speaker-modell som lar nøyaktig kontroll over stilparametere, språk og aksent. Modellen genererer en stemme som deretter sendes til tonefarge-omvandleren, som endrer base-speaker-tonefargen til tonefargen til referansespeakeren.
OpenVoice-rammeverket tilbyr mye fleksibilitet når det gjelder base-speaker tekst-til-tale-modellen, siden den kan anvende VITS-modellen med små modifikasjoner som lar den akseptere språk- og stil-embedding i sin varighet-prediktor og tekst-encoder. Rammeverket kan også anvende modeller som Microsoft (MSFT ) TTS som er kommersielt billige eller det kan deployere modeller som InstructTTS som er i stand til å akseptere stil-prompter. For tiden anvender OpenVoice-rammeverket VITS-modellen, selv om de andre modellene også er en mulig løsning.
Kommer til den andre komponenten, er tonefarge-omvandleren en encoder-decoder-komponent som huset en inverserbar normaliseringsstrøm i midten. Encoder-komponenten i tonefarge-omvandleren er en en-dimensjonal CNN som aksepterer den kort-tids-fourier-transformerte spektrumet til base-speaker tekst-til-tale-modellen som innputt. Encoderen genererer deretter funksjonskart som utgang. Tonefarge-ekstraktoren er en enkel to-dimensjonal CNN som opererer på mel-spektrumet til innputt-stemmen og genererer en enkelt funksjonsvektor som utgang som koder informasjonen om tonefargen. Normaliseringsstrømslagene aksepterer funksjonskartene generert av encoderen som innputt og genererer en funksjonsrepresentasjon som bevare alle stil-egenskaper, men eliminerer tonefarge-informasjonen. OpenVoice-rammeverket anvender deretter normaliseringsstrømslagene i den inverse retningen og tar funksjonsrepresentasjonene som innputt og utgang. Rammeverket dekoderer deretter normaliseringsstrømslagene til rå lydbølger ved hjelp av en stabel av transponerte en-dimensjonale konvolusjoner.
Hele arkitekturen til OpenVoice-rammeverket er feed-forward uten å bruke noen auto-regressive komponent. Tonefarge-omvandler-komponenten er lignende til stemme-omvandling på et konseptuelt nivå, men forskjeller i funksjonalitet, trening-objektiver og induktiv bias i modellstrukturen. Normaliseringsstrømslagene deler samme struktur som flow-baserte tekst-til-tale-modeller, men forskjeller i funksjonalitet og trening-objektiver.
Videre finnes det en annen tilnærming til å trekke ut funksjonsrepresentasjoner, metoden implementert av OpenVoice-rammeverket leverer bedre lydkvalitet. Det er også verdt å merke seg at OpenVoice-rammeverket har ingen intensjon om å oppfinne komponenter i modell-arkitekturen, men både de to hoved-komponentene, dvs. tonefarge-omvandleren og base-speaker TTS-modellen, er begge hentet fra eksisterende arbeider. Det primære målet til OpenVoice-rammeverket er å danne et frigjort rammeverk som skiller språk-kontroll og stemme-stil fra tonefarge-kloning. Selv om tilnærmingen er ganske enkel, er den ganske effektiv, spesielt på oppgaver som kontrollerer stiler og aksenter eller nye språk-generering-oppgaver. Å oppnå samme kontroll når man anvender et koblet rammeverk krever en stor mengde beregning og data og generaliserer ikke godt til nye språk.
I sin kerne, er den primære filosofien til OpenVoice-rammeverket å frigjøre genereringen av språk og stemmestiler fra genereringen av tonefarge. En av de største styrkene til OpenVoice-rammeverket er at klon-stemmen er flytende og av høy kvalitet så lenge enkelt-speaker TTS snakker flytende.
OpenVoice: Eksperiment og Resultater
Å evaluere stemme-kloning-oppgaver er en vanskelig objektivt på grunn av flere årsaker. For det første, anvender eksisterende arbeider ofte forskjellige trening- og test-data som gjør sammenligning av disse arbeidene intrinsisk urimelig. Selv om crowd-sourcing kan brukes til å evaluere metrikker som gjennomsnittlig mening-score, vil vanskeligheten og mangfoldet av test-dataene vil påvirke resultatet betydelig. For det andre, har forskjellige stemme-kloning-metoder forskjellige trening-data, og mangfoldet og skalaen av disse dataene påvirker resultatet betydelig. Til slutt, har de primære målene til eksisterende arbeider ofte forskjellige funksjoner, og derfor forskjeller i funksjonalitet.
På grunn av de tre årsakene ovenfor, er det urimelig å sammenligne eksisterende stemme-kloning-rammeverk numerisk. I stedet, har det mer mening å sammenligne disse metodene kvalitativt.
Nøyaktig Tonefarge-Kloning
For å analysere dens ytelse, bygger utviklerne en testsett med anonyme personer, spill-karakterer og kjendiser som danner referansespeaker-basen, og har en bred stemme-distribusjon som inkluderer både nøytrale eksempler og unike uttrykksfulle stemmer. OpenVoice-rammeverket er i stand til å klone referansetonefargen og generere tale i flere språk og aksenter for en hvilken som helst av referansespeakerne og de 4 base-speakerne.

Fleksibel Kontroll over Stemme-Stiler
En av målene til OpenVoice-rammeverket er å kontrollere tale-stilene fleksibelt ved hjelp av tonefarge-omvandleren som kan modifisere tonefargen mens den bevare alle andre stemme-egenskaper og -parametere.
Eksperimenter indikerer at modellen bevare stemme-stilene etter å ha konvertert til referansetonefargen. I noen tilfeller, neutraliserer modellen følelsene litt, et problem som kan løses ved å sende mindre informasjon til flow-lagene så de ikke kan fjerne følelsen. OpenVoice-rammeverket er i stand til å bevare stilene fra base-stemmen takket være bruken av en tonefarge-omvandler. Det lar OpenVoice-rammeverket manipulere base-speaker tekst-til-tale-modellen for å lett kontrollere stemme-stilene.

Kors-Lingvistisk Stemme-Klon
OpenVoice-rammeverket inkluderer ikke noen massive-speaker-data for et usett språk, og er likevel i stand til å oppnå nær kors-lingvistisk stemme-kloning i en null-skudd-innstilling. Kors-lingvistiske stemme-kloning-egenskapene til OpenVoice-rammeverket er to-delt:
- Modellen er i stand til å klone tonefargen til referansespeakeren nøyaktig når språket til referansespeakeren ikke er sett i multi-speaker multi-lingual eller MSML-datasettet.
- Videre, i samme hendelse som språket til referansespeakeren ikke er sett, er OpenVoice-rammeverket i stand til å klone stemmen til referansespeakeren og snakke på språket på betingelse av at base-speaker tekst-til-tale-modellen støtter språket.
Slutt-tanker
I denne artikkelen har vi snakket om OpenVoice, et fleksibelt instant-stemme-kloning-rammeverk som replikerer stemmen til en hvilken som helst bruker og genererer tale i flere språk ved hjelp av et kort lydklipp fra referansespeakeren. Den primære intuisjonen bak OpenVoice er at så lenge en modell ikke må utføre tonefarge-kloning av referansespeakeren, kan et rammeverk anvende en base-speaker TTS-modell til å kontrollere språket og stemme-stilene.
OpenVoice demonstrerer at Instant Voice Cloning-modellene kan replikere tonefargen til referansespeakeren og oppnå granulert kontroll over stemme-stiler, inkludert aksent, rytme, intonasjon, pauser og selv følelser. OpenVoice klarer å levere overlegne instant-stemme-kloning-resultater samtidig som det er komputasjonelt levedyktig med driftskostnader opptil 10 ganger mindre enn nåværende tilgjengelige API-er med dårligere ytelse.












