AI-mallit ja alustat
OpenVoice: Monipuolinen Äänen Kloonauksesta
Tekstistä puheen synteesissä (TTS) Äänen Kloonauksesta (IVC) mahdollistaa TTS-mallin kloonata äänen minkä tahansa viitepuhujan käyttäen lyhyttä ääninäytettä, ilman tarvetta lisäkoulutukselle viitepuhuja. Tämä tekniikka tunnetaan myös nimellä Zero-Shot Text-to-Speech Synthesis. Äänen Kloonauksen lähestymistapa mahdollistaa joustavan mukauttamisen luodulle äänelle ja osoittaa merkittävää arvoa laajassa valikoimassa todellisissa tilanteissa, mukaan lukien mukautettavat chatbotit, sisällön luonti ja vuorovaikutus ihmisien ja suurten kielimallien (LLM) välillä.
Vaikka nykyiset äänen kloonauksen kehykset tekevät työnsä hyvin, ne ovat ongelmallisia joitakin haasteita alalla, mukaan lukien Joustava Äänen Tyylin Ohjaus eli mallit eivät pysty muokkaamaan äänen tyylejä joustavasti kloonatun äänen jälkeen. Toinen merkittävä este, jota nykyiset instant-kloonauksen kehykset kohtaavat, on Nollan Shot Cross-Lingual Äänen Kloonauksesta eli koulutuksen tarpeisiin nykyiset mallit vaativat pääsyä laajaan massive-speaker monikieliseen tai MSML-aineistoon riippumatta kielestä.
Ratkaistaakseen nämä ongelmat ja osallistuakseen äänen kloonauksen mallien parantamiseen, kehittäjät ovat työskennelleet OpenVoice-projektissa, joka on monipuolinen instant-äänen kloonauksen kehys, joka replikoi minkä tahansa käyttäjän äänen ja luo puhetta useilla kielillä käyttäen lyhyttä ääninäytettä viitepuhujalta. OpenVoice osoittaa, että instant-äänen kloonauksen mallit voivat replikoida viitepuhujan sävyvärin ja saavuttaa hienorakeisen ohjauksen äänen tyyleissä, mukaan lukien aksentti, rytmi, intonaatio, tauot ja jopa tunteet. Mitä enemmän vaikuttaa, on se, että OpenVoice-kehys osoittaa myös merkittäviä kykyjä saavuttamaan nollan shot cross-lingual äänen kloonauksen kielille, jotka eivät ole MSML-aineistossa, mahdollistaen OpenVoicen kloonata ääniä uusille kielille ilman laajaa esikoulutusta kyseiselle kielelle. OpenVoice pystyy toimittamaan ylivoimaiset instant-äänen kloonauksen tulokset ollessaan laskennallisesti toteuttamiskelpoinen ja käyttäen operatiivisia kustannuksia, jotka ovat jopa 10 kertaa vähemmän kuin nykyisillä saatavilla olevilla API:illa, joilla on heikompi suorituskyky.
Tässä artikkelissa puhumme OpenVoice-kehystä syvemmällä ja paljastamme sen arkkitehtuurin, joka mahdollistaa sen toimittaa ylivoimaisen suorituskyvyn instant-äänen kloonauksen tehtävissä. Joten aloitetaan.
OpenVoice: Mahdollistaen Monipuolisen Instant-Äänen Kloonauksen
Kuten mainittiin aiemmin, instant-äänen kloonauksesta, jota kutsutaan myös Zero-Shot Text-to-Speech Synthesiksi, mahdollistaa TTS-mallin kloonata minkä tahansa viitepuhujan äänen käyttäen lyhyttä ääninäytettä ilman tarvetta lisäkoulutukselle viitepuhuja. Instant-äänen kloonauksesta on aina ollut kuumaa tutkimusaihetta, ja olemassa olevat työt, kuten XTTS- ja VALLE-kehykset, jotka poistavat puhujan upotukset ja/tai akustiset tokenit viiteäänestä, jotka toimivat ehdolla auto-regressiiviselle mallille. Auto-regressiivinen malli generoi akustisia tokeneja peräkkäin ja dekoodaa nämä tokenit raakaa ääniaaltoa.
Vaikka auto-regressiiviset instant-äänen kloonauksen mallit kloonaa sävyvärin erinomaisesti, ne eivät pysty muokkaamaan muita tyyliparametreja, kuten aksenttia, emotionaalisuutta, taukoja ja rytmiä. Lisäksi auto-regressiiviset mallit kokemuksensa mukaan myös hitaan inference-nopeuden ja korkeiden operatiivisten kustannusten. Olemassa olevat lähestymistavat, kuten YourTTS-kehys, käyttävät non-autoregressiivista lähestymistapaa, joka osoittaa merkittävästi nopeamman inference-puheen auto-regressiivisten kehysten verrattuna, mutta eivät pysty tarjoamaan käyttäjilleen joustavaa ohjausta tyyliparametreissa. Lisäksi sekä auto-regressiiviset että non-autoregressiiviset instant-äänen kloonauksen kehykset tarvitsevat pääsyn laajaan MSML- tai massive-speaker monikieliseen aineistoon cross-lingual äänen kloonaukseen.
Ratkaistaakseen haasteita, joita nykyiset instant-äänen kloonauksen kehykset kohtaavat, kehittäjät ovat työskennelleet OpenVoice-projektissa, joka on avoimen lähdekoodin instant-äänen kloonauksen kirjasto, jonka tavoitteena on ratkaista seuraavat haasteet, joita nykyiset IVC-kehykset kohtaavat.
- Ensimmäinen haaste on mahdollistaa IVC-kehyksille joustava ohjaus tyyliparametreissa, mukaan lukien aksentti, rytmi, intonaatio ja tauot, lisäksi sävyvärin. Tyyliparametrit ovat tärkeitä luodakseen luonnollista vuorovaikutusta ja puhetta, eikä pelkästään narratiivista syötetekstiä.
- Toinen haaste on mahdollistaa IVC-kehyksille cross-lingual äänen kloonauksesta nollan shot -asetuksessa.
- Viimeinen haaste on saavuttaa korkeat reaaliaikaiset inference-nopeudet ilman suorituskyvyn heikentymistä.
Ratkaistaakseen kaksi ensimmäistä esteitä, OpenVoice-kehys on suunniteltu siten, että se erottaa komponentit äänessä parhaansa mukaan. Lisäksi OpenVoice generoi sävyvärin, kielen ja muut äänen ominaisuudet itsenäisesti, mahdollistaen kehykselle joustavan muokkaamisen yksittäisiä kielityyppejä ja äänen tyylejä. OpenVoice-kehys ratkaisee kolmannen haasteen oletusarvoisesti, koska eriytetty rakenne vähentää laskennallista monimutkaisuutta ja mallin kokoa.
OpenVoice: Menetelmä ja Arkkitehtuuri
OpenVoice-kehys on tehokas ja yllättävän helppo toteuttaa. On selvää, että kloonata sävyväri minkä tahansa puhujan, lisätä uusi kieli ja mahdollistaa joustava ohjaus äänen parametreissa samanaikaisesti voi olla haasteellista. Tämä johtuu siitä, että suorittaa nämä kolme tehtävää samanaikaisesti vaatii ohjattavien parametreja leikkaamaan suuren osan kombinatorisista aineistoista. Lisäksi säännöllisessä yksittäisen puhujan tekstistä puhetta synteesissä, tehtävissä, jotka eivät vaadi äänen kloonauksesta, on helpompi lisätä ohjaus muihin tyyliparametreihin. Rakentamalla näistä, OpenVoice-kehys pyrkii erottamaan instant-äänen kloonauksen tehtävät alitehtäviin. Malli ehdottaa käyttää peruspuhujan tekstistä puhetta -mallia ohjata kieltä ja tyyliparametreja, ja käyttää sävyväri-muuttajaa sisällyttääkseen viitepuhujan sävyvärin ääneen. Seuraava kuva osoittaa kehys arkkitehtuurin.

OpenVoice-kehys käyttää kahta komponenttia: sävyväri-muuttajaa ja peruspuhujan tekstistä puhetta -mallia. Peruspuhujan tekstistä puhetta -malli on joko yksittäisen puhujan tai monen puhujan malli, joka mahdollistaa tarkan ohjauksen tyyliparametreissa, kielessä ja aksentissa. Malli generoi äänen, joka välitetään sävyväri-muuttajalle, joka muuttaa peruspuhujan sävyvärin viitepuhujan sävyväriksi.
OpenVoice-kehys tarjoaa paljon joustavuutta peruspuhujan tekstistä puhetta -mallissa, koska se voi käyttää VITS-mallia, joka voidaan muokata siten, että se hyväksyy kielen ja tyyli- upotukset sen kestoa ennustajassa ja teksti- kooderissa. Kehys voi myös käyttää malleja, kuten Microsoft (MSFT ) TTS, jotka ovat kaupallisesti edullisia, tai malleja, kuten InstructTTS, jotka pystyvät hyväksymään tyyli- ohjeita. Toistaiseksi OpenVoice-kehys käyttää VITS-mallia, vaikka muut mallit ovat myös toteuttamiskelpoisia.
Tulevaan toiseen komponenttiin, sävyväri-muuttaja on koodaus-dekoodaus komponentti, joka sisältää invertoitavan normalisoinnin virran keskellä. Sävyväri-muuttajan koodaus- komponentti on yksiulotteinen CNN, joka hyväksyy peruspuhujan tekstistä puhetta -mallin lyhytaikaisen Fourier- muunnoksen spektrin syötteenä. Koodaus- komponentti generoi piirustus- kartat tuloksena. Sävyväri- poistaja on yksinkertainen kaksiulotteinen CNN, joka toimii syötteen äänen mel- spektrogrammin päällä, ja generoi yksittäisen piirustus- vektorin tuloksena, joka koodaa sävyvärin tiedon. Normalisointi- virran tasot hyväksyvät koodaus- komponentin generoimat piirustus- kartat syötteenä ja generoivat piirustus- esitysmuodon, joka säilyttää kaikki tyyli- ominaisuudet, mutta poistaa sävyväri- tiedon. OpenVoice-kehys soveltaa normalisointi- virran tasot vastakkaisessa suunnassa, ja ottaa piirustus- esitysmuodot syötteenä ja generoi normalisointi- virran tasot. Kehys dekoodaa sitten normalisointi- virran tasot raakaa ääniaalloksi käyttäen pinon yksiulotteisia transponoituneita konvoluutioita.
Koko OpenVoice-kehys on eteenpäin- syötetty ilman auto-regressiivisen komponentin käyttöä. Sävyväri-muuttaja- komponentti on samanlainen kuin äänen muunnos konseptuaalisella tasolla, mutta eroaa toiminnallisesti, koulutus- tavoitteissa ja induktiivisessa vinoumassa mallirakenteessa. Normalisointi- virran tasot jakavat saman rakenteen kuin flow- perustuvat tekstistä puhetta -mallit, mutta eroavat toiminnallisesti ja koulutus- tavoitteissa.
Lisäksi on olemassa erilainen lähestymistapa piirustus- esitysmuodon poistamiseen, ja menetelmä, jota OpenVoice-kehys toteuttaa, toimittaa paremman äänen laadun. On myös huomionarvoista, että OpenVoice-kehys ei pyri keksimään komponentteja mallirakenteessa, vaan molemmat pääkomponentit, eli sävyväri-muuttaja ja peruspuhujan tekstistä puhetta -malli, ovat peräisin olemassa olevista töistä. OpenVoice-kehys pyrkii muodostamaan eriytetyn kehys, joka erottaa kielen ohjauksen ja äänen tyylit sävyväri- kloonauksesta. Vaikka lähestymistapa on hyvin yksinkertainen, se on erittäin tehokas, erityisesti tehtävissä, jotka ohjaavat tyylejä ja aksentteja, tai uusien kielten yleistämistehtävissä. Saavuttamaan sama ohjaus, kun käytetään kiinnitettyä kehystä, vaatii suuren määrän laskentaa ja dataa, eikä se yleisty uusiin kieliihin.
OpenVoice-kehys perustuu pääfilosofiaan, joka erottaa kielen ja äänen tyylit sävyväri- kloonauksesta. Yksi OpenVoice-kehys suurista vahvuuksista on, että kloonattu ääni on sulava ja laadukas, kunhan yksittäisen puhujan TTS puhuu sulavasti.
OpenVoice: Koe ja Tulokset
Äänen kloonauksen tehtävien arviointi on vaikea objektiivinen useista syistä. Ensinnäkin, olemassa olevat työt usein käyttävät erilaisia koulutus- ja testi- aineistoja, mikä tekee niiden vertailun sisäisesti epäoikeudenmukaiseksi. Vaikka crowd-sourcing voidaan käyttää arvioimaan metriikkoja, kuten Mean Opinion Score, testi- aineiston vaikeus ja monimuotoisuus vaikuttavat lopputulokseen merkittävästi. Toiseksi, erilaiset äänen kloonauksen menetelmät ovat erilaisia, ja niiden koulutus- aineistojen monimuotoisuus ja aineiston laajuus vaikuttavat tuloksiin merkittävästi. Lopuksi, olemassa olevien töiden pääasiallinen tavoite eroaa toisistaan, joten ne eroavat toiminnallisesti.
Näiden kolmen syyn vuoksi on epäoikeudenmukainen vertailla olemassa olevia äänen kloonauksen kehyksiä numeerisesti. Sen sijaan on järkevämpää vertailla näitä menetelmiä laadullisesti.
Tarkan Sävyväri- Kloonauksen
Analyysiakseen suorituskykyä, kehittäjät rakentavat testi- aineiston, joka sisältää anonyymejä yksilöitä, pelihahmoja ja julkkisia viitepuhujan perustana, ja jolla on laaja äänen jakautuma, mukaan lukien sekä neutraaleja näytteitä että ainutlaatuisia ilmaisullisia ääniä. OpenVoice-kehys pystyy kloonamaan viite- sävyvärin ja generoi puhetta useilla kielillä ja aksenteilla minkä tahansa viitepuhujan ja neljän peruspuhujan äänessä.

Joustava Ohjaus Äänen Tyyleissä
Yksi OpenVoice-kehys tavoitteista on ohjata puhetyylejä joustavasti sävyväri- muuttajan avulla, joka voi muuttaa sävyväriä säilyttäen kaikki muut äänen ominaisuudet ja ominaisuudet.
Kokeet osoittavat, että malli säilyttää äänen tyylit sävyväri- muunnoksen jälkeen. Jossain tapauksissa kuitenkin malli neutraloi emotionaalisuutta hieman, ongelma, joka voidaan ratkaista antamalla vähemmän tietoa virran tasolle, jotta se ei pysty poistamaan emotionaalisuutta. OpenVoice-kehys pystyy säilyttämään tyylit perusäänestä kiitos sävyväri- muuttajan käytölle. Se mahdollistaa OpenVoice-kehys muokata peruspuhujan tekstistä puhetta -mallia helposti ohjata äänen tyylejä.

Cross-Lingual Äänen Kloonauksesta
OpenVoice-kehys ei sisällä massive- puhujan dataa näkemättömälle kielelle, mutta se pystyy saavuttamaan lähes cross-lingual äänen kloonauksen nollan shot -asetuksessa. OpenVoice-kehys cross-lingual äänen kloonauksen kyvyt ovat kaksinkertaiset:
- Malli pystyy kloonamaan sävyväri- viitepuhujan tarkasti, kun viitepuhujan kieli on näkemätön monen puhujan monikielisessä tai MSML- aineistossa.
- Lisäksi, kun viitepuhujan kieli on näkemätön, OpenVoice-kehys pystyy kloonamaan viitepuhujan äänen ja puhua kielellä, edellyttäen, että peruspuhujan tekstistä puhetta -malli tukee kieltä.
Loppusanat
Tässä artikkelissa olemme puhuneet OpenVoice-kehystä, joka on monipuolinen instant-äänen kloonauksen kehys, joka replikoi minkä tahansa käyttäjän äänen ja luo puhetta useilla kielillä käyttäen lyhyttä ääninäytettä viitepuhujalta. OpenVoice-kehys perustuu pääasiallisesti siihen, että kunhan malli ei tarvitse suorittaa sävyväri- kloonauksesta viitepuhujalle, kehys voi käyttää peruspuhujan tekstistä puhetta -mallia ohjata kieltä ja äänen tyylejä.
OpenVoice-kehys osoittaa, että instant-äänen kloonauksen mallit voivat replikoida viitepuhujan sävyvärin ja saavuttaa hienorakeisen ohjauksen äänen tyyleissä, mukaan lukien aksentti, rytmi, intonaatio, tauot ja jopa tunteet. OpenVoice-kehys pystyy toimittamaan ylivoimaiset instant-äänen kloonauksen tulokset ollessaan laskennallisesti toteuttamiskelpoinen ja käyttäen operatiivisia kustannuksia, jotka ovat jopa 10 kertaa vähemmän kuin nykyisillä saatavilla olevilla API:illa, joilla on heikompi suorituskyky.












