Modely a platformy AI

OpenVoice: Povolující všestranné okamžité klonování hlasu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Při syntéze textu na řeč (TTS) umožňuje Instant Voice Cloning (IVC) modelu TTS klonovat hlas libovolného referenčního mluvčího pomocí krátkého audio vzorku, aniž by vyžadoval další trénink pro referenčního mluvčího. Tato technika je také známa jako Zero-Shot Text-to-Speech Synthesis. Přístup Instant Voice Cloning umožňuje flexibilní přizpůsobení vygenerovaného hlasu a prokázal významnou hodnotu v širokém spektru reálných situací, včetně přizpůsobených chatbotů, tvorby obsahu a interakcí mezi lidmi a velkými jazykovými modely (LLM).

Ačkoli současné rámce pro klonování hlasu dělají svou práci dobře, jsou zatíženy několika výzvami v oboru, včetně Flexibilní kontroly stylu hlasu, tj. modely postrádají schopnost flexibilně manipulovat styly hlasu po klonování hlasu. Další významnou překážkou, se kterou se setkávají současné rámce pro okamžité klonování, je Zero-Shot Cross-Lingual Voice Cloning , tj. pro účely tréninku vyžadují současné modely přístup k rozsáhlé sadě dat s mnoha mluvčími a mnoha jazyky (MSML), bez ohledu na jazyk.

Aby se tyto problémy vyřešily a přispěly k vylepšení modelů pro okamžité klonování hlasu, vývojáři pracovali na OpenVoice, rámci pro okamžité klonování hlasu, který replikuje hlas libovolného uživatele a generuje řeč v několika jazycích pomocí krátkého audio vzorku z referenčního mluvčího. OpenVoice prokázal, že modely pro okamžité klonování hlasu mohou replikovat barevný tón referenčního mluvčího a dosáhnout jemné kontroly nad styly hlasu, včetně přízvuku, rytmu, intonace, pauz a dokonce i emocí. Co je ještě působivější, je to, že rámec OpenVoice také prokázal pozoruhodné schopnosti při dosahování zero-shot cross-lingvalního klonování hlasu pro jazyky mimo sadu MSML, což umožňuje OpenVoice klonovat hlasy do nových jazyků bez rozsáhlého předtréninku pro ten jazyk. OpenVoice dokáže dodat nadřazené výsledky okamžitého klonování hlasu, zatímco je výpočetně životaschopný s provozními náklady až o 10krát nižšími než u aktuálně dostupných API s horším výkonem.

V tomto článku budeme hovořit o rámci OpenVoice v hloubce a prozkoumáme jeho architekturu, která mu umožňuje dodat nadřazený výkon při úkolech okamžitého klonování hlasu. Takže pojďme začít.

OpenVoice : Povolující všestranné okamžité klonování hlasu

Jak bylo zmíněno dříve, okamžité klonování hlasu, také známé jako Zero-Shot Text to Speech Synthesis, umožňuje modelu TTS klonovat hlas libovolného referenčního mluvčího pomocí krátkého audio vzorku, aniž by vyžadoval další trénink pro referenčního mluvčího. Okamžité klonování hlasu bylo vždy horkým tématem výzkumu s existujícími pracemi, včetně rámců XTTS a VALLE, které extrahují vložené mluvčího a/nebo akustické tokeny z referenčního audio, které slouží jako podmínka pro auto-regresivní model. Auto-regresivní model poté generuje akustické tokeny sekvenčně a poté dekóduje tyto tokeny do surového audio signálu.

Ačkoli auto-regresivní modely pro okamžité klonování hlasu klonují barevný tón pozoruhodně, postrádají schopnost manipulovat jinými parametry stylu, včetně přízvuku, emocí, pauz a rytmu. Kromě toho auto-regresivní modely také zažívají nízkou rychlost inferencingu a jejich provozní náklady jsou quite vysoké. Existující přístupy, jako je rámec YourTTS, využívají neauto-regresivní přístup, který prokazuje výrazně rychlejší inferencing řeči než rámce založené na auto-regresivních modelech, ale jsou stále neschopné poskytnout uživatelům flexibilní kontrolu nad parametry stylu. Kromě toho rámce pro okamžité klonování hlasu založené na auto-regresivních a neauto-regresivních modelech vyžadují přístup k rozsáhlé sadě dat s mnoha mluvčími a mnoha jazyky (MSML) pro cross-lingvalní klonování hlasu.

Aby se tyto problémy vyřešily, vývojáři pracovali na OpenVoice, otevřeném rámci pro okamžité klonování hlasu, který má za cíl vyřešit následující problémy, se kterými se setkávají současné rámce pro okamžité klonování hlasu.

  1. První výzvou je umožnit rámcům pro okamžité klonování hlasu flexibilní kontrolu nad parametry stylu, kromě barevného tónu, včetně přízvuku, rytmu, intonace a pauz. Parametry stylu jsou zásadní pro generování přirozených konverzací a řeči, spíše než monotónního čtení vstupního textu.
  2. Druhá výzvou je umožnit rámcům pro okamžité klonování hlasu klonovat cross-lingvalní hlasy v zero-shot nastavení.
  3. Třetí výzvou je dosáhnout vysoké rychlosti inferencingu v reálném čase, aniž by se zhoršila kvalita.

Aby se tyto dvě první překážky vyřešily, je architektura rámce OpenVoice navržena tak, aby rozdělila komponenty v hlasu na maximum. Kromě toho OpenVoice generuje barevný tón, jazyk a další funkce hlasu nezávisle, což umožňuje rámci flexibilně manipulovat jednotlivými jazykovými typy a styly hlasu. Rámec OpenVoice vyřešuje třetí výzvu implicitně, protože rozdělená struktura snižuje výpočetní složitost a požadavky na velikost modelu.

OpenVoice : Metodologie a architektura

Technický rámec OpenVoice je účinný a překvapivě jednoduchý na implementaci. Není žádným tajemstvím, že klonování barevného tónu pro libovolného mluvčího, přidání nového jazyka a umožnění flexibilní kontroly nad parametry hlasu současně může být náročné. Je to proto, že provedení těchto tří úkolů současně vyžaduje, aby řízené parametry se protínaly pomocí velké části kombinatorických dat. Kromě toho, v běžné syntéze textu na řeč pro jednoho mluvčího, pro úkoly, které nevyžadují klonování hlasu, je snazší přidat kontrolu nad jinými parametry stylu. Na základě toho se rámec OpenVoice snaží rozdělit úkoly okamžitého klonování hlasu na podúkoly. Model navrhuje použít základní model TTS pro mluvčího, aby kontroloval jazyk a parametry stylu, a využít převodník barevného tónu, aby zahrnul referenční barevný tón do vygenerovaného hlasu. Následující obrázek demonstruje architekturu rámce.

V jádru rámce OpenVoice jsou dvě komponenty: převodník barevného tónu a základní model TTS pro mluvčího. Základní model TTS pro mluvčího je buď jednoduchý model pro jednoho mluvčího, nebo model pro více mluvčích, který umožňuje přesnou kontrolu nad parametry stylu, jazykem a přízvukem. Model generuje hlas, který je poté předán převodníkovi barevného tónu, který změní základní barevný tón mluvčího na barevný tón referenčního mluvčího.

Rámec OpenVoice nabízí mnoho flexibility, pokud jde o základní model TTS pro mluvčího, protože může využít model VITS s malými úpravami, které umožňují přijímat jazykové a stylové vložené prvky v jeho prediktoru délky a textovém kodéru. Rámec může také využít modely, jako je Microsoft (MSFT ) TTS, které jsou komerčně levné, nebo modely, jako je InstructTTS, které jsou schopné přijímat stylové prompty. Prozatím rámec OpenVoice využívá model VITS, i když ostatní modely jsou také životaschopnou možností.

Převodník barevného tónu je komponenta encoder-decoder, která obsahuje invertibilní normalizující tok ve středu. Encoderová komponenta v převodníkovi barevného tónu je jednoduchý konvoluční neuronový réseau (CNN), který přijímá krátkodobou Fourierovu transformaci základního modelu TTS pro mluvčího jako vstup. Encoder poté generuje feature mapy jako výstup. Extraktor barevného tónu je jednoduchý dvoudimenzionální CNN, který operuje na mel-spektrogramu vstupního hlasu a generuje jeden feature vektor jako výstup, který kóduje informace o barevném tónu. Normalizující tokové vrstvy přijímají feature mapy generované encoderem jako vstup a generují feature reprezentaci, která zachovává všechny stylové vlastnosti, ale eliminuje informace o barevném tónu. Rámec OpenVoice poté aplikuje normalizující tokové vrstvy v inverzním směru a bere feature reprezentace jako vstup a výstup normalizující tokové vrstvy. Rámec poté dekóduje normalizující tokové vrstvy do surových audio signálů pomocí zásobníku transponovaných jednodimenzionálních konvolucí.

Celá architektura rámce OpenVoice je feed forward bez použití žádné auto-regresivní komponenty. Převodník barevného tónu je podobný převodu hlasu na konceptuální úrovni, ale liší se ve funkčnosti, tréninkových cílech a induktivním zkreslením ve struktuře modelu. Normalizující tokové vrstvy sdílejí stejnou strukturu jako modely TTS založené na toku, ale liší se ve funkčnosti a tréninkových cílech.

Kromě toho existuje jiný přístup k extrakci feature reprezentací, metoda implementovaná rámcem OpenVoice dodává lepší kvalitu audio. Je také důležité poznamenat, že rámec OpenVoice nemá v úmyslu vynalézat komponenty ve struktuře modelu, ale spíše obě hlavní komponenty, tj. převodník barevného tónu a základní model TTS pro mluvčího, pocházejí z existujících prací. Hlavním cílem rámce OpenVoice je vytvořit rozdělený rámec, který odděluje kontrolu jazyka a stylu od klonování barevného tónu. Ačkoli přístup je poměrně jednoduchý, je účinný, zejména pro úkoly, které kontrolují styly a akcenty, nebo nové jazykové generalizační úkoly. Dosáhnutí stejné kontroly při využití rozděleného rámce vyžaduje velké množství výpočtů a dat a negeneralizuje se dobře na nové jazyky.

V jádru je hlavní filozofií rámce OpenVoice oddělit generování jazyka a stylů od generování barevného tónu. Jednou z hlavních silných stránek rámce OpenVoice je, že klonovaný hlas je plynulý a vysoké kvality, pokud základní model TTS pro jednoho mluvčího mluví plynule.

OpenVoice : Experiment a výsledky

Hodnocení úkolů klonování hlasu je obtížné z mnoha důvodů. Za prvé, existující práce často využívají různé tréninkové a testovací data, což činí srovnání těchto prací vnitřně nespravedlivým. Ačkoli lze využít crowd-sourcing k hodnocení metrik, jako je Mean Opinion Score, obtížnost a rozmanitost testovacích dat budou mít značný vliv na celkový výsledek. Za druhé, různé metody klonování hlasu mají různé tréninkové data a rozmanitost a rozsah těchto dat ovlivňují výsledky významně. Konečně, hlavní cíl existujících prací se často liší, a proto se liší ve funkčnosti.

Vzhledem k těmto třem důvodům je nespravedlivé srovnávat existující rámce pro klonování hlasu numericky. Místo toho má více smyslu srovnávat tyto metody kvalitativně.

Přesné klonování barevného tónu

Aby se analyzoval jeho výkon, vývojáři vytvořili testovací sadu s anonymními jednotlivci, herními postavami a celebritami, které tvoří referenční mluvčí a mají široké rozložení hlasu, včetně neutrálních vzorků a unikátních expresivních hlasů. Rámec OpenVoice je schopen klonovat referenční barevný tón a generovat řeč v několika jazycích a akcentech pro libovolného referenčního mluvčího a 4 základních mluvčích.

Flexibilní kontrola nad styly hlasu

Jedním z cílů rámce OpenVoice je kontrola stylů hlasu flexibilně pomocí převodníku barevného tónu, který může měnit barevný tón, zatímco zachovává všechny ostatní funkce a vlastnosti hlasu.

Experimenty ukazují, že model zachovává styly hlasu po převodu na referenční barevný tón. V některých případech však model neutralizuje emoce mírně, problém, který lze vyřešit přenosem méně informací do tokových vrstev, aby nemohly eliminovat emoce. Rámec OpenVoice je schopen zachovat styly z základního hlasu díky využití převodníku barevného tónu. To umožňuje rámcu OpenVoice manipulovat základním modelem TTS pro mluvčího, aby snadno kontroloval styly hlasu.

Cross-lingvalní klonování hlasu

Rámec OpenVoice neobsahuje žádné velké množství dat pro neviditelný jazyk, a přesto je schopen dosáhnout téměř cross-lingvalního klonování hlasu v zero-shot nastavení. Schopnosti cross-lingvalního klonování hlasu rámce OpenVoice jsou dvojí:

  1. Model je schopen klonovat barevný tón referenčního mluvčího přesně, když jazyk referenčního mluvčího není viditelný v sadě dat s mnoha mluvčími a mnoha jazyky (MSML).
  2. Kromě toho, v případě, že jazyk referenčního mluvčího není viditelný, je rámec OpenVoice schopen klonovat hlas referenčního mluvčího a mluvit v jazyce, za předpokladu, že základní model TTS pro mluvčího podporuje jazyk.

Závěrečné myšlenky

V tomto článku jsme hovořili o rámcu OpenVoice, všestranném rámci pro okamžité klonování hlasu, který replikuje hlas libovolného uživatele a generuje řeč v několika jazycích pomocí krátkého audio vzorku z referenčního mluvčího. Hlavní intuice za OpenVoice je, že pokud model nemusí provádět klonování barevného tónu referenčního mluvčího, může rámec využít základní model TTS pro mluvčího, aby kontroloval jazyk a styly hlasu.

Rámec OpenVoice prokazuje, že modely pro okamžité klonování hlasu mohou replikovat barevný tón referenčního mluvčího a dosáhnout jemné kontroly nad styly hlasu, včetně přízvuku, rytmu, intonace, pauz a dokonce i emocí. Rámec OpenVoice dokáže dodat nadřazené výsledky okamžitého klonování hlasu, zatímco je výpočetně životaschopný s provozními náklady až o 10krát nižšími než u aktuálně dostupných API s horším výkonem.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.