Моделі та платформи ШІ
OpenVoice: Надання гнучкого миттєвого клонування голосу
У синтезі тексту в мову (TTS), миттєве клонування голосу (IVC) дозволяє моделі TTS клонувати голос будь-якого речового диктора, використовуючи короткий аудіозразок, без потреби додаткової підготовки для речового диктора. Цей підхід також відомий як синтез мови без зразків. Підхід миттєвого клонування голосу дозволяє гнучко налаштовувати згенерований голос і демонструє значну цінність у широкому спектрі реальних ситуацій, включаючи налаштовані чат-боти, створення контенту та взаємодію між людьми та великими мовними моделями (LLM).
Хоча поточні фреймворки клонування голосу роблять свою роботу добре, вони мають кілька проблем у галузі, включаючи гнучкий контроль над стилем голосу, тобто моделі не мають можливості маніпулювати стилем голосу гнучко після клонування голосу. Іншою великою проблемою, з якою стикаються поточні фреймворки миттєвого клонування голосу, є клонування голосу без зразків для різних мов, тобто для навчання поточні моделі потребують доступу до великої бази даних мовних зразків для різних мов.
Для вирішення цих проблем розробники працювали над OpenVoice, відкритим фреймворком миттєвого клонування голосу, який реплікує голос будь-якого користувача та генерує мову у декількох мовах, використовуючи короткий аудіозразок від речового диктора. OpenVoice демонструє, що моделі миттєвого клонування голосу можуть реплікувати тоновий колір речового диктора та досягати гранульованого контролю над стилем голосу, включаючи акцент, ритм, інтонацію, паузи та навіть емоції. Що ще більш вражає, так це те, що фреймворк OpenVoice також демонструє видатні можливості у досягненні клонування голосу без зразків для мов, які не входять до бази даних мовних зразків, що дозволяє OpenVoice клонувати голоси на нові мови без великої попередньої підготовки для тієї мови. OpenVoice здатний доставляти суперійорні результати миттєвого клонування голосу, залишаючись обчислювально життєздатним з операційними витратами до 10 разів меншими, ніж у поточних API з нижчою продуктивністю.
У цій статті ми поговоримо про фреймворк OpenVoice докладно та розкриємо його архітектуру, яка дозволяє йому демонструвати суперійорну продуктивність у завданнях миттєвого клонування голосу. Тому давайте почнемо.
OpenVoice: Надання гнучкого миттєвого клонування голосу
Як згадувалося раніше, миттєве клонування голосу, також відоме як синтез мови без зразків, дозволяє моделі TTS клонувати голос будь-якого речового диктора, використовуючи короткий аудіозразок, без потреби додаткової підготовки для речового диктора. Миттєве клонування голосу завжди було гарячою темою досліджень з існуючими роботами, включаючи фреймворки XTTS та VALLE, які витягують інформацію про мовця та/або акустичних токенів з аудіозразка, який служить умовою для автoregresивної моделі. Авторегресивна модель потім генерує акустичних токенів послідовно, а потім декодує ці токени у сирій аудіозразок.
Хоча автoregresивні моделі миттєвого клонування голосу реплікують тоновий колір чудово, вони не можуть маніпулювати іншими параметрами стилю, включаючи акцент, емоцію, паузи та ритм. Крім того, автoregresивні моделі також мають низьку швидкість висновку, а їх операційні витрати досить високі. Існуючі підходи, такі як фреймворк YourTTS, використовують неавторегресивний підхід, який демонструє значно вищу швидкість висновку мови над автoregresивними фреймворками, але все ще не можуть надати користувачам гнучкий контроль над параметрами стилю. Крім того, як автoregresивні, так і неавторегресивні фреймворки миттєвого клонування голосу потребують доступу до великої бази даних мовних зразків для клонування голосу різних мов.
Для вирішення проблем, з якими стикаються поточні фреймворки миттєвого клонування голосу, розробники працювали над OpenVoice, відкритим фреймворком миттєвого клонування голосу, який має на меті вирішити наступні проблеми, з якими стикаються поточні фреймворки IVC.
- Перша проблема полягає у тому, щоб дозволити фреймворкам IVC мати гнучкий контроль над параметрами стилю, крім тонового кольору, включаючи акцент, ритм, інтонацію та паузи. Параметри стилю мають важливе значення для генерації природних розмов та мови, а не для монотонного читання вхідного тексту.
- Друга проблема полягає у тому, щоб дозволити фреймворкам IVC клонувати голоси різних мов у режимі без зразків.
- Остання проблема полягає у тому, щоб досягти високої швидкості висновку у реальному часі без погіршення якості.
Для вирішення перших двох проблем архітектура фреймворку OpenVoice спроектована так, щоб відокремити компоненти голосу максимально можливим чином. Крім того, OpenVoice генерує тоновий колір, мову та інші характеристики голосу незалежно, що дозволяє фреймворку гнучко маніпулювати окремими мовами та стилями голосу. Фреймворк OpenVoice вирішує третю проблему за замовчуванням, оскільки відокремлена структура зменшує обчислювальну складність та вимоги до розміру моделі.
OpenVoice: Методологія та архітектура
Технічний фреймворк фреймворку OpenVoice є ефективним і досить простим у реалізації. Не секрет, що клонування тонового кольору для будь-якого мовця, додавання нової мови та забезпечення гнучкого контролю над параметрами голосу одночасно може бути складним завданням. Це відбувається тому, що виконання цих трьох завдань одночасно вимагає контрольованих параметрів, які перетинаються великою частиною комбінаторних даних. Крім того, у звичайному синтезі мови для одного мовця, для завдань, які не потребують клонування голосу, легше додати контроль над іншими параметрами стилю. Будуючи на цих знаннях, фреймворк OpenVoice має на меті відокремити завдання миттєвого клонування голосу на підзадачі. Модель пропонує використовувати базову модель синтезу мови для контролю мови та параметрів стилю, а також використовує конвертер тонового кольору для включення тонового кольору речового диктора у згенерований голос.
У своєму ядрі фреймворк OpenVoice використовує два компоненти: конвертер тонового кольору та базову модель синтезу мови. Базова модель синтезу мови може бути як одномовною, так і багатомовною, що дозволяє точно контролювати параметри стилю, мови та акценту. Модель генерує голос, який потім передається конвертеру тонового кольору, який змінює базовий тоновий колір на тоновий колір речового диктора.
Фреймворк OpenVoice пропонує багато гнучкості щодо базової моделі синтезу мови, оскільки він може використовувати модель VITS з незначними модифікаціями, що дозволяє їй приймати мовні та стилістичні вкладення у передбачувачі тривалості та текстовому кодувачі. Фреймворк також може використовувати моделі, такі як Microsoft (MSFT ) TTS, які є комерційно доступними, або моделі, такі як InstructTTS, які здатні приймати стилістичні запити. Наразі фреймворк OpenVoice використовує модель VITS, хоча інші моделі також є життєздатними варіантами.
Перейшовши до другого компоненту, конвертер тонового кольору є компонентом кодувача-дешифратора, який містить інвертований нормалізуючий потік у центрі. Компонент кодувача у конвертері тонового кольору є одновимірною сворючою нейронною мережею, яка приймає короткочасний Фур’є-спектр базової моделі синтезу мови як вхідні дані. Кодувач потім генерує карту особливостей як вихід. Витягувач тонового кольору є простою двовимірною сворючою нейронною мережею, яка працює над мел-спектрограмою вхідного голосу та генерує один вектор особливостей, який кодує інформацію про тоновий колір. Шари нормалізуючого потоку приймають карти особливостей, згенерованих кодувачем, як вхідні дані та генерують представлення особливостей, яке зберігає всі властивості стилю, але усуває інформацію про тоновий колір. Фреймворк OpenVoice потім застосовує шари нормалізуючого потоку у зворотному напрямку та приймає представлення особливостей як вхідні дані та виводить нормалізуючі потоки. Фреймворк потім декодує нормалізуючі потоки у сирі аудіозразки за допомогою стека перестворених одновимірних сворючих.
Ціла архітектура фреймворку OpenVoice є прямою без використання будь-яких автoregresивних компонентів. Компонент конвертера тонового кольору подібний до голосової конверсії на концептуальному рівні, але відрізняється за функціональністю, навчальними цілями та індуктивним упередженням у структурі моделі. Шари нормалізуючого потоку мають ту ж структуру, що й потокові моделі синтезу мови, але відрізняються за функціональністю та навчальними цілями.
Крім того, існує інший підхід до витягування представлень особливостей, реалізований фреймворком OpenVoice, який забезпечує кращу якість аудіо. Також варто зазначити, що фреймворк OpenVoice не має наміру винаходити компоненти у структурі моделі, а радше обидва основні компоненти, тобто конвертер тонового кольору та базова модель синтезу мови, походять з існуючих робіт. Основна мета фреймворку OpenVoice полягає у створенні відокремленого фреймворку, який відокремлює генерацію мови та стилю голосу від генерації тонового кольору. Хоча підхід досить простий, він досить ефективний, особливо для завдань контролю стилю та акценту, або завдань узагальнення нових мов. Досягнення такого контролю при використанні зв’язаного фреймворку потребує великої кількості обчислень та даних та не узагальнюється добре для нових мов.
У своєму ядрі основна філософія фреймворку OpenVoice полягає у відокремленні генерації мови та стилю голосу від генерації тонового кольору. Однією з основних переваг фреймворку OpenVoice є те, що клонований голос є плавним та високої якості, якщо тільки одномовна модель синтезу мови говорить плавно.
OpenVoice: Експеримент та результати
Оцінка завдань клонування голосу є складним завданням через численні причини. По-перше, існуючі роботи часто використовують різні навчальні та тестові дані, що робить порівняння цих робіт внутрішньо несправедливим. Хоча краудсорсинг може бути використаний для оцінки метрик, таких як середній бал оцінки, складність та різноманітність тестових даних суттєво вплине на загальний результат. По-друге, різні методи клонування голосу мають різні навчальні дані, а різноманітність та масштаб цих даних суттєво впливають на результати. Нарешті, основна мета існуючих робіт часто відрізняється одна від одної, тому вони відрізняються за функціональністю.
Через три причини, згадані вище, не зовсім правильно порівнювати існуючі фреймворки клонування голосу чисельно. Замість цього більш логічно порівнювати ці методи якісно.
Точне клонування тонового кольору
Для аналізу його продуктивності розробники створили тестову вибірку з анонімними особами, персонажами гри та знаменитостями, які утворюють базу речових дикторів, та мають широке розподілення голосів, включаючи як нейтральні зразки, так і унікальні виразні голоси. Фреймворк OpenVoice здатний клонувати тоновий колір речового диктора та генерувати мову у декількох мовах та акцентах для будь-якого з речових дикторів та 4 базових мовців.

Гнучкий контроль над стилем голосу
Однією з меть фреймворку OpenVoice є забезпечення гнучкого контролю над стилем голосу за допомогою конвертера тонового кольору, який може змінити тоновий колір, зберігаючи при цьому всі інші властивості голосу.
Експерименти показують, що модель зберігає стиль голосу після конвертації у тоновий колір речового диктора. У деяких випадках, однак, модель трохи нейтралізує емоції, проблему, яку можна вирішити, передавши менше інформації до шарів потоку, щоб вони не могли позбуватися емоції. Фреймворк OpenVoice здатний зберегти стиль голосу завдяки використанню конвертера тонового кольору. Це дозволяє фреймворку OpenVoice маніпулювати базовою моделлю синтезу мови для легкого контролю над стилем голосу.

Клонування голосу різних мов
Фреймворк OpenVoice не включає жодних великих баз даних мовних зразків для невидимої мови, але все ж здатний досягати майже клонування голосу різних мов у режимі без зразків. Можливості клонування голосу різних мов фреймворку OpenVoice складаються з двох частин:
- Модель здатна точно клонувати тоновий колір речового диктора, якщо мова речового диктора не входила до бази даних мовних зразків.
- Крім того, якщо мова речового диктора не входила до бази даних мовних зразків, фреймворк OpenVoice здатний клонувати голос речового диктора та говорити мовою, якщо базова модель синтезу мови підтримує цю мову.
Заключні думки
У цій статті ми говорили про фреймворк OpenVoice, гнучкий миттєвий фреймворк клонування голосу, який реплікує голос будь-якого користувача та генерує мову у декількох мовах, використовуючи короткий аудіозразок від речового диктора. Основна інтуїція за фреймворком OpenVoice полягає у тому, що якщо модель не повинна виконувати клонування тонового кольору речового диктора, фреймворк може використовувати базову модель синтезу мови для контролю мови та стилю голосу.
Фреймворк OpenVoice демонструє, що моделі миттєвого клонування голосу можуть реплікувати тоновий колір речового диктора та досягати гранульованого контролю над стилем голосу, включаючи акцент, ритм, інтонацію, паузи та навіть емоції. Фреймворк OpenVoice здатний доставляти суперійорні результати миттєвого клонування голосу, залишаючись обчислювально життєздатним з операційними витратами до 10 разів меншими, ніж у поточних API з нижчою продуктивністю, і досягати гранульованого контролю над стилем голосу, включаючи акцент, ритм, інтонацію, паузи та навіть емоції, і говорить, як диктор, і досягати гранульованого контролю над стилем голосу, включаючи акцент, ритм, інтонацію, паузи та навіть емоції.












