Інтерв’ю
Офір Краковскі, генеральний директор і співзасновник Deepdub – Серія інтерв’ю

Офір Краковскі є співзасновником і генеральним директором Deepdub. З 30-річним досвідом у галузі комп’ютерних наук і машинного навчання, він відіграв ключову роль у створенні та керівництві відділом машинного навчання та інновацій ВПС Ізраїлю протягом 25 років.
Deepdub – це компанія, яка займається дублюванням, що використовує штучний інтелект і технологію клонування голосу для надання високоякісного, масштабованого локалізації для фільмів, телебачення та цифрового контенту. Заснована у 2019 році, вона дозволяє творцям контенту зберегти оригінальні виконання, одночасно безшовно перекладаючи діалог на кілька мов. Інтегруючи синтез мови, керований штучним інтелектом, з лінгвістичним наглядом людини, Deepdub підвищує глобальну доступність контенту, знижуючи час і вартість традиційного дублювання. Компанія здобула визнання галузі за свою інноваційність, забезпечивши великі партнерства, сертифікації та фінансування для розширення технології локалізації штучного інтелекту у сфері розваг.
Що спонукало вас заснувати Deepdub у 2019 році? Чи був якийсь особливий момент чи виклик, який призвів до її створення?
Традиційне дублювання давно є стандартом галузі для локалізації контенту, але це дорогий, тривалий і ресурсоємкий процес. Хоча існували рішення для генерації голосу штучним інтелектом, вони не мали емоційної глибини, необхідної для справжнього захоплення виконання актора, що робило їх непридатними для високоякісного, складного контенту.
Ми визначили можливість скоротити цей розрив, розробивши рішення для локалізації, що використовує штучний інтелект, яке зберігає емоційну автентичність оригінального виконання, одночасно суттєво покращуючи ефективність. Ми розробили свою власну технологію eTTS™ (Emotion-Text-to-Speech), яка забезпечує те, що голоси, згенеровані штучним інтелектом, несуть ту ж емоційну вагу, тон і нюанси, що й голоси людей.
Ми бачимо світ, у якому мовні та культурні бар’єри більше не будуть перешкодами для глобальної доступності контенту. Створюючи нашу платформу, ми визнали виклик мовних обмежень у сфері розваг, електронного навчання, FAST та інших галузей, і поставили за мету революціонізувати локалізацію контенту.
Щоб забезпечити те, що рішення Deepdub забезпечує найвищу якість локалізації та дублювання для складного контенту у масштабі, ми вирішили застосувати гібридний підхід і включити лінгвістів та експертів з голосу до процесу, поряд з нашою технологією eTTS™.
Наша мета – демократизувати виробництво голосу, роблячи його масштабованим, універсально доступним, інклюзивним і культурно значимим.
Які були деякі з найбільших технічних і бізнесових викликів, з якими ви зіткнулися при запуску Deepdub, і як ви їх подолали?
Одним із найбільших перешкод було здобуття довіри галузі розваг. Голлівуд довгий час покладався на традиційне дублювання, і перехід до рішень, керованих штучним інтелектом, вимагав демонстрації нашої здатності надавати результати студійного рівня в галузі, часто скептичній щодо штучного інтелекту.
Щоб подолати цей скептицизм, ми спочатку покращили автентичність наших голосів, згенерованих штучним інтелектом, створивши повністю ліцензований банк голосів. Цей банк включає реальні зразки людських голосів, суттєво покращуючи природність і виразність нашого виходу, що є важливим для прийняття в Голлівуді.
Далі ми розробили власні технології, такі як eTTS™, а також функції, такі як Контроль акценту. Ці технології забезпечують те, що голоси, згенеровані штучним інтелектом, не тільки захоплюють емоційну глибину і нюанси, але й відповідають регіональній автентичності, необхідній для високоякісного дублювання.
Ми також створили спеціальну внутрішню команду постпродакшну, яка працює в тісній співпраці з нашою технологією. Ця команда доопрацьовує виходи штучного інтелекту, забезпечуючи те, що кожна частина контенту відполірована і відповідає високим стандартам галузі.
Крім того, ми розширили свій підхід, включивши глобальну мережу експертів-людей – акторів голосу, лінгвістів і режисерів з усього світу. Ці професіонали приносять невід’ємні культурні знання і творчу експертизу, підвищуючи культурну точність і емоційну резонансність нашого дубльованого контенту.
Наша лінгвістична команда працює в тандемі з нашою технологією і глобальними експертами, щоб забезпечити те, що мова, використовувана в контенті, ідеальна для культурного контексту цільової аудиторії, ще більше забезпечуючи автентичність і відповідність місцевим нормам.
За допомогою цих стратегій, що поєднують передові технології з сильною командою глобальних експертів і внутрішньої команди постпродакшну, Deepdub успішно продемонструвала Голлівуду і іншим топовим виробничим компаніям світу, що штучний інтелект може суттєво покращити традиційні робочі процеси дублювання. Ця інтеграція не тільки оптимізує виробництво, але й розширює можливості для розширення ринку.
Як технологія дублювання Deepdub, що використовує штучний інтелект, відрізняється від традиційних методів дублювання?
Традиційне дублювання – це трудомісткий процес, який може тривати місяцями на проєкт, оскільки воно вимагає голосових акторів, звукорежисерів і команд постпродакшну для ручного відтворення діалогу на різних мовах. Наше рішення революціонізує цей процес, пропонуючи гібридне кінцеве рішення – поєднання технологій і людської експертизи – інтегроване безпосередньо у робочі процеси постпродакшну, тим самим знижуючи витрати на локалізацію до 70% і скорочуючи терміни виконання до 50%.
На відміну від інших рішень для генерації голосу штучним інтелектом, наша власна технологія eTTS™ дозволяє досягти рівня емоційної глибини, культурної автентичності і консистентності голосу, якого традиційні методи важко досягти у масштабі.
Можете розповісти про гібридний підхід Deepdub – як штучний інтелект і людська експертиза працюють разом у процесі дублювання?
Гібридна модель Deepdub поєднує точність і масштабованість штучного інтелекту з творчістю і культурною чутливістю людської експертизи. Наш підхід поєднує мистецтво традиційного дублювання з передовими технологіями штучного інтелекту, забезпечуючи те, що локалізований контент зберігає емоційну автентичність і вплив оригіналу.
Наше рішення використовує штучний інтелект для автоматизації основних аспектів локалізації, тоді як людські професіонали доопрацьовують емоційні нюанси, акценти і культурні деталі. Ми включаємо як нашу власну технологію eTTs™, так і технологію Voice-to-Voice (V2V), щоб підвищити природну виразність голосів, згенерованих штучним інтелектом, забезпечуючи те, що вони захоплюють глибину і реалізм людських виступів. Таким чином, ми забезпечуємо те, що кожна частина контенту здається такою ж автентичною і впливаючою у локалізованій формі, як і в оригіналі.
Лінгвісти і голосові професіонали відіграють ключову роль у цьому процесі, оскільки вони підвищують культурну точність контенту, згенерованого штучним інтелектом.既然 глобалізація продовжує формувати майбутнє розваг, інтеграція штучного інтелекту з людським мистецтвом стане стандартом для локалізації контенту.
Крім того, наша Програма роялті для голосових акторів компенсує професійним голосовим акторам кошти всякий раз, коли їхні голоси використовуються у дублюванні, що використовує штучний інтелект, забезпечуючи етичне використання технології голосу штучного інтелекту.
Як власна технологія Deepdub eTTS™ (Emotion-Text-to-Speech) покращує автентичність голосу і емоційну глибину у дубльованому контенті?
Традиційні голоси, згенеровані штучним інтелектом, часто не мають тих емоційних сигналів, які роблять виступи переконливими. Щоб подолати цей недолік, Deepdub розробила свою власну технологію eTTS™, використовуючи штучний інтелект і моделі глибокого навчання для генерації мови, яка не тільки зберігає повну емоційну глибину оригінального виконання актора, але й інтегрує людський емоційний інтелект у автоматизований процес. Ця передова здатність дозволяє штучному інтелекту точно регулювати синтезовані голоси, щоб вони відображали намічні емоції, такі як радість, гнів або смуток, резонуючи автентично з аудиторією. Крім того, eTTS™ excels у виробництві високоякісної реплікації голосу, імітуючи природні нюанси людської мови, такі як висота, тон і темп, які є важливими для доставки рядків, які є справжніми і привабливими. Ця технологія також підвищує культурну чутливість, адаптуючи виходи для контролю акцентів, тим самим підвищуючи глобальну привабливість і ефективність.
Однією з поширених критик щодо голосів, згенерованих штучним інтелектом, є те, що вони можуть звучати роботично. Як Deepdub забезпечує те, що голоси, згенеровані штучним інтелектом, зберігають природність і емоційну нюанс?
Наша власна технологія використовує алгоритми глибокого навчання і машинного навчання для надання масштабованих, високоякісних рішень для дублювання, які зберігають оригінальний намір, стиль, гумор і культурні нюанси.
Поряд з нашою технологією eTTS™, інноваційна суїта Deepdub включає функції, такі як Voice-to-Voice (V2V), Клонування голосу, Контроль акценту і наш Банк вокальних емоцій, які дозволяють командам виробництва доопрацьовувати виступи, щоб вони відповідали їхньому творчому баченню. Ці функції забезпечують те, що кожен голос несе емоційну глибину і нюанси, необхідні для переконливого розповідання історій і впливаючих користувацьких досвідів.
За останні кілька років ми бачили зростаючий успіх наших рішень у галузі Медіа та Розваг, тому ми вирішили відкрити доступ до наших голлівудських голосових робіт для розробників, підприємств і творців контенту з нашим API аудіо. Повністю підтримуваний нашою технологією eTTS™, цей API дозволяє генерацію голосу в реальному часі з передовими параметрами налаштування, включаючи акцент, емоційний тон, темп і стиль голосу.
Флагманська функція нашого API – це аудіо-пресети, розроблені на основі років промислового досвіду з найбільш запитаними потребами в голосових роботах. Ці попередньо налаштовані параметри дозволяють користувачам швидко адаптувати різні типи контенту без потреби у великих ручних налаштуваннях або дослідженнях. Доступні пресети включають аудіо-описи і аудіокниги, документальне або реаліті-оповідання, драму і розваги, доставку новин, спортивний коментар, аніме- або мультфільм-озвучення, Інтерактивну систему голосових відповідей (IVR), а також промоціонний і комерційний контент.
Дублювання штучним інтелектом включає культурну і лінгвістичну адаптацію – як Deepdub забезпечує те, що рішення для дублювання відповідають культурним і лінгвістичним вимогам?
Локалізація – це не тільки переклад слів – це переклад значення, наміру і культурного контексту. Гібридний підхід Deepdub поєднує автоматизацію, керовану штучним інтелектом, з лінгвістичною експертизою людини, забезпечуючи те, що перекладений діалог відображає культурні і емоційні нюанси цільової аудиторії. Наша мережа експертів з локалізації працює поряд з штучним інтелектом, щоб забезпечити те, що дубльований контент відповідає регіональним діалектам, виразам і культурним чутливостям.
Які найбільш цікаві інновації ви зараз працюєте над тим, щоб покращити дублювання штучним інтелектом до наступного рівня?
Однією з наших найбільших майбутніх інновацій є дублювання в прямому ефірі, яке дозволить здійснювати дублювання в реальному часі для прямої трансляції, наприклад, спортивних подій і новин, роблячи глобальні події миттєво доступними. Комбінуючи це з іншою нашою цікавою інновацією, нашою функцією eTTs™, власною технологією, яка дозволяє створювати голоси, подібні до людських, з тексту у великому масштабі і з повною емоційною підтримкою і комерційними правами, ми зможемо пропонувати високоякісне, автентичне, емоційне дублювання в прямому ефірі, яке не має аналогів на ринку.
Візьміть, наприклад, відкриття Олімпійських ігор або будь-яку іншу прямуючу спортивну подію. Хоча місцеві мовники зазвичай забезпечують коментарі на своїй регіональній мові і діалекті, ця технологія дозволить глядачам з усього світу переживати повну подію на своїй рідній мові, коли вона відбувається.
Дублювання в прямому ефірі переозначить, як ми переживаємо прямій події по всьому світу, забезпечуючи те, що мова ніколи не буде бар’єром.
Дублювання, згенероване штучним інтелектом, зазнало критики в деяких проєктах останнім часом. Що, на вашу думку, є ключовими чинниками, які спричиняють ці критики?
Основні критики походять від проблем автентичності, етики і якості. Деякі голоси, згенеровані штучним інтелектом, не мали емоційної резонансності і нюансів, необхідних для іммерсивного розповідання історій. У Deepdub ми подолали це, розробивши емоційно виразні голоси штучного інтелекту, забезпечуючи те, що вони зберігають душу оригінального виконання. Deepdub досягла понад 70% виняткової задоволеності глядачів по всіх вимірам, включаючи чудове акторське виконання, чіткий діалог, безшовну синхронізацію і ідеальний темп.
Іншим питанням є етичне використання голосів штучного інтелекту. Deepdub є лідером у відповідальному дублюванні штучним інтелектом, пионером першої в галузі Програми роялті, яка компенсує голосовим акторам кошти за виступи, згенеровані штучним інтелектом. Ми віримо, що штучний інтелект повинен підвищувати людську творчість, а не замінювати її, і ця прив’язаність відображається у всьому, що ми будемо.
Як ви бачите зміну дублювання штучним інтелектом у глобальній індустрії розваг за наступні 5-10 років?
У наступному десятилітті дублювання, кероване штучним інтелектом, демократизуватиме контент, як ніколи раніше, роблячи фільми, телешоу і прямій трансляцію доступними кожній аудиторії, скрізь, на їхній рідній мові миттєво.
Ми бачимо світ, у якому платформи потокового мовлення і мовники інтегрують багатомовне дублювання в реальному часі, усуваючи мовні бар’єри і дозволяючи історіям подорожувати далі і швидше, ніж традиційні методи локалізації дозволяли.
Поза мовною доступністю дублювання штучним інтелектом також може підвищити доступність медіа для сліпих і людей з порушеннями зору. Багато хто з них покладається на аудіо-описи, щоб слідкувати за візуальним контентом, і дублювання штучним інтелектом дозволяє їм взаємодіяти з іноземним контентом, коли субтитри не є доступним варіантом. Подолавши як мовні, так і сенсорні бар’єри, дублювання штучним інтелектом допоможе створити більш інклюзивний досвід розваг для всіх, що особливо критично, оскільки нові регуляції щодо доступності медіа набувають чинності у світі.
Які найбільш значні виклики, які ще потрібно подолати, щоб дублювання штучним інтелектом стало真正нім мейнстримом?
Найбільші виклики – це підтримання надзвичайно високої якості у масштабі, забезпечення культурної і лінгвістичної точності, а також встановлення етичних керівних принципів для голосів, згенерованих штучним інтелектом. Однак, окрім технічних перешкод, публічне прийняття дублювання штучним інтелектом залежить від довіри. Глядачі повинні відчувати, що голоси, згенеровані штучним інтелектом, зберігають автентичність і емоційну глибину виступів, а не звучать синтетично або відсторонено.
Щоб дублювання штучним інтелектом було повністю прийнято, воно повинно бути високоякісним, поєднуючи людське мистецтво і технології у масштабі, і також демонструвати повагу до творчої цілісності, лінгвістичної нюансів і культурного контексту. Це означає забезпечення того, що голоси залишаються вірними наміру оригінальних акторів, уникання неточностей, які могли б відштовхнути аудиторію, і звернення до етичних проблем щодо ризиків глибоких підробок і власності голосу.
Як дублювання штучним інтелектом стає більш поширеним, постачальники технологій повинні реалізувати суворі стандарти для автентичності голосу, безпеки і захисту інтелектуальної власності. Deepdub активно очолює цей рух у цих областях, забезпечуючи те, що технологія голосу штучного інтелекту підвищує глобальне розповідання історій, одночасно поважаючи творчі і професійні внески людського таланту. Тільки тоді аудиторія, творці контенту і учасники галузі повністю приймуть дублювання штучним інтелектом як довірений і цінний інструмент.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Deepdub.












