Интервью
Офир Краковски, генеральный директор и сооснователь Deepdub – Интервью

Офир Краковски является сооснователем и генеральным директором Deepdub. С 30-летним опытом в области компьютерных наук и машинного обучения, он сыграл ключевую роль в создании и руководстве отделом машинного обучения и инноваций израильских ВВС в течение 25 лет.
Deepdub – это компания, занимающаяся дублированием с использованием искусственного интеллекта, которая использует глубокое обучение и клонирование голоса для предоставления высококачественной, масштабируемой локализации для фильмов, телевидения и цифрового контента. Основанная в 2019 году, она позволяет создателям контента сохранять оригинальные выступления, одновременно переводя диалог на несколько языков. Интегрируя синтез речи на основе искусственного интеллекта с лингвистическим надзором человека, Deepdub увеличивает доступность глобального контента, снижая время и стоимость традиционного дублирования. Компания получила признание в отрасли за свою инновацию, обеспечив крупные партнерства, сертификаты и финансирование для расширения своей технологии локализации на основе искусственного интеллекта по всему сектору развлечений.
Что вдохновило вас основать Deepdub в 2019 году? Был ли какой-то конкретный момент или проблема, которая привела к его созданию?
Традиционное дублирование давно является отраслевым стандартом для локализации контента, но это дорогостоящий, трудоемкий и ресурсоемкий процесс. Хотя существовали решения для голоса, сгенерированного искусственным интеллектом, они не имели эмоциональной глубины, необходимой для真正щего захвата выступления актера, что делало их непригодными для высококачественного, сложного контента.
Мы определили возможность сократить этот разрыв, разработав решение для локализации на основе искусственного интеллекта, которое сохраняет эмоциональную аутентичность оригинального выступления, одновременно значительно улучшая эффективность. Мы разработали свою собственную технологию eTTS (Эмоция-Текст-в-Речь), которая гарантирует, что голоса, сгенерированные искусственным интеллектом, несут тот же эмоциональный вес, тон и нюансы, что и голоса человеческих актеров.
Мы представляем себе мир, где языковые и культурные барьеры больше не являются препятствиями для доступности глобального контента. При создании нашей платформы мы признали проблему языковых ограничений в индустрии развлечений, электронном обучении, FAST и других отраслях, и поставили цель революционизировать локализацию контента.
Чтобы гарантировать, что решение Deepdub обеспечивает локализацию и дублирование высокого качества для сложного контента в масштабе, мы решили использовать гибридный подход и включить лингвистов и экспертов по голосу в процесс, в дополнение к нашей технологии eTTS.
Наша цель – демократизировать производство голоса, сделав его чрезвычайно масштабируемым, универсально доступным, инклюзивным и культурно актуальным.
Какие были некоторые из наиболее значительных технических и деловых проблем, с которыми вы столкнулись при запуске Deepdub, и как вы их преодолели?
Одной из основных проблем при запуске Deepdub было завоевание доверия индустрии развлечений. Голливуд полагался на традиционное дублирование в течение десятилетий, и переход к решениям на основе искусственного интеллекта требовал демонстрации нашей способности предоставлять результаты высокого качества в отрасли, часто скептической по отношению к искусственному интеллекту.
Чтобы решить эту проблему, мы сначала повысили аутентичность наших голосов, сгенерированных искусственным интеллектом, создав полностью лицензированный банк голосов. Этот банк включает реальные образцы человеческого голоса, что значительно улучшает естественность и выразительность нашей продукции, что имеет решающее значение для принятия в Голливуде.
Далее мы разработали собственные технологии, такие как eTTS, а также функции, такие как Контроль Акцента. Эти технологии гарантируют, что голоса, сгенерированные искусственным интеллектом, не только захватывают эмоциональную глубину и нюансы, но также соответствуют региональной аутентичности, необходимой для высококачественного дублирования.
Мы также создали специальную внутреннюю команду пост-продакшна, которая работает в тесном сотрудничестве с нашей технологией. Эта команда дорабатывает выходные данные искусственного интеллекта, гарантируя, что каждый фрагмент контента отполирован и соответствует высоким стандартам отрасли.
Кроме того, мы расширили наш подход, включив в него глобальную сеть человеческих экспертов – голосовых актеров, лингвистов и режиссеров со всего мира. Эти профессионалы приносят ценные культурные идеи и творческую экспертизу, повышая культурную точность и эмоциональный резонанс нашего дублированного контента.
Наша лингвистическая команда работает в тандеме с нашей технологией и глобальными экспертами, чтобы гарантировать, что используемый язык идеален для культурного контекста целевой аудитории, еще больше гарантируя аутентичность и соблюдение местных норм.
Благодаря этим стратегиям, сочетающим передовые технологии с прочной командой глобальных экспертов и внутренней командой пост-продакшна, Deepdub успешно продемонстрировала Голливуду и другим ведущим производственным компаниям во всем мире, что искусственный интеллект может значительно улучшить традиционные рабочие процессы дублирования. Это интеграция не только оптимизирует производство, но и расширит возможности для расширения рынка.
Как технология дублирования на основе искусственного интеллекта Deepdub отличается от традиционных методов дублирования?
Традиционное дублирование – это трудоемкий процесс, который может занять месяцы на проект, поскольку для этого требуется ручное воспроизведение диалога в разных языках голосовыми актерами, звукорежиссерами и командами пост-продакшна. Наше решение революционизирует этот процесс, предлагая гибридное решение – сочетание технологии и человеческой экспертизы – интегрированное直接 в рабочие процессы пост-продакшна, тем самым снижая затраты на локализацию до 70% и время выполнения до 50%.
В отличие от других решений для голоса, сгенерированного искусственным интеллектом, наша собственная технология eTTS позволяет достичь уровня эмоциональной глубины, культурной аутентичности и последовательности голоса, с которым традиционные методы борются за достижение в масштабе.
Можете ли вы рассказать о гибридном подходе, который использует Deepdub – как искусственный интеллект и человеческая экспертиза работают вместе в процессе дублирования?
Гибридная модель Deepdub сочетает точность и масштабируемость искусственного интеллекта с творчеством и культурной чувствительностью человеческой экспертизы. Наш подход сочетает искусство традиционного дублирования с передовыми технологиями искусственного интеллекта, гарантируя, что локализованный контент сохраняет эмоциональную аутентичность и воздействие оригинала.
Наше решение использует искусственный интеллект для автоматизации основной работы по локализации, в то время как человеческие профессионалы дорабатывают эмоциональные нюансы, акценты и культурные детали. Мы включаем как нашу собственную технологию eTTs, так и нашу технологию Голос-в-Голос (V2V), чтобы повысить естественную выразительность голосов, сгенерированных искусственным интеллектом, гарантируя, что они захватывают глубину и реализм человеческих выступлений. Таким образом, мы гарантируем, что каждый фрагмент контента кажется таким же аутентичным и воздействующим в локализованной форме, как и в оригинале.
Лингвисты и голосовые профессионалы играют ключевую роль в этом процессе, поскольку они повышают культурную точность контента, сгенерированного искусственным интеллектом. По мере того, как глобализация продолжает формировать будущее развлечений, интеграция искусственного интеллекта с человеческим творчеством станет золотым стандартом для локализации контента.
Кроме того, наша Программа роялти для голосовых актеров компенсирует профессиональным голосовым актерам каждый раз, когда их голоса используются в дублировании с помощью искусственного интеллекта, гарантируя этичное использование технологии голоса на основе искусственного интеллекта.
Как технология eTTS (Эмоция-Текст-в-Речь) Deepdub улучшает аутентичность голоса и эмоциональную глубину в дублированном контенте?
Традиционные голоса, сгенерированные искусственным интеллектом, часто не имеют тонких эмоциональных сигналов, которые делают выступления привлекательными. Чтобы решить эту проблему, Deepdub разработала свою собственную технологию eTTS, используя искусственный интеллект и модели глубокого обучения для генерации речи, которая не только сохраняет полную эмоциональную глубину выступления оригинального актера, но также интегрирует человеческий эмоциональный интеллект в автоматизированный процесс. Эта передовая возможность позволяет искусственному интеллекту тонко регулировать синтезированные голоса, чтобы отразить намеченные эмоции, такие как радость, гнев или печаль, аутентично резонируя с аудиторией. Кроме того, eTTS превосходно производит высококачественную репликацию голоса, имитируя естественные нюансы в человеческой речи, такие как высота, тон и темп, что является важным для доставки строк, которые являются аутентичными и привлекательными. Технология также повышает культурную чувствительность, умело адаптируя выходные данные для контроля акцентов, тем самым повышая ее глобальную привлекательность и эффективность.
Одна из распространенных критических замечаний о голосах, сгенерированных искусственным интеллектом, заключается в том, что они могут звучать роботизированно. Как Deepdub гарантирует, что голоса, сгенерированные искусственным интеллектом, сохраняют естественность и эмоциональные нюансы?
Наша собственная технология использует алгоритмы глубокого обучения и машинного обучения для предоставления масштабируемых, высококачественных решений для дублирования, которые сохраняют оригинальный замысел, стиль, юмор и культурные нюансы.
Вместе с нашей технологией eTTS инновационный набор Deepdub включает функции, такие как Голос-в-Голос (V2V), Клонирование Голоса, Контроль Акцента и наш Банк Вокальной Эмоции, которые позволяют командам производства дорабатывать выступления, чтобы они соответствовали их творческому видению. Эти функции гарантируют, что каждый голос несет эмоциональную глубину и нюансы, необходимые для привлекательного рассказывания историй и воздействующих пользовательских опытов.
За последние несколько лет мы видели растущий успех наших решений в индустрии СМИ и развлечений, поэтому мы最近 решили открыть доступ к нашим проверенным Голливудом голосовым для разработчиков, предприятий и создателей контента с помощью нашего API аудио на основе искусственного интеллекта. Оснащенный нашей технологией eTTS, API позволяет генерировать голос в реальном времени с расширенными параметрами настройки, включая акцент, эмоциональный тон, темп и стиль голоса.
Флагманской функцией нашего API являются аудио-предустановки, разработанные на основе лет опыта в индустрии с наиболее часто запрашиваемыми потребностями в голосовом сопровождении. Эти предварительно настроенные настройки позволяют пользователям быстро адаптировать различные типы контента без необходимости обширной ручной настройки или исследования. Доступные настройки включают аудио-описания и аудиокниги, документальное или реальное повествование, драму и развлечения, доставку новостей, спортивный комментарий, аниме или голоса мультфильмов, Интерактивные голосовые ответы (IVR), а также рекламный и коммерческий контент.
Дублирование на основе искусственного интеллекта предполагает культурную и лингвистическую адаптацию – как Deepdub гарантирует, что ее решения для дублирования являются культурно подходящими и точными?
Локализация не только о переводе слов – это о переводе смысла, намерения и культурного контекста. Гибридный подход Deepdub сочетает автоматизацию на основе искусственного интеллекта с человеческой лингвистической экспертизой, гарантируя, что переведенный диалог отражает культурные и эмоциональные нюансы целевой аудитории. Наша сеть экспертов по локализации работает вместе с искусственным интеллектом, чтобы гарантировать, что дублированный контент соответствует региональным диалектам, выражениям и культурным чувствительностям.
Какие наиболее интересные инновации вы в настоящее время разрабатываете, чтобы продвинуть дублирование на основе искусственного интеллекта на новый уровень?
Одна из наших крупнейших предстоящих инноваций – это Дублирование в прямом эфире/Стриминг, которое позволит осуществлять дублирование в реальном времени для прямых трансляций, таких как спортивные мероприятия и новостные программы, делая глобальные события мгновенно доступными. Объединив это с другой нашей интересной инновацией, нашей функцией eTTs, которая позволяет создавать голоса, похожие на человеческие, из текста в крупном масштабе и с полной эмоциональной поддержкой и коммерческими правами, мы сможем предложить высококачественное, аутентичное и эмоциональное дублирование в прямом эфире, не имеющее аналогов на рынке.
Возьмем, к примеру, церемонию открытия Олимпийских игр или любое другое прямое спортивное мероприятие. Хотя местные вещатели обычно предоставляют комментарии на региональном языке и диалекте, эта технология позволит зрителям со всего мира испытать полное событие на своем родном языке по мере его развития.
Дублирование в прямом эфире переопределит, как мы переживаем прямые события по всему миру, гарантируя, что язык никогда не будет препятствием.
Дублирование на основе искусственного интеллекта столкнулось с критикой в определенных проектах в последнее время. Что, по вашему мнению, являются ключевыми факторами, способствующими этой критике?
Основные критические замечания вызваны проблемами аутентичности, этики и качества. Некоторые голоса, сгенерированные искусственным интеллектом, не имели эмоциональной резонансности и нюансов, необходимых для погружения в историю. В Deepdub мы решили эту проблему, разработав эмоционально выразительные голоса, сгенерированные искусственным интеллектом, гарантируя, что они сохраняют душу оригинального выступления. Deepdub достигла более 70% исключительного удовлетворения зрителей по всем параметрам, включая отличный подбор, ясный диалог, бесшовную синхронизацию и идеальный темп.
Другой проблемой является этичное использование голосов, сгенерированных искусственным интеллектом. Deepdub является лидером в ответственном дублировании на основе искусственного интеллекта, пионером в индустрии первой Программы роялти, которая компенсирует голосовым актерам выступления, сгенерированные искусственным интеллектом. Мы считаем, что искусственный интеллект должен улучшать человеческое творчество, а не заменять его, и эта приверженность отражена во всем, что мы строим.
Как, по вашему мнению, дублирование на основе искусственного интеллекта изменит глобальную индустрию развлечений в течение следующих 5-10 лет?
В течение следующего десятилетия дублирование на основе искусственного интеллекта демократизирует контент, как никогда раньше, сделав фильмы, телешоу и прямые трансляции доступными каждой аудитории, где бы она ни была, на ее родном языке мгновенно.
Мы представляем себе мир, где платформы потокового вещания и вещатели интегрируют многоязычное дублирование в реальном времени, удаляя языковые барьеры и позволяя историям путешествовать дальше и быстрее, чем традиционные методы локализации.
За пределами языковой доступности дублирование на основе искусственного интеллекта также может улучшить доступ к медиа для слепых и слабовидящих. Многие из них полагаются на аудио-описания, чтобы следить за визуальным контентом, и дублирование на основе искусственного интеллекта позволяет им взаимодействовать с иностранным контентом, когда субтитры не являются доступным вариантом. Разрушая как языковые, так и сенсорные барьеры, дублирование на основе искусственного интеллекта поможет создать более инклюзивный опыт развлечений для всех, что особенно важно, поскольку новые правила доступности медиа вступают в силу во всем мире.
Какие наиболее значительные проблемы еще необходимо решить, чтобы дублирование на основе искусственного интеллекта стало真正 массовым?
Самыми большими проблемами являются поддержание чрезвычайно высокого качества в масштабе, гарантия культурной и лингвистической точности, а также установление этических руководств для голосов, сгенерированных искусственным интеллектом. Однако, помимо технических препятствий, общественное принятие дублирования на основе искусственного интеллекта зависит от доверия. Зрители должны чувствовать, что голоса, сгенерированные искусственным интеллектом, сохраняют аутентичность и эмоциональную глубину выступлений, а не звучат синтетически или отстраненно.
Чтобы дублирование на основе искусственного интеллекта было полностью принято, оно должно быть высококачественным, сочетая человеческое творчество и технологию в масштабе, и также демонстрировать уважение к творческой целостности, лингвистической нюансе и культурному контексту. Это означает обеспечение того, чтобы голоса оставались верными намерениям оригинальных актеров, избегая неточностей, которые могли бы оттолкнуть аудиторию, и решая этические проблемы, связанные с рисками глубоких фейков и владением голосом.
По мере того, как дублирование на основе искусственного интеллекта становится более распространенным, поставщики технологий должны реализовать строгие стандарты для аутентичности голоса, безопасности и защиты интеллектуальной собственности. Deepdub активно ведет эту деятельность, гарантируя, что технология голоса на основе искусственного интеллекта улучшает глобальное рассказывание историй, одновременно уважая художественные и профессиональные вклады человеческого таланта. Только тогда аудитория, создатели контента и заинтересованные стороны отрасли полностью примут дублирование на основе искусственного интеллекта как заслуживающий доверия и ценный инструмент.
Благодарим за отличное интервью, читатели, которые хотят узнать больше, должны посетить Deepdub.












