Wywiady

Ofir Krakowski, CEO i współzałożyciel Deepdub – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Ofir Krakowski jest współzałożycielem i CEO Deepdub. Z 30-letnim doświadczeniem w dziedzinie informatyki i sztucznej inteligencji, odegrał kluczową rolę w założeniu i prowadzeniu departamentu sztucznej inteligencji i innowacji w izraelskich siłach powietrznych przez 25 lat.

Deepdub to firma zajmująca się dubbingiem z wykorzystaniem sztucznej inteligencji, która wykorzystuje głębokie uczenie i klonowanie głosu, aby zapewnić wysokiej jakości, skalowalną lokalizację dla filmów, telewizji i cyfrowych treści. Założona w 2019 roku, umożliwia twórcom zachowanie oryginalnych występów, jednocześnie bezproblemowo tłumacząc dialogi na wiele języków. Poprzez integrację syntezatora mowy z nadzorem językowym, Deepdub zwiększa dostępność treści na całym świecie, redukując czas i koszty tradycyjnego dubbingu. Firma zdobyła uznanie w branży za swoją innowacyjność, zabezpieczając ważne partnerstwa, certyfikaty i finansowanie, aby rozszerzyć swoją technologię lokalizacji AI na sektor rozrywkowy.

Co skłoniło Cię do założenia Deepdub w 2019 roku? Czy był jakiś konkretny moment lub wyzwanie, które doprowadziło do jego powstania?

Tradycyjny dubbing od dawna jest standardem branżowym dla lokalizacji treści, ale jest to kosztowny, czasochłonny i wymagający zasobów proces. Chociaż istniały już rozwiązania z wykorzystaniem sztucznej inteligencji, brakowało im emocjonalnej głębi, niezbędnej do prawdziwego uchwycenia występu aktora, co sprawiało, że nie były one odpowiednie dla wysokiej jakości, złożonych treści.

Zidentyfikowaliśmy możliwość zbudowania mostu między tymi dwoma obszarami, rozwijając rozwiązanie z wykorzystaniem sztucznej inteligencji, które zachowuje emocjonalną autentyczność oryginalnego występu, jednocześnie znacznie poprawiając wydajność. Rozwinęliśmy naszą własną technologię eTTS™ (Emotion-Text-to-Speech), która zapewnia, że głosy generowane przez sztuczną inteligencję posiadają tę samą emocjonalną wagę, ton i nuans, co ludzie.

Widzimy świat, w którym bariery językowe i kulturowe nie są już przeszkodą w dostępie do treści na całym świecie. Tworząc naszą platformę, rozpoznaliśmy wyzwanie ograniczeń językowych w branży rozrywkowej, edukacji, FAST i innych, i postanowiliśmy rewolucjonizować lokalizację treści.

Aby zapewnić, że rozwiązanie Deepdub zapewnia najwyższą jakość lokalizacji i dubbingu dla złożonych treści w skali, zdecydowaliśmy się na podejście hybrydowe, włączając do procesu ekspertów językowych i głosowych, w połączeniu z naszą technologią eTTS™.

Nasza wizja to demokratyzacja produkcji głosowej, czyniąc ją masowo skalowalną, powszechnie dostępną, inkluzywną i kulturowo istotną.

Jakie były największe wyzwania techniczne i biznesowe, z którymi się zetknąłeś przy uruchamianiu Deepdub, i jak je pokonałeś?

Zdobywanie zaufania branży rozrywkowej było główną przeszkodą przy uruchamianiu Deepdub. Hollywood przez dziesięciolecia polegało na tradycyjnym dubbingu, a przejście na rozwiązania z wykorzystaniem sztucznej inteligencji wymagało udowodnienia naszej zdolności do dostarczania wyników o jakości studyjnej w branży często sceptycznej wobec sztucznej inteligencji.

Aby rozwiązać ten sceptycyzm, najpierw poprawiliśmy autentyczność naszych głosów generowanych przez sztuczną inteligencję, tworząc w pełni licencjonowaną bazę głosów. Ta baza zawiera prawdziwe próbki głosów ludzkich, znacznie poprawiając naturalność i ekspresyjność naszych wyników, co jest kluczowe dla akceptacji w Hollywood.

Następnie opracowaliśmy własne technologie, takie jak eTTS™, wraz z funkcjami takimi jak Accent Control. Te technologie zapewniają, że głosy generowane przez sztuczną inteligencję nie tylko uchwyciają emocjonalną głębię i nuans, ale także przestrzegają regionalnej autentyczności wymaganej dla wysokiej jakości dubbingu.

Także zbudowaliśmy dedykowany zespół postprodukcji, który ściśle współpracuje z naszą technologią. Ten zespół dopracowuje wyniki sztucznej inteligencji, zapewniając, że każda część treści jest wypolerowana i spełnia wysokie standardy branży.

Ponadto rozszerzyliśmy nasze podejście, aby objąć globalną sieć ekspertów ludzkich – aktorów głosowych, językoznawców i reżyserów z całego świata. Ci profesjonaliści przynoszą niezastąpione wglądy kulturowe i ekspertyzę twórczą, wzmacniając dokładność kulturową i emocjonalną rezonans naszych zdubbingowanych treści.

Naszy zespół językowy pracuje w tandemie z naszą technologią i globalnymi ekspertami, aby zapewnić, że język używany jest idealny dla kontekstu kulturowego docelowej publiczności, zapewniając autentyczność i zgodność z normami lokalnymi.

Poprzez te strategie, łącząc zaawansowaną technologię z solidnym zespołem globalnych ekspertów i zespołem postprodukcji, Deepdub udowodnił Hollywood i innym wiodącym firmom produkcyjnym na całym świecie, że sztuczna inteligencja może znacznie poprawić tradycyjne procesy dubbingu. Ta integracja nie tylko usprawnia produkcję, ale także rozszerza możliwości ekspansji rynkowej.

Jak technologia dubbingu z wykorzystaniem sztucznej inteligencji Deepdub różni się od tradycyjnych metod dubbingu?

Tradycyjny dubbing jest procesem czasochłonnym, który może trwać miesiące na projekt, ponieważ wymaga aktorów głosowych, inżynierów dźwięku i zespołów postprodukcji, aby ręcznie odtworzyć dialogi w różnych językach. Nasze rozwiązanie rewolucjonizuje ten proces, oferując hybrydowe, kompleksowe rozwiązanie – łącząc technologię i ekspertyzę ludzką – zintegrowane bezpośrednio z procesami postprodukcji, redukując koszty lokalizacji o nawet 70% i czas realizacji o nawet 50%.

W przeciwieństwie do innych rozwiązań z wykorzystaniem sztucznej inteligencji, nasza własna technologia eTTS™ pozwala na poziom emocjonalnej głębi, autentyczności kulturowej i spójności głosu, który tradycyjne metody mają trudności z osiągnięciem w skali.

Czy możesz opowiedzieć o podejściu hybrydowym Deepdub – jak sztuczna inteligencja i ekspertyza ludzka współpracują w procesie dubbingu?

Model hybrydowy Deepdub łączy precyzję i skalowalność sztucznej inteligencji z kreatywnością i wrażliwością kulturową ekspertyzy ludzkiej. Nasze podejście łączy sztukę tradycyjnego dubbingu z zaawansowaną technologią sztucznej inteligencji, zapewniając, że zlokalizowane treści zachowują emocjonalną autentyczność i wpływ oryginału.

Nasze rozwiązanie wykorzystuje sztuczną inteligencję do zautomatyzowania podstawowych aspektów lokalizacji, podczas gdy profesjonaliści ludzcy dopracowują nuansy emocjonalne, akcenty i detale kulturowe. Włączamy naszą własną technologię eTTS™ i Voice-to-Voice (V2V), aby poprawić naturalną ekspresyjność głosów generowanych przez sztuczną inteligencję, zapewniając, że każda część treści wydaje się tak autentyczna i wpływowa w swojej zlokalizowanej formie, jak i oryginał.

Językoznawcy i profesjonaliści głosowi odgrywają kluczową rolę w tym procesie, ponieważ poprawiają dokładność kulturową treści generowanych przez sztuczną inteligencję. W miarę jak globalizacja kształtuje przyszłość rozrywki, integracja sztucznej inteligencji z ludzką sztuką stanie się standardem dla lokalizacji treści.

Ponadto nasz program royalty dla artystów głosowych kompensuje profesjonalnym aktorom głosowym za każde użycie ich głosów w dubbingu z wykorzystaniem sztucznej inteligencji, zapewniając etyczne wykorzystanie technologii głosowej sztucznej inteligencji.

Jak technologia eTTS™ (Emotion-Text-to-Speech) Deepdub poprawia autentyczność głosu i emocjonalną głębię w zdubbingowanych treściach?

Tradycyjne głosy generowane przez sztuczną inteligencję często brakowało subtelnych wskazówek emocjonalnych, które czynią występy przekonywującymi. Aby rozwiązać ten problem, Deepdub opracował swoją własną technologię eTTS™, wykorzystując sztuczną inteligencję i głębokie modele uczenia, aby generować mowę, która nie tylko zachowuje pełną emocjonalną głębię oryginalnego występu aktora, ale także integruje ludzką inteligencję emocjonalną w procesie zautomatyzowanym. Ta zaawansowana możliwość pozwala sztucznej inteligencji precyzyjnie dostosowywać syntetyzowane głosy do odzwierciedlenia zamierzonych emocji, takich jak radość, gniew lub smutek, rezonując autentycznie z publicznością. Dodatkowo, technologia eTTS™ wyróżnia się produkcją replikacji głosu o wysokiej wierności, naśladując naturalne nuansy w mowie ludzkiej, takie jak pitch, ton i tempo, niezbędne do dostarczania linii, które są prawdziwe i angażujące. Technologia ta również poprawia wrażliwość kulturową, umiejętnie adaptując dane wyjściowe do kontroli akcentów, zapewniając, że zdubbingowane treści szanują i są zgodne z nuansami kulturowymi, zwiększając w ten sposób ich globalny apel i skuteczność.

Jedną z powszechnych krytyk głosów generowanych przez sztuczną inteligencję jest to, że mogą brzmieć sztucznie. Jak Deepdub zapewnia, że głosy generowane przez sztuczną inteligencję zachowują naturalność i emocjonalną nuans?

Nasza własna technologia wykorzystuje algorytmy głębokiego uczenia i sztucznej inteligencji, aby dostarczyć skalowalne, wysokiej jakości rozwiązania dubbingu, które zachowują oryginalny zamiar, styl, humor i nuansy kulturowe.

Wraz z naszą technologią eTTS™, innowacyjny pakiet Deepdub obejmuje funkcje takie jak Voice-to-Voice (V2V), Voice Cloning, Accent Control i nasz Vocal Emotion Bank, które pozwalają zespołom produkcyjnym dopracować występy, aby dopasować je do ich wizji twórczej. Te funkcje zapewniają, że każdy głos nosi emocjonalną głębię i nuans niezbędny do przekonywującej narracji i wpływowych doświadczeń użytkowników.

W ciągu ostatnich kilku lat, widzieliśmy rosnący sukces naszych rozwiązań w branży Media & Entertainment, więc niedawno zdecydowaliśmy się udostępnić nasze zweryfikowane przez Hollywood nagrania głosowe developerom, firmom i twórcom treści za pośrednictwem naszego AI Audio API. Napędzany przez naszą technologię eTTS™, API umożliwia generowanie głosu w czasie rzeczywistym z zaawansowanymi parametrami dostosowania, w tym akcent, ton emocjonalny, tempo i styl głosowy.

Główną funkcją naszego API są ustawienia audio, opracowane na podstawie lat doświadczenia branżowego z najczęściej wymaganymi potrzebami nagrania głosowego. Te prekonfigurowane ustawienia umożliwiają użytkownikom szybkie adaptowanie różnych typów treści bez konieczności ręcznego konfigurowania lub eksploracji. Dostępne ustawienia obejmują opisy audio i audiobooki, narrację dokumentalną lub reality, dramat i rozrywkę, dostarczanie wiadomości, komentarz sportowy, nagrania głosowe anime lub kreskówek, interaktywne odpowiedzi głosowe (IVR), a także treści promocyjne i komercyjne.

Dubbing z wykorzystaniem sztucznej inteligencji obejmuje adaptację kulturową i językową – jak Deepdub zapewnia, że jego rozwiązania dubbingu są odpowiednie kulturowo i dokładne?

Lokalizacja nie jest tylko tłumaczeniem słów – jest to tłumaczenie znaczenia, zamiaru i kontekstu kulturowego. Podejście hybrydowe Deepdub łączy zautomatyzowanie z wykorzystaniem sztucznej inteligencji z ekspertyzą językową ludzką, zapewniając, że przetłumaczone dialogi odzwierciedlają nuansy kulturowe i emocjonalne docelowej publiczności. Nasza sieć ekspertów lokalizacji pracuje wraz z sztuczną inteligencją, aby zapewnić, że zdubbingowane treści są zgodne z dialekty regionalnymi, wyrażeniami i wrażliwościami kulturowymi.

Co są najbardziej ekscytujące innowacje, nad którymi obecnie pracujesz, aby podnieść dubbing z wykorzystaniem sztucznej inteligencji na wyższy poziom?

Jedną z naszych największych innowacji jest dubbing na żywo / transmisja, która umożliwi dubbing w czasie rzeczywistym dla transmisji na żywo, takich jak wydarzenia sportowe i media, sprawiając, że globalne wydarzenia będą natychmiast dostępne. Łącząc to z inną z naszych ekscytujących innowacji, naszą funkcją eTTs™, technologią, która pozwala na tworzenie głosów brzmiących jak ludzkie z tekstu w dużym stopniu i z pełnym wsparciem emocjonalnym i prawami komercyjnymi, będziemy w stanie zaoferować wysokiej jakości, autentyczne, emocjonalne dubbingowanie na żywo, niczym niezrównane na rynku.

Weźmy na przykład ceremonię otwarcia igrzysk olimpijskich lub jakiekolwiek wydarzenie na żywo. Podczas gdy lokalni nadawcy zwykle zapewniają komentarz w swoim regionalnym języku i dialekcie, ta technologia pozwoli widzom z całego świata doświadczyć pełnego wydarzenia w swoim ojczystym języku, w miarę jego rozwoju.

Dubbing na żywo zrewolucjonizuje, jak wydarzenia na żywo są doświadczane na całym świecie, zapewniając, że język nigdy nie będzie barierą.

Dubbing z wykorzystaniem sztucznej inteligencji spotkał się z krytyką w pewnych projektach w ostatnim czasie. Co uważasz za kluczowe czynniki napędzające te krytyki?

Główne krytyki wynikają z obaw dotyczących autentyczności, etyki i jakości. Niektóre głosy generowane przez sztuczną inteligencję brakowało emocjonalnej rezonansu i nuansu niezbędnego do immersyjnej narracji. W Deepdub, rozwiązaliśmy ten problem, rozwijając emocjonalnie wyraziste głosy sztucznej inteligencji, zapewniając, że zachowują one duszę oryginalnego występu. Deepdub osiągnął ponad 70% wyjątkowej satysfakcji widzów we wszystkich wymiarach, w tym wspaniałe obsadzenie, czysty dialog, płynną synchronizację i idealne tempo.

Inny problem to etyczne wykorzystanie głosów sztucznej inteligencji. Deepdub jest liderem w odpowiedzialnym dubbingu z wykorzystaniem sztucznej inteligencji, pionierem w branży, który wprowadził pierwszy program royalty, który wynagradza aktorów głosowych za występy generowane przez sztuczną inteligencję. Wierzymy, że sztuczna inteligencja powinna wspierać kreatywność ludzką, a nie ją zastępować, i to zaangażowanie jest odzwierciedlone we wszystkim, co budujemy.

Jak widzisz przyszłość dubbingu z wykorzystaniem sztucznej inteligencji w branży rozrywkowej w ciągu najbliższych 5-10 lat?

W ciągu najbliższej dekady, dubbing z wykorzystaniem sztucznej inteligencji demokratyzuje treści jak nigdy wcześniej, sprawiając, że filmy, programy telewizyjne i transmisje na żywo będą dostępne dla każdej publiczności, wszędzie, w ich ojczystym języku, natychmiast.

Widzimy świat, w którym platformy streamingowe i nadawcy integrują dubbing wielojęzyczny w czasie rzeczywistym, usuwając bariery językowe i pozwalając historiom podróżować dalej i szybciej niż tradycyjne metody lokalizacji.

Ponadto, dubbing z wykorzystaniem sztucznej inteligencji może poprawić dostęp do mediów dla osób niewidomych i słabowidzących. Wielu z nich polega na opisach audio, aby śledzić treści wizualne, a dubbing z wykorzystaniem sztucznej inteligencji pozwala im angażować się w treści w języku obcym, gdy napisy nie są dostępne. Przełamując zarówno bariery językowe, jak i sensoryczne, dubbing z wykorzystaniem sztucznej inteligencji pomoże stworzyć bardziej inkluzywne doświadczenie rozrywkowe dla wszystkich, co jest szczególnie krytyczne, ponieważ nowe regulacje dotyczące dostępności mediów wchodzą w życie na całym świecie.

Co są największe wyzwania, które nadal muszą być rozwiązane, aby dubbing z wykorzystaniem sztucznej inteligencji stał się naprawdę mainstreamowy?

Największe wyzwania to utrzymanie ultra-wysokiej jakości w skali, zapewnienie precyzji kulturowej i językowej oraz ustalenie wytycznych etycznych dla głosów generowanych przez sztuczną inteligencję. Jednak poza wyzwaniami technicznymi, akceptacja dubbingu z wykorzystaniem sztucznej inteligencji przez publiczność zależy od zaufania. Widzowie muszą czuć, że głosy generowane przez sztuczną inteligencję zachowują autentyczność i emocjonalną głębię występów, a nie brzmią sztucznie lub oderwane.

Aby dubbing z wykorzystaniem sztucznej inteligencji został w pełni zaakceptowany, musi być wysokiej jakości, łącząc sztukę ludzką i technologię w skali, oraz musi demonstrować szacunek dla integralności twórczej, nuansów językowych i kontekstu kulturowego. Oznacza to zapewnienie, że głosy pozostają wiernymi intencjom oryginalnym aktorom, unikając nieścisłości, które mogą alienować publiczność, oraz rozwiązywanie problemów etycznych związanych z ryzykiem głębokich fałszerstw i własnością głosu.

W miarę jak dubbing z wykorzystaniem sztucznej inteligencji staje się bardziej powszechny, dostawcy technologii muszą wdrożyć rygorystyczne standardy dla autentyczności głosu, bezpieczeństwa i ochrony własności intelektualnej. Deepdub aktywnie prowadzi prace w tych obszarach, zapewniając, że technologia głosu sztucznej inteligencji hances global storytelling while respecting the artistic and professional contributions of human talent. Only then will audiences, content creators, and industry stakeholders fully embrace AI dubbing as a trusted and valuable tool. Thank you for the great interview, readers who wish to learn more should visit Deepdub.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.