Interviews

Ofir Krakowski, CEO en mede-oprichter van Deepdub – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Ofir Krakowski is de mede-oprichter en CEO van Deepdub. Met 30 jaar ervaring in computerwetenschappen en machine learning, speelde hij een sleutelrol bij de oprichting en leiding van de afdeling machine learning en innovatie van de Israëlische luchtmacht voor 25 jaar.

Deepdub is een AI-gedreven ondertitelingsbedrijf dat diepe leer- en stemkloon technologie gebruikt om hoge kwaliteit, schaalbare localisatie te bieden voor film, tv en digitale content. Opgericht in 2019, maakt het het mogelijk voor contentmakers om de originele prestaties te behouden terwijl ze dialoog naadloos vertalen in meerdere talen. Door AI-geactiveerde spraaksynthese te integreren met menselijke linguïstische toezicht, verbetert Deepdub de wereldwijde toegankelijkheid van content, waardoor de tijd en kosten van traditionele ondertiteling worden verlaagd. Het bedrijf heeft industrie-erkenning gekregen voor zijn innovatie, waardoor het belangrijke partnerschappen, certificaten en financiering heeft verworven om zijn AI-localisatietechnologie uit te breiden in de entertainmentsector.

Wat inspireerde u om Deepdub op te richten in 2019? Was er een specifiek moment of uitdaging dat leidde tot zijn creatie?

Traditionele ondertiteling is lange tijd de industrienorm geweest voor het lokaliseren van content, maar het is een dure, tijdrovende en resource-intensieve procedure. Terwijl AI-gegenereerde stemoplossingen bestonden, ontbrak het aan de emotionele diepte die nodig is om een acteurprestatie echt te vangen, waardoor ze ongeschikt waren voor hoge kwaliteit, complexe content.

We zagen een kans om deze kloof te overbruggen door een AI-geactiveerde localisatieoplossing te ontwikkelen die de emotionele authenticiteit van de originele prestatie behoudt en de efficiëntie aanzienlijk verbetert. We ontwikkelden onze eigen eTTS™ (Emotion-Text-to-Speech) technologie, die ervoor zorgt dat AI-gegenereerde stemmen dezelfde emotionele gewicht, toon en nuance hebben als menselijke acteurs.

We stellen ons een wereld voor waarin taal- en culturele barrières geen obstakels meer zijn voor de wereldwijde toegankelijkheid van content. Bij het creëren van ons platform erkenden we de uitdaging van taalbeperkingen binnen de entertainment-, e-learning-, FAST- en andere industrieën en stelden we ons ten doel de contentlocalisatie te revolutioneren.

Om ervoor te zorgen dat Deepdubs oplossing de hoogste kwaliteit localisatie en ondertiteling voor complexe content op grote schaal bood, besloten we een hybride aanpak te volgen en linguïstische en stemexperts in het proces te integreren, in combinatie met onze eTTS™-technologie.

Ons visie is om stemproductie te democratiseren, het massaal schaalbaar, universeel toegankelijk, inclusief en cultureel relevant te maken.

Wat waren enkele van de grootste technische en bedrijfsuitdagingen die u tegenkwam bij het lanceren van Deepdub, en hoe overwon u ze?

Het verdienen van het vertrouwen van de entertainmentindustrie was een grote hindernis bij het lanceren van Deepdub. Hollywood heeft decennialang vertrouwd op traditionele ondertiteling en het omschakelen naar AI-gedreven oplossingen vereiste het demonstreren van onze mogelijkheid om studio-kwaliteit resultaten te leveren in een industrie die vaak sceptisch staat tegenover AI.

Om deze scepsis aan te pakken, hebben we allereerst de authenticiteit van onze AI-gegenereerde stemmen verbeterd door een volledig gelicenceerde stembank te creëren. Deze bank bevat echte menselijke stemmonsters, waardoor de naturaliteit en expressiviteit van onze output aanzienlijk wordt verbeterd, wat cruciaal is voor acceptatie in Hollywood.

Vervolgens hebben we eigen technologieën ontwikkeld, zoals eTTS™, evenals functies zoals Accent Control. Deze technologieën zorgen ervoor dat AI-gegenereerde stemmen niet alleen emotionele diepte en nuances vangen, maar ook regionale authenticiteit behouden, die nodig is voor hoge kwaliteit ondertiteling.

We hebben ook een toegewijd in-house post-productieteam opgebouwd dat nauw samenwerkt met onze technologie. Dit team fine-tuned de AI-outputs, waardoor elke content-polijst en voldoet aan de hoge standaarden van de industrie.

Bovendien hebben we onze aanpak uitgebreid tot een wereldwijd netwerk van menselijke experts – stemacteurs, linguïsten en regisseurs van over de hele wereld. Deze professionals brengen waardevolle culturele inzichten en creatieve expertise, waardoor de culturele nauwkeurigheid en emotionele resonantie van onze ondertitelde content worden verbeterd.

Ons linguïstisch team werkt in tandem met onze technologie en wereldwijde experts om ervoor te zorgen dat de taal die wordt gebruikt perfect is voor de culturele context van het doelpubliek, waardoor authenticiteit en naleving van lokale normen worden gewaarborgd.

Door deze strategieën, die geavanceerde technologie combineren met een robuust team van wereldwijde experts en een in-house post-productieteam, heeft Deepdub erfolgreich aangetoond aan Hollywood en andere top-tier productiebedrijven wereldwijd dat AI de traditionele ondertitelingswerkstromen aanzienlijk kan verbeteren. Deze integratie stroomlijnt niet alleen de productie, maar vergroot ook de mogelijkheden voor marktuitbreiding.

Hoe verschilt Deepdubs AI-gedreven ondertiteltechnologie van traditionele ondertitelingsmethoden?

Traditionele ondertiteling is een arbeidsintensieve procedure die maanden per project kan duren, omdat het stemacteurs, geluidstechnici en post-productieteams vereist om handmatig dialoog in verschillende talen te reproduceren. Onze oplossing revolutioneert dit proces door een hybride eind-tot-eindoplossing te bieden – een combinatie van technologie en menselijke expertise – die rechtstreeks in post-productieworkflows is geïntegreerd, waardoor localisatiekosten met maximaal 70% en doorlooptijden met maximaal 50% worden verlaagd.

In tegenstelling tot andere AI-gegenereerde stemoplossingen, biedt onze eigen eTTS™-technologie een niveau van emotionele diepte, culturele authenticiteit en stemconsistentie dat traditionele methoden moeilijk kunnen bereiken op grote schaal.

Kunt u ons door de hybride aanpak van Deepdub leiden – hoe werken AI en menselijke expertise samen in het ondertitelingsproces?

Deepdubs hybride model combineert de precisie en schaalbaarheid van AI met de creativiteit en culturele gevoeligheid van menselijke expertise. Onze aanpak combineert de kunst van traditionele ondertiteling met geavanceerde AI-technologie, waardoor gelokaliseerde content de emotionele authenticiteit en impact van het origineel behoudt.

Onze oplossing gebruikt AI om de grondwerkaspecten van localisatie te automatiseren, terwijl menselijke professionals de emotionele nuances, accenten en culturele details verfijnen. We integreren zowel onze eigen eTTs™- als onze Voice-to-Voice (V2V)-technologieën om de natuurlijke expressiviteit van AI-gegenereerde stemmen te verbeteren, waardoor ze de diepte en realisme van menselijke prestaties vangen. Op deze manier waarborgen we dat elke content zo echt en impactvol aanvoelt in zijn gelokaliseerde vorm als in het origineel.

Linguïsten en stemprofessionals spelen een sleutelrol in dit proces, omdat ze de culturele nauwkeurigheid van AI-gegenereerde content verhogen. Naarmate globalisering de toekomst van entertainment vormgeeft, zal de integratie van AI met menselijke creativiteit de standaard worden voor contentlocalisatie.

Bovendien compenseert ons Voice Artist Royalty Program professionele stemacteurs wanneer hun stemmen worden gebruikt in AI-geassisteerde ondertiteling, waardoor een ethisch gebruik van stem-AI-technologie wordt gewaarborgd.

Hoe verbetert Deepdubs eigen eTTS™ (Emotion-Text-to-Speech) technologie de stemauthenticiteit en emotionele diepte in ondertitelde content?

Traditionele AI-gegenereerde stemmen ontbreken vaak aan de subtiele emotionele signalen die prestaties boeiend maken. Om deze tekortkoming aan te pakken, ontwikkelde Deepdub zijn eigen eTTS™-technologie, die AI en diepe leermodellen gebruikt om spraak te genereren die niet alleen de volledige emotionele diepte van de originele acteursprestatie behoudt, maar ook menselijke emotionele intelligentie in het geautomatiseerde proces integreert. Deze geavanceerde mogelijkheid stelt de AI in staat om gesynthesiseerde stemmen fijn af te stemmen op de bedoelde emoties, zoals vreugde, woede of verdriet, waardoor ze authentiek resonerend met het publiek zijn. Bovendien blinkt eTTS™ uit in het produceren van hoge kwaliteit stemreplicatie, waardoor natuurlijke nuances in menselijke spraak, zoals toon, toonhoogte en tempo, essentieel zijn voor het leveren van regels die echt en boeiend zijn. De technologie verbetert ook de culturele gevoeligheid door output aan accenten aan te passen, waardoor de ondertitelde content de culturele nuances respecteert en ermee overeenstemt, waardoor de wereldwijde aantrekkingskracht en effectiviteit worden verbeterd.

Een van de meest voorkomende kritieken op AI-gegenereerde stemmen is dat ze robotachtig klinken. Hoe zorgt Deepdub ervoor dat AI-gegenereerde stemmen hun naturaliteit en emotionele nuances behouden?

Onze eigen technologie gebruikt diepe leer- en machine learning-algoritmen om schaalbare, hoge kwaliteit ondertitelingsoplossingen te bieden die de originele intentie, stijl, humor en culturele nuances behouden.

Naast onze eTTS™-technologie omvat Deepdubs innovatieve suite functies zoals Voice-to-Voice (V2V), Voice Cloning, Accent Control en onze Vocal Emotion Bank, die productieteams in staat stellen om prestaties te fine-tunen om aan hun creatieve visie te voldoen. Deze functies waarborgen dat elke stem de emotionele diepte en nuances nodig heeft voor boeiende verhalenvertelling en impactvolle gebruikerservaringen.

In de afgelopen jaren hebben we een toenemend succes van onze oplossingen gezien in de media- en entertainmentindustrie, dus hebben we onlangs besloten om toegang te bieden tot onze door Hollywood goedgekeurde voice-overs voor ontwikkelaars, bedrijven en contentmakers met onze AI Audio API. Aangedreven door onze eTTS™-technologie, biedt de API real-time stemgeneratie met geavanceerde aanpasbare parameters, waaronder accent, emotionele toon, tempo en vocale stijl.

Het vlaggenschip van onze API is de audio-presets, ontworpen op basis van jarenlange industrie-ervaring met de meest gevraagde voice-over behoeften. Deze vooraf geconfigureerde instellingen stellen gebruikers in staat om verschillende contenttypen snel aan te passen zonder uitgebreide handmatige configuratie of exploratie. Beschikbare presets omvatten audio-beschrijvingen en luisterboeken, documentaire- of reality-narratie, drama en entertainment, nieuwslevering, sportcommentaar, anime- of tekenfilmstemmen, Interactive Voice Response (IVR), evenals promotionele en commerciële content.

AI-ondertiteling omvat culturele en linguïstische aanpassing – hoe zorgt Deepdub ervoor dat zijn ondertitelingsoplossingen cultureel geschikt en accuraat zijn?

Localisatie is niet alleen het vertalen van woorden – het is het vertalen van betekenis, intentie en culturele context. Deepdubs hybride aanpak combineert AI-gedreven automatisering met menselijke linguïstische expertise, waardoor vertaalde dialoog de culturele en emotionele nuances van het doelpubliek weerspiegelt. Ons netwerk van localisatie-experts werkt samen met AI om ervoor te zorgen dat ondertitelde content overeenkomt met regionale dialecten, uitdrukkingen en culturele gevoeligheden.

Wat zijn enkele van de meest spannende innovaties waar u momenteel aan werkt om AI-ondertiteling naar het volgende niveau te tillen?

Een van onze grootste aanstaande innovaties is Live/Streaming Ondertiteling, waardoor real-time ondertiteling voor live-uitzendingen zoals sportevenementen en nieuwsmedia mogelijk wordt, waardoor globale evenementen onmiddellijk toegankelijk worden. Door dit te combineren met een andere van onze spannende innovaties, onze eTTs™-functie, een eigen technologie die het mogelijk maakt om menselijke stemmen van tekst te creëren op grote schaal en met volledige emotionele ondersteuning en commerciële rechten, zullen we in staat zijn om hoge kwaliteit, authentieke, emotionele live-ondertiteling te bieden, zoals nog nooit tevoren op de markt is geweest.

Neem bijvoorbeeld de openingsceremonie van de Olympische Spelen of elk live-sportevenement. Terwijl lokale omroepen doorgaans commentaar leveren in hun regionale taal en dialect, zal deze technologie het mogelijk maken voor kijkers over de hele wereld om het evenement te ervaren in hun moedertaal terwijl het zich ontvouwt.

Live-ondertiteling zal opnieuw definiëren hoe live-evenementen wereldwijd worden ervaren, waardoor taal nooit een barrière is.

AI-gegenereerde ondertiteling heeft in sommige projecten onlangs kritiek gekregen. Wat denkt u dat de belangrijkste factoren zijn die deze kritiek aanwakkeren?

De belangrijkste kritiek komt voort uit zorgen over authenticiteit, ethiek en kwaliteit. Sommige AI-gegenereerde stemmen ontbraken aan de emotionele resonantie en nuances die nodig zijn voor boeiende verhalenvertelling. Bij Deepdub hebben we dit aangepakt door emotioneel expressieve AI-stemmen te ontwikkelen, waardoor ze de ziel van de originele prestatie behouden. Deepdub heeft meer dan 70% uitzonderlijke kijkersbevrediging behaald over alle dimensies, waaronder superbe casting, duidelijk dialoog, naadloze synchronisatie en perfecte timing.

Een ander probleem is het ethische gebruik van AI-stemmen. Deepdub is een leider in verantwoordelijke AI-ondertiteling, die de eerste Royalty Program in de industrie heeft geïntroduceerd, waardoor stemacteurs worden gecompenseerd voor AI-gegenereerde prestaties. We geloven dat AI menselijke creativiteit moet versterken, niet vervangen, en dat engagement wordt weerspiegeld in alles wat we bouwen.

Hoe ziet u AI-ondertiteling de wereldwijde entertainmentindustrie veranderen in de komende 5-10 jaar?

In de komende decennium zal AI-gedreven ondertiteling content democratiseren zoals nooit tevoren, waardoor films, tv-series en live-uitzendingen toegankelijk worden voor elk publiek, overal, in hun moedertaal, onmiddellijk.

We stellen ons een wereld voor waarin streamingplatforms en omroepen real-time meertalige ondertiteling integreren, waardoor taalbarrières worden verwijderd en verhalen sneller en verder reiken dan traditionele localisatiemethoden hebben toegestaan.

Behalve taaltoegankelijkheid kan AI-ondertiteling ook mediatoegang voor blinden en mensen met een visuele beperking verbeteren. Velen vertrouwen op audiobeschrijvingen om visuele content te volgen, en AI-ondertiteling stelt hen in staat om te communiceren met buitenlandse content wanneer ondertiteling geen toegankelijke optie is. Door zowel taal- als sensorische barrières te doorbreken, zal AI-gedreven ondertiteling helpen om een meer inclusieve entertainmentervaring voor iedereen te creëren, wat vooral kritiek is nu nieuwe regelgeving rond mediatoegankelijkheid wereldwijd van kracht wordt.

Wat zijn enkele van de grootste uitdagingen die nog moeten worden overwonnen om AI-ondertiteling echt mainstream te maken?

De grootste uitdagingen zijn het behouden van ultrahoge kwaliteit op grote schaal, het waarborgen van culturele en linguïstische precisie en het vaststellen van ethische richtlijnen voor AI-gegenereerde stemmen. Echter, voorbij de technische hindernissen, hangt de publieke acceptatie van AI-ondertiteling af van vertrouwen. Kijkers moeten het gevoel hebben dat AI-gegenereerde stemmen de authenticiteit en emotionele diepte van prestaties behouden, in plaats van synthetisch of losgekoppeld te klinken.

Om AI-ondertiteling volledig te omarmen, moet het van hoge kwaliteit zijn door menselijke creativiteit en technologie op grote schaal te combineren en ook respect te tonen voor creatieve integriteit, linguïstische nuances en culturele context. Dit betekent dat stemmen trouw moeten blijven aan de originele intentie van de acteurs, inaccuraatheid moet vermijden die het publiek kan alieneren en ethische zorgen rond diepe vervalsingsrisico’s en stembezit moet aanpakken.

Naarmate AI-ondertiteling meer wordt gebruikt, moeten technologieaanbieders strikte standaarden implementeren voor stemauthenticiteit, beveiliging en intellectueel eigendomsbescherming. Deepdub leidt actief de charge in deze gebieden, waardoor AI-stemtechnologie wereldwijde verhalenvertelling verbetert, terwijl het de artistieke en professionele bijdragen van menselijke talenten respecteert. Pas dan zullen kijkers, contentmakers en industrie- stakeholders AI-ondertiteling volledig omarmen als een betrouwbaar en waardevol instrument.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Deepdub bezoeken. 

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.