Interviews

Ofir Krakowski, CEO og medstifter af Deepdub – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Ofir Krakowski er medstifter og CEO af Deepdub. Med 30 års erfaring inden for datalogi og maskinlæring, spillede han en nøglerolle i oprettelsen og ledelsen af det israelske luftvåbens maskinlæring- og innovationsafdeling i 25 år.

Deepdub er et AI-drevet dubbingfirma, der udnytter dyb læring og stemmekloning til at levere højkvalitets-, skalerbar lokalisation for film, tv og digitalt indhold. Grundlagt i 2019, gør det det muligt for indholdsskabere at bevare de originale præstationer, mens de samtidig oversætter dialogen til flere sprog. Ved at integrere AI-drevet tale-syntese med menneskelig lingvistisk oversigt, forbedrer Deepdub den globale indholdstilgængelighed, reducerer tiden og omkostningerne ved traditionel dubbing. Virksomheden har opnået branchegenkendelse for sin innovation, sikret større partnerskaber, certificeringer og finansiering til at udvide sin AI-lokalisationsteknologi på tværs af underholdningssektoren.

Hvad inspirerede dig til at grundlægge Deepdub i 2019? Var der et bestemt øjeblik eller udfordring, der førte til dets oprettelse?

Traditionel dubbing har længe været branchestandarden for lokalisation af indhold, men det er en dyrt, tidskrævende og ressourcekrævende proces. Mens AI-genererede stemmeløsninger eksisterede, manglede de den emotionelle dybde, der er nødvendig for at fange en skuespillers præstation, og gjorde dem upassende for højkvalitets-, komplekst indhold.

Vi identificerede en mulighed for at brokke denne kløft ved at udvikle en AI-drevet lokaliseringsløsning, der opretholder den emotionelle autenticitet af den originale præstation, mens den samtidig dramatisk forbedrer effektiviteten. Vi udviklede vores proprietære eTTS™ (Emotion-Text-to-Speech)-teknologi, der sikrer, at AI-genererede stemmer bærer den samme emotionelle vægt, tone og nuance som menneskelige skuespillere.

Vi forestiller os en verden, hvor sprog- og kulturelle barrierer ikke længere er hindringer for global indholdstilgængelighed. I oprettelsen af vores platform erkendte vi udfordringen med sprogmæssige begrænsninger inden for underholdning, e-læring, FAST og andre brancher, og satte os for at revolutionere indholdslokalisation.

For at sikre, at Deepdubs løsning leverede den højeste kvalitetslokalisering og dubbing for komplekst indhold i stor målestok, besluttede vi at tage en hybridtilgang og inkorporere lingvistiske og stemmeeksperter i processen, i tillæg til vores eTTS™-teknologi.

Vores vision er at demokratisere stemmeproduktion, gøre den massivt skalerbar, universelt tilgængelig, inklusiv og kulturelt relevant.

Hvad var nogle af de største tekniske og forretningsmæssige udfordringer, du stod over for, da du lancerede Deepdub, og hvordan overvandede du dem?

At opnå tillid fra underholdningsindustrien var en større forhindring, da Deepdub blev lanceret. Hollywood har længe afhængigt af traditionel dubbing, og skiftet mod AI-drevne løsninger krævede, at vi demonstrerede vores evne til at levere studie-kvalitetsresultater i en branche, der ofte er skeptisk over for AI.

For at imødegå denne skepsis forbedrede vi først autenticiteten af vores AI-genererede stemmer ved at oprette en fuldt licenseret stemmebank. Denne bank inkorporerer ægte menneskestemprøver, hvilket betydeligt forbedrer naturligheden og udtryksfuldheden af vores output, hvilket er afgørende for accept i Hollywood.

Derefter udviklede vi proprietære teknologier, såsom eTTS™, samt funktioner som Accent Control. Disse teknologier sikrer, at AI-genererede stemmer ikke kun fanger den emotionelle dybde og nuancer, men også overholder regional autenticitet, der er nødvendig for højkvalitetsdubbing.

Vi opbyggede også et dedikeret internt post-produktionshold, der arbejder tæt sammen med vores teknologi. Dette hold finjusterer AI-udgangene, så hver enkelt del af indholdet er poleret og opfylder branchens høje standarder.

Desuden udvidede vi vores tilgang til at inkludere et globalt netværk af menneskelige eksperter – stemmeaktører, lingvister og instruktører fra hele verden. Disse fagfolk bringer uvurderlige kulturelle indsighter og kreative ekspertise, der forbedrer den kulturelle nøjagtighed og emotionelle resonans af vores dubbede indhold.

Vores lingvistiske hold arbejder i tandem med vores teknologi og globale eksperter for at sikre, at sproget brugt er perfekt for målgruppens kulturelle kontekst, og yderligere sikrer autenticitet og overholdelse af lokale normer.

Gennem disse strategier, der kombinerer avanceret teknologi med et robust hold af globale eksperter og et internt post-produktionshold, har Deepdub succesfuldt demonstreret for Hollywood og andre top-tier-produktionsvirksomheder verden over, at AI kan betydeligt forbedre traditionelle dubbing-workflows. Denne integration gør ikke kun produktionen mere effektiv, men åbner også muligheder for markedsudvidelse.

Hvordan adskiller Deepdubs AI-drevne dubbingteknologi sig fra traditionelle dubbingmetoder?

Traditionel dubbing er en arbejdskrævende proces, der kan tage måneder pr. projekt, da den kræver stemmeaktører, lydteknikere og post-produktionshold for at manuelt genskabe dialog i forskellige sprog. Vores løsning revolutionerer denne proces ved at tilbyde en hybrid end-to-end-løsning – kombinerer teknologi og menneskelig ekspertise – integreret direkte i post-produktionsworkflows, hvilket reducerer lokaliseringsomkostningerne med op til 70% og omgangstiderne med op til 50%.

I modsætning til andre AI-genererede stemmeløsninger tillader vores proprietære eTTS™-teknologi en niveau af emotionel dybde, kulturel autenticitet og stemmekonsistens, som traditionelle metoder kæmper for at opnå i stor målestok.

Kan du føre os igennem den hybridtilgang, Deepdub bruger – hvordan arbejder AI og menneskelig ekspertise sammen i dubbingprocessen?

Deepdubs hybridmodel kombinerer præcisionen og skalerbarheden af AI med kreativiteten og kulturelle følsomheden af menneskelig ekspertise. Vores tilgang kombinerer kunsten af traditionel dubbing med avanceret AI-teknologi, sikrer, at lokaliseret indhold beholder den emotionelle autenticitet og impact af originalen.

Vores løsning udnytter AI til at automatisere grundarbejdet med lokalisation, mens menneskelige fagfolk forfiner de emotionelle nuancer, accenter og kulturelle detaljer. Vi inkorporerer både vores proprietære eTTs™ og vores Voice-to-Voice (V2V)-teknologier for at forbedre den naturlige udtryksfuldhed af AI-genererede stemmer, sikrer, at de fanger dybden og realisme af menneskelige præstationer. På denne måde sikrer vi, at hver enkelt del af indholdet føles lige så ægte og betydningsfuldt i sin lokaliserede form som i originalen.

Lingvister og stemmeeksperter spiller en nøglerolle i denne proces, da de forbedrer den kulturelle nøjagtighed af AI-genereret indhold. Da globaliseringen fortsætter med at forme fremtiden for underholdning, vil integrationen af AI med menneskelig kunst blive standarden for indholdslokalisation.

Desuden kompenserer vores Voice Artist Royalty Program professionelle stemmeaktører, hver gang deres stemmer bruges i AI-assisteret dubbing, sikrer, at AI-stemme-teknologien bruges på en etisk måde.

Hvordan forbedrer Deepdubs proprietære eTTS™ (Emotion-Text-to-Speech)-teknologi stemmeautenticitet og emotionel dybde i dubbede indhold?

Traditionelle AI-genererede stemmer mangler ofte de subtile emotionelle signaler, der gør præstationer overbevisende. For at imødegå denne manglende udviklede Deepdub sin proprietære eTTS™-teknologi, der udnytter AI og dyb læring til at generere tale, der ikke kun beholder den fulde emotionelle dybde af den originale skuespillers præstation, men også integrerer menneskelig emotionel intelligens i den automatiserede proces. Denne avancerede kapacitet giver AI mulighed for at justere syntetiserede stemmer for at reflektere intentionelle emotioner som glæde, vrede eller sorg, og giver en autentisk resonans med publikum. Desuden excellerer eTTS™ i at producere høj-fidel stemme-replikation, der efterligner naturlige nuancer i menneskelig tale som tone, tempo og pacing, essentiel for at levere linjer, der er ægte og engagerende. Teknologien forbedrer også kulturel følsomhed ved at tilpasse output til at kontrollere accenter, sikrer, at det dubbede indhold respekterer og tilpasser sig kulturelle nuancer, og forbedrer dets globale appel og effektivitet.

En af de almindelige kritikker af AI-genererede stemmer er, at de kan lyde robotiske. Hvordan sikrer Deepdub, at AI-genererede stemmer beholder naturlighed og emotionel nuance?

Vores proprietære teknologi udnytter dyb læring og maskinlæring til at levere skalerbare, højkvalitetsdubbingløsninger, der bevare den originale intention, stil, humor og kulturelle nuancer.

Sammen med vores eTTS™-teknologi inkluderer Deepdubs innovative suite funktioner som Voice-to-Voice (V2V), Voice Cloning, Accent Control og vores Vocal Emotion Bank, der giver produktionsholdene mulighed for at finjustere præstationer for at matche deres kreative vision. Disse funktioner sikrer, at hver enkelt stemme bærer den emotionelle dybde og nuance, der er nødvendig for overbevisende historiefortælling og betydningsfulde brugeroplevelser.

I de seneste år har vi set en stigende succes med vores løsninger i medie- og underholdningsindustrien, så vi besluttede at åbne adgang til vores Hollywood-godkendte stemmer til udviklere, virksomheder og indholdsskabere med vores AI Audio API. Drevet af vores eTTS™-teknologi giver API’en mulighed for realtids-stemme-generering med avancerede tilpasningsparametre, herunder accent, emotionel tone, tempo og vokalstil.

Flagship-funktionen i vores API er lyd-forudsætninger, designet på baggrund af års erfaring med de mest anmodede stemmebehov. Disse forudindstillede indstillinger giver brugerne mulighed for at hurtigt tilpasse forskellige indholdstyper uden at kræve omfattende manuel konfiguration eller udforskning. Tilgængelige forudsætninger inkluderer lyd-beskrivelser og lydbøger, dokumentar- eller reality-narration, drama og underholdning, nyhedsformidling, sportskommentarer, anime- eller tegnefilms-stemmer, interaktivt svar (IVR) samt promoverings- og kommercielt indhold.

AI-dubbing indebærer kulturel og sproglig tilpasning – hvordan sikrer Deepdub, at deres dubbingløsninger er kulturelt passende og nøjagtige?

Lokalisering handler ikke kun om at oversætte ord – det handler om at oversætte mening, intention og kulturel kontekst. Deepdubs hybridtilgang kombinerer AI-drevet automation med menneskelig lingvistisk ekspertise, sikrer, at oversat dialog reflekterer de kulturelle og emotionelle nuancer af målgruppen. Vores netværk af lokaliserings-eksperter arbejder sammen med AI for at sikre, at det dubbede indhold er i overensstemmelse med regionale dialekter, udtryk og kulturelle følsomheder.

Hvad er de mest spændende innovationer, du arbejder på lige nu for at føre AI-dubbing til næste niveau?

En af vores største kommende innovationer er Live/Streaming Dubbing, der giver mulighed for realtids-dubbing af live-transmissioner som sportsbegivenheder og nyhedsmedier, og gør globale begivenheder øjeblikkeligt tilgængelige. Ved at kombinere dette med en anden af vores spændende innovationer, vores eTTs™-funktion, en proprietær teknologi, der giver mulighed for at skabe menneske-lignende stemmer fra tekst i stor målestok og med fuld emotionel støtte og kommercielle rettigheder indbygget, vil vi kunne tilbyde høj-kvalitets-, ægte og emotionel live-dubbing, der er ulig noget andet på markedet.

Tænk på åbningsseremonierne ved OL eller enhver anden live-begivenhed, for eksempel. Mens lokale tv-stationer typisk giver kommentarer på deres regionale sprog og dialekt, vil denne teknologi give seerne fra hele verden mulighed for at opleve den fulde begivenhed på deres modersmål, mens den udvikler sig.

Live-dubbing vil gendefinere, hvordan live-begivenheder opleves verden over, og sikre, at sprog aldrig er en barriere.

AI-genereret dubbing har mødt kritik i visse projekter for nylig. Hvad mener du er de vigtigste faktorer, der driver disse kritikker?

De primære kritikker stammer fra bekymringer over autenticitet, etik og kvalitet. Nogle AI-genererede stemmer har manglet den emotionelle resonans og nuance, der er nødvendig for overbevisende historiefortælling. Hos Deepdub har vi imødegået dette ved at udvikle emotionelt udtryksfulde AI-stemmer, der sikrer, at de beholder sjælen af den originale præstation. Deepdub har opnået over 70% exceptionel seer-tilfredshed på tværs af alle dimensioner, herunder superb casting, klart dialog, ubrudt synkronisering og perfekt pacing.

En anden problemstilling er den etiske brug af AI-stemmer. Deepdub er en leder i ansvarlig AI-dubbing, og vi har banet vejen for branchens første Royalty Program, der kompenserer stemmeaktører for AI-genererede præstationer. Vi mener, at AI skal forbedre menneskelig kreativitet, ikke erstatte den, og dette engagement afspejles i alt, hvad vi bygger.

Hvordan ser du AI-dubbing forandre den globale underholdningsindustri i de næste 5-10 år?

I de næste 10 år vil AI-drevet dubbing demokratisere indhold som aldrig før, og gøre film, tv-serier og live-transmissioner tilgængelige for hver enkelt målgruppe, overalt, på deres modersmål øjeblikkeligt.

Vi forestiller os en verden, hvor streaming-platforme og tv-stationer integrerer realtids-flersproget dubbing, fjerner sprogbarrierer og giver historier mulighed for at rejse længere og hurtigere end traditionelle lokaliseringsmetoder har tilladt.

Ud over sprogtilgængelighed kan AI-dubbing også forbedre medieadgang for blinde og svagtseende. Mange afhænger af lyd-beskrivelser for at følge visuelt indhold, og AI-dubbing giver dem mulighed for at engagere sig i fremmedsproget indhold, når undertekster ikke er en tilgængelig mulighed. Ved at bryde både sprog- og sensoriske barrierer vil AI-drevet dubbing hjælpe med at skabe en mere inklusiv underholdningsoplevelse for alle, hvilket er særligt kritisk, da nye regler om medieadgang kommer i kraft verden over.

Hvad er nogle af de største udfordringer, der stadig skal løses for AI-dubbing, så den kan blive rigtig mainstream?

De største udfordringer er at opretholde ultra-høj kvalitet i stor målestok, sikre kulturel og sproglig præcision og etablere etiske retningslinjer for AI-genererede stemmer. Men ud over de tekniske hindringer afhænger offentlig accept af AI-dubbing af tillid. Seerne skal føle, at AI-genererede stemmer bevare autenticiteten og emotionelle dybde af præstationer, snarere end at lyde syntetiske eller frakoblet.

For at AI-dubbing kan blive fuldt accepteret, skal den være af høj kvalitet ved at kombinere menneskelig kunst og teknologi i stor målestok, og også demonstrere respekt for kreativ integritet, sproglig nuance og kulturel kontekst. Dette indebærer, at stemmer forbliver sande over for de originale skuespilleres intention, undgår urealistiske fremstillinger, der kunne alienere seerne, og adresserer etiske bekymringer omkring deepfake-risici og stemme-ejerskab.

Som AI-dubbing bliver mere udbredt, skal teknologileverandører implementere strenge standarder for stemmeautenticitet, sikkerhed og immaterielle rettigheder. Deepdub er aktivt med til at føre an i disse områder, og sikrer, at AI-stemme-teknologien forbedrer global historiefortælling, samtidig med at den respekterer de kreative og professionelle bidrag fra menneskelig talent. Først da vil seerne, indholdsskabere og branchestakeholdere fuldt ud acceptere AI-dubbing som et troværdigt og værdifuldt værktøj.

Tak for det gode interview. Læsere, der ønsker at lære mere, kan besøge Deepdub

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.