Intervjuer
Ofir Krakowski, CEO og medgrunnlegger av Deepdub – Intervju-serie

Ofir Krakowski er medgrunnlegger og CEO av Deepdub. Med 30 års erfaring innen datavitenskap og maskinlæring, spilte han en nøkkelrolle i å etablere og lede det israelske flyvåpenets avdeling for maskinlæring og innovasjon i 25 år.
Deepdub er et selskap som driver med AI-drevet dubbing, og som utnytter dypt læring og stemmekloning for å levere høykvalitets-, skalerbare lokaliseringsløsninger for film, TV og digitale innhold. Grunnlagt i 2019, muliggjør det at innholdsskapere kan bevare de opprinnelige prestasjonene samtidig som de oversetter dialoger til flere språk. Ved å integrere AI-drevet tale-syntese med menneskelig lingvistisk tilsyn, forbedrer Deepdub den globale tilgjengeligheten av innhold, og reduserer tiden og kostnadene forbundet med tradisjonell dubbing. Selskapet har fått anerkjennelse i bransjen for sin innovasjon, og har sikret større partnerskap, sertifiseringer og finansiering for å utvide sin AI-lokaliserings-teknologi over hele underholdningssektoren.
Hva inspirerte deg til å etablere Deepdub i 2019? Var det et bestemt øyeblikk eller en utfordring som ledet til dets opprettelse?
Tradisjonell dubbing har lenge vært bransjens standard for lokaliseringsinnhold, men det er en kostbar, tidskrevende og ressurskrevende prosess. Mens AI-genererte stemmeløsninger allerede eksisterte, manglet de den emosjonelle dybden som er nødvendig for å fange en skuespillers prestasjon, og gjorde dem upassende for høykvalitets-, komplekse innhold.
Vi identifiserte en mulighet til å lukke denne gapen ved å utvikle en AI-drevet lokaliseringsløsning som opprettholder den emosjonelle autentisiteten til den opprinnelige prestasjonen samtidig som den dramatisk forbedrer effisiensen. Vi utviklet vår egen eTTS™-teknologi (Emotion-Text-to-Speech), som sikrer at AI-genererte stemmer bærer den samme emosjonelle vekten, tonen og nuansen som menneskelige skuespillere.
Vi forestiller oss en verden hvor språk- og kulturelle barrierer ikke lenger er hindringer for global tilgjengelighet av innhold. I å lage vår plattform, erkjente vi utfordringen med språkbegrensninger innen underholdning, e-læring, FAST og andre industrier, og satte oss som mål å revolusjonere innholdslokalisering.
I å sikre at Deepdubs løsning tilbød den høyeste kvaliteten på lokaliserings- og dubbingstjenester for komplekse innhold i stor skala, bestemte vi oss for å bruke en hybridtilnærming og inkorporere lingvistiske og stemme-ekspertise i prosessen, i tillegg til vår eTTS™-teknologi.
Vår visjon er å demokratisere stemmeproduksjon, gjøre den massivt skalerbar, universelt tilgjengelig, inkluderende og kulturelt relevant.
Hva var noen av de største tekniske og forretningsmessige utfordringene du møtte da du lanserte Deepdub, og hvordan overvant du dem?
Å vinne tillit fra underholdningsindustrien var en stor hindring da Deepdub ble lansert. Hollywood har lenge avhengig av tradisjonell dubbing, og å skifte til AI-drevne løsninger krevde at vi demonstrerte vår evne til å levere studio-kvalitetsresultater i en bransje som ofte er skeptisk til AI.
For å møte denne skepsisen, forbedret vi først autentisiteten til våre AI-genererte stemmer ved å lage en fullt lisensiert stemmebank. Denne banken inkorporerer ekte menneskestemmemønstre, og forbedrer betydelig den naturlige og uttrykksfulle kvaliteten til våre utdata, noe som er avgjørende for aksept i Hollywood.
Deretter utviklet vi egen teknologi, som vår eTTS™, samt funksjoner som Accent Control. Disse teknologiene sikrer at AI-genererte stemmer ikke bare fanger den emosjonelle dybden og nuansene, men også overholder den regionale autentisiteten som kreves for høykvalitets dubbing.
Vi bygget også et dedikert internt post-produksjonsteam som arbeider tett med vår teknologi. Dette teamet finjusterer AI-utdataene, og sikrer at hvert innhold er polert og møter bransjens høye standarder.
Videre utvidet vi vår tilnærming til å inkludere et globalt nettverk av menneskelige eksperter – stemmeskuespillere, lingvister og regissører fra hele verden. Disse profesjonelle bringer uvurderlige kulturelle innsikter og kreative ekspertise, og forbedrer den kulturelle nøyaktigheten og emosjonelle resonansen til våre dubbede innhold.
Vår lingvistiske team arbeider i tandem med vår teknologi og globale eksperter for å sikre at språket som brukes er perfekt for målgruppens kulturelle kontekst, og videre sikrer autentisitet og overholdelse av lokale normer.
Med disse strategiene, som kombinerer avansert teknologi med et robust team av globale eksperter og et internt post-produksjonsteam, har Deepdub suksessfullt demonstrert for Hollywood og andre topp-produksjonsselskaper verden over at AI kan betydelig forbedre tradisjonelle dubbing-prosesser. Denne integreringen strømlinjeformer ikke bare produksjonen, men åpner også opp for nye muligheter for markedsekspansjon.
Hvordan skiller Deepdubs AI-drevne dubbingsteknologi seg fra tradisjonelle dubbingmetoder?
Tradisjonell dubbing er en arbeidskrevende prosess som kan ta måneder per prosjekt, ettersom den krever stemmeskuespillere, lydteknikere og post-produksjonsteam for å manuelt rekonstruere dialoger på forskjellige språk. Vår løsning revolusjonerer denne prosessen ved å tilby en hybrid, sluttløsning – som kombinerer teknologi og menneskelig ekspertise – integrert direkte i post-produksjonsprosesser, og reduserer dermed lokaliseringskostnadene med opptil 70% og omgangstidene med opptil 50%.
I motsetning til andre AI-genererte stemmeløsninger, tillater vår egen eTTS™-teknologi en grad av emosjonell dybde, kulturell autentisitet og stemmekonsistens som tradisjonelle metoder sliter med å oppnå i stor skala.
Kan du forklaere Deepdubs hybridtilnærming – hvordan samarbeider AI og menneskelig ekspertise i dubbingprosessen?
Deepdubs hybridmodell kombinerer presisjonen og skalerbarheten til AI med kreativiteten og kulturelle sensitiviteten til menneskelig ekspertise. Vår tilnærming blander kunsten til tradisjonell dubbing med avansert AI-teknologi, og sikrer at lokalisiert innhold beholder den emosjonelle autentisiteten og impulsen til originalen.
Vår løsning utnytter AI til å automatisere de grunnleggende aspektene av lokaliseringsprosessen, mens menneskelige profesjonelle finjusterer de emosjonelle nuansene, aksentene og kulturelle detaljene. Vi inkorporerer både vår egen eTTS™ og vår Voice-to-Voice (V2V)-teknologi for å forbedre den naturlige uttrykksfulheten til AI-genererte stemmer, og sikrer at de fanger dybden og realisme til menneskelige prestasjoner. På denne måten sikrer vi at hvert innhold føles like ekte og innvirkende i sin lokalisiserte form som det gjør i originalen.
Lingvister og stemme-eksperter spiller en nøkkelrolle i denne prosessen, ettersom de forbedrer den kulturelle nøyaktigheten til AI-generert innhold. Ettersom globaliseringen fortsetter å forme fremtiden til underholdningsindustrien, vil integreringen av AI med menneskelig kunstneri bli den gylne standarden for innholdslokalisering.
I tillegg kompenserer vår Voice Artist Royalty Program profesjonelle stemmeskuespillere hver gang deres stemmer brukes i AI-assistert dubbing, og sikrer en etisk bruk av stemme-AI-teknologi.
Hvordan forbedrer Deepdubs egen eTTS™-teknologi (Emotion-Text-to-Speech) stemmeautentisiteten og emosjonell dybde i dubbede innhold?
Tradisjonelle AI-genererte stemmer mangler ofte de subtile emosjonelle signalene som gjør prestasjoner kompellende. For å møte denne mangelen, utviklet Deepdub sin egen eTTS™-teknologi, som utnytter AI og dypt læring til å generere tale som ikke bare beholder den fulle emosjonelle dybden til den opprinnelige skuespillerens prestasjon, men også integrerer menneskelig emosjonell intelligens i den automatiserte prosessen. Denne avanserte kapasiteten tillater AI-en å finjustere syntetiske stemmer for å reflektere ønskede emosjoner som glede, sinne eller sorg, og resonere ekte med publikum. I tillegg utmerker eTTS™ seg ved å produsere høykvalitets stemme-replikasjon, og etterligner naturlige nuanser i menneskelig tale som tone, pitch og tempo, essensielle for å levere linjer som er ekte og engasjerende. Teknologien forbedrer også kulturell sensitivitet ved å tilpasse utdataene for å kontrollere aksenter, og sikrer at dubbede innhold respekterer og harmonerer med kulturelle nuanser, og forbedrer dermed dens globale appell og effektivitet.
En av de vanligste kritikkene av AI-genererte stemmer er at de kan høres robotiske ut. Hvordan sikrer Deepdub at AI-genererte stemmer beholder naturlighet og emosjonell nuanse?
Vår egen teknologi utnytter dypt læring og maskinlæring-algoritmer for å levere skalerbare, høykvalitets dubbingløsninger som bevare den opprinnelige intensjonen, stilen, humoren og kulturelle nuansene.
I tillegg til vår eTTS™-teknologi, inkluderer Deepdubs innovative suite funksjoner som Voice-to-Voice (V2V), Voice Cloning, Accent Control og vår Vocal Emotion Bank, som tillater produksjonsteam å finjustere prestasjoner for å møte deres kreative visjon. Disse funksjonene sikrer at hver stemme bærer den emosjonelle dybden og nuansen som er nødvendig for kompellende historiefortelling og innvirkende brukeropplevelser.
I løpet av de siste årene har vi sett økende suksess med våre løsninger i media- og underholdningsindustrien, så vi bestemte oss nylig for å åpne opp vår Hollywood-godkjente stemmeoversettelse til utviklere, bedrifter og innholdsskapere med vår AI Audio API. Drevet av vår eTTS™-teknologi, tillater API-en sanntids stemmegenerering med avanserte tilpasningsparametere, inkludert aksent, emosjonell tone, tempo og vokalstil.
Flaggskip-funksjonen til vår API er audio-presets, designet basert på års erfaring fra industrien med de mest etterspurte stemmeoversettelsesbehov. Disse forhånds-konfigurerte innstillinger tillater brukerne å raskt tilpasse forskjellige innholdstyper uten å måtte gjøre omfattende manuell konfigurasjon eller utforsking. Tilgjengelige presets inkluderer audio-beskrivelser og lydbøker, dokumentar- eller reality-narrasjon, drama og underholdning, nyhetsformidling, sportskommentatorer, anime- eller tegnefilm-stemmer, Interactive Voice Response (IVR), samt promotering og kommersielt innhold.
AI-dubbing innebærer kulturell og lingvistisk tilpasning – hvordan sikrer Deepdub at deres dubbingløsninger er kulturelt passende og nøyaktige?
Lokalisering handler ikke bare om å oversette ord – det handler om å oversette mening, intensjon og kulturell kontekst. Deepdubs hybridtilnærming kombinerer AI-drevet automatisering med menneskelig lingvistisk ekspertise, og sikrer at oversatt dialog reflekterer den kulturelle og emosjonelle nuansen til målgruppen. Vår nettverk av lokaliserings-eksperter arbeider sammen med AI for å sikre at dubbede innhold harmonerer med regionale dialekter, uttrykk og kulturelle sensitiviteter.
Hva er de mest spennende innovasjonene du for tiden arbeider med for å bringe AI-dubbing til neste nivå?
En av våre største kommende innovasjoner er Live/Streaming Dubbing, som vil muliggjøre sanntids dubbing for live-sendinger som sportsarrangementer og nyhetsmedier, og gjøre globale arrangementer umiddelbart tilgjengelige. Ved å kombinere dette med en annen av våre spennende innovasjoner, vår eTTs™-funksjon, en proprietær teknologi som tillater skapelse av menneskelige stemmer fra tekst i stor skala og med full emosjonell støtte og kommersielle rettigheter bygget inn, vil vi kunne tilby høykvalitets, autentiske og emosjonelle live-dubbing ulikt noe annet på markedet.
La oss ta åpningsseremoniene til OL eller et annet live-arrangement som eksempel. Mens lokale kringkastere vanligvis tilbyr kommentarer på sitt regionale språk og dialekt, vil denne teknologien tillate seere over hele verden å oppleve hele arrangementet på sitt eget språk mens det utvikler seg.
Live-dubbing vil omdefinere hvordan live-arrangementer oppleves over hele verden, og sikre at språk aldri er en barriere.
AI-generert dubbing har møtt kritikk i visse prosjekter nylig. Hva tror du er de viktigste faktorene som driver disse kritikkene?
De viktigste kritikkene stammer fra bekymringer om autentisitet, etikk og kvalitet. Noen AI-genererte stemmer har manglet den emosjonelle resonansen og nuansen som er nødvendig for å fange en skuespillers prestasjon. Hos Deepdub har vi møtt dette ved å utvikle emosjonelt uttrykksfulle AI-stemmer, og sikret at de beholder sjelen til den opprinnelige prestasjonen. Deepdub har oppnådd over 70% unik tilfredshet blant seere over alle dimensjoner, inkludert superb casting, klart dialog, sømløs synkronisering og perfekt pacing.
En annen utfordring er den etiske bruken av AI-stemmer. Deepdub er en ledende aktør i ansvarlig AI-dubbing, og har banebrent for industrien med det første Royalty Programmet som kompenserer stemmeskuespillere for AI-genererte prestasjoner. Vi tror AI skal forbedre menneskelig kreativitet, ikke erstatte den, og dette engasjementet reflekteres i alt vi bygger.
Hvordan ser du for deg at AI-dubbing vil endre den globale underholdningsindustrien de neste 5-10 årene?
I løpet av de neste ti årene vil AI-drevet dubbing demokratisere innhold som aldri før, og gjøre filmer, TV-serier og live-sendinger tilgjengelige for hver enkelt målgruppe, over hele verden, på deres eget språk og umiddelbart.
Vi forestiller oss en verden hvor strømmingtjenester og kringkastere integrerer sanntids flerspråklig dubbing, fjerner språkbarrierer og lar historier reise lengre og raskere enn tradisjonelle lokaliseringsmetoder har tillatt.
Ut over språktilgjengelighet kan AI-dubbing også forbedre medietilgjengelighet for blinde og synshemmede. Mange avhenger av audio-beskrivelser for å følge visuelt innhold, og AI-dubbing tillater dem å engasjere seg med fremmedspråklig innhold når undertekster ikke er en tilgjengelig mulighet. Ved å bryte både språklige og sanselige barrierer, vil AI-drevet dubbing hjelpe til å skape en mer inkluderende underholdningsopplevelse for alle, noe som er spesielt kritisk ettersom nye regler om medietilgjengelighet kommer i kraft verden over.
Hva er noen av de største utfordringene som fortsatt må løses for at AI-dubbing skal bli virkelig mainstream?
De største utfordringene er å opprettholde ultra-høy kvalitet i stor skala, sikre kulturell og lingvistisk presisjon, og etablere etiske retningslinjer for AI-genererte stemmer. Men utover de tekniske hindrene, avhenger offentlig aksept av AI-dubbing av tillit. Seere må føle at AI-genererte stemmer beholder autentisiteten og emosjonelle dybden til prestasjonene, snarere enn å høres syntetiske eller avsondrede.
For at AI-dubbing skal bli fullt akseptert, må den være av høy kvalitet ved å kombinere menneskelig kunstneri og teknologi i stor skala, og også demonstrere respekt for kreativ integritet, lingvistisk nuanse og kulturell kontekst. Dette innebærer å sikre at stemmer forblir tro mot de opprinnelige skuespillerens intensjoner, unngå uakkurater som kan alienere publikum, og møte etiske bekymringer rundt deepfake-risiko og stemme-eierskap.
Som AI-dubbing blir mer utbredt, må teknologileverandører implementere strenge standarder for stemmeautentisitet, sikkerhet og intellektuell eiendomsbeskyttelse. Deepdub er aktivt i ferd med å lede an i disse områdene, og sikrer at AI-stemme-teknologi forbedrer global historiefortelling samtidig som den respekterer de kreative og profesjonelle bidragene til menneskelig talent. Først da vil seere, innholdsskapere og bransjestakeholdere fullt ut akseptere AI-dubbing som et pålitelig og verdifullt verktøy.
Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Deepdub.












