Interviste
Ofir Krakowski, CEO e Co-Fondatore di Deepdub – Serie di Interviste

Ofir Krakowski è il co-fondatore e CEO di Deepdub. Con 30 anni di esperienza nel campo dell’informatica e dell’apprendimento automatico, ha svolto un ruolo chiave nella fondazione e nella guida del dipartimento di apprendimento automatico e innovazione dell’aeronautica militare israeliana per 25 anni.
Deepdub è un’azienda di doppiaggio guidata dall’intelligenza artificiale che sfrutta l’apprendimento profondo e la clonazione vocale per fornire una localizzazione di alta qualità e scalabile per film, TV e contenuti digitali. Fondata nel 2019, consente ai creatori di contenuti di preservare le prestazioni originali mentre traduce in modo trasparente i dialoghi in più lingue. Integrando la sintesi vocale guidata dall’IA con la supervisione linguistica umana, Deepdub migliora l’accessibilità dei contenuti a livello globale, riducendo il tempo e i costi della tradizionale tecnica del doppiaggio. L’azienda ha ottenuto il riconoscimento dell’industria per la sua innovazione, assicurandosi importanti partnership, certificazioni e finanziamenti per espandere la sua tecnologia di localizzazione AI nel settore dell’intrattenimento.
Cosa ti ha ispirato a fondare Deepdub nel 2019? C’è stato un momento o una sfida particolare che ha portato alla sua creazione?
Il doppiaggio tradizionale è stato a lungo lo standard dell’industria per la localizzazione dei contenuti, ma è un processo costoso, lungo e intensivo in termini di risorse. Mentre esistevano soluzioni di voci generate dall’IA, mancavano della profondità emotiva necessaria per catturare veramente la performance di un attore, rendendole inadeguate per contenuti di alta qualità e complessi.
Abbiamo identificato un’opportunità per colmare questo divario sviluppando una soluzione di localizzazione guidata dall’IA che mantenga l’autenticità emotiva della prestazione originale mentre migliora drasticamente l’efficienza. Abbiamo sviluppato la nostra tecnologia proprietaria eTTS™ (Emotion-Text-to-Speech), che assicura che le voci generate dall’IA abbiano lo stesso peso emotivo, tono e sfumatura degli attori umani.
Ci immaginiamo un mondo in cui le barriere linguistiche e culturali non siano più ostacoli all’accessibilità dei contenuti a livello globale. Creando la nostra piattaforma, abbiamo riconosciuto la sfida delle limitazioni linguistiche all’interno dell’intrattenimento, dell’e-learning, di FAST e di altri settori, e ci siamo impegnati a rivoluzionare la localizzazione dei contenuti.
Per assicurare che la soluzione di Deepdub fornisse la localizzazione e il doppiaggio di alta qualità per contenuti complessi su larga scala, abbiamo deciso di adottare un approccio ibrido e di incorporare esperti linguistici e vocali nel processo, insieme alla nostra tecnologia eTTS™.
La nostra visione è quella di democratizzare la produzione vocale, rendendola massicciamente scalabile, universalmente accessibile, inclusiva e culturalmente rilevante.
Quali sono stati alcuni dei più grandi sfide tecniche e commerciali che hai affrontato quando hai lanciato Deepdub, e come le hai superate?
Guadagnare la fiducia dell’industria dell’intrattenimento è stato un ostacolo significativo quando abbiamo lanciato Deepdub. Hollywood ha fatto affidamento sul doppiaggio tradizionale per decenni, e spostarsi verso soluzioni guidate dall’IA ha richiesto di dimostrare la nostra capacità di fornire risultati di qualità da studio.
Per affrontare questo scetticismo, abbiamo migliorato l’autenticità delle nostre voci generate dall’IA creando una banca di voci completamente licenziata. Questa banca incorpora campioni di voci umane reali, migliorando notevolmente la naturalità e l’espressività della nostra uscita, che è cruciale per l’accettazione a Hollywood.
Poi, abbiamo sviluppato tecnologie proprietarie, come eTTS™, insieme a funzionalità come Accent Control. Queste tecnologie assicurano che le voci generate dall’IA non solo catturino la profondità emotiva e le sfumature, ma si attengano anche all’autenticità regionale richiesta per il doppiaggio di alta qualità.
Abbiamo anche costruito un team di post-produzione interno dedicato che lavora a stretto contatto con la nostra tecnologia. Questo team affina gli output dell’IA, assicurandosi che ogni pezzo di contenuto sia lucidato e soddisfi gli elevati standard dell’industria.
Inoltre, abbiamo esteso il nostro approccio per includere una rete globale di esperti umani – attori vocali, linguisti e registi di tutto il mondo. Questi professionisti portano contributi inestimabili in termini di insight culturali e competenze creative, migliorando l’accuratezza culturale e la risonanza emotiva dei nostri contenuti doppiati.
Il nostro team di linguistica lavora in tandem con la nostra tecnologia e con gli esperti globali per assicurare che il linguaggio utilizzato sia perfetto per il contesto culturale del pubblico target, ulteriormente assicurando l’autenticità e la conformità con le norme locali.
Attraverso queste strategie, combinando tecnologia avanzata con un solido team di esperti globali e un team di post-produzione interno, Deepdub ha dimostrato con successo a Hollywood e ad altre importanti società di produzione in tutto il mondo che l’IA può notevolmente migliorare i flussi di lavoro del doppiaggio tradizionale. Questa integrazione non solo semplifica la produzione, ma espande anche le possibilità di espansione del mercato.
Come si differenzia la tecnologia di doppiaggio guidata dall’IA di Deepdub dai metodi di doppiaggio tradizionali?
Il doppiaggio tradizionale è un processo laborioso e può richiedere mesi per ogni progetto, poiché richiede attori vocali, ingegneri del suono e team di post-produzione per ricreare manualmente i dialoghi in diverse lingue. La nostra soluzione rivoluziona questo processo offrendo una soluzione ibrida end-to-end – combinando tecnologia ed esperti umani – integrata direttamente nei flussi di lavoro di post-produzione, riducendo così i costi di localizzazione fino al 70% e i tempi di consegna fino al 50%.
A differenza di altre soluzioni di voci generate dall’IA, la nostra tecnologia proprietaria eTTS™ consente un livello di profondità emotiva, autenticità culturale e coerenza vocale che i metodi tradizionali faticano a raggiungere su larga scala.
Puoi spiegarci l’approccio ibrido utilizzato da Deepdub – come lavorano insieme l’IA e l’esperienza umana nel processo di doppiaggio?
Il modello ibrido di Deepdub combina la precisione e la scalabilità dell’IA con la creatività e la sensibilità culturale dell’esperienza umana. Il nostro approccio combina l’arte del doppiaggio tradizionale con la tecnologia AI avanzata, assicurandosi che i contenuti localizzati mantengano l’autenticità emotiva e l’impatto dell’originale.
La nostra soluzione sfrutta l’IA per automatizzare gli aspetti di base della localizzazione, mentre gli esperti umani raffinano le sfumature emotive, gli accenti e i dettagli culturali. Incorporiamo sia la nostra tecnologia eTTs™ che la nostra tecnologia Voice-to-Voice (V2V) per migliorare l’espressività naturale delle voci generate dall’IA, assicurandoci che catturino la profondità e il realismo delle prestazioni umane. In questo modo, ci assicuriamo che ogni pezzo di contenuto sembri altrettanto genuino e coinvolgente nella sua forma localizzata quanto lo è nell’originale.
I linguisti e gli esperti vocali svolgono un ruolo chiave in questo processo, poiché migliorano l’accuratezza culturale dei contenuti generati dall’IA. Man mano che la globalizzazione continua a plasmare il futuro dell’intrattenimento, l’integrazione dell’IA con l’arte umana diventerà lo standard per la localizzazione dei contenuti.
Inoltre, il nostro Programma di Royalty per Artisti Vocali compensa gli attori vocali professionisti ogni volta che le loro voci vengono utilizzate nel doppiaggio assistito dall’IA, assicurando l’uso etico della tecnologia vocale AI.
Come migliora la tecnologia eTTS™ (Emotion-Text-to-Speech) di Deepdub l’autenticità vocale e la profondità emotiva nei contenuti doppiati?
Le voci generate dall’IA tradizionale spesso mancano dei sottili segnali emotivi che rendono le prestazioni coinvolgenti. Per affrontare questo limite, Deepdub ha sviluppato la sua tecnologia proprietaria eTTS™, sfruttando l’IA e i modelli di apprendimento profondo per generare discorsi che non solo mantengono la piena profondità emotiva della prestazione originale dell’attore, ma integrano anche l’intelligenza emotiva umana nel processo automatizzato. Questa capacità avanzata consente all’IA di regolare finemente le voci sintetizzate per riflettere le emozioni intese, come gioia, rabbia o tristezza, risuonando in modo autentico con il pubblico. Inoltre, eTTS™ eccelle nella produzione di repliche vocali ad alta fedeltà, imitando le sfumature naturali del linguaggio umano come pitch, tono e ritmo, essenziali per consegnare battute che sono genuine e coinvolgenti. La tecnologia migliora anche la sensibilità culturale adattando abilmente le uscite per controllare gli accenti, allineando così il contenuto doppiato con le sfumature culturali e aumentandone l’appeal e l’efficacia a livello globale.
Una delle critiche comuni alle voci generate dall’IA è che possono suonare robotiche. Come fa Deepdub a garantire che le voci generate dall’IA mantengano la naturalità e la sfumatura emotiva?
La nostra tecnologia proprietaria utilizza algoritmi di apprendimento profondo e di apprendimento automatico per offrire soluzioni di doppiaggio scalabili e di alta qualità che preservano l’intento originale, lo stile, l’umorismo e le sfumature culturali.
Insieme alla nostra tecnologia eTTS™, la nostra suite innovativa include funzionalità come Voice-to-Voice (V2V), Voice Cloning, Accent Control e il nostro Vocal Emotion Bank, che consentono ai team di produzione di raffinare le prestazioni per allinearle con la loro visione creativa. Queste funzionalità assicurano che ogni voce abbia la profondità emotiva e la sfumatura necessarie per una narrazione coinvolgente e un’esperienza utente di impatto.
Negli ultimi anni, abbiamo visto un crescente successo delle nostre soluzioni nel settore Media & Entertainment, quindi abbiamo recentemente deciso di aprire l’accesso ai nostri doppiaggi testati a Hollywood a sviluppatori, aziende e creatori di contenuti con il nostro AI Audio API. Potenziata dalla nostra tecnologia eTTS™, l’API consente la generazione di voci in tempo reale con parametri di personalizzazione avanzati, inclusi accento, tono emotivo, tempo e stile vocale.
La funzionalità principale della nostra API sono i preset audio, progettati sulla base di anni di esperienza nel settore con le esigenze di doppiaggio più richieste. Queste impostazioni preconfigurate consentono agli utenti di adattare rapidamente diversi tipi di contenuto senza richiedere una configurazione manuale estensiva o un’indagine. I preset disponibili includono descrizioni audio e audiolibri, narrazione di documentari o reality, drama e intrattenimento, consegna di notizie, commento sportivo, doppiaggio di anime o cartoni animati, Interactive Voice Response (IVR), nonché contenuti promozionali e commerciali.
Il doppiaggio AI comporta un adattamento culturale e linguistico – come fa Deepdub a garantire che le sue soluzioni di doppiaggio siano culturalmente adeguate e accurate?
La localizzazione non è solo questione di tradurre parole – è questione di tradurre il significato, l’intento e il contesto culturale. L’approccio ibrido di Deepdub combina l’automazione guidata dall’IA con l’esperienza linguistica umana, assicurandosi che i dialoghi tradotti riflettano le sfumature culturali e emotive del pubblico target. La nostra rete di esperti di localizzazione lavora a stretto contatto con l’IA per assicurare che i contenuti doppiati si allineino con i dialetti regionali, le espressioni e le sensibilità culturali.
Quali sono le innovazioni più emozionanti su cui stai lavorando attualmente per spingere il doppiaggio AI al prossimo livello?
Una delle nostre più grandi innovazioni in arrivo è il Doppiaggio in Diretta/Streaming, che consentirà il doppiaggio in tempo reale per eventi in diretta come le partite sportive e i notiziari, rendendo gli eventi globali accessibili all’istante. Combinando questo con un’altra delle nostre emozionanti innovazioni, la nostra funzionalità eTTs™, una tecnologia proprietaria che consente la creazione di voci umane da testo su larga scala e con pieno supporto emotivo e diritti commerciali integrati, saremo in grado di offrire un doppiaggio live di alta qualità, autentico ed emotivo, diverso da tutto ciò che è disponibile sul mercato.
Prendiamo ad esempio le cerimonie di apertura delle Olimpiadi o qualsiasi evento sportivo in diretta. Mentre i broadcaster locali di solito forniscono commenti nella loro lingua e dialetto regionali, questa tecnologia consentirà ai telespettatori di tutto il mondo di vivere l’intero evento nella loro lingua madre mentre si svolge.
Il doppiaggio live ridefinirà la way in cui gli eventi in diretta sono vissuti in tutto il mondo, assicurandosi che la lingua non sia mai una barriera.
Il doppiaggio generato dall’IA ha affrontato critiche in alcuni progetti recenti. Cosa pensi siano i fattori chiave che guidano queste critiche?
Le principali critiche derivano da preoccupazioni riguardanti l’autenticità, l’etica e la qualità. Alcune voci generate dall’IA hanno mancato della risonanza emotiva e della sfumatura necessarie per una narrazione coinvolgente. In Deepdub, abbiamo affrontato questo problema sviluppando voci generate dall’IA espressive emotivamente, assicurandoci che mantengano l’anima della prestazione originale. Deepdub ha raggiunto oltre il 70% di soddisfazione eccezionale degli spettatori in tutte le dimensioni, comprese la scelta del cast, il dialogo chiaro, la sincronizzazione senza soluzione di continuità e il ritmo perfetto.
Un altro problema è l’uso etico delle voci AI. Deepdub è un leader nel doppiaggio AI responsabile, pioniere del primo Programma di Royalty dell’industria che compensa gli attori vocali per le prestazioni generate dall’IA. Crediamo che l’IA debba migliorare la creatività umana, non sostituirla, e questo impegno è riflesso in tutto ciò che costruiamo.
Come vedi il doppiaggio AI cambiare l’industria dell’intrattenimento globale nei prossimi 5-10 anni?
Nel prossimo decennio, il doppiaggio guidato dall’IA democratizzerà i contenuti come mai prima d’ora, rendendo film, spettacoli TV e trasmissioni in diretta accessibili a ogni pubblico, ovunque, nella sua lingua madre all’istante.
Ci immaginiamo un mondo in cui le piattaforme di streaming e i broadcaster integrino il doppiaggio multilingue in tempo reale, rimuovendo le barriere linguistiche e consentendo alle storie di viaggiare più lontano e più velocemente dei metodi di localizzazione tradizionali.
Oltre all’accessibilità linguistica, il doppiaggio AI può anche migliorare l’accesso ai media per i non vedenti e gli ipovedenti. Molti di loro si affidano alle descrizioni audio per seguire i contenuti visivi, e il doppiaggio AI consente loro di interagire con contenuti in lingue straniere quando le didascalie non sono un’opzione accessibile. Rompendo sia le barriere linguistiche che sensoriali, il doppiaggio guidato dall’IA aiuterà a creare un’esperienza di intrattenimento più inclusiva per tutti, aspetto particolarmente critico poiché nuove norme sull’accessibilità dei media stanno entrando in vigore in tutto il mondo.
Quali sono le sfide più grandi che devono ancora essere risolte affinché il doppiaggio AI diventi veramente mainstream?
Le sfide più grandi sono il mantenimento di un’ultra-alta qualità su larga scala, l’assicurazione della precisione culturale e linguistica e l’istituzione di linee guida etiche per le voci generate dall’IA. Tuttavia, oltre gli ostacoli tecnici, l’accettazione pubblica del doppiaggio AI dipende dalla fiducia. Gli spettatori devono sentirsi che le voci generate dall’IA preservano l’autenticità e la profondità emotiva delle prestazioni, piuttosto che suonare sintetiche o distaccate.
Perché il doppiaggio AI sia pienamente accettato, deve essere di alta qualità, combinando l’arte umana e la tecnologia su larga scala, e deve anche dimostrare rispetto per l’integrità creativa, la sfumatura linguistica e il contesto culturale. Ciò significa assicurarsi che le voci rimangano vere all’intento degli attori originali, evitando inesattezze che potrebbero alienare il pubblico, e affrontando le preoccupazioni etiche legate ai rischi di deepfake e alla proprietà delle voci.
Man mano che il doppiaggio AI diventa più diffuso, i fornitori di tecnologia devono implementare standard rigorosi per l’autenticità vocale, la sicurezza e la protezione della proprietà intellettuale. Deepdub è attivamente alla guida in questi settori, assicurandosi che la tecnologia vocale AI migliori la narrazione globale mentre rispetta i contributi artistici e professionali del talento umano. Solo allora gli spettatori, i creatori di contenuti e gli stakeholder dell’industria accetteranno pienamente il doppiaggio AI come uno strumento affidabile e prezioso.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Deepdub.












