Interviews

Ofir Krakowski, CEO und Mitgründer von Deepdub – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Ofir Krakowski ist der Mitgründer und CEO von Deepdub. Mit 30 Jahren Erfahrung in Informatik und Maschinellem Lernen spielte er eine Schlüsselrolle bei der Gründung und Leitung der Abteilung für Maschinelles Lernen und Innovation der israelischen Luftwaffe für 25 Jahre.

Deepdub ist ein von KI angetriebenes Synchronisationsunternehmen, das Deep Learning und Voice Cloning nutzt, um hochwertige, skalierbare Lokalisierung für Film, Fernsehen und digitale Inhalte bereitzustellen. Gegründet im Jahr 2019 ermöglicht es Content-Erstellern, die ursprünglichen Darstellungen zu erhalten, während es Dialoge nahtlos in mehrere Sprachen übersetzt. Durch die Integration von KI-gesteuerter Sprachsynthese mit menschlicher linguistischer Aufsicht verbessert Deepdub die globale Zugänglichkeit von Inhalten, reduziert die Zeit und Kosten traditioneller Synchronisation. Das Unternehmen hat Branchenanerkennung für seine Innovationen erhalten, indem es wichtige Partnerschaften, Zertifizierungen und Finanzierungen zur Erweiterung seiner KI-Lokalisierungstechnologie im Entertainment-Sektor gesichert hat.

Was hat Sie dazu inspiriert, Deepdub im Jahr 2019 zu gründen? Gab es einen bestimmten Moment oder eine bestimmte Herausforderung, die zu seiner Gründung führte?

Traditionelle Synchronisation ist seit langem der Branchenstandard für die Lokalisierung von Inhalten, aber es ist ein teurer, zeitaufwändiger und ressourcenintensiver Prozess. Während es bereits KI-generierte Sprachlösungen gab, fehlte es ihnen an der emotionalen Tiefe, die notwendig ist, um eine Schauspielleistung wirklich einzufangen, was sie für hochwertige, komplexe Inhalte ungeeignet machte.

Wir haben eine Chance erkannt, diese Lücke zu schließen, indem wir eine KI-gesteuerte Lokalisierungslösung entwickelten, die die emotionale Authentizität der ursprünglichen Darstellung beibehält, während sie gleichzeitig die Effizienz drastisch verbessert. Wir entwickelten unsere eigene eTTS™-Technologie (Emotion-Text-to-Speech), die sicherstellt, dass KI-generierte Stimmen das gleiche emotionale Gewicht, die gleiche Tonlage und die gleiche Nuancen wie menschliche Schauspieler haben.

Wir stellen uns eine Welt vor, in der Sprach- und Kulturbarrieren keine Hindernisse mehr für die globale Zugänglichkeit von Inhalten sind. Bei der Erstellung unserer Plattform erkannten wir die Herausforderung der Sprachbegrenzungen in der Unterhaltungs-, E-Learning-, FAST- und anderen Branchen und machten uns daran, die Inhaltslokalisierung zu revolutionieren.

Um sicherzustellen, dass Deepdubs Lösung die höchste Qualität an Lokalisierung und Synchronisation für komplexe Inhalte im großen Maßstab bietet, entschieden wir uns für einen hybriden Ansatz und integrierten linguistische und Stimmenexperten in den Prozess, in Verbindung mit unserer eTTS™-Technologie.

Unsere Vision ist es, die Stimmenproduktion zu demokratisieren, sie massiv skalierbar, universell zugänglich, inklusiv und kulturell relevant zu machen.

Welche waren einige der größten technischen und geschäftlichen Herausforderungen, denen Sie bei der Gründung von Deepdub gegenüberstanden, und wie überwanden Sie sie?

Das Vertrauen der Unterhaltungsindustrie zu gewinnen, war ein großes Hindernis bei der Gründung von Deepdub. Hollywood hat seit Jahrzehnten auf traditionelle Synchronisation gesetzt, und der Wechsel zu KI-gesteuerten Lösungen erforderte, dass wir unsere Fähigkeit demonstrieren, studioqualifizierte Ergebnisse in einer Branche zu liefern, die oft skeptisch gegenüber KI ist.

Um diese Skepsis zu bekämpfen, verbesserten wir zunächst die Authentizität unserer KI-generierten Stimmen, indem wir eine voll lizenzierte Stimmenbank erstellten. Diese Bank enthält echte menschliche Stimmenproben, was die Natürlichkeit und Ausdruckskraft unserer Ausgaben erheblich verbessert, was für die Akzeptanz in Hollywood entscheidend ist.

Dann entwickelten wir proprietäre Technologien wie eTTS™ und Funktionen wie Accent Control. Diese Technologien stellen sicher, dass KI-generierte Stimmen nicht nur emotionale Tiefe und Nuancen erfassen, sondern auch der regionalen Authentizität entsprechen, die für hochwertige Synchronisation erforderlich ist.

Wir bauten auch ein dediziertes internes Postproduktionsteam, das eng mit unserer Technologie zusammenarbeitet. Dieses Team feilt die KI-Ausgaben, um sicherzustellen, dass jeder Inhalt poliert und den hohen Standards der Branche entspricht.

Darüber hinaus erweiterten wir unseren Ansatz, um ein globales Netzwerk von menschlichen Experten einzubeziehen – Stimmenakteure, Linguisten und Regisseure aus der ganzen Welt. Diese Fachleute bringen unverzichtbare kulturelle Einblicke und kreative Expertise ein, die kulturelle Genauigkeit und emotionale Resonanz unserer synchronisierten Inhalte verbessern.

Unser linguistisches Team arbeitet in enger Zusammenarbeit mit unserer Technologie und globalen Experten, um sicherzustellen, dass die verwendete Sprache perfekt auf den kulturellen Kontext der Zielgruppe abgestimmt ist, was die Authentizität und Einhaltung lokaler Normen weiter verbessert.

Durch diese Strategien, die fortschrittliche Technologie mit einem robusten Team globaler Experten und einem internen Postproduktionsteam kombinieren, hat Deepdub erfolgreich demonstriert, dass KI die traditionellen Synchronisationsworkflows erheblich verbessern kann. Diese Integration nicht nur die Produktion zu rationalisieren, sondern auch die Möglichkeiten für Markterweiterungen zu erweitern.

Wie unterscheidet sich Deepdubs KI-gesteuerte Synchronisationstechnologie von traditionellen Synchronisationsmethoden?

Traditionelle Synchronisation ist ein arbeitsintensiver Prozess, der Monate pro Projekt dauern kann, da er Stimmenakteure, Tontechniker und Postproduktionsteams erfordert, um Dialoge manuell in verschiedene Sprachen zu reproduzieren. Unsere Lösung revolutioniert diesen Prozess, indem sie eine hybride End-to-End-Lösung bietet – Kombination aus Technologie und menschlicher Expertise – direkt in die Postproduktionsworkflows integriert, wodurch die Lokalisierungskosten um bis zu 70 % und die Durchlaufzeiten um bis zu 50 % reduziert werden.

Im Gegensatz zu anderen KI-generierten Sprachlösungen ermöglicht unsere proprietäre eTTS™-Technologie ein Level an emotionaler Tiefe, kultureller Authentizität und Stimmenkonsistenz, das traditionelle Methoden bei der Skalierung nur schwer erreichen können.

Können Sie uns den hybriden Ansatz von Deepdub erläutern – wie arbeiten KI und menschliche Expertise zusammen im Synchronisationsprozess?

Deepdubs hybrides Modell kombiniert die Präzision und Skalierbarkeit von KI mit der Kreativität und kulturellen Sensibilität menschlicher Expertise. Unser Ansatz verbindet die Kunst traditioneller Synchronisation mit fortschrittlicher KI-Technologie, um sicherzustellen, dass lokalisierte Inhalte die emotionale Authentizität und Wirkung des Originals beibehalten.

Unsere Lösung nutzt KI, um die Grundarbeiten der Lokalisierung zu automatisieren, während menschliche Fachleute die emotionalen Nuancen, Akzente und kulturellen Details verfeinern. Wir integrieren sowohl unsere proprietäre eTTs™- als auch unsere Voice-to-Voice (V2V)-Technologien, um die natürliche Ausdruckskraft von KI-generierten Stimmen zu verbessern, um sicherzustellen, dass sie die Tiefe und Realistik menschlicher Darstellungen erfassen. Auf diese Weise stellen wir sicher, dass jeder Inhalt in seiner lokalisierten Form so authentisch und wirksam ist wie im Original.

Linguisten und Stimmenfachleute spielen eine Schlüsselrolle in diesem Prozess, da sie die kulturelle Genauigkeit von KI-generierten Inhalten verbessern. Da die Globalisierung die Zukunft der Unterhaltungsindustrie weiter prägt, wird die Integration von KI mit menschlicher Kreativität zum Goldstandard für Inhaltslokalisierung.

Darüber hinaus bietet unser Voice Artist Royalty Program professionellen Stimmenakteuren eine Vergütung, wenn ihre Stimmen in KI-gesteuerter Synchronisation verwendet werden, um den ethischen Einsatz von Stimmen-KI-Technologie sicherzustellen.

Wie verbessert Deepdubs proprietäre eTTS™-Technologie (Emotion-Text-to-Speech) die Stimmenauthentizität und emotionale Tiefe in synchronisierten Inhalten?

Traditionelle KI-generierte Stimmen fehlen oft an den subtilen emotionalen Signalen, die Darstellungen überzeugend machen. Um diese Lücke zu schließen, entwickelte Deepdub seine proprietäre eTTS™-Technologie, die KI und Deep-Learning-Modelle nutzt, um Sprache zu generieren, die nicht nur die volle emotionale Tiefe der ursprünglichen Schauspielleistung beibehält, sondern auch menschliche emotionale Intelligenz in den automatisierten Prozess integriert. Diese fortschrittliche Fähigkeit ermöglicht es der KI, synthetisierte Stimmen fein abzustimmen, um beabsichtigte Emotionen wie Freude, Wut oder Traurigkeit authentisch wiederzugeben, was mit dem Publikum resoniert. Darüber hinaus zeichnet sich eTTS™ durch die Produktion von hochwertigen Stimmenreplicationen aus, die natürliche Nuancen in der menschlichen Sprache wie Tonhöhe, Ton und Tempo nachahmen, was für die Lieferung von Zeilen, die echt und ansprechend sind, unerlässlich ist. Die Technologie verbessert auch die kulturelle Sensibilität, indem sie Ausgaben an Akzente anpasst, um sicherzustellen, dass synchronisierte Inhalte kulturelle Nuancen respektieren und mit ihnen übereinstimmen, was ihre globale Attraktivität und Wirksamkeit erhöht.

Eine der häufigsten Kritikpunkte an KI-generierten Stimmen ist, dass sie roboterhaft klingen. Wie stellt Deepdub sicher, dass KI-generierte Stimmen Natürlichkeit und emotionale Nuancen beibehalten?

Unsere proprietäre Technologie nutzt Deep Learning- und Machine-Learning-Algorithmen, um skalierbare, hochwertige Synchronisationslösungen bereitzustellen, die die ursprüngliche Absicht, den Stil, den Humor und die kulturellen Nuancen beibehalten. Zusammen mit unserer eTTS™-Technologie umfasst Deepdubs innovative Suite Funktionen wie Voice-to-Voice (V2V), Voice Cloning, Accent Control und unseren Vocal Emotion Bank, die es Produktions teams ermöglichen, Darstellungen zu feinjustieren, um ihrem kreativen Konzept zu entsprechen. Diese Funktionen stellen sicher, dass jede Stimme die emotionale Tiefe und Nuancen aufweist, die notwendig sind, um überzeugende Geschichten und wirksame Benutzererfahrungen zu schaffen.

Im Laufe der letzten Jahre haben wir zunehmend erfolgreich unsere Lösungen im Medien- und Unterhaltungssektor eingesetzt, so dass wir kürzlich beschlossen, den Zugang zu unseren in Hollywood geprüften Voiceovers für Entwickler, Unternehmen und Content-Ersteller mit unserer AI-Audio-API zu öffnen. Gestützt auf unsere eTTS™-Technologie ermöglicht die API Echtzeit-Stimmen-Generierung mit erweiterten Anpassungsparametern, einschließlich Akzent, emotionaler Tonlage, Tempo und Stimmstil.

Das Flaggschiff-Feature unserer API sind die Audio-Presets, die auf Basis von jahrelanger Branchenerfahrung mit den am häufigsten angeforderten Bedürfnissen von Voiceovers entwickelt wurden. Diese vorkonfigurierten Einstellungen ermöglichen es Benutzern, unterschiedliche Inhalte schnell anzupassen, ohne dass umfangreiche manuelle Konfiguration oder Erkundung erforderlich ist. Verfügbar sind Präsentationen wie Audio-Beschreibungen und Hörbücher, Dokumentar- oder Realitätsnarration, Drama und Unterhaltung, Nachrichtenlieferung, Sportkommentar, Anime- oder Cartoon-Stimmen, interaktive Voice-Response (IVR) sowie Werbe- und kommerzielle Inhalte.

Die KI-Synchronisation umfasst kulturelle und sprachliche Anpassung – wie stellt Deepdub sicher, dass seine Synchronisationslösungen kulturell angemessen und genau sind?

Lokalisierung ist nicht nur die Übersetzung von Worten – es geht um die Übersetzung von Bedeutung, Absicht und kulturellem Kontext. Deepdubs hybrider Ansatz kombiniert KI-gesteuerte Automation mit menschlicher linguistischer Expertise, um sicherzustellen, dass übersetzter Dialog die kulturellen und emotionalen Nuancen der Zielgruppe widerspiegelt. Unser Netzwerk von Lokalisierungsexperten arbeitet Seite an Seite mit KI, um sicherzustellen, dass synchronisierte Inhalte mit regionalen Dialekten, Ausdrücken und kulturellen Sensibilitäten übereinstimmen.

Was sind die aufregendsten Innovationen, an denen Sie derzeit arbeiten, um die KI-Synchronisation auf das nächste Level zu heben?

Eine unserer größten kommenden Innovationen ist Live-/Streaming-Synchronisation, die es ermöglichen wird, Echtzeit-Synchronisation für Live-Übertragungen wie Sportereignisse und Nachrichtenmedien zu ermöglichen, wodurch globale Ereignisse sofort weltweit zugänglich gemacht werden. Durch die Kombination dieser Technologie mit einer weiteren unserer aufregenden Innovationen, unserem eTTs™-Feature, einer proprietären Technologie, die die Erstellung von menschlich klingenden Stimmen aus Texten im großen Maßstab mit voller emotionaler Unterstützung und kommerziellen Rechten ermöglicht, werden wir in der Lage sein, hochwertige, authentische und emotionale Live-Synchronisation zu bieten, die es auf dem Markt noch nicht gibt.

Nehmen wir beispielsweise die Eröffnungszeremonie der Olympischen Spiele oder jedes Live-Sportereignis. Während lokale Sender typischerweise Kommentare in ihrer regionalen Sprache und ihrem Dialekt anbieten, ermöglicht diese Technologie es Zuschauern auf der ganzen Welt, das gesamte Ereignis in ihrer Muttersprache zu erleben, während es sich entfaltet.

Live-Synchronisation wird neu definieren, wie Live-Ereignisse weltweit erlebt werden, und sicherstellen, dass Sprache nie ein Hindernis darstellt.

Die KI-generierte Synchronisation ist in bestimmten Projekten kürzlich kritisiert worden. Was glauben Sie, sind die Hauptfaktoren, die diese Kritik antreiben?

Die Hauptkritikpunkte resultieren aus Bedenken hinsichtlich Authentizität, Ethik und Qualität. Einige KI-generierte Stimmen haben der emotionalen Resonanz und Nuancen gefehlt, die für immersive Geschichtenerzählung erforderlich sind. Bei Deepdub haben wir dies angegangen, indem wir emotional ausdrucksstarke KI-Stimmen entwickelt haben, die die Seele der ursprünglichen Darstellung beibehalten. Deepdub hat über 70 % außergewöhnliche Zuschauerzufriedenheit in allen Dimensionen erzielt, einschließlich hervorragender Besetzung, klarer Dialoge, nahtloser Synchronisation und perfekter Timing.

Ein weiteres Problem ist der ethische Einsatz von KI-Stimmen. Deepdub ist ein Vorreiter im verantwortungsvollen Einsatz von KI-Synchronisation und hat das erste Royalty-Programm der Branche ins Leben gerufen, das Stimmenakteuren für KI-generierte Darstellungen eine Vergütung bietet. Wir glauben, dass KI menschliche Kreativität erweitern und nicht ersetzen sollte, und dieses Engagement spiegelt sich in allem wider, was wir aufbauen.

Wie sehen Sie die Zukunft der KI-Synchronisation in der globalen Unterhaltungsindustrie in den nächsten 5-10 Jahren?

In den nächsten zehn Jahren wird die KI-gesteuerte Synchronisation Inhalte demokratisieren wie nie zuvor, indem sie Filme, Fernsehsendungen und Live-Übertragungen für jedes Publikum, überall und in seiner Muttersprache sofort zugänglich macht.

Wir stellen uns eine Welt vor, in der Streaming-Plattformen und Sender Echtzeit-Mehrsprachensynchronisation integrieren, um sprachliche Barrieren zu beseitigen und es Geschichten zu ermöglichen, weiter und schneller zu reisen, als traditionelle Lokalisierungsmethoden es je ermöglicht haben.

Darüber hinaus kann die KI-Synchronisation auch den Zugang zu Medien für Blinde und Sehbehinderte verbessern. Viele sind auf Audio-Beschreibungen angewiesen, um visuelle Inhalte zu verfolgen, und die KI-Synchronisation ermöglicht es ihnen, sich mit fremdsprachigen Inhalten auseinanderzusetzen, wenn Untertitel keine zugängliche Option sind. Indem sie sowohl sprachliche als auch sensorische Barrieren durchbricht, wird die KI-gesteuerte Synchronisation dazu beitragen, eine inklusivere Unterhaltungserfahrung für alle zu schaffen, was besonders kritisch ist, da neue Vorschriften für Medienzugänglichkeit weltweit in Kraft treten.

Was sind einige der größten Herausforderungen, die noch gelöst werden müssen, damit die KI-Synchronisation wirklich mainstream wird?

Die größten Herausforderungen sind die Beibehaltung von ultrahochwertiger Qualität im großen Maßstab, die Sicherstellung kultureller und sprachlicher Präzision und die Etablierung ethischer Richtlinien für KI-generierte Stimmen. Darüber hinaus hängt die öffentliche Akzeptanz der KI-Synchronisation von Vertrauen ab. Zuschauer müssen das Gefühl haben, dass KI-generierte Stimmen die Authentizität und emotionale Tiefe von Darstellungen beibehalten, anstatt künstlich oder abgehoben zu klingen.

Um die KI-Synchronisation vollständig zu akzeptieren, muss sie hochwertig sein, indem sie menschliche Kreativität und Technologie im großen Maßstab kombiniert, und sie muss Respekt für kreative Integrität, sprachliche Nuancen und kulturellen Kontext demonstrieren. Dies bedeutet, dass Stimmen treu bleiben müssen zu den ursprünglichen Absichten der Schauspieler, Ungenauigkeiten vermeiden, die das Publikum alienieren könnten, und ethische Bedenken hinsichtlich Deepfake-Risiken und Stimmeneigentum ansprechen.

Da die KI-Synchronisation weiter verbreitet wird, müssen Technologieanbieter strenge Standards für Stimmenauthentizität, Sicherheit und geistiges Eigentum umsetzen. Deepdub ist aktiv dabei, in diesen Bereichen die Führung zu übernehmen, um sicherzustellen, dass KI-Stimmen-Technologie globale Geschichtenerzählung erweitert, während sie die künstlerischen und professionellen Beiträge menschlichen Talents respektiert. Nur dann werden Zuschauer, Content-Ersteller und Branchenbeteiligte die KI-Synchronisation als vertrauenswürdiges und wertvolles Werkzeug vollständig annehmen.

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Deepdub besuchen.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.