インタビュー
ディープダブのOfir Krakowski CEO&共同創設者 – インタビューシリーズ

オフィル・クラコフスキーは、ディープダブの共同創設者兼CEOです。コンピューターサイエンスと機械学習の分野で30年の経験を持つ彼は、イスラエル空軍の機械学習とイノベーション部門の創設と指導に重要な役割を果たしました。
ディープダブは、ディープラーニングとボイスクローニングを利用したAIドライブの吹き替え会社です。2019年に設立され、映画、テレビ、デジタルコンテンツの高品質でスケーラブルなローカライズを提供します。オリジナルのパフォーマンスを保持しながら、会話を複数の言語にシームレスに翻訳することができます。AIパワードのスピーチ合成と人間の言語的監視を統合することで、ディープダブはグローバルコンテンツのアクセシビリティを向上させ、伝統的な吹き替えの時間とコストを削減します。同社は、イノベーションに対する業界の認識を獲得し、主要なパートナーシップ、認定、資金調達を確保して、エンターテインメント業界全体でAIローカライズ技術を拡大しています。
ディープダブを2019年に設立するきっかけとなったものは何ですか?特定の瞬間や課題がその創設につながったのでしょうか。
伝統的な吹き替えは長年にわたり業界の標準でしたが、時間がかかり、費用がかかり、リソースが多く必要なプロセスです。AI生成ボイスソリューションは存在しましたが、俳優のパフォーマンスを真正に捉えるために必要な感情の深さが欠けていたため、高品質な複雑なコンテンツには不適切でした。
私たちは、オリジナルのパフォーマンスの感情的真実性を維持しながら効率を大幅に改善するAIパワードのローカライズソリューションを開発する機会を発見しました。私たちは、独自のeTTS(Emotion-Text-to-Speech)技術を開発しました。これにより、AI生成ボイスが人間の俳優と同じ感情の重み、トーン、ニュアンスを持ちます。
私たちは、言語や文化の壁がグローバルコンテンツのアクセシビリティの障壁ではなくなった世界を想像しています。プラットフォームの作成において、エンターテインメント、eラーニング、FAST、その他の業界における言語の限界という課題を認識し、コンテンツローカライズを革命的に変えることを目指しました。
ディープダブのソリューションが複雑なコンテンツに対する最高品質のローカライズと吹き替えを提供することを保証するために、ハイブリッドアプローチを採用し、言語学とボイスの専門家をプロセスに組み込むことにしました。
私たちのビジョンは、ボイスプロダクションを民主化し、大規模にスケーラブルで、普遍的にアクセス可能で、包括的で、文化的に関連性のあるものにすることです。
ディープダブを立ち上げたときに直面した最大の技術的およびビジネス上の課題とは何ですか?それらをどのように克服しましたか。
エンターテインメント業界の信頼を獲得することは、ディープダブを立ち上げたときに大きな障害でした。ハリウッドは数十年間、伝統的な吹き替えに頼ってきたため、AIドライブのソリューションへの転換には、スタジオ品質の結果を提供する能力を示す必要がありました。
この懐疑を解消するために、最初に、完全にライセンスされたボイスバンクを使用して、AI生成ボイスの真実性を高めました。このバンクには、人間のボイスサンプルが含まれており、出力の自然さと表現力を大幅に改善しました。これは、ハリウッドでの受け入れに不可欠です。
次に、eTTSやアクセントコントロールなどの独自技術を開発しました。これらの技術により、AI生成ボイスは感情の深さとニュアンスを捉えると同時に、ハイクオリティな吹き替えに必要な地域の真実性にも対応します。
さらに、テクノロジーと密接に協力するインハウスのポストプロダクションチームを構築しました。このチームは、AI出力を微調整して、業界の高い基準を満たすものになるようにします。
また、世界中から集まった人間の専門家、ボイスアクター、言語学者、ディレクターのグローバルネットワークを拡大しました。これらの専門家は、貴重な文化的洞察と創造的な専門知識を提供し、吹き替えコンテンツの文化的正確性と感情的共鳴を高めます。
私たちの言語学チームは、テクノロジーとグローバルな専門家と密接に協力して、言語がターゲットオーディエンスの文化的背景にぴったり合うようにします。これにより、真実性と地元の規範への準拠がさらに高まり、グローバルな魅力と有効性が向上します。
これらの戦略を通じて、先進的なテクノロジーとグローバルな専門家の強固なチーム、およびインハウスのポストプロダクションチームを組み合わせて、ディープダブはハリウッドと世界中のトップティアのプロダクション会社に、AIが従来の吹き替えワークフローを大幅に強化できることを実証しました。この統合により、生産性が向上し、市場拡大の可能性が拡大します。
ディープダブのAIパワードの吹き替えテクノロジーは、伝統的な吹き替え方法とどのように異なりますか。
伝統的な吹き替えは、ボイスアクター、サウンドエンジニア、ポストプロダクションチームが手動で会話を別の言語で再作成する必要があるため、時間がかかり、手間がかかります。私たちのソリューションは、テクノロジーと人間の専門知識を組み合わせたハイブリッドのエンドツーエンドソリューションを提供することで、このプロセスを革命的に変えます。これにより、ローカライズのコストが最大70%、ターンアラウンド時間が最大50%削減されます。
他のAI生成ボイスソリューションとは異なり、私たちの独自のeTTS技術により、伝統的な方法では達成が難しい感情の深さ、文化的真実性、ボイスの一貫性が実現します。
ディープダブが使用するハイブリッドアプローチについて説明してください。AIと人間の専門知識はどのようにして吹き替えプロセスで協力していますか。
ディープダブのハイブリッドモデルは、AIの精度とスケーラビリティを人間の創造性と文化的感受性と組み合わせます。私たちのアプローチは、伝統的な吹き替えの芸術性と先進的なAIテクノロジーを融合させ、ローカライズされたコンテンツがオリジナルの感情的真実性と影響力を維持することを保証します。
私たちのソリューションは、ローカライズの基礎となる作業をAIで自動化しながら、人間の専門家が感情のニュアンス、口調、文化的詳細を磨きます。私たちは、eTTsとVoice-to-Voice(V2V)テクノロジーを組み合わせて、AI生成ボイスの自然な表現力を高め、人間のパフォーマンスの深さとリアリズムを捉えることを保証します。これにより、コンテンツの各部分がローカライズされた形式で同じぐらい本物的に感じられることを保証します。
言語学者とボイスプロフェッショナルは、このプロセスで重要な役割を果たします。彼らは、AI生成コンテンツの文化的正確性を高めます。グローバル化がエンターテインメントの未来を形作るにつれて、AIと人間の芸術性の統合がコンテンツローカライズの金標準になるでしょう。
さらに、私たちのボイスアーティストロイヤリティプログラムは、プロのボイスアクターがAIアシストの吹き替えで使用されるたびに報酬を支払います。ボイスAIテクノロジーの倫理的な使用を保証します。
ディープダブの独自のeTTS(Emotion-Text-to-Speech)テクノロジーは、吹き替えコンテンツのボイスの真実性と感情的深さをどのように向上させますか。
伝統的なAI生成ボイスは、パフォーマンスを魅力的にする感情的ニュアンスが欠けています。ディープダブは、AIとディープラーニングモデルを使用して、オリジナルの俳優の感情的深さを維持するだけでなく、自動化プロセスに人間の感情的知性を統合するeTTSテクノロジーを開発しました。この高度な機能により、AIは、喜び、怒り、悲しみなどの意図された感情を反映して、オーディエンスに真正に共感できるように合成ボイスを微調整できます。さらに、eTTSは、高忠実度のボイスレプリカを生成することに優れています。人間のスピーチの自然なニュアンス、ピッチ、トーン、テンポを模倣することができ、真正で魅力的なラインを提供するために不可欠です。テクノロジーはまた、口調を制御することで文化的感受性を高め、出力を文化的ニュアンスと一致させることで、グローバルな魅力と有効性を高めます。
AI生成ボイスがロボットのような音になるという批判が最近のプロジェクトで出ています。ディープダブは、AI生成ボイスが自然さと感情的ニュアンスを維持するようにどうしていますか。
私たちの独自テクノロジーは、ディープラーニングとマシーンラーニングアルゴリズムを使用して、オリジナルの意図、スタイル、ユーモア、文化的ニュアンスを維持しながら、スケーラブルで高品質な吹き替えソリューションを提供します。
eTTSテクノロジーの他に、ディープダブの革新的なスイートには、Voice-to-Voice(V2V)、ボイスクローニング、アクセントコントロール、ボーカルエモーションバンクなどの機能があり、プロダクションチームがパフォーマンスを創造的なビジョンに合わせて微調整できるようになります。これらの機能により、魅力的なストーリーテリングと影響力のあるユーザーエクスペリエンスに必要な感情的深さとニュアンスをボイスが持つことが保証されます。
過去数年間で、メディア&エンターテインメント業界での私たちのソリューションの成功を増やしてきました。そこで、最近、開発者、企業、コンテンツクリエイター向けに、ハリウッドで検証されたボイスオーバーへのアクセスをAIオーディオAPIで公開しました。このAPIは、私たちのeTTSテクノロジーによって推進されており、先進的なカスタマイズパラメータを備えたリアルタイムボイス生成を可能にします。アクセント、感情的トーン、テンポ、ボーカルスタイルを含むものです。
私たちのAPIの主な機能は、最も要求の多いボイスオーバーのニーズに基づいて設計されたオーディオプリセットです。これらのプリコンフィグ済み設定により、ユーザーは、広範な手動構成や探索を必要とせずに、さまざまなコンテンツタイプを迅速に適応させることができます。利用可能なプリセットには、オーディオ記述とオーディオブック、ドキュメンタリーまたはリアリティナレーション、ドラマとエンターテインメント、ニュース配信、スポーツ実況、アニメまたは漫画のボイスオーバー、インタラクティブボイスレスポンス(IVR)、およびプロモーションと商業コンテンツが含まれます。
AI吹き替えには文化的および言語的適応が伴います。ディープダブは、吹き替えソリューションが文化的に適切で正確であることをどのように保証していますか。
ローカライズとは、単に言葉を翻訳することではなく、意味、意図、文化的背景を翻訳することです。ディープダブのハイブリッドアプローチは、AIドライブの自動化と人間の言語的専門知識を組み合わせて、翻訳された会話がターゲットオーディエンスの文化的および感情的ニュアンスを反映することを保証します。私たちのローカライズの専門家ネットワークは、AIと協力して、吹き替えコンテンツが地域の方言、表現、文化的感受性と一致することを保証します。
現在、AI吹き替えを次のレベルに引き上げるために最も興奮する革新を何ですか。
私たちが現在取り組んでいる最も大きな革新の1つは、ライブ/ストリーミング吹き替えです。これにより、スポーツイベントやニュースメディアなどのライブ放送のリアルタイム吹き替えが可能になり、世界中のイベントが瞬時にアクセス可能になります。このテクノロジーを、テキストから人間のようなボイスを作成できるeTTs機能と組み合わせることで、市場では他にない、高品質で本物的な、感情豊かなライブ吹き替えを提供できるようになります。
オリンピックの開会式やライブスポーツイベントを例に挙げてみましょう。地元の放送局は通常、地域の言語と方言で実況を提供しますが、このテクノロジーにより、世界中の視聴者が、イベントが進行するにつれて、母国語で体験できるようになります。
ライブ吹き替えは、世界中でライブイベントが体験される方法を再定義し、言語が障壁ではなくなります。
AI生成吹き替えは最近のプロジェクトで批判されています。ディープダブはこれらの批判の背後にある主な要因をどのように見ていますか。
主な批判は、真実性、倫理、品質に関する懸念から生じています。ディープダブでは、感情を表現豊かなAIボイスを開発することでこれに対処し、オリジナルのパフォーマンスの魂を維持することを保証しています。ディープダブは、全ての次元で70%を超える優れたビューアーサチスフィケーションを達成しました。すなわち、素晴らしいキャスティング、明確なダイアログ、シームレスな同期、完璧なペースです。
別の問題は、AIボイスの倫理的な使用です。ディープダブは、業界初のロイヤリティプログラムを立ち上げ、AI生成パフォーマンスでボイスアクターに報酬を支払っています。私たちは、AIが人間の創造性を強化すべきであり、置き換えるべきではないと信じ、すべてのビルディングにこのコミットメントを反映しています。
次の5〜10年で、AI吹き替えがグローバルエンターテインメント業界をどのように変えるでしょうか。
次の10年間で、AIパワードの吹き替えは、コンテンツを以前よりも簡単にアクセス可能にし、映画、テレビ番組、ライブ放送を、瞬時に、どこでも、誰でもが母国語で楽しめるようにします。
私たちは、ストリーミングプラットフォームや放送局がリアルタイムの多言語吹き替えを統合し、言語の壁を排除し、物語が従来のローカライズ方法よりも遠くまで、より速く届く世界を想像しています。
言語のアクセシビリティを超えて、AI吹き替えは、視覚障害者や盲目の人のためのメディアアクセスも強化できます。多くの人が視覚的なコンテンツを追跡するためにオーディオ記述に頼っているため、AI吹き替えにより、字幕がアクセス可能なオプションではない外国語コンテンツと互動できるようになります。言語的および感覚的障壁の両方を排除することで、AIパワードの吹き替えは、すべての人のためのより包括的なエンターテインメント体験を作成するのに役立ちます。これは、今年世界中でメディアアクセシビリティに関する新しい規制が施行されるため、特に重要です。
AI吹き替えが真正に主流になるために、まだ解決しなければならない最大の課題とは何ですか。
最大の課題は、超高品質を維持したままスケーラビリティを実現すること、文化的および言語的精度を確保すること、およびAI生成ボイスのための倫理基準を確立することです。しかし、技術的な障壁を超えて、AI吹き替えの受け入れは、視聴者がAI生成ボイスがパフォーマンスの真実性と感情的深さを維持していることを感じることに依存しています。
AI吹き替えが完全に受け入れられるためには、人間の芸術性とテクノロジーを組み合わせて、高品質で、創造的な完全性、言語的ニュアンス、文化的背景を尊重するものでなければなりません。これは、ボイスがオリジナルの俳優の意図に忠実であり、オーディエンスを遠ざける可能性のある不正確さを避け、ディープフェイクのリスクやボイス所有権に関する倫理的懸念に対処することを意味します。
AI吹き替えがより広く普及するにつれて、テクノロジー提供者は、ボイスの真実性、セキュリティ、知的財産保護のための厳格な基準を実施する必要があります。ディープダブは、これらの分野で積極的にリーダーシップをとり、AIボイステクノロジーがグローバルストーリーテリングを強化しながら、人間の才能の芸術的および専門的な貢献を尊重することを保証しています。そうすれば、オーディエンス、コンテンツクリエイター、業界の利害関係者は、AI吹き替えを信頼性の高い貴重なツールとして完全に受け入れるでしょう。
素晴らしいインタビュー、詳しく知りたい読者はディープダブを訪問してください。












