インタビュー
ハイアム リオル、Hour Oneの共同創設者兼CTO – インタビュー シリーズ

ハイアム リオル、Hour Oneの共同創設者兼最高技術責任者です。Hour Oneは、プロフェッショナルなビデオ コミュニケーション向けのバーチャル ヒューマンを制作する業界のリーダーです。現実の人間をモデルにした、リアルなバーチャル キャラクターは、テキストを通じて人間のような表現力を発揮し、ビジネスはそのメッセージングを前例のないほどの簡単さとスケーラビリティで高めることができます。
Hour Oneの創設の経緯についてお話しください。
Hour Oneの起源は、暗号化ドメインでの私の関与に遡ります。その後、私は次の大きなことについて考えるようになりました。大量のクラウド コンピューティング リソースが利用できるようになると、機械学習がレコメンドや予測分析で人気を博していることを知り、数々の機械学習 インフラストラクチャ関連プロジェクトに取り組みました。その過程で、初期の生成モデルに興味を持ち、特にGANsに注目しました。利用できるすべてのコンピューティング リソースを使用して、これらの新しいテクノロジーをテストしていました。結果を友人に見せたところ、彼は私にオレンに会うように勧めました。私はなぜかと聞いたところ、彼は私とオレンが両方で彼の時間を無駄にしているので、互いに時間を無駄にしたらどうかと言ったそうです。オレンは私の共同創設者であり、Hour OneのCEOでした。当時、AIの初期投資家でした。私たちは異なる立場にいたものの、同じ方向に向かって進んでいたので、Hour Oneの創設は避けられない旅でした。
使用されている機械学習アルゴリズムについて教えてください。また、生成AIはどの部分で使用されていますか。
ビデオ制作の世界では、機械学習アルゴリズムは各段階で重要な役割を果たしています。スクリプティング段階では、大規模言語モデル(LLMs)が物語を魅力的にするためのサポートを提供します。音声に移ると、テキストを音声(TTS)アルゴリズムが自然な、感情豊かな声に変換します。視覚的な表現に移ると、私たちの独自のバーチャルヒューマンの基礎モデルが中心となります。このモデルは、生成対抗ネットワーク(GANs)と変分オートエンコーダー(VAEs)を使用して、感情、発音、そして明確で魅力的な表現を実現します。生成AIは、テキストと音声のヒントをリアルなバーチャルヒューマンのビジュアルに変換し、ハイパーリアリスティックなビデオ出力を生み出します。LLMs、TTS、GANs、VAEs、および私たちのマルチモーダル モデルの調和が、生成AIを現代のビデオ制作の骨格として機能させます。
Hour Oneは他のビデオ生成ツールとどう違いますか。
Hour Oneでは、競合他社との差別化は競争にのみ焦点を当てるのではなく、品質、製品設計、市場戦略への取り組みから生まれます。私たちの基本原則は、常に人間の要素を優先し、創造物が本物の感情と共感を呼び起こすことです。業界で最高の品質を妥協することなく提供することに誇りを持ちます。先進的な3Dビデオレンダリングを使用して、ユーザーに真正なシネマティック体験を提供します。さらに、私たちの戦略は独自の意見を持っています。完成度の高い製品から始めて、急速に完璧に向かって進化させます。このアプローチにより、私たちの提供するものは常に一歩先を行き、新しい基準をビデオ生成に設定します。
NVIDIA (NVDA ) Next-Generation GH200 グレイス ホッパー スーパーチップ プラットフォームについてのご意見を聞かせてください。
グレイス ホッパー アーキテクチャは本当に革命的なものです。GPUがホストのRAMから直接計算を実行できるようになれば、現在不可能なモデル/アクセラレータの比率が解放され、トレーニング ジョブのサイズに大幅な柔軟性がもたらされます。GH200の全量がLLMのトレーニングにのみ使用されないことを前提として、私たちはこれを使用して、将来的に私たちのマルチモーダル アーキテクチャのプロトタイピング コストを大幅に削減したいと考えています。
現在注目している他のチップはありますか。
私たちの主な目標は、ユーザーに価格競争力のあるビデオ コンテンツを提供することです。現在、GPUの需要が高まっているため、トップのクラウド サービス プロバイダーで提供されるすべてのGPU クラウド オファリングを最適化し、テストしています。さらに、私たちのいくつかのワークロードについては、少なくとも部分的にプラットフォームに依存しないように努めています。したがって、TPUやその他のASIC、およびAMDにも注目しています。最終的に、FLOPS/ドル比率を改善できるハードウェア主導の最適化ルートはすべて検討されます。
ビデオ生成の将来的な進歩についてのご見解を教えてください。
24か月後には、生成された人間と撮影された人間を区別することはできなくなります。それは多くのことを変えるでしょう。私たちはその進歩の最前線にいます。
現在、ほとんどの生成されたビデオはコンピューターとモバイル デバイス向けですが、オーグメンテッド リアリティとバーチャル リアリティの両方でフォトリアリスティックな生成アバターと世界を実現するには何が必要ですか。
現在、オーグメンテッド リアリティ(AR)とバーチャル リアリティ(VR)の両方でフォトリアリスティックなアバターと世界を生成する能力を持っています。主な障害は待ち時間です。ARおよびVRヘッドセットのようなエッジ デバイスに、高品質のリアルタイム グラフィックスを提供することは重要ですが、これを無理なく実現するには、いくつかの要素が必要です。まず、より高速で効率的な処理を可能にするチップ製造の進歩に依存しています。並行して、電力消費の最適化も重要です。ユーザー エクスペリエンスを損なうことなく、長時間使用できるようにする必要があります。最後に、生成とリアルタイム レンダリングのギャップを埋めるソフトウェアのブレークスルーが必要です。これらの要素が揃うと、ARおよびVRプラットフォームでのフォトリアリスティックなアバターと環境の利用が大幅に増加するでしょう。
AIの次の大きなブレークスルーは何だと考えていますか。
AIの次の大きなブレークスルーについては、いつも期待と興奮が高まります。前述した進歩以外に、私たちが現在取り組んでいる数々の革新については、詳細を語ることはできませんが、近々のリリースに注目してください。AIの未来は大きな約束を持ち、私たちがこれらの先駆的な取り組みの最前線に立っていることを誇りに思います。待っていてください。
Hour Oneについてさらに何か共有したいことがありますか。
ぜひHour Oneのディスコード チャンネルとAPIをチェックしてください。これらは私たちのプラットフォームに新しく追加された機能です。












