インタビュー

Kismat Singh、MachGen AI の共同創業者兼CEO – インタビューシリーズ

mm
Unite.AI を Google の優先ソースに追加

Kismat Singh、MachGen AI の共同創業者兼CEO は、ハイパフォーマンスコンピューティングと機械学習システムの構築に20年以上の経験を持つ AI インフラストラクチャおよびエンジニアリングのエグゼクティブです。MachGen AI を共同設立する前、Singh は Intel で AI フレームワーク向けエンジニアリング部門の副社長を務め、以前は NVIDIA、AMD、HP などのテクノロジー企業で上級エンジニアリング職を歴任しました。彼の業績には、ディープラーニングライブラリやコンパイラへの貢献、AI フレームワークの最適化、ハイパースケールトレーニングのレジリエンス向上が含まれます。Intel では、同社の PyTorch イニシアチブに深く関わり、さまざまなハードウェアプラットフォームで AI フレームワークをより利用しやすくすることについて公に講演しました。

MachGen AIは、生成画像および動画モデルを劇的に高速化し、実行コストを大幅に削減することに注力する AI インフラストラクチャ企業です。Kismat Singh と Manoj Krishnan によって設立され、同社は大規模言語モデル向けに構築されたインフラを流用するのではなく、拡散モデル専用に設計された高性能な推論およびファインチューニングスタックを開発しています。MachGen は、アテンション計算、キャッシュ、GPU カーネル、メモリ管理、並列処理、スケジューリング、デプロイメントといった領域を最適化し、モデル品質を維持しながら生成レイテンシを削減します。そのプラットフォームは、テキストから画像への変換、画像から画像への変換、テキストから動画への変換、画像から動画への変換、参照から動画への変換の API を提供し、基盤技術はインタラクティブなコンテンツ作成、リアルタイムアバター、ゲーム、パーソナライズド広告など、低レイテンシが求められるアプリケーションを実現することを目指しています。

あなたは、NVIDIA の TensorRT、Intel の AI ソフトウェア、AMD の GPU 最適化、そして以前のリアルタイム動画エンコーディングの取り組みなど、動画、GPU 計算、AI パフォーマンスに20年以上取り組んできました。その長い年月の中で何を見て、最終的に大手テクノロジー企業を離れ MachGen を共同設立することを決意したのですか?また、拡散推論が会社を立ち上げる価値のあるインフラ課題だと考えた理由は何ですか?

私の共同創業者である Manoj と私は、約10年にわたり同じジムでバドミントンをしていました。その間のほとんどは、お互いを採用しようとしていましたが、最終的にお互いを採用し続けるよりも、一緒に働く方が簡単だと判断しました。

この課題を選んだ理由は、私たち二人とも内部から推論スタックが成熟していく様子を見てきたからです。私は NVIDIA の推論プラットフォームチームの立ち上げに携わり、その後 Intel で AI ソフトウェアを統括しました。Manoj は Meta における PyTorch の大規模モデル訓練インフラを構築しました。私たちは、キャッシュ、バッチング、スケジューリング、カーネルに関する長年の取り組みが、初期の LLM 研究システムをトリリオン単位のトークンを処理する本番インフラへと変換するのを目の当たりにしました。

拡散モデルは、約3年前の LLM 推論があった位置に相当します。画像や動画モデルは急速に進化しましたが、それらを提供するシステムは依然として遅く、高コストで、スケールが困難です。既存のインフラの大半は LLM 用に設計されており、拡散モデルは後から追加された形です。

タイミングが適切だった理由は3つあります。モデルが実用的な製品を構築できるほど十分に高性能になったこと、問題が私たちのキャリアで培ってきたスキルと正確に合致していたこと、そしてインパクトが世代を超える企業を築くに足りるほど大きいことです。数分かかっていた動画が数秒で、しかもコストのごく一部で生成できるようになると、インタラクティブな生成、パーソナライズド広告、リアルタイムアバター、そして全く新しいクリエイティブ製品が実現可能になります。

MachGen は、大規模言語モデルの推論を変革した多くの手法が拡散モデルにはうまく適用できないと主張しています。画像および動画モデルの提供において根本的に異なる点は何か、また従来の AI インフラが見落としがちな最大のパフォーマンスボトルネックはどこにあるのでしょうか?

LLM と拡散モデルは、計算パターンが根本的に異なります。LLM は自己回帰型で、計算負荷の高いプレフィルフェーズの後に、メモリバウンドでトークン単位のデコードが続きます。KV キャッシングやプレフィル/デコードの分離といった手法は、この構造を前提に設計されています。

拡散モデルは非自己回帰型で、ノイズ除去プロセス全体を通して計算負荷が支配的です。動画生成は空間的・時間的データが大量に伴うため、アテンション、メモリ、通信、並列処理に関して異なる要求が生じます。

その結果、LLM 向けに開発された多くの最適化は拡散モデルにはうまく適用できません。従来の KV キャッシングは同じ問題を解決せず、標準的な並列処理は大きな通信オーバーヘッドを招き、利用可能なオープンソースカーネルははるかに成熟度が低いです。スケジューラ、メモリモデル、キャッシング戦略、カーネル、並列処理はすべて拡散モデル自体を前提に設計する必要があります。これが、私たちが拡散を第一級のコンポーネントとして MachGen を構築した理由です。

MachGen は、いくつかの画像モデルで約 4〜6 倍、複数の動画モデルで約 6 倍のレイテンシ低減を、元の蒸留されていないモデルを使用したまま実現したと報告しています。これらの向上を支える最も重要な技術的ブレークスルーは何ですか?また、性能向上が出力品質を犠牲にしないようにするにはどのようにしていますか?

これらの向上は、スタックの複数の部分が連携して働くことから得られます。多くのビデオモデルでは注意機構が計算予算の大部分を占めるため、低精度レシピ、スパース注意、関連技術に注力しています。また、空間的および時間的冗長性を活用するキャッシング手法、高度に最適化された拡散アーキテクチャ用カーネル、そして通信オーバーヘッドを削減する並列化技術も開発しました。

これらの改善により、MachGenはHiDreamを6秒から1秒で、Fluxを6.2秒から1.5秒で提供できるようになりました。ビデオの場合、Wan 2.2は98秒から16.5秒で、LTX 2.3は67秒から10.7秒で実行されます。推論コストも画像モデルで2〜4倍、ビデオで2〜3倍低減されています。

これらの結果は、元の未蒸留モデルを使用しています。出力品質を犠牲にせずに、モデルの実行方法を改善しています。実運用での採用には、速度、コスト、品質がすべて連携して機能する必要があります。

Trusted TVは興味深い例です。生成時間を数分から数秒に短縮することで、インフラストラクチャのコスト以上の変化が生じます。ビデオ生成が十分に高速になり、何千ものキャンペーンやパーソナライズされたクリエイティブバリエーションを作成できるようになると、従来は実現不可能だった新たなビジネスモデルや製品体験が可能になります。

TrustedTVは、AIを活用して放送品質のコマーシャルを作成し、Prime Video、Roku、DirecTVといった接続テレビプラットフォームに配信することを支援します。その顧客の多くは中小企業です。従来の方法でテレビコマーシャルを制作するには、撮影と編集のクルーが必要で、費用は数千ドルから始まり、通常は数万ドル規模になります。Trusted TVはそのコストをゼロにします。中小企業のオーナーは、スマートフォンだけで約5分でフルコマーシャルを作成し、支払い前に確認できます。プラットフォーム上で10,000件以上のキャンペーンが作成されています。

Ian氏(Trusted TVのCEO)は、Artificial AnalysisでのMachGenのレイテンシベンチマークを見て信じませんでした。彼は自らテストに申し込み、最初のレンダリングは約25秒で品質の低下はありませんでした。また、同時実行テストを行ったところ、スケールでも改善が維持されました。彼らは48時間未満で全生産ワークフローをMachGenに移行し、現在はMachGenが新しいビデオ制作すべてを支えています。最新のデプロイでは、そのモデルで10〜11秒に近づいており、今後も改善を続けます。

この製品効果により、広告主は1〜2本の汎用コマーシャルの制作をやめます。ユーザーは週に2〜3本の新しい広告をローテーションし、異なるオーディエンスセグメントでクリエイティブをテストし、確定せずに繰り返し改善します。次に来るのは、地理的・オーディエンスレベルのパーソナライズで、これまで数百万ドル規模の予算を持つ企業だけが実現できた規模です。

私が個人的に考える例です。現在、私はマンハッタンの通りで撮影されたスニーカー広告を目にしますが、私はベイエリアに住んでいるため、意味がありません。欲しいのは、背景にミッションピークが写っている同じ広告です。これは安価なコマーシャルというわけではなく、別の形態の広告であり、生成が十分に高速かつ低コストで何千ものバリエーションを作成できるときに初めて経済的に成立します。

製品に画像やビデオ生成を直接組み込む企業は、推論の経済性についてどのように考えるべきでしょうか?GPU利用率の最適化が、単に各生成ごとにAPIプロバイダーに支払うだけでなく、戦略的に重要になる規模はどれくらいでしょうか?

転換点は、推論が顧客体験または企業のマージンに影響を及ぼし始めたときに訪れます。

チームが製品を検証している間は、汎用APIが有用です。生成がその製品の中心となった時点で、チームは出力ごとの掲載価格だけでなく、レイテンシ、同時実行性、品質、信頼性、GPU利用率も経済性の要素として検討する必要があります。

生成は安価に見えるかもしれませんが、ユーザーが数分待たされて作業を放棄してしまうと、ビジネス上の問題が生じます。使用量と同速でGPU容量を拡張しなければならないアーキテクチャは、マージンに対する圧力をますます高めます。

短い540pクリップに必要な計算量は、長い1080pビデオとは大きく異なるため、単一のリクエスト量の閾値は存在しません。使用量の増加に伴いコストがほぼ同率で上昇したり、ピーク需要でキューが発生したり、レイテンシが製品体験を制限し始めたとき、最適化は戦略的な課題となります。

MachGenはカスタムGPUカーネル、キャッシング、精度最適化、スケジューリング、並列化など、複数の層で機能します。モデルが急速に進化し続ける中で、推論スタックのどの層が速度とコストの劇的な改善に最も大きな残りの機会を提供すると考えますか?

注意機構は多くのモデルで計算予算を支配しているため、残された最大の機会の一つです。低精度レシピ、スパース注意、拡散特化型注意カーネルの改善余地はまだ大きく残っています。

注意は機会の一部に過ぎません。全体として最大の成果は、スタック全体の改善を組み合わせることで得られます。キャッシングはその一例です。LLMで使用されるKVキャッシング手法は直接適用できませんが、拡散モデルは空間的・時間的冗長性を持ち、適切な手法で活用できます。

並列処理は別の機会を提供します。GPU を追加しても、通信オーバーヘッドが利益を相殺するため、比例した速度向上が自動的に得られるわけではありません。私たちは、通信とデータ非依存計算を重ね合わせ、データ依存作業とパイプライン化するカスタマイズされたカーネルを開発しています。

注意機構、キャッシュ、カーネル、並列処理、メモリ、スケジューリングはすべて相互に影響し合います。1 つの層だけを最適化すると、最終的に別の場所でボトルネックが生じます。最大の改善は、拡散モデルの計算プロファイルに合わせてスタック全体を一つのシステムとして扱うことから得られます。

新しい動画モデルが生成時間をリアルタイムに近づけている中、実際にインタラクティブな生成動画がどれほど実現に近いのか、そしてリアルタイム動画生成が一般化するまでに克服すべき技術的障壁は何か、という点が問われています。

私たちはすでに特定のアプリケーションでインタラクティブな速度に到達しています。MachGen は 5 秒の Vidu Q3 Turbo 動画を 720p で約 6 秒、540p で 3 秒未満で生成します。これは迅速なクリエイティブな反復に十分な速度であり、応答性の高いアバターやインタラクティブ動画を実現可能にします。

インタラクティブとは何かの例です。物語を見ていて、結末がどこに向かうかが分かり、気に入らないとします。受動的に座っているのではなく、ストーリーを方向転換させます。つまり、2 人のキャラクターが3 人目が隠しているものを探し出し、展開させるのではなく対峙させる、といった具合です。受け取るコンテンツではなく、自分で操るコンテンツです。高速で低コストな生成が可能にするものであり、私たちが消費するほぼすべてを変えるでしょう。

そこに到達するには、通常、1 つ以上の強力なレイテンシベンチマークが必要です。全体の体験は、プロダクショントラフィック下でも応答性を保ちつつ、映像品質、フレーム間の一貫性、予測可能なコストを維持しなければなりません。長時間の動画や高解像度、同時リクエストはすべてインフラ負荷を増大させ、システムは容量を確保し、リクエストをルーティングし、ハードウェア障害からユーザーに気付かれずに復旧する必要があります。

導入はユースケースごとに進んでいきます。短いクリップ、アバター、ゲーム、クリエイティブツールは、数秒単位の生成で十分であるため、まず実現する可能性が高いです。モデルの品質と推論性能が同時に向上すれば、さらに多くのアプリケーションがその閾値を超えるでしょう。

AI エージェントが人間がボタンを押すのを待つことなく、画像や動画を自律的に生成するようになると、インフラ要件はどのように変化するでしょうか?エージェント主導のワークロードは、レイテンシ、同時実行性、コスト、信頼性に関して根本的に異なる要求を生み出すのでしょうか?

エージェントは、1 件のユーザーリクエストを数十から数百の生成ジョブに変換します。複数のオプションを作成し、評価し、プロンプトを修正し、ステップ間に人間の介入なしでプロセスを繰り返します。

これにより、レイテンシ、同時実行性、コスト、信頼性が格段に重要になります。各生成に数分かかると、エージェントのワークフローは実用的ではなくなります。各試行が高コストであれば、自律的な反復は経済的に実現不可能です。また、システムは多数の同時リクエストを信頼性高く処理する必要があります。なぜなら、1 つの失敗が作業全体のチェーンを中断させる可能性があるからです。

ここで、GPU プロビジョニング、オートスケーリング、ルーティングといった機能が、モデルレベルの最適化と同等に重要になります。エージェントの需要は、ユーザーがボタンをクリックするクリエイティブアプリケーションの需要に比べてはるかにバースト的です。

対象となる作業単位はもはや単一の画像や動画ではありません。生成、評価、コンテンツの洗練という全ループです。インフラはその全ループを高速かつ低コストで信頼性のあるものにしなければなりません。

GPU プロバイダー、推論クラウド、モデル開発者、最適化プラットフォーム間で激しい競争が繰り広げられています。ハードウェア自体が高速化する中で、企業は NVIDIA、AMD、クラウドプロバイダー、あるいはモデル開発者自身の改善に依存するのではなく、なぜ MachGen のような専門的な推論レイヤーを必要とするのでしょうか?

高速なハードウェアは上限を引き上げます。ソフトウェアがその上限のどこまで到達できるかを決定します。

LLM でも同様の現象が見られました。新しいアクセラレータは世代ごとに生の性能を向上させましたが、継続的なバッチ処理、KV キャッシュ管理、投機的デコード、専門的なカーネルが業界を生産レベルのスループットと経済性に導いた要因でした。これらはハードウェアから生まれたものではありません。

画像・動画生成のフルプロダクションパスを継続的に最適化することは、ハードウェアベンダー、クラウドプロバイダー、モデル開発者が行っていることとは別の仕事であり、いずれの主体にとっても主要な優先事項ではありません。

その仕事にはいくつかのアプローチがあります。その一つがモデルを集約しリクエストをルーティングするマーケットプレイスモデルです。パフォーマンスが存在する層を制御できないため、長期的に防御可能とは考えていません。私たちはスタックを自ら構築し、ネイティブにホストすることを選択しました。これが、我々が目指すレイテンシとコストの数値を実現する唯一の方法です。

つまり、モデルごとおよびアクセラレータごとにアテンション、キャッシュ、カーネル、精度、メモリ、並列性を調整し、マネージド API、専用クラウド、セルフホスト展開をサポートすることを意味します。モデルやハードウェアオプションの数が増えるほど、複雑さも増大します。私たちの役割はそれを吸収し、顧客が自社製品の差別化に時間を費やせるようにすることです。

あなたは、世界モデルを MachGen の長期ビジョンの一部として説明し、その計算特性の多くが拡散ワークロードに似ていると述べました。生産規模の世界モデル向けインフラはどのような姿になるべきか、そして視覚環境の生成・シミュレーションが将来的にテキスト生成と同程度に低コストで高速になると、どのようなアプリケーションが可能になるのでしょうか?

我々のプラットフォームを考える一つの方法は、汎用 LLM に似ているということです。同じモデルが法的契約書を作成し、レストランに関する質問に答えます。我々にとっては、同じスタックがビデオアバター企業、AI 広告、ストーリーやマイクロドラマの生成、そして最終的には世界モデルにサービスを提供します。異なる業界でも、根底にあるパフォーマンス課題は同一です。

世界モデルは現時点では我々の主力事業ではありませんが、目指すべき方向であり、現在積極的に取り組んでいます。生産規模の世界モデルは、環境を継続的に生成・更新するため、単一の出力を生成するだけのものとは異なり、非常に高いスループットと極めて低いレイテンシが求められます。また、空間的・時間的な一貫性、アクションへの応答能力、さらにしばしば複数の可能な結果を同時にシミュレートする能力も必要です。これにより、メモリ、データ転送、並列性、信頼性に関する難題が生じます。ロボットやゲームを駆動する世界モデルが次の状態を生成するのに数分かかってはならないのです。性能がこれらのシステムの実用性を左右します。

計算上、現在の世界モデルは拡散モデルに非常に似ているため、我々が現在構築しているスタックは自然な基盤となります。LLM 向けに存在するような成熟した本番環境向けのサービング層はまだなく、我々はそれを構築する予定です。

シミュレーションが現在のテキスト生成と同程度に高速かつ低コストになると、ロボットは稀な状況を事前にリハーサルでき、ゲームは個々のプレイヤーに応じて環境を生成でき、デザイナーは実際に構築する前に数十通りの可能性をテストできます。拡散は我々が現在収益を上げている領域です。世界モデルは我々の指針(ノーススター)です。

素晴らしいインタビューをありがとうございました。詳しく知りたい読者は MachGen AI をご覧ください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。