インタビュー

ディブ・ガーグ、AGI株式会社のCEO兼共同創設者 – インタビュー・シリーズ

mm
Unite.AI を Google の優先ソースに追加

ディブ・ガーグ、AGI株式会社のCEO兼共同創設者は、自律エージェント、エッジインテリジェンス、コンピュータビジョン、ロボティクスに焦点を当てたAI研究者であり、起業家です。AGI株式会社を設立する前、彼はコンピュータ利用エージェントの初期の先駆者であるMultiOnを共同設立し、後にその取締役会長を務めました。ガーグは、スタンフォード大学でも約4年間、客員教員として働き、大学で初めてのトランスフォーマーアーキテクチャー専門のコースであるCS 25:トランスフォーマー・ユナイテッドを開発しました。彼の以前の経験には、コラボレーティブ・ロボティクスでのAI開発のリーダーシップ、NVIDIA (NVDA )およびApple (AAPL )での研究、およびGoogle、Uber、コーネル大学でのコンピュータビジョンおよび自律走行技術の研究が含まれます。彼の研究には、カメラベースの3D認識のための影響力のある疑似LiDARアプローチが含まれていました。

AGI株式会社は、プライベート、セキュア、そしてアクセス可能なインテリジェンスを開発するAI研究会社です。同社の旗艦技術であるAGI-0は、アクション指向のAIシステムであり、ユーザーの好みを理解し、スマートフォン、コンピューター、ウェアラブルデバイス、その他の接続デバイス上のアプリケーション全体でタスクを完了するように設計されています。同社は、ハードウェアメーカーと開発者が、既存のアプリケーションに対して個別の統合を構築せずに、スクリーンに認識可能なエージェントを追加できるプラットフォームも提供しています。AGI株式会社は、レノボと共同で技術を実証し、Qualcomm (QCOM )のSnapdragonパワードデバイス向けにエージェントスタックを最適化しています。

あなたはApple、Google、NVIDIAで働き、MultiOnでの初期エージェントシステムのパイオニアであり、スタンフォード大学でのPh.D.を中断してAGI株式会社を設立しました。既存のAIアプローチが十分ではないと感じた具体的な制限や瞬間は何でしたか?また、デバイス上の自律エージェントを構築することが正しい道であると感じたのはいつでしたか。

この変化は、2023年から2024年の間に、私がウェブエージェントで働いていた間に起こりました。私たちは、エージェントをアクションを実行するために作成できましたが、ウェブサイトがエージェントが作業できる適切な構造を持っている場合にのみ、ブラウザ内で動作しました。ただし、モーダルウィンドウやアニメーションエフェクトなどの問題が発生すると、エージェントは機能を停止しました。他方、ユーザーがスマートフォンとやり取りしたいものはすべて、アプリケーション内で発生しています。アプリケーションは、APIを提供するのではなく、スクリーンを提示します。

これが私たちの結論につながりました。問題の解決策は、より洗練されたAPIやより大きなモデルではありませんでした。代わりに、デバイスを操作するエージェントが必要でした。つまり、スマートフォンを人間が操作するように操作するエージェントが必要でした。

現在の多くのAIアシスタントは、API、統合、クラウドオーケストレーションに大きく依存しています。このモデルでは、基本的に何が壊れていますか?また、デバイス上の実行が欠けているレイヤーであるとどうして信じていますか。

問題は3つあります。まず、カバレッジです。APIは、すべての開発者があなたと接続する必要があり、エージェントの機能は最も遅いパートナーによって制限されます。AppleのApp Intentsは、WWDC 2024で作成されたこのようなテクノロジーの良い例です。次に、プライバシーがあります。クラウドオーケストレーションには、スクリーンコンテンツ、メッセージ、アクティビティが第三者のサーバーに送信される必要があります。最後に、コストと待機時間の問題があります。クラウドを介したすべての処理は遅くて高価です。

デバイス上の実行はこれらの問題をすべて解決します。エージェントは誰にも依存せず、システムと直接やり取りすることでUIを介して接続します。

あなたのアプローチは、質問に答えるのではなく、実際にアプリケーション全体でタスクを完了することに焦点を当てています。エージェントが人間のように信頼性を持って電話を操作できるようにするために、最も困難な技術的な課題は何でしたか。

電話を信頼性を持って制御することは、思ったよりも難しいです。まず、エージェントは人間のように同時に電話のスクリーンを認識し、次のステップを理解し、適切なアクションを実行する必要があります。認識は、ボタン、テキストボックス、メニュー、レイアウトなどを認識できるビジョン言語モデルによって行われます。アクションの選択は、曖昧さ、部分的に読み込まれたページ、モーダルダイアログ、エラーを処理するために必要です。最後に、アクションは正確でなければなりません。タップが正しい場所に着地するようにする必要があります。

最も重大な問題は、長期間にわたって複雑なアプリケーションと信頼性を持ってやり取りするエージェントの能力にあります。Uberを予約することは一つのことですが、アプリケーション内で複数のステップを実行するプロセスは、各ステップが前のやり取りに依存する完全に異なるゲームです。これが、モデルをエンドツーエンドでトレーニングすることが製品の開発に不可欠だった理由です。

あなたはこれをアシスタントからエージェントへの移行と表現しています。この移行は、実際に何を意味しますか?また、ユーザーの行動はどのように変化するでしょうか。

実際の変化は、インターフェース自体から来ます。今日、ユーザーはアプリとやり取りし、アプリの使用方法を学習します。明日、エージェントが存在し、アプリはエージェントがユーザーの代理で組み立てる機能になります。ユーザーはアプリについて考えるのではなく、意図について考えるようになります。例えば、「私を家に連れてって」、「週末の写真をママに送って」、「次の週末に静かなホテルを見つけて」などです。エージェントは、どのアプリを使用するかを知っています。

行動の変化はゆっくり始まり、時間の経過とともに加速します。最初、ユーザーは信頼できるシンプルなタスクを試します。次に、より複雑なタスクに進みます。エージェントがルーティンタスクを毎回正しく実行するときに、全面的な受け入れが発生します。

QualcommやLenovoとのパートナーシップは、Agentic AIを大規模に使用可能にするために、ハードウェアとソフトウェアの統合の重要性についてはどう考えていますか。

これは、研究目的のためのプロトタイプと実際に使用可能なアプリケーションの違いです。Snapdragonパワードデバイスには、ニューラルプロセッサユニットがあります。これにより、エージェントのアルゴリズムがデバイス上で遅延やエネルギー消費を最小限に抑えながら動作できます。Qualcommは、この最適化に数年間取り組んできました。MWC 2026で発表したパートナーシップは、この目標を達成することを目的としていました。

もう一方はLenovoです。Lenovoは、スマートフォン、タブレット、PCを通じて数億人のユーザーにリーチし、AIを使用して自己を差別化しようとしています。既存のデバイスポートフォリオを持つパートナーを介して、迅速かつ透明性を持ってリーチすることは、代替ルートよりも優れています。私はこれを経験から知っています。

信頼は大きな障壁のように思えます。ユーザーがAIに代わりにアクションを取らせることに快適に感じるシステムを設計するには、どうすればよいですか。特に、複数のアプリや機密データを扱う場合に、そのようなアクションを取るにはどうすればよいですか。

信頼は、エージェントが何ができるか、何ができないかを明確に伝えることから築かれます。重要なもの、たとえば実際の購入、メッセージの送信、またはアカウント設定の変更を含むアクションについては、ユーザーの承認が必要です。エージェントは、チェックアウトページまで自身で進むことができますが、ユーザーが承認するまで先に進みません。Visa (V ) とのパートナーシップにより、認証された支払いレールが追加されます。

これは2つのシンプルな哲学に基づいています。まず、「人間が重要なものに関与する」ことです。2つ目は、「可能な限り逆転させる」ことです。また、エージェントはスクリーン上に表示されるもののみを表示し、設定されたOSの権限を尊重します。

アプリエコノミーが混乱する可能性があるという物語が広がっています。エージェントはアプリを完全に置き換えるのでしょうか。あるいは、アプリにアクセスし、収益化する方法を再構成するのでしょうか。

アプリは決して消えません。ダイナミクスはただシフトします。今日、アプリはブランドが消費者とコミュニケーションをとる方法です。明日、エージェントがそれになり、アプリはエージェントがユーザーの代理で使用するツールになります。アプリケーションを提供する開発者は、サービス呼び出し、テキストメッセージ、またはトランザクションの背後にあるアプリケーションが必要であるため、ここに留まるでしょう。違いは、選択が行われるインターフェースにあります。

これは、アプリとそれらを使用するブランドにとって、新しいフロンティアを表します。これは、パートナーシップを開発し、プラットフォームとともに進化するための素晴らしい機会を表します。

あなたのシステムはAPIに頼るのを避けています。これは、開発者やプラットフォームとの間に緊張を生み出すのでしょうか。あるいは、よりオープンなエコシステムを解放するのでしょうか。

これは聞こえほど論争的ではありません。開発者と私たちとの間に競争はありません。インターフェースがどのように機能するかというプロセスは、誰かがアプリケーションを使用するのと同じです。エージェントは、誰でも使用できるのと同じインターフェースを使用します。開発者は、エージェントがアクセスできないようにするために、一般的な技術的慣行を使用できます。

より興味深い結果は、対立の不存在です。ユニバーサルな相互運用性を持つオープンシステムは、すべての利害関係者に利益をもたらします。各アシスタントが特定のアプリでのみ使用できるように、独自の統合が必要な閉じたシステムとは対照的にです。ユニバーサル性はユーザーに利益をもたらしますが、実際の価値を持つアプリにも利益をもたらします。

デバイス上のAIは、プライバシーの利点としてしばしば表現されます。ローカル処理と、従来大規模なコンピューティングを必要とする強力なモデルとのバランスをとるには、どうすればよいのでしょうか。

これはハイブリッドシステムであり、完全にデバイス上のシステムに進化するでしょう。アクションと軽量な推論は電話で発生し、重い推論はクラウドで発生します。Qualcommとの作業を通じてスタックを最適化し、電話のNPUの機能が急速に進化しているため、モデルはよりローカライズされています。現在、市場で利用可能なほとんどのフラグシップ電話は、必要なワークロードを処理する能力を持っています。

強力なパフォーマンスとローカライゼーションを犠牲にするという二律背反は、時代遅れです。モデルはより効率的になり、電話のハードウェアはより強力になります。スタックが適切に最適化されれば、すべてが達成可能です。

3〜5年先を見て、完全に実現されたAIネイティブデバイスはどのようなものになりますか。技術的および文化的に、どのようなことが起こる必要がありますか。

実装は、デバイスを横断する単一のエージェントになります。ユーザーはPCに情報を見つけるように指示し、スマートフォンに切り替えて購入し、車に温めるように指示します。意図は同じですが、コンテキストは一定で、サーフェスは変化します。電話は現在のコンピューティングの挿入点です。その後、PC、テレビ、車、最終的にスマートグラスに移り、Qualcommとのコラボレーションはこの点で大きな違いをもたらします。

技術的には、デバイス上の推論と長期的な信頼性の向上、および適切なデバイス間の移行が必要です。文化的には、エージェントに複雑なタスクを与えることへの信頼の向上が必要です。これは、エージェントが何ができないかを明確に伝え、約束を破らないこと、および可能な限り逆転させることによって達成されます。

素晴らしいインタビュー、ありがとうございます。詳細については、AGI株式会社を訪れてください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。