ソートリーダー

エージェントの約束はどこにあるのか? 私たちが得たのは静的な連鎖だけだった

mm
Unite.AI を Google の優先ソースに追加

2023年の春、LLMベースのAIエージェントの出現に世界中が熱を上げました。AutoGPTやBabyAGIのような強力なデモは、LLMがループで動作し、次のアクションを選択し、その結果を観察し、次のアクションを選択するというポテンシャルを示しました(ReACTフレームワーク)。この新しい方法は、エージェントが自律的に多ステップタスクを実行するために使用されることが期待されました。目標とツールを与えれば、エージェントは残りのタスクを処理することができます。2024年の終わりまでに、AIエージェントとAIエージェント構築フレームワークが溢れることになるでしょう。しかし、約束されたエージェントはどこにあるのでしょうか?

ReACTフレームワークに基づくエージェントは、重大な制限を抱えていると言えるでしょう。複数のステップやツールを必要とするタスクを与えると、悲惨に失敗します。明らかな遅延の問題以外に、エージェントはトラックを失い、指示に従うことができず、早すぎてまたは遅すぎて停止し、異なる結果を生み出します。驚くことではありません。ReACTフレームワークは、予測不可能なLLMの制限をステップ数で増幅させます。しかし、エージェント構築者は、特に企業での実際のユースケースを解決するために、そんなレベルのパフォーマンスでは十分ではありません。複雑な多ステップワークフローで信頼性の高い、予測可能な、説明可能な結果が必要です。さらに、LLMの予測不可能な性質を緩和するAIシステムが必要です。

では、企業では現在どのようにエージェントが構築されているのでしょうか?複数のツールやステップを必要とするユースケース(例えば、会話型RAG)では、エージェント構築者は、ReACTのダイナミックで自律的な約束を放棄し、静的な連鎖の作成に頼る方法を採用しています。このアプローチは、従来のソフトウェアエンジニアリングに似ており、ReACTのエージェント的な約束から遠ざかっています。制御と信頼性のレベルは高くなりますが、自律性と柔軟性は欠けているため、開発に多くの時間がかかり、適用範囲が狭くなり、入力スペースや環境の変化に対応することが難しくなります。

静的な連鎖の実践は、どれだけ「静的な」かによって異なります。ある連鎖は、原子的なステップを実行するためにLLMのみを使用します(例えば、情報を抽出する、テキストを要約する、メッセージを下書きする)。他の連鎖は、実行時に一部の決定を動的に行うためにLLMを使用します(例えば、代替フロー間のルーティング、ステップの結果を検証して再実行するかどうかを決定する)。どちらにせよ、LLMがソリューション内の動的な決定を担当している限り、信頼性と自律性のトレードオフに陥ります。ソリューションが静的な場合、より信頼性が高く予測可能ですが、自律性が低く、適用範囲が狭くなり、開発に多くの時間がかかります。一方、ソリューションが動的で自律的な場合、より汎用性が高く、構築が簡単ですが、信頼性と予測可能性が低くなります。

このトレードオフは、次のグラフィックで表すことができます。

 

これは、右上の象限に位置するエージェントフレームワークがなぜまだ見つかっていないのかを疑問にさせます。信頼性と自律性のトレードオフから逃れることはできないのでしょうか?ReACTエージェントのようなシンプルなインターフェース(目標とツールを与えれば、エージェントが残りのタスクを処理する)を提供するフレームワークが、信頼性を犠牲にすることなく実現可能なのでしょうか?

答えは、可能です。しかし、そのためには、間違った方法でやってきたことを認識する必要があります。現在のエージェント構築フレームワークは、すべてが共通の欠陥を抱えています。LLMを、動的で自律的なコンポーネントとして頼りにしています。しかし、エージェントが自律的で信頼性の高いものになるために欠けている重要な要素は、計画技術です。LLMは、計画者としては優れています。

では、計画とは何でしょうか?計画とは、望ましい結果につながる代替の行動計画を明示的にモデル化し、予算制約の下でこれらの代替案を効率的に探索し、利用する能力を指します。計画は、マクロレベルとミクロレベルの両方で行う必要があります。マクロプランは、タスクを依存関係と独立関係のあるステップに分解し、望ましい結果を達成するために実行する必要があります。ミクロ計画は、ステップレベルで望ましい結果を保証するために必要です。単一のステップで要件を満たす結果を得るために、より多くの推論時間の計算を使用するための戦略は多数あります。例えば、意味的検索クエリを複数回言い換えることができます。特定のクエリに対してより多くのコンテキストを取得できます。より大きなモデルを使用できます。LLMからより多くの推論を得ることができます。すべての結果から最も適切なものを選択できます。良いミクロプランナーは、与えられたコンピューティングと遅延の予算の下で、最適な結果を効率的に得ることができます。必要に応じてリソースの投資をスケーリングできます。計画的なAIシステムは、LLMの確率的な性質を緩和して、ステップレベルで保証された結果を達成することができます。そうでない場合、エラーの累積問題に陥り、最も優れたマクロレベルの計画をも損なうことになります。

では、LLMはなぜ計画者として機能できないのでしょうか?LLMは、高レベルの指示を、自然言語やコードで表現された合理的な行動計画に翻訳することができます。計画には、それ以上のことが必要です。計画には、望ましい結果につながる可能性のある代替の行動計画をモデル化する能力と、各代替案の予想される効用とコスト(コンピューティングと/または遅延)について推論する能力が必要です。LLMは、利用可能な行動計画の表現を生成することができますが、各行動計画の予想される効用とコストを予測することはできません。例えば、特定のコンテキストでモデルXとモデルYを使用する場合の予想される効用とコストは何でしょうか?インデックスされたドキュメントコーパスで特定の情報を検索する場合の予想される効用は何でしょうか?CRMへのAPIコールの場合の予想される効用は何でしょうか?LLMは、これらの質問に答えることはできません。なぜなら、歴史的なトレースは、野生の環境では見つからず、LLMのトレーニングデータにも含まれないからです。また、特定のツールとデータ環境に依存するため、LLMが一般的な知識を獲得することはできません。さらに、LLMが予想される効用とコストを予測できたとしても、最も効果的な行動計画を選択するための論理的な決定理論的推論は、LLMの次のトークンの予測によって実行されることはありません。

では、AI計画技術の欠けている要素は何でしょうか?タスクとツールおよびデータ環境に特化した代替の行動計画と対応する効用とコストの確率を明示的にモデル化することができるプランナー模型が必要です。行動計画と確率について推論することができるプラン定義言語(PDL)が必要です。PDLで定義された計画を決定的にかつ効率的に実行することができる実行エンジンが必要です。

いくつかの人々は、すでにこの約束を実現するために努力しています。そうなるまで、静的な連鎖を構築し続けてください。ただし、それらを「エージェント」と呼ぶことは止めてください。

アムノンは2017年にAI21に入社し、同社でさまざまな製品リーダーシップ役割を担っています。AI21に入社する前は、イスラエル地域イニシアチブNGOで国際活動マネージャーとして働きました。アムノンはテルアビブ大学(ラウトマン・インターディシプリンアリー・プログラム・フォー・アウトスタンディング・スタッフ)で法学、経済学、歴史学、哲学を学びました。また、イスラエル信号インテリジェンス国立ユニット(8200)のセクションコマンダーを務め、テルアビブ大学とハーバード法学校から2つの法学修士(LLM)を取得しています。