オピニオン

Jev と AI エージェントの新しい意思決定レイヤー

mm
Unite.AI を Google の優先ソースに追加

System One モデルが高速な判断と低速な推論を分離できる理由

多くの AI エージェントは、ほぼすべての意思決定に言語モデルを利用しています。言語モデルはツールを選択し、結果を評価し、継続が必要か判断し、最終的に回答を生成します。柔軟性がありますが、規模ではい/いいえの判断を繰り返すとコストがかかることがあります。 Unite.AI は以前、エージェント型ワークフローがモデル呼び出し、コンテキスト、リトライを増加させることについて議論しました. 追加の意思決定ごとに、ユーザーに有用な情報を提供する前に時間とコストが増加する可能性があります。

Jev はタスクの分割方法を変えることを提案します。回答集合が定義された限定的判断用に構築されたモデルを利用します。オープンエンドの推論と自然言語のために生成モデルを利用します。Jev は、ここでの主な考えはすべてのエージェントが新しい製品を購入する必要があるということではない、と示唆しています。重要な概念は、エージェントはすべての段階で同じタイプのインテリジェンスを必要としないということです。

Jev が実際に行うこと

TypeSafe は 2026年9月に Jev をリリースしました, それは彼らの新しい System One モデルの最初です。Jev は文章を書き出しません。代わりに、状態(サポートメッセージやユーザーデータなど)を送ります。事前に定義された回答タイプを持つ1つ以上の質問も送ります。その後、Jev は型付けされた回答と確率で応答します。

によると、公式ドキュメント、判断を行うための3つのプリミティブがあります:

  • Choice 事前定義されたオプションから選択できます。
  • Score 順序付けられたルーブリックに基づいて評価できます。
  • Noul 文が真である確率を推定します。

同一の状態に対して、1つのリクエスト内で複数の独立した質問を行うことができます。

例えば、顧客サービスの問題に対応しているとします。システムはどのチームがこのケースを処理すべきかを判断したいかもしれません。また、対応の速さを決定し、顧客が返金を要求したかどうかを確認することもあります。

チャットモデルは潜在的にこれら3つのタスクすべてを実行できるかもしれません。しかし、結果を構造化されたレスポンスとしてアプリに返す必要があります。対照的に、Jev は限定的な判断のみを提供します。アプリはそれらの判断に基づいて次に取るべきアクションを決定します。

アーキテクチャのシフトはモデル以上に重要です

これらの議論の大半は大規模モデルと小規模モデルを比較します。Jev は代替的な境界を提案します。いくつかのステップは言語生成を伴い、他はソフトウェアが利用できる狭い判断です。

これによりエージェントに意思決定レイヤーが作成されます。モデルは推定を行います。ソフトウェアはポリシーを適用します。推定確率がテスト済みの閾値を超え、かつアクションが低リスクで可逆的であれば、ワークフローは継続できます。結果に不確実性がある場合や、アクションが重大な影響を及ぼす可能性がある場合、システムは人的監視を求めることができます。推論モデルは不確実性の調査に役立つかもしれませんが、必要な人的承認の代替にはなりません。

図 1. 限定的な意思決定パスは、閾値、権限、エスカレーションをコード内に保持します。

モデルルーティングと類似点はありますが、重要な違いがあります。 RouteLLMは、どちらの言語モデルを選択するかについて決定します。品質と価格のバランスを取るために、より強力なモデルとより弱いモデルの間で選択します。System One モデルはコードが直接使用できる限定的な判断を生成します。これらの判断は、モデルルーティングだけでなく、エージェント内の他の意思決定も支援できます。

エージェントループが自然に適合する理由

エージェントループの特性は、極めて細かいレベルで多数の判断を行うのに特に適しています。これらの判断は最終的な出力に到達するのに役立ちます。言い換えれば、ユーザーが質問やリクエストを送信した後、エージェントは多数の「小さな」判断を行わなければなりません。これらの判断は回答や出力が返される前に行われます。

例として、使用するツールの決定、取得したレコードのランク付け、リスクの評価があります。システムは証拠が十分にあるか、プロセスを継続すべきかも判断します。これらはほぼ繰り返し発生するでしょう。また、各ループ間の遅延は時間とともに蓄積する可能性があります。

このエージェントループの役割はLangChain の Jev 統合で例示されます。ここで Jev はモデルルーティングとツール呼び出しチェックの両方を実行できます。Jev は生成モデルの周辺に統合されますが、生成モデル自体は引き続き計画とコンテンツ生成を行います。これは Jev にとってははるかに現実的なユースケースを表します。汎用言語モデルを置き換えるのではなく、補完します。

さらに、質問を並列化することで、チームがタスクの分解方法を考える姿勢も変わります。具体的には、チームは曖昧な指示を複数の離散した評価質問に分割できるようになります。これにより、モデル呼び出しのシーケンスがはるかに短くなる可能性があります。評価が格段に容易になるワークフローを作成できます。また、開発者は明示的なビジネスロジックを用いて、得られた判断を組み合わせることが可能になります。

汎用言語モデルは構造化された出力を生成でき、場合によってはより適した選択肢となり得ます。例えば、判定と説明を同時に提供する必要があることがあります。したがって、Jev は単なるスキーマ遵守以上の実証が求められ、効果的と見なされるためにはそれを示さなければなりません。

Jev の有効性は、全体的なシステムレイテンシの削減を実現できるかに依存します。また、有用な確率推定を生成し、さまざまな入力に対してパフォーマンスの安定性を示すことも必要です。Jev がこれらの利点を提供できない場合、別のモデルを選択すると、開発および運用の負荷が余計に増えるだけです。

Typedは正確を意味するか?

Jev に関する主張を行う際に使用する言語も慎重に選ぶ必要があります。出力空間が事前に定義されているため、モデルは架空のフィールドや解析不能な段落を返すべきではありません。これにより一つの失敗形態は排除されますが、意味的エラーは排除されません。システムが誤った部門を返したり、誤ったリスクレベルを割り当てたり、過度の確実性を示したりすることを防ぐものは何もありません。これらすべてを、完全に型安全である状態で実行できます。

TypeSafe の独自の System One ドキュメンテーションは重要な区別を示しています。キャリブレーションは予測のグループ全体で測定され、個々の予測の正確性を保証するものではありません。実運用ではこれが意味するところがあります。チームは自らのデータで、予測確率が観測結果と一致しているかをテストする必要があります。

パフォーマンス証拠はまだ初期段階

TypeSafeは応答時間が70〜500ミリ秒であると報告しています. また、内部ワークフロー評価において大幅なコスト削減と速度向上があったことも言及しています。さらに、TypeSafeはこれらの顕著な改善が実際の環境での効果の上限に近い可能性が高いと示しています。TypeSafeの 公開されているワークフローテストは、実際のラベルではなく他の最先端モデルが提供する参照確率を使用しています。結果は仮説形成に有用です。結果は実際のワークロードに対する独立したテストの代替にはなりません。

導入前の実践的テスト

AI 搭載の意思決定ワークフローを初めて構築する際は、最も重要な意思決定(例:医療承認やアカウント停止)を選ばないでください。その代わり、非常に一般的で、取り消し可能で、チームの他のメンバーが容易にレビューできるものを選びます。具体例としては、チケットの振り分け、文書の分類、モデルの選択、低リスクの品質保証などが含まれますが、これらに限られません。

4つの質問が、この取り組みが機能するかどうかを判断するのに役立ちます。

  • 出力に有限の回答数があるか?
  • 判断基準を明確に説明できるか?
  • 測定可能な結果があるか?予測、その確率、アクション、そしてその後の結果を追跡します。予測確率と観測結果を比較して、キャリブレーションを定期的にチェックします。
  • 自動意思決定プロセスが失敗した場合の代替プランはあるか?推論モデルを使用すべき具体的なタイミングを特定し、追加情報を求めるか、人間を介入させるかを決定します。

分析にはワークフロー全体、意思決定プロセスを含めるべきです。意思決定精度、保留またはエスカレーション率、エンドツーエンドの総処理時間、タスク1件あたりのコスト、ミスの影響などの指標を使用します。逆境条件下でテストを実施してください:語彙の変化、関連データの欠落、稀なカテゴリ、敵対的入力など。下流で追加コストを生む最適化された分類器は、最適化とは言えません。

ここから得られる長期的教訓

Jev が成功したり、著しく変化したり、急速に置き換えられたりした場合でも、変わらないものがあります。アーキテクチャ上の問いです。すべての機械ベースの意思決定を生成言語で表現する必要があるのでしょうか?

多くの場合、答えは「いいえ」です。実運用環境では、生成モデルを用いるシステムが解釈、計画、説明を生成できます。境界付き意思決定モデルを使用すれば、同じシステムはルーティング、スコア付け、ゲート処理が可能です。コードは許容閾値や権限を引き続き規定できます。人間は他者の生活に影響を与える意思決定に対して責任を持ち続けるべきです。

これは、すべてのタスクを信頼性高く実行させる単一の自律モデルを持つという劇的な見方よりも控えめな視点ですが、信頼できるシステムがどのように構築されるかを示しています。エージェントの次なる性能向上は、システム内で思考に時間がかかる領域を選択することに依存するかもしれません。他の領域は迅速な意思決定が必要であり、ある領域はまったくアクションを必要としません。

ヒマンシュ・ゴエルは、バイオメディカル、金融、規制文書ワークフローなどのハイステークス・ドメイン向けのリトリーバル増強生成を専門とするAI/ML研究者です。