ソートリーダー

AIエージェントは作業を実行できるが、企業はそれらを運用できるか?

mm
Unite.AI を Google の優先ソースに追加

AIエージェントはタスクを完了する能力が驚くほど向上しています。エージェントに目標、適切なツールへのアクセス、十分なコンテキスト、そして明確に定義されたワークフローを与えると、情報の調査、文書の分析、意思決定、システムの更新、他のエージェントとの調整が可能になります。

これがエージェントAIの魅力的な部分です。また、デモでよく目にする部分でもあります。

エンタープライズの業務は異なる様相を呈します。ローン申請が審査の途中で変更されることがあります。顧客が検証完了後に新たな情報を提供します。二つのシステムが同じ口座について意見が合わないことがあります。昨日まで有効だった承認が本日には無効になることがあります。エージェントがケースを要約して別のエージェントに渡す際、些細な詳細がプロセス上で失われてしまうことがあります。

エージェントが行うべき作業のうち、順調に進むパスは約80%を占めるかもしれません。エンタープライズは残りの20%の中で運用されています。

80/20の枠組みは業界統計ではありません。運用上の複雑性が潜む場所を示す手法です。エンタープライズ業務の難しい部分は、通常ケースではなく、例外や引き継ぎ、依存関係、変化するコンテキスト、そして組織が結果に対して責任を負う意思決定にあります。

AIが質問への回答から実際の行動へと移行するにつれて、この運用上の複雑性はさらに重要になります。エンタープライズはエージェントの構築方法だけでなく、運用方法についても考える必要があります。

そこがAgentic Operationsの始まりです。

回答の生成から行動への移行

エンタープライズ向けジェネレーティブAIの最初の波は主に情報に関するものでした。モデルは文書を要約し、レポートを生成し、質問に回答し、企業内ナレッジを検索し、従業員が既存のタスクをより速く完了できるよう支援しました。

エージェントは根本的に異なるものをもたらします。ビジネスプロセスの状態を変える行動を取ることができます。エージェントは何かを承認または却下し、記録システムを更新し、顧客へのコミュニケーションを送信し、別のワークフローをトリガーし、別のエージェントを呼び出す、あるいは次に何が起こるかを決定する意思決定を行うことができます。

OpenAIは実用ガイドでエージェントを説明していますそれらはユーザーに代わってタスクを独立して実行するシステムであり、モデルを用いてワークフロー実行を管理し、ツールで外部システムとやり取りします。誤った回答の運用上の影響は、誤った行動の影響とは大きく異なります。

したがって、エンタープライズの課題は変わります。モデルが良い回答を生成したか、エージェントが割り当てられたタスクを成功裏に完了したかを問うだけでは不十分です。エンタープライズは、ビジネスコンテキスト、ポリシー、権限、そしてプロセスの前段階で起こったすべてを考慮し、行動がそもそも実行すべきだったかどうかをますます知る必要があります。

図1:生成AIは出力を生成します。エージェントAIはビジネス状態を変化させます。

AIがビジネスの状態を変え、以降の意思決定に影響を与えるようになると、信頼性はもはやモデルレベルだけで測定できなくなります。

ビジネスプロセスが失敗してもエージェントは成功できる

AI搭載のローン審査ワークフローを考えてみましょう。あるエージェントが申請書類を抽出し、別のエージェントが収入を検証し、さらに別のエージェントが信用情報を評価し、後続のエージェントがケースを要約してから、審査エージェントが意思決定を行うまたは推奨します。

各エージェントには明確に定義された責任があり、その責任を正しく遂行できます。文書エージェントは適切な情報を抽出できます。収入検証エージェントはタスクを成功裏に完了できます。要約エージェントは利用可能な情報の正確なサマリーを作成できます。審査エージェントは指示通りに正しく実行できます。

最終的なビジネス判断は依然として誤りです。

初回の検証後に更新された収入情報が届くと想像してください。新しい文書は処理されますが、次のステップのためにケースが要約される際にその重要性は低下します。最終的な審査エージェントは妥当な要約を受け取りますが、プロセス全体にわたって存在した完全なビジネスコンテキストは得られません。

何も必ずしもクラッシュしたわけではありません。APIが失敗したわけでもありません。個々のエージェントが必ずしも幻覚を起こしたわけでもありません。すべてのコンポーネントが正常に実行されたと報告しても、ビジネスプロセスが誤った結果に至ることがあります。

Anthropicは効果的なエージェント構築に関するガイダンスで関連する課題について論じています、自律システムはステップが増えるにつれてエラーが累積する可能性があることを指摘しています。問題はモデルの精度を超えて、状態、コンテキスト、意思決定、前提がワークフロー全体に渡って変化することに広がります。

これにより重要な区別が生まれます:エージェントの信頼性とビジネスプロセスの信頼性。エンタープライズが最終的に体験するのは個々のエージェントではなく、完全なプロセスが生み出す結果です。

図2:ローカルでの成功がビジネスの成功を保証するわけではない

これはエージェントAIがもたらす重要な変化のひとつです。各コンポーネントが個別に検査すると正常に見えても、ワークフローは失敗することがあります。

能力は権限と同等ではない

現在のエージェントスタックの多くは、能力に焦点を当てているのは理解できる。チームは、エージェントが推論できるか、適切なツールを選択できるか、タスクを完了できるか、エラーから回復できるか、許容できる精度とレイテンシで動作できるかを知りたい。

企業には別の要件があります:権限です。

例えば、与信審査エージェントがローンを承認できるとします。これは、評価できるすべてのローンを承認すべきだという意味ではありません。その権限は、ローン額、リスクカテゴリ、顧客タイプ、利用可能な証拠、信頼度、過去の決定、あるいは以前の審査後に申請内容が変更されたかどうかに依存する可能性があります。

これはエージェントが できること とエージェントが 許可されていることの間に境界を作ります。

OpenAIは、エージェントツールに関連するリスクを評価し、機密かつ不可逆的な操作に対して保護策や人的介入を追加することを推奨しています。 Microsoftはエージェントが運用するコアビジネスプロセスに関するガイダンスで同様のアプローチを取っています。エージェントは定義された境界内で日常的な意思決定を行うことができ、意思決定権がどのアクションを独立して実行でき、どのアクションが人的承認を必要とするかを決定します。

エージェントの能力が向上するにつれて、この区別はむしろ重要になってきます。より高性能なエージェントは、より重大な行動を取ることができるため、企業はそれらの行動が許容される境界を明確に定義し、強制する方法を必要とします。

質問は エージェントはこれをできるか?から どのような条件下でエージェントにこれを許可すべきか?

ビジネスポリシーは実行に近づく必要がある

企業はすでに人が操作するプロセスを管理するための広範な仕組みを持っています。SOP、承認マトリックス、コンプライアンスポリシー、リスク閾値、トレーニング、職務分離、監査、エスカレーション手順などを使用しています。これらの多くは、単純な前提――人が規則を読み、状況を理解し、作業を行いながら規則を適用する――に基づいて設計されました。

エージェントはその前提を変えます。

一定の閾値を超える取引に二次承認を要求するポリシーを考えてみてください。人がそのタスクを実行する場合、ポリシーはトレーニングやワークフロー制御で支えられた文書として存在します。エージェントが数百から数千のアクションを迅速に実行できる場合、その文書の存在だけではポリシーに違反する行動を防げません。

文書化されたポリシーとビジネスアクションの間のどこかで、ポリシーは実行可能な形に変わる必要があります。

これはすべてのポリシーが決定論的なコードになる必要があるという意味ではありません。制御の中には決定論的なものもあれば、意味的解釈が必要なもの、リスクや信頼度に依存するもの、そして引き続き人的判断が必要なものがあります。より大きなアーキテクチャ上の変化は、ビジネスポリシーが実行経路により近づき始めることです。

AWSは金融サービスにおけるエージェントAIの文脈でこの点を特に指摘しています。これにはエージェントの行動に対するポリシーベースの検証や、重要な活動に関する監査トレイルの必要性が含まれます。

従来、組織は実行前に多くのガバナンス要件を定義し、後で監査やレビューを通じてコンプライアンスを検証できました。自律システムが継続的に、かつ機械速度で動作する場合、いくつかの制御はプロセスが実行中に機能する必要があります。

ヒューマン・イン・ザ・ループは必要だが、運用モデルではない

AIワークフローにおける不確実性への最も一般的な対応は、ヒューマン・イン・ザ・ループを導入することです。特に重要な意思決定においては理にかなっていますが、人的レビューをすべての例外への答えとみなすと問題が生じます。

エージェント主導のオペレーションが数千から数百万の意思決定を処理すると想像してください。すべての異常事態、低信頼度の結果、ポリシーの曖昧さ、例外が人に回されると、組織はオペレーション上のボトルネックを取り除いたわけではありません。単にボトルネックがレビューキューに移っただけです。時間が経つにつれ、人的が過剰に日常的な決定を承認するようになると、人的監視自体の意味が薄れてしまうという別の問題も生じます。

人間は依然として不可欠ですが、その役割は変わる必要があります。すべての決定をレビューするのではなく、判断が実際に必要な状況、エージェントの権限に達したケース、またはシステムが独立して解決すべきでない条件に直面したケースに集中すべきです。

したがって、スケーラブルな運用モデルはリスクスコアリングや人的レビューだけに依存することはできません。エージェントのアクションがビジネスアクションになる前に、システムは現在のビジネスコンテキスト、関連するポリシー、エージェントの権限、そしてワークフローで既に起こったことを考慮する必要があります。その結果として、継続する、追加の証拠を要求する、アクションを保留する、あるいは意思決定を人間にエスカレーションする、という選択肢が考えられます。

図 3: 人的レビューがランタイム制御の一つの結果になる

これにより人的監視の役割が変わります。人間はもはやデフォルトであらゆる不確実なステップに挿入されるわけではなく、ビジネスコンテキスト、ポリシー、権限、またはアクションの結果が判断を要する場合にのみ、人的介入が一つの可能な結果となります。

この区別はエンタープライズ規模で重要です。ポリシーと権限の範囲内で明らかに許容されるアクションは自動的に進行すべきです。必要な証拠が不足している、あるいはビジネス状態が変化した場合は一時停止すべきです。意思決定が組織が意図的に人に委ねている境界を超えた場合はエスカレーションすべきです。

目的は人間をループから排除することではありません。人間を適切なループに配置し、ルーティンな意思決定を明確に定義された境界内で進行させることです。エージェントシステムがスケールするにつれ、人間の監視の質は、レビューする意思決定の数よりも、オペレーティングシステムが人間の判断が実際に重要となる意思決定を特定できるかどうかに依存するようになります。

可観測性は必要だが、見えるだけでは制御できない

業界はAIの可観測性において大きな進展を遂げました。チームはプロンプト、モデルの応答、トレース、ツール呼び出し、レイテンシ、トークン使用量、そしてエージェントが結果を生成するまでにたどった全軌跡を検査できるようになっています。

この可視性は不可欠です。 OpenAI のエージェント安全性と評価に関するガイダンスは、エージェントの行動を理解するための評価やトレース評価といった手法も強調しています。

しかし、可視性だけでは運用上の問題は解決しません。

たとえば、ある保険引受エージェントが先週、承認ポリシーに違反した回数が2,700回だったとします。これは優れた可観測性を示す一方で、運用が極めて悪いことを意味します。

重要なビジネスプロセスにおいて、企業はエージェントの行動を理解するだけでなく、プロセスが実行中である間に対応できる能力も最終的に必要となります。

図 4: 運用制御ループ

可観測性はエージェントが何をしたかを答えます。エージェント運用はさらにエージェントが継続すべきかどうかを答える必要があります。

この区別は、アクションが高コストで、結果が重大で、取り消しが困難、あるいは多数の下流決定に影響を与える可能性がある場合に特に重要です。

最も困難な失敗はエージェント間で起こり得る

企業がマルチエージェントや長時間実行されるワークフローに移行するにつれて、別の課題が顕在化します。多くのビジネスポリシーは単一のアクションに局所的ではありません。

たとえば、意思決定の連続にわたる総金融エクスポージャーを制限するポリシーを考えてみましょう。個々の取引は許容閾値未満であっても、累積エクスポージャーがそれを超えることがあります。各アクションを個別に見るだけでは違反は検出できません。

同様の問題は権限にも現れます。エージェントは情報収集は許可されていても最終決定はできない場合があります。いくつかのハンドオフの後、下流エージェントが情報を受け取っても、元のタスクに付随していた権限制限を保持していないことがあります。各ステップは合理的に見えても、全体のシーケンスは意図されたビジネスプロセスに違反していることがあります。

コンテキストも同様の問題を引き起こします。ワークフローの最初の段階で重要だった情報が、数ステップ後に要約、変換、あるいは省略されることがあります。下流エージェントはもはやその情報を持たないため、正しく推論できても正しい結論に至れません。

これらの失敗は、信頼性の単位を拡大する必要があることを示唆しています。

私たちは、モデルの応答が正しいかどうかを問うことで評価を続けます。エージェントがタスクを正しく完了したかどうかを問うことでエージェントを評価します。しかし、ワークフローのレベルでは、情報、権限、ポリシーが一連のアクションを通じて維持されたかどうかが問題になります。ビジネスレベルでは、最終結果が正しくかつ許可されたものであるかが問題になります。

これは、 NIST AIリスク管理フレームワークにおけるより広範なライフサイクル視点とも一致しており、AIリスクの継続的な測定と管理を強調し、導入前の一回限りの評価として扱わないことを示しています。

ここからエージェント運用が始まります

AIガバナンス、モデル評価、LLMOps、可観測性、セキュリティ、そして責任あるAIは、すでにAIシステムの運用における重要な部分に対処しています。エージェントオペレーションはこれらの分野に取って代わるものではありません。自律的および半自律的なシステムがビジネスプロセスに直接関与し始めたときに重要になる運用層に取り組みます。

エージェントオペレーションとは、実際のビジネスプロセス内で自律的および半自律的なAIシステムを運用する学問であり、実行中に権限、コンテキスト、意思決定、例外、人間の介入、そして説明責任がどのように管理されるかを含みます。

この区別が重要なのは、管理対象がもはや単なるモデルではなくなるからです。ソフトウェアが独立して意思決定や行動を行える継続的なビジネスプロセスなのです。

実際には、これにより別の運用上の質問が生じます。エージェントに許可されている行動は何か?長期間にわたるワークフロー全体で保持すべきビジネスコンテキストは何か?新たな証拠が以前の決定を無効にした場合、どうなるか?個々に許容できる行動が集合的にポリシーに違反していることを組織はどのように検知できるか?エージェントはいつ継続し、いつ一時停止、停止、またはエスカレーションすべきか?数か月後に、組織は特定の決定がなされた理由を再構築できるでしょうか?

所有権の問題もあります。エージェントが技術的なタスクを正しく実行してもビジネス結果が誤っている場合、失敗の責任は誰にあるのでしょうか?エージェントに実行を委任しても、組織の説明責任が委譲されるわけではありません。

エージェントが作業を実行することはあっても、結果の所有権は企業に残ります。

目標は制御された自律性です

エージェントAIの未来は、しばしば完全な自律性への進展として描かれ、人間がビジネスワークフローから徐々に姿を消すとされています。多くの企業にとって、それはおそらく誤った目標です。

より有用な目標は 制御された自律性。

現在の多くのAI支援プロセスは、エージェントが行動を提案し、人が最終決定を下すというパターンに従っています。信頼が高まるにつれ、いくつかのワークフローではエージェントが定義された権限内で意思決定を行い、周囲のシステムが実行を監督し、人間が例外を処理するようになります。成熟した低リスクのワークフローでは、最終的にエージェントが独立して判断・行動できるようになる一方で、重要な決定は引き続き監視・記録されます。

図5:自律性のレベル上昇

適切な境界はプロセスごとに異なります。銀行は文書分類においてかなりの自律性を許可しつつ、信用決定に関しては厳格な管理を要求するかもしれません。保険会社は日常的な請求処理を自動化し、異常な証拠の組み合わせはエスカレーションするでしょう。医療機関はエージェントに情報の収集と要約を任せ、重要な決定は人間が行うようにするかもしれません。

したがって重要な質問は、エージェントがどれだけ自律的になれるかではなく、組織がどれだけの自律性を責任を持って運用できるかです。

これによりコントロールの役割も変わります。コントロールは必ずしも自律性を削減する手段ではありません。適切に実施すれば、組織はより自信を持って自律性を拡大できるようになります。

エージェントの運用は構築よりも難しくなる可能性がある

モデルは引き続き改善されます。ツールの活用も向上し、エージェントフレームワークも進化します。推論能力も向上し、現在困難に見える多くの課題は最終的に日常的なものとなるでしょう。

しかし、優れたモデルであってもビジネスポリシー、変化するコンテキスト、例外、組織の境界、説明責任を排除することはできません。むしろ、より優れたエージェントはこれらの問題をより重要にします。自律的に行動できないシステムは運用権限が限定的です。数千件のビジネス決定を実行できるシステムは、全く異なる責任を伴います。

このため、エンタープライズAIの次のフェーズは、どの組織が最も多くのエージェントを展開するかでは決まらないかもしれません。むしろ、エージェントの運用方法を学んだ組織が決定的になるでしょう。

最初の80%はエージェントが機能することを示し、残りの20%が企業がビジネスに対してそれを信頼できるかどうかを決定します。

エージェントがより高性能になるにつれ、企業を定義する質問は我々のエージェントは何ができるかから、より難しいものへと変わる可能性があります:

我々はどのような条件下でエージェントに何をさせることを許容し、条件が変化したときにそれをどのように把握するのでしょうか?

そこがエージェントオペレーションが始まる地点です。

Rajesh GuptaはAI製品および技術リーダーで、元AppleおよびQualcommの実務家、2度目の創業者です。彼は機械学習、エンタープライズAI、エージェントAIの分野で15年以上にわたり活動しており、現在はエージェントビジネスオペレーションの実行時制御に焦点を当てたRunCtrl AIの構築に取り組んでいます。