ソートリーダー

私が人間の専門家のように判断するAIシステムに知識を転送した方法

mm
Unite.AI を Google の優先ソースに追加
A human expert in a technical control room teaching an AI system to make complex decisions through a holographic interface.

マイクロソフトを辞めた後、企業のAI導入に取り組み続けていると、多くのAIシステムが真正の人間の判断力を持って決定を下すことができないことがわかりました。確かに、彼らは文章を書き、要約し、決定のように聞こえる驚くほど流暢な文章を生成することができます。しかし、これらのシステムを実際の運用環境に投入すると、トレードオフ、不確実性、不完全な指示、実際の結果が生じる場所で、すぐに苦労することになります。これは、MIT Project NANDAのデータと一致しています。60%の組織がAIツールを評価しましたが、20%のみがパイロット段階に達し、5%のみが本稼働に達しました。つまり、業界は実際のワークフロー内で持続できるシステムを構築するのに苦労しています。

企業環境、特にサプライチェーン、製造、運用などの分野では、答えを得ることは難しくありません。信頼できる答え、最も重要な変数、間違った場合にどのようなことが起こるかを判断することが難しいのです。私の目に、これは専門知識と判断の問題です。

明確に述べると、AIは出力の質を向上させるという点で驚くべき進歩を遂げてきました。しかし、出力の質が良くても、必ずしも決定が良くなるわけではありません。これらは異なる目標であり、業界はこれらを交換可能なものとして扱ってきました。

専門知識と判断力の欠如が、私が人間の専門家が複雑な決定を下す方法を教えるAIを構築することに興味を持った理由です。AIはタスクの自動化だけでなく、人間の判断力を安全にAIに転送することについても考えるべきです。

大規模言語モデル(LLM)は決定者のように話すが、実際にはそうではない

大規模言語モデルは有用ですが、デフォルトでは決定システムではありません。言語でラップされた予測システムです。言語は説得力があるため、これが問題の一部です。システムが自分自身を流暢に説明できる場合、我々はその理解を過大評価しやすいです。ビジネス上の質問をすると、トレードオフ、条件、まとまりのある要約を付けた構造化された答えを返しますが、それは実際の能力よりも賢く聞こえます。論理的に整合していることと、運用上の能力があることとは異なることです。これが、企業のAIが壊れる理由の一つです。モデルは、決定が良いか悪いかを判断することなく、決定の良し悪しを教えることができます。これが、多くの組織が実験を超えて進むのに苦労する理由の一つです。ガートナーによると、生成AIプロジェクトの少なくとも50%が概念実証の後、実際の運用への影響を与える前に放棄されています、これは、価値とリスク管理が不明確であることが原因です。

情報は専門知識と同じではない

AIのトラップの一つは、システムが十分な情報を持っていれば、専門家のように動作できるという仮定です。妥当な考えのように思えますが、日常生活で考えてみると、あることについての情報を増やすと、自動的に専門家になるわけではありません。航空のマニュアルをすべて読んでも、飛行機を着陸させる準備はできません。サプライチェーンのベストプラクティスをすべて暗記しても、3つのことが同時に間違っているときにフリーズしてしまいます。

私は続けることができますが、ポイントは、情報が必ずしも能力を意味するわけではないことです。能力は経験から来ます。具体的には、答えが明らかでない混沌とした状況に繰り返し触れることで、決定能力が身につきます。

毎日、私は今日の多くのAIシステムが静的な例に基づいてトレーニングされていることを確認しています。これは予測を行うには役立ちますが、決定の一部にすぎません。企業はデータが不足しているのではなく、練習のための構造化された環境が必要です。つまり、システムが:

  • 現実的なシナリオに遭遇する
  • 選択を行う
  • 結果を見る
  • フィードバックを受ける
  • 時間の経過とともに改善する

AIは予測アルゴリズムを使用してトレーニングできますが、そのアプローチには限界があります。次に必要なのは、人間の監督の下でシミュレートされた環境でAIをトレーニングすることです。これをマシンテーチングと呼びます。複雑な決定をシナリオとスキルに分解し、人間の専門家がAIを教えるためのガイドを提供します。結果として得られるフィードバックと試行錯誤により、エージェントは現実世界の自律性を身につけ、人間によって構築されたプロセスから直接学習し、行動することができます。

AIをモノリシックなものとして扱うのを止める

見られる別の間違いは、一つの大きなモデルがすべてを行うべきであるという仮定です。バスケットボールチームは一人の選手だけで構成されません。工場は一人の個人が運営しています。複雑なシステムは、異なるコンポーネントが異なる役割を果たし、それらをまとめる構造があるため機能します。

AIも同様に構築されるべきです。企業の意思決定の将来は、一つの巨大なモデルが会社の中央で万能的に動作するのではなく、専門化されたエージェントのチームであると思います。

一つのエージェントはデータの取得に専門化しています。別のエージェントはシナリオの評価に優れています。別のエージェントは計画を担当します。別のエージェントはコンプライアンスをチェックしたり矛盾を発見したりします。別のエージェントは上司のように動作し、エスカレーションを決定したり、信頼性が低すぎて進めない場合に判断します。チームアーキテクチャは、実際の組織がどのように機能するか、より広範な市場のトレンドに合致するため、私にはより多くの意味があります。マッキンゼーの調査によると、企業はAIの周りにワークフローと運用構造を再設計することで、最も価値を得ています。

すべての決定は同じ方法で行われるわけではありません。多くの場合、同じモデル、同じデータ、同じ推論タイプがすべての決定に適しているという仮定をします。実際には、異なる決定には異なるメカニズムが必要です。

決定が実際に行われる4つの方法

私の経験によると、多くの決定はいくつかのカテゴリに分類できます。

  1. 制御システム(ルールと式): 決定は、既知の入力に事前に定義された方程式やルールを適用することによって行われます。如果Xが起こるなら、Yを行う。
  2. 検索と最適化: 決定は、多くの可能な選択肢を評価し、定義された目的関数に基づいて最良のものを選択することによって行われます。
  3. 強化学習(試行錯誤): 決定は、行動をとり、結果を観察し、報酬または罰に基づいて調整することによって時間の経過とともに学習されます。
  4. 練習と経験(人間のような学習): 決定は、現実のシナリオでの繰り返しへの露出、ガイドされたフィードバック、蓄積された判断を通じて形作られます。

多くの企業のAIは最初の2つのカテゴリでうまく機能します。3つ目と4つ目のカテゴリはAIにとってより課題があります。そこには人間のような判断が存在します。

構造のない自律性はリスク

自律的なAIについて話すとき、会話は二つの極端な意見に分かれます。一方は、これらのシステムがほぼ魔法で、すべてを実行する準備ができていると考えています。他方は、これらのシステムが重要なものについては決して信頼されるべきではないと考えています。

私はどちらの見方も役に立たないと思います。構造の中での自律性に焦点を当てるべきです。監督、エスカレーションロジック、境界、説明責任のない自律性が、リスクの主な原因です。リスクに関する懸念は、国立標準技術研究所のAIリスク管理フレームワークなどの取り組みによって形作られる会話でも現れています。これは、組織が監督、説明責任、運用上の信頼性に関する質問をどれほど深刻に受け止めているかを反映しています。

企業のAIの将来は、エージェントのチームにあります。AIから最も価値を得る組織は、最も多くの単語を自動化するのではなく、実際の専門知識をシステムに転送し、環境が混沌とした場合でも持続できるようにする方法を理解することです。那が、私の見解では、印象的なAIと真正に有用なAI、実際のROIを生み出すAIの違いです。

ケンス・アンダーソンは、AMESAの創設者兼CEOであり、以前はマイクロソフトのAutonomous AI Adoptionディレクターでした。彼は、シミュレーション、フィードバック、トライアル・アンド・エラーを通じてAIエージェントが現実世界での自律性を発展させることを可能にする「マシン・ティーチング」と呼ばれる手法の共同創設者です。過去7年間、ケンスは、製造業と物流業向けの知的自律エージェントの設計、構築、展開に専念し、シェル、ペプシコ、デルタ航空など主要企業向けに200以上の現場での導入を主導しました。彼はまた、Designing Autonomous AI(O'Reilly、2022)の著者であり、現在、企業の運用で百万ドル規模の決定を下すためのAIエージェントのオーケストレーションを可能にする水平プラットフォームを開発中です。