ソートリーダー

企業のAIがデプロイ後に壊れる理由と対策

mm
Unite.AI を Google の優先ソースに追加

警告:問題はモデルではない

2023年、ニューヨーク市は、MyCityチャットボットを立ち上げました。これは、企業が複雑な規制をナビゲートするのを助けるために設計されました。アイデアはシンプルでした:法的情報にアクセスしやすくすること。

実践では、システムは間違った答えを生み出し、法的にも誤解を招くものでした。チップの規則から住宅差別まで、支払い規則まで。

後日の監査では、71.4%のユーザーフィードバックが否定的であることがわかりました。根本的な問題を修正するのではなく、免責事項を追加することになりました。チャットボットは2年以上「ベータ」版のままだった後、停止されました。

失敗は技術的なものではありませんでした。システムは、精度を確保するメカニズムがなく、明確な責任がなく、問題が発生したときに介入する方法がなかったため、生産で壊れました。

これは、今日の企業AIの背後にあるパターンです:テクノロジーは機能しますが、組織はそれを信頼性高く運用する準備ができていません。

パイロットから生産まで:すべてが壊れる場所

パイロットを構築することは比較的簡単です。ユースケースを選択し、モデルを選択し、データを準備し、スポンサーを見つけます。システムを生産環境で実行することは、まったく別のレベルです。

ギャップは、プールに飛び込むことと、2012年にフェリックス・バウムガルトナーが行ったストラトスフィアからの飛び込みの違いです。基本的な物理学は同じですが、条件は完全に異なります。失敗の結果も異なります。

生産環境では、AIは実際の意思決定フローに参加し、顧客とやり取りし、法的および運用上の結果を生み出します。那がギャップが現れる場所です。モデルではなく、どのように管理されているかです。

ヨーロッパでは、これが他の地域よりも早く明らかになります。EU AI法、GDPR、NIS2などの規制は、採用を遅くしません。組織がAIシステムを実際の制約の下で運用できるかどうかを明らかにします。

2025年、55%のEUの大企業はすでにAIを使用していました。採用はすでに大規模に行われています。課題は、デプロイ後に何が起こるかです。

その時点で、基本的な運用上の質問が浮かび上がります。誰がAIの出力と自律的な決定に責任がありますか?システムが予期せぬ方法で動作したときに何が起こりますか?誰がそれをメディアに届ける前にキャッチしますか?

責任は会社にあり、テクノロジーにはありません。 エア・カナダのチャットボットは、顧客に不正確な情報を提供しました。顧客はそれに頼り、後で払い戻しを拒否されました。審判は、航空会社が責任があると判断しました。チャットボットは別のエンティティではありませんでした。

同じ問題、異なる角度:マクドナルドのMcHireシステムは、約64,000人の応募者から機密情報を公開しました。原因は、複雑な攻撃ではなく、管理者ログインが「admin」と「123456」を使用していたためでした。システムは高度に見えましたが、失敗は基本的なものでした。

システムがすでに稼働している場合、管理を追加しても遅すぎます。システムをデプロイすることは技術的な決定です。それを信頼性高く運用することは、組織的な決定です。それが、ほとんどの企業が軽視している部分です。

誰が実際にAIのリスクを所有するのか?誰も

これは問題の核心であり、皮肉にも議論されることが最も少ないものです。ITはインフラストラクチャを管理します。法務はコンプライアンスを扱います。ビジネスチームはユースケースを推進します。しかし、誰もがエンドツーエンドのAIリスクを所有していません。

それにより、2つの即時の問題が生じます。誰も責任を負いたくないため、「行く」という決定が遅れます。また、誰が止めることができるかがわからないため、「止める」という決定も遅れます。

データはそれを反映しています。 10%未満のAIユースケースがパイロットから生産までに到達し、ほとんどの組織は測定可能なビジネス影響を生み出すのに苦労しています。一方、多くの企業はすでにAIを展開していますが、ガバナンス成熟度調査によると、7%のみが構造化されたガバナンスを確立していました。

これがなぜ起こるのか?大多数のフレームワークや企業のポリシーは、誰が責任を負うかではなく、どのように起こるべきかを定義しているからです。システムが金曜日の午後0時に間違った出力を生み出すと、質問は理論的なものではありません。誰が行動しますか?誰が決定する権限を持っていますか?

これはスケールでさらに悪化します。1つのシステムは非公式に管理できますが、30個のシステムがあると、責任はチームに分散し、誰も全体像を把握していません。

コモンウェルス・バンク・オブ・オーストラリアは明確な例です。銀行は45人のカスタマーサービスワーカーをAIボイスボットに置き換えました。需要が減ることを期待しましたが、実際は増加しました。マネージャーはオーバーフローを処理するために介入し、銀行はすべての45人の従業員を再雇用しなければなりませんでした。質問されたとき、銀行は自動化がワークロードを削減したことを証明できませんでした。

誰もがデプロイ前に仮定を検証しませんでした。誰もが結果を所有しませんでした。そこが、説明責任の空白が実際にどのように見えるかです。

ルールだけでは十分ではない。メカニズムが必要

ほとんどの組織はポリシーが不足しているのではありません。システムが機能しないのは、問題が発生したときです。

ポリシーは何が起こるべきかを定義します。メカニズムは、モデルが間違った出力を生み出すとき、ベンダーがバックグラウンドで何かを変更するとき、またはシステムが予期せぬ方法で動作し始める時に、実際に何が起こるかを決定します。

その違いは生産で明らかになります。決定が実際の条件下で行われるときです。

これらの失敗は一貫したダイナミクスに従います。各ケースで、同じ運用上のギャップが現れます。ただし、異なる形式で現れます。

所有権が第一に

すべてのデプロイされたAIシステムには、明確に責任のある所有者が必要です。承認、停止、停止の権限を持つ1人、チームや部門ではありません。

それがない場合、迅速なデプロイも安全な介入も不可能です。コモンウェルス銀行の例のように、明確な所有権の欠如は直接運用上の失敗につながります。

データと法的明確性が欠けている

多くのシステムは、文書化されたデータフロー、検証された法的根拠、または生産時にどのような義務が適用されるかについての明確性なしに稼働します。

イタリアの規制当局によるDeepSeekへの措置はこれを明確に示しています。問題はモデル品質ではありませんでした。個人データの取り扱い方を説明できないことだったのです。結果は、ヨーロッパのユーザーに対するサービスの突然の中断でした。

テストは実世界の使用を反映しない

システムは、うまく動作するシナリオで評価されることが多いですが、失敗が最も重要となるケースでは評価されません。

MyCityチャットボットは明確な例です。基本的なエッジケース、たとえば労働法、住宅差別、または支払い規則については、デプロイ前に検出されませんでした。実際のユーザーに公開されると、すぐに失敗が明らかになりました。

テストはパフォーマンスだけではなく、ユーザー、規制当局、またはジャーナリストが前にシステムが失敗するポイントを特定することです。

介入は不明または遅い

問題が見える場合でも、システムを停止または停止するための明確なトリガーまたは権限がないことが多いです。

Zillow Offersはこれを大規模に示しています。システムは、アルゴリズムを使用して家を価格設定および購入しました。2021年に市場が冷え込むと、システムはインフレされた価格で家を買い続けました。ドリフトを検出するメカニズムはなく、停止するための明確な決定ポイントもありませんでした。結果は、8億8000万ドル以上の損失と、部門の閉鎖でした。

モニタリングは所有権ではない

モニタリングはダッシュボードに減らされることが多いですが、それが失敗を防ぐものではありません。

何が重要かは、定義された責任です。誰がシグナルを追跡するか、どのようなことがエスカレーションを引き起こすか、誰が行動することが期待されているか。

デロイト・オーストラリアのケースは、そこが何を意味するかを示しています。政府の報告書には、誰もが検証する責任を負っていなかったため、虚構の引用と不正確な法的参照が含まれていました。結果は、部分的な払い戻しと評判の損害でした。

エージェントAI:これから来るものはさらに難しい

生成AIは出力を生み出します。エージェントAIはアクションを取ります。那はリスクを変えます。

評価するための単一の応答ではなく、1つの命令がシステム全体にわたる一連の決定をトリガーすることがあります。APIコール、データアクセス、トランザクション、更新などが、各ステップで人間の介入なしに発生することがあります。

何かが間違ったとき、問題は精度ではありません。トレーサビリティです。どのステップが問題を引き起こしましたか?どのデータが使用されましたか?誰がアクションを承認しましたか?多くの場合、これらの質問は事後に答えるのが難しいです。

これが、既存のギャップが重要になる場所です。所有権の不明確さ、モニタリングの弱さ、介入の欠如は、単に持続するだけではありません。複合します。誤った答えは修正できます。誤ったアクションは、誰もが気づく前に結果を生み出す可能性があります。

初期の兆候はすでにこの方向に示唆しています。 ガートナーは、2027年までに40%以上のエージェントAIプロジェクトがモデル制限ではなく、組織がコスト、リスク、成果を管理するのに苦労しているため、キャンセルされる予想です。那は、デプロイ後に私たちが生成AIで見るパターンと同じです。ただし、より高い賭けでです。

規制当局は、単純な原則で対応しています。自動化は説明責任を除去しません。組織にとっては、明確な意味があります。所有権とコントロールが不明な場合、エージェントシステムへのスケーリングは問題を解決しません。問題を増幅します。

それを運用する – または失う

AIはもう制約ではありません。モデルは幅広く利用可能で、能力が高く、コモディティ化されています。実際の違いは、組織がAIを構築できるかどうかではありません。組織がそれを信頼性高く運用できるかどうかです。

それが、ほとんどの失敗が発生する場所です。システムが構築されている方法ではなく、システムが実行されている方法です。成功する組織は、最も高度なモデルを持っている組織ではありません。明確な運用構造を持っている組織です。

これは直接テストできます。最も重要なAIシステムを取り出し、3つの質問に答えてみましょう:

  • 誰がそれを停止できますか?
  • それが失敗していることをどうやって知ることができますか?
  • それが失敗したときに何が起こりますか?

もし、それらの答えが不明な場合、システムは生産に適していません。

モデルはそうかもしれません。組織はそうではありません。

ズザナ・ドロタロヴァーはアベンガのビジネス分析を率いており、チェコとスロバキアの企業プログラムで約100人のアナリストを指揮しています。彼女は、AIを含む企業のイニシアチブが生産で機能するかどうかを決定する運用と意思決定構造に焦点を当てています。