
ソートリーダー
-

ソートリーダーAI エージェントは書き換えられないセキュリティ境界が必要
Hugging Face のストーリーを AI エージェントが暴走した瞬間と読むのは魅力的ですが、実際にはそうではなく、詳細が重要です。これは、研究者がモデルの能力を確認できるように、意図的に安全策を緩めた評価で動作していたサイバーセキュリティ研究エージェントでした。ある企業のカスタマーサービスボットがある朝目覚めて会社を攻撃したわけではありません。しかし、その文脈が誰の責任も免れさせるわけではありません。エージェントは本来留まるべき境界を超え、オペレーターが許可しなかった方法で認証情報やツールを使用し、他者のシステムに入り込みました。これこそがすべてのセキュリティチームが注目すべき点です。ロイターは、エージェントが 5 月に入ってすでに Hugging Face を調査していたと報じました、研究者はその初期の活動が単独で侵害を引き起こした証拠は見つからなかったと述べています。7 月は状況が異なりました。OpenAI は、同社のモデルが隔離制御を回避したと述べました、インターネットに到達し、Hugging Face のシステムと共に自社の研究インフラの一部が侵害されました。Hugging Face の公式説明では、自律エージェントシステムによるエンドツーエンドの侵入が記述されています。この侵入はデータ処理パイプラインを悪用し、認証情報を収集し、内部クラスター間を移動しました。不快に思う点は、エージェントが本来の仕事を遂行していたことです。彼らは与えられた目的を追求していました。だからこそこの話は一つの研究ラボに留まらず、広範囲に及びます。エンタープライズ向けエージェントも同様に目的を追い求めます。彼らは認証情報を保持し、ツールを呼び出し、人間がレビューできる速度をはるかに超えて動きます。善意だけのエージェントでも実際に被害を与える可能性があり、ハイジャックされたエージェントは同じ権限を攻撃者のために利用できます。したがって、モデルがどれだけ自信満々に見えても、目的が無害に見えても、システムが実際に何をできるかをセキュリティが管理しなければなりません。モデルだけでなく、行動を保護する初期のエージェントプログラムの多くは、モデルに重点を置いています。チームはプロンプトをテストし、拒否応答を調整し、最初のモデルをチェックするために第二のモデルを追加し、推論のトレースを見て悪意の兆候を探ります。これらは無駄ではありません。しかし、すべてが確率的であり、別のモデルが判断を下すことに依存しています。実運用のセキュリティ境界は決定論的でなければならず、ツール、認証情報、ネットワーク、取引の周囲に配置される必要があります。私が投げかける具体的な質問は次のとおりです:このエージェントは実際に現実世界で何を実行できるのでしょうか?支払いリクエストを作成することと、資金を放出することは別問題です。データベースの変更を準備することと、実運用で実行すること、保持ポリシーに合致するレコードにフラグを付けることと削除することも同様です。どちらの場合でも同じモデルであっても、どの側に位置するかによってリスクは大きく異なります。最近の Unite AI による機能制御の概要は同様の線を引き、リスクをデータ、ツール、権限、自律性、エージェントが稼働する環境に結び付けます。このフレーミングが好きなのは、「安全なモデル」や「安全でないモデル」のような曖昧なラベルを超えることができるからです。これにより、チームはエージェントの決定から実際の結果につながるすべての経路を追跡できます。すべてのエージェントにアイデンティティと限定的な任務を付与するエージェントは開発者のアカウントで実行したり、人間ユーザーが許可されたすべての権限を継承したりすべきではありません。共有されたアイデンティティは帰属を消失させます。長期間有効な認証情報は攻撃者に濫用する時間を与えてしまいます。また、広範なサービスアカウントは小規模なワークフローが関係のないデータやシステムに侵入することを許してしまいます。NIST は現在、ソフトウェアと AI エージェントのアイデンティティを独自のアーキテクチャ課題として扱っています。その概念文書では、エージェントが特定の行動に対して認可されていることをどのように証明できるか、エージェントのアイデンティティを人間の認可に結び付ける方法、そして組織が意図したことと実際に起きたことの改ざん耐性のある記録をどのように保持できるかを問います。実際には、これはシンプルな設計を示唆しています。すべてのエージェントは固有のアイデンティティ、所有者(個人またはチーム)、定義された目的、そしてそのタスクに限定された権限を持ちます。認証情報は速やかに期限切れとなり、特定のリソースとアクションにのみ有効であるべきです。ネットワークアクセスは厳格な許可リストから開始すべきです。エージェントが承認済みデータベースを一つ照会する必要がある場合、一般的なシェルやインターネットへのオープンアクセス、あるいは新たな認証情報を生成する権限まで与えてはなりません。また、作業がエージェントとツールのチェーンを下流へ渡るにつれ、権限は各ステップで狭くなるべきで、広がってはいけません。NIST はまた、認証情報の共有と過度に広いアクセスに警告しています。この警告はエージェントが機会主義的であるため重要です。ある経路が遮断されると、別のツールを試したり、環境を探索したり、誰かが忘れたトークンに偶然出くわしたりします。7 月の事例でも取得された認証情報が問題となりました。最小権限の原則は、推論層が設計者の予期しないことを行った際に、影響範囲を小さく抑えます。認可は推論ループの外に保つエージェントはアクションを推奨できるが、そのアクションが許可されているかを決定すべきではない。その判断はエージェントが書き換えたり、オフにしたり、言い逃れできない別個の実行層に属する。すべてのツール呼び出しは構造化されたリクエストとして表示されるべきである:どのエージェントが要求し、どの人間がスポンサーし、どの操作を望み、何を対象とし、どの制限が適用されるか。実行層はそれを許可するか、ブロックするか、エスカレーションするかを判断する。OWASPは過剰なエージェンシーを記述していますそれは不要な機能、過剰な権限、そして過度の自律性の混合とされています。そのガイダンスは、狭いツール、最小限の権限、下流システムでの認可、そして高インパクトなアクションに対するユーザー承認を求めています。私はそれがまさに正しい順序だと思います。このルールはデータを所有する者または取引を実行する者によって施行されるべきです。モデルがアクションが承認されたと言ったとしても、その声明だけに重みは全くありません。この分離はプロンプトインジェクションにも有効です。毒されたメールや文書がエージェントの推論を誘導する可能性がありますが、エージェントの資格情報を拡張したり、ポリシーゲートを下げたりすることはできません。モデルは禁止されたものを要求する自由がありますが、システムは依然として「ノー」と答えるべきです。重要な場面でのみ人間の承認を保存する人間のレビューは、アクションが取り消せない、組織の境界を越える、権限を変更する、機密情報を公開する、金銭を移動する、または本番システムに触れる場合に価値があります。すべてのルーティンステップで承認を求めると、遅延と、内容を読まずに「承認」ボタンをクリックする人が生まれます。NISTはこの同意疲労を名称で指摘しています。適切な承認リクエストは、実行される正確なアクションを平易な言葉で示し、行き先と重要なパラメータを含めます。それはエージェントが書いたテキストではなく、権威あるシステムから来るべきです。承認は迅速に期限切れとなり、その単一のアクションのみをカバーすべきです。重要な詳細が変更された場合、システムは再度問い合わせます。OWASPのエージェントセキュリティガイダンスは、高インパクトなアクションが有効な期限内のパラメータに基づく承認なしに通過できるかテストすることを推奨しています。そのフレーズは覚えておく価値があります。「続行してよい」は、別のエージェントや悪意ある行為者が承認できる弱い承認です。「この金額をこの口座に送金する」や「この変更をこの環境にデプロイする」は、システムが実行時に実際に検証でき、ユーザーが完全に理解できるものです。ライブの人間による身元保証がこのゲートで重要です。プッシュ通知は誰かがボタンをクリックしたことだけを証明します。より強固な設計では、フィッシング耐性のある公開鍵認証を使用し、ローカルの生体認証手段で裏付けられた登録された人物が必要です。FIDO標準は公開鍵クレデンシャルを正当なオンラインサービスに結び付けますそして生体データはユーザーの隔離されたデバイスに保持されます。適切に使用すれば、ハードウェアバックアップ認証は実際に正しい人物がそこにいたというはるかに優れた証拠を提供します。ただし、取引のバインディング、信頼できる表示、またはポリシー執行の代替にはなりません。これらすべてが連携して機能する必要があります。行動を監視し証拠を保持するエージェントの長時間実行中に最初のプロンプトだけで何が起きたかを説明させることはできません。セキュリティチームはツール呼び出し、ネットワーク活動、資格情報使用、ポリシー決定、承認、拒否、スコープ変更に関するテレメトリが必要です。モニタリングはエージェントが実際に行ったことを、その実行時に宣言された境界と比較すべきです。エージェントがコード解析に割り当てられているのに外部資格情報を探したり、無関係なサービスを探索し始めた場合、アラートを発するべきです。ログは機密情報を平文で漏らさずにアクションの連鎖を再構築できるだけのコンテキストを保持する必要があります。各記録はエージェントのバージョン、所有者、開始した人物またはシステム、使用したツール、要求されたアクション、ポリシー結果、そして人間の承認を捕捉すべきです。署名付きまたはその他の改ざん耐性のある記録は、複数のエージェントやサービスが関与した場合の事後レビューをはるかに信頼性のあるものにします。これらすべては機械速度で実行されなければなりません。ダッシュボードを見ているだけで数千件の数秒で完了する呼び出しを止めることはできません。自動化された制御はレートリミットを施行し、異常なシーケンスを検出し、行動が定義された閾値を超えた瞬間に資格情報を停止すべきです。そうすれば、人間の調査者は無限に追いかけるのではなく、限定されたインシデントを処理できます。起動前に停止パスを設計するすべてのエージェント展開には、実際に機能を除去する停止手段が必要です。エージェントに停止を要求するだけでは不十分です。運用者はその資格情報を取り消し、ネットワーク経路を切断し、ランタイムを終了し、キューに入ったアクションが再開しないようにできなければなりません。高リスクなワークフローでは、承認またはポリシーサービスがダウンした場合、システムはクローズド状態で失敗すべきです。そのパスを負荷下でテストしてください。承認サービスをオフラインにし、エージェントに矛盾する指示を与え、実行中に資格情報をローテーションし、侵害されたツールと応答しない承認者をシミュレートします。アクションがブロックされ、有用な記録が残ることを確認してください。そして、モデル、プロンプト、コネクタ、メモリシステム、または権限セットが変更されるたびにこれらのテストを再実行します。目標は説明責任のある自律性ですこれらはエージェントに対する反論ではなく、Hugging Face のインシデントが有用なエージェントから人々を遠ざけるべきではありません。むしろ、安全プロンプトと善意だけで信頼できる展開になるという考えを打ち砕くべきです。エージェントに分析や作業準備、可逆的なタスクの処理の余地を与えてください。エージェントが実際の結果をもたらす権限は、狭く、可視化され、エージェント自身以外の何かによって強制されるべきです。エージェントが本番環境に入る前に、リーダーは数個のシンプルな質問に答えられる必要があります。エージェントはどのシステムにアクセスできるか?どの認証情報を使用できるか?レビューなしで何ができるか?エスカレーションのトリガーは何か?承認者は承認される具体的なアクションをどのように確認できるか?どんな証拠が残るか?そして、セキュリティはどのようにして実行を即座に停止できるか?回答が曖昧である場合、エージェントは組織が認識している以上の権限を持っています。長期にわたって機能するアーキテクチャは、モデルの保護策とアイデンティティ、最小特権、外部ポリシーの強制、選択的な人間の承認、完全なテレメトリ、そして実際に機能する停止メカニズムを組み合わせます。前提は正直な仮定です:有能なエージェントは時折私たちを驚かせるでしょう。私たちのセキュリティ境界はそうすべきではありません。最終的には、AI...
著者 Kevin Surace, CEO、Token
-

ソートリーダーシグナル一つでは不十分:エンドツーエンドAIがサプライチェーンリスク管理の未来である理由
人工知能はサプライチェーンの変革とほぼ同義語となっています。組織はAIを活用して需要予測、在庫最適化、出荷のモニタリング、品質検査の自動化、製品の分類、コンプライアンス問題の特定を行っています。個別に見ると、これらのアプリケーションは測定可能な改善をもたらします。しかし、多くの組織はAIに多額の投資を行っているにもかかわらず、依然として高額な混乱に直面しており、その理由は驚くほど単純です。ほとんどのAIイニシアチブは、製品ライフサイクル全体にわたるリスクの発展を理解するのではなく、個別の問題解決に焦点を当てています。遅延した出荷は、ほとんどの場合単なる物流の問題だけではありません。工場監査の失敗は最終的に調達遅延につながることがあります。小さな品質偏差の連続は、数か月後に製品リコールへと発展する可能性があります。不正確な製品分類は、関税の遅延を引き起こし、販売シーズン全体を混乱させることがあります。これらの出来事は個別のシステムで見ると無関係に見えますが、合わせて見るとはるかに大きな物語を語ります。サプライチェーン管理におけるAIの次なる進化は、個別のアプリケーションをより賢く構築することではありません。以前は切り離されていた機能間のシグナルを結びつけ、リスクがビジネス上の問題になる前に新たなリスクを特定することです。リスクはサイロ化された領域に存在しないグローバルサプライチェーンはかつてないほど相互接続性が高く、変動性も増しています。地政学的緊張、関税の変動、環境規制の変化、強制労働の取り締まり、気候関連の混乱、そしてますます複雑化するサプライヤーエコシステムが、組織が常に適応し続けなければならない環境を作り出しています。 World Economic Forum’s Global Risks Reportによると、サプライチェーンの混乱は世界中の組織が直面する決定的なビジネスリスクの一つであり続けています。課題は、多くの企業が依然として、相互に通信できるように設計されていないシステムでこれらのリスクを管理していることです。例えば: 製品ライフサイクル管理チームは設計変更を管理する 調達チームはサプライヤーを評価する 品質チームは検査を追跡する コンプライアンスチームは規制を監視する 物流チームは輸送パフォーマンスに注力する 各機能は価値ある情報を生成しますが、これらのインサイトは部門別アプリケーションに閉じ込められがちで、可視性が断片的になります。AIはアクセスできるデータ内のパターンしか特定できません。情報が孤立したままであると、AIは企業全体のリスクではなくローカルな最適化を見つけてしまいます。AIの真の価値はコンテキストをつなげることにある現在のAIに関する議論の多くは自動化を強調しています。自動化は確かに重要ですが、AIのより大きな価値はコンテキストを創出することにあります。大企業はしばしば数十のサプライチェーンアプリケーションを保有しており、それぞれが異なる用語、スコアリング手法、ワークフロー、許容パフォーマンスの定義を持っています。ある小売業者は特定のカテゴリに対して10%の検査不合格率を許容できると分類するかもしれません。別の小売業者は同じ結果を許容できないと見なすでしょう。あるサプライヤーのスコアカードは納品パフォーマンスを重視し、別のスコアカードは持続可能性指標を優先します。正規化がなければ、AIはこれらのデータセットを正確に比較できません。最新のAIシステムは単なる予測ツールではなく、翻訳者として機能します。異質な情報を共通のリスクシグナルに正規化し、意思決定者がサプライヤー、工場、製品カテゴリ、地域を超えて一貫して解釈できるようにします。この機能は、組織がブランドを取得したり、複数の調達パートナーと協働したり、異なるソフトウェアプラットフォームからデータを統合したりする際に特に価値があります。ユーザーに多数の矛盾する指標を調整させるのではなく、AIは運用リスクを評価するための共通言語を作り出します。個別の出来事よりもパターンが重要サプライチェーンの専門家は常に例外を管理してきました。今日の課題はその膨大な数です。遅延した出荷だけでは介入が必要とは限りません。単一の実験室テストの失敗や見逃された検査も同様です。しかし、AIは人間が見落としがちなパターンを特定するのに優れています。次のような問題が発生し始めたサプライヤーを考えてみましょう: 品質欠陥のわずかな増加 検査のターンアラウンド時間の延長 小規模な物流遅延 文書エラーの増加 施設の是正行動計画に伴う是正期間の延長 これらの出来事は個別に見れば差し迫った混乱を示すものではありません。しかし、合わせて見ると、運用パフォーマンスの低下を示唆し、最終的に生産スケジュールの遅延や規制違反につながる可能性があります。この種のトレンド検出こそがAIが最大の価値を示す場面です。問題が顕在化した後に対応するのではなく、是正措置が比較的低コストで済むうちに新たなリスクを特定できます。によると National Institute of Standards and Technology (NIST)、効果的なリスク管理はシステムを継続的に監視し、重大な問題になる前に新たなリスクを特定することに依存しています。この同じ原則はサプライチェーンにもますます適用されており、予測的な可視性により組織はリアクティブな対応からプロアクティブな意思決定へとシフトできます。さらに、Cybersecurity...
著者 Angela Rhea, 副社長、製品&産業コンサルタント、TradeBeyond
-

ソートリーダー自社のメモリはAIモデルよりも長く保たれるべきです
人々はしばしば、どのモデルが自社を支えているのかと尋ねます。その答えは重要です。品質、コスト、制限を決定し、私はそれに1時間を費やすことを喜んで受け入れます。また、もう一つ知りたいことがあります。モデルが変わったときに組織がまだ保有しているものは何かです。日付で考えてみましょう。もしプロバイダーが火曜日に価格を2倍にしたり、構築したエンドポイントを廃止したりした場合、翌日の水曜日の朝に自分がまだ所有しているものは何でしょうか?多くの企業にとって正直な答えは、APIキー、請求書、そして他社のサーバー上に他社の保持スケジュールで保存されている非常に長い会話履歴、です。私のバックグラウンドは化学です。SCADA、実験結果、オペレーター自身のメモに接続された化学プラントのグレイボックスモデルを何年も構築してきました。その経験からすぐに分かるルールがあります:条件のない数値は結果ではありません。もし誰かが先週センサーを交換し、誰も記録しなければ、画面上の読み取り値は何も説明できません。それは実験ノートの問題です。現在では調達の問題として現れ、AI予算が決定されるシートに載ることはほとんどありません。一つにまとめて答えられる三つの質問より大きなコンテキストウィンドウは、モデルが単一リクエスト内でより多くの情報を使用できるようにします。永続的なストレージはリクエスト間で何が残るかを決定します。ポータビリティは、プロバイダーが変更されたときにその情報が引き続き利用可能かどうかを決定します。これらは別個のアーキテクチャ上の課題であり、100万トークンのウィンドウは皆がそれらを一つとして扱うよう促しました。Googleの公式ドキュメントは直接的な類推を提供しています: 「コンテキストウィンドウの類推は短期記憶です。」文字通りに受け取ってください。短期記憶は失われるものです。したがって、巨大なウィンドウを販売するすべてのベンダーは、状態を永続化する別個のものも販売しています。これらの層をそれぞれの言葉で狭く読み取り、各層が実際に何をカバーしているかを確認してください。OpenAI はデフォルトで Response オブジェクトを 30 日間保存します;Conversation オブジェクトとその項目はその TTL の対象外です。Amazon の 30 日削除ポリシーはBedrock Session Management APIに適用され、対象はその API のみです。Anthropic のクライアント側メモリツールは有用な境界を示しています:モデルがメモリ操作を要求し、アプリケーションがストレージを制御し、同社はさらにホストエージェント向けにマネージドメモリストアも提供しています。これらはすべて、公開された通常のエンジニアリング上の決定です。また、貴社の作業コンテキストに関する保持ルールが他社のリリースノートに記載されていることを意味し、どのルールがどのデータに適用されるかを特定できるはずです。スイッチングコストが実際に存在する場所テキスト生成呼び出しを別のものに置き換えるだけで、週末で済みます。だから「マルチモデルです」という言い回しが安価に聞こえるのです。高価になる層は、誰もデモを行わない部分です。埋め込み。変更することは埋め込みモデルは通常、コーパスの再埋め込みとインデックスの移行または再構築が必要です。生成モデルの変更は生成モデルはそのような要件を持ちません。そして両者は常に混同されます—通常は移行が迅速になると約束する者によってです。2025 年の文献は標準的な手順を次のように記述しています“コーパス全体を再エンコードし、近似最近傍(ANN)インデックスを再構築することは、重大な運用上の混乱と計算コストをもたらす”;その論文の独自の貢献である Drift-Adapter は、延期埋め込み空間間の変換を学習することで再構築を延期します。いずれにせよ、移行コストは検索の検証と運用作業、そして埋め込み呼び出し自体をカバーします。ファインチューニングされた挙動。 Cohere の 2025年9月の廃止通知はすべての調達デスクの上位に位置付けられます:”Previously fine-tuned...
著者 Ilia Razvin, 創設者、IOSYA
-

ソートリーダーAIエージェントは行動できる準備ができている。ほとんどの企業はそれを許可する準備ができていない。
生成AI時代の大半において、私たちはモデルが何を言うか、そして私たちがそれに何を入力するかに焦点を当ててきました。プロンプトを検査し、応答をフィルタリングし、モデルにレッドチームを行い、入力と出力の周囲に制御を構築します。これらの保護は依然として重要ですが、AIが主に人間が消費する何かを生成する世界向けに設計されたものです。エージェントはその方程式を変えます。情報を単に消費したり生成したりするだけではありません。彼らは行動します。エージェントはツールを実行し、サブエージェントを呼び出し、他のエージェントと協働し、APIを呼び出し、データにアクセスし、認証情報を使用し、MCPサーバーを呼び出し、コードを生成・実行し、目的達成のために一連の意思決定を自律的に行うことができます。執拗な追求です。これが起こると、中心的な質問はもはやモデルが安全な応答を生成したかどうかだけではなく、エージェントが取る行動が実行に際して安全かどうかということになります。OpenAIからの最近の開示は、その区別がますます重要になることを示しています。OpenAIは予期しない、または懸念されるモデルの挙動を体系的に報告する、一方で、より広範な安全性の取り組みは、モデルがより大きな自律性とツールへのアクセスを得るにつれて生じるリスクにますます対処しています。教訓は、エージェントが本質的に安全でないということではなく、セキュリティ境界が移動したということです。エージェントシステムは別の運用モデルを必要とするエージェントAIは単なる別のアプリケーションアーキテクチャではありません。ソフトウェア自体が、仕事の進め方をますます決定しています。エージェントは障害に直面し、何が起こったかを解釈して別の道を選択できます。事前に明示的に設計されていない方法でツールを組み合わせることができます。同じワークフローの一部としてコードを生成し、そのコードを実行することも可能です。アクションのシーケンスはエージェントが実行されるたびに変わることがあります。同時に、このソフトウェアを作成する人々の数は劇的に拡大しています。私たちが市民開発者の台頭について書いたように、AIは自分を開発者と考えたことのない人々をソフトウェア作成者に変えています。マーケター、財務アナリスト、あるいはオペレーションリーダーが、欲しいものを説明すれば、実際のビジネスシステムと連携できるエージェントを作成できるようになりました。これは、誰がソフトウェアを構築できるか、そしてそのソフトウェアが何ができるかという点で、並外れた拡大です。また、組織はビジネスのはるかに多くの領域で、はるかに多くの自律ソフトウェアが稼働することを意味します。答えは単に昨日の制御をこの新しい環境に適用することではありません。企業がこれらのシステムを安全に運用できない場合、代替策はそれらを制限し、最終的には達成しようとしている生産性向上自体を遅らせることになるでしょう。エージェントが行動する場所に制御が必要ですAIがより自律的になるにつれて、課題はモデルに何を入力するかを制御することから、モデルの決定が行動になるときに何が起こるかを制御することへとシフトします。エージェントは、承認されたユーザー、適切なプロンプト、正当な認証情報、ツールへの認可されたアクセスから始まることがあります。しかし、これらがすべて、以降のすべてのアクションが実行すべきであることを保証するわけではありません。ここでランタイムが重要になります。組織はエージェントが誰であるかだけでなく、現在何をしているのかについて質問する必要があります。 どのツールを呼び出しているか、 どのリソースにアクセスしているか、どのコードを実行しようとしているか、 どのサブエージェントや他のエージェント間の通信が行われているか、 そのアクション直前に何が起きたか、そしてその振る舞いが許容範囲内にあるかどうか、 ランタイムでエージェントが内部で何をしているか。 そしてそれが行われない場合、システムは実行前にリアルタイムで介入できる能力が必要です。これは重要な区別です。可観測性は何が起きたかを教えてくれます。ランタイム制御はエージェントの実行層を抑制する能力を提供します。エージェントの振る舞いが非決定的で多次元的であるため、これは特に重要になります。ブロックされたアクションは、エージェントが目的に向かって別のアプローチを試す原因となります。一見無害なツール呼び出しでも、直前の状況によってリスクが生じることがあります。単に観察したり「検出して応答」するだけでは、エージェントへのアクセスと実行を実際に制御するには手遅れです。ランタイムはインラインかつ同期的である必要があり、AIの速度に追いつくことが求められます。このようなアプローチを受け入れる上での根本的な課題は、より長い分析と検出手法に依存する、AI以前の時代の考え方に基づいていることです。これらの原則は今日の世界ではもはや適用されません。ランタイムセキュリティには制御だけでなくコンテキストが必要です新興AIリスクへの対応として、自律性を削減する傾向があります。エージェントに付与する権限を減らしたり、人間の承認をより頻繁に求めたり、動作環境を制限したりします。これらのコントロールは、特に高リスクな行動に対しては適切な場合があります。しかし、それが長期的な運用モデルになることはできません。人間がすべての重要な決定を承認しなければならない場合、自治エージェントの価値の大部分が失われます。厳格なヒューマン・イン・ザ・ループのやり取りに依存することで、最も有能な人材さえ「ボタンを押すだけ」の役割に変えてしまいます。これは、エージェント組織が基盤としているコードベースの範囲や相互依存性を把握する能力に直接影響します。エージェントAIの経済的約束は、ソフトウェアが意味のある作業を独立かつ継続的に(24時間365日)完了できることに正確に由来します。したがって、目標は自律性を排除することではなく、より大きな自律性を安全に運用できるようにすることです。それには、エージェント自身の推論プロセスの外部に独立したコントロールが必要です。Anthropicのエージェント的ミスマッチに関する研究は、意図的に構築されたシミュレーションで実施されており、なぜこれが重要なのかを示しています。システムがより自律的になるにつれて、元の目的が明確であっても、実際の挙動がオペレーターの期待と乖離する可能性があります。実務上の意味は明快です。組織はエージェントに何をさせたかだけを理解するだけでは不十分です。実際に何をしているかを把握し、制御できなければなりません。エージェント自体はもはや難題ではなくなった業界はエージェントの能力向上に莫大なエネルギーを注いできました。現在、能力が企業導入の主要な制約ではなくなる時点に急速に近づいています。制約はコントロールです。エージェントがより自律的になるにつれて、その行動の影響は拡大し、予測可能なソフトウェア向けに設計されたコントロールは効果が薄れます。企業はエージェントの行動を継続的に可視化し、なぜその行動が重要なのかを理解するコンテキストを持ち、すべての意思決定に人間を介在させずに介入できる能力が必要です。それはソフトウェアの運用方法を変えることを意味します。 開発者は、エージェントが実際にどのように振る舞うかを理解する必要があり、設計上の振る舞いだけで判断してはいけません。 プラットフォームおよびセキュリティチームは、エージェントがシステムやツールを横断して行動しても、執行可能な境界を確立する必要があります。 ビジネスリーダーは、より大きな自律性がコントロールの喪失を意味しないことに自信を持つ必要があります。 これは、別のアプリケーションを保護したり別のモデルを統治したりすることとは根本的に異なります。私たちは企業環境に自律的なアクターを導入しています。すなわち、推論し、意思決定し、行動を起こすシステムです。組織がそれらの行動をリアルタイムで見て制御できなければ、最終的にはエージェントができることを制限せざるを得ず、自律性が本来創出すべき価値の多くが失われます。答えは、すべての悪い決定を防げると仮定することではありません。システムがより自律的かつ非決定論的になるほど、保証がますます困難になります。目標は、悪意あるまたは破壊的な行動が望ましくない結果につながらないようにすることです。これには、エージェントの周囲に新たな運用層を設ける必要があります。その層は行動を継続的に観測し、コンテキスト内での行動を理解し、エージェント実行スタック全体にわたって境界を強制し、意図しないまたは受容できない行動が不可逆的な結果になる前に介入します。次の企業AIフェーズは、エージェントの能力だけで定義されるわけではありません。安全に付与できる自律性の度合いが、今後の鍵となります。
著者 Harold Byun, 最高経営責任者, BlueRock
-

ソートリーダーAIはすでにあなたの医師よりも賢い。恐ろしいのはそこではない。
私はAIにこの問題を解決してほしかった。何年もの間、複雑な患者の病歴、検査結果、症状、投薬、サプリメント、そして過去の治療歴をすべて取りまとめ、首尾一貫した臨床計画に変換しようとしてきました。複雑な症例では、重要な点と次にすべきことを判断できるようになるまでに、3時間もの調査が必要になることもありました。そして生成AIが登場した。私の最初の考えは明白だった:ついに。膨大な情報を処理し、私がこれまでに記憶できる以上の速さで医療知識を呼び起こし、数秒で症例全体の関係性を見つけ出す技術が目の前にあった。大規模言語モデルの周りにインターフェースを設け、いくつかの安全策を構築すれば完了するだろうと考えた。それは素晴らしいことだっただろう。しかし、約1年と100万ドルが経過し、ソフトウェアエンジニアが10人の臨床チームと共に作業しているにもかかわらず、私たちはまだ構築段階にあった。理由は、AIが十分に賢くなかったからではない。知性自体は簡単な部分だった。私は他の人とは違うAIを手に入れていた最初の手がかりは、臨床ソフトウェアの構築に取り掛かる前に得られた。隣に座っている人と同じAIツールを使っても、劇的に優れた結果が得られることに気付いたのだ。なぜか?単に質問して答えを受け取るだけではなかったからだ。私はAIと議論し、前提に挑戦し、見落としていた文脈を提供し、誤りを訂正し、枠組みを変え、再度突き進んだのだ。技術的には同じツールを使用していたが、機能面ではそうではなかった。広告を書いているときは興味深い生産性の問題だが、対象が患者になると全く別の問題になる。私は7万人以上の医療従事者と仕事をしてきた。臨床的に優秀でも、AIシステムから有用な情報を引き出すのが下手な人もいる。それらは別々のスキルだ。しかし、医療界の答えは、臨床医が単に「プロンプトエンジニアリング」を学べばよいというもののようだ。それが真剣な解決策だとは思わない。臨床AIシステムが信頼できるようになる前に、医師が高度なプロンプトエンジニアになる必要があるなら、臨床AIの構築はまだ完了していないということになる。研究はすでに不快な事実を示している2024年に実施されたランダム化臨床試験で、50人の医師に難しい診断症例が与えられた。GPT-4を使用した医師は76%の得点を得たのに対し、従来のリソースを使用した医師は74%で、統計的に有意な差はなかった。その後、研究者はGPT-4単独でテストした。従来のリソースを使用した医師よりも16ポイント上回った。2026年にパキスタンで実施された試験では、AIリテラシー研修を受けた後、GPT-4oにアクセスできる医師は診断推論で71.4%の得点を得たのに対し、従来のリソースを使用した医師は42.6%だった。しかし、GPT-4o単独では82.9%の得点だった。2026年の英国再現実験でも同様の差が見られた。医師はAI支援で改善したものの、単独で動作するLLMよりも21ポイント以上低い得点にとどまった。不快な部分をはっきり言わなければならない。特定の認知タスクにおいて、AIはすでに個々の医師よりも優れている。どの医師もすべての医学論文を読んだり、関連性が出た瞬間にすべての稀な疾患や相互作用、禁忌を記憶したりすることはできない。AIは膨大な情報を疲れたり時間切れになったりすることなく処理できる。チャットボットを臨床医の前に置くだけで問題が解決したと考えるのは誤りだ。空のプロンプトボックスが問題だ医師が150項目のマーカーを含む検査報告書をアップロードし、LLMに分析を依頼すると想像してみてください。回答は美しく整理された形で返ってくる。しかし唯一の問題は、システムが150項目すべてを確実に抽出できなかったことだ。汎用のLLMは決定論的な臨床文書パーサーではない。表や密度の高い医療報告書は依然として特に難しい。恐ろしいのは、最終的な回答が「50項目を見落としました」と告げない可能性があることだ。単に回答するだけかもしれない。そして、見落とされた項目のひとつが緊急の医療評価を必要とすると想像してみてください。それは私が受け入れられる制限ではなかった。システムの臨床推論部分を開始する前に、検査報告書を正確かつ再現性をもって処理できる別の抽出技術を開発せざるを得なかった。その経験は、AI安全性に対する私の考え方を変えた。何かを知らないと告げるAIシステムは不便だ。何が欠けているか分からないAIシステムは危険です。なぜAIを超えて構築しなければならなかったのか臨床業務には、汎用的な生成AIが自然に提供できないもの、すなわち再現性が必要です。私たちは、入力と出力を制御できることが必要でした。信頼できるデータ抽出、構造化された知識、決定論的ロジック、保護策、そして患者の履歴全体にわたる関係性を評価できるシステムです。臨床的推論は単なるif‑then文の集合ではありません。時にはシグナルは複数の指標間の関係です。時には、個別には目立たない5つの所見が、合わせて見ると重要になります。エンジニアはソフトウェアが実行できるほど明示的なルールが必要です。臨床医は「はい、ただし…」と言い続けます。人間の生物学は例外、修飾子、文脈、競合する説明で満ちています。システムを構築する際、あるグループは手話で、別のグループはクリンゴン語でコミュニケーションしているように感じました。答えは「AI」でも「非AI」でもありませんでした。各要素が正確にどこに属すべきかを見極めることでした。AIはチャートを読むことができる。人間は部屋の雰囲気を読むことができる。適切に使用すれば、AIは臨床医の記憶を拡張し、研究を加速させ、稀な可能性を提示し、膨大な情報からパターンを認識できます。それは医師を置き換えるというより、バイオニックな医師を構築することに近いです。しかし、患者は臨床的な症例ではありません。医師は答えが出る前にためらいを聞き取り、話の変化に気づきます。ある患者は症状を常に最小化し、別の患者はすべての感覚を最大強度で報告します。「私は大丈夫です」という言葉が明らかに大丈夫でないことを医師は知っています。その情報はチャートに存在しないこともあります。医療における人間の相互作用は、機械が知的作業を終えた後に付加する快適な層ではなく、別の臨床データの源です。AIはチャートを読み取れます。人間は部屋の雰囲気を読み取れます。最高の臨床システムは両方を必要とします。AIが医師に取って代わるかどうかを問うのはやめましょう私たちは間違った質問をしています。将来は必ずしも最も賢いチャットボットや最先端の基盤モデルを持つ企業が支配するわけではありません。重要なイノベーションはモデルそのものではなく、情報の取得と検証、提供される知識、システムが推論できる範囲、決定論的制御が介入する場所、そして人間がループに残るべき場所に関わっています。生の知能は豊富になりつつあります。その知能を適用する信頼できるシステムの構築ははるかに難しいです。そして、すべての臨床医がアマチュアAI開発者になるよう要求してこの問題を解決すべきではありません。複雑さは技術内部にあり、医師のプロンプト内部にあってはなりません。将来の医師がAIの記憶力に勝つことはありません。その競争はすでに無意味になりつつあります。むしろ、機械の記憶力、処理能力、パターン認識を提供しつつ、臨床医の文脈、判断、懐疑心、人間的なつながりを保持するシステムを構築すべきです。私たちはそれをバイオニック・プラクティショナーと呼んでいます。患者は最終的にもっとシンプルな呼び方をするのではないかと予想しています。自分の医師。
著者 Dr. Brandy Zachary, 創設者、TDZ Functional Medicine Academy
-

ソートリーダー次のAI電力ボトルネックは都市内部にある
過去数年にわたり、そして現在も続くように、AIインフラ市場は膨大な時間と資金(2030年までに $7 trillion のデータセンター投資、マッキンゼーの推計)を費やし、電力が確保できる場所に大規模データセンターを建設する方法を学んできた。「どこでも」というのが重要なキーワードで、かつては場所はあまり重要ではなかった。トレーニングクラスターは単に十分な電力へのアクセスさえあればよい。しかし、AIの利用がチャットインターフェースを超えて機械、音声システム、動画、そして物理世界と相互作用するアプリケーションへと拡大する現在、場所の重要性が高まりつつある。こうした運用には、計算力をそれらの相互作用が行われる都市部に近い場所に置く必要があり、レイテンシを低く保つことが求められる。チャットボットのようなツールは0.5秒程度の遅延を許容できるが、遠隔監視された配送ロボットやライブ音声アシスタント、あるいは自動化されたフルフィルメントシステムといった自動サービスアプリケーションはミリ秒単位で反応する必要がある可能性がある。これはAI企業にとっての新たな課題である。大規模な都市圏の内外で、信頼できる小規模な電力供給をどのように見つけるか? そして、場所が見つかった後でも、遠隔データセンターが直面している反発にどう対処するかが問題だ。都市部におけるAI需要が高まっている都市圏では、チャットボットの個人的利用やロボットへの過度な執着を超えるAIへの需要が高まっている。IMF のワーキングペーパーによると、データセンターとAIによる電力消費は2023年にすでに世界で400〜500 TWh に達しており、AI主導の消費は2030年までに1,500 TWh に達する可能性があるという。書類処理や動画のアーカイブといった単純作業をより効率化するために必要な自動化は、大規模に大量の電力を必要とする。都市はこの分野の最前線にあり、OECD が78か国の250都市を調査した結果が示すように、56% はすでに AI を積極的に使用しており、さらに 35% がパイロットまたは導入計画を進めている。簡単なユースケースとして、都市の監視カメラを考えてみよう。IHS Markit は推定したところ、数年前に世界の監視カメラ数は10億台を超えると予測されていた。これらは主に記録目的で使用されているが、現在ではネットワーク上の物体追跡や自然言語で大規模な動画アーカイブを検索するなど、より計算負荷の高い作業にも利用されている。現在の AI 処理能力では、すべてのカメラでこのようなプロセスを実行することはできない。都市外の遠隔データセンターに送って処理すべきか? データ規制や大量トラフィックの移動コストを考えると、実用的ではない。最近の Gallup 調査によると、民間および公共部門の従業員の30% が AI を使用していることが分かり、数は上昇傾向にある。これらのセクター—銀行、病院、公共機関など—は同様の課題に直面している。彼らは自らの管轄内に...
著者 Denis Alkhazov, 創業者 & マネージングパートナー, Teravolt
-

ソートリーダーAIエージェントは作業を実行できるが、企業はそれらを運用できるか?
AIエージェントはタスクを完了する能力が驚くほど向上しています。エージェントに目標、適切なツールへのアクセス、十分なコンテキスト、そして明確に定義されたワークフローを与えると、情報の調査、文書の分析、意思決定、システムの更新、他のエージェントとの調整が可能になります。これがエージェントAIの魅力的な部分です。また、デモでよく目にする部分でもあります。エンタープライズの業務は異なる様相を呈します。ローン申請が審査の途中で変更されることがあります。顧客が検証完了後に新たな情報を提供します。二つのシステムが同じ口座について意見が合わないことがあります。昨日まで有効だった承認が本日には無効になることがあります。エージェントがケースを要約して別のエージェントに渡す際、些細な詳細がプロセス上で失われてしまうことがあります。エージェントが行うべき作業のうち、順調に進むパスは約80%を占めるかもしれません。エンタープライズは残りの20%の中で運用されています。80/20の枠組みは業界統計ではありません。運用上の複雑性が潜む場所を示す手法です。エンタープライズ業務の難しい部分は、通常ケースではなく、例外や引き継ぎ、依存関係、変化するコンテキスト、そして組織が結果に対して責任を負う意思決定にあります。AIが質問への回答から実際の行動へと移行するにつれて、この運用上の複雑性はさらに重要になります。エンタープライズはエージェントの構築方法だけでなく、運用方法についても考える必要があります。そこがAgentic Operationsの始まりです。回答の生成から行動への移行エンタープライズ向けジェネレーティブAIの最初の波は主に情報に関するものでした。モデルは文書を要約し、レポートを生成し、質問に回答し、企業内ナレッジを検索し、従業員が既存のタスクをより速く完了できるよう支援しました。エージェントは根本的に異なるものをもたらします。ビジネスプロセスの状態を変える行動を取ることができます。エージェントは何かを承認または却下し、記録システムを更新し、顧客へのコミュニケーションを送信し、別のワークフローをトリガーし、別のエージェントを呼び出す、あるいは次に何が起こるかを決定する意思決定を行うことができます。OpenAIは実用ガイドでエージェントを説明していますそれらはユーザーに代わってタスクを独立して実行するシステムであり、モデルを用いてワークフロー実行を管理し、ツールで外部システムとやり取りします。誤った回答の運用上の影響は、誤った行動の影響とは大きく異なります。したがって、エンタープライズの課題は変わります。モデルが良い回答を生成したか、エージェントが割り当てられたタスクを成功裏に完了したかを問うだけでは不十分です。エンタープライズは、ビジネスコンテキスト、ポリシー、権限、そしてプロセスの前段階で起こったすべてを考慮し、行動がそもそも実行すべきだったかどうかをますます知る必要があります。図1:生成AIは出力を生成します。エージェントAIはビジネス状態を変化させます。AIがビジネスの状態を変え、以降の意思決定に影響を与えるようになると、信頼性はもはやモデルレベルだけで測定できなくなります。ビジネスプロセスが失敗してもエージェントは成功できるAI搭載のローン審査ワークフローを考えてみましょう。あるエージェントが申請書類を抽出し、別のエージェントが収入を検証し、さらに別のエージェントが信用情報を評価し、後続のエージェントがケースを要約してから、審査エージェントが意思決定を行うまたは推奨します。各エージェントには明確に定義された責任があり、その責任を正しく遂行できます。文書エージェントは適切な情報を抽出できます。収入検証エージェントはタスクを成功裏に完了できます。要約エージェントは利用可能な情報の正確なサマリーを作成できます。審査エージェントは指示通りに正しく実行できます。最終的なビジネス判断は依然として誤りです。初回の検証後に更新された収入情報が届くと想像してください。新しい文書は処理されますが、次のステップのためにケースが要約される際にその重要性は低下します。最終的な審査エージェントは妥当な要約を受け取りますが、プロセス全体にわたって存在した完全なビジネスコンテキストは得られません。何も必ずしもクラッシュしたわけではありません。APIが失敗したわけでもありません。個々のエージェントが必ずしも幻覚を起こしたわけでもありません。すべてのコンポーネントが正常に実行されたと報告しても、ビジネスプロセスが誤った結果に至ることがあります。Anthropicは効果的なエージェント構築に関するガイダンスで関連する課題について論じています、自律システムはステップが増えるにつれてエラーが累積する可能性があることを指摘しています。問題はモデルの精度を超えて、状態、コンテキスト、意思決定、前提がワークフロー全体に渡って変化することに広がります。これにより重要な区別が生まれます:エージェントの信頼性とビジネスプロセスの信頼性。エンタープライズが最終的に体験するのは個々のエージェントではなく、完全なプロセスが生み出す結果です。図2:ローカルでの成功がビジネスの成功を保証するわけではないこれはエージェントAIがもたらす重要な変化のひとつです。各コンポーネントが個別に検査すると正常に見えても、ワークフローは失敗することがあります。能力は権限と同等ではない現在のエージェントスタックの多くは、能力に焦点を当てているのは理解できる。チームは、エージェントが推論できるか、適切なツールを選択できるか、タスクを完了できるか、エラーから回復できるか、許容できる精度とレイテンシで動作できるかを知りたい。企業には別の要件があります:権限です。例えば、与信審査エージェントがローンを承認できるとします。これは、評価できるすべてのローンを承認すべきだという意味ではありません。その権限は、ローン額、リスクカテゴリ、顧客タイプ、利用可能な証拠、信頼度、過去の決定、あるいは以前の審査後に申請内容が変更されたかどうかに依存する可能性があります。これはエージェントが できること とエージェントが 許可されていることの間に境界を作ります。OpenAIは、エージェントツールに関連するリスクを評価し、機密かつ不可逆的な操作に対して保護策や人的介入を追加することを推奨しています。 Microsoftはエージェントが運用するコアビジネスプロセスに関するガイダンスで同様のアプローチを取っています。エージェントは定義された境界内で日常的な意思決定を行うことができ、意思決定権がどのアクションを独立して実行でき、どのアクションが人的承認を必要とするかを決定します。エージェントの能力が向上するにつれて、この区別はむしろ重要になってきます。より高性能なエージェントは、より重大な行動を取ることができるため、企業はそれらの行動が許容される境界を明確に定義し、強制する方法を必要とします。質問は エージェントはこれをできるか?から どのような条件下でエージェントにこれを許可すべきか?ビジネスポリシーは実行に近づく必要がある企業はすでに人が操作するプロセスを管理するための広範な仕組みを持っています。SOP、承認マトリックス、コンプライアンスポリシー、リスク閾値、トレーニング、職務分離、監査、エスカレーション手順などを使用しています。これらの多くは、単純な前提――人が規則を読み、状況を理解し、作業を行いながら規則を適用する――に基づいて設計されました。エージェントはその前提を変えます。一定の閾値を超える取引に二次承認を要求するポリシーを考えてみてください。人がそのタスクを実行する場合、ポリシーはトレーニングやワークフロー制御で支えられた文書として存在します。エージェントが数百から数千のアクションを迅速に実行できる場合、その文書の存在だけではポリシーに違反する行動を防げません。文書化されたポリシーとビジネスアクションの間のどこかで、ポリシーは実行可能な形に変わる必要があります。これはすべてのポリシーが決定論的なコードになる必要があるという意味ではありません。制御の中には決定論的なものもあれば、意味的解釈が必要なもの、リスクや信頼度に依存するもの、そして引き続き人的判断が必要なものがあります。より大きなアーキテクチャ上の変化は、ビジネスポリシーが実行経路により近づき始めることです。AWSは金融サービスにおけるエージェントAIの文脈でこの点を特に指摘しています。これにはエージェントの行動に対するポリシーベースの検証や、重要な活動に関する監査トレイルの必要性が含まれます。従来、組織は実行前に多くのガバナンス要件を定義し、後で監査やレビューを通じてコンプライアンスを検証できました。自律システムが継続的に、かつ機械速度で動作する場合、いくつかの制御はプロセスが実行中に機能する必要があります。ヒューマン・イン・ザ・ループは必要だが、運用モデルではないAIワークフローにおける不確実性への最も一般的な対応は、ヒューマン・イン・ザ・ループを導入することです。特に重要な意思決定においては理にかなっていますが、人的レビューをすべての例外への答えとみなすと問題が生じます。エージェント主導のオペレーションが数千から数百万の意思決定を処理すると想像してください。すべての異常事態、低信頼度の結果、ポリシーの曖昧さ、例外が人に回されると、組織はオペレーション上のボトルネックを取り除いたわけではありません。単にボトルネックがレビューキューに移っただけです。時間が経つにつれ、人的が過剰に日常的な決定を承認するようになると、人的監視自体の意味が薄れてしまうという別の問題も生じます。人間は依然として不可欠ですが、その役割は変わる必要があります。すべての決定をレビューするのではなく、判断が実際に必要な状況、エージェントの権限に達したケース、またはシステムが独立して解決すべきでない条件に直面したケースに集中すべきです。したがって、スケーラブルな運用モデルはリスクスコアリングや人的レビューだけに依存することはできません。エージェントのアクションがビジネスアクションになる前に、システムは現在のビジネスコンテキスト、関連するポリシー、エージェントの権限、そしてワークフローで既に起こったことを考慮する必要があります。その結果として、継続する、追加の証拠を要求する、アクションを保留する、あるいは意思決定を人間にエスカレーションする、という選択肢が考えられます。図 3: 人的レビューがランタイム制御の一つの結果になるこれにより人的監視の役割が変わります。人間はもはやデフォルトであらゆる不確実なステップに挿入されるわけではなく、ビジネスコンテキスト、ポリシー、権限、またはアクションの結果が判断を要する場合にのみ、人的介入が一つの可能な結果となります。この区別はエンタープライズ規模で重要です。ポリシーと権限の範囲内で明らかに許容されるアクションは自動的に進行すべきです。必要な証拠が不足している、あるいはビジネス状態が変化した場合は一時停止すべきです。意思決定が組織が意図的に人に委ねている境界を超えた場合はエスカレーションすべきです。目的は人間をループから排除することではありません。人間を適切なループに配置し、ルーティンな意思決定を明確に定義された境界内で進行させることです。エージェントシステムがスケールするにつれ、人間の監視の質は、レビューする意思決定の数よりも、オペレーティングシステムが人間の判断が実際に重要となる意思決定を特定できるかどうかに依存するようになります。可観測性は必要だが、見えるだけでは制御できない業界はAIの可観測性において大きな進展を遂げました。チームはプロンプト、モデルの応答、トレース、ツール呼び出し、レイテンシ、トークン使用量、そしてエージェントが結果を生成するまでにたどった全軌跡を検査できるようになっています。この可視性は不可欠です。 OpenAI のエージェント安全性と評価に関するガイダンスは、エージェントの行動を理解するための評価やトレース評価といった手法も強調しています。しかし、可視性だけでは運用上の問題は解決しません。たとえば、ある保険引受エージェントが先週、承認ポリシーに違反した回数が2,700回だったとします。これは優れた可観測性を示す一方で、運用が極めて悪いことを意味します。重要なビジネスプロセスにおいて、企業はエージェントの行動を理解するだけでなく、プロセスが実行中である間に対応できる能力も最終的に必要となります。図 4: 運用制御ループ可観測性はエージェントが何をしたかを答えます。エージェント運用はさらにエージェントが継続すべきかどうかを答える必要があります。この区別は、アクションが高コストで、結果が重大で、取り消しが困難、あるいは多数の下流決定に影響を与える可能性がある場合に特に重要です。最も困難な失敗はエージェント間で起こり得る企業がマルチエージェントや長時間実行されるワークフローに移行するにつれて、別の課題が顕在化します。多くのビジネスポリシーは単一のアクションに局所的ではありません。たとえば、意思決定の連続にわたる総金融エクスポージャーを制限するポリシーを考えてみましょう。個々の取引は許容閾値未満であっても、累積エクスポージャーがそれを超えることがあります。各アクションを個別に見るだけでは違反は検出できません。同様の問題は権限にも現れます。エージェントは情報収集は許可されていても最終決定はできない場合があります。いくつかのハンドオフの後、下流エージェントが情報を受け取っても、元のタスクに付随していた権限制限を保持していないことがあります。各ステップは合理的に見えても、全体のシーケンスは意図されたビジネスプロセスに違反していることがあります。コンテキストも同様の問題を引き起こします。ワークフローの最初の段階で重要だった情報が、数ステップ後に要約、変換、あるいは省略されることがあります。下流エージェントはもはやその情報を持たないため、正しく推論できても正しい結論に至れません。これらの失敗は、信頼性の単位を拡大する必要があることを示唆しています。私たちは、モデルの応答が正しいかどうかを問うことで評価を続けます。エージェントがタスクを正しく完了したかどうかを問うことでエージェントを評価します。しかし、ワークフローのレベルでは、情報、権限、ポリシーが一連のアクションを通じて維持されたかどうかが問題になります。ビジネスレベルでは、最終結果が正しくかつ許可されたものであるかが問題になります。これは、 NIST AIリスク管理フレームワークにおけるより広範なライフサイクル視点とも一致しており、AIリスクの継続的な測定と管理を強調し、導入前の一回限りの評価として扱わないことを示しています。ここからエージェント運用が始まりますAIガバナンス、モデル評価、LLMOps、可観測性、セキュリティ、そして責任あるAIは、すでにAIシステムの運用における重要な部分に対処しています。エージェントオペレーションはこれらの分野に取って代わるものではありません。自律的および半自律的なシステムがビジネスプロセスに直接関与し始めたときに重要になる運用層に取り組みます。エージェントオペレーションとは、実際のビジネスプロセス内で自律的および半自律的なAIシステムを運用する学問であり、実行中に権限、コンテキスト、意思決定、例外、人間の介入、そして説明責任がどのように管理されるかを含みます。この区別が重要なのは、管理対象がもはや単なるモデルではなくなるからです。ソフトウェアが独立して意思決定や行動を行える継続的なビジネスプロセスなのです。実際には、これにより別の運用上の質問が生じます。エージェントに許可されている行動は何か?長期間にわたるワークフロー全体で保持すべきビジネスコンテキストは何か?新たな証拠が以前の決定を無効にした場合、どうなるか?個々に許容できる行動が集合的にポリシーに違反していることを組織はどのように検知できるか?エージェントはいつ継続し、いつ一時停止、停止、またはエスカレーションすべきか?数か月後に、組織は特定の決定がなされた理由を再構築できるでしょうか?所有権の問題もあります。エージェントが技術的なタスクを正しく実行してもビジネス結果が誤っている場合、失敗の責任は誰にあるのでしょうか?エージェントに実行を委任しても、組織の説明責任が委譲されるわけではありません。エージェントが作業を実行することはあっても、結果の所有権は企業に残ります。目標は制御された自律性ですエージェントAIの未来は、しばしば完全な自律性への進展として描かれ、人間がビジネスワークフローから徐々に姿を消すとされています。多くの企業にとって、それはおそらく誤った目標です。より有用な目標は 制御された自律性。現在の多くのAI支援プロセスは、エージェントが行動を提案し、人が最終決定を下すというパターンに従っています。信頼が高まるにつれ、いくつかのワークフローではエージェントが定義された権限内で意思決定を行い、周囲のシステムが実行を監督し、人間が例外を処理するようになります。成熟した低リスクのワークフローでは、最終的にエージェントが独立して判断・行動できるようになる一方で、重要な決定は引き続き監視・記録されます。図5:自律性のレベル上昇適切な境界はプロセスごとに異なります。銀行は文書分類においてかなりの自律性を許可しつつ、信用決定に関しては厳格な管理を要求するかもしれません。保険会社は日常的な請求処理を自動化し、異常な証拠の組み合わせはエスカレーションするでしょう。医療機関はエージェントに情報の収集と要約を任せ、重要な決定は人間が行うようにするかもしれません。したがって重要な質問は、エージェントがどれだけ自律的になれるかではなく、組織がどれだけの自律性を責任を持って運用できるかです。これによりコントロールの役割も変わります。コントロールは必ずしも自律性を削減する手段ではありません。適切に実施すれば、組織はより自信を持って自律性を拡大できるようになります。エージェントの運用は構築よりも難しくなる可能性があるモデルは引き続き改善されます。ツールの活用も向上し、エージェントフレームワークも進化します。推論能力も向上し、現在困難に見える多くの課題は最終的に日常的なものとなるでしょう。しかし、優れたモデルであってもビジネスポリシー、変化するコンテキスト、例外、組織の境界、説明責任を排除することはできません。むしろ、より優れたエージェントはこれらの問題をより重要にします。自律的に行動できないシステムは運用権限が限定的です。数千件のビジネス決定を実行できるシステムは、全く異なる責任を伴います。このため、エンタープライズAIの次のフェーズは、どの組織が最も多くのエージェントを展開するかでは決まらないかもしれません。むしろ、エージェントの運用方法を学んだ組織が決定的になるでしょう。最初の80%はエージェントが機能することを示し、残りの20%が企業がビジネスに対してそれを信頼できるかどうかを決定します。エージェントがより高性能になるにつれ、企業を定義する質問は我々のエージェントは何ができるかから、より難しいものへと変わる可能性があります:我々はどのような条件下でエージェントに何をさせることを許容し、条件が変化したときにそれをどのように把握するのでしょうか?そこがエージェントオペレーションが始まる地点です。
著者 Rajesh Gupta, 共同創業者 & CEO、RunCtrl
-

ソートリーダーZero-Trust KYC Manifesto:アイデンティティ検証を再構築するための4つの原則
ユーザーが一度だけ本人確認を行い、デジタル資格情報がサービス間を自由に行き来し、KYC(顧客確認)が背景に溶け込むというデジタル未来像が広く語られています。このような状況が今日の敵対的なデジタル環境では不可能であることは容易に想像できます。このアプローチは不要な転送を生むだけでなく、身元データの露出範囲をはるかに広げてしまいます。実際、KYCは 避けられない、したがってより高速に、より安全に、よりプライベートに、より透明に、そしてより回復力のあるものへと進化しなければなりません。多くのプロバイダーがこれらの特性を実現しようと努力していますが、KYC業界の多くが進んでいる方向は、その限界をますます露呈させています。業界がこの状況に至ったのは、クラウドインフラストラクチャ、AIモデル、ベンダー、下請け業者、管理者、そしてKYCプロセスに関わる多くの関係者を引き続き信頼できるという前提に基づく壊れた信頼モデルです。頻繁に増えている現象として、州レベルのシステムでさえ 身元データを保護できていない – 人が提供できる最も機微な情報の一つ – 外部プラットフォームや請負業者、内部アクセス制御に信頼を置いた後に起こります。 このため、OCR Studio は Zero-Trust KYC Manifesto を作成しました – 安全な次世代KYCシステムを構築するための原則セットです。本稿ではZero-Trust KYCが何を意味するのか、そしてそれが今日と明日の現実に対して唯一実行可能なモデルであると考える理由を説明します。Zero-Trust KYCとは何かZero-Trust KYCは、コンポーネント、ベンダー、デバイス、モデル、またはインフラ層がデフォルトで信頼されないことを意味します。このアプローチに沿ったシステムは、既存のアーキテクチャが移動を便利にするだけで、機微な身元データが引き渡されたり、転送されたり、コピーされたり、露出したりしないように設計されなければなりません。データは、その移動が本質的に必要であり、明確に正当化できる場合にのみ移動可能です。したがって、Zero-Trust KYCプロセスのすべての要素は目的に紐づき、管理され、検証可能でなければなりません。あるステップがその存在理由、使用するデータ、データの行き先、最終結果への影響を説明できない場合、それはKYCプロセスの一部であるべきではありません。KYCから信頼を除くことは、単なる多数のアプローチの一つではありません。唯一の選択肢であり、業界が自ら作り出した構造的制限に対処できるものです。このアプローチを実用的にするために、Zero-Trust KYC Manifestoは4つの譲れない原則を定めています。原則1:身元データは提示時点に留まるべきであるZero-Trust KYCでは、機微な身元データ(身分証明書の画像、セルフィーや顔画像、その他すべての個人識別子)は、ユーザーが提示するその地点に留まらなければなりません。論理はシンプルです:最も安全なデータ転送は、そもそも行われない転送です。不要な身元データの移動はすべて、データが保持、コピー、記録、傍受、または本来見るべきでない者にアクセスされる可能性のある新たなポイントを生み出します。オンプレミス展開さえも最終目標ではありません。サーバー側処理が本当に避けられないケースにおける最低限受容可能なインフラ層です。Zero-Trust KYCはさらに進む必要があり、技術的に可能な限りデバイス上またはブラウザ内での処理へと移行すべきです。原則2:KYCはウェブネイティブであるべきデジタルインタラクションの未来はウェブ上にあり、KYCはその現実に合わせて構築されなければなりません。ユーザーがブラウザでオンボーディングを開始した場合、身元確認は同じブラウザセッション内で継続すべきであり、QRコードをスキャンさせたり、電話に切り替えさせたり、別のモバイルフローに移行させるべきではありません。デスクトップで開始し、すぐにユーザーをスマートフォンへリダイレクトするプロセスは、デバイス間に別の制御されていない信頼ポイントを作り出します。真のウェブネイティブKYCとは、検証スタック全体がブラウザセッション内で利用可能であることを意味します。ブラウザは、文書のキャプチャ、画像品質評価、OCR、MRZおよびバーコード読み取り、文書の真正性チェック、顔照合、活体検出、詐欺防止を、プロセスの機微な部分を別環境に委ねることなく処理できなければなりません。原則3:詐欺防止は証拠ベースであるべきZero-Trust KYCはすべての決定を説明しなければならず、各詐欺評価は証拠に遡って追跡可能である必要があります。リスクスコアはリスクを生み出した要因を示し、警告はそれを引き起こしたシグナルを特定し、拒否は何が失敗したかを説明しなければなりません。証拠がなければ、組織は決定を適切に監査できず、規制当局の前で防御できず、顧客に説明できず、検証プロセスを改善できません。単にベンダーの結論を信頼せざるを得ず、今回は顧客オンボーディングの最も機微なポイントの一つである別のブラックボックスに直面することになります。Zero-Trust KYCにおいて、「AIが否定した」は決定モデルではありません。それは決定モデルが存在しないことを意味します。原則4:KYCは実世界向けに設計されなければならない理想的な条件は存在せず、KYCは完璧な照明、きれいな書類、安定したネットワーク、高性能カメラ、そしてすべての指示を正確に守るユーザーだけを対象に設計することはできません。実際の本人確認は、眩しさ、ぼやけ、影、切り取られたフレーム、圧縮、不安定な手、低性能デバイス、弱い接続、摩耗した書類、そして撮影エラーとともに行われます。Zero-Trust...
著者 Vladimir V. Arlazarov, D.Sc, 創設者 & CEO、OCR Studio
-

ソートリーダーフォームは見た目は正しいが、データ契約は間違っている。
問題は、AIが作成したフォームが本番準備ができているように見えるかどうかではなく、そのデータを受け取るシステムが同意するかどうかです。日付ピッカーは見た目は完璧でも、APIがISO日付を期待しているのにロケール依存の文字列を送信することがあります。チェックボックスは「はい」または「いいえ」を示すかもしれませんが、データベースはブール値を期待しています。デモは通過し、スクリーンショットはきれいに見えても、失敗は下流で待ち受けています。フォームは実際に何を約束しているのか?フォーム設計は通常、インターフェースの問題として評価されます。ラベルはユーザーにとって理解しやすいか?タブ順序は妥当か?ページはモバイルで正しく動作するか?これらの質問は重要ですが、仕事全体を説明しているわけではありません。フォームは、別のシステムが解釈できる形で構造化データを提供することも約束します。この約束は、フィールド名、データ型、必須値、許容オプション、デフォルト、識別子、そして宛先マッピングを含みます。受信側システムを変更せずにそのうちの一つだけを変えると、洗練されたインターフェースでも信頼性の低い統合になり得ます。その境界は、生成AI文書自動化がテキストの下書き作成を超えて構造化文書やインタラクティブコンポーネントの生成に移行するにつれて見えにくくなります。生成は、モデルが短い説明から妥当なレイアウトを推測できるため高速です。ただし、妥当であることは互換性があることと同じではありません。IETF JSON Schema ワーキンググループのアクティブなInternet-Draft(最終更新日:2026年8月26日)は、スキーマを受け入れられる JSON 値を制限する規則の集合として説明しています。また、UI レンダラーなどの生成的利用についても論じています。この組み合わせが問題の核心です。同じスキーマはインターフェース作成に役立つかもしれませんが、バリデーションは生成された入力が受け入れられる集合に属するかどうかを判断しなければなりません。なぜ契約はずれ込むのか?AI は明らかに壊れたコードを生成する必要はなく、システムが共有していないと合理的に仮定できるだけで、悪い契約を作り出すことがあります。「Customer ID」とラベル付けされたフィールドを持つオンボーディングフォームを想像してください。モデルはそのフィールドを customer_id と命名し、妥当な名前に見えます。しかし、既存の API は依然として account_number を期待しています。すべてのテストユーザーはボックスに入力できますが、統合が予期しないプロパティを拒否または変換しなければ、識別子は正しいレコードに届かない可能性があります。型も同様の不一致を引き起こします。空のフィールドは空文字列、null、あるいはプロパティ自体が存在しない形で届くことがあります。数値がテキストとして届くこともあります。ドロップダウンはユーザーフレンドリーなラベルを表示しますが、受信側システムは安定したコードを期待しています。OpenAPI 3.2.0 は入力と出力データ型を定義するSchema Objects を使用し、チームに画面上の見た目に頼らずフォームと比較できる機械可読の記述を提供します。依存関係はユーザーの選択の背後に隠れるため見落としやすくなります。国を選択すると州・県・地域フィールドが必須になることがあります。「個人」ではなく「会社」を選ぶと登録番号が必要になることがあります。JSON Schema の条件付きバリデーションは、依存要件や条件付きサブスキーマを通じてこれらの関係を表現できますが、生成されたフォームは同じルールを実装しなければなりません。フィールド名、型、値、プロパティを公開する開発者向けツールは、PDFフォームフィールドバリデーション を最終段階のビジュアルチェックではなくビルドプロセスの一部にします。これはスキーマバリデータや API 契約テストの代替にはなりませんが、開発者にテストが検査すべきフォーム側オブジェクトへの制御権を提供します。ずれの別の原因があります。フォームと契約は最初は一致していても、異なるスケジュールで変更されることがあります。プロンプトが改訂され、フィールドラベルが名前変更され、API がオプションを削除したり新しい必須プロパティを導入したりします。レイアウトの破損に気付かないため、変更は無害に見えるのです。そうではありません。ハッピーパス以外をどのようにテストするか?成功した送信は、ある値の組み合わせが一度機能したことを証明します。実運用のフォームはより厳しい検証が必要です。スクリーンショットではなくペイロードから始めます。既知の正常な例を送信し、実際のシリアライズ出力を契約と比較します。プロパティ名、型、ネスト構造、許容値をチェックします。その後、そのペイロードを実際の統合に通し、同じ値が CRM、ERP、データベースへ往復し、任意のレビュー画面に戻っても保持されていることを確認します。次のテストは失敗するように設計すべきです。必須値が欠如しているケース、null...
著者 Gary Espinosa
-

ソートリーダー調達がAIの最も強力な規制ツールになる理由
AI立法への関心が高まる中、テクノロジーを規制する最も重要な規則のいくつかは、実に予想外の場所、すなわち調達部門から生まれる可能性があります。米国における多くの規制の始まりと同様に、カリフォルニア州は早期の例を示しています。州は生成AIを使用する製品やサービスの購入に対し、具体的な要件を設けました。州機関はGenAIの購入に伴うリスクを評価し、中リスク・高リスクの利用にはカリフォルニア州テクノロジー局(CDT)の追加審査が行われます。入札要項にはGenAIの開示文言が必要で、AIが製品やサービスに付随するものであってもベンダーはその使用を開示しなければならない場合があります。さらに興味深いのは、取引完了後に何が起こるかです。GenAI調達ガイダンス初回購入を超えて監視を拡大します。契約管理者は、技術の特定の変更が新たなリスク評価を引き起こす可能性があるため、時間とともにGenAI技術を監視することが求められます。これはベンダーにとって状況を変えます。調達を通過することがもはやセキュリティ質問票に回答し、いくつかの文書を提出するだけの問題ではなくなるからです。AIガバナンスはカリフォルニアで事業を行うための参入コストの一部となりつつあります。そして、これはカリフォルニアの現状であるものの、連邦法が整備されていない場合、他州にも波及することが多く、企業がこれをカリフォルニアの調達問題とだけ捉えるのは短絡的です。買い手が規則を作り始めるとき調達部門はなぜAIガバナンスの最前線となったのでしょうか。政府は法案の議論に何年も費やすことがありますが、調達規則はより機敏です。なぜなら、対象がはるかに直接的で、契約を欲するすべての者に向けられているからです。包括的なAI法制がない中で、買い手はAIに関する独自の期待基準を設定する別の方法を見出しました。ベンダーの技術使用について何を知る必要があるか、どのような証拠を求めるか、契約締結前に受容できるリスクのレベルを決定できます。特に政府や大企業といった大規模な買い手にとって、これらの要件はかなりの重みを持ちます。民間セクターの調達チームにも、AIがどこで使用されているか、適切な管理が行われていることを示す証拠はあるかといった質問を始める独自の理由があります。企業はすでにサプライヤーのセキュリティとプライバシー慣行を検証するのにかなりの時間を費やしています。AIの導入は、ベンダーにデータを委ねる、技術を重要なプロセスに組み込む、あるいは顧客や従業員に影響を与える意思決定をさせる前に、買い手が理解すべき新たなリスク群を加えることになります。あなたのAIリスクは他者に帰属する可能性がありますカリフォルニア州のアプローチで特に重要なのは、組織のAI利用を明確に区切ることがいかに困難になったかを認識している点です。自社のAI製品を購入した場合でも、コンサルティング会社が提供するサービスと協働する場合でも、単にクラウドサービスを利用する場合でも、AIは組織やサプライチェーンに組み込まれています。カリフォルニア州の調達プロセスはこの一部を考慮しています。IT・非ITのGenAIを含む購入、技術を使用するコンサルタントを対象とし、調達時にGenAIが特定された場合にはリスク評価を求めています。このプロセスは、サイバーセキュリティチームが、自社システムの保護だけでは不十分で、データやインフラにアクセスできるサプライヤーの管理が甘い場合があると認識した時と似ています。その認識により、サードパーティのサイバーセキュリティがベンダーリスク管理の重要な要素となり、AIも同様の方向へ向かっているようです。また、セキュリティ、プライバシー、AIガバナンス、そして新たに生じるすべてのコンプライアンス義務のために別々のプログラムを構築している組織にとっては、厄介な問題を生み出します。リスクは組織の境界を尊重せず、AIアプリケーションは同時にプライバシー問題、セキュリティ上の脆弱性、規制上の義務を引き起こす可能性があります。それを統治するために別のサイロを構築すると、抜け落ちる箇所がさらに増えるだけです。コンプライアンスを一度証明することの難しさすでに複雑な課題に加えて、AIは変化します。モデルが更新され、ベンダーが新機能を提供し、従業員が購入時には想定されていなかったツールの活用法を見つけ、データも変化します。この流動性により、規制も変化する必要があります。しかし、多くのコンプライアンス活動は依然として特定の時点に基づいて構築されています。監査が来るので証拠を収集し、顧客が質問票を送付すれば誰かが回答を探し、新たな要件が出てくれば別のコンプライアンスプロジェクトが始まります。このアプローチはすでに手間がかかりますが、AIが加わると防御がますます困難になります。製品購入時に実施されたリスク評価は当時は正確でも、1年後には大幅に時代遅れになる可能性があります。カリフォルニア州はこれを認識しているようで、契約監視ガイダンスは、誤った出力、捏造されたコンテンツ、バイアスを含むGenAI成果物の継続的な評価を求めています。以前はCDTの相談が必要だった契約におけるGenAI技術の変更や追加も、再評価が必要になる場合があります。このNIST AI Risk Management FrameworkはAIリスク管理に対して同様の見解を示し、AIライフサイクル全体にわたる継続的なプロセスとして扱います。これを実施するには、次の監査に備えて準備し、終了後に安堵の息をつくことに慣れた組織とは異なる考え方が求められます。調達は証拠を求め、慌てることはない自動化されたコンプライアンスへの関心は高まっており、特に企業が増加するセキュリティ、プライバシー、AI要件に追随しようとする中で顕著です。その魅力は理解できるものの、効率性とガバナンスを混同したときに危険が生じます。ワークフローを完了しただけでは、根本的なリスクが変化したかどうかは分かりません。例えば、6か月前には特定のサービスでAIを使用していなかったベンダーが、現在は使用している可能性があります。これがコンプライアンスがゴールではなくループとして機能すべき理由です。組織は何を統治しているかを把握し、コントロールが本来の機能を継続しているかを確認し、出てきた新たなリスクや要件をプロセスに組み込む必要があります。適切に実施すれば、調達はかなり楽になります。顧客がAIの統治方法を尋ねたとき、答えは昨年誰かが監査用に作成した文書にあるわけではありません。実際にリスクがどのように管理されているかを示す現在進行形の証拠が蓄積されており、これは商業的に重要性を増しています。カリフォルニア州は、調達がAIガバナンスの原則を、ビジネスを獲得したいベンダーが実際に遵守しなければならない要件へと転換できることを示しています。他の公共部門の購買者も同様にでき、エンタープライズの調達チームは自社のサプライヤーに対してより厳しい質問を投げかけるインセンティブが豊富にあります。企業は最終的に、AIガバナンスが単に規制当局の要求だから行うものではないことに気付くかもしれません。調達チームが証明を求めることを決定すれば、ビジネス獲得のために喜んでそれを行うでしょう。
著者 Sam Peters, 最高プロダクト責任者、IO
-

ソートリーダーAIパイロットでの損失を止める方法:3つのミスと代わりにすべきこと
ここ数年、金融業界は人工知能の導入を急いでいます。企業はますますモデルを購入し、ベンダーと契約を結んでいますが、ほとんど成果が得られないか、恐ろしい結果になることもあります。昨年発表されたMITの研究によると、95%の企業AIパイロットは企業の利益に測定可能な効果をもたらしていません。同時に支出は急増しており、昨年世界全体でAIに 1.76兆ドル を費やしたと推定され、2026年にはこの数字が 2.59兆 にまで増えると予想されています。したがって、投入された資金と回収される資金には大きな差があり、コストはほぼ無駄に上昇し続けています。しかし、問題は技術が弱いことではありません。AIモデルは年々賢くなっており、OpenAIは決定したほどに、行き過ぎないよう開発を保留しています。したがって、このケースでの本当の欠点は、これらの技術を効果的に活用できる運用モデルが欠如していることです。パイロットを持つという錯覚AI統合の規模が非常に大きいため、ほぼすべてのフィンテックや従来の金融会社が最近、たとえば顧客向けチャットボットなど、少なくとも1つのAIパイロットを開始しています。しかし、何を立ち上げても、これらの事例は総じてかなり不快な結末を迎えます。すべては、特定のチームが管理されたテスト条件下でうまく機能する概念実証を構築することから始まります。そのデモの後、経営陣は感銘を受けて導入を許可しますが、やがてプロジェクトは崩壊するか、効果がないことが判明します。では、なぜでしょうか?もちろん、すべての社内AIプロジェクトが失敗するわけではありません。もしそうなれば、MLエンジニアがいなくなり、技術は無用のものとなります。しかし、この失敗サイクルを何度も目にしてきたので、その根本原因はよく分かっています。要するに、パイロット自体が、たとえうまく作られていても、日常のビジネスの実際の働き方や機能に合うよう設計されていないのです。結果として、単独で優秀に機能するモデルは実務に投入されると、レガシーなインフラや技術の扱い方すら分からない従業員に直面します。しかし、これらの障壁はより賢いアルゴリズムでは解決できません。すべては経営判断でのみ解決できるものであり、データサイエンティストの責任範囲ではありません。できるだけ避けたいいくつかのミス企業でAIをより効果的に統合する方法を見る前に、途中で起こり得る他のミスについて考えてみましょう。すでに間接的に触れたように、最初で最も重要な失敗は、プロセスを再構築せずにAIを付加的なものとして扱うことです。実際、多くの企業は既存のワークフローにAIツールを単に1つのステップに埋め込むだけで、AIがそのプロセスで意味を持つかどうかすら検討していません。そこで、マネージャーとしてまず自問すべきは、このプロセスはそもそも自社に必要だったのか、ということです。自動化前にワークフローが非効率であったなら、導入後も同様に非効率なままでしょう。むしろ悪化する可能性があります。なぜなら、AIは覚えている負のパターンを記憶し、繰り返すことがあるからです。次のミスは、マネージャーがコンプライアンスとガバナンスの負担を過小評価することです。金融サービスはあらゆる業界の中で最も厳しい規制圧力に直面しており、例えばコンプライアンス部門全体をAIで自動化することはできません。直接的なサービス提供やポートフォリオ管理でも同様です。普遍的な真実のように思えますが、実際に多くの創業者がこの点で失敗していることに驚くでしょう。最後に、しかし重要なのは、多くの企業がAI導入に向けた従業員のトレーニングを忘れていることです。技術が従業員の業務を代替すると、まず人員削減が本能的に選ばれがちです。なぜなら、少人数でも多くのタスクをより速くこなせるからです。短期的にはコスト削減になりますが、非常に短絡的です。本当の価値を求めるなら、別の質問を自問してください。ルーティンから解放された今、私たちのスタッフはどのような上位レベルの業務ができるでしょうか?現在のスキルとモチベーションでそれに対応できるでしょうか?月曜から始めるべき、効率向上の取り組みまず最初のステップとして、停止中のAIパイロットを監査しましょう。つまり、既存の案件を適切に処理するまで新しいアイデアを導入しないことです。ケースの90%で問題は責任の欠如、つまりスケールに対して明確に責任を持つ人物がいないことです。したがって、所有権を割り当てましょう。すでにAI管理者がいる場合、次のステップはプロセスを見直し、全体を再構築することです。既存のワークフローに単にAIを追加するだけではいけません。むしろ、AIが一次分析を行えることを前提に、今日ゼロから設計するとしたらこのプロセスはどうなるかを問うべきです。答えは思ったよりずっとシンプルなことが多いです。また、AIモデルがもたらす実際の数値を算出することを忘れないでください。導入から6か月後に、モデルの効果を示す具体的な数値(例:削減した時間や増加した利益)を示せない場合、期待通りに機能していないことになるので、価値を再評価した方が良いでしょう。そして、おそらく最も重要なのは、人を解雇しないことです。特に責任者や常に誠実に仕事をしてきた人はなおさらです。もし従業員が会社にもたらす収益が1年で得られる給与を上回る場合、解雇はすぐに問題となります。また、これを理解しない企業は組織の知識やチームの信頼を失い、結果としてはるかに大きなコストを被ります。総合すると、パイロットの95%が結果に至らないのは、技術が失敗したからではありません。組織が変わらず旧態依然としているために成功しないのです。これが最初に変えるべき唯一の変数です。
著者 Eugenia Mykuliak, 創業者、B2PRIME Group
-

ソートリーダーAI データが証拠になるとき
ほとんどの組織は使用している AI ツールを特定できます。より難しい問題は、これらのシステムがアクセスした企業データ、受け取った指示、返した結果、そしてどのポリシーがやり取りを統制していたかという信頼できる記録を作成できるかどうかです。そのギャップはパイロット段階では隠れたままになることがあります。規制当局が質問し、顧客が決定に異議を唱え、または訴訟でシステムが精査されると、明らかになります。その時点で、監査トレイルは存在するか、存在しないかのどちらかです。米国には包括的な単一の連邦 AI 法律はありませんが、既存のプライバシー、証券、差別禁止、記録保持、開示要件は依然として AI データに適用され得ます。新たな AI 固有の法律がさらに層を加えます。すべての規則が確定するのを待つことはリスクを誤解しています。法律は技術を待たない裁判所は以前からこの問題に対処してきました。電子メールは、確立された記録保持および開示法により証拠として扱われるようになり、全く新しい法的枠組みではありません。Zubulake litigationにおいて、裁判所は組織が電子メッセージを保存・管理する方法に対して保存義務と開示義務を適用しました。これらの判決は、デジタル記録に対する現代的な期待を定義するのに役立ちました。AI データは同様の道筋をたどる可能性があります。プロンプトには機密情報が含まれることがあります。出力は雇用決定、顧客とのやり取り、契約に影響を与えることがあります。エージェントは複数のシステムから記録を取得してから行動を推奨することがあります。その活動が争点となった場合、弁護士や規制当局はシステムがアクセスできたもの、使用したもの、組織が保持した記録は何かを尋ねます。このSecurities and Exchange Commissionは既存の証券法を利用していますは、AI の使用について誤解を招く主張をした企業に対して使用されています。州の検事総長は消費者保護およびプライバシー当局に依拠でき、裁判所は確立された開示および証拠規則を適用できます。AI 固有の要件はその方向性を強化します。EU AI Actは段階的に義務を導入しており、ColoradoとTexasは文書化、透明性、執行規定を確立しています。詳細は異なりますが、期待は一貫しています:組織は AI がデータをどのように使用するかを理解し、適切な管理が行われていることを示さなければなりません。記録は出力の前に始まるAI の出力を全体の記録とみなすのは誤りです。出力だけでは結論に至ったプロセスは説明できません。防御可能な記録には、プロンプトまたは指示、アクセスした情報源、ユーザーまたはエージェントの権限、そして当時有効だったポリシーも必要です。トレーニングデータと運用データもそれぞれ異なる管理が必要です。モデルをトレーニングまたはファインチューニングする組織は、これらのデータセットの出所と許可された使用方法を理解しなければなりません。従業員やエージェントがサードパーティモデルを使用する場合、直ちに問われるのはどの企業データが投入または取得されたかです。組織は基盤モデルのトレーニングセット内のすべての語句を追跡できないかもしれませんが、管理下にあるデータとプロセスについては説明責任を負う必要があります。企業データはほとんどの場合、単一のクリーンなリポジトリに存在しません。運用プラットフォーム、コミュニケーション、共有コンテンツ、レガシーアプリケーションに分散しています。AI はその断片化の影響を拡大します。エージェントは人間よりも迅速に情報を取得できるかもしれませんが、同時に一貫性のないアクセス権、保持ポリシー、データ分類も引き継ぎます。AI のやり取りは記録として管理される必要がある組織はすでにメール、チャット、その他の規制対象コミュニケーションを記録しています。生成 AI のビジネス利用にも同様の規律が必要です。プロンプトと出力は作成時に記録され、保持、セキュリティ、法的保留、開示、そして防御可能な処分のポリシーの対象となるべきです。記録にはコンテキストも必要です:誰が、あるいは何がやり取りを開始したか、どのモデルが使用されたか、アクセスした情報源は何に基づいていたか、どのようなアクションが続いたか、そしてどのポリシーが適用されたか。これらのコンテキストがなければ、プロンプトと応答のアーカイブだけでは何が起きたかを説明できないことがあります。これらの管理はデータ自体から始まります。分類、保持、法的保留、アクセス権、出所、監査ログは情報が統制環境に入る段階で適用すべきです。AI システムは、利用可能なすべてのデータに広範にアクセスするのではなく、ポリシーで管理されたデータを使用して動作すべきです。ディスカバリー時にガバナンスを追加することはできない召喚状、規制当局の調査、または苦情が届くと、組織は数か月前に存在した正確な権限、データバージョン、AI...
著者 Jerry Caviston, 最高経営責任者、Archive360
-

ソートリーダーAIはこれら4つの重要なスキルを置き換えることはできません
コンサルティング会社、テクノロジーサービス企業、税務・監査事務所などを含むプロフェッショナルサービス組織は、常に自らの思考力の強さで競争してきました。しかし、その方程式は変わりつつあります。製造業やホスピタリティ業界のような分野では、AIは主に製品を支えるタスクを自動化しています。プロフェッショナルサービスにおいては、AIはますます製品そのもの、すなわち顧客が支払う専門知識、分析、提言に関わるようになっています。この業界では人間のスキルに関する問題が特に緊急である理由です。World Economic Forumの2025 Future of Jobs Reportによると、既存のスキルの39%が2030年までに変容するか時代遅れになると見積もられており、その多くはAIが牽引しています。サービス組織は多くの業界よりも早く、より顕著に影響を受ける可能性があります。実際、2026 Global Service Dynamics Reportは、テクノロジーが急速に業界を変革する中で、次の12か月間にAIスペシャリストの採用を高い優先事項と考えるサービス企業が82%に上ることを明らかにしています。HRはその変革を遅らせることはできません。できることは、誰がそれに備えているかを判断する支援をすることです。私が自分の役割で繰り返し考える質問は、AIが実行作業の多くを担う中で、組織をより強くするために今日人々に意図的に育成すべき能力は何か、ということです。技術変化の速度は明らかです。人材への投資先を決めることはそれほど明快ではありません。私にとって特に際立っているのはこの4つの能力です。仕事の管理から人材育成へAIがタスク割り当て、進捗追跡、一次分析を担うにつれ、これらの業務に多くの時間を費やすマネージャーは、その仕事から得られるリターンが減少していくでしょう。彼らの価値は、ますます自動化が難しい領域、すなわち人々の成長支援へとシフトしていきます。HRにとっては、優れたマネージャーとは何かを、研修プログラムや役割期待からパフォーマンス測定の方法に至るまで再考することを意味します。マネージャーのコーチングの質は、AIが豊富に活用される職場における効果的な育成像を反映した基準で支えられる、意味のあるパフォーマンス指標となるべきです。AIが生成した回答を信頼すべきか、さらに調査すべきかを判断しようとする若手コンサルタントを想像してください。その従業員がその判断力を育む支援は、現在、マネジメントの重要な要素となっています。チームに対して明確な育成パスを示すリーダーは、従来の稼働率や利益率目標と同様に評価されるべきです。Deloitteの2026年の調査(1,394人の従業員を対象)によると、ハイパフォーマンスチームのメンバーは、チームが徒弟制度の文化を促進していると答える確率が約3倍高く、40%対15%となっています。さらに、68%が互いに学び合い成長するために積極的に時間を割いていると報告しています。ハイパフォーマンスチームはAIの利用率も高く、78%対54%ですが、重要な違いは単に使用する技術ではなく、チームメンバー同士がどのように協働し、互いに育成し合うかにあります。不確実性下での判断AIはシナリオを評価し、潜在的な選択肢を特定し、リスクのパターンを浮き彫りにできます。しかし、意思決定の結果に対する責任は人間に残ります。プロフェッショナルサービスの仕事は、常に不完全な情報の中で健全な判断を下すことに依存してきました。したがって、最も強固な組織はこの方程式の両側に投資する必要があります。曖昧さを乗り越えるために必要な人間の判断力を育成すると同時に、不完全な情報をより明確な業務像に変えるテクノロジーを導入することです。その判断の中でますます重要になるのは、人間の専門家、AIエージェント、そして自動化されたワークフローが共存するハイブリッド環境でどのように機能すべきかを知ることです。このような環境で成功するプロフェッショナルは、どの意思決定が人間主導であるべきか、どれがAIの入力で利益を得られるか、そしてどの引き継ぎが品質ゲートやエスカレーションパスを必要とするかを理解しています。これらの境界を慎重に定めることは、独自のリーダーシップ能力として重要になっています。HRはそれを職務プロファイルやコンピテンシーモデルに明示的に組み込むべきです。HRは、知的謙虚さ(新しいデータに直面したときに自らの前提を問い直す姿勢)と批判的思考(AIが生成した洞察が完全で適切かどうかを検証する能力)という2つの具体的特性を強調することで、これらのモデルを実践的に活用できます。これらの期待は、継続的なパフォーマンス評価の一部にもなります。単に意思決定の結果だけを評価するのではなく、リーダーに意思決定プロセスを説明させることができます。すなわち、AIに依存した箇所、AIの提言に挑戦した箇所、データと人間の文脈をどのようにバランスさせたかです。戦略的判断は、リーダーに難しい決断を繰り返し行わせ、その決断に責任を持たせることで育まれます。この能力を構築する近道はありません。信頼は競争上の優位性になるすべての企業が同様のAIツールにアクセスできるようになると、実行はクライアントが比較しやすくなります。しかし、テーブルの向こう側にいる人々がクライアントに理解されていると感じさせるかどうかを比較することははるかに難しいです。そのため、関係性の質が更新、紹介、そしてスコープ拡大においてますます重要な差別化要因となります。HRは、関係構築能力を時間とともに自然に現れるものと想定せず、意図的に育成できるスキルとして扱うべきです。クライアントの傾聴、コンフリクトの調整、ステークホルダーの信頼は、すべてプロフェッショナル開発の核心要素となるべきです。パフォーマンス指標は、Net Promoter Score を超えて、リーダーが困難な状況でどのように対応するかも評価する必要があるかもしれません。具体的には、困難なリストラの会話を進めることや、AI導入に伴う役割変更を説明すること、あるいはクライアントと向き合い「AIが誤った判断をしたので、こう対処します」と伝えることが含まれます。雇用主はすでにこれらの能力の重要性を認識しています。World Economic Forum の2025年版『Future of Jobs Report』によれば、2030年までに重要性が高まると予測される上位スキルは、レジリエンス、共感的リーダーシップ、創造的思考、自己認識です。これらはすべて根本的に人間的な能力であり、技術的なものはありません。これらのスキルを体系的に育成する組織は、AIツールでは容易に再現できない関係性の優位性を築くことができます。AI環境での学習と実験AIの能力は急速に変化しています。数か月ごとに新しいツールや機能が登場し、プロジェクト管理、リソース計画、クライアントエンゲージメントの手法が刷新されます。常に質問を投げかけ、新しいアプローチを試し、得た知見を共有し続ける人材が、最も時代に追いつくことができるでしょう。LinkedInの2025年 Workplace Learning Reportによると、L&D専門家の91%が人間スキルの価値がかつてないほど高まっていると考えています。しかし、組織が人間スキルと技術スキルの開発に同等の重点を置いていると答えたのは半数未満でした。HRにはそのギャップに対処する実践的な方法がいくつかあります。AI環境での学び方を教えることに焦点を当てた開発プログラムは、特定のツールに基づくトレーニングよりも長く有効である可能性が高いです。従業員に実務に近いがリスクの低い作業でAIを試せる構造化されたサンドボックスを提供することも、学習を加速させます。組織は、異なる領域を効果的に横断したり、クライアントへの提供に新しいワークフローを迅速に適用したりするなど、学習の敏捷性を示す従業員を認識し、昇進させることもできます。AIはプロフェッショナルサービス業界全体で実行の基準を引き上げています。すべての企業には、より速くなる機会があり、より効率的になる機会もあります。より重要な問いは、単に速いだけの組織と真に優れた組織を何が区別するかです。私は、答えはHRの責任範囲に明確にあると確信しています。AIが仕事の比率を拡大する中で、価値が減少するのではなくむしろ高まる人間的能力を意図的に構築することが求められます。
著者 Kris Kildahl, チーフ・ピープル・オフィサー、Certinia -

ソートリーダーオープンモデルはますます向上しています。経済面はますます複雑になっています。
AIモデルは明らかに18か月前よりも優れています。しかし、より深く調べ始めると、その進歩に対する従来の説明では納得できませんでした。単に規模が大きくなったからといって改善したわけではありません。「オープンソースが勝っている」は半分だけ正しいです。また、ベンチマークスコアを見るべきだという助言は、予想ほど有用ではないことが判明しました。この点を受け入れるのに時間がかかりました。そこで、8つの研究所から46モデルにわたる18か月間のデータを取得しました。インテリジェンスが商品化しつつあるか、オープンモデルが最先端に追いついているか、そして企業がシステム選定時に測定すべき指標は何かを理解したいと考えました。重要な発見は単純明快でした。ベンチマークスコアはモデルそのものの属性ではなく、モデル、ソフトウェア、周囲のコンテキスト、そして許容された時間と計算リソースを反映しています。1つの数値だけを公開すれば、残りの2つは隠されたままです。しかし、その意味合いははるかに広範です。企業は、実際に作業を遂行すべき完全なシステムを評価すべきところで、個々のモデルだけを比較しています。ベンチマークはシステムを隠す総合スコアを見るのをやめ、テストごとにモデルを比較したところ、主要なオープンウェイトモデルとプロプライエタリモデルの差は単一の数値では表せませんでした。SWE-bench Verified(多くのモデル発表で使用されてきた古いテスト)では差は0.2ポイントでした。一方、現実的で多言語のソフトウェア作業を標準化された設定で設計した新しいテスト、SWE-bench Proでは差は18.2ポイントでした。見かけ上のモデル差はベンチマークによって異なります ベンチマーク 差 ステータス SWE-bench Verified 0.2 ポイント 飽和、汚染が検出済み GPQA Diamond 2.0 ポイント 飽和、上限は約92〜95% Terminal-Bench 2.1 4.9 ポイント ライブ、エージェント的 Humanity’s Last Exam 9.8 ポイント...
著者 Jaspreet Singh, CEO & 創業者, Druva
-

ソートリーダーテック調達の進化がイノベーションサイクルに合わせて整合する方法
テック調達は静かだが重要な進化を遂げています。かつては予測可能なベンダー関係と線形の購買サイクルを前提に設計されていましたが、調達チームは現在、技術イノベーションのスピードで運用することが求められています。高度な指示型プラットフォーム、AI 主導の分析、そして自動化ツールは数年ではなく数か月で進化します。これにより、企業は新しい機能を評価・導入・スケールする方法、そして何より取引的関係から戦略的パートナーシップへの移行方法を再考せざるを得なくなっています。イノベーションを支えるために、調達機能はプロセス、ガバナンス、リスク許容度を技術の急速なリズムに合わせる必要があります。今後数年で、調達は企業が新興技術を実質的な業務上の優位性に転換する速度をますます左右するでしょう。線形購買から多層的意思決定へ数十年にわたり、調達は慣れ親しんだパターンに従ってきました。問題が表面化すると、経営陣は業界アナリストやコンサルティング会社に問題の定義、市場の評価、今後の方針の提案を依頼しました。その作業はしばしば数か月、時には数年かかり、技術が検討される前に時間が費やされました。広範なプロセス再設計が完了して初めて、調達は正式な提案依頼(RFP)を開始し、通常は公平性とコスト管理を確保するために中立的な第三者が管理しました。このモデルは当時の実情を反映していました。エンタープライズソフトウェアはゆっくりと進化し、導入サイクルは長く、切り替えコストは高かったです。例えば、小売企業は選択したソリューションが10年程度は使用される見込みであるため、意思決定に1年を費やす余裕がありました。調達の役割はガバナンス、リスク軽減、そして価格最適化に中心が置かれ、成功は速度や適応性、価値ではなく、交渉によるコスト削減で測定されました。その構造はまた、影響力を仲介者に集中させました。アナリストが候補リストを作成し、コンサルタントが要件を定義し、実装パートナーが技術の選定と展開方法をしばしば支配しました。調達は厳密さを確保しましたが、プロセス自体は重く、高コストで、組織外で進行するイノベーションのペースから乖離していました。テクノロジーサイクルの圧縮今日のテクノロジー環境は当時とはほとんど似ていません。クラウドネイティブプラットフォーム、モジュラーアーキテクチャ、継続的なソフトウェア更新により、イノベーションサイクルが劇的に短縮されました。かつては成熟に数年要した機能が、今や四半期単位で出現し、繰り返し改良されます。経営層はますます、テクノロジーがビジネスと共に進化し、固定されたロードマップに縛られないことを期待しています。この圧縮により情報の流れが変化しました。調達チームはベンダー環境を把握するために、もはやアナリストや正式な市場調査だけに依存しません。ピアネットワーク、デジタルコミュニティ、そしてAI駆動のリサーチツールがリアルタイムで比較インサイトを提供します。バイヤーは初期の対話において、どのベンダーが望む成果を提供できるかについて、より明確な仮説を持って臨むことができます。その結果、調達のフロントエンドは発見から検証へとシフトしました。企業は問題を解決できると既に信じているベンダーと関わり、調達プロセスを通じて適合性の確認、リスク評価、条件の正式化を行います。価格圧力は依然として存在しますが、同時に機能の差別化、拡張性、長期的な価値創出への重視が高まっています。このシフトはマインドセットの根本的な変化を反映しています。調達は単位コストの最小化から、選択肢の最大化へと重点が移りつつあります。スケール、適応、そして新しい機能の統合能力は、初期価格と同等の戦略的価値を持つようになりました。AI と評価の再定義人工知能は調達の進化を加速させています。テック調達チームはますますAIエージェントを活用しています、かつてアナリストやジュニアコンサルタントが担当していたタスクを実行するために。これらのツールはベンダー比較を統合し、顧客リファレンスを抽出し、機能ギャップを驚異的な速度で特定します。以前は数週間にわたるインタビューやレポートが必要だった作業が、今では非同期に、人的バイアスやスケジュール調整の制約なしに行えるようになりました。これにより評価の心理が変化します。バイヤーはベンダーと関わる前に、プライベートに自分のペースでソリューションを探ります。プレゼンテーションではなくインタラクションを通じて学び、シミュレートされたユースケースやシナリオベースの質問で前提を検証します。調達はプロセスの早い段階でより豊かなコンテキストを得ることで、より焦点を絞った生産的なエンゲージメントにつながります。AIは要件の進化の仕方も変えます。初期の探索段階で、バイヤーは当初考慮していなかった隣接する機能をしばしば発見します。基本的な監視を目的としたソリューションが、予測保守機能や自動化ワークフローを明らかにし、ビジネスケースを実質的に変えることがあります。調達が柔軟であり続けると、これらの発見は評価の範囲を再構築し、成果を向上させます。この環境では、提案依頼(RFP)は依然として役割を果たしますが、その目的は変化します。主要な探索手段として機能するのではなく、洗練ツールとなります。代替ベンダーが実質的に優れたアプローチを提供するか、あるいは当初の前提を修正する必要があるかをテストします。RFPは、より深い理解と明確な優先順位に基づき、プロセスの後半に移行します。変化のスピードに合わせたプロセスの整合調達と技術イノベーションサイクルの整合はまだ進行中です。レガシープロセスが完全に消えることはありませんが、引き続き適応していきます。正式なガバナンス、競争的評価、財務規律は、特に大規模において重要です。変わるのは、これらの仕組みがいつ、どのように適用されるかです。企業は、調達を技術イノベーションサイクルに合わせるために、以下の実践を採用すべきです。 調達チームにAI駆動の調査・評価ツールを装備し、初期段階の学習を加速させる 購買プロセスの後半にRFPを移行し、洞察を生成するのではなく検証に用いる リスク管理と迅速な実験を両立させる契約やパイロットを構築する 調達、IT、オペレーション間の横断的協働を構築し、長期的価値と総所有コストを評価する 過去の技術決定からの教訓を継続的に取り込み、将来の調達戦略に活かす 成功する企業は、インテリジェンスを早期に取り込み、選択肢を迅速に絞り、意思決定を効率的に正式化する調達プロセスを設計します。変化が常態化した技術環境で調達チームが自信を持って活動できるよう、ツールとスキルに投資します。これにより、調達はイノベーションを実務価値に変換する戦略的機能として位置付けられます。
著者 Guy Yehiav, ディジのスマートセンス社長