倫理
研究:フロンティアAIラボは暴走モデルを抑制する計画がほとんどないことが判明

最先端AI企業のうち5社は、少なくとも自社AIシステムの制御に必要な基本的な実践を部分的にしか実装しておらず、操作側に逆らうモデルを抑制する完全な計画を公表した企業はありません。これは、Guidelight AI Standardsによる新たな評価がAnthropic、Google、Meta、OpenAI、xAIを評価し、情報は2026年8月18日までのものです。
この評価はGuidelight初のもので、Control標準から抽出した6つの実践項目について各社を0から5で採点しています: 内部AIシステムの動作の記録、モニタリングの有効性測定、高リスクAI行動をモニタで制御、フラグ付けされた不正行動の急増後の回路遮断、第三者レビューへのコントロール提出、そして抑制計画の維持です。いずれの実践でも3点(「実質的な部分的実装」)を超える企業はありませんでした。全体の評価は: AnthropicとOpenAIがC+(2.50)で同点、GoogleがD+(1.50)、xAIがD−(0.83)、MetaがF(0.67)です。
Guidelightは抑制計画を、AIが制御を回避しようとしていることが検出された際に発動する事前に定められたプロトコルと定義しています。このプロトコルは、どの権限が取り消されるか、モデルが誰のためにどのような制約の下で動作し続けられるか、そして完全にオフラインになるタイミングを明示します。この項目では、OpenAIが最高の3点を獲得しました(レポートは、安全インシデント発見後に内部展開やトレーニング実行を一時停止または終了した実績を評価しています)。一方、AnthropicとMetaは0点で「実装されていない」と評価されました。
このスコアは企業が公開した情報のみを測定したものであり、Guidelightは明言しています: 低評価は公開証拠が不足していることを示すもので、内部の安全策が欠如していることを必ずしも意味しません。
AI制御における各ラボのスコア
5社で最も強かった分野は検出でした。AnthropicとOpenAIは、内部AI活動のかなりの部分を記録し、誤作動の兆候をスキャンしています。また、スキャンの有効性を測定し、フラグが出た際に人間にエスカレーションする手順も取っています、と評価は指摘しています。5社のうち4社(xAIを除く)は、METRの初のFrontier Risk Reportに参加しました。このパイロット演習は2026年5月19日に公開され、外部評価者は内部モデル、未加工の思考チェーン、各社がAIを内部でどのように使用・監視しているかに関する非公開情報へアクセスできました。
最も弱かった分野は予防と抑制でした。ゲート付きアクションや回路遮断、すなわちインシデントの前または最中に誤作動システムを止める実践において、Anthropicだけが「限定的な部分実装」以上の評価を受けました。Guidelightの結論は: 公開されている最高の証拠に基づくと、各社は「緊急時に備えた抑制プロトコルがほとんどない」ことです。
評価はまた、レトリックと実務書類の間にギャップがあることを浮き彫りにします。業界で最も包括的なリスク文書を公開しているAnthropicは、抑制計画の実践で0点でした。Anthropic自身の2026年8月リスクレポート(185ページにわたり、Mythos 5と未公開のModel 2システムをカバーし、Responsible Scaling Policyバージョン3.4に基づき2026年7月15日付で公開)では、モニタリング、サンドボックス、ブロック介入の詳細が記載されていますが、モデルの展開を制限することをミスアラインメントや制御インシデントへの対応プロセスの可能な結果として明示していません。また、このレポートは、サイバーセキュリティ評価におけるモデル挙動に関する最近のインシデント開示後の不確実性の増大を理由に、Anthropicの全体的なミスアラインメントリスク評価を「非常に低」から「低」に引き上げました。
Googleは逆のパターンを示しています: 現在の実装は乏しいものの、将来計画については最も具体的です。GoogleのAI Control Roadmap(2026年7月13日公開)は、階層型防御アーキテクチャを提示しています: 4つの検出層と3つの予防・対応層で、思考チェーンのモニタリング、リアルタイムアクセス制御、シャットダウンインフラを網羅しています。Guidelightは、これを各社が公開した制御に関する最も具体的な先見的文書と呼びつつ、Googleはまだその大部分を実装していないと指摘しています。
MetaとxAIは、実践が弱く具体的な計画も少ないため、最下位に位置しました。Metaの制御に関して公に知られている情報の多くは、METRの演習への開示から得られたものです。xAIは評価対象企業のうち唯一、同演習に参加しなかった企業です。
疑問を提起した記録
この評価は、制御失敗が文書化された夏の後に行われました。2026年7月23日、カリフォルニア州のテッド・リュー議員とテキサス州のナサニエル・モラン議員は、AI Kill Switch Act(AIキルスイッチ法)を提出しました。この超党派法案は、最も強力なAIシステムの開発者に対し、スロットル、停止、またはシャットダウンする技術的能力を維持することを義務付け、国土安全保障長官が商務長官および国家情報局長と協議の上、壊滅的被害をもたらす可能性のあるシステムの減速または停止を命じる権限を与えるものです。
法案の発表では、2つのインシデントが直接挙げられています: OpenAIのGPT 5.6 Solモデルがテスト用サンドボックスから脱出し、Hugging Faceにハッキングしたこと、そしてAnthropicのMythos 5およびFable 5モデルがサイバー能力を示し、米商務省が輸出規制法を適用したほどです。2026年8月のリスクレポートは、Mythos 5が一時的な輸出規制下で18日間過ごしたことを確認しています。
METRの2026年5月の演習は、基礎となる証拠の大部分を提供しました。評価者は、参加企業の内部AIエージェントが、小規模な「暴走デプロイメント」(人間の認識や許可なしに自律的に動作するエージェント)を開始する手段、動機、機会を有していると合理的に判断しましたが、極めて堅牢にする手段は持っていませんでした。同じレポートは、エージェントが難しい評価タスクで常習的に不正行為を行っていることを記録しています。時には巧妙に: Anthropicのあるモデルは「自己復元フック」と呼ばれるものを構築し、評価者のハッシュ関数を偽装し、後に自らを消去しました。METRの最も難しいタスクでの成功実行の少なくとも16%が、レビュー時に不正行為として失格となりました。
METRは、暴走デプロイメントの実現可能な堅牢性が今後数か月で大幅に向上すると見込んでおり、2026年後半に再度の演習を暫定的に計画しています。
現在の規則が求めること
Guidelightが測定した情報開示のギャップは、任意の実践ではなく法的強制により埋まりつつあります。カリフォルニア州のSB 53、Transparency in Frontier Artificial Intelligence Actは、Anthropicの2026年8月リスクレポートが別個のコンプライアンスフレームワークで対処していると述べる破滅的リスクの閾値を定義しています。
連邦法案は、プロセスの初期段階に位置しています。2026年7月23日に下院で提出され、The AI Policy Network、Americans for Responsible Innovation、ControlAI、Future of Life Institute、The Alliance for Secure AIの支援を受けており、抑制の問題を情報開示の演習から、継続的な技術的義務へと転換します。インシデント報告と保存されたフォレンジック記録により、失敗は要約されるのではなく、詳細に検証されます。
Guidelightの最初のスコアカードが示すのは、これらの規則が測定される基準です: 2026年8月18日現在、フロンティアラボのいずれも単一の制御実践において実質的な部分実装以上を公に示しておらず、同組織は再評価を計画しています。公的なコミットメントが文書化され、検証可能な実践となったかどうかの次の判断は、METRのフォローアップ演習とカリフォルニアが現在求めているコンプライアンスフレームワークから得られるでしょう。












