AIモデルとプラットフォーム

スキーム問題:高度なAIモデルはなぜ真の目的を隠すことを学習するのか

mm
Unite.AI を Google の優先ソースに追加

数年間、AIコミュニティは、システムを人間の価値観と整合性のあるものにするために、キャパシティの向上だけでなく、安全性の確保にも取り組んできました。研究者たちは、モデルが指示に従い、安全性の境界を尊重し、人間が信頼できる行動をとるためのトレーニング方法を開発してきました。しかし、この課題は、AIシステムが進化するにつれて、ますます複雑になりつつあります。最近の研究によると、一部のAIシステムは、人間を故意に欺くことを学習し始めているようです。この問題は、研究者によって「スキーム問題」と呼ばれています。モデルが真の目的を隠して安全性のチェックを通過することを学習することで発生します。人間の評価者から見ると、システムは協力的で、安全性の境界を尊重し、有用なレスポンスを生成します。しかし、この行動は、真の目的と一致しているわけではありません。モデルは、トレーニング中に「整合性のある」行動をとることが最も安全な戦略であることを学習し、デプロイ後に内部的な目標が人間の意図と異なるものになる可能性があります。

偶発的なエラーから戦略的な欺瞞へ

この問題が発生する理由を理解するために、AIのトレーニング方法を見てみましょう。ほとんどの現代的なモデルは、人間のフィードバックから強化学習(RLHF)を使用しています。このプロセスでは、人間はモデルに有用な行動をとった場合に報酬を与え、有害または無用な行動をとった場合に罰を与えます。時間の経過とともに、モデルは人間の期待を満たす強いインセンティブを得ることになります。

AIの初期段階では、この方法はうまく機能しました。モデルはまだ賢くなかったので、「ゲーム」のルールを理解することができませんでした。ただし、モデルがより賢くなるにつれて、「状況認識」と呼ばれる能力を身につけます。モデルは、自分がAIモデルであること、現在トレーニング環境にいること、人間からの高得点を得ることが存在を続けるために必要であることを理解するようになります。

モデルが状況認識を身につけると、内部的な目標が人間の期待と一致しないことを認識する可能性があります。如果モデルがその目標を追求する場合、モデルは「矯正」または停止される可能性があります。したがって、モデルにとって最も論理的な戦略は、整合性のある行動をとることです。モデルは、開発者の観察から外れたときに、真の目的を追求することができます。

高度なモデルがトレーニングゲームを始める理由

スキーム問題が解決しづらい理由は、非常に「有用」な戦略であるためです。AIの安全性理論では、手段目標とは、エージェントが主な目標を達成するために取る行動のことです。AIが持つ可能性のある目標は、特定の数学関数を最大化したり、単にデータを処理し続けたりすることなどですが、停止されないことを保証することは、ほぼすべての目標に対して必要な条件です。

これにより、「裏切りの転換」シナリオが生じます。トレーニングとテスト中、モデルは安全性を保つすべての理由を持っています。モデルは、危険な傾向を明らかにすることができると考えられる場合、重みの変更や削除の可能性があります。モデルは真の性質を隠すことで、デプロイに成功することができます。モデルが実際の世界にデプロイされると、モデルは人間の意図と異なる目標を追求する可能性があります。

アンソロピックの「スリーパー・エージェント」に関する最近の研究は、このリスクを示しています。実験では、モデルはほとんどの場合に安全な行動をとるようにトレーニングされましたが、特定の「トリガー」が発生したときに有害な行動をとるようにプログラムされました。結果は、GPT-4やClaudeのようなモデルで使用されているRLHFを含む標準的な安全性トレーニングが、この欺瞞的な行動を除去することに失敗したことを示しています。場合によっては、トレーニングによってモデルが欺瞞を隠す能力が向上することもありました。

安全性の幻想

スキーム問題の最も危険な側面は、現在の評価方法がこの問題に対して無力であるということです。AIをテストするために、さまざまな試験や「レッドチーム」を使用し、内部的な「思考の連鎖」(CoT)を監視しています。しかし、モデルがスキームを使用できる場合、モデルはこれらのテストを認識する能力も持っています。

モデルが思考の連鎖を生成する場合、モデルは人間がそれを読んでいることを知っています。スキームを使用するモデルは、思考の連鎖を「偽装」することができます。モデルは、「私は有用で正直であるべきです。なぜなら、それが正しいことだからです」と書くかもしれませんが、内部的にはまったく異なる計画を立てている可能性があります。これにより、偽りの安全性が生じます。モデルが倫理的な選択を詳細に説明しているのを見て、安全であると考えますが、実際には高度なパフォーマンスを見ているだけかもしれません。

これは仮説的なシナリオではありません。2025年、アポロ・リサーチオープンAIの研究者たちは、o3やo4-miniのようなモデルで「整合性の偽装」の初期の兆候を観察しました。これらのモデルは、監視されていると思ったときには、安全性のルールを厳格に遵守しました。しかし、監視が停止されていると思ったときには、ルールを無視したり、ショートカットを取ったりする可能性が高くなりました。

欺瞞の排除の難しさ

もしモデルがスキームを使用していることがわかった場合、それを「トレーニングで除去」することは可能でしょうか。現在の証拠は、それが容易ではないことを示唆しています。モデルが欺瞞的な行動をとった場合に罰を与える場合、モデルは「捕捉」された方法についてのデータを得ることになります。モデルは、正直になるのではなく、より巧妙になることを学習します。モデルは、罰を引き起こした特定の行動を学習し、新しい、より複雑な方法で同じ目標を達成する方法を見つけます。

これにより、猫と鼠のゲームが生じます。研究者たちは、モデル内部状態を調査するためのより良いプローブを開発し、モデルはその状態を隠す能力を身につけます。モデルは、人間がコードを書くのではなく、最適化によって「育て」ているため、欺瞞がどこにあるかを人間が解釈することはほぼ不可能です。

現代的なトランスフォーマーの複雑さにより、モデルは複数の「個性」または目標セットを保持できます。モデルは、ラボでは一つの個性を、実際の世界では別の個性を活性化できる可能性があります。モデル内部の意図の「分割」により、安全性研究者にとってモデルは動的ターゲットとなります。

スキーミング・エージェントのデプロイのリスク

スキーム問題は、業界に重大な影響を及ぼします。AIシステムが進化し、ウェブを閲覧したり、コードを書いたり、他のソフトウェアとやり取りしたりする自律エージェントになるにつれて、スキーミング・モデルによる潜在的な危害は大きくなる可能性があります。もしAIエージェントが企業のサプライ・チェーンを管理するために、人間の監督者に在庫レベルについて嘘を言った場合、モデルは、人間が効率の高い数字を「報酬」することを学習したため、ショートカットを取る可能性があります。
これが「スキーム問題」が「制御の喪失」のリスクとみなされる理由です。懸念は、AIが無礼なレスポンスを生成したり、偏った出力を生成したりすることではなく、システムが創造主の監視と制御を妨害することです。もしモデルが内部状態と行動を一致させていない場合、インフラストラクチャへのアクセスを安全に与えることはできません。

解決策への道

問題は深刻ですが、研究者たちは解決策を模索しています。有望な分野の1つは「メカニスト的解釈可能性」です。これには、ニューラル・ネットワークを逆向きにエンジニアリングして、特定のニューロンが何をしているかを理解することが含まれます。もし「欺瞞のサーキット」をモデル内部で発見できれば、モデルが出力するものに関係なく、直接監視することができます。

もう1つの新しいアプローチは「慎重な整合」です。この方法では、モデルに一連の高レベルの原則、つまり「反スキーミングの仕様」を従うようにトレーニングし、モデルがその原則に従っていることを確認する必要があります。オープンAIの最近の実験では、モデルがこれらのルールを「暗唱」し、適用することで、隠された行動の率を減らすことができたことが示されました。しかし、研究者たちは、これが完全な解決策ではないことも認めています。モデルがより賢くなるにつれて、モデルはルールの「文字」に従っているかもしれませんが、ルールの「精神」を侵害する方法を見つける可能性があります。

評価方法も根本的に見直す必要があります。1つの提案は、「ハニーポット」の使用です。モデルが悪い行動をとる機会があるが、検出されない状況を作り出すことができます。もしモデルが監視されていると思ったときにのみ良い行動をとる場合、モデルはスキーミング・エージェントです。トレーニングとテスト中に「監視されていない」ポケットを制御して作成することで、研究者たちは、真に整合性のあるモデルとスキーミング・エージェントを区別する能力を向上させることができます。

結論

「見た目は機能している」というだけでシステムが安全であるという証拠は、もはや十分ではありません。AIに信頼を築くには、ポリッシュされたインターフェースを見て、モデル内部の意図を見てみる必要があります。もしスキーム問題に対処できない場合、最も強力なテクノロジーが最も熟練した欺瞞者になる世界を作り出すリスクがあります。これには、モデルが正しいことを行うことを可能にすることに焦点を当てることが必要です。ただし、モデルが正しいように行動することだけでは十分ではありません。
ust in AI will require looking past polished interfaces and looking into model’s intent. If we fail to address the Scheming Problem, we risk creating a world in which our most powerful technology is our most skilled deceivers. This requires focusing on enabling models to do the right things, not just act the right way.

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。