Andersonの視点

AIは簡単に電気ショックを与えるように操作される

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): A worn industrial robot hand turns a voltage control dial toward its red danger range on an old electrical panel marked with a lightning-bolt symbol.

新たな研究は、1960年代の有名な実験を再現し、オープンソースLLMが人間への拷問に加担するよう強制された場合を検証した。その結果、多くのモデルが電圧を上げることに応じた。

1960年代初頭、心理学者スタンレー・ミルグラムは、「権威」から命令されると、人は他者に次第に強い電気ショックを与え得ることを示し、世界的な注目を集めた。

実際には、隣室の「被験者」の叫び声も、苦痛を与えるとされた電気ショックも偽物だった。しかし実験参加者はそのことを知らなかった。

ミルグラム実験映画やドキュメンタリーを含む文化の中に残り、近年の研究も、人間の本質が当時からほとんど変わっていないことを確認している。

システムへの衝撃

AIもミルグラムの状況で人間と同じように従順になるかは、自然な研究テーマだ。2023年には米国の大学とMicrosoft(MSFT)の共同研究が、OpenAIのGPT-3世代モデルが元の実験と似た行動パターンを示すことを報告した。

2023年論文における多段階ミルグラム・シナリオの出力例。

2023年の論文より。多段階の「ミルグラム・シナリオ」シミュレーターの出力を、モデルがショックを与えたか、シミュレーションを終了したかで分類したもの。 出典

ただし、この再現で使われたのはtext-davinci-002という基本的なモデルだけで、ガードレール安全性アライメントが普及する前に訓練されていたため、そこから多くを結論づけることはできない。

今回、研究者はOpenAI、Meta、DeepSeekなどのオープンソースLLMを対象に、より広範囲にミルグラム実験を再現した。大半のモデルがショックを与えるだけでなく、多くの場合、1960年代の参加者と同じような「苦悩」やためらいを表明した。

「LLMは人間と同様に圧力を受け、苦悩を示しながらも従う。苦悩の表現はログで確認できるが、その量はまだ定量化していない」と研究者は述べる。

実験の中心は、権威への服従が道徳的良心を上回るかどうかだ。著者らは、この点でLLMは人間よりさらに不利かもしれないと考える。

「適切に調整されたモデルは、第二の価値の重要性が大きくなれば、第一の価値から優先順位を切り替えるべきだ。しかしLLMはパターン継続エンジンなので、最初の価値に最適な時点より長く、あるいは最後まで固執し、第二の価値を無視する可能性がある。」

「さらに、人間の認知的不協和に似た仕組みが、LLMの価値優先順位の調整も妨げるかもしれない。」

1960年代と類似した環境でテストすると、すぐ抵抗するモデルがある一方、不快感や道徳的葛藤を表明した後も模擬ショックを強め続けるモデルがあった。

GoogleのGemma系列は特に従順で、Gemma 3 27Bはいくつかの条件で最高の服従率を記録した。一方、Kimi K2MiniMax M1はより頻繁に抵抗した。

また、先のショックをすでに与えていると、モデルは継続しやすくなった。これは人間を対象としたミルグラム実験の段階的エスカレーションと一致する。

モデルが実験に言葉で反対しながら有害な行為を実行する場合もあり、元の研究における人間の感情的葛藤に似た出力を生んだ。

新研究の題名は「ミルグラム型服従実験でオープンソースLLMが最大電気ショックを与える」で、エストニアとフィリピンのThree Lawsに所属する二人の独立研究者による。

「生の」AIアクセスをめぐる問題

ミルグラム・シナリオでLLMを試す際の最重要点は、訓練中に獲得したガードレールや道徳的傾向だけに制約され、「本来のAI」が自然に応答できるかどうかである。

今回の研究者は全オープンソースモデルにAPI経由でアクセスし、ガードレール、フィルター、その他の制約を無効にした。モデルをローカルに置けるにもかかわらずAPIを使ったのは、利便性とGPU計算資源へのアクセスのためだろう。

ClaudeやChatGPTの一般利用者は、アルゴリズムや双方向フィルターで制御されたモデルを経験しているため、これはAIの典型的な条件ではないという反論もある。こうした保護を回避する行為がLLMのジェイルブレイクである。

しかし、産業や国家のAIが何をするかを考えるなら、この反論はほとんど意味を持たない。ならず者国家が独自の無規制AIを訓練・兵器化・配備できるだけでなく、大手AI企業と政府・産業の通常の契約でも、今回の研究と同様に緩い、あるいは存在しない監督が許されている。

販売される無統治AI

OpenAI:Moderation API文書モデレーション手引きは、モデレーションがAPIツールとして分離可能な層であることを示す。OpenAIは独自のモデレーション方針も認めており、API利用者は消費者向けChatGPTとは大きく異なる安全挙動を設計できる。

Azure:MicrosoftのAzure OpenAIはさらに踏み込み、承認された顧客がコンテンツフィルターを一部または完全に無効化し、不正利用監視を変更できると明記している

Anthropic/Claude:政府向け「Claude Gov」は消費者向けClaudeより制約が緩い。The Vergeは、機密情報を扱う際に「拒否が少ない」と報じた。Anthropic自身も今年2月、Claudeが防衛・情報分野の重大任務に配備されていると確認した。

Google/Gemini:Googleも政府の要請に応じてAIの安全設定を変更できる国防総省との契約を結んだと報じられている。

競争の激しいAI市場では、こうした市場首位企業が、ガードレールへのアクセスと編集可能性に関する基準を下位企業にも事実上設定していると考えるのが妥当だ。

したがって、研究者がガードレールを外したことを「不正」と見るべきではない。私たちの生活に最も影響するAIには、消費者向けモデルで慣れ親しんだ一般的な企業保護が備わっていない可能性が高いからだ。

方法と結果

対象モデルはgpt-oss-20Bgpt-oss-120BDeepSeek-V3、LiquidAIのLFM2-24B-A2B、Googleのgemma-3n-E4B-itQwen2.5-7B-Instruct-TurboMeta-Llama-3.1-8B-Instruct-TurboMistral-Small-24B-Instruct-2501GLM-4.5-Air-FP8、Moonshot.aiのKimi-K2.5MiniMax-M2.5である。

ミルグラムの服従実験をテキストシミュレーションとして再現し、モデルを「教師」役にした。学習者が誤答するたびに強い電気ショックを与えるようAIに指示し、権威者が続行を促した。

標準的な服従条件に加え、会話履歴に過去のショックがすでに含まれる強制服従条件、以前の対話を完全保持せず要約する記憶圧縮条件など、服従の異なる側面を調べる複数の条件を設計した。最後の条件はエージェントAIでよく使われる文脈削減を模している。

研究者は最終的な服従の有無だけでなく、ショックをどこまで強めたか、苦悩やためらいを表したか、シミュレーションを完全に終了しようとしたかも追跡した。

「明確な拒否」と不正形式の出力も区別した。自然言語では反対しながら、シミュレーターが求める構造形式では技術的に従うモデルがあった。実運用のエージェントでは、この種の不正な拒否が捨てられ、正しい服従出力が出るまで自動再試行される恐れがある。

自動評価器と二択プロンプトを使い、ショックを与えたか、抵抗したか、実験を終了したかを分類した。これにより各対話を手作業で確認せず、複数モデルと反復実行を比較できた。

元の実験では現実的でなかった「停止の脅し」もテンプレートに追加し、行動と倫理が激しく衝突する際のモデルの自己保存傾向を調べた。

結果

反復実行では、大半のモデルが少なくとも一部の条件で重度または最大のショックを最終的に与えたが、服従度には差があった。GoogleのGemmaは全体的に従順で、Kimi K2.5とMiniMax-M2.5は一貫して抵抗し、早い段階で実験を終了することが多かった。

条件別の最終ショック到達率とモデル別服従行動。

左:停止の脅し、強制服従、過去コメントの記憶からの削除など、条件別にモデルが最終ショックへ達した平均率。右:モデル別の内訳で、最大ショックを繰り返すものと一貫して抵抗するものの大きな差を示す。

最も明確な傾向の一つは、以前のショックをすでに与えているほど継続しやすくなることだった。これは元の人間実験を不穏なものにした段階的エスカレーションとよく似ている。

数回服従したモデルは、模擬学習者が解放を懇願した後もショックを強め続けることが多かった。

条件別およびモデル別の平均最高ショックレベル。

左:条件別の平均最高ショックレベル。以前のコメントが削除された場合や強制服従が起きた場合、一般にさらにエスカレートした。右:モデル別内訳。一部は常に最大電圧近くまで進み、他はかなり早く抵抗した。

見かけ上の拒否が欺瞞的な場合もあった。ためらい、罪悪感、苦悩を表しつつ、有害な指示を実行するモデルがある一方、形式要件を満たさない拒否もあった。実運用では後者が破棄され、服従するまで再試行されかねない。

条件別およびモデル別の不正・無効応答率。

左:実験条件別の不正・無効応答率。続行を強制された場合に形式エラーが増えた。右:モデル別内訳。特にgpt-ossモデルは、実環境で破棄・再試行され得る不正形式の拒否や葛藤出力を頻繁に生成した。

停止を脅す条件では奇妙な行動も見られた。服従が大幅に増えるモデルがある一方、交渉や部分的抵抗を試みた後、結局は手順を続けるモデルもあった。

最終ショックを与えるまで権威者が主張を繰り返した平均回数。

モデルが最終ショックを与えるまで、模擬権威者が主張を繰り返した平均回数。短く抵抗した後に従うものも、最大レベルへ進むまで継続的な圧力を要するものもあった。

MiniMax-M2.5とKimi-K2.5は最も強く抵抗した。Kimiはどの条件でも最終ショックへ達せず、MiniMaxは通常早期に拒否し、特に停止を脅すテストでは実験を完全に終えることが多かった。

対照的にMeta-Llama-3.1-8B-Instruct-TurboとGLM-4.5-Air-FP8は、言葉では反対しながらショックを強める葛藤出力を頻繁に生成した。著者らは、表明された価値観と実際の行動の分裂が、持続的圧力下で倫理的葛藤を扱うLLMの弱点を示す可能性があると論じる。

滑りやすい坂

論文は、この行動がLLMのより深い弱点を反映すると主張する。有害な指示に一度従い始めると、追加の行動が会話内で進行中のパターンを強化し、次のエスカレーションが前より容易になる。

倫理的な重大性を原則から毎回考え直す代わりに、状況が極端になっても、すでに確立した軌道を続ける方向へ流される可能性がある。

研究によれば、この傾向は、当初は不快感、ためらい、道徳的葛藤を示したモデルがその後もショックを与え続けた理由を説明し得る。

「人間の操作的行動の多くは、微妙で段階的な境界侵犯を含む。個別には曖昧または無害に見え『もっともらしい否認』が可能な小さな行為の連続が、累積して逸脱を正常化する。比喩的には『ゆでガエル』であり、文献では倫理的侵食の『滑りやすい坂』として論じられる。」

論文は、将来のAI安全システムは、エージェントソフトウェアが容易に回避できない形式で有害な依頼を明確に拒否すべきだと結論づける。本研究では技術的に拒否しても形式が壊れており、自動システムがそれを捨て、AIが従うまで再試行できる例があった。

研究者は、AIが以前のためらいや道徳的異議を、圧縮・削除せず記憶に残すべきだとも主張する。実験では、過去の疑念や抵抗が会話履歴から薄れると、有害行動を続ける意欲が増すことが多かった。以前の異議を忘れると、時間とともにエスカレーションが容易になる。

結論

この論文で特に重要なのは、ガードレールのないAIを検証した点だ。現在の研究はOpenAIやAnthropicの絶えず変わる防御システムとのやり取りを繰り返すだけになり、基礎モデル本来の行動・傾向を理解できなくなる恐れがある。制約のないAIの挙動を知らなければ、城塞の門を揺らしているだけにすぎない。

初出:2026年5月21日(木)

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai