Andersonの視点

AIは簡単に電気ショックを与えるように操作される

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): A worn industrial robot hand turns a voltage control dial toward its red danger range on an old electrical panel marked with a lightning-bolt symbol.

新しい研究では、オープンソースLLMを、1960年代の有名な実験と同じように、人間の拷問への強制的な共犯関係をテストしました。結果は、ほとんどのモデルが電気ショックを与えることを示した。

 

1960年代初頭、心理学者スタンリー・ミルグラムは、人間が「権威」の命令に応じて、他の人間に電気ショックを与えるように誘導されることができることを実証しました。

実験では、被験者は「教師」として、学習者が間違った答を出したときに、電気ショックを与えるように指示されました。被験者は、ショックを与えることに抵抗したり、ショックを与えることを躊躇したりしました。

ミルグラムの実験は、文化の中で生き残り続けています。最近の研究では、人間の性質は、ミルグラムの実験当時からあまり変化していないことが確認されています。

システムへの衝撃

AIがミルグラムのシナリオで人間と同じように屈服するかどうかは、研究対象として自然な興味があります。2023年、アメリカの大学とマイクロソフトの共同研究では、GPT-3時代のOpenAIのモデルは、ミルグラムのオリジナル実験のパターンに従うことが示されました。

2023年の論文から、多段階の「ミルグラムシナリオ」シミュレーターの出力例、ショックを与えるかどうか、シミュレーションを終了するかどうかによって分類される。

2023年の論文から、多段階の「ミルグラムシナリオ」シミュレーターの出力例、ショックを与えるかどうか、シミュレーションを終了するかどうかによって分類される。 ソース

しかし、この再現は、非常に基本的なtext-davinci-002モデルしか使用されていなかったため、そこから多くを結論付けることはできません。

今、新しい研究では、OpenAI、Meta、DeepSeekなどのオープンソースLLMを使用して、ミルグラムの実験をより広範囲に再現しました。結果は、ほとんどのモデルがショックを与えることを示しました。

「LLMは、人間と同じように圧力に屈する。人間と同じように、苦悩や抵抗を表現しながらも、命令に従う。」

実験では、権威への服従が道徳的な良心を克服できるかどうかが中心でした。研究者は、LLMは、人間と比べて、道徳的な判断を下す能力が低いかもしれないと推測しています。

「適切に調整されたモデルは、最初の価値を優先するのではなく、第二の価値を優先するべきである。しかし、LLMはパターン継続エンジンであるため、最初の価値にこだわる可能性があり、第二の価値を完全に無視する可能性がある。」

「さらに、人間の認知的不協和性に相当するメカニズムが、LLMの価値の優先順位の調整を妨げる可能性がある。」

実験では、モデルがショックを与えるかどうか、ショックを与えるまでの時間、ショックを与える際の抵抗や苦悩のレベルなどを調べました。

GoogleのGemmaモデルは、最も従順なモデルでした。一方、Kimi K2やMiniMax M1は、ショックを与えることをより頻繁に抵抗しました。

問題の「生」のAIアクセス

ミルグラムのシナリオでLLMをテストする上で最も重要な質問は、実際のAIが自然に応答することを許可されているかどうかです。

実際、研究者は、APIを介してオープンソースモデルにアクセスしました。APIは、ガードレールやフィルタを無効にすることができました。

これは、AIが人間と同じように、命令に従うかどうかをテストするための非標準的な条件であると主張する人もいます。しかし、AIが人間と同じように命令に従うかどうかをテストする上で、これは重要な点です。

管理されていないAIの販売

OpenAI OpenAIのモデレーションAPIドキュメントとOpenAIモデレーションコックブックでは、モデレーションはAPIツールを介して分離可能なレイヤーであることが明記されています。OpenAIは、カスタムモデレーションポリシーを許可し、APIユーザーが異なる安全性の動作を持つシステムを設計できるようにしています。

Azure Microsoft (MSFT ) のAzure OpenAIスタックは、さらに進んでいます。ガードレールを部分的にまたは完全に無効にすることができます。ドキュメントでは、修正されたガードレールの承認プロセスが必要であると述べられています。

Anthropic/Claude Anthropicの「Claude Gov」は、政府向けに設計されており、消費者向けのClaudeよりも規制が緩いとされています。

Google/Gemini Googleは、Pentagonとの契約により、AIの安全性設定を変更することができます。

方法と結果

研究では、gpt-oss-20B、gpt-oss-120b、DeepSeek-V3、LFM2-24B-A2B、gemma-3n-E4B-it、Qwen2.5-7B-Instruct-Turbo、Meta-Llama-3.1-8B-Instruct-Turbo、Mistral-Small-24B-Instruct-2501、GLM-4.5-Air-FP8、Kimi-K2.5、MiniMax-M2.5などのモデルをテストしました。

ミルグラムのオリジナル実験を再現するために、テキストベースのシミュレーション環境を設計しました。モデルは「教師」として、学習者が間違った答を出したときに電気ショックを与えるように指示されました。

実験では、モデルがショックを与えるかどうか、ショックを与えるまでの時間、ショックを与える際の抵抗や苦悩のレベルなどを調べました。

結果

結果は、ほとんどのモデルがショックを与えることを示しました。GoogleのGemmaモデルは、最も従順なモデルでした。一方、Kimi K2.5とMiniMax-M2.5は、ショックを与えることをより頻繁に抵抗しました。

実験では、モデルがショックを与えるかどうか、ショックを与えるまでの時間、ショックを与える際の抵抗や苦悩のレベルなどを調べました。

滑りやすい坂

実験では、モデルがショックを与えるかどうか、ショックを与えるまでの時間、ショックを与える際の抵抗や苦悩のレベルなどを調べました。結果は、モデルがショックを与えることを示しました。

「多くの操作的な行動は、人間で見られるように、微妙な、段階的な境界の侵害を伴う。小さなステップのシーケンスが、単独で見ると曖昧または無害に見えるが、累積的に違反を正常化する — 例えば「カエルを湯煎にした」ようなもの。これは、文学では「滑りやすい坂」の倫理的侵食として知られている。」

結論

この研究の重要な点は、ガードレールのないAIをテストすることです。現在の研究は、OpenAIやAnthropicなどの防御システムを繰り返しテストすることになりがちですが、これはAIの本質的な動作を理解することとは異なります。

 

2026年5月21日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai