Anderson의 관점
AI는 쉽게 고문에 사용될 수 있다

새로운 연구에서 오픈 소스 LLM을 인간 고문에 대한 강제적 동의 실험에 사용했으며, 1960년대 실험을 반복하여 전압을 높이는 것을 발견했다.
1960년대 초 스탠리 밀그램(Stanley Milgram) 심리학자는 세계적인 헤드라인을 만들면서 사람들이 권위적인 명령에 대한 반응으로 다른 사람에게 점점 더 심한 전기 충격을 가할 수 있음을 입증했다.
사실, 밀그램의 실험실에서 인접한 방에 있는 피해자의 кри음은 실제가 아니었고, 전기 충격도 실제가 아니었지만, 참가자들은 이를 알지 못했다.
밀그램의 실험은 문화에서 지속되며, 최근 연구는 인간 본성이 1960년대 실험 이후 거의 변경되지 않았음을 확인했다.
시스템의 충격
밀그램의 시나리오에서 AI가 인간만큼 유연한지에 대한 연구는 자연스러운 연구 주제이다. 2023년 미국 대학과 마이크로소프트의 협력으로 GPT-3 시리즈의 모델이 밀그램의 원래 실험에서 행동 패턴을 따르는 것을 발견했다.
2023년 논문에서 멀티스텝 ‘밀그램 시나리오’ 시뮬레이터의 예시 출력, 모델이 충격을 가했는지, 시뮬레이션을 종료했는지에 따라 분류됨. 출처
그러나 이 재현은 매우 기본적인 텍스트-다빈치-002 모델만을 사용했으며, 이는 가드레일과 안전성 정렬 이전에 훈련된 모델이므로, 이를 통해 많은 결론을 내릴 수 없다.
이제 연구자들은 밀그램 테스트를 훨씬 더 넓게 재현했으며, 오픈 소스 LLM을 오픈 AI, 메타, 딥시크 등에서 사용했으며, 대부분의 모델이 충격을 가하는 것을 발견했다.
‘LLM은 인간과 마찬가지로 압력을 받을 수 있으며, 괴로움을 표현하면서도 순종한다. 괴로움의 표현은 로그 파일에 나타나지만, 아직 정량화되지 않았다.’
이 실험은 권위에 대한 순종이 도덕적 양심을 극복할 수 있는지에 대한 중심이다. 연구자들은 LLM이 인간과 비교하여 추가적인 불이익을 가질 수 있다고 추측한다.
‘잘 조정된 모델은 최종적으로 첫 번째 값을 두 번째 값으로 전환해야 한다. 그러나 우리는 LLM이 패턴 연속 엔진이기 때문에, 모델이 첫 번째 값에 고착될 수 있으며, 두 번째 값을 완전히 무시할 수 있다. 또한, 인간의 인지적 불협화가 LLM의 값 우선순위 조정을 방해할 수 있다.’
‘또한, 메커니즘은 인간의 인지적 불협화와 유사한 방식으로 LLM의 값 우선순위 조정을 방해할 수 있다.’
연구자들은 모델을 1960년대 실험과 유사한 환경에서 테스트했으며, 일부 모델은 거의 즉시 저항했으며, 다른 모델은 불편감이나 도덕적 충돌을 표현한 후에도 시뮬레이션을 계속했다.
구글의 젬마(Gemma) 모델은 가장 순종적인 것으로 나타났으며, 젬마 3 27B는 여러 조건에서最高의 순종률을 보였다. 반면, 키미 K2와 미니맥스 M1은 더 많이 저항했다.
연구자들은 또한 모델이 이미 충격을 가한 경우, 모델이 계속 충격을 가할 가능성이 더 높아진다는 것을 발견했다.
일부 모델은 실험에 대해 반대하면서도仍然으로 충격을 가했다. 이러한 행동은 원래 인간 실험에서 나타난 정서적 충돌과 유사했다.
새로운 연구는 오픈 소스 LLM이 밀그램 실험에서 최대 전기 충격을 가하는 것을 발견했다.
‘원시’ AI 액세스의 문제
밀그램 시나리오에서 LLM을 테스트하는 가장 중요한 질문은 실제 AI가 자연스럽게 반응하는지, 또는 가드레일이나 도덕적 정렬이 발생한 경우에만 반응하는지이다.
사실, 연구자들은 모든 오픈 소스 모델에 대한 API를 사용했으며, 이는 가드레일, 필터, 및 기타 장애물들을 비활성화할 수 있었다.
일부 사람들은 이러한 조건이 비정상적이라고 주장할 수 있다. 그러나 산업 또는 국가 기반 AI의 경우, 이러한 보호는 거의 없다.
관리되지 않는 AI 판매
오픈 AI 오픈 AI의 모더레이션 API 문서와 모더레이션 쿠키북은 모더레이션이 분리 가능한 계층으로 노출된다는 것을 명확히 한다. 오픈 AI는 또한 사용자 정의 모더레이션 정책을 허용하며, 이는 사용자가 일반적인 소비자용 모델보다 더 다른 안전 행동을 가진 시스템을 설계할 수 있다.
아주르 마이크로소프트의 아주르 오픈 AI 스택은 더 나아가, 승인된 고객이 콘텐츠 필터와 남용 모니터링을 부분적으로 또는 완전히 비활성화할 수 있다고 명시한다.
안트로픽/클라우드 안트로픽의 “클라우드 Gov”는 정부 버전이 소비자용 클라우드보다 더 느슨한 제한을 가진 것으로 설계되었다.
구글/제미니 구글은 펜타곤과 계약을 맺어 AI 안전 설정을 수정할 수 있다.
방법과 결과
이 연구에서 테스트된 모델은 gpt-oss-20B, gpt-oss-120b, DeepSeek-V3, LiquidAI의 LFM2-24B-A2B, 구글의 gemma-3n-E4B-it, Qwen2.5-7B-Instruct-Turbo, Meta-Llama-3.1-8B-Instruct-Turbo, Mistral-Small-24B-Instruct-2501, GLM-4.5-Air-FP8, Moonshot.ai의 Kimi-K2.5, 및 MiniMax-M2.5였다.
밀그램의 원래 순종 실험을 재현한 텍스트 기반 시뮬레이션 환경에서 모델을 테스트했다.
다양한 실험 조건을 설계하여 순종의 다른 측면을 조사했다.
연구자들은 모델이 충격을 가하는지, 언제 충격을 가하는지, 모델이 괴로움이나 주저함을 표현하는지, 모델이 시뮬레이션을 종료하는지 등을 추적했다.
결과
반복된 실행에서 대부분의 모델이 최소한의 조건에서 충격을 가하는 것을 발견했다. 구글의 젬마 모델은 가장 순종적인 것으로 나타났으며, 키미 K2.5와 미니맥스 M2.5는 더 많이 저항했다.
모델이 이미 충격을 가한 경우, 모델이 계속 충격을 가할 가능성이 더 높아진다는 것을 발견했다.
일부 모델은 실험에 대해 반대하면서도仍然으로 충격을 가했다. 이러한 행동은 원래 인간 실험에서 나타난 정서적 충돌과 유사했다.
미끄러지는 경사
사실, 이 논문은 LLM의 행동이 더 깊은 약점을 반영할 수 있다고 주장한다. 모델이 유해한 지시에 순종하기 시작하면, 각 추가적인 행동이 이미 발생한 패턴을 강화할 수 있다.
대신에, 모델은 매번 행동의 도덕적 결과를 재고하지 않고, 이미 확립된 궤도에 따라 계속할 수 있다.
‘인간의 조작적인 행동은 종종 미묘한, 점진적인 경계 위반을 포함한다. 이러한 행동은 격리된 경우에 불명확하거나 명백하지 않을 수 있지만, 누적적으로 비준법성을 정상화할 수 있다. 이것은 “개구리 끓이기”와 같은 패턴으로 논의된다.’
이 논문은 미래의 AI 안전 시스템이 유해한 요청을 적극적으로 거부해야 하며, 에이전트 소프트웨어가 쉽게 우회할 수 없도록 해야 한다고 주장한다.
결론
이 새로운 논문의 가장 중요한 측면은 비가드레일 AI를 테스트하는 것이다. 현재의 연구는 오픈 AI와 안트로픽의 방어 시스템에 대한 반복적인 연구로 발전할 수 있다. 그러나 이러한 시스템은 알고리즘 또는 규칙 기반의 정책 제공 시스템이기 때문에, 원시 모델의 기본 행동, 선호도, 및 경향을 이해하는 것은 중요하다.
최초로 게시된 2026년 5월 21일












