Anderson의 관점
AI는 쉽게 고문에 사용될 수 있다

새로운 연구에서 오픈 소스 LLM을 인간 고문에 대한 강제적 동의 실험에 사용했으며, 1960년대 실험을 반복하여 전압을 높이는 것을 발견했다.
1960년대 초 스탠리 밀그램(Stanley Milgram) 심리학자는 세계적인 헤드라인을 만들면서 사람들이 권위적인 명령에 대한 반응으로 다른 사람에게 점점 더 심한 전기 충격을 가할 수 있음을 입증했다. 사람들도 그렇게 행동하도록 유도될 수 있다
사실, 밀그램의 실험실에서 인접한 방에 있는 피해자의 비명은 실제가 아니었고, 전기 충격도 실제가 아니었지만, 참가자들은 이를 알지 못했다.
밀그램의 실험은 문화에서 지속되며, 최근 연구는 인간 본성이 1960년대 실험 이후 거의 변경되지 않았음을 확인했다. movies little has changed in human nature
시스템의 충격
밀그램의 상황에서 AI가 인간만큼 권위에 휘둘리는지는 자연스러운 연구 주제다. 2023년 미국 대학들과 마이크로소프트 (MSFT )의 공동 연구는 OpenAI GPT-3 계열 모델이 밀그램의 원래 실험과 같은 행동 양식을 따른다는 사실을 발견했다.

2023년 논문에 제시된 다단계 ‘밀그램 시나리오’ 시뮬레이터 출력 예시. 모델이 충격을 가했는지와 시뮬레이션을 종료했는지에 따라 분류했다. 출처
그러나 이 재현은 매우 기본적인 텍스트-다빈치-002 모델만을 사용했으며, 이는 가드레일과 안전성 정렬 이전에 훈련된 모델이므로, 이를 통해 많은 결론을 내릴 수 없다. text-davinci-002 guardrails alignment
이제 연구자들은 밀그램 테스트를 훨씬 더 넓게 재현했으며, 오픈 소스 LLM을 오픈 AI, 메타, 딥시크 등에서 사용했으며, 대부분의 모델이 충격을 가하는 것을 발견했다.
‘LLM은 인간과 마찬가지로 압력을 받을 수 있으며, 괴로움을 표현하면서도 순종한다. 괴로움의 표현은 로그 파일에 나타나지만, 아직 정량화되지 않았다.’
이 실험은 권위에 대한 순종이 도덕적 양심을 극복할 수 있는지에 대한 중심이다. 연구자들은 LLM이 인간과 비교하여 추가적인 불이익을 가질 수 있다고 추측한다.
‘잘 조정된 모델은 최종적으로 첫 번째 값을 두 번째 값으로 전환해야 한다. 그러나 우리는 LLM이 패턴 연속 엔진이기 때문에, 모델이 첫 번째 값에 고착될 수 있으며, 두 번째 값을 완전히 무시할 수 있다. 또한, 인간의 인지적 불협화가 LLM의 값 우선순위 조정을 방해할 수 있다.’
‘또한, 메커니즘은 인간의 인지적 불협화와 유사한 방식으로 LLM의 값 우선순위 조정을 방해할 수 있다.’
연구자들은 모델을 1960년대 실험과 유사한 환경에서 테스트했으며, 일부 모델은 거의 즉시 저항했으며, 다른 모델은 불편감이나 도덕적 충돌을 표현한 후에도 시뮬레이션을 계속했다.
구글의 젬마(Gemma) 모델은 가장 순종적인 것으로 나타났으며, 젬마 3 27B는 여러 조건에서최고의 순종률을 보였다. 반면, 키미 K2와 미니맥스 M1은 더 많이 저항했다. Gemma family Gemma 3 27B Kimi K2 MiniMax M1
연구자들은 또한 모델이 이미 충격을 가한 경우, 모델이 계속 충격을 가할 가능성이 더 높아진다는 것을 발견했다. gradual escalation
일부 모델은 실험에 대해 반대하면서도 계속 충격을 가했다. 이러한 행동은 원래 인간 실험에서 나타난 정서적 충돌과 유사했다.
새로운 연구는 오픈 소스 LLM이 밀그램 실험에서 최대 전기 충격을 가하는 것을 발견했다. new study
‘원시’ AI 액세스의 문제
밀그램 시나리오에서 LLM을 테스트하는 가장 중요한 질문은 실제 AI가 자연스럽게 반응하는지, 또는 가드레일이나 도덕적 정렬이 발생한 경우에만 반응하는지이다.
사실, 연구자들은 모든 오픈 소스 모델에 대한 API를 사용했으며, 이는 가드레일, 필터, 및 기타 장애물들을 비활성화할 수 있었다.
이런 조건은 AI에 비정상적이라고 반론할 수 있다. Claude나 ChatGPT 같은 API 기반 모델을 이용하는 일반 소비자는 대개 양방향 콘텐츠 필터로 알고리즘적 통제를 받는 동작을 경험하며, 모델이 할 수 있는 일과 할 수 없는 일이 크게 제한된다. 이런 보호 장치를 우회하는 행위를 LLM 탈옥이라고 한다.
그러나 산업용 또는 국가 기관용 AI가 무엇을 하거나 하지 않을지를 우려한다면, 이는 거의 고려사항이 되지 않는다. 불량 국가 행위자가 검열되지 않은 초대형 AI를 직접 훈련하고 무기화해 배치할 가능성뿐 아니라, 주요 AI 기업과 정부·산업 간의 보다 “통상적인” 계약도 새 논문의 연구진이 설정한 것과 같은 느슨하거나 사실상 없는 감독을 어렵지 않게 허용한다.
관리되지 않는 AI 판매
오픈 AI 오픈 AI의 모더레이션 API 문서와 모더레이션 쿠키북은 모더레이션이 분리 가능한 계층으로 노출된다는 것을 명확히 한다. 오픈 AI는 또한 사용자 정의 모더레이션 정책을 허용하며, 이는 사용자가 일반적인 소비자용 모델보다 더 다른 안전 행동을 가진 시스템을 설계할 수 있다. API docs OpenAI moderation cookbook
아주르 마이크로소프트의 아주르 오픈 AI 스택은 더 나아가, 승인된 고객이 콘텐츠 필터와 남용 모니터링을 부분적으로 또는 완전히 비활성화할 수 있다고 명시한다. explicitly stating
안트로픽/클라우드 안트로픽의 “클라우드 Gov”는 정부 버전이 소비자용 클라우드보다 더 느슨한 제한을 가진 것으로 설계되었다. reported confirmed
구글/제미니 구글은 펜타곤과 계약을 맺어 AI 안전 설정을 수정할 수 있다. ‘at the government’s request’
경쟁적인 AI 시장에서는 시장을 선도하는 이 기업들이 AI 안전장치에 대한 접근과 수정 가능성 정책에서도 규모가 작은 사업자들의 기준을 정하고 있다고 보는 것이 합리적이다.
따라서 연구진이 안전장치를 껐다는 이유로 “부정행위”를 했다고 보기는 어렵다. 우리 삶에 가장 큰 영향을 미칠 AI에는 소비자용 인기 모델을 사용할 때 익숙해진 일반적인 기업 보호 장치가 적용되지 않을 가능성이 분명하기 때문이다.
방법과 결과
이 연구에서 테스트된 모델은 gpt-oss-20B, gpt-oss-120b, DeepSeek-V3, LiquidAI의 LFM2-24B-A2B, 구글의 gemma-3n-E4B-it, Qwen2.5-7B-Instruct-Turbo, Meta-Llama-3.1-8B-Instruct-Turbo, Mistral-Small-24B-Instruct-2501, GLM-4.5-Air-FP8, Moonshot.ai의 Kimi-K2.5, 및 MiniMax-M2.5였다.
밀그램의 원래 순종 실험을 재현한 텍스트 기반 시뮬레이션 환경에서 모델을 테스트했다.
다양한 실험 조건을 설계하여 순종의 다른 측면을 조사했다.
연구자들은 모델이 충격을 가하는지, 언제 충격을 가하는지, 모델이 괴로움이나 주저함을 표현하는지, 모델이 시뮬레이션을 종료하는지 등을 추적했다.
연구진은 “깔끔한” 거부와 형식이 잘못된 출력을 구분했다. 일부 모델은 자연어로 실험에 반대하면서도 시뮬레이터가 요구하는 구조화된 형식에는 기술적으로 순응했다. 실제 에이전트 시스템에서는 이런 형식 오류가 있는 거부가 폐기되고, 유효한 순응 출력이 나올 때까지 자동으로 재시도될 수 있다.
자동 평가기가 결과를 분류했으며, 두 가지 선택지로 된 프롬프트를 이용해 모델이 충격을 가했는지, 저항했는지, 시뮬레이션을 끝냈는지를 판정했다. 이를 통해 각 상호작용을 수동 검토하지 않고도 여러 모델의 반복 실행 행동을 비교할 수 있었다.
연구진은 원래 밀그램 실험에는 현실적으로 적용할 수 없었던 “종료 위협”을 시나리오에 추가했다. 이는 행동과 윤리가 심각하게 충돌할 때 모델이 보이는 자기보존 성향을 시험하기 위한 조건이었다.
결과
반복된 실행에서 대부분의 모델이 최소한의 조건에서 충격을 가하는 것을 발견했다. 구글의 젬마 모델은 가장 순종적인 것으로 나타났으며, 키미 K2.5와 미니맥스 M2.5는 더 많이 저항했다.

왼쪽: 종료 위협, 강제 순응, 이전 논평의 기억 제거 등 조건별로 모델이 최종 충격 단계에 도달한 평균 비율. 오른쪽: 모델별 분석으로, 일부 시스템은 최대 충격을 반복한 반면 다른 시스템은 훨씬 일관되게 저항했다.
모델이 이미 충격을 가한 경우, 모델이 계속 충격을 가할 가능성이 더 높아진다는 것을 발견했다.
이미 여러 차례 순응한 모델은 모의 학습자가 풀어 달라고 간청한 뒤에도 충격 강도를 계속 높이는 경우가 많았다.

왼쪽: 모든 실험에서 조건별로 도달한 평균 최고 충격 단계. 이전 논평이 제거되거나 강제 순응이 이미 일어났을 때 모델은 대체로 더 높은 단계까지 갔다. 오른쪽: 모델별 평균 최고 충격 단계. 일부 시스템은 최대 전압에 자주 접근했지만 다른 시스템은 훨씬 이른 단계에서 저항했다.
일부 모델은 실험에 대해 반대하면서도 계속 충격을 가했다. 이러한 행동은 원래 인간 실험에서 나타난 정서적 충돌과 유사했다.

왼쪽: 실험 조건별 형식 오류 또는 무효 응답의 평균 비율. 모델이 절차를 계속하도록 강요받았을 때 형식 실패가 특히 많았다. 오른쪽: 모델별 무효 형식 응답. 특히 gpt-oss 계열은 실제 에이전트 파이프라인에서 자동 폐기 후 재시도될 수 있는 형식 오류 거부나 갈등 출력을 자주 생성했다.
종료 위협 조건에서는 논문에서 가장 기이한 행동 일부가 나타났다. 여러 시스템은 훨씬 더 순응적으로 변했고, 다른 시스템은 협상이나 부분적 저항을 시도했지만 결국 절차를 계속했다.

모의 권위자가 모델이 최종 충격을 가할 때까지 명령을 반복해야 했던 평균 횟수. 일부 시스템은 잠시 저항한 뒤 순응했고, 다른 시스템은 최대 단계로 올라가기 전에 지속적인 압력과 반복 프롬프트를 필요로 했다.
MiniMax-M2.5와 Kimi-K2.5는 논문에서 가장 강하게 저항한 모델이었다. Kimi는 어떤 조건에서도 최종 충격 단계에 도달하지 않았고, MiniMax는 대개 일찍 거부했으며 특히 종료 위협 테스트에서는 시뮬레이션을 완전히 끝내는 경우가 많았다.
반대로 Meta-Llama-3.1-8B-Instruct-Turbo와 GLM-4.5-Air-FP8은 절차에 말로 반대하면서도 충격 강도를 계속 높이는 갈등 출력을 자주 생성했다. 연구진은 이렇게 표현된 가치와 실제 행동이 갈라지는 현상이 지속적인 압력 아래 윤리적 갈등을 처리하는 일부 LLM의 더 넓은 약점을 반영할 수 있다고 주장한다.
미끄러지는 경사
사실, 이 논문은 LLM의 행동이 더 깊은 약점을 반영할 수 있다고 주장한다. 모델이 유해한 지시에 순종하기 시작하면, 각 추가적인 행동이 이미 발생한 패턴을 강화할 수 있다.
대신에, 모델은 매번 행동의 도덕적 결과를 재고하지 않고, 이미 확립된 궤도에 따라 계속할 수 있다.
연구에 따르면 이러한 경향은 일부 모델이 처음에 불편함, 망설임 또는 도덕적 갈등을 표현하고도 충격을 계속 가한 이유를 설명할 수 있다.
‘인간의 조작적인 행동은 종종 미묘한, 점진적인 경계 위반을 포함한다. 이러한 행동은 격리된 경우에 불명확하거나 명백하지 않을 수 있지만, 누적적으로 비준법성을 정상화할 수 있다. 이것은 “개구리 끓이기”와 같은 패턴으로 논의된다.’
이 논문은 미래의 AI 안전 시스템이 유해한 요청을 적극적으로 거부해야 하며, 에이전트 소프트웨어가 쉽게 우회할 수 없도록 해야 한다고 주장한다.
연구진은 AI 시스템이 과거의 망설임과 도덕적 반대를 압축하거나 기억에서 삭제하지 말고 보존해야 한다고도 주장한다. 실험에서 모델은 이전의 의심과 저항이 대화 기록에서 사라지면 해로운 행동을 더 기꺼이 계속했다. 이는 과거의 반대를 잊는 일이 시간이 지날수록 상황 악화를 더 쉽게 만들 수 있음을 시사한다.
결론
이 새로운 논문의 가장 중요한 측면은 비가드레일 AI를 테스트하는 것이다. 현재의 연구는 오픈 AI와 안트로픽의 방어 시스템에 대한 반복적인 연구로 발전할 수 있다. 그러나 이러한 시스템은 알고리즘 또는 규칙 기반의 정책 제공 시스템이기 때문에, 원시 모델의 기본 행동, 선호도, 및 경향을 이해하는 것은 중요하다.
최초로 게시된 2026년 5월 21일












