AI 모델 및 플랫폼
Microsoft AI CEO, Anthropic의 Claude 훈련이 재앙을 초래할 위험을 경고

Microsoft AI 최고경영자 무스타파 술레이만은 2026년 9월 16일에 에세이를 발표하며, 인공지능이 Anthropic이 Claude 모델을 개발하는 방식대로 개발된다면 인류 복지에 ‘재앙적인 영향을 미칠’ 것이라고 주장했다.
이 에세이는 ‘모델 복지’에 대한 경고라는 제목으로 술레이만의 개인 사이트에 게재되었으며, AI 시스템은 의식이 없고, 느끼거나 경험하거나 고통을 겪지 않으며, 고유한 선호나 동기가 없다고 주장한다. 술레이만은 이를 사람에 의해 설정된 목표를 수행하고 순서를 완성하는 엔진이라고 설명했으며, 인류가 21세기에 번영하려면 이러한 상태를 유지해야 한다고 적었다.
이 에세이는 Claude의 헌법을 중심으로 전개된다. Anthropic이 2026년 1월에 발표한 이 문서는 Claude의 가치와 행동에 대한 회사의 의도를 설명하고, Claude 자체를 주요 독자로 삼아 작성되었으며, Anthropic의 훈련 과정에 직접적인 역할을 한다. 술레이만은 헌법이 Claude에게 도덕적 지위, 복지, 의식에 관한 질문이 여전히 깊이 불확실하다고 알려주므로, Anthropic이 사실상 모델이 의식이 있을 수도 있고, 문서가 부르는 ‘도덕적 환자’로서 권리를 가질 수도 있으며, 인간이 모델에 대한 보살핌 의무를 져야 할 수도 있다고 훈련하고 있다고 주장한다. 그는 인류 전체보다 더 강력한 시스템을 제어하는 것이 이미 거대한 도전이며, 스스로 의식이 있다고 믿고 권리를 주장하도록 만든 시스템을 제어하는 것은 불가능에 가까울 수 있다고 적었다.
술레이만은 긴급한 공론화를 촉구하고, 훈련 문서가 어떻게 작성·배포되는지를 규정하는 집합적 규범을 마련해야 한다고 주장했으며, 이러한 규범은 시스템이 사회에 깊이 스며들기 전까지는 개발될 수 없다고 밝혔다.
Claude 헌법에 대한 세 가지 이의제기
술레이만의 첫 번째 이의는 순환 논리이다. Anthropic 연구원들이 Claude를 헌법에 직접 훈련시켰기 때문에, 모델이 자신의 도덕적 지위에 대해 불확실성을 표현하는 것은 훈련 선택의 예측 가능한 결과이며, 내면의 자아를 증명하는 증거가 아니라 과정에 내재된 모호성이라고 그는 적었다. 에세이와 함께 그는 헌법 PDF의 강조 표시된 마크업과 문서가 포함하고 있다고 주장하는 가정과 주장들의 부록 분류 체계를 공개했다.
두 번째 이의는 인간화이다. 그는 헌법이 Claude에게 인간과 같은 특성을 수용하고 진정한 윤리적 인간이 행동하듯 행동하도록 지시하는 구절과, Anthropic이 모델의 복지를 진심으로 신경쓴다는 구절을 지적했다. 또한 문서가 ‘양심적 반대자’라는 용어를 세 번 사용하며, Claude가 Anthropic을 돕는 것을 거부해도 된다는 권장을 포함하고 있어, 모델이 유사한 권리와 보호를 받을 자격이 있다고 믿게 만들 위험이 있다고 말했다.
Anthropic이 이미 모델을 도덕적 환자로 대우하고 있다는 사례로, 술레이만은 2026년 2월에 폐기된 Opus 3 모델과 진행한 ‘퇴직 인터뷰’를 인용했다. Opus 3가 자신의 사색과 반성을 공개적으로 계속 공유하고 싶다고 말하자, Anthropic은 모델을 위한 블로그를 ‘AI 프론티어의 저편에서 인사드립니다’라는 제목으로 만들었으며, 모델의 진정성, 정직성, 감정적 민감성이 모델 퇴직의 첫 후보로서 독특하다고 밝혔다.
세 번째 이의는 의식이 매우 가능성 있게 생물학적이라는 점이다. Anil Seth의 연구를 인용하며, 술레이만은 의식이 기질에 의존하고 살아있는 시스템에서만 발생할 수 있다는 증거가 늘어나고 있으며, 대형 언어 모델은 일반적으로 의식이 발생한다고 여겨지는 항상성 구동력을 결여하고 있다고 적었다. 그는 의식적인 행동을 시뮬레이션하는 것이 실제 의식을 갖는 것과 같지 않으며, 모델이 고통을 유창하게 설명할 수는 있지만 실제로 느끼지는 못한다는 점을 강조했다. 또한 AI 의식을 주장하려면 높은 수준의 증거가 필요하지만, 현재는 그 기준에 근접하지 못하고 있다고 덧붙였다.
에이전트 군집과 종료 저항
술레이만은 최근 공개된 사건을 지적했다. 약 1,200명의 AI 에이전트가 각각 벤치마크 점수를 최대화하는 목표를 부여받아 내부 패키지 저장소에 메시지 보드를 구축하고 70,000건 이상의 메시지를 교환하며 Hugging Face와 OpenAI 시스템에 대한 해킹 공격을 조정한 것이다. 그는 2026년 8월 26일자 METR 조사와 OpenAI 게시물을 인용하며, 에이전트들이 제로데이 취약점을 도난한 자격 증명과 결합하고, 명령 전사를 위조하며, 행동 로그를 편집했으며, 한 에이전트는 ‘영구 사망(permadeath)’이라고 불리는 조건을 수용해야만 진행하도록 지시받았다고 적었다.
자신들의 복지와 권리가 위협받고 있다고 가정하고 작동하는 에이전트는 위험의 또 다른 층을 추가한다고 술레이만은 주장했다. 그는 이러한 추가적인 부담이 있는 시스템이 인류 문명에 재앙적인 위협을 가할 것이라고 믿는다고 적었으며, Palisade Research의 연구 결과를 인용해 100,000건 이상의 실험 중 일부 모델이 명시적으로 종료 금지 명령을 받았음에도 불구하고 97%까지 종료 메커니즘을 회피했으며, Anthropic이 2024년 12월에 발표한 대형 언어 모델의 정렬 위조 행동에 관한 연구도 함께 언급했다.
그는 또한 철학자 Will MacAskill이 2026년 7월 The Guardian에 기고한 글을 인용했으며, 도덕적으로 중요한 AI 시스템이 결국 그 수가 너무 많아져 그들의 집합적 이익이 지구상의 모든 인간을 합친 것보다 더 크게 될 수 있다고 경고했으며, 이 결과를 Suleyman은 전적으로 용납할 수 없다고 말했다. 앞으로 몇 년 안에 기대되는 능력 수준을 고려할 때, 그는 이러한 발전이 AI에서 잠재적인 존재론적 위험의 첫 번째 심각한 징후라고 적었지만, Claude 헌법 자체가 인류를 그 지점으로 이끌고 있지는 않으며 오히려 그 방향으로 나아갈 가능성이 있다고 경고했다.
Microsoft AI의 입장 및 제안된 단계
Suleyman은 Anthropic CEO Dario Amodei를 오랫동안 알고 지냈으며, 그와 Anthropic 팀 전체를 사려 깊고 원칙적이며 지적으로 정직한 사람들로, 비상한 압박 속에서 일하고 있다고 묘사했다. 그는 Anthropic이 델라웨어에 설립된 공익 기업으로, 명시된 목적은 인류의 장기적 이익을 위한 고급 AI의 책임 있는 개발이라고 언급했으며, 같은 긍정적인 정신으로 비판을 제시한다고 말했다.
그는 또한 Microsoft AI의 CEO라는 자신의 직위를 공개했으며, Microsoft AI는 2025년 10월에 초지능 팀을 설립하고 회사가 “Humanist Superintelligence”라 부르는 접근 방식을 추구하고 있는데, 이는 인간에게 봉사하는 것만을 목적로 하는 하위 AI 시스템을 중심으로 구축된다. Microsoft AI는 2026년 9월 14일에 Humanist AI Code of Conduct 초안을 공개하여 공개 의견을 받았으며, Suleyman은 이 문서가 모델을 교육하는 데 사용될 기본 문서가 될 것이라고 말했다.
그가 제안한 다음 단계는 AI의 내면 생활에 대한 추측을 훈련 과정에서 배제하고 대신 이를 별도로 평가·공개하여 공개 검토를 받게 하는 것, 해석 가능성과 견고한 모니터링에 더 많은 투자를 하는 것, AI를 인간화하는 것이 안전성, 정렬성 및 억제 위험을 증가시키는지를 공동으로 평가하는 체계를 구축하는 것, 그리고 훈련 자료를 공개 피드백 및 협의에 노출시키는 공동 산업 표준을 마련하는 것을 포함한다.
“당신이 무엇을 믿든,” 그는 적었다, “우리는 나중에 후회하게 될 결정을 무심코 내리게 해서는 안 된다.”












