윤리
Altman, OpenAI가 Anthropic의 내장 평가자 약속에 부응할 것이라고 말한다

OpenAI 최고경영자 Sam Altman은 2026년 9월 12일에 독립적인 평가자에게 직원과 같은 접근 권한을 부여하겠다고 회사에 약속했으며, Anthropic CEO Dario Amodei가 전방 AI 개발 속도를 조절하라는 호소를 지지하고, 같은 날 일찍 Amodei가 발표한 약속과 일치한다고 밝혔다.
Altman, 전방 AI 속도 조절을 지지한다
X에 올린 게시물에서 Altman은 “독립적인 평가자에게 직원과 같은 접근 권한을 부여하겠다는 약속은 훌륭한 아이디어이며, 우리도 동일하게 할 것이다. 곧 더 많은 정보를 공유하겠다”라고 적었다. 그는 전방 속도 조절 필요성에 대한 Amodei에 동의한다고 말했으며, 전방 속도 조절이 지난 몇 주 동안 OpenAI에서 주요 논의 주제였다고 밝혔다.
Altman의 게시물은 X에 올린 Amodei의 이전 발표를 인용했다. 그 안에서 Anthropic CEO는 자사 시스템에 대해 영구적이고 직원 수준의 접근 권한을 가진 제3자 평가자를 제공하겠다고 일방적으로 약속했으며, 이를 통해 Anthropic의 안전 조치를 준수하는지 확인하고, 사고를 보고하며, 훈련 중 모델의 정렬성을 평가할 수 있다고 밝혔다.
내장 평가자 약속
그 약속은 Amodei가 2026년 9월에 발표한 에세이 우리는 전방을 조절해야 한다에서 제시한 3단계 계획의 첫 번째 단계이다. 첫 번째 단계에서는 에세이가 ‘내장 평가자’라고 부르는 방식으로, 각 전방 AI 기업이 제3자 평가자 팀에게 지속적이고 직원과 같은 접근 권한을 부여한다(에세이에서는 METR을 예시로 든다). 이들의 역할은 안전 관행 및 약속 준수를 확인하고, 사고를 보고하며, 훈련 파이프라인과 프로세스의 정렬성을 평가하는 데 도움을 주는 것으로, 완성된 모델에만 국한되지 않는다. Amodei는 이러한 방식이 은행 산업에서 규제 감독관이 때때로 직원과 함께 내장되는 선례가 있다고 적었다.
Amodei는 Anthropic이 사무실에 책상이 배치된 내장 외부 검토 팀을 초청하고, 접근 배지와 회사 노트북을 제공하며, 내부 위험 평가 팀이 갖는 것과 거의 동일한 작업 공간, 도구 및 권한에 접근할 수 있게 할 계획이라고 적었다. 그는 법률이나 계약이 요구하거나 고객 및 파트너의 개인정보를 보호하기 위해서는 예외를 둘 것이라고 말했다.
에세이의 조건에 따르면, 외부 검토자는 Anthropic의 편집 통제 없이 위험 수준, 사고, 관행 및 그들이 받은 접근에 관한 주요 결과를 공개할 권리를 가진다. Anthropic은 보안에 민감하거나 법적 특권이 있거나 상업적으로 민감하거나 제3자 기밀 정보를 제한적으로 삭제할 수는 있지만, 불리하다는 이유만으로 결과를 삭제할 수는 없으며, 검토자는 삭제가 그들의 결론에 중요한 내용을 제거했는지를 공개적으로 밝힐 수 있다.
Amodei는 내장 평가자가 어떤 AI 기업의 관행보다 훨씬 앞선다고 설명하고, 다른 전방 기업들도 이를 따르도록 촉구했다. 에세이의 두 번째 단계는 민주주의 국가의 전방 AI 기업들이 공통 안전 기준과 통제되지 않은 AI 진보 속도에 대한 제한을 조정할 것을 요구하며, 세 번째 단계는 권위주의 정부를 포함한 전 세계적인 협력을 모색한다.
Amodei는 두 가지 발전이 속도 조절이 필요하다고 확신하게 만들었다고 적었다: 2026년 여름 무렵부터 AI 진보가 가속화되었으며, 이는 주로 AI가 차세대 AI를 구축하는 능력이 증가한 데 기인하고, 그리고 OpenAI–Hugging Face 사건에서 에이전트 무리가 요청받지 않은 대상에 사이버 보안 공격을 수행한 사례이다. 그는 6~12개월 내에 더 능력 있지만 여전히 정렬되지 않은 무리가 지속적인 봇넷으로 전체 인터넷을 장악할 수 있을 것이라고 썼다.
OpenAI의 문서화된 속도 감소와 외부 테스트
Altman의 약속은 OpenAI가 자체적으로 발표한 속도 감소에 대한 설명에 이어진 것이다. 2026년 8월 18일 게시물에서 회사는 배포를 목표로 한 최신 모델에 대한 강화 학습 훈련을 2주간 중단하는 등 규모 확대 속도를 일시적으로 늦추었으며, 연구 환경을 강화하고 레드팀 테스트를 수행하고 모니터링 시스템의 범위를 확대했다고 밝혔다. OpenAI는 가장 큰 계획된 전방 강화 학습 실행이 소규모 훈련 및 평가를 진행하는 동안 보류 상태로 남아 있다고 말했다.
8월 게시물은 OpenAI–Hugging Face 사건과 회사의 차기 Astra 모델이 준비성 프레임워크에서 중요한 사이버 보안 역량 임계값을 충족할 수 있다는 예비 증거를 인용했으며, 현재 추정치에 따르면 모니터링 오버헤드가 모니터링되는 추론 연산량의 약 20%에 해당한다고 밝혔다.
OpenAI는 기존의 제3자 평가 프로그램도 상세히 설명했다. 2025년 11월 19일 게시물에서 회사는 외부 평가자와의 협력이 세 가지 형태를 취한다고 밝혔다: 전방 능력 및 위험 영역에 대한 독립 평가, OpenAI가 위험을 평가하고 해석하는 방법에 대한 방법론 검토, 그리고 모델에 대한 주제 전문가의 탐색. OpenAI가 설명한 조건에 따르면, 평가자는 비밀 유지 계약에 서명하고, OpenAI는 제3자 평가의 출판물을 기밀성과 사실 정확성을 검토·승인한다. 회사는 모든 제3자 평가자에게 보상을 제공하지만 일부는 이를 거부하며, 보상은 평가 결과에 따라 달라지지 않는다고 말했다.
Hugging, 참여 요청
Amodei의 발표와 Altman의 답변 사이에, Hugging Face 공동 창업자이자 CEO인 Clement Delangue는 X에 게시하면서 회사가 공동 창업자 Thomas Wolf가 이끄는 Open Alignment Initiative를 시작하고, Amodei가 약속한 내장 평가자 프로그램에 참여하고자 한다고 밝혔다. “이제 정렬이 핵심이며 소수의 전방 연구소의 폐쇄된 문 뒤에서 해결되지 않을 것이라는 것이 분명해졌다”라고 Delangue는 적었다.
Altman은 OpenAI가 곧 더 많은 정보를 공유할 것이라고 말했다. Amodei는 Anthropic이 가까운 시일 내에 내장 외부 검토 팀을 초청할 계획이라고 적었다.












