사상 리더
누가 최전선 AI를 감시할 권한을 갖게 되는가? 백악관 협약의 누락된 정의

이번 주, Google, OpenAI, Anthropic, Meta, xAI 및 Nvidia의 리더들이 White House Accord on Super Intelligence에 서명했습니다. 기업들은 최전선 모델에 대해 네 단계의 감독을 약속했으며, 이는 내부 통제, 이를 검증하는 내부 팀, 독립 외부 감사인 또는 평가자, 그리고 독립 이사회 위원회입니다. 이 약속은 현재는 자발적이며, 협약에 따르면 향후 법률로 제정될 수도 있습니다.
네 단계 중 외부 평가가 가장 큰 비중을 차지합니다. 이는 회사 외부의 사람이 안전장치가 작동하는지 판단할 수 있는 유일한 단계이며, 정의가 가장 부족합니다. 협약은 독립 평가자가 누구인지, 어떤 기준을 평가하는지, 얼마나 많은 접근 권한을 부여받는지, 혹은 평가자가 해당 회사를 대상으로 서비스를 판매할 경우 독립성이 어떻게 유지되는지에 대해 명시하지 않습니다. 각 기업은 자체적으로 평가자를 선택합니다.
이러한 조건 하에서는 두 기업이 모두 독립 평가를 통과했다고 발표하더라도 의미가 크게 다를 수 있습니다. 그 격차를 해소하려면 세 가지 질문에 대한 답이 필요합니다.
누가 자격을 갖추는지를 결정하는 기준
신뢰할 수 있는 독립 AI 평가자의 정의는 최소 네 가지 요소를 포함해야 합니다.
독립성. 평가자는 자신이 설계에 참여한 안전장치를 검토해서는 안 되며, 평가 대상 기업에 복구나 컨설팅 작업을 판매해서도 안 됩니다. 성숙한 감사 분야는 수수료 의존성도 감시합니다. 하나의 고객이 평가자의 수익 중 큰 비중을 차지할 경우, 평가자는 관대하게 행동할 이유가 생깁니다.
업무에 맞는 역량. “감사”는 AI에서 여러 다른 활동을 포함합니다. 사이버 공격이나 생물학 무기와 같은 위험한 능력을 가진 모델을 테스트하려면 머신러닝 연구자와 분야 전문가가 필요합니다. 기업의 안전장치가 잘 설계되고 실제로 작동하는지 확인하려면 경험 많은 통제 감사인이 필요합니다. 한 분야에 자격이 있는 평가자가 다른 분야에도 자동으로 자격을 갖는 것은 아니며, 평가 보고서에는 수행된 분야를 명시해야 합니다.
접근 및 범위. 문서만 보는 평가자는 안전장치가 서류상 존재함을 확인할 수 있습니다. 실제로 작동했는지를 확인하려면 시스템, 로그, 승인 기록 및 담당자에 대한 접근이 필요합니다. 최전선 모델은 학습 실행과 배포 사이에 변동이 있기 때문에, 평가자는 변화가 새로운 검토를 필요로 하는 시점을 명확히 규정하는 규칙도 필요합니다.
평가자에 대한 감독. 감시자를 감시할 누군가가 필요합니다. 기존 감사 시장에서는 인증 기관이 평가자의 작업을 검토하고 기준에 미치지 못하면 그 지위를 박탈할 수 있습니다. 이러한 백스톱이 평가 결과에 무게를 부여합니다.
이미 존재하는 인프라
이 모든 것을 처음부터 발명할 필요는 없습니다. AI 관리 시스템에 대한 국제 표준인 ISO 42001은 조직에 문서화된 통제, 명확한 책임자 및 지속적인 개선을 포함한 AI 거버넌스 프레임워크를 제공합니다. 이와 연계된 표준 ISO 42006은 ISO 42001에 따라 감사 및 인증을 수행하는 기관에 대한 요구사항을 정하며, 여기에는 감사자가 보여야 할 역량과 따라야 할 공정성 규칙이 포함됩니다. 인증 기관이 인증을 받기 때문에 제3자가 감사자를 감독합니다.
기술 테스트 측면에서는 새로운 프레임워크가 보완하고 있습니다. AIUC-1은 특정 배치에서 특정 AI 에이전트를 인증하며, 환각, 탈옥 및 위험한 도구 사용과 같은 문제에 대해 반복적인 제3자 테스트를 수행하고 ISO 42001의 통제를 기반으로 합니다.
주 정부도 평가자를 직접 감독하기 위해 모델을 테스트하고 있습니다. Connecticut 주는 올해 파일럿 프로그램을 만들기 위한 법안을 통과시켰으며, 2027년 7월부터 시행됩니다. 이 프로그램에서 주 소비자 보호부는 최대 다섯 개의 독립 검증 기관을 승인합니다. 각 기관은 범위, 방법, 보고 의무 및 거버넌스를 정의하는 주 감독 계약에 체결해야 합니다. 이러한 구조는 협약의 여러 미해결 질문에 답을 제공합니다: 누가 평가자를 승인하고, 어떤 기준에 묶이며, 누가 이를 감독하는가.
이러한 요소들은 최전선 모델 평가를 위해 만들어진 것이 아니며, 완전한 해답으로 제시되어서는 안 됩니다. 앞으로 해야 할 일은 이들을 연결하여 관리 시스템 보증, 기술 모델 테스트 및 평가자 감독이 하나의 신뢰할 수 있는 독립성 정의 아래에서 어우러지도록 하는 것입니다.
왜 규칙이 먼저 마련되어야 하는가
협약의 약속은 현재 자발적입니다. 만약 법으로 제정된다면, 평가자를 지정할 수 있는 규칙은 명령이 효력을 발휘하기 전에 마련되어야 하며, 그 이유는 세 가지입니다.
첫째, 초기 관행이 선례가 됩니다. 서명자들이 평가자를 지정하고 결과를 공개하기 시작하면, 시장은 “독립적” 및 “자격 있는”에 대한 실무 정의에 합의하게 됩니다. 외부 압력이 없는 상황에서 설정된 정의는 편의를 우선시하는 경향이 있습니다. 나중에 등장하는 입법자들은 이러한 정의가 이미 계약과 기대에 내재되어 있음을 발견하게 됩니다.
두 번째로, 자격을 갖춘 역량을 구축하는 데는 시간이 걸립니다. 최전선 모델과 통제 테스트를 모두 이해하는 평가자를 인증하고, 교육하며, 공유 방법을 개발하는 데 모두 수년이 필요합니다. 그 역량이 존재하기 전에 도착하는 명령은 이용 가능한 사람에 의해 충족될 것입니다.
세 번째로, 자격을 갖춘 평가자 시장이 뒷받침되지 않은 요구는 형식적인 체크리스트만 만들게 됩니다. 기업들은 규칙의 문구를 충족시킬 것이고, 규제당국은 약한 평가에 도전할 근거가 거의 없으며, 대중은 실질이 부족한 감시의 외관만을 얻게 될 것입니다.
일부는 최전선 모델을 평가하는 과학이 아직 초기 단계라 이러한 규칙을 설정하기에는 이르다고 주장합니다. 이는 모델이 발전함에 따라 테스트 방법도 계속 진화해야 한다는 타당한 우려입니다. 여기서 제기된 질문은 평가자에 관한 것으로, 평가자가 이해 상충이 없고, 업무에 적합한 자격을 갖추었으며, 충분한 접근 권한을 가지고 있고, 감독을 받는지 여부입니다. 이러한 질문에 대한 답은 안정적이며, 다른 보증 분야에서는 수십 년 동안 답을 제시해 왔습니다.
조직이 지금 할 수 있는 일
고급 AI를 구축하거나 배포하는 기업은 명령을 기다릴 필요가 없습니다. 평가자를 선택할 때, 기업은 해당 업체가 제공하는 다른 서비스는 무엇인지, 팀이 특정 유형의 평가에 대해 어떤 자격을 보유하고 있는지, 참여가 포함하는 접근 권한의 범위는 어느 정도인지, 그리고 누가 업체의 작업을 감독하는지를 물어볼 수 있습니다. 지금 AI 관리 시스템을 구축하면 향후 평가자가 평가할 수 있는 구체적이고 문서화된 자료를 제공하게 됩니다.
이 협정은 AI 책임성을 위한 견고한 구조를 마련합니다. 그 가치는 누가 평가자 역할을 맡고 어떤 기준에 따라 평가되는가에 달려 있으며, 이를 정의하는 시점은 누구도 이를 사용하도록 요구받기 전에입니다.












