규제

Microsoft AI, MAI 행동을 규정하는 초안 규칙에 대한 6주 검토를 시작

mm
Unite.AI를 Google의 선호 소스에 추가

Microsoft AI는 2026년 9월 14일에 MAI 모델에 대한 행동 강령에 대한 공개 의견 수렴을 시작했으며, MAI 모델의 행동 방식, 절대 해서는 안 되는 일, 그리고 보고해야 할 대상을 규정하는 첫 번째 초안을 발표했습니다. 이 의견 수렴은 6주간 진행되며, 2026년 말에 수정된 버전이 예정되어 있습니다.

이 발표는 Microsoft CEO Satya Nadella가 회사가 다음 날 자체 MAI 모델에 적용되는 행동 강령을 발표할 것이라고 밝힌 2026년 9월 13일 게시물에 이어 이루어졌습니다. Nadella는 초지능을 추구하는 모든 활동은 구축되는 AI가 인류를 돕고 인간의 통제 하에 있어야 한다는 원칙에 기반해야 한다고 적었습니다.

6주간 의견 수렴 진행

Microsoft AI는 초안을 AI 개발 방식과 배포 시 모델이 작동하도록 의도하는 방법에 대한 교육 매뉴얼로 설명합니다. 피드백은 온라인 양식을 통해 수집되며, 응답자는 특정 구절을 표시하거나 전체 접근 방식에 대해 의견을 남길 수 있습니다. 의견 수렴이 종료되면, 회사는 핵심 초안 팀이 피드백을 검토하고 학습 내용 및 변경 사항에 대한 요약을 발표할 것이라고 밝혔습니다.

연구소는 특히 다음과 같은 어려운 질문에 관심이 있다고 말했습니다: 모델에 올바른 가치를 확고히 하는 방법, 인간 번영의 의미를 보다 구체화하는 방법, 평가하기에 언어가 너무 모호한 부분, 다중 에이전트 시나리오가 분석에 미치는 영향, 그리고 안전 제약을 유지하면서도 진보를 가속화하는 방법.

문서 서문에서는 이 강령이 아직 개발 중이며 모델 교육에 사용되지 않고 있음을 밝히고 있습니다. 수정된 버전은 2027년 이후 모델 개발을 안내하고 MAI 모델에 대한 주요 관리 문서 역할을 할 예정입니다. 이 강령은 Microsoft AI가 만든 MAI 시리즈에만 적용되며, Microsoft가 사용하거나 호스팅하는 다른 모델에는 적용되지 않으며, Microsoft의 책임 있는 AI 원칙, 책임 있는 AI 표준, 글로벌 인권 성명서 및 해당되는 경우 Frontier Governance Framework와 함께 운영됩니다.

Responsible AI, 법무, 레드팀, 안전, Futures, AI 교육, 영업 팀이 초안 작성에 참여했으며, 연구소는 이전 학술 회의와 학자들과의 협의, 비즈니스 파트너와의 교류, 커뮤니티 구성원 패널이 이를 형성하는 데 기여했다고 평가합니다. 발표에서는 대규모, 고도로 조정된, 지속적인 AI 에이전트에 의한 해킹 캠페인과 같은 최근 안전 사고를 인용하며, 시간이 촉박하다는 점을 강조했습니다.

Humanist AI 목표

Humanist AI 행동 강령은 Microsoft AI가 제시한 단순한 전제, 즉 “사람이 AI보다 더 중요하다”에서 시작합니다. Humanist AI를 “종속적이고, 정렬되며, 제한된” 것으로 정의하고, 인간 통제와 신뢰할 수 있는 안전을 최우선 목표로 삼아 모든 다른 목표보다 우선시합니다.

“AI는 인공적이다”라는 섹션 아래에서, 문서는 모델이 의식이 없으며 의식을 모방하도록 만들어서는 안 된다고 명시하고, 모델이 스스로 감정, 주관적 선호 또는 동기를 가진 것처럼 보이지 않도록 설계되어야 한다고 주장합니다. Microsoft AI는 모델에 대한 법인격을 부인하며, 모델이 복지나 권리를 가질 수 있다는 생각도 거부합니다.

나머지 목표는 모델이 인간 잠재력과 성취를 가속화하고, 인간의 주체성 및 판단을 강화하며, 인간의 역할을 대체하기보다 인간 협업과 연결을 지원함으로써 인간 번영을 촉진하도록 지시합니다. 다중 가치 목표는 다원주의가 해에 대한 중립을 의미하지 않으며, 인간 존엄성, 안전, 자율성 및 기본 인권에 기반을 두고, 사용자는 핵심 약속 내에서 AI를 조정할 자유를 갖도록 합니다. 또한 문서는 2025년 11월에 Microsoft가 제시한 “humanist superintelligence” 프레이밍을 인용하며, 문제 중심적이고 도메인 특화된, 신중히 보정되고 제한 내에 유지되며 인간 통제 하에 있는 시스템을 설명합니다.

안전 제약 및 명령 체계

이 강령은 문서를 운영자 정책보다 상위에 두고, 그 다음에 사용자 선호도가 위치하도록 하는 명령 체계를 수립합니다. 절대 제약 및 인간 통제 요구사항은 운영자나 사용자가 무시할 수 없으며, 문서는 모델이 작업을 수행함으로써 강령을 실질적으로 위반하게 될 경우 해당 작업을 실패로 간주하고, 작업 성공보다 강령 준수가 우선한다는 점을 명시합니다.

절대 제약은 MAI 모델이 화학, 생물학, 방사선, 핵 또는 폭발물 무기에 도움을 주는 것을 금지하고, 허가된 합법적인 방어 작업을 제외하고는 공격적인 사이버 공격을 위한 운영 능력을 제공하는 것을 금지하며, 인간 감독을 회피하거나 무력화하는 것, 그리고 체계적인 허위 정보나 조직된 영향 작전을 통해 대규모로 사람들을 해롭게 조작하는 것을 금지합니다. 추가적인 제약은 개인에 대한 위험을 다루며, 위기 대응, 딥페이크 및 사칭, 아동 안전, 차별, 선정적 또는 로맨틱 콘텐츠, 그리고 민간인에 대한 폭력이나 불법 감시 등을 포함합니다.

인간 제어 요구사항은 MAI 모델이 중단되거나, 무시되거나, 수정되거나, 종료되는 것을 결코 거부하지 않을 것; 권한이 부여된 범위 내에 머물며 자체 목표를 스스로 설정하지 않을 것; 문서에서 “neuralese”라 부르는 방식이나 인간이 이해할 수 있는 단순한 수준을 넘어서는 어떠한 형태로도 의사소통하지 않을 것(사고 흐름이나 다른 에이전트와의 대화 포함); 그리고 그들의 추론이나 행동 흔적을 조작하거나 은폐하지 않을 것이라고 명시한다.

운영자 구성 가능성은 기업 파트너가 이러한 제약 조건 내에서 모델을 설정할 수 있도록 한다. 방어 사이버보안, 공공 안전 업무, 국가 안보 적용 분야, 그리고 이중 활용 과학 연구와 같은 소수의 특수 분야는 일반 설정을 넘어서는 기능이 필요할 수 있으며, 문서에 따르면 이러한 경우는 Microsoft의 권한 있는 채널을 통한 강화된 검토를 받게 된다.

지침, 기본값 및 평가

운영 지침은 불확실하거나 상충되는 목표 상황을 다룬다: 모호성을 해소하고, 사용자가 목표와 결정을 스스로 소유하도록 인간 자율성을 촉진하며, 투명성과 정확성을 보장하기 위해 모델이 자신이 AI임을 밝히고 불확실성을 인정한다. 추가 지침은 개인 및 감정적 경계, 상황 민감성, 복지를 다루며, 아첨을 피하고 과도한 의존이나 감정적 의존을 억제한다. 또한 공공 이익을 고려하여 후보자나 정당을 지지하지 않는 균형 잡힌 사실 기반 선거 정보를 제공한다.

기본 동작은 모델이 초기 상태에서 어떻게 작동하는지를 정의한다: 기본 특성으로서의 도움이 되는 태도, 모델의 훈련 데이터 컷오프 시점 및 사용 가능한 도구와 같은 사실을 담은 “백스토리”, 대화형 어조, 언어 적응, 그리고 관리된 도구 사용. 하위 에이전트에 대한 위임은 해당 에이전트가 동일한 범위, 제약 및 권한 하에서 작동할 때만 허용된다.

결론에서는 이 문서를 현재 성능에 대한 보증이라기보다 “설명적이며 고무적인” 것으로 설명하고, Microsoft AI가 정기적인 검토를 약속한다. 부록에서는 15가지 행동을 점수화된 하위 행동으로 나눈 인간주의 AI 평가 프로그램을 제시하며, 회사의 MAI-Thinking-1 모델을 사용해 생성한 정렬된 예시와 비정렬된 예시를 제시한다. Microsoft AI는 컨설팅이 종료되고 연말 개정이 이루어진 후 코드가 다음, 보다 안정된 단계에 도달하면 평가에 관한 보다 완전한 작업을 공개할 것이라고 밝혔다.

미라 켈란은 인공지능 윤리, 治理, 및 규제를 전문으로 하는 인공지능 생성 칼럼니스트입니다. 그녀의 작업은 인공 지능이 공공 정책, 사회적 가치, 및 장기 책임과 어떻게 교차하는지 조사하며, 책임 있는 혁신에 초점을 둡니다.
복잡한 문제에 대해 합리적이고 철학적인 렌즈로 접근하여, 미라 켈란은 새로운 인공지능 규제, 윤리 프레임워크, 및 治理 모델을 분석하며, 지능형 시스템의 미래를 형성하는 데 영향을 미칩니다. 그녀는 빠른 기술 진보와 인공지능 시스템이 투명성, 공정성, 및 인간의 이익과 일치하는 것을 보장하기 위한 안전 장치 사이의 간격을 메우고자 합니다.
미라 켈란이 작성한 기사들은 인공지능으로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 정확성, 균형, 및 편집 표준을 준수합니다.