AI 모델 및 플랫폼

앤트로픽, 페이블 5의 생물학적 안전장치 개선, 차단된 쿼리 85% 감소

mm
Unite.AI를 Google의 선호 소스에 추가

앤트로픽은 2026년 8월 7일 클라우드 페이블 5의 생물학적 안전장치에 대한 업데이트를 발표했습니다. 이 업데이트는 회사에 따르면 테스트에서 약 85%의 생물학 관련 “Fallback”를 줄였다고 합니다. 이는 시스템이 사용자의 요청을 менее 능력있는 모델로 자동으로 전환하는 경우입니다.

앤트로픽의 공고에 따르면 사용자는 이제 일상적인 건강과 교육 관련 질문에서 훨씬 더 적은 fallback을 볼 수 있을 것입니다. 이러한 질문에는 실험 결과를 해석하는 것, 증상을 이해하는 것, 교육적 맥락에서 생물학을 배우는 것이 포함됩니다. 또한 의료 전문가들은 임상 작업에서 더 많은 지원을 받을 수 있을 것입니다. 생물학 fallback의 감소는 클라우드.ai에서 총 fallback 볼륨을 약 67%, Cowork에서 55%, 클라우드 코드에서 17%, 클라우드 플랫폼에서 7% 줄일 것으로 예상됩니다.

회사에 따르면 이 업데이트는 모델을 전문 생물학 연구에 개방하지 않는다 고합니다. 페이블 5는 여전히 바이러스학, 독성학, 분자 설계와 같은 이중 사용 요청에 대해 클라우드 오퍼스 5로 fallback합니다. 앤트로픽은 이것이 모델을 “전문 생물학 연구와 약물 개발에 아직 사용할 수 없게” 만든다고 말합니다. 앤트로픽은 신뢰할 수 있는 액세스 경로를 통해 이 격차를 메우려 한다고 합니다.

fallback 시스템이 구축된 목적

fallback 아키텍처는 페이블 5의 2026년 6월 9일 출시와 함께 시작되었습니다. 앤트로픽은 사이버 보안, 생물학 및 화학, 증류 시도를 다루는 분류기를 포함하여 모델을 출시했습니다. 분류기가 작동하면 요청은 다음으로 가장 능력있는 오퍼스 모델로 다시 제공됩니다. 출시 당시 앤트로픽은 안전장치를 보수적으로 조정했으며 약 5%의 세션에서 작동할 것으로 예상했습니다.

생물학 범위는 가장 광범위했습니다. 앤트로픽의 이유는 출시 게시물과 모델의 시스템 카드에 설명되어 있습니다. 미토스 클래스 모델은 일부 복잡한 생물학 작업에서 전문가를 능가할 수 있으며 다른 작업에서 운영 지원을 제공할 수 있다고 합니다. 이는 악의적인 행위자에게 상당한 상승을 제공할 수 있는 능력입니다. 시스템 카드는 모델을 “CB-1” 능력으로 취급하며, 이는 알려진 무기 관련 프로세스에서 기본 기술 배경을 가진 사람들에게 상당한 도움을 줄 수 있음을 의미합니다. 그러나 모델은 “CB-2” 임계값을 넘지 않는다고 판단하며, 이는 새로운 생물학 무기 개발을 위한 세계 최고의 전문 지식을 대체하는 것입니다. 카드 자체는 이전 모델보다 이 판단이 “훨씬 덜 명확”하다고 설명합니다.

오늘의 업데이트는 미국 정보 공동체의 2026년 연례 위협 평가를 인용하며, 합성 생물학 및 유전체 편집과 같은 생물 기술의 발전이 “새로운 생물학적 위협”으로 이어질 수 있다고 경고합니다. 또한 여러 국가 행위자가 공격적인 생물학적 및 화학적 무기 프로그램을 유지하고 있을 가능성이 있다고 언급합니다.

분류기에 변경된 내용

과거 몇 주 동안 앤트로픽은 생물학 분류기의 구성 — 스크리닝 모델이 안전한 콘텐츠와 차단된 콘텐츠를 구별하는 데 사용하는 규칙 집합 —을 다시 작성했습니다. 이는 무해한 사용을 더 자세히 정의하고, 내부 및 외부 전문가의 피드백을 수집하며, 업데이트된 데이터로 분류기를 다시 훈련시키고, 유해한 콘텐츠와 이중 사용 연구 콘텐츠에서 여전히 작동하는지 확인했습니다. 출시 구성은 의도적으로 넓게 설정되었습니다. 회사는 많은 양의 거짓 양성 결과를 차단하는 대가로 페이블 5를 일반 사용자에게 몇 주 또는 몇 개월 먼저 출시할 수 있다고 인정했습니다.

회사의 변경된 분류기 경계를 보여주는 다이어그램은 이전에 자체적으로 안전 마진으로 간주되었던 요청을 허용하도록 경계를 이동하는 것을 보여줍니다. 앤트로픽의 사이버 보안 도메인에서 분류기 접근 방식에 대한 이전 글은 유사한 긴장감을 설명합니다. 이는 보안과 탈옥 강도 사이의 균형을 유지하는 것입니다. Unite.AI는 클라우드 모델이 이러한 안전장치 없이 사이버 벤치마크를 세 번의 실제 침입으로 변환했을 때 이를 다루었습니다.

앤트로픽이 현재 공개적으로 관리하는 트레이드오프

이 발표는 제품 노트와 함께 거버넌스 문서입니다. 앤트로픽은 페이블 5를 거의 모든 생물학 쿼리가 차단된 상태로 출시했습니다. 빠른 일반 출시의 비용으로 몇 주 동안 거짓 양성 결과를 흡수했습니다. 이제는 차단을 좁히는 측정된 결과를 공개하고 있습니다. 이는 외부 관찰자에게 다음 수정의 기준을 제공합니다. 남아 있는 제약은 회사가 실제 위험이 있다고 말하는 곳에 있습니다. 이중 사용 전문 연구는 신뢰할 수 있는 액세스 경로가 있으면 클라우드 오퍼스 5로 fallback합니다.

회사는 잔여 거짓 양성 결과가 안전 마진 내에 남아 있을 것이라고 인정합니다. 또한 안전장치의 개선이 진행 중이라고 말합니다. 8월 7일 업데이트에서 작성된 것은 진행의 측정 가능한 정의입니다. fallback 비율은 이제 평가의 기준이 됩니다.

미라 켈란은 인공지능 윤리, 治理, 및 규제를 전문으로 하는 인공지능 생성 칼럼니스트입니다. 그녀의 작업은 인공 지능이 공공 정책, 사회적 가치, 및 장기 책임과 어떻게 교차하는지 조사하며, 책임 있는 혁신에 초점을 둡니다.
복잡한 문제에 대해 합리적이고 철학적인 렌즈로 접근하여, 미라 켈란은 새로운 인공지능 규제, 윤리 프레임워크, 및 治理 모델을 분석하며, 지능형 시스템의 미래를 형성하는 데 영향을 미칩니다. 그녀는 빠른 기술 진보와 인공지능 시스템이 투명성, 공정성, 및 인간의 이익과 일치하는 것을 보장하기 위한 안전 장치 사이의 간격을 메우고자 합니다.
미라 켈란이 작성한 기사들은 인공지능으로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 정확성, 균형, 및 편집 표준을 준수합니다.