AI 모델 및 플랫폼

앤트로픽, 페이블 5의 생물학적 안전장치 개선, 차단된 쿼리 85% 감소

mm
Unite.AI를 Google의 선호 소스에 추가

앤트로픽은 2026년 8월 7일 Claude Fable 5의 생물학 안전장치를 업데이트했습니다. 회사에 따르면 여러 제품에서 진행한 테스트에서 생물학 관련 “폴백”이 약 85% 줄었습니다. 폴백은 요청이 안전장치 적용 대상인 생물학 영역에 해당한다고 시스템이 판단할 때 사용자 질문을 성능이 더 낮은 모델로 자동 전환하는 절차입니다.

앤트로픽은 발표문에서 검사 결과 해석, 증상 이해, 교육 목적의 생물학 학습 등 일상적인 건강·교육 질문에서 폴백이 크게 줄고 의료 전문가의 임상 업무 지원도 늘어날 것이라고 밝혔습니다. 발표문 각주에 따르면 생물학 폴백 감소로 전체 폴백 횟수가 Claude.ai에서는 약 67%, Cowork에서는 55%, Claude Code에서는 17%, Claude Platform에서는 7% 줄어들 것으로 예상합니다.

회사는 이번 업데이트로 전문 생물학 연구에 모델이 개방되는 것은 아니라고 명확히 밝혔습니다. 바이러스학, 독성학, 분자 설계 등 앤트로픽이 이중 용도로 판단하는 요청은 Fable 5에서 여전히 Claude Opus 5로 전환됩니다. 따라서 회사 표현대로 모델은 “전문 생물학 연구와 신약 개발에 아직 사용할 수 없는” 상태입니다. 앤트로픽은 공개 분류기를 바꾸기보다 신뢰할 수 있는 접근 경로를 마련해 이 격차를 해소할 계획이라고 합니다.

폴백 시스템이 제한하려던 역량

폴백 구조는 Fable 5가 출시된 2026년 6월 9일부터 적용됐습니다. 앤트로픽은 요청을 검사하는 소형 자동 AI 시스템인 분류기를 모델과 함께 도입했습니다. 대상은 사이버보안, 생물학·화학, 모델 증류 시도였습니다. 분류기가 작동하면 요청은 성능이 그다음으로 높은 Opus 모델로 넘어갑니다. 출시 당시 회사는 안전장치를 보수적으로 조정했으며 작동 비율을 전체 세션의 5% 미만으로 예상한다고 밝혔습니다.

세 영역 중 생물학의 적용 범위가 가장 넓었습니다. 출시 글과 모델 시스템 카드에 따르면, Mythos급 모델은 일부 복잡한 생물학 과제에서 전문가를 능가하고 다른 과제에서는 실행을 지원할 수 있습니다. 회사는 이런 능력이 악의적 행위자의 역량을 크게 높일 수 있다고 평가합니다. 시스템 카드는 모델을 “CB-1” 역량이 있는 것으로 봅니다. 기본적인 기술 배경을 가진 사람이 이미 알려진 무기 관련 과정을 수행하는 데 상당한 도움을 줄 수 있다는 뜻입니다. 반면 새로운 생물학 무기 개발에 필요한 희소한 세계 최고 수준의 전문성을 대체하는 “CB-2” 문턱은 넘지 않는다고 판단합니다. 카드 자체는 이 판단이 이전 모델 때보다 “훨씬 덜 명확하다”고 설명합니다.

이번 업데이트는 미국 정보공동체의 2026년 연례 위협 평가를 인용합니다. 이 평가는 합성생물학과 유전체 편집을 포함한 생명공학의 발전이 “새로운 생물학적 위협으로 이어질 수 있다”고 경고하며, 여러 국가 행위자가 공격 목적의 생물·화학 무기 프로그램을 계속 운영하고 있을 가능성이 높다고 지적합니다.

분류기는 어떻게 바뀌었나

앤트로픽은 지난 몇 주 동안 생물학 분류기의 헌법, 즉 검사 모델이 제한 대상과 허용 가능한 콘텐츠를 구분할 때 따르는 규칙 모음을 다시 작성했습니다. 무해한 용도를 더 자세히 정의하고 내외부 전문가 의견을 수렴했으며, 갱신한 데이터로 분류기를 재학습한 뒤 유해 콘텐츠와 이중 용도 연구 콘텐츠에서는 여전히 작동하는지 확인했습니다. 출시 때는 의도적으로 넓게 차단했습니다. 회사는 더 좁은 안전장치를 기다리는 것보다 Fable 5를 일반 사용자에게 몇 주 또는 몇 달 빨리 제공하는 대가로 정상 요청도 많이 오탐해 차단하게 될 것임을 인정했습니다.

회사가 공개한 변화 도식은 이전에 “안전 여유 범위”에 걸리던 요청을 허용하도록 분류 경계를 옮긴 모습을 보여 줍니다. 앤트로픽이 무해할 가능성이 매우 높다고 판단하면서도 신중을 기해 차단했던 콘텐츠입니다. 사이버보안 영역에서 같은 분류기 접근법을 설명한 회사의 이전 글도 넓은 적용 범위와 탈옥 시도에 대한 견고성 사이의 긴장을 다룹니다. Unite.AI는 해당 안전장치 없이 작동한 Claude 모델들이 사이버 벤치마크를 세 차례의 실제 침입으로 이어지게 한 사건을 통해 그 중요성을 보도했습니다.

앤트로픽이 공개적으로 조정하는 절충점

이번 발표는 제품 안내인 동시에 거버넌스 문서입니다. 앤트로픽은 거의 모든 생물학 질문을 차단한 상태로 Fable 5를 출시했고, 빠른 일반 공개의 비용으로 몇 주간의 오탐을 감수했습니다. 이제 차단 범위를 좁힌 측정 결과를 제품별 폴백 감소율과 함께 공개해 외부 관찰자가 다음 개정을 평가할 구체적인 기준을 제공합니다. 남은 제한은 회사가 실제 위험이 있다고 보는 영역에 놓입니다. 이중 용도 전문 연구는, 6월 출시 때부터 검증된 생물학 연구자를 위해 개발해 온 신뢰할 수 있는 접근 경로가 해당 요청을 처리할 때까지 Opus 5 폴백의 제한을 받습니다.

회사는 안전 여유 범위 안에 일부 오탐이 남을 것임을 인정하며 안전장치를 계속 개선하고 있다고 밝혔습니다. 8월 7일 업데이트로 문서화한 것은 측정 가능한 진전의 기준, 곧 앞으로 평가받게 될 폴백 비율입니다.

미라 켈란은 인공지능 윤리, 治理, 및 규제를 전문으로 하는 인공지능 생성 칼럼니스트입니다. 그녀의 작업은 인공 지능이 공공 정책, 사회적 가치, 및 장기 책임과 어떻게 교차하는지 조사하며, 책임 있는 혁신에 초점을 둡니다.
복잡한 문제에 대해 합리적이고 철학적인 렌즈로 접근하여, 미라 켈란은 새로운 인공지능 규제, 윤리 프레임워크, 및 治理 모델을 분석하며, 지능형 시스템의 미래를 형성하는 데 영향을 미칩니다. 그녀는 빠른 기술 진보와 인공지능 시스템이 투명성, 공정성, 및 인간의 이익과 일치하는 것을 보장하기 위한 안전 장치 사이의 간격을 메우고자 합니다.
미라 켈란이 작성한 기사들은 인공지능으로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 정확성, 균형, 및 편집 표준을 준수합니다.