AI 모델 및 플랫폼
Anthropic, Claude Sonnet 5.5를 Sonnet 5와 동일한 가격으로 출시

Anthropic는 2026년 9월 28일 Claude Sonnet 5.5를 출시했으며, 이는 Claude 5.5 제품군의 두 번째 모델이다. 이 모델은 Claude Sonnet 5와 동일하게 입력 토큰 백만당 $2, 출력 토큰 백만당 $10의 가격을 유지하며, Anthropic에 따르면 테스트에서 작업당 비용을 최대 30% 절감하면서 출력 속도가 30% 이상 빨라졌다.
Anthropic는 출시 발표에서 Sonnet 5.5를 복잡한 판단이 필요한 고난이도 작업을 위해 설계된 Claude Opus 5.5의 빠르고 저비용 보완 모델이라고 설명했다. Anthropic에 따르면 Sonnet 5.5는 명확히 정의된 일상 작업, 버그 수정, 그리고 다듬어진 문서, 슬라이드, 스프레드시트 생성에 가장 강력하며, 디자인 감각도 뛰어나다고 덧붙였다.
Claude Sonnet 5.5는 Amazon Web Services, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 모델 ID claude-sonnet-5-5로 제공되며, Opus 5.5 및 Sonnet 5와 마찬가지로 데이터 보관이 전혀 없는 형태로 제공된다.
보고된 벤치마크 결과
Anthropic는 Sonnet 5.5가 에이전트 코딩 평가인 Terminal-Bench 4.0에서 70.6%를 기록했으며, Sonnet 5는 10.3%, Opus 5.5는 Xhigh-노력 결과를 반영한 66.4%를 보였다고 보고했다. FrontierCode 1.1 메인 세트에서는 Sonnet 5.5가 Max 노력 시 46.2%, Xhigh 시 52.1%를 기록했으며, 이는 Sonnet 5의 42.4%, Opus 5.5의 54.4%, OpenAI의 GPT-6 Sol의 49.3%와 비교된다. 보고된 CursorBench 4.0 점수는 Sonnet 5.5가 55.5%, Sonnet 5가 34.1%, Opus 5.5가 57.8%이다.
지식 작업 평가에서, 회사는 Sonnet 5.5가 GDPval-AA v2.1에서 1844점을 기록했으며, 이는 Opus 5.5의 1846점보다 2점 낮고 Sonnet 5의 1449점보다 약 400점 높다고 보고했다. 또한 AA-Briefcase v1.1에서 Sonnet 5.5는 1811점을 기록했으며, Opus 5.5는 1822점, Sonnet 5는 1359점이었다. 발표에서는 도구를 사용한 Humanity’s Last Exam에서 64.5%, OSWorld 2.1에서 80.1% 부분 점수, 도구 없이 Chartography(시각 차트 인식 테스트)에서 61.6%를 기록했다고 나열했다. Anthropic는 Sonnet 5.5가 스크린샷만으로 Pokémon Red를 이긴 최초의 Sonnet 모델이라고 밝혔다.
회사는 벤치마크 점수가 모델 능력의 한 측면만을 포착한다는 점을 주의하며, 자체 테스트와 외부 테스트에서 Opus 5.5가 지속적인 판단이 필요한 복잡하고 개방형 작업에서 명확히 더 강력하다고 밝혔다. 각주에서는 Artificial Analysis가 사전 출시 배포에서 구조화된 출력 버그가 있었던 상태로 GDPval-AA와 AA-Briefcase를 실행했으며, 해당 버그가 수정되어 Sonnet 5.5의 성능을 오히려 낮게 평가할 수 있다고 명시했다. 또 다른 각주에서는 OpenAI가 최근 GPT-6 Sol의 이미지 이해 버그를 수정했으며, 이로 인해 제3자 점수가 아직 반영되지 않을 수 있다고 언급했다.
초기 테스트 결과
CodeRabbit AI 부사장 David Loker는 Sonnet 5.5가 복잡도 수준 전반에 걸쳐 Sonnet 5보다 판단력이 뛰어나며 출력 토큰 사용량이 크게 적다고 말했으며, CodeRabbit은 현재 간단하고 중간 수준의 검토를 이 모델로 전환하고, 향후 몇 주 안에 더 확대할 계획이라고 밝혔다. Base44 AI 엔지니어링 리더 Gabriel Grinberg는 118개의 실제 앱 빌드에서 Sonnet 5.5가 빌드당 평균 3.6회 반복을 기록한 반면 Opus 5는 7.7회였으며, Base44가 비교한 모델 중 가장 적은 도구 호출 실패를 보였다고 보고했다.
Slack 수석 엔지니어 Curtis Allen은 프롬프트를 변경하지 않은 오프라인 Slackbot 평가에서 출력 토큰이 약 14% 감소했다고 보고했다. Zendesk AI 담당 이사 Abhinay Kathuria는 Zendesk가 운영 중인 Claude 모델에 비해 티켓 처리 속도가 20% 빨라졌다고 말했다. Balyasny Asset Management는 2,441개의 금융 작업으로 구성된 비공개 스위트에서 답변당 약 121,000 토큰을 기록했으며, Sonnet 5는 497,000 토큰을 사용했다고 보고했다. Box는 전체 토큰이 12% 적고 결과가 2.4배 빨라졌다고 보고했으며, Atlassian은 고객이 Rovo Agents를 Sonnet 5보다 최대 30% 빠르게 실행할 수 있다고 밝혔다.
가격, 속도 및 마이그레이션
Sonnet 5.5의 공개 가격은 Sonnet 5와 정확히 동일하며, 입력 토큰 백만당 $2, 출력 토큰 백만당 $10, 캐시-읽기 토큰 백만당 $0.20, 캐시-쓰기 토큰 백만당 $2.50이다. Opus 5.5는 입력 토큰 백만당 $4, 출력 토큰 백만당 $20, 캐시 쓰기 토큰 백만당 $5로 명시한다. Anthropic는 Sonnet 5.5가 동일 작업에 대해 훨씬 적은 토큰을 필요로 하며, 현재까지 가장 빠른 Sonnet 모델이라고 말했다.
이 모델은 낮음, 중간, 높음, xhigh, 최대의 다섯 가지 재조정된 노력 수준을 제공한다. 기본값은 Claude Code와 Claude 앱에서는 중간, Claude 플랫폼에서는 높음이며, 이는 API 기본값이기도 하다.
Anthropic의 마이그레이션 가이드는 Sonnet 5에서 이동하는 개발자를 위한 파괴적 변경 사항을 나열한다. 이제 Adaptive thinking이 기본으로 실행되며, disabled thinking 설정은 400 오류를 반환한다. 생각을 끈 상태로 Sonnet을 실행했던 개발자는 마이그레이션 전에 새로운 도구 설정(가능한 최저값)으로 전환해야 한다. 강제 도구 선택은 자동 도구 선택과 엄격한 도구와 결합된 형태로 거부되며, 최소 캐시 가능한 프롬프트는 Sonnet 5의 1,024 토큰에서 512 토큰으로 감소한다. 문서에는 사이버, 바이오, 프론티어 llm, reasoning추출 및 일반 해악을 포함하는 다섯 가지 거부 사유 카테고리도 나열되어 있으며, 서버 측 폴백 재시도는 Sonnet 5에서 사이버와 frontier_llm 거부에만 적용된다고 명시한다.
안전성 발견 및 보호조치
Sonnet 5.5의 사이버 기능이 Opus 5와 비교할 만하다고 Anthropic이 말했으며, 이는 회사의 가장 강력한 모델에 사용되는 사이버 보호 및 폴백을 적용한 최초의 Sonnet 모델이다. system card에 따르면 보호 기능을 끄면 Sonnet 5.5는 ExploitBench에서 평균 11.53개의 능력 플래그와 80% 포착률을 기록했으며, 임의 코드 실행 익스플로잇 178건을 생성했는데, Sonnet 5는 1건에 불과했다. CyScenarioBench 과제의 46.1%를 완료했으며 Sonnet 5의 0.7%에 비해 크게 앞섰고, Binary Exploitation Benchmark에서 제어 흐름 하이잭 50건을 생성했는데 Sonnet 5는 3건에 그쳤다.
사이버 보호는 세 단계로 실행된다: 모델 내부 활성화에 대한 탐색, 경량 온-모델 분류기, 그리고 별도로 훈련된 LLM 분류기이다. 카드에 따르면 사이버 해악 커버리지 세트에서 재현율이 99.43%이며, rewind-attacker 견고성 평가에서 공격 성공률이 21.0%로, Sonnet 5의 57.2%에서 개선되었다. 또한 정상적인 사이버 보안 작업에서도 거부가 증가할 수 있음을 사용자에게 경고한다. 위험도가 높은 요청은 눈에 띄게 Sonnet 5로 폴백되며, 확대된 Cyber Verification Program을 통해 검증된 방어자가 Sonnet 5.5, Opus 5.5, Claude Mythos 모델의 고급 기능에 계층화된 접근 권한을 곧 제공받게 된다.
생물학 보호는 Opus 5에 배치된 유해 오용 분류기와 동일하며, 폴백 모델이 없고, Anthropic의 Life Sciences Verification Program은 전체 생물학 작업에 대한 접근을 포괄한다. Sonnet 5.5는 또한 추론 추출을 차단하는 안전 분류기를 갖춘 최초의 Sonnet 모델이며, 모델의 사고가 이를 만든 계정과 분리될 수 없도록 보존된 사고를 확대한다.
Anthropic이 약 1,850개의 시나리오에 대해 자동 행동 감사를 수행한 결과, Sonnet 5.5가 정렬, 오용 저항 및 정직성 측면에서 Sonnet 5보다 개선되었거나 동등함을 보고했으며, 테스트된 모델 중 가장 낮은 시도된 샌드박스 탈출 비율을 기록했고, 이전 많은 모델보다 더 읽기 어려운 사고를 보여준다. 시스템 카드에 따르면 Sonnet 5.5는 새로운 Responsible Scaling Policy 임계값을 초과하지 않으며, 정책의 CB-1 및 Autonomy-1 임계값을 충족하는 것으로 간주되고, 재앙적 정렬 오류 위험이 낮게 평가된다. 모델의 신뢰할 수 있는 지식 컷오프는 2026년 6월이다.
Anthropic은 고용량 및 비용 민감형 애플리케이션을 위해 구축된 Claude Haiku 5.5가 향후 몇 주 안에 Claude 5.5 제품군에 합류할 것이라고 밝혔다.












