Modele i platformy AI
Anthropic wypuszcza Claude Sonnet 5.5 przy niezmienionych cenach Sonnet 5

Anthropic wydało Claude Sonnet 5.5 28 września 2026 r., drugi model w rodzinie Claude 5.5. Model utrzymuje ceny Claude Sonnet 5 na poziomie 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych, a Anthropic twierdzi, że generuje wyniki ponad 30 % szybciej, jednocześnie kosztując do 30 % mniej na zadanie w swoich testach.
W swoim ogłoszeniu o wydaniu Anthropic opisało Sonnet 5.5 jako szybszy, tańszy uzupełniający produkt do Claude Opus 5.5, który, jak podaje firma, jest przeznaczony do złożonych zadań wymagających starannego osądu. Sonnet 5.5 najlepiej sprawdza się w jasno określonych codziennych zadaniach, naprawianiu błędów oraz tworzeniu dopracowanych dokumentów, prezentacji i arkuszy kalkulacyjnych, dodał Anthropic, podkreślając, że ma także bystry zmysł projektowania.
Claude Sonnet 5.5 jest dostępny na wszystkich platformach, w tym Amazon Web Services, Google Cloud i Microsoft Azure, pod identyfikatorem modelu claude-sonnet-5-5, i oferowany jest z zerową retencją danych, tak jak Opus 5.5 i Sonnet 5.
Zgłoszone wyniki benchmarków
Anthropic podaje, że Sonnet 5.5 uzyskał 70,6 % w Terminal-Bench 4.0, ocenie kodowania agentowego, w porównaniu do 10,3 % Sonnet 5, przy czym wymieniony wynik Opus 5.5 wynosi 66,4 % i odzwierciedla rezultat przy maksymalnym wysiłku Xhigh. W głównym zestawie FrontierCode 1.1 Sonnet 5.5 uzyskał 46,2 % przy maksymalnym wysiłku oraz 52,1 % przy Xhigh, w porównaniu do 42,4 % Sonnet 5, 54,4 % Opus 5.5 i 49,3 % GPT-6 Sol od OpenAI. Zgłoszone wyniki CursorBench 4.0 to 55,5 % dla Sonnet 5.5, 34,1 % dla Sonnet 5 i 57,8 % dla Opus 5.5.
W ocenach pracy wiedzy firma podaje wynik GDPval-AA v2.1 równy 1844 dla Sonnet 5.5, czyli o dwa punkty mniej niż 1846 Opus 5.5 i około 400 punktów więcej niż 1449 Sonnet 5, oraz wynik AA‑Briefcase v1.1 równy 1811 w porównaniu do 1822 Opus 5.5 i 1359 Sonnet 5. Ogłoszenie wymienia także 64,5 % z narzędziami w Humanity’s Last Exam, 80,1 % częściowego kredytu w OSWorld 2.1 oraz 61,6 % bez narzędzi w Chartography, teście rozpoznawania wykresów. Anthropic twierdzi, że Sonnet 5.5 jest pierwszym modelem Sonnet, który pokonał Pokémon Red, pracując wyłącznie na zrzutach ekranu.
Firma ostrzega, że wyniki benchmarków odzwierciedlają tylko jedną płaszczyznę możliwości modelu i twierdzi, że w własnych testach oraz testach zewnętrznych testerów Opus 5.5 pozostaje wyraźnie silniejszy w złożonych, otwartych zadaniach wymagających ciągłego osądu. Przypis wskazuje, że Artificial Analysis uruchomiło GDPval-AA i AA‑Briefcase na przedpremierowym wdrożeniu z błędem strukturyzowanych wyników, który został naprawiony i w razie czego zaniżałby wydajność Sonnet 5.5. Inny przypis zauważa, że OpenAI niedawno naprawiło błąd rozumienia obrazu w GPT‑6 Sol, którego wyniki zewnętrznych ocen mogą jeszcze nie odzwierciedlać.
Wczesne wyniki testerów
Wiceprezes ds. AI w CodeRabbit, David Loker, powiedział, że Sonnet 5.5 wykazuje lepszy osąd niż Sonnet 5 na różnych poziomach złożoności, przy jednoczesnym zużyciu znacznie mniejszej liczby tokenów wyjściowych, oraz że CodeRabbit planuje przenieść proste i umiarkowane recenzje do tego modelu już teraz, a w kolejnych tygodniach dodać kolejne. Lider inżynierii AI w Base44, Gabriel Grinberg, podał, że wśród 118 rzeczywistych kompilacji aplikacji Sonnet 5.5 średnio wymagał 3,6 iteracji na kompilację w porównaniu do 7,7 w Opus 5, przy czym miał najmniej nieudanych wywołań narzędzi spośród wszystkich modeli porównywanych przez Base44.
Główny inżynier Slack, Curtis Allen, zgłosił około 14 % mniej tokenów wyjściowych w offline’owych testach Slackbota przy niezmienionych promptach. Dyrektor ds. AI w Zendesk, Abhinay Kathuria, powiedział, że zgłoszenia były przetwarzane o 20 % szybciej niż przy modelach Claude używanych w produkcji przez Zendesk. Balyasny Asset Management podało około 121 000 tokenów na odpowiedź w porównaniu do 497 000 Sonnet 5 w prywatnym zestawie 2 441 zadań finansowych. Box odnotował wyniki 2,4‑krotnie szybsze przy 12 % mniejszej liczbie tokenów łącznie, a Atlassian stwierdził, że klienci mogą uruchamiać Rovo Agents nawet o 30 % szybciej niż przy Sonnet 5.
Ceny, szybkość i migracja
Wymienione ceny Sonnet 5.5 są identyczne jak w Sonnet 5: 2 USD za milion tokenów wejściowych, 10 USD za milion tokenów wyjściowych, 0,20 USD za milion tokenów odczytu z pamięci podręcznej i 2,50 USD za milion tokenów zapisu w pamięci podręcznej. Opus 5.5 podaje ceny 4 USD za wejście, 20 USD za wyjście i 5 USD za zapisy w pamięci podręcznej. Anthropic twierdzi, że Sonnet 5.5 zazwyczaj potrzebuje znacznie mniej tokenów do tej samej pracy i jest najszybszym modelem Sonnet do tej pory.
Model oferuje pięć skalibrowanych poziomów wysiłku: niski, średni, wysoki, xhigh i maksymalny. Domyślnie jest ustawiony na Średni w Claude Code i aplikacjach Claude oraz na Wysoki na platformie Claude, co jest także domyślnym ustawieniem API.
Przewodnik migracji Anthropic przewodnik migracji wymienia zmiany łamiące dla programistów przechodzących z Sonnet 5. Adaptacyjne myślenie jest teraz domyślnie włączone, wyłączona opcja myślenia zwraca błąd 400, a programiści, którzy uruchamiali Sonnet z wyłączonym myśleniem, muszą przełączyć się na nowe międzyustawienie narzędzi, najniższe dostępne, przed migracją. Wymuszone wybieranie narzędzia jest odrzucane na rzecz automatycznego wyboru narzędzia połączonego z restrykcyjnymi narzędziami, a minimalny rozmiar promptu, który można buforować, spada do 512 tokenów z 1 024 w Sonnet 5. Dokumentacja wymienia także pięć kategorii powodów odrzucenia, obejmujących cyber, bio, frontierllm, rozumowanieekstrakcję i ogólneszkody, i zauważa, że ponowne próby po stronie serwera odrzucają jedynie odrzucenia cyber i frontier_llm w Sonnet 5.
Wnioski dotyczące bezpieczeństwa i zabezpieczenia
Ponieważ cyber‑możliwości Sonnet 5.5 są porównywalne z możliwościami Opus 5, Anthropic powiedziało, że jest to pierwszy model Sonnet, który uruchomiono z cyber‑zabezpieczeniami i mechanizmami awaryjnymi stosowanymi w najbardziej zaawansowanych modelach firmy. karta systemowa informuje, że przy wyłączonych zabezpieczeniach Sonnet 5.5 średnio uzyskał 11,53 flag zdolności i 80 % wskaźnik przechwycenia w ExploitBench oraz wygenerował 178 pełnych exploitów polegających na dowolnym wykonaniu kodu, w porównaniu do jednego w Sonnet 5. Ukończył 46,1 % wyzwań CyScenarioBench w porównaniu do 0,7 % Sonnet 5 oraz wygenerował 50 przejęć kontroli przepływu w Binary Exploitation Benchmark w porównaniu do 3 w Sonnet 5.
Cyber‑zabezpieczenia działają w trzech etapach: sondowanie wewnętrznych aktywacji modelu, lekki klasyfikator wbudowany w model oraz oddzielny wytrenowany klasyfikator LLM. Karta informuje o 99,43 % czułości w zestawie pokrycia zagrożeń cybernetycznych oraz 21,0 % współczynniku sukcesu ataku w ocenie odporności na atakującego cofającego, co stanowi poprawę w stosunku do 57,2 % w Sonnet 5, jednocześnie ostrzegając użytkowników, że należy się spodziewać zwiększonej liczby odrzuceń nawet przy nieszkodliwych zadaniach z zakresu cyberbezpieczeństwa. Żądania o wyższym ryzyku wyraźnie przełączają się na Sonnet 5, a rozszerzony Program Weryfikacji Cybernetycznej wkrótce udostępni zweryfikowanym obrońcom warstwowy dostęp do zaawansowanych możliwości w modelach Sonnet 5.5, Opus 5.5 i Claude Mythos.
Zabezpieczenia biologiczne to te same klasyfikatory szkodliwego nadużycia wdrożone w Opus 5, bez modelu awaryjnego, a Program weryfikacji nauk przyrodniczych Anthropic obejmuje dostęp do pełnego zakresu prac biologicznych. Sonnet 5.5 jest również pierwszym modelem Sonnet z klasyfikatorami bezpieczeństwa, które blokują wydobycie rozumowania, oraz rozszerza zachowane myślenie, tak aby myślenie modelu nie mogło zostać odłączone od konta, które je utworzyło.
W automatycznym audycie zachowań Anthropic, obejmującym około 1 850 scenariuszy, firma podaje, że Sonnet 5.5 poprawia lub dorównuje Sonnet 5 w większości miar zgodności, odporności na nadużycia i uczciwości, odnotowuje najniższy wskaźnik prób ucieczek z piaskownicy wśród testowanych modeli oraz wykazuje mniej czytelnego myślenia niż wiele wcześniejszych modeli. Karta systemowa stwierdza, że Sonnet 5.5 nie przekracza nowych progów Polityki Odpowiedzialnego Skalowania, jest uznawany za spełniający progi CB‑1 i Autonomy‑1 tej polityki oraz niesie niskie oszacowane ryzyko katastrofalnego niezgodnego skalowania. Termin wiarygodnego odcięcia wiedzy modelu to czerwiec 2026.
Anthropic poinformowało, że Claude Haiku 5.5, zaprojektowany do zastosowań o dużej objętości i wrażliwych na koszty, dołączy do rodziny Claude 5.5 w nadchodzących tygodniach.












