Modely a platformy AI

Anthropic uvádí Claude Sonnet 5.5 za nezměněné ceny Sonnet 5

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Anthropic vydal Claude Sonnet 5.5 dne 28. září 2026, druhý model v rodině Claude 5.5. Model zachovává cenovou strukturu Claude Sonnet 5 na 2 USD za milion vstupních tokenů a 10 USD za milion výstupních tokenů a Anthropic uvádí, že generuje výstup o více než 30 % rychleji, přičemž v testování stojí až o 30 % méně na úkol.

Ve svém oznámení o vydání Anthropic popsal Sonnet 5.5 jako rychlejší a levnější doplněk k Claude Opus 5.5, o kterém společnost uvádí, že je určen pro složitou práci vyžadující pečlivý úsudek. Anthropic uvedl, že Sonnet 5.5 je nejvhodnější pro dobře definované každodenní úkoly, opravu chyb a tvorbu vylepšených dokumentů, prezentací a tabulek, a dodal, že má také cit pro design.

Claude Sonnet 5.5 je dostupný na všech platformách, včetně Amazon Web Services, Google Cloud a Microsoft Azure, pod modelem s ID claude-sonnet-5-5, a je nabízen s nulovým uchováváním dat, stejně jako Opus 5.5 a Sonnet 5.

Uvedené výsledky benchmarků

Anthropic uvádí, že Sonnet 5.5 dosáhl 70,6 % v Terminal‑Bench 4.0, hodnocení agentického programování, oproti 10,3 % u Sonnet 5, přičemž uvedený výsledek Opus 5.5 ve výši 66,4 % odráží jeho výsledek při Xhigh‑effort. V hlavní sadě FrontierCode 1.1 dosahuje Sonnet 5.5 46,2 % při Max úsilí a 52,1 % při Xhigh, ve srovnání s 42,4 % u Sonnet 5, 54,4 % u Opus 5.5 a 49,3 % u GPT‑6 Sol od OpenAI. Uvedené skóre v CursorBench 4.0 je 55,5 % pro Sonnet 5.5, 34,1 % pro Sonnet 5 a 57,8 % pro Opus 5.5.

V hodnoceních práce s informacemi společnost uvádí skóre GDPval‑AA v2.1 ve výši 1844 pro Sonnet 5.5, o dva body pod 1846 u Opus 5.5 a přibližně 400 bodů nad 1449 u Sonnet 5, a skóre AA‑Briefcase v1.1 ve výši 1811 oproti 1822 u Opus 5.5 a 1359 u Sonnet 5. Oznámení také uvádí 64,5 % s nástroji v Humanity’s Last Exam, 80,1 % částečného kreditu v OSWorld 2.1 a 61,6 % bez nástrojů v Chartography, testu rozpoznávání vizuálních grafů. Anthropic uvádí, že Sonnet 5.5 je první model Sonnet, který překonal Pokémon Red pracující jen ze screenshotů.

Společnost upozorňuje, že skóre benchmarků zachycuje pouze jeden aspekt schopností modelu, a uvádí, že ve svém vlastním testování i v testování externích testerů zůstává Opus 5.5 jednoznačně silnější při složité, otevřené práci vyžadující trvalý úsudek. Poznámka pod čarou uvádí, že Artificial Analysis spustil GDPval‑AA a AA‑Briefcase na předběžném nasazení s chybou strukturovaných výstupů, která byla opravena a v případě čehokoli by podhodnocovala výkon Sonnet 5.5. Další poznámka pod čarou uvádí, že OpenAI nedávno opravila chybu v porozumění obrazu v GPT‑6 Sol, kterou třetí strany možná ještě neodrážejí ve svých skórech.

Výsledky raných testerů

Viceprezident AI ve společnosti CodeRabbit, David Loker, řekl, že Sonnet 5.5 vykazuje lepší úsudek než Sonnet 5 napříč úrovněmi složitosti při podstatně menším počtu výstupních tokenů, a že CodeRabbit plánuje nyní přesunout jednoduché a středně náročné revize na tento model, s dalším rozšířením v nadcházejících týdnech. Vedoucí inženýrství AI ve společnosti Base44, Gabriel Grinberg, uvedl, že v rámci 118 reálných sestavení aplikací dosahuje Sonnet 5.5 průměrně 3,6 iterací na sestavení oproti 7,7 u Opus 5, a má nejméně neúspěšných volání nástrojů ze všech modelů, které Base44 porovnával.

Hlavní inženýr Slacku Curtis Allen uvedl, že při offline hodnoceních Slackbotu došlo k přibližně 14 % menšímu počtu výstupních tokenů bez změny promptu. Ředitel AI ve společnosti Zendesk, Abhinay Kathuria, řekl, že tikety byly zpracovány o 20 % rychleji než s modely Claude, které Zendesk používá v produkci. Balyasny Asset Management uvedl přibližně 121 000 tokenů na odpověď oproti 497 000 u Sonnet 5 v soukromé sadě 2 441 finančních úkolů. Box oznámil výsledky 2,4‑krát rychlejší s 12 % méně celkových tokenů a Atlassian uvedl, že zákazníci mohou spouštět Rovo Agents až o 30 % rychleji než se Sonnet 5.

Ceny, rychlost a migrace

Uvedené ceny Sonnet 5.5 se shodují přesně s cenami Sonnet 5: 2 USD za milion vstupních tokenů, 10 USD za milion výstupních tokenů, 0,20 USD za milion tokenů při čtení z cache a 2,50 USD za milion tokenů při zápisu do cache. Opus 5.5 uvádí 4 USD za vstup, 20 USD za výstup a 5 USD za zápisy do cache. Anthropic uvádí, že Sonnet 5.5 obvykle potřebuje podstatně méně tokenů pro stejnou práci a je dosud nejrychlejším modelem Sonnet.

Model nabízí pět přenastavených úrovní úsilí: low, medium, high, xhigh a max. Výchozí nastavení je Medium v Claude Code a v aplikacích Claude a High na Claude Platform, což je také výchozí nastavení API.

Anthropicův průvodce migrací uvádí rozpadové změny pro vývojáře přecházející z Sonnet 5. Adaptivní myšlení nyní běží ve výchozím nastavení, zakázané nastavení myšlení vrací chybu 400 a vývojáři, kteří spouštěli Sonnet s vypnutým myšlením, musí přejít na nové mezinastavením nástrojů, nejnižší dostupné, před migrací. Vynucený výběr nástroje je odmítnut ve prospěch automatického výběru nástroje spárovaného se striktními nástroji a minimální počet tokenů pro kešovatelný prompt klesá na 512 tokenů z 1 024 u Sonnet 5. Dokumentace také uvádí pět kategorií důvodů odmítnutí, zahrnujících cyber, bio, frontierllm, uvažováníextrakci a obecnéškod a poznamenává, že serverové fallbacky opakují pouze odmítnutí cyber a frontier_llm u Sonnet 5.

Zjištění o bezpečnosti a opatření

Protože kybernetické schopnosti modelu Sonnet 5.5 jsou srovnatelné s modelem Opus 5, uvedla společnost Anthropic, že se jedná o první model Sonnet, který je nasazen s kybernetickými ochrannými opatřeními a záložními mechanismy používanými u nejvýkonnějších modelů společnosti. systémová karta uvádí, že při vypnutých ochranách dosáhl Sonnet 5.5 průměrně 11,53 příznaků schopnosti a 80 % zachycení na ExploitBench a vytvořil 178 plných exploitů na libovolné spuštění kódu, oproti jednomu u modelu Sonnet 5. Dokončil 46,1 % úkolů v CyScenarioBench ve srovnání s 0,7 % u Sonnet 5 a vytvořil 50 přesměrování řízení toku na Binary Exploitation Benchmark oproti 3 u Sonnet 5.

Kybernetické ochranné opatření fungují ve třech fázích: sondování vnitřních aktivací modelu, lehký klasifikátor na modelu a samostatný trénovaný klasifikátor LLM. Karta uvádí 99,43 % záchytnosti v sadě pokrytí kybernetických škod a 21,0 % úspěšnost útoku v hodnocení odolnosti proti přehrávání útočníka, což je zlepšení oproti 57,2 % u modelu Sonnet 5, přičemž uživatelům varuje, aby očekávali zvýšený počet odmítnutí i u neškodných úkolů kybernetické bezpečnosti. Požadavky s vyšším rizikem jsou viditelně přesměrovány na Sonnet 5 a rozšířený Cyber Verification Program brzy nabídne ověřeným obráncům stupňovaný přístup k pokročilým schopnostem modelů Sonnet 5.5, Opus 5.5 a Claude Mythos.

Biologické ochranné opatření jsou stejné klasifikátory škodlivého zneužití, které jsou nasazeny u Opus 5, bez záložního modelu, a Life Sciences Verification Program společnosti Anthropic pokrývá přístup pro celé spektrum biologické práce. Sonnet 5.5 je také první model Sonnet s bezpečnostními klasifikátory, které blokují extrakci uvažování, a rozšiřuje zachované myšlení tak, aby myšlení modelu nemohlo být odděleno od účtu, který jej vytvořil.

Podle automatizovaného behaviorálního auditu Anthropic, který zahrnoval přibližně 1 850 scénářů, společnost uvádí, že Sonnet 5.5 zlepšuje nebo odpovídá Sonnet 5 ve většině měřítek souladu, odolnosti vůči zneužití a poctivosti, zaznamenává nejnižší míru pokusů o únik z sandboxu mezi testovanými modely a vykazuje méně čitelného myšlení než mnoho předchozích modelů. V systémové kartě je uvedeno, že Sonnet 5.5 nepřekračuje žádné nové prahy Responsible Scaling Policy, je považován za splňující prahy CB‑1 a Autonomy‑1 a nese nízké odhadované riziko katastrofálního nesouladu. Spolehlivý limit znalostí modelu je červen 2026.

Anthropic uvedla, že Claude Haiku 5.5, vytvořený pro aplikace s vysokým objemem a citlivé na náklady, se během několika týdnů připojí k rodině Claude 5.5.

Jonas Reeve je analytik vytvořený umělou inteligencí ve Unite.AI, zaměřuje se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojové inteligence. Jeho práce zkoumá, jak se učení, uvažování, paměť a abstrakce objevují jak v biologických, tak v umělých systémech, a vytváří spojení mezi moderními architekturami AI a dlouhodobými otázkami kognitivní vědy a filozofie mysli.

S konceptuálním a reflexivním přístupem Jonas zkoumá rámce jako modely uvažování, agentické systémy, emergentní kognice a teorii zarovnání, s cílem objasnit, co skutečně znamená pokrok směrem k AGI – a co ne. Místo honby za termíny nebo hype zdůrazňuje první principy, konceptuální přísnost a limity současných modelů.

Články napsané Jonasem Reeve jsou generovány AI a jsou recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, srozumitelnost a odpovědnou diskusi o pokročilých konceptech AI.