AI-modellen en platforms
Anthropic brengt Claude Sonnet 5.5 uit tegen ongewijzigde Sonnet 5-prijzen

Anthropic bracht Claude Sonnet 5.5 uit op 28 september 2026, het tweede model in de Claude 5.5-familie. Het model behoudt de prijzen van Claude Sonnet 5 op $2 per miljoen invoertokens en $10 per miljoen uitvoertokens, en Anthropic zegt dat het output meer dan 30 % sneller genereert terwijl het tot 30 % minder kost per taak in de tests.
In zijn release‑aankondiging beschreef Anthropic Sonnet 5.5 als een snellere, goedkopere aanvulling op Claude Opus 5.5, waarvan het bedrijf zegt dat het is gebouwd voor complex werk dat zorgvuldige beoordeling vereist. Sonnet 5.5 blinkt uit in goed afgebakende alledaagse taken, het oplossen van bugs en het produceren van verzorgde documenten, presentaties en spreadsheets, zei Anthropic, en voegde toe dat het ook een scherp oog voor design heeft.
Claude Sonnet 5.5 is beschikbaar op alle platformen, waaronder Amazon Web Services, Google Cloud en Microsoft Azure, onder het model-ID claude-sonnet-5-5, en wordt aangeboden met nul gegevensretentie, net als bij Opus 5.5 en Sonnet 5.
Gerapporteerde benchmarkresultaten
Anthropic meldt dat Sonnet 5.5 70,6 % scoort op Terminal-Bench 4.0, een agentische code-evaluatie, tegenover 10,3 % voor Sonnet 5, met een vermelde score van 66,4 % voor Opus 5.5 die het Xhigh‑inspanningresultaat weerspiegelt. Op de hoofdset van FrontierCode 1.1 behaalt Sonnet 5.5 46,2 % bij Max‑inspanning en 52,1 % bij Xhigh, vergeleken met 42,4 % voor Sonnet 5, 54,4 % voor Opus 5.5 en 49,3 % voor OpenAI’s GPT-6 Sol. De gerapporteerde CursorBench 4.0‑scores zijn 55,5 % voor Sonnet 5.5, 34,1 % voor Sonnet 5 en 57,8 % voor Opus 5.5.
Bij kenniswerk-evaluaties meldt het bedrijf een GDPval-AA v2.1‑score van 1844 voor Sonnet 5.5, twee punten lager dan de 1846 van Opus 5.5 en ongeveer 400 punten hoger dan de 1449 van Sonnet 5, en een AA‑Briefcase v1.1‑score van 1811 tegenover 1822 voor Opus 5.5 en 1359 voor Sonnet 5. De aankondiging vermeldt ook 64,5 % met tools op Humanity’s Last Exam, 80,1 % gedeeltelijke credit op OSWorld 2.1, en 61,6 % zonder tools op Chartography, een visuele grafiekherkenningstest. Anthropic zegt dat Sonnet 5.5 het eerste Sonnet‑model is dat Pokémon Red verslaat door alleen screenshots te gebruiken.
Het bedrijf waarschuwt dat benchmarkscores slechts één facet van de mogelijkheden van een model weergeven, en zegt dat in zowel eigen tests als die van externe testers Opus 5.5 duidelijk sterker blijft bij complex, open‑ended werk dat voortdurende beoordeling vereist. Een voetnoot vermeldt dat Artificial Analysis GDPval-AA en AA‑Briefcase heeft uitgevoerd op een pre‑release‑implementatie met een bug in gestructureerde outputs die inmiddels is verholpen en die, indien iets, de prestaties van Sonnet 5.5 zou onderschatten. Een andere voetnoot merkt op dat OpenAI recent een bug in beeldbegrip in GPT-6 Sol heeft opgelost, waardoor scores van derden die nog niet zijn bijgewerkt mogelijk niet correct weergeven.
Vroege testresultaten
David Loker, vice‑president AI bij CodeRabbit, zei dat Sonnet 5.5 beter oordeel toont dan Sonnet 5 over verschillende complexiteitsniveaus terwijl het aanzienlijk minder uitvoertokens verbruikt, en dat CodeRabbit van plan is om nu eenvoudige en middelmatige beoordelingen naar het model te verplaatsen, met meer in de komende weken. Gabriel Grinberg, lead engineering AI bij Base44, meldde dat over 118 echte app‑builds Sonnet 5.5 gemiddeld 3,6 iteraties per build behaalde tegenover 7,7 voor Opus 5, met het minste aantal mislukte tool‑aanroepen van alle modellen die Base44 heeft vergeleken.
Curtis Allen, principal engineer bij Slack, meldde ongeveer 14 % minder uitvoertokens bij offline Slackbot‑evaluaties zonder wijziging van prompts. Abhinay Kathuria, directeur AI bij Zendesk, zei dat tickets 20 % sneller werden verwerkt dan met de Claude‑modellen die Zendesk in productie gebruikt. Balyasny Asset Management rapporteerde ongeveer 121.000 tokens per antwoord versus 497.000 voor Sonnet 5 over een privé‑suite van 2.441 financiële taken. Box meldde resultaten 2,4 keer sneller met 12 % minder totale tokens, en Atlassian zei dat klanten Rovo Agents tot 30 % sneller kunnen draaien dan met Sonnet 5.
Prijzen, snelheid en migratie
De vermelde prijzen van Sonnet 5.5 komen exact overeen met die van Sonnet 5: $2 per miljoen invoertokens, $10 per miljoen uitvoertokens, $0,20 per miljoen cache‑leestokens en $2,50 per miljoen cache‑schrijftokens. Opus 5.5 staat geprijsd op $4 invoer, $20 uitvoer en $5 cache‑schrijvingen. Anthropic zegt dat Sonnet 5.5 doorgaans veel minder tokens nodig heeft voor hetzelfde werk en het tot nu toe snelste Sonnet‑model is.
Het model biedt vijf opnieuw gekalibreerde inspanningsniveaus: laag, gemiddeld, hoog, xhigh en max. Standaardinstellingen zijn Medium in Claude Code en de Claude‑apps en High op het Claude‑Platform, wat ook de API‑standaard is.
Anthropic’s migratiehandleiding somt brekende wijzigingen op voor ontwikkelaars die van Sonnet 5 overstappen. Adaptief denken draait nu standaard, de uitgeschakelde denkinstelling geeft een 400‑fout, en ontwikkelaars die Sonnet met denkinstelling uit hebben gebruikt, moeten overschakelen naar de nieuwe tussen tool‑instelling, de laagst beschikbare, vóór migratie. Geforceerde tool‑keuze wordt afgewezen ten gunste van automatische tool‑keuze gekoppeld aan strikte tools, en de minimale cache‑bare prompt daalt naar 512 tokens van 1.024 bij Sonnet 5. De documentatie somt ook vijf afwijzings‑stop‑reden‑categorieën op, die cyber, bio, frontierllm, redeneringextractie, en algemeenschade, en merkt op dat server‑side fallback‑herpogingen alleen cyber‑ en frontier_llm‑afwijzingen op Sonnet 5 herhalen.
Bevindingen over veiligheid en beschermingsmaatregelen
Omdat de cybercapaciteiten van Sonnet 5.5 vergelijkbaar zijn met die van Opus 5, zei Anthropic dat het het eerste Sonnet‑model is dat wordt gelanceerd met de cyberbeveiligingen en fallback‑mechanismen die op de meest capabele modellen van het bedrijf worden gebruikt. De systeemkaart meldt dat bij uitgeschakelde beveiligingen Sonnet 5.5 gemiddeld 11,53 capability‑flags behaalde en een vangstpercentage van 80 % op ExploitBench, en 178 volledige willekeurige‑code‑uitvoerings‑exploits produceerde, tegenover één voor Sonnet 5. Het voltooide 46,1 % van de CyScenarioBench‑uitdagingen versus 0,7 % voor Sonnet 5, en produceerde 50 control‑flow‑overnames op de Binary Exploitation Benchmark versus 3 voor Sonnet 5.
De cyberbeveiligingen werken in drie fasen: een probe op de interne activaties van het model, een lichtgewicht classifier op het model zelf, en een aparte getrainde LLM‑classifier. De kaart meldt een recall van 99,43 % op de cyber‑schade‑dekkingsset en een aanvalssuccespercentage van 21,0 % op de rewind‑attacker‑robustheidsevaluatie, een verbetering ten opzichte van 57,2 % voor Sonnet 5, terwijl gebruikers worden gewaarschuwd dat er meer weigeringen kunnen optreden, zelfs bij onschuldige cybersecurity‑taken. Verzoeken met een hoger risico vallen duidelijk terug op Sonnet 5, en een uitgebreid Cyber Verification Program zal binnenkort geteste verdedigers gelaagde toegang bieden tot geavanceerde capaciteiten op Sonnet 5.5, Opus 5.5 en Claude Mythos‑modellen.
Biologie‑beveiligingen zijn dezelfde schadelijke‑misbruik‑classifiers die voor Opus 5 worden ingezet, zonder fallback‑model, en Anthropic’s Life Sciences Verification Program dekt toegang voor de volledige breedte van biologisch werk. Sonnet 5.5 is bovendien het eerste Sonnet‑model met veiligheidsclassifiers die redenerings‑extractie blokkeren, en het breidt bewaarde denkwijze uit zodat het denken van een model niet kan worden losgekoppeld van het account dat het heeft gecreëerd.
Op basis van Anthropic’s geautomatiseerde gedragsaudit van ongeveer 1.850 scenario’s meldt het bedrijf dat Sonnet 5.5 verbetert of gelijk blijft aan Sonnet 5 op de meeste maatstaven voor afstemming, misbruik‑weerstand en eerlijkheid, het laagste percentage pogingen tot sandbox‑ontsnapping registreert onder de geteste modellen, en meer onleesbaar denken vertoont dan veel eerdere modellen. De systeemkaart stelt dat Sonnet 5.5 geen nieuwe Responsible Scaling Policy‑drempels overschrijdt, wordt beschouwd als voldaan aan de CB‑1‑ en Autonomy‑1‑drempels van het beleid, en een laag beoordeeld risico op catastrofale misalignement draagt. De betrouwbare kennis‑cut‑off van het model is juni 2026.
Anthropic zei dat Claude Haiku 5.5, gebouwd voor toepassingen met hoog volume en kostengevoeligheid, de Claude 5.5‑familie in de komende weken zal versterken.












