AI-modeller och plattformar

Anthropic lanserar Claude Sonnet 5.5 till oförändrad Sonnet 5-prissättning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Anthropic släppte Claude Sonnet 5.5 den 28 september 2026, den andra modellen i sin Claude 5.5-familj. Modellen behåller Claude Sonnet 5:s prissättning på $2 per miljon inmatningstoken och $10 per miljon utmatningstoken, och Anthropic säger att den genererar output mer än 30 % snabbare samtidigt som den kostar upp till 30 % mindre per uppgift i sina tester.

I sitt lanseringsmeddelande beskrev Anthropic Sonnet 5.5 som ett snabbare, lägre kostnadstillägg till Claude Opus 5.5, som företaget säger är byggt för komplext arbete som kräver noggrann bedömning. Sonnet 5.5 är starkast i välavgränsade vardagliga uppgifter, felsökning och att producera polerade dokument, presentationer och kalkylblad, sade Anthropic, och tillade att den också har ett skarpt öga för design.

Claude Sonnet 5.5 är tillgänglig på alla plattformar, inklusive Amazon Web Services, Google Cloud och Microsoft Azure, under modell-ID:t claude-sonnet-5-5, och erbjuds med noll datalagring, precis som Opus 5.5 och Sonnet 5.

Rapporterade benchmarkresultat

Anthropic rapporterar att Sonnet 5.5 får 70,6 % på Terminal-Bench 4.0, en agentisk kodningsutvärdering, jämfört med Sonnet 5:s 10,3 %, med Opus 5.5:s angivna poäng på 66,4 % som speglar dess Xhigh‑insatsresultat. På FrontierCode 1.1:s huvuduppsättning får Sonnet 5.5 46,2 % vid Max‑insats och 52,1 % vid Xhigh, jämfört med 42,4 % för Sonnet 5, 54,4 % för Opus 5.5 och 49,3 % för OpenAI:s GPT-6 Sol. De rapporterade CursorBench 4.0‑poängen är 55,5 % för Sonnet 5.5, 34,1 % för Sonnet 5 och 57,8 % för Opus 5.5.

Vid kunskapsarbetsutvärderingar rapporterar företaget ett GDPval-AA v2.1‑resultat på 1844 för Sonnet 5.5, två poäng under Opus 5.5:s 1846 och cirka 400 poäng över Sonnet 5:s 1449, samt ett AA‑Briefcase v1.1‑resultat på 1811 jämfört med 1822 för Opus 5.5 och 1359 för Sonnet 5. Meddelandet listar också 64,5 % med verktyg på Humanity’s Last Exam, 80,1 % delvis kredit på OSWorld 2.1 och 61,6 % utan verktyg på Chartography, ett visuellt diagramigenkänningstest. Anthropic säger att Sonnet 5.5 är den första Sonnet-modellen som slår Pokémon Red genom att endast arbeta från skärmbilder.

Företaget varnar för att benchmarkresultat bara fångar en aspekt av en modells förmågor, och säger att i sina egna tester och i externa testares tester är Opus 5.5 tydligt starkare i komplext, öppet arbete som kräver ihållande omdöme. En fotnot anger att Artificial Analysis körde GDPval-AA och AA‑Briefcase på en förhandsutgåva med en strukturerade‑utdata‑bugg som har åtgärdats och som, om något, skulle underskatta Sonnet 5.5:s prestanda. En annan fotnot noterar att OpenAI nyligen åtgärdade en bildförståelse‑bugg i GPT-6 Sol som tredjepartsresultat ännu inte kan återspegla.

Tidiga testresultat

CodeRabbits vice president för AI, David Loker, sade att Sonnet 5.5 visar bättre omdöme än Sonnet 5 över olika komplexitetsnivåer samtidigt som den använder avsevärt färre utmatningstoken, och att CodeRabbit planerar att flytta enkla och måttliga granskningar till modellen nu, med fler under de kommande veckorna. Base44 AI:s tekniska ledare Gabriel Grinberg rapporterade att över 118 riktiga app‑byggen hade Sonnet 5.5 i genomsnitt 3,6 iterationer per byggnad jämfört med Opus 5:s 7,7, med det lägsta antalet misslyckade verktygsanrop av alla modeller som Base44 jämfört.

Slack:s huvudingenjör Curtis Allen rapporterade ungefär 14 % färre utmatningstoken i offline‑Slackbot‑utvärderingar utan några prompt‑ändringar. Zendesk:s AI‑direktör, Abhinay Kathuria, sade att ärenden behandlades 20 % snabbare än med Claude-modellerna som Zendesk använder i produktion. Balyasny Asset Management rapporterade cirka 121 000 token per svar jämfört med Sonnet 5:s 497 000 över en privat svit av 2 441 finansiella uppgifter. Box rapporterade resultat 2,4 gånger snabbare med 12 % färre totala token, och Atlassian sade att kunder kan köra Rovo Agents upp till 30 % snabbare än med Sonnet 5.

Prissättning, hastighet och migrering

Sonnet 5.5:s angivna priser matchar exakt Sonnet 5: $2 per miljon inmatningstoken, $10 per miljon utmatningstoken, $0,20 per miljon cache‑lästoken och $2,50 per miljon cache‑skrivetoken. Opus 5.5 listas till $4 för inmatning, $20 för utmatning och $5 för cache‑skrivningar. Anthropic säger att Sonnet 5.5 vanligtvis behöver avsevärt färre token för samma arbete och är deras snabbaste Sonnet-modell hittills.

Modellen erbjuder fem omkalibrerade insatsnivåer: låg, medel, hög, xhigh och max. Standardnivåerna är Medel i Claude Code och i Claude‑apparna samt Hög på Claude Platform, vilket också är API‑standardvärdet.

Anthropic’s migrationsguide listar brytande förändringar för utvecklare som går från Sonnet 5. Adaptivt tänkande körs nu som standard, den inaktiverade tänkande‑inställningen returnerar ett 400‑fel, och utvecklare som körde Sonnet med tänkande avstängt måste byta till den nya verktygsinställning, den lägsta tillgängliga, innan migrering. Tvingat verktygsval avvisas till förmån för automatiskt verktygsval i kombination med strikta verktyg, och det minsta cache‑bara promptet minskar till 512 token från 1 024 på Sonnet 5. Dokumentationen listar också fem avvisningsorsakskategorier, som täcker cyber, bio, frontierllm, resonemangextraktion, och allmänskador, och noterar att server‑sidiga fallback‑försök endast återför cyber‑ och frontier_llm‑avslag på Sonnet 5.

Säkerhetsfynd och skyddsåtgärder

Eftersom Sonnet 5.5:s cyberkapaciteter är jämförbara med Opus 5:s, Anthropic sade, är det den första Sonnet-modellen som lanseras med de cyber‑säkerhetsåtgärder och återfall som används på företagets mest kapabla modeller. system card rapporterar att med säkerhetsåtgärder avstängda, genomsnittade Sonnet 5.5 11.53 kapacitetsflaggor och en fångstgrad på 80 % på ExploitBench samt producerade 178 fullständiga arbiträra kodexekverings‑exploits, mot en för Sonnet 5. Den slutförde 46.1 % av CyScenarioBench‑utmaningarna jämfört med Sonnet 5:s 0.7 %, och producerade 50 kontrollflödeskapningar på Binary Exploitation Benchmark jämfört med Sonnet 5:s 3.

Cyber‑säkerhetsåtgärderna körs i tre steg: en sond på modellens interna aktiveringar, en lättviktig klassificerare på modellen och en separat tränad LLM‑klassificerare. Kortet rapporterar 99.43 % återkallelse på cyberskade‑omfångssetet och en attackframgångsgrad på 21.0 % i återspolnings‑angriparens robusthetstest, förbättrat från 57.2 % för Sonnet 5, samtidigt som användare varnas för att förvänta sig ökade avslag även på ofarliga cybersäkerhetsuppgifter. Begäranden med högre risk faller tydligt tillbaka till Sonnet 5, och ett utökat Cyber Verification Program kommer snart att erbjuda granskade försvarare lagrad åtkomst till avancerade kapaciteter på Sonnet 5.5, Opus 5.5 och Claude Mythos‑modeller.

Biologiska säkerhetsåtgärder är samma skadliga‑missbruksklassificerare som används för Opus 5, utan någon återfallsmodell, och Anthropics Life Sciences Verification Program omfattar åtkomst för hela bredden av biologi‑arbete. Sonnet 5.5 är också den första Sonnet-modellen med säkerhetsklassificerare som blockerar resonemangsutvinning, och den utökar bevarat tänkande så att en modells tänkande inte kan frikopplas från kontot som skapade den.

I Anthropics automatiserade beteendegranskning av ungefär 1 850 scenarier rapporterar företaget att Sonnet 5.5 förbättrar eller matchar Sonnet 5 på de flesta mått av inriktning, motstånd mot missbruk och ärlighet, registrerar den lägsta frekvensen av försök till sandbox‑flykt bland testade modeller, och visar mer oläsligt tänkande än många tidigare modeller. Systemkortet anger att Sonnet 5.5 inte överskrider några nya Responsible Scaling Policy‑trösklar, behandlas som att uppfylla policyns CB‑1‑ och Autonomy‑1‑trösklar, och har en låg bedömd risk för katastrofal felinriktning. Modellens pålitliga kunskapsgräns är juni 2026.

Anthropic sade att Claude Haiku 5.5, byggd för högvolym‑ och kostnadskänsliga tillämpningar, kommer att anslutas till Claude 5.5‑familjen under de kommande veckorna.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.