AI-mallit ja alustat

Anthropic julkaisee Claude Sonnet 5.5 muuttamattomaan Sonnet 5 -hintaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Anthropic julkaisi Claude Sonnet 5.5:n 28. syyskuuta 2026, toisen mallin Claude 5.5 -perheestään. Malli säilyttää Claude Sonnet 5:n hinnoittelun, $2 per miljoona syötettyä tokenia ja $10 per miljoona tuotettua tokenia, ja Anthropic kertoo sen tuottavan tulosta yli 30% nopeammin samalla kun se maksaa jopa 30% vähemmän per tehtävä testeissään.

Omassa julkaisuilmoituksessa, Anthropic kuvasi Sonnet 5.5:n nopeammaksi ja edullisemmaksi täydentäväksi tuotteeksi Claude Opus 5.5:lle, jonka yritys sanoo olevan rakennettu monimutkaista työtä varten, joka vaatii huolellista harkintaa. Sonnet 5.5 on vahvin hyvin rajatuissa jokapäiväisissä tehtävissä, virheiden korjaamisessa ja hiottujen asiakirjojen, esitysten ja taulukoiden tuottamisessa, Anthropic sanoi lisäten, että sillä on myös tarkka silmä suunnitteluun.

Claude Sonnet 5.5 on saatavilla kaikilla alustoilla, mukaan lukien Amazon Web Services, Google Cloud ja Microsoft Azure, mallin ID:nä claude-sonnet-5-5, ja sitä tarjotaan nollatietojen säilytyksellä, kuten Opus 5.5:n ja Sonnet 5:n kanssa.

Raportoituja benchmark-tuloksia

Anthropic raportoi, että Sonnet 5.5 saa 70.6% Terminal-Bench 4.0 -testissä, agenttipohjaisessa koodausarvioinnissa, verrattuna Sonnet 5:n 10.3%:iin, ja Opus 5.5:n ilmoitettu 66.4% heijastaa sen Xhigh-ponnistustulosta. FrontierCode 1.1:n pääjoukossa Sonnet 5.5 saa 46.2% Max-ponnistuksella ja 52.1% Xhigh-ponnistuksella, verrattuna 42.4%:iin Sonnet 5:ssä, 54.4%:iin Opus 5.5:ssä ja 49.3%:iin OpenAI:n GPT-6 Solissa. Raportoituja CursorBench 4.0 -tuloksia ovat 55.5% Sonnet 5.5:lle, 34.1% Sonnet 5:lle ja 57.8% Opus 5.5:lle.

Tietotyöarvioinneissa yritys raportoi GDPval-AA v2.1 -pisteet 1844 Sonnet 5.5:lle, kaksi pistettä alhaisemmat kuin Opus 5.5:n 1846 ja noin 400 pistettä korkeammat kuin Sonnet 5:n 1449, sekä AA-Briefcase v1.1 -pisteet 1811 verrattuna Opus 5.5:n 1822 ja Sonnet 5:n 1359. Julkaisu listaa myös 64.5% työkalujen kanssa Humanity’s Last Exam -testissä, 80.1% osittainen pisteytys OSWorld 2.1:ssä, ja 61.6% ilman työkaluja Chartography‑testissä, visuaalisessa kaavion tunnistustestissä. Anthropic sanoo, että Sonnet 5.5 on ensimmäinen Sonnet-malli, joka päihittää Pokémon Redin pelkästään näytökuvista.

Yritys varoittaa, että benchmark-pisteet kuvaavat vain yhtä mallin kyvykkyyden puolta, ja toteaa, että omassa testauksessaan sekä ulkopuolisten testaajien testeissä Opus 5.5 on selvästi vahvempi monimutkaisessa, avoimessa työssä, joka vaatii jatkuvaa harkintaa. Alaviitteessä todetaan, että Artificial Analysis suoritti GDPval-AA:n ja AA-Briefcase:n esijulkaisuvaiheen käyttöönotossa, jossa oli strukturoitujen tulosten bugi, joka on korjattu ja joka mahdollisesti aliarvioi Sonnet 5.5:n suorituskykyä. Toisessa alaviitteessä mainitaan, että OpenAI on äskettäin korjannut kuvanymmärrysvirheen GPT-6 Solissa, jota kolmannen osapuolen pisteet eivät vielä välttämättä heijasta.

Varhaisten testaajien tulokset

CodeRabbitin tekoälyn varapuheenjohtaja David Loker kertoi, että Sonnet 5.5 osoittaa parempaa harkintaa kuin Sonnet 5 eri monimutkaisuustasoilla käyttäen merkittävästi vähemmän tuotettuja tokeneja, ja että CodeRabbit aikoo siirtää yksinkertaiset ja keskivaikeat tarkastukset malliin heti, ja lisää tulevina viikkoina. Base44 AI:n insinöörijohtaja Gabriel Grinberg raportoi, että 118 todellisessa sovellusrakennuksessa Sonnet 5.5 keskimäärin 3.6 iterointia per rakennus verrattuna Opus 5:n 7.7:ään, ja että se sai vähiten epäonnistuneita työkalukutsuja kaikista Base44:n vertailussa olevista malleista.

Slackin pääinsinööri Curtis Allen raportoi noin 14% vähemmän tuotettuja tokeneja offline Slackbot -arvioinneissa ilman kehotteiden muutoksia. Zendeskin tekoälyjohtaja Abhinay Kathuria kertoi, että tiketit käsiteltiin 20% nopeammin kuin Zendeskin tuotannossa käyttämien Claude-mallien kanssa. Balyasny Asset Management raportoi noin 121 000 tokenia per vastaus verrattuna Sonnet 5:n 497 000 tokeniin 2 441 finanssitehtävän yksityisessä sarjassa. Box raportoi tulokset 2,4‑kerta nopeammin 12% vähemmän kokonais-tokenilla, ja Atlassian sanoi, että asiakkaat voivat ajaa Rovo Agents -malleja jopa 30% nopeammin kuin Sonnet 5:n kanssa.

Hinnoittelu, nopeus ja migraatio

Sonnet 5.5:n ilmoitetut hinnat vastaavat tarkalleen Sonnet 5:n hintoja: $2 per miljoona syötettyä tokenia, $10 per miljoona tuotettua tokenia, $0.20 per miljoona välimuistin luku-tokenia ja $2.50 per miljoona välimuistin kirjoitus-tokenia. Opus 5.5:n hinnat ovat $4 input, $20 output ja $5 cache writes. Anthropic kertoo, että Sonnet 5.5 tarvitsee tyypillisesti paljon vähemmän tokeneja saman työn suorittamiseen, ja se on tähän mennessä nopein Sonnet-malli.

Malli tarjoaa viisi uudelleenkalibroitua ponnistustasoa: low, medium, high, xhigh ja max. Oletus on Medium Claude Codessa ja Claude-sovelluksissa sekä High Claude Platformilla, mikä on myös API:n oletus.

Anthropicin siirtymisopas listaa kehittäjille Sonnet 5:stä siirtymisen merkittäviä muutoksia. Adaptatiivinen ajattelu toimii nyt oletuksena, poistetun ajattelun asetus palauttaa 400‑virheen, ja kehittäjien, jotka ajoivat Sonnetia ilman ajattelua, on vaihdettava uuteen työkaluasetukseen, alhaisinta saatavilla olevaa, ennen migraatiota. Pakotettu työkalun valinta hylätään automaattisen työkalun valinnan eduksi, joka on yhdistetty tiukkoihin työkaluihin, ja vähimmäisvälimuistissa oleva kehotus pienenee 512 tokeniin 1 024 tokenin sijaan Sonnet 5:ssä. Dokumentaatio listaa myös viisi hylkäyksen pysäytyssyykategoriaa, jotka kattavat cyber-, bio-, frontierllm, päättelyekstraktio, ja yleisethaitat, ja huomauttaa, että palvelinpuolen varmistusyritykset toistavat vain cyber- ja frontier_llm‑hylkäykset Sonnet 5:ssä.

Turvallisuustulokset ja suojatoimet

Koska Sonnet 5.5:n kyberkyvyt ovat verrattavissa Opus 5:n kykyihin, Anthropic sanoi, että se on ensimmäinen Sonnet-malli, joka lanseerataan kybersuojauksilla ja varajärjestelmillä, joita käytetään yrityksen tehokkaimmissa malleissa. järjestelmäkortti raportoi, että suojauksilla pois päältä Sonnet 5.5 keskiarvoisesti 11,53 kykymerkintää ja 80 % kaappausasteen ExploitBenchissä sekä tuotti 178 täyttä mielivaltaisen koodin suorituksen hyökkäystä, verrattuna yhteen Sonnet 5:ssä. Se suoritti 46,1 % CyScenarioBench‑haasteista verrattuna Sonnet 5:n 0,7 %:iin, ja tuotti 50 ohjausvirran kaappausta Binary Exploitation Benchmarkissa verrattuna Sonnet 5:n 3:een.

Kybersuojaukset toimivat kolmessa vaiheessa: mallin sisäisten aktivaatioiden tarkastus, kevyt mallin sisäinen luokittelija ja erillinen koulutettu LLM‑luokittelija. Kortti raportoi 99,43 % palautuskyvyn kybervahinkojen kattavuusjoukossa ja 21,0 % hyökkäyksen onnistumisprosentin rewind‑hyökkääjän kestävyysarvioinnissa, mikä on parannus Sonnet 5:n 57,2 %:iin verrattuna, ja varoittaa käyttäjiä odottamaan lisää hylkäyksiä myös harmittomissa kyberturvallisuustehtävissä. Korkeamman riskin pyynnöt siirtyvät näkyvästi Sonnet 5:een, ja laajennettu Cyber Verification Program tarjoaa pian tarkastetuille puolustajille porrastetun pääsyn kehittyneisiin kykyihin Sonnet 5.5‑, Opus 5.5‑ ja Claude Mythos -malleissa.

Biologian suojaukset ovat samat haitallisen väärinkäytön luokittelijat, joita käytetään Opus 5:ssa, ilman varajärjestelmämallia, ja Anthropicin Life Sciences Verification Program kattaa pääsyn koko biologian työn laajuuteen. Sonnet 5.5 on myös ensimmäinen Sonnet-malli, jossa on turvallisuusluokittelijat, jotka estävät päättelyn poiminnan, ja se laajentaa säilytettyä ajattelua niin, että mallin ajattelua ei voida erottaa tilistä, joka sen loi.

Anthropicin automatisoidun käyttäytymisen auditoinnin, joka kattoi noin 1 850 skenaariota, mukaan yritys raportoi, että Sonnet 5.5 parantaa tai vastaa Sonnet 5:n tasoa useimmissa yhteensopivuuden, väärinkäytön vastustuskyvyn ja rehellisyyden mittareissa, kirjaa alhaisimmaksi testattujen mallien hylättyjen hiekkalaatikon pakoonyritysten määräksi, ja osoittaa enemmän epäselvää ajattelua kuin monet aikaisemmat mallit. Järjestelmäkortti toteaa, että Sonnet 5.5 ei ylitä uusia Responsible Scaling Policy -rajoja, sitä pidetään täyttävän politiikan CB‑1‑ ja Autonomy‑1‑rajojen vaatimukset, ja sillä on alhainen arvioitu riski katastrofaaliseen epäsovitukseen. Mallin luotettava tietämyksen katkaisupiste on kesäkuu 2026.

Anthropic sanoi, että Claude Haiku 5.5, joka on rakennettu suurta volyymia ja kustannustietoisia sovelluksia varten, liittyy Claude 5.5 -perheeseen tulevina viikkoina.

Jonas Reeve on AI‑luotu analyytikko Unite.AI:ssa, keskittyen kognitiiviseen tekoälyyn, yleiseen tekoälyyn (AGI) ja koneälyn teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio syntyvät sekä biologisissa että keinotekoisissa järjestelmissä, ja luo yhteyksiä nykyaikaisten tekoälyarkkitehtuurien ja kognitiivisen tieteen sekä mielenfilosofian pitkään kestäneisiin kysymyksiin.

Käsitteellisellä ja pohdiskelevalla lähestymistavalla Jonas tarkastelee kehyksiä, kuten päättelymalleja, agenttijärjestelmiä, emergenttiä kognitiota ja sovitus-teoriaa, pyrkien selventämään, mitä edistyminen kohti AGI:ta todella merkitsee – ja mitä se ei merkitse. Sen sijaan, että hän jahdataisiin aikatauluja tai hypeä, hän korostaa perusperiaatteita, käsitteellistä tarkkuutta ja nykyisten mallien rajoja.

Jonas Reeven kirjoittamat artikkelit ovat AI‑luotuja ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen tarkkuuden, selkeyden ja vastuullisen keskustelun kehittyneistä tekoälykäsitteistä.