AI-mallit ja alustat

Anthropicin Opus 5 lähestyy raja-älyä Opus-hinnoilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
A person at a desk at night reading a long streaming reply in a warm-toned AI assistant chat interface, with a two-bar capability-versus-cost chart glowing on a second screen.

Anthropic julkaisi Claude Opus 5:n 24. heinäkuuta 2026, ja se esittää uusimman Opus-luokan mallinsa arkipäivän työjuhtana, joka yhtiön mukaan lähestyy Fable 5:n älykkyyttä, joka on paljon kalliimpi, puoleen hintaan. Opus 5 on saatavilla välittömästi Anthropicin sovelluksissa, sen API:ssa ja suurimmissa pilvi-alustoissa, 5 dollarin hintaan miljoonaa syötettävää merkkiä kohden ja 25 dollarin hintaan miljoonaa tulostettavaa merkkiä kohden, samat hinnat kuin se malli, jonka se korvaa, Opus 4.8.

Julkaisu tekee Opus 5:stä oletusmallin Anthropicin Max-tilauksessa ja vahvimman vaihtoehdon, joka on saatavilla Pro:ssa. Yhtiö esittää sitä enemmän kuin kapasiteetin katto, vaan mallina, joka on säädetty päivittäiseen käyttöön, ja se tarjoaa ponnistelun asetuksen, joka antaa kehittäjille mahdollisuuden vaihtaa syvyyden nopeampiin vastauksiin ja alempiin kustannuksiin.

Mitä Anthropicin benchmarkit osoittavat

Omien koodaus- ja tietotyön arvioidensa perusteella Anthropic raportoi, että Opus 5 on valmis tasoilla kokeissa, mukaan lukien Frontier-Bench ja GDPval-AA, mutta se jää jälkeen rajoitetusta Mythos 5 -mallistaan kyberTurvallisuustehtävissä. Yhtiö sanoo, että Opus 5 ylittää Opus 4.8:n tuloksen Frontier-Benchillä alempaan kustannukseen, saavuttaa Fable 5:n huipun CursorBench-koodausarvioinnissa maksimiponnistelulla, ja on kolminkertainen seuraavalle parhaalle mallille ARC-AGI 3 -testissä, joka on rakennettu uusille ongelmille, joita malli ei ole nähnyt. OSWorld-tietokoneen käytön benchmarkilla se sanoo, että Opus 5 voittaa Fable 5:n parhaan tuloksen vain yli kolmanneksen kustannuksista.

Anthropic kuvaa loikan enemmän tuomion asia kuin raakapisteiden. Se kuvailee kokeen, jossa Opus 5:lle annettiin koneen osan piirustus, mutta ei tapaa nähdä kuvaa; malli kirjoitti oman tietokoneen näköpiippulinsa geometrian raakapikseleistä ja rakensi osan uudelleen, tehtävä, jonka yhtiö sanoo, että mikään kilpaileva malli ei ratkaissut viidessä yrityksessä.

Nämä ovat toimittajan ilmoittamat luvut, jotka on suoritettu Anthropicin omilla ohjaimilla, eikä niitä ole vielä toistettu riippumattomasti. Tämä ero on tärkeämpää kuin tavallisesti, koska otsikko on, että Opus 5 tarjoaa raja-läheisiä tuloksia keskitason hinnalla. Ainoa ulkopuolinen tarkastus, jonka Anthropic paljastaa, on cyber-range-testaus varhaisista Opus 5 -tarkistuspisteistä Iso-Britannian AI-turva instituutissa, josta kerrotaan mallin järjestelmäkortissa.

Täyttämällä aukon valikoimassa

Julkaisu tukkii aukon, jonka Anthropic oli avannut oman 2026-linjansa. Sonnet 5, joka julkaistiin 30. kesäkuuta 2026, tarjosi lähellä Opus-tason työtä murto-osaan hintaa, kun taas Mythos-luokan Fable 5, joka julkaistiin 9. kesäkuuta 2026, istui yläpuolella Opusia kaksinkertaisella hinnalla. Tämä jätti Opus-tason puristuksiin molemmista suunnista. Opus 5 antaa Max-, Team- ja Enterprise-asiakkaille raja-läheisen vaihtoehdon ilman, että heidän on maksettava Fable- tai Mythos-hintoja.

Joukkueille, jotka suorittavat pitkiä agenteja, tehtävän kustannus on tärkeämpää kuin tarra-hinta merkkiä kohden, ja Anthropic nojaa siihen matemaattiseen. Se sanoo, että Opus 5 suorittaa työn vähemmässä määrässä askelissa ja työkaluilla kuin Opus 4.8, ja se tarjoaa Nopea-tilan, joka suorittaa noin 2,5 kertaa oletusnopeutta kaksinkertaisella perushinnalla.

Turva ja varoitukset järjestelmäkortissa

Anthropicin järjestelmäkortti kutsuu Opus 5:ää yhtiön kaikkein sopivimmaksi malliksi automaattisessa käyttäytymisauditingissa, joka on edellä Sonnet 5:ää, Opus 4.8:aa ja raja-tason Fable 5:ää yhtiön malliperustuslaissa, ja se on malli, jolla on alhaisin väärinkäytön yhteistyön määrä kaikista testatuista malleista. Nämä ovat yhtiön sisäisiä itsearviointeja, eivät ulkopuolisia löytöjä.

Sama asiakirja on epätavallisen avoin mallin rajoituksista. Se toteaa, että Opus 5 “harhauttaa faktatietoja hieman enemmän kuin Opus 4.8, vaikka se on yleisesti tarkin”, ja se jää jälkeen Mythos 5:stä sekä biologisen tutkimuksen että hyökkäävän kyberturvallisuuden suhteen. Yhdessä sisäisessä biologisessa harjoituksessa malli jumiutui itsevarmennus-silmukoihin ja ei toimittanut joukkoa proteiinisuunnitelmia, jotka Mythos 5 suoritti.

Kyberturvallisuuden osalta Anthropic mallinsi Opus 5:n luokittelijat Fable 5:n kaltaisiksi, mutta odottaa niiden puuttuvan noin 85 % vähemmän usein. Malli on nyt sallittu etsimään haavoittuvuuksia lähdekoodissa, joka on enemmän puolustuksellista, kun taas käännetyistä binääritiedostoista, penetraatiotestauksesta ja hyökkäysgeneroinnista estetään edelleen. Pyynnöt, jotka laukaisevat luokittelijan, palautuvat oletusarvoisesti Opus 4.8:aan. Toisin kuin Fable ja Mythos, Opus 5 ei vaadi tietojen säilyttämistä yleiseen käyttöön.

Praktinen testi on nyt, voivatko riippumattomat arvioijat toistaa koodaus- ja päättelyparannukset, jotka Anthropic raportoi, ja säilyvätkö suuntautumisen parannukset yhtiön oman auditin ulkopuolella. Siihen asti selvintä asia, jonka Opus 5 muuttaa, on lähellä raja-älykkyyttä olevan ominaisuuden hinta Anthropicin oman luettelossa.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.