AI-mallit ja alustat

OpenAI ja Anthropic julkaisivat vastakkaiset mallit kun tekoälykilpailu kiihtyy

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

OpenAI ja Anthropic julkaisivat uudet lippumallinsa muutamien minuuttien välein tänään, kun taas OpenAI julkaisi samalla yritysagenttialustan ja Perplexity esitteli monimallisen tutkimusominaisuuden. Tänään julkaistiin enemmän merkittäviä tekoälytuotteiden julkaisuja yhdessä iltapäivässä kuin useimmissa viikoissa yhteensä.

Tässä on mitä julkaistiin ja mitä se merkitsee.

Anthropin Opus 4.6: Agenttitiimit ja miljoonan tokenin ikkuna

Anthropic julkaisi Claude Opus 4.6:n, sen kyvykkäimmän mallin, jossa on kaksi merkittävää ominaisuutta: miljoonan tokenin kontekstipääty ja uusi ominaisuus nimeltä Agenttitiimit.

Kontekstipääty on suurempi tekninen saavutus. Miljoonan tokenin kokoisella Opus 4.6:lla voidaan prosessoida noin 3 000 sivun verran tekstiä yhdessä syötteenä — neljä kertaa enemmän kuin edeltäjänsä 256 000 tokenin raja. Yhdistettynä 128 000 tokenin tulostuella malli voi nyt syödä ja työskennellä koko koodipohjilla, sääntelyasiakirjoilla tai tutkimusaineistolla ilman paloittelua tai tiivistämistä.

Agenttitiimit, saatavilla Claude Code:ssa, sallivat useiden Clauden instanssien työskennellä rinnakkain jaettavalla koodipohjilla. Sen sijaan, että yksittäinen agentti suorittaa tehtäviä peräkkäin, kehittäjät voivat luoda tiimejä, joissa yksi agentti käsittelee etuyläosan muutoksia, toinen kirjoittaa testejä ja kolmas uudelleenjärjestää taustalogiikkaa — kaikki koordinoivat samalla projektille.

Opus 4.6 esittelee myös adaptiivisen ajattelun, joka sallii mallin säätää, kuinka paljon ponnistelua se panostaa tiettyyn syötteeseen. Yksinkertaisiin kysymyksiin annetaan nopeita vastauksia; monimutkaisiin ongelmiin liittyy syvempi laajennettu ajattelu. Kehittäjät voivat säätää tätä ponnistelun hallinnan kautta neljällä tasolla: matala, keskitaso, korkea ja maksimi.

Benchmarkkejä laskiessa Opus 4.6 saa korkeimman tuloksen Terminal-Bench 2.0:lla agenteille koodaamisessa ja johtaa Humanity’s Last Examia, monimutkaisen päättelyn arviointia. Anthropic väittää 144 pisteen Elo-etua GPT-5.2:sta GDPval-AA-arvioinnissa ja 190 pisteen parannusta Opus 4.5:een verrattuna.

API-hinnat säilyvät muuttumattomina 5 dollarina miljoonaa syötetokenia kohden ja 25 dollarina miljoonaa tulostokenia kohden, vaikka yli 200 000 tokenin mittaiset syötteet maksavat premium-hintaa 10/37,50 dollarina.

Yritysliikkeessä Anthropic ilmoitti Clauden tutkimusesityksestä Microsoft (MSFT ) PowerPointissa, jossa malli voi lukea olemassa olevia diaesitys- ja mallipohjia ja luoda tai muokata esityksiä säilyttäen brändin muotoilun.

OpenAI:n GPT-5.3-Codex: Malli, joka auttoi rakentamaan itsensä

Muutamia minuutteja Anthropin ilmoituksen jälkeen OpenAI julkaisi GPT-5.3-Codex:in, sen kyvykkäimmän koodausmallin. Julkaisu yhdistää GPT-5.2-Codexin koodausominaisuudet GPT-5.2:n päättely- ja ammattitietämyysominaisuuksiin yhteen järjestelmään, joka on myös 25 prosenttia nopeampi.

Merkittävin väite: GPT-5.3-Codex auttoi rakentamaan itsensä. OpenAI:n Codex-tiimi käytti mallin varhaisia versioita omassa koulutusprosessissaan — vianetsintää, käyttöönoton infrastruktuurin hallintaa ja arviointitulosten diagnosointia. Tämä on OpenAI:n ensimmäinen julkisesti tunnustettu tapaus, jossa malli oli avainasemassa oman kehittämisessään — merkittävä välietappi, joka herättää sekä tehokkuus- että turvallisuuskysymyksiä.

GPT-5.3-Codex asettaa uudet teollisuuden ennätykset SWE-Bench Pro – ja Terminal-Bench -benchmarkkeissa, jotka arvioivat todellisen ohjelmistosuunnittelun tehtäviä. Malli pystyy käsittelemään pitkäaikaisia tehtäviä, jotka liittyvät tutkimukseen, työkalujen käyttöön ja monimutkaiseen suorittamiseen, ja käyttäjät voivat vuorovaikuttaa sen kanssa tehtävän aikana ilman kontekstin menettämistä — enemmän kuin yhteistyössä kollegan kanssa kuin käskyjen antamisena.

Malli on nyt saatavilla kaikille ChatGPT:n maksullisten suunnitelmien käyttäjille Codex-sovelluksen, CLI:n, IDE-laajennuksen ja verkkorajapinnan kautta. API-käyttö on tulossa pian.

Kehittäjille, jotka valitsevat tekoälykoodin generointityökaluja, kilpailukuva on nyt terävästi määritelty: Opus 4.6 johtaa agenttikoordinaatiossa ja pitkän kontekstin työssä, kun taas GPT-5.3-Codex korostaa nopeutta ja integroidua päättelyä. Molemmat väittävät saavuttavansa huipputulokset päällekkäisissä benchmarkkeissa, ja työkalut kuten Cursor ja Applen Xcode tukevat molempia, joten kehittäjät voivat vaihtaa niitä vapaasti.

OpenAI Frontier: Yritysagentit saavat oman alustan

Mallin julkaisun rinnalla OpenAI esitteli Frontier:in, yritysalustan tekoälyagenttien luomiseen, käyttöönottoon ja hallintaan. Frontier yhdistää tietokantoihin, CRM-järjestelmiin, HR-alustoihin, lippujärjestelmiin ja muihin liiketoimintasovelluksiin, sitten sallii tekoälyagenttien suorittaa prosesseja niiden yli.

OpenAI kuvasi Frontieria “semanttisena kerroksena yrityksille”, jossa ihmiset ja tekoälyagentit toimivat samalla alustalla jaettujen tietojen ja turvallisuuden hallinnan kanssa. Agentit saavat työntekijämäiset identiteetit, jaettujen organisaatioiden kontekstin ja yritysluokan lupaukset.

Alusta on malliriippumaton — yritykset voivat hallita OpenAI:n malleilla rakennettuja agenteja yhdessä muiden, kuten Google (GOOGL ), Microsoft ja Anthropic, mallien kanssa. Alkuvaiheen asiakkaat ovat Intuit (INTU ), State Farm, Thermo Fisher ja Uber.

Frontier asemoi OpenAI:n kilpailemaan suoraan yritysalustoja vastaan, kuten Salesforce (CRM ) Agentforce ja ServiceNow (NOW ) AI -agentit. Ero: OpenAI rakentaa mallitasolta ylöspäin, kun taas vakiintuneet toimijat lisäävät tekoälyä olemassa oleviin työkaluihin. Onko yrityksille mieluummin agenttien infrastruktuuri tekoälytoimittajalta vai ohjelmistotoimittajalta, määrittelee tekoälykilpailun yrityksissä vuonna 2026.

Perplexityn Model Council: Kolme mallia, yksi vastaus

Perplexity esitteli Model Council:in, ominaisuuden, joka suorittaa saman kysymyksen kolmella mallilla samanaikaisesti — Claude Opus, GPT ja Gemini — sitten käyttää synteesimallia yhdistämään tulokset yhdeksi vastaukseksi, joka osoittaa sopimusta ja erimielisyyttä.

Kuva: Perplexity

Perusteena on, että yksikin malli ei ole luotettavasti paras kaikissa kysymyksissä. Kun kolme eturintamalla olevaa mallia päätyvät samaan vastaukseen, luottamus on korkea. Kun ne eroavat, käyttäjät tietävät, että heidän on tutkittava asiaa tarkemmin. Model Council on saatavilla Max-tilaajille ja on suunniteltu sijoitus-, strategia- ja monimutkaisten päätösten analyysiin.

Ominaisuus heijastaa Perplexityn strategiaa, jossa erottautuminen tapahtuu monimallisen orkestraation kautta, ei perusmallien rakentamisella. Kun eturintamalla olevien tekoälychatbottien välinen kuilu yksittäisillä benchmarkkeilla kapeenee, niiden tulosten yhdistäminen saattaa osoittautua arvokkaammaksi kuin yksittäisen toimittajan valinta.

Mitä kaikkea tämä merkitsee

Nämä julkaisut vahvistavat, että tekoälykilpailu on siirtynyt mallin kyvystä tuoteinfrastruktuuriin. Sekä OpenAI:lla että Anthropilla on malleja, jotka johtavat samoja benchmarkkeja; erottautuminen on nyt siinä, mitä voidaan rakentaa niiden päälle.

Perplexity tekee hiljaisen väitteen, että mallisodat saattavat olla vähemmän tärkeitä kuin se, miten malleja yhdistetään. Jos Model Council osoittautuu hyödylliseksi, se viittaa siihen, että tulevaisuus ei ole valintaa Clauden ja GPT:n välillä — vaan käyttää molempia.

Kehittäjille ja yrityksille, jotka arvioivat tekoälyominaisuuksiaan, tämä teki päätöksen vaikeammaksi.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.