AI-modeller och plattformar

OpenAI och Anthropic släpper duellerande modeller när AI-kapprustningen intensifieras

mm
Lägg till Unite.AI bland dina föredragna källor på Google

OpenAI och Anthropic släppte nya flaggskeppmodeller inom några minuter från varandra idag, medan OpenAI samtidigt lanserade en enterprise-agentplattform och Perplexity introducerade en multi-modellforskningfunktion. Idag levererade mer betydande AI-produktmeddelanden under en eftermiddag än de flesta veckor producerar totalt.

Här är vad som skedde och vad det betyder.

Anthropics Opus 4.6: Agentteam och en miljontokenfönster

Anthropic släppte Claude Opus 4.6, sin mest kapabla modell, med två huvudfunktioner: ett miljontokenkontextfönster och en ny funktion som kallas Agentteam.

Kontextfönstret är den större tekniska prestationen. Med ett miljontoken kan Opus 4.6 bearbeta ungefär 3 000 sidor text i en enda prompt — fyra gånger 256 000-tokenbegränsningen för dess föregångare. Kombinerat med 128 000-tokenutmatningsstöd kan modellen nu mata in och arbeta med hela kodbas, regulatoriska filer eller forskningskorpus utan chunkning eller sammanfattning.

Agentteam, tillgängligt i Claude Code, tillåter flera Claude-instanser att arbeta parallellt på en delad kodbas. Istället för att en enskild agent utför uppgifter sekventiellt kan utvecklare starta team där en agent hanterar frontendändringar, en annan skriver tester och en tredje refaktoriserar backendlogik — alla samordnar på samma projekt samtidigt.

Opus 4.6 introducerar också adaptivt tänkande, som låter modellen kalibrera hur mycket resonemangsinsats som ska investeras i en given prompt. Enkla frågor får snabba svar; komplexa problem utlöser djupare utökad tanke. Utvecklare kan justera detta via ansträngningskontroller över fyra nivåer: låg, medium, hög och max.

På benchmarktest presterar Opus 4.6 bäst på Terminal-Bench 2.0 för agentic kodning och leder Humanity’s Last Exam, en komplex resonemangsutvärdering. Anthropic hävdar en 144-poängs Elo-fördel över GPT-5.2 på GDPval-AA-utvärderingen och en 190-poängsförbättring över Opus 4.5.

API-prissättningen förblir oförändrad på 5 dollar per miljon indata-token och 25 dollar per miljon utdatatoken, även om prompter som överstiger 200 000 token har en premiumtaxa på 10/37,50 dollar.

I ett anmärkningsvärt företagsdrag meddelade Anthropic en forskningsförhandsvisning av Claude i Microsoft PowerPoint, där modellen kan läsa befintliga layouts och mallar och generera eller redigera presentationer samtidigt som den bevarar varumärkesformatering.

OpenAI’s GPT-5.3-Codex: Modellen som hjälpte till att bygga sig själv

Några minuter efter Anthropics meddelande lanserade OpenAI GPT-5.3-Codex, sin mest kapabla kodmodell. Utgåvan förenar den banbrytande kodprestandan hos GPT-5.2-Codex med resonemangs- och professionella kunskapsförmågorna hos GPT-5.2 i ett enda system som också är 25 procent snabbare.

Det mest anmärkningsvärda påståendet: GPT-5.3-Codex hjälpte till att bygga sig själv. OpenAI:s Codex-team använde tidiga versioner av modellen under dess egen utbildningsprocess — felsökning av utbildningskörningar, hantering av distributionsinfrastruktur och diagnostisering av utvärderingsresultat. Det är OpenAI:s första offentliga erkännande av att en modell var avgörande för sin egen utveckling, en milstolpe som väcker både effektivitets- och säkerhetsfrågor.

GPT-5.3-Codex sätter nya branschrekord på SWE-Bench Pro och Terminal-Bench, benchmarktest som utvärderar verkliga mjukvaruutvecklingsuppgifter. Modellen kan hantera långvariga uppgifter som involverar forskning, verktygsanvändning och komplex körning, och användare kan interagera med den mitt i uppgiften utan att förlora kontext — mer som att samarbeta med en kollega än att utfärda kommandon.

Modellen är tillgänglig nu för alla ChatGPT-betalkontouanvändare via Codex-appen, CLI, IDE-tillägget och webbgränssnittet. API-åtkomst kommer snart.

För utvecklare som väljer mellan AI-kodgenererare är den konkurrensbild som nu skarpt definierad: Opus 4.6 leder på agentkoordination och långkontextarbete, medan GPT-5.3-Codex betonar hastighet och integrerat resonemang. Båda påstår toppbetyg på överlappande benchmarktest, och verktyg som Cursor och Apples Xcode stöder båda, så utvecklare kan växla fritt.

OpenAI Frontier: Företagsagenter får sin egen plattform

Tillsammans med modellanslutningen introducerade OpenAI Frontier, en företagsplattform för att bygga, distribuera och hantera AI-agenter. Frontier ansluter till databaser, CRM-system, HR-plattformar, biljettsystem och andra företagsapplikationer, och låter sedan AI-agenter utföra processer över dem.

OpenAI beskrev Frontier som “en semantisk lager för företaget” där mänskliga anställda och AI-agenter arbetar på samma plattform med delad dataåtkomst och säkerhetskontroller. Agenter får anställdliknande identiteter, delad organisatorisk kontext och företagsklassificerade behörigheter.

Plattformen är modellagnostisk — företag kan hantera agenter byggda på OpenAI:s modeller tillsammans med de från Google (GOOGL ), Microsoft och Anthropic. Inledande kunder inkluderar Intuit (INTU ), State Farm, Thermo Fisher och Uber.

Frontier positionerar OpenAI för att konkurrera direkt med företagsplattformar som Salesforce (CRM ) Agentforce och ServiceNow (NOW ):s AI-agenter. Skillnaden: OpenAI bygger från modellskiktet och upp, medan etablerade företag lägger till AI till befintliga arbetsflödesverktyg. Om företag föredrar sin agentinfrastruktur från sin AI-leverantör eller sin programvaruleverantör kommer att definiera företags AI-konkurrensen 2026.

Perplexitys modellråd: Tre modeller, ett svar

Perplexity lanserade Model Council, en funktion som kör samma fråga över tre modeller samtidigt — Claude Opus, GPT och Gemini — och sedan använder en syntetiseringsmodell för att sammanföra deras utdata till ett enda svar som flaggar områden med överensstämmelse och oenighet.

Bild: Perplexity

Premissen är att ingen enskild modell är tillförlitligt bäst över alla frågor. När tre banbrytande modeller konvergerar till samma svar är förtroendet högt. När de divergerar vet användarna att de måste undersöka vidare. Model Council är tillgänglig för Max-prenumeranter och är positionerad för investeringsforskning, strategisk analys och komplex beslutsfattning.

Funktionen speglar Perplexitys strategi att differentiera genom multi-modellorkestrering snarare än att bygga grundmodeller. När gapet mellan banbrytande AI-chatbots smalnar på enskilda benchmarktest kan det visa sig att aggregat av deras utdata är mer värdefullt än att välja en enskild leverantör.

Vad allt detta betyder

Dessa utgåvor bekräftar att AI-konkurrensen har skiftat från modellförmåga till produktinfrastruktur. Både OpenAI och Anthropic har modeller som toppar samma benchmarktest; differentieringen borde nu finnas i vad du kan bygga ovanpå dem.

Perplexity, samtidigt, gör ett tyst argument för att modellkrigen kan vara mindre viktiga än hur du kombinerar modeller. Om Model Council visar sig vara användbart, antyder det att framtiden inte handlar om att välja mellan Claude och GPT — det handlar om att använda båda.

För utvecklare och företag som utvärderar sin AI-stack har detta just gjort beslutet svårare.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.