AI-modeller og platforme

Anthropic lancerer Claude Opus 4.1, knuser kodningsbenchmarks

mm
Føj Unite.AI til dine foretrukne kilder på Google

Anthropic har lanceret Claude Opus 4.1 i dag, en opgraderet version af deres flagskib AI-model, der opnår 74,5% nøjagtighed på virkelige kodningsopgaver, og sætter dermed en ny benchmark-rekord, samtidig med at den fastholder samme priser som dens forgænger.

Opdateringen er en strategisk move, da AI-industrien forventer OpenAIs GPT-5 udgivelse, hvor Anthropic positionerer deres seneste model som en konkurrent, der udmærker sig ved komplekse programmeringsudfordringer og selvstændige opgavefuldførelse. Virksomheden lover “væsentligt større forbedringer” i de kommende uger, hvilket signalerer en intensiveret konkurrence blandt førende AI-udviklere.

Nøglepræstationsforbedringer

Ifølge Anthropics meddelelse forbedrer Claude Opus 4.1 sig på tre nøgleområder i forhold til sin forgænger: agensopgaver, der kræver multi-step-reasoning, virkelige kodningsapplikationer og analytiske reasoneringsfærdigheder.

Modellen opnåede 74,5% på SWE-bench Verified-benchmarket, der måler en AIs evne til at identificere og korrigere virkelige fejl i open-source-software – overgående den tidligere Claude Opus 4-score på 72,5% og overgående OpenAIs o-serie-modeller med ca. fem procentpoint.

GitHub noterede særligt store fremskridt i multi-fil-kod-refaktorering, mens Rakuten Group fremhævede modellens præcision i at identificere korrektioner inden for store kodebasers uden at introducere nye fejl. Windsurf, en kodningsstartup, rapporterede, at Opus 4.1 leverede en forbedring på en standardafvigelse over Opus 4 på deres junior-udvikler-benchmark, sammenlignende performancespringet med det tidligere spring fra Sonnet 3.7 til Sonnet 4.

Tilgængelighed og integration

Den opgraderede model er umiddelbart tilgængelig for betalende Claude-brugere via webgrænsefladen og Claude Code, samt via Anthropics API, Amazon Bedrock og Google Clouds Vertex AI. Udviklere kan få adgang til den nye model via API-tagget uden prisstigning fra den tidligere version, og fastholder prisstrukturen, der har gjort Claude konkurrencedygtig på enterprise-markedet.

Ud over software-udvikling viser Claude Opus 4.1 forbedrede evner i dataanalyse og forskningsopgaver. Anthropic fremhævede specifikt forbedringer i “detail-tracking og agenssøgning”, henvisende til modellens evne til at fastholde kontekst på tværs af komplekse, multi-step-operationer – en kritisk funktion for enterprise-applikationer, der kræver selvstændig problemløsning.

Branchekontekst og konkurrence

Udgivelsestidspunktet synes at være bevidst, da brancherapporter antyder, at OpenAI planlægger at offentliggøre GPT-5 i nær fremtid. Ifølge The Information forventes GPT-5 at fokusere på lignende områder – programmering, matematik og agensbaserede opgaver – selvom analytikere forudser, at forbedringerne kan være inkrementelle snarere end revolutionerende.

Den hurtige iteration på Claude-modellerne – med denne opdatering, der kommer kun tre måneder efter Claude 4-familie-lanceringen i maj – afspejler den accelererende udviklingstakt i AI, da virksomheder konkurrerer om markedstilladelse i enterprise- og udviklerværktøj. Dette følger Anthropics historie med at positionere sig selv som en sikkerhedsfokuseret alternativ til OpenAI, samtidig med at den fastholder konkurrencedygtige performancesmetrikker.

Tekniske detaljer og implementering

Systemkortet afslører, at Claude Opus 4.1 er en hybrid reasoneringsmodel, der kan fungere med eller uden forlængede tænkeformer. For benchmarks som SWE-bench Verified og Terminal-Bench opnåede modellen resultaterne uden forlængede tænkeformer, mens andre benchmarks som GPQA Diamond og MMMU udnyttede op til 64K tokens af forlænget tænkekapacitet.

Modellen fortsætter med at bruge samme enkle scaffold til SWE-bench-testning, som Anthropic har anvendt på tværs af Claude 4-familien – udstyrer modellen med kun en bash-værktøj og en filredigeringværktøj, der fungerer via strengersætninger. Denne minimalistiske tilgang kontrasterer med mere komplekse implementeringer, men opnår alligevel brancheførerende resultater.

Fremadrettet

Anthropic anbefaler alle nuværende Opus 4-brugere at opgradere til den nye version til alle brugsområder. Virksomheden har gjort omfattende dokumentation tilgængelig, herunder modellens side og tekniske specifikationer for udviklere, der er interesseret i at implementere teknologien.

Med både Anthropic og OpenAI, der forbereder betydelige udgivelser, kan de kommende uger vise sig at være afgørende for at bestemme lederskab i den næste generation af AI-kapaciteter. Da AI-modeller bliver stadig mere avancerede i deres reasonerings- og kodningsfærdigheder, skifter konkurrencen fra rå performancesmetrikker til praktisk implementering og pålidelighed i produktionsmiljøer.

FAQ (Claude Opus 4.1)

Hvordan forbedrer Claude Opus 4.1 kodnings- og reasoneringsopgaver i forhold til tidligere versioner?

Claude Opus 4.1 opnår 74,5% på SWE-bench Verified (op fra 72,5% i Opus 4), med bemærkelsesværdige forbedringer i multi-fil-kod-refaktorering, detaljerede sporingsfærdigheder i komplekse kodebasers og agenssøgningsfærdigheder, der tillader den at håndtere multi-step-reasoneringsopgaver mere effektivt.

Hvad er de vigtigste virkelige anvendelser for Claude Opus 4.1 i kodning og AI-agenter?

Modellen udmærker sig ved at fejlfinde store kodebasers uden at introducere nye fejl, selvstændig kod-refaktorering på tværs af flere filer, dybdegående dataanalyse og forskningsopgaver, der kræver vedvarende kontekst – hvilket gør den ideel for enterprise-softwareudvikling og automatiseret workflow-optimering.

Hvordan afspejler Claude Opus 4.1’s præstation på SWE-bench dens kodningsfærdigheder?

SWE-bench Verified måler en AIs evne til at identificere og korrigere virkelige fejl i open-source-software, og Claude Opus 4.1’s 74,5%-score repræsenterer den højeste offentliggjorte præstation, overgående OpenAIs o-serie-modeller med ca. fem procentpoint.

Hvad er de væsentligste forskelle mellem Claude Opus 4.1 og andre AI-modeller som GitHub Copilot eller ChatGPT?

I modsætning til GitHub Copilot, der fokuserer på kodekomplettering, håndterer Claude Opus 4.1 komplette problemløsnings-workflows, herunder fejlfinde og refaktorering, samtidig med at den tilbyder hybrid reasoneringsmodi, der kan skifte mellem hurtige svar og forlænget tænkeform – en funktion, der ikke er tilgængelig i standard-ChatGPT-implementeringer.

Hvordan kan udviklere og virksomheder integrere Claude Opus 4.1 i deres workflows og platforme?

Udviklere kan få adgang til Claude Opus 4.1 via API-tagget “claude-opus-4-1-20250805”, via Amazon Bedrock, Google Cloud Vertex AI eller via Claude Code til kommandolinje-integration, med samme priser som Opus 4 og uden krav om kodeændringer for eksisterende implementeringer.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.