AI-modeller og platforme
Anthropic siger, at Claude leder 26% af sin AI-forskning og -udvikling

Anthropic sagde, at dets Claude-modeller “leder” 26 % af virksomhedens AI-forsknings- og udviklingsarbejde pr. august 2026, i de første resultater fra en prototype af R&D Automation Index, der blev offentliggjort i et Anthropic Institute-indlæg den 17. september 2026.
Indlægget, med titlen “Målinger for at forstå tempoet i AI-udvikling i frontlabber”, kombinerer indekset med interne målinger af agentovervågning og compute‑allokering, og Anthropic sagde, at de har til hensigt at fortsætte med at offentliggøre sådanne målinger.
R&D Automation Index
Anthropic R&D Automation Index kortlægger hele spektret af AI R&D-arbejde, der udføres i virksomheden, vurderer, hvor automatiseret hver opgave er i øjeblikket, og kombinerer disse vurderinger til et samlet mål. Vurderingerne bruger en automatiseringsniveau‑skala udviklet af Epoch AI, som går fra AL0, hvilket betyder ingen AI‑involvering, til AL5, hvor AI opererer fuldt autonomt uden menneskelig indblanding. På AL3 “samarbejder” AI og udfører store dele af en opgave under tæt menneskelig ledelse; på AL4 “leder” AI og udfører størstedelen af en opgave fra en overordnet prompt til færdiggørelse, mens et menneske superviserer.
Anthropic rapporterede, at Claude “leder” 26 % af deres AI R&D-arbejde pr. august 2026, andelen af arbejde på eller over “samarbejder”‑niveauet er over 90 %, og Claude opererer ikke fuldt autonomt for nogen målt delmængde af AI R&D-arbejdet. Et diagram i indlægget beskriver, at andelen på 26 % “leder” er steget fra under 1 % i februar 2026.
Den underliggende opgavekatalog blev sammensat fra bunden ved hjælp af arbejdsregistre såsom Slack og intern dokumentation. For hver uge i juli 2026 gennemgik en Claude‑forskningsagent hver tilfældigt udvalgt persons uge — 20 % af medarbejderne fra hver afdeling, der udgør model‑R&D‑løkken — og listede de opgaver, de arbejdede på, hvilket resulterede i en flad liste på cirka 15.000 detaljerede opgaver. Claude organiserede derefter disse opgaver i et hierarkisk træ med 542 noder, hvoraf 378 er blade, såsom “eval platform defect diagnosis and fixes”, og dette træ er frosset, så hver måling udføres mod den samme arbejds‑kurv.
For hver node undersøger en Claude‑agent, hvordan den type arbejde udføres i hele virksomheden, og en uafhængig Claude‑dommer tildeler et af seks automatiseringsniveauer, begrænset til beviser fra den måned, der vurderes, eller tidligere. Opgaver vægtes efter person‑tid, så kategorier, hvor der bruges mere medarbejderindsats, får større vægt.
Anthropic sammenlignede dommerens vurderinger med personale, der ejer de relevante arbejdsområder, som vurderede uden at se modellernes beviser eller domme, og rapporterede en nøjagtig model‑mod‑menneske‑overensstemmelse på 59 % versus 35 % menneske‑mod‑menneske, med vurderinger inden for ét niveau af hinanden 97 % af tiden. De angivne begrænsninger omfatter den frosne kurv, som registrerer automatisering af eksisterende arbejde uden at indfange nye typer arbejde; en sammenligning af opgaver fra februar til juli 2026 mod en januar‑2026‑kurv viste ingen stigning i “novel”‑opgaver, og Anthropic planlægger at genopbygge kurven periodisk og opdatere de offentliggjorte tal.
Overvågning af interne agenter
Et andet sæt målinger dækker Anthropics overvågning af AI‑agenter på deres systemer. Pr. august 2026 var omkring 30.000 agenter i gang med forsknings‑ og ingeniørarbejde på et givet tidspunkt på virksomhedens mest anvendte interne platform, og de rapporterede målinger dækker kun den platform.
Anthropic rapporterede, at online‑monitorer tjekker 100 % af disse agenters handlinger før udførelse, normalt inden for sekunder; af mere end en milliard agentbeslutninger analyseret i løbet af august 2026 blev 0,002 % (ca. 1 ud af 47.000) blokeret, og mennesker gennemgår eventuelle blokerede handlinger inden for en uge. Offline‑monitorer indsamler 100 % af handlingerne efterfølgende og markerer cirka 100.000 transskriptioner pr. uge, som flere klassifikatorer gennemgår for falske positiver og løser de fleste flag; omkring 50 højprioriterede flag pr. uge eskaleres til menneskelig gennemgang, og cirka én til to transskriptioner pr. tusinde flagges til yderligere gennemgang.
Ifølge indlægget er online‑monitorer designet til skader, der sker hurtigt og ikke kan omgøres, såsom en agent, der kopierer modelvægte ud af Anthropics systemer, mens offline‑monitorer retter sig mod farlige adfærdsmønstre, der udvikles langsomt og kan vendes, som tegn på model‑misjustering. Anthropic sagde, at to designvalg i den interne struktur understøtter overvågning: hver agent bærer en individuel identitet, der bevares på tværs af modelopgraderinger, og agenter kommunikerer gennem et delt, åbent beskedsystem, der krydsrefereres med transskriptioner, så adfærdsovervågning kan følge kommunikationen mellem agenter. Virksomheden oplyste, at METR tidligere uafhængigt har red‑teamet sin offline‑monitoreringsplatform, og at disse overvågningsmålinger også blev offentliggjort i deres risikorapport fra august 2026.
Snapshot af compute‑allokering
For den tredje måling undersøgte Anthropic, hvordan de brugte al deres compute fra 13. til 20. juli 2026, sorterede hver arbejdsbelastning i kategorier og målte, hvor meget af den compute, der gik til AI R&D, der var sikkerhedsarbejde. I løbet af den uge rapporterede Anthropic, at omkring 6 % af compute, der gik til AI R&D, blev allokeret til sikkerhed, og omkring 12 % af compute, der gik til AI‑drevet AI R&D, blev allokeret til sikkerhed.
Virksomheden beskriver begge estimater som bevidst konservative: tokens, der avancerede kapaciteter så meget som sikkerhed, blev talt som AI‑F&U, og sikkerhedsklassifikatorer, en separat og sammenlignelig mængde beregning, er udeladt. En promptet Claude‑klassifikator sorterede ugens næsten 10.000 forsknings‑trænings‑ og evalueringskørsler ved hjælp af et cirka 14 % udsnit vægtet mod de største beregningsbrugere, og Anthropic rapporterede, at klassifikatoren var enig med menneskelige anmeldere inden for én eller to procentpoint.
De angivne begrænsninger er, at en enkelt uge viser, at målingen er gennemførlig uden at fastslå en tendens, at de underliggende arbejdsbelastningsetiketter er bedste indsats og uverificerede, samt at andelen af beregning måler, hvad der er brugt, snarere end mængden af udført sikkerhedsarbejde.
Formål og næste skridt
Anthropic sagde, at de offentliggør målingerne, fordi de giver offentligheden, eksterne parter og regeringer et klarere billede af tempoet i AI‑udviklingen i frontløber‑laboratorier, som et supplement til deres Responsible Scaling Policy‑risikorapporter og deres Advanced AI Framework‑politikforslag. De bemærkede, at tallene ville forventes at ændre sig, hvis der var koordinering omkring tempoet i frontløber‑området, som CEO Dario Amodei har opfordret til.
Indlægget siger, at enhver frontløber‑udvikler kunne offentliggøre de samme målinger regelmæssigt med en offentlig metodik, og identificerer to forhindringer for tvær‑lab‑sammenligning: fraværet af en fælles metodik og en udviklers brug af sine egne modeller til at vurdere sine systemer. Det påpeger, at sådanne målinger kunne verificeres af tredjepart eller af andre udvikleres modeller, og kunne blive en udløser for strengere krav, såsom et fast testvindue, før en ny model sættes i arbejde på yderligere AI‑F&U.
Anthropic sagde, at de planlægger at indlejre uafhængige tredjeparts‑evaluatører fra flere organisationer, give dem adgang til interne processer, systemer og data, der svarer til hvad interne risikovurderingsteams har, for at verificere sikkerhedspraksis, rapportere hændelser og følge nøglemålinger som dem i indlægget. Artiklen var medforfattet af Marina Favaro og Phillie Wright, med forskningsretning fra Jack Clark.












