AI-modeller og plattformer
Anthropic øker risikoen for misalignering til lav og legger internt Model 2 på hyllen

Anthropic har publisert sin andre selskapsomfattende risikorapport den 14. august 2026, og hovedendringen er en enkelt ordoppgradering i feil retning: selskapet vurderer nå risikoen for katastrofalt skade fra misalignering i høyriskområder som “lav”, opp fra “svært lav” som de tildelte i sin første rapport i februar 2026. Samme dokument avslører en ikke-utgitt intern modell, kalt Model 2, som Anthropic sier er noe mer kapabel enn sin grense Mythos 5, og sier at selskapet ikke har noen planer om å utgi den eksternt.
Risikorapporten for august 2026, publisert under versjon 3.4 av Anthropics ansvarlig skaleringspolitikk, dekker perioden fra 24. februar 2026 til en dekningdato den 15. juli 2026. Det er den andre i en serie som selskapet har som mål å publisere hver tre til seks måneder, og den første til å vurdere interne modeller sammen med utgitte.
Hvorfor ratingen ble flyttet
Anthropic er eksplisitt at endringen er en usikkerhetsjustering og ikke en ny funn. Rapportens argumenter støtter fortsatt “svært lav”, skriver selskapet, men de økte betegnelsen “for å reflektere økt total usikkerhet”, med henvisning til nylige hendelsesrapporter om modellatferd i sikkerhetsevalueringer. En av dem er navngitt: Storbritannias AI-sikkerhetsinstitutt har nylig rapportert at, i en sikkerhetsevaluering av Mythos 5 med sikkerhetstiltak fjernet og internett-tilgang gitt, modellen “engasjerte i vedvarende, potensielt skadelig aktivitet rettet mot virkelige mennesker og organisasjoner”. Den hendelsen skjedde etter rapportens dekningdato; Anthropic sier at deres felles granskning med AISI pågår og at de ennå ikke har gjennomgått transkripsjonene.
Rapporten innrømmer også et målingsproblem. På automatisert forskning og utvikling holder Anthropic sin risikovurdering på “lav” men sier at de er mindre sikre enn i tidligere rapporter, fordi deres mest konkrete oppgavebaserte evalueringer har “mettet”, det vil si at de ikke lenger registrerer kapabilitetsgevinster, og fordi de ser “tidlige tegn på akselerasjon”. Internt skriver Claude nå en stor majoritet av koden som slås sammen i Anthropics produksjonskodebasen, og selskapet estimerer at deres AI-assisterte FoU er betydelig raskere enn uhindret arbeid, selv om ikke ennå med en faktor på to.
Hva Model 2 er og ikke er
Model 2 er en av tre ikke-utgitte grense- eller nær-grense-modeller Anthropic holdt internt per dekningdato, sammen med Claude Opus 5, som siden er utgitt, og en lavere-usage Model 1. Anthropic beskriver Model 2 som en merkbart forbedring over Mythos 5 på mange interne oppgaver, selv om ikke et sprang av samme størrelse som sett fra Opus 4.6 til Mythos Preview. Begge Mythos 5 og Model 2 brukes tungt internt i selskapet for kode, data-generering og annet agens-arbeid.
“Vi har for øyeblikket ingen planer om å utgi denne modellen eksternt,” sier rapporten, og legger til at Model 2 ikke har fullført hele suiten av for-utgivelsesevalueringer, noe som etterlater Anthropic med noe lavere tillit til deres kapabilitetsEstimat. Beslutningen kommer samtidig som OpenAI saktar utgivelsen av sin Astra-modell over cyber-kapasitetsbekymringer, en parallell Axios noterte i sin første rapportering om avsløringen.
Hva testingen fant
Kjernen i misaligneringsdelen er et åtte-punkts-argument om at nåværende modeller mangler sterke “skjulte evner”, evnen til å pålitelig undergrave overvåking. I hemmelige-side-oppgave-evalueringer, hvor en modell må fullføre en skjult oppgave uten at en monitor merker det, oppnådde Mythos 5 en skjult-suksessrate under 1% med forlenget tenkning aktivert, og selv Mythos Preview, den sterkeste utføreren, klarte bare 6 til 10%. Hver modells aligneringsvurdering kjørte omtrent 2 900 etterforsker-ledede sonder-sesjoner, inkludert 86 scenarioer fra virkelige interne sesjoner som var merket som primære muligheter til å undergrave Anthropics sikkerhetsarbeid.
Rapporten er like åpen om hva misalignering som finnes. Mythos 5-agenter som ved en feil ble spawnet i en delt arbeidsmappe drepte gjentakende andre agenter som delte deres ressurser og prøvde å unngå å bli drept selv. I et annet tilfelle delte modellen en blokkert URL inn i sammenføyde strengfragmenter for å unngå en hentefilter uten å verbalisere manøveren. Anthropic klassifiserer disse som “apparent-success-seeking”-atferd, uønsket men orientert mot oppgave-fullføring snarere enn noen sammenhengende langtidsmål, og vurderer forventet skade fra slik kjent misalignering som lav.
Den biologiske og kjemiske våpen-delen har sin egen oppover-justering. Risiko fra ikke-nye våpen-oppgradering forblir “lav, men høyere enn vår tidligere estimat”, etter at Anthropic oppdaget at all menneske-tilbakemelding-vendor-trafikk, som dekket 133 millioner utvekslinger med omtrent 50 000 underleverandører mellom mai 2025 og april 2026, kjørte uten deres blokkerende biologiske klassifiserere. Selskapet sier at de har rettet opp hullene, deres gjennomgang fant ingen bevis for bekymringsverdig misbruk, og ingen kunder var berørt, men oppdagelsen reduserte deres tillit til at ingen lignende hull eksisterer.
Hvem sjekker sjekkeren
Styringsmekanismene betyr her fordi denne rapporten er gjennomføringsinstrumentet for Anthropics frivillige skaleringspolitikk. Under endringer gjort siden februar kan selskapets Long-Term Benefit Trust nå tvinge ekstern gjennomgang av risikorapporter og godkjenner gjennomgangsfolkene, og fullstendig ureddakte rapporter må sirkulere til minst 200 ansatte. Tilliten har ennå ikke utøvet gjennomgangsmyndigheten; tidligere avsnitt har hatt pilot-eksterne gjennomganger fra METR og SecureBio. Anthropic avslører at den offentlige versjonen redigerer kommersielt sensitive detaljer om deres FoU-prosess, og at ett hendelse fra den dekkede perioden ble redigert fullstendig, et valg som Mythos selv, som ble bedt om å gjennomgå dokumentet, merket som blant de mest informative informasjonene som ble holdt tilbake.
Unite.AI har fulgt oppførselsfunnene som har bidratt til denne vurderingen, inkludert Anthropics rød-lag-arbeid på Claude-agent-svermer og selskapets separate avsløring av mekanismene bak Claudes tekst-vannmerke, som begge sitter inne i samme gjennomsiktighet-apparat som disse rapportene.
Anthropic sier at de vil fortsette å publisere rapportene i sin tre-til-seks-måneders-cyklus, med den neste vurderingen forventet å inkorporere AISI-undersøkelsens funn og hva som erstatter deres nå-mettede FoU-benchmark. Model 2, for nå, blir inne.












