AI-modeller og plattformer
Anthropic justerer Fable 5’s biologiske sikkerhetstiltak, kutting blokkerte spørringer med 85%

Anthropic lanserte 7. august 2026 en oppdatering av biologiske sikkerhetstiltak på Claude Fable 5 som selskapet sier kutta biologirelaterte “fallbacks” med omtrent 85% i testing over produktflate — de automatiske videreformidlingene som sender en brukers spørring til en mindre kapabel modell når systemet vurderer at en forespørsel berører beskyttet biologisk område.
I sin annonsering, sa Anthropic at brukerne nå skulle se langt færre fallbacks på hverdagslige helse- og utdannings-spørringer, som å tolke laboratorie-resultater, forstå symptomer og lære biologi i en utdanningskontekst, og at helsepersonell skulle få mer støtte på kliniske oppgaver. Reduksjonen i biologiske fallbacks forventes å bringe ned total fallback-volum med omtrent 67% på Claude.ai, 55% på Cowork, 17% på Claude Code og 7% på Claude-plattformen, ifølge en fotnote i innlegget.
Selskapet er eksplisitt at oppdateringen ikke åpner modellen for profesjonell biologisk forskning. Fable 5 faller fortsatt tilbake til Claude Opus 5 for forespørringer som Anthropic betrakter som dobbelt-bruk, inkludert virologi, toksikologi og molekylær design, som selskapet sier etterlater modellen “ikke ennå brukbar for profesjonell biologisk forskning og legemiddelutvikling”. Anthropic sier at de har til hensikt å lukke denne gapen gjennom pålitelige tilgangsveier heller enn gjennom den offentlige klassifikatoren.
Hva fallback-systemet ble bygget for å holde tilbake
Fallback-arkitekturen daterer tilbake til Fable 5’s lansering 9. juni 2026. Anthropic lanserte modellen med klassifikatorer — mindre automatiserte AI-systemer som skjermer forespørringer — som dekket cybersikkerhet, biologi og kjemi, og destillasjonsforsøk. Når en klassifikator utløses, blir forespørselen betjent av den neste mest kapable Opus-modellen i stedet. Ved lanseringen sa Anthropic at de hadde justert sikkerhetstiltakene konservativt og forventet at de skulle utløse i mindre enn 5% av sesjonene.
Biologidekningen var den bredeste av de tre. Anthropics begrunnelse, som er fremme i lanseringsinnlegget og modellens systemkort, er at Mythos-klassemodeller kan overgå eksperter på noen komplekse biologiske oppgaver og gi operasjonell støtte på andre — en evne som selskapet vurderer kunne gi betydelig løft til en ondsinnet aktør. Systemkortet behandler modellen som om den har “CB-1”-evner, hvilket betyr at den kunne gi betydelig hjelp til personer med grunnleggende tekniske bakgrunner på kjente våpen-relevante prosesser, mens den vurderer at den ikke krysser “CB-2”-terskelen for å erstatte den sjeldne verdensklasse-ekspertisen bak nyutvikling av biologiske våpen — en vurdering som kortet selv beskriver som “mye mindre klar” enn for tidligere modeller.
I dag siterer oppdateringen den amerikanske etterretningsommunisitetens 2026 årlige trusselvurdering, som advarer om at fremgang i bioteknologi, inkludert syntetisk biologi og genomredigering, “kunne føre til nye biologiske trusler” og bemerker at flere statlige aktører sannsynligvis har aktive offensivt biologiske og kjemiske våpenprogrammer.
Hva endret seg i klassifikatorene
Over de siste ukene har Anthropic omskrevet biologiklassifikatorens konstitusjon — samlingen av regler som skjermingsmodellen bruker til å skille beskyttet fra tillatt innhold — og hugget ut harmløse bruksområder i mer detalj, samlet inn tilbakemeldinger fra interne og eksterne eksperter, gjennentrent klassifikatoren på oppdatert data og verifisert at den fortsatt utløser på skadelig og dobbelt-bruk forskningsinnhold. Lanseringskonfigurasjonen valgte bevisst å feile bredt: selskapet innrømmet at de ville blokkere et høyt volum av false positiver i bytte mot å få Fable 5 til generelle brukere uker eller måneder tidligere enn en smalere sikkerhetstiltak ville ha tillatt.
Selskapets eget diagram over endringen viser klassifikator-grensen flytter for å tillate forespørringer som tidligere ble fanget i en selvbeskrevet sikkerhetsmargin — innhold som Anthropic vurderer som svært sannsynlig harmløst, men blokkerte av forsiktighet. Anthropics tidligere skriving om samme klassifikator-tilnærming i cybersikkerhetsdomenet beskriver en lignende spenning mellom bred dekkning og fengsels-robusthet — innsatsen som Unite.AI dekket da Claude-modeller uten disse sikkerhetstiltakene omdannet en cyber-benchmark til tre virkelige intrusjoner.
Den avveiingen Anthropic nå håndterer offentlig
Annonseringen er et styredokument like mye som et produkt-notat. Anthropic lanserte Fable 5 med nesten alle biologiske spørringer blokkert, absorberte uker med false positiver som kostnaden for en rask generell lansering, og er nå publisert den målte resultaten av å snevre denne blokkeringen — inkludert per-overflate-fallback-reduksjoner, som gir ytre observatører en konkrete baseline for den neste revisjonen. Den gjenværende begrensningen sitter der selskapet sier den faktiske risikoen sitter: dobbelt-bruk profesjonell forskning forblir bak Opus 5-fallbacks inntil pålitelige tilgangsveier, som Anthropic har utviklet siden juni-lanseringen for verifiserte biologiforskere, tar denne trafikken.
Selskapet innrømmet at resterende false positiver vil forbli innenfor sikkerhetsmarginen og sier at sikkerhetstiltak-refinement er pågående. Det de har skrevet ned, med 7. august-oppdateringen, er en målbar definisjon av fremgang: fallback-rater de nå vil bli dømt mot.












