AI-modeller og plattformer

Anthropic justerer Fable 5’s biologiske sikkerhetstiltak, kutting blokkerte spørringer med 85%

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Anthropic lanserte 7. august 2026 en oppdatering av biologiske sikkerhetstiltak på Claude Fable 5 som selskapet sier kutta biologirelaterte “fallbacks” med omtrent 85% i testing over produktflate — de automatiske videreformidlingene som sender en brukers spørring til en mindre kapabel modell når systemet vurderer at en forespørsel berører beskyttet biologisk område.

I sin annonsering, sa Anthropic at brukerne nå skulle se langt færre fallbacks på hverdagslige helse- og utdannings-spørringer, som å tolke laboratorie-resultater, forstå symptomer og lære biologi i en utdanningskontekst, og at helsepersonell skulle få mer støtte på kliniske oppgaver. Reduksjonen i biologiske fallbacks forventes å bringe ned total fallback-volum med omtrent 67% på Claude.ai, 55% på Cowork, 17% på Claude Code og 7% på Claude-plattformen, ifølge en fotnote i innlegget.

Selskapet er eksplisitt at oppdateringen ikke åpner modellen for profesjonell biologisk forskning. Fable 5 faller fortsatt tilbake til Claude Opus 5 for forespørringer som Anthropic betrakter som dobbelt-bruk, inkludert virologi, toksikologi og molekylær design, som selskapet sier etterlater modellen “ikke ennå brukbar for profesjonell biologisk forskning og legemiddelutvikling”. Anthropic sier at de har til hensikt å lukke denne gapen gjennom pålitelige tilgangsveier heller enn gjennom den offentlige klassifikatoren.

Hva fallback-systemet ble bygget for å holde tilbake

Fallback-arkitekturen daterer tilbake til Fable 5’s lansering 9. juni 2026. Anthropic lanserte modellen med klassifikatorer — mindre automatiserte AI-systemer som skjermer forespørringer — som dekket cybersikkerhet, biologi og kjemi, og destillasjonsforsøk. Når en klassifikator utløses, blir forespørselen betjent av den neste mest kapable Opus-modellen i stedet. Ved lanseringen sa Anthropic at de hadde justert sikkerhetstiltakene konservativt og forventet at de skulle utløse i mindre enn 5% av sesjonene.

Biologidekningen var den bredeste av de tre. Anthropics begrunnelse, som er fremme i lanseringsinnlegget og modellens systemkort, er at Mythos-klassemodeller kan overgå eksperter på noen komplekse biologiske oppgaver og gi operasjonell støtte på andre — en evne som selskapet vurderer kunne gi betydelig løft til en ondsinnet aktør. Systemkortet behandler modellen som om den har “CB-1”-evner, hvilket betyr at den kunne gi betydelig hjelp til personer med grunnleggende tekniske bakgrunner på kjente våpen-relevante prosesser, mens den vurderer at den ikke krysser “CB-2”-terskelen for å erstatte den sjeldne verdensklasse-ekspertisen bak nyutvikling av biologiske våpen — en vurdering som kortet selv beskriver som “mye mindre klar” enn for tidligere modeller.

I dag siterer oppdateringen den amerikanske etterretningsommunisitetens 2026 årlige trusselvurdering, som advarer om at fremgang i bioteknologi, inkludert syntetisk biologi og genomredigering, “kunne føre til nye biologiske trusler” og bemerker at flere statlige aktører sannsynligvis har aktive offensivt biologiske og kjemiske våpenprogrammer.

Hva endret seg i klassifikatorene

Over de siste ukene har Anthropic omskrevet biologiklassifikatorens konstitusjon — samlingen av regler som skjermingsmodellen bruker til å skille beskyttet fra tillatt innhold — og hugget ut harmløse bruksområder i mer detalj, samlet inn tilbakemeldinger fra interne og eksterne eksperter, gjennentrent klassifikatoren på oppdatert data og verifisert at den fortsatt utløser på skadelig og dobbelt-bruk forskningsinnhold. Lanseringskonfigurasjonen valgte bevisst å feile bredt: selskapet innrømmet at de ville blokkere et høyt volum av false positiver i bytte mot å få Fable 5 til generelle brukere uker eller måneder tidligere enn en smalere sikkerhetstiltak ville ha tillatt.

Selskapets eget diagram over endringen viser klassifikator-grensen flytter for å tillate forespørringer som tidligere ble fanget i en selvbeskrevet sikkerhetsmargin — innhold som Anthropic vurderer som svært sannsynlig harmløst, men blokkerte av forsiktighet. Anthropics tidligere skriving om samme klassifikator-tilnærming i cybersikkerhetsdomenet beskriver en lignende spenning mellom bred dekkning og fengsels-robusthet — innsatsen som Unite.AI dekket da Claude-modeller uten disse sikkerhetstiltakene omdannet en cyber-benchmark til tre virkelige intrusjoner.

Den avveiingen Anthropic nå håndterer offentlig

Annonseringen er et styredokument like mye som et produkt-notat. Anthropic lanserte Fable 5 med nesten alle biologiske spørringer blokkert, absorberte uker med false positiver som kostnaden for en rask generell lansering, og er nå publisert den målte resultaten av å snevre denne blokkeringen — inkludert per-overflate-fallback-reduksjoner, som gir ytre observatører en konkrete baseline for den neste revisjonen. Den gjenværende begrensningen sitter der selskapet sier den faktiske risikoen sitter: dobbelt-bruk profesjonell forskning forblir bak Opus 5-fallbacks inntil pålitelige tilgangsveier, som Anthropic har utviklet siden juni-lanseringen for verifiserte biologiforskere, tar denne trafikken.

Selskapet innrømmet at resterende false positiver vil forbli innenfor sikkerhetsmarginen og sier at sikkerhetstiltak-refinement er pågående. Det de har skrevet ned, med 7. august-oppdateringen, er en målbar definisjon av fremgang: fallback-rater de nå vil bli dømt mot.

Mira Kellan er en AI-generert spaltist som spesialiserer seg på AI-etik, styring og regulering. Hennes arbeid undersøker hvordan kunstig intelligens krysser offentlig politikk, samfunnsverdier og langsiktig ansvar, med fokus på ansvarlig innovasjon.
Hun nærmer seg komplekse problemer med en rasjonell og filosofisk linse, Mira analyserer fremvoksende AI-reguleringer, etiske rammer og styringsmodeller som former fremtiden for intelligente systemer. Hun har som mål å brygge gapet mellom rask teknologisk fremgang og de sikkerhetstiltakene som er nødvendige for å sikre at AI-systemer forblir transparente, rettferdige og i samsvar med menneskelige interesser.
Artikler skrevet av Mira Kellan er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, balanse og overholdelse av redaksjonelle standarder.