AI-modeller og platforme

Anthropic Retunerer Fable 5’s Biologiske Sikkerhedsforanstaltninger, Reducerer Blokerede Forespørgsler Med 85%

mm
Føj Unite.AI til dine foretrukne kilder på Google

Anthropic udgav den 7. august 2026 en opdatering til de biologiske sikkerhedsforanstaltninger på Claude Fable 5, som virksomheden siger reducerer biologirelaterede “fallbacks” med omkring 85% i test på tværs af deres produktoverflader – de automatiske videreformidlinger, der sender en brugers forespørgsel til en mindre kapabel model, når systemet vurderer, at en anmodning berører sikkerhedsskærmet biologisk territorium.

I deres meddelelse sagde Anthropic, at brugerne nu skal se langt færre fallbacks på hverdags sundheds- og uddannelsesspørgsmål, såsom fortolkning af laboratorie-resultater, forståelse af symptomer og læring af biologi i en uddannelsesmæssig kontekst, og at sundhedsprofessionelle skal få mere støtte til kliniske opgaver. Reduktionen i biologiske fallbacks forventes at bringe den samlede fallback-volumen ned med omkring 67% på Claude.ai, 55% på Cowork, 17% på Claude Code og 7% på Claude Platform, ifølge en fodnote i indlægget.

Virksomheden er eksplicit om, at opdateringen ikke åbner modellen for professionel biologisk forskning. Fable 5 falder stadig tilbage til Claude Opus 5 for anmodninger, som Anthropic betragter som dual-brug, herunder virologi, toksikologi og molekylær design, som virksomheden siger efterlader modellen “endnu ikke brugbar til professionel biologisk forskning og lægemiddeludvikling”. Anthropic siger, at de har til hensigt at lukke denne kap ved hjælp af betroede adgangsveje snarere end gennem den offentlige klassifikator.

Hvad fallback-systemet var bygget til at holde tilbage

Feedback-arkitekturen daterer tilbage til Fable 5’s lancering den 9. juni 2026. Anthropic udgav modellen med klassifikatorer – mindre automatiserede AI-systemer, der skærmer anmodninger – dækkende cybersikkerhed, biologi og kemi samt destillationsforsøg. Når en klassifikator udløser, genbetjenes anmodningen af den næstmest kapable Opus-model i stedet. Ved lanceringen sagde Anthropic, at de havde justeret sikkerhedsforanstaltningerne konservativt og forventede, at de ville udløse i mindre end 5% af sessionerne.

Den biologiske dækning var den bredeste af de tre. Anthropics begrundelse, som er beskrevet i lanceringen og modellens systemkort, er, at Mythos-klassens modeller kan overgå eksperter på visse komplekse biologiske opgaver og give operationel støtte på andre – en kapacitet, som virksomheden vurderer kunne give en betydelig opgradering til en ondsindet aktør. Systemkortet behandler modellen som havende “CB-1”-kapaciteter, hvilket betyder, at den kunne give betydelig hjælp til personer med grundlæggende tekniske baggrunde på kendte våben-relevante processer, mens den vurderer, at den ikke overskrider “CB-2”-grænsen for at erstatte den sjældne verdensklasse-ekspertise bag udviklingen af nye biologiske våben – en vurdering, som kortet selv beskriver som “meget mindre klar” end for tidligere modeller.

I dag citerer opdateringen den amerikanske efterretningsgemeinschafts 2026 årlige trusselsvurdering, som advarer om, at fremskridt inden for bioteknologi, herunder syntetisk biologi og genom-redigering, “kunne føre til nye biologiske trusler” og bemærker, at flere statlige aktører sandsynligvis opretholder aktive offensive biologiske og kemiske våbenprogrammer.

Hvad ændrede sig i klassifikatorerne

Over de seneste par uger har Anthropic omskrevet biologiklassifikatorens forfatning – den samling regler, som screeningsmodellen bruger til at skelne mellem sikkerhedsskærmet og tilladt indhold – udhulet harmløse anvendelser i mere detaljer, indhentet feedback fra interne og eksterne eksperter, genoptrænet klassifikatoren på opdateret data og verificeret, at den stadig udløser på skadelig og dual-brugsforskning. Lanceringen konfigureredes bevidst bredt: Virksomheden erkendte, at den ville blokere en høj volumen af falske positiver i bytte for at få Fable 5 til almindelige brugere uger eller måneder tidligere end en smallere sikkerhedsforanstaltning ville have tilladt.

Virksomhedens egen diagram over ændringen viser klassifikatorgrænsen flytter til at tillade anmodninger, som tidligere var fanget i en selvbeskrevet sikkerhedsmargin – indhold, som Anthropic vurderede som meget sandsynligt harmløst, men blokerede af forsigtighed. Anthropics tidligere skriv om den samme klassifikator-tilgang i cybersikkerhedsdomænet beskriver en lignende spænding mellem bred dækning og fængselsrobusthed – gevinsten af, hvilket Unite.AI dækkede, da Claude-modeller uden disse sikkerhedsforanstaltninger omdannede en cybersikkerhedsbenchmark til tre rigtige intrutioner.

Det kompromis, som Anthropic nu håndterer offentligt

Meddelelsen er en styrethedsskrivelse såvel som en produktmeddelelse. Anthropic lancerede Fable 5 med næsten alle biologiske forespørgsler blokeret, absorberede uger med falske positiver som omkostningerne for en hurtig almindelig udgivelse og udgiver nu den målte resultat af at snævre denne blok – herunder per-overflade-fallback-reduktioner, som giver ydre iagttagere en konkrete baseline for den næste revision. Den resterende begrænsning sidder, hvor virksomheden siger, at den virkelige risiko sidder: dual-brug professionel forskning forbliver bag Opus 5-fallbacks, indtil betroede adgangsveje, som Anthropic har udviklet siden lanceringen i juni for godkendte biologiforskere, tager den trafik.

Virksomheden erkender, at resterende falske positiver vil forblive inden for sikkerhedsmargenen, og siger, at sikkerhedsforanstaltningerne er under udvikling. Det, de har sat i skrift, med opdateringen den 7. august, er en målbar definition af fremgang: fallback-rater, som de nu vil blive vurderet imod.

Mira Kellan er en AI-genereret klummeskriver, der specialiserer sig i AI-etik, styring og regulering. Hendes arbejde undersøger, hvordan kunstig intelligens krydser offentlig politik, samfundsverdier og langsigtede ansvar, med fokus på ansvarlig innovation.
Hun nærmer sig komplekse problemer med en rationel og filosofisk synsvinkel, og Mira analyserer fremvoksende AI-reguleringer, etiske rammer og styringsmodeller, der former fremtiden for intelligente systemer. Hun sigter på at brobygge mellem den hurtige teknologiske fremgang og de sikkerhedsforanstaltninger, der er nødvendige for at sikre, at AI-systemer forbliver gennemsigtige, retfærdige og i overensstemmelse med menneskelige interesser.
Artikler skrevet af Mira Kellan er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, balance og overholdelse af redaktionelle standarder.