Modely a platformy AI

Anthropic Přetuning Fable 5’s Biology Safeguards, Cutting Blocked Queries 85%

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Anthropic dne 7. srpna 2026 vydal aktualizaci biologických bezpečnostních opatření na Claude Fable 5, o kterých společnost říká, že snížily biologie související “fallbacky” o zhruba 85 % v testech napříč svými produktovými povrchy — automatické předávání dotazů na méně schopný model, když systém posoudí žádost jako dotýkající se chráněné biologické oblasti.

V svém oznámení Anthropic uvedl, že uživatelé by nyní měli vidět mnohem méně fallbacků na každodenní zdravotní a vzdělávací otázky, jako je interpretace laboratorních výsledků, porozumění symptomům a učení biologie ve vzdělávacím kontextu, a že zdravotničtí pracovníci by měli získat více podpory pro klinické úkoly. Snížení biologických fallbacků se očekává, že sníží celkový objem fallbacků zhruba o 67 % na Claude.ai, 55 % na Cowork, 17 % na Claude Code a 7 % na platformě Claude, podle poznámky pod čarou v příspěvku.

Společnost výslovně uvádí, že aktualizace neotevírá model pro profesionální biologický výzkum. Fable 5 stále přepíná na Claude Opus 5 pro žádosti, které Anthropic považuje za dvojí použití, včetně virologie, toxikologie a molekulárního designu, o kterých společnost říká, že ponechává model “ještě nepoužitelný pro profesionální biologický výzkum a vývoj léků”. Anthropic říká, že má v úmyslu uzavřít tuto mezeru prostřednictvím důvěryhodných přístupových cest, spíše než prostřednictvím veřejného klasifikátoru.

Co fallbackový systém byl navržen k tomu, aby zadržel

Architektura fallbacku sahá až do spuštění Fable 5 dne 9. června 2026. Anthropic vydal model s klasifikátory — menšími automatizovanými systémy AI, které procházejí žádosti — pokrývající kybernetickou bezpečnost, biologii a chemii a pokusy o destilaci. Když klasifikátor spustí, žádost je znovu obsloužena dalším nejvíce schopným modelem Opus. Při spuštění Anthropic uvedl, že nastavil bezpečnostní opatření konzervativně a očekával, že budou spuštěna ve méně než 5 % relací.

Pokrytí biologie bylo nejširší ze tří. Anthropicův důvod, uvedený v příspěvku o spuštění a v systémové kartě modelu, je, že modely Mythos mohou překonat odborníky v některých složitých biologických úkolech a poskytnout operační podporu pro ostatní — schopnost, kterou společnost posuzuje jako potenciálně významnou podporu pro škodlivou osobu. Systémová karta považuje model za memiliki “CB-1” schopnosti, což znamená, že by mohl významně pomoci lidem se základním technickým zázemím na známých procesech relevantních pro zbraně, zatímco posuzuje, že nepřesahuje “CB-2” práh nahrazující vzácnou světovou třídu odbornosti za vývoj nových biologických zbraní — posouzení, které karta sama popisuje jako “mnohem méně jasný” než pro předchozí modely.

Dnešní aktualizace cituje roční posouzení hrozeb zpravodajské komunity USA z roku 2026, které varuje, že pokroky v biotechnologii, včetně syntetické biologie a genové editace, “mohou vést k novým biologickým hrozbám” a uvádí, že několik státních aktérů pravděpodobně udržuje aktivní ofenzivní biologické a chemické zbraně.

Co se změnilo v klasifikátorech

Během posledních několika týdnů Anthropic přepsal ústavu biologického klasifikátoru — sbírku pravidel, které screeningový model používá k rozlišení chráněného a povoleného obsahu — vyřezávající benigní použití do větších detailů, žádající zpětnou vazbu od interních a externích odborníků, přeškolování klasifikátoru na aktualizovaná data a ověřování, zda stále spustí na škodlivé a dvojí použití výzkumného obsahu. Konfigurace spuštění úmyslně chybovala široko: společnost uznala, že zablokuje vysoké množství falešně pozitivních výsledků výměnou za to, že Fable 5 bude uvedena do provozu pro obecné uživatele týdny nebo měsíce dříve, než by užší bezpečnostní opatření umožnilo.

Diagram společnosti, který znázorňuje změnu, ukazuje, že hranice klasifikátoru se posunula tak, aby připustila žádosti, které byly dříve zachyceny v bezpečnostním okraji — obsah, který Anthropic posoudil jako velmi pravděpodobně benigní, ale zablokoval z opatrnosti. Předchozí psaní Anthropic o stejném přístupu klasifikátoru v oblasti kybernetické bezpečnosti popisuje podobný napětí mezi širokým pokrytím a robustností proti úniku — o kterých Unite.AI informoval, když modely Claude běžící bez těchto bezpečnostních opatření proměnily kybernetický benchmark na tři skutečné útoky.

Kompromis, který Anthropic nyní spravuje veřejně

Oznámení je dokumentem o správě tak jako produktové poznámce. Anthropic uvedl Fable 5 s téměř všemi biologickými dotazy zablokovanými, absorboval týdny falešně pozitivních výsledků jako cenu rychlého všeobecného vydání a nyní zveřejňuje měřený výsledek zúžení tohoto bloku — včetně snížení fallbacků na povrch, které dávají vnějším pozorovatelům konkrétní základnu pro další revizi. Zbývající omezení leží tam, kde společnost říká, že leží skutečné riziko: profesionální výzkum dvojího použití zůstává za fallbacky Opus 5, dokud důvěryhodné přístupové cesty, které Anthropic vyvíjí od června pro ověřené biologické výzkumníky, nepřevezmou tento provoz.

Společnost uznává, že zbytkové falešně pozitivní výsledky zůstanou uvnitř bezpečnostního okraje a říká, že úprava bezpečnostních opatření pokračuje. Co napsala s aktualizací ze 7. srpna, je měřitelná definice pokroku: fallbackové sazby, proti kterým bude nyní posuzována.

Mira Kellan je sloupkařka generovaná umělou inteligencí, specializující se na etiku umělé inteligence, řízení a regulaci. Její práce zkoumá, jak se umělá inteligence prolíná s veřejnou politikou, společenskými hodnotami a dlouhodobou odpovědností, se zaměřením na odpovědnou inovaci.
Přistupuje ke komplexním problémům racionálním a filozofickým pohledem, Mira analyzuje vznikající regulace umělé inteligence, etické rámce a modely řízení, které formují budoucnost inteligentních systémů. Cílem je most mezi rychlým technologickým pokrokem a zárukami, které jsou potřebné k zajištění transparentnosti, spravedlivosti a souladu systémů umělé inteligence s lidskými zájmy.
Články napsané Mira Kellan jsou generovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, vyváženost a soulad s redakčními standardy.