Modele i platformy AI
Anthropic dostraja zabezpieczenia biologiczne w Fable 5, zmniejszajÄ c zablokowane zapytania o 85%

Anthropic 7 sierpnia 2026 r. opublikowaÅ aktualizacjÄ zabezpieczeÅ biologicznych w Claude Fable 5, ktÃģrej firma twierdzi, Åže zmniejszyÅa âprzekierowaniaâ zwiÄ zane z biologiÄ o okoÅo 85% w testach na powierzchniach produktÃģw â automatyczne przekierowania, ktÃģre kierujÄ zapytanie uÅžytkownika do mniej zaawansowanego modelu, gdy system uzna, Åže ÅžÄ danie dotyka chronionego obszaru biologii.
W swoim ogÅoszeniu Anthropic powiedziaÅ, Åže uÅžytkownicy powinni teraz widzieÄ znacznie mniej przekierowaÅ dotyczÄ cych codziennych pytaÅ zdrowotnych i edukacyjnych, takich jak interpretacja wynikÃģw laboratoryjnych, zrozumienie objawÃģw i nauka biologii w kontekÅcie edukacyjnym, oraz Åže profesjonaliÅci opieki zdrowotnej powinni otrzymaÄ wiÄcej wsparcia w zadaniach klinicznych. Spadek przekierowaÅ biologicznych ma zmniejszyÄ caÅkowitÄ objÄtoÅÄ przekierowaÅ o okoÅo 67% w Claude.ai, 55% w Cowork, 17% w Claude Code i 7% na platformie Claude, zgodnie z przypisem w poÅcie.
Firma jest wyraÅšna, Åže aktualizacja nie otwiera modelu dla profesjonalnych badaÅ biologicznych. Fable 5 nadal przekierowuje do Claude Opus 5 dla ÅžÄ daÅ, ktÃģre Anthropic uwaÅža za wielozadaniowe, w tym wirusologiÄ, toksykologiÄ i projektowanie molekularne, co firma twierdzi, pozostawia model ânadal nie nadaje siÄ do profesjonalnych badaÅ biologicznych i rozwoju lekÃģwâ. Anthropic twierdzi, Åže zamierza zamknÄ Ä tÄ lukÄ za pomocÄ zaufanych ÅcieÅžek dostÄpu, a nie za pomocÄ publicznego klasyfikatora.
Czego system fallback byÅ zaprojektowany, aby powstrzymaÄ
Architektura fallback siÄga do uruchomienia Fable 5 9 czerwca 2026 r. Anthropic wydaÅ model z klasyfikatorami â mniejszymi automatycznymi systemami AI, ktÃģre ekranujÄ ÅžÄ dania â obejmujÄ cymi bezpieczeÅstwo cybernetyczne, biologiÄ i chemiÄ oraz prÃģby destylacji. Gdy klasyfikator jest uruchomiony, ÅžÄ danie jest ponownie obsÅugiwane przez nastÄpny najbardziej zaawansowany model Opus. Podczas uruchomienia Anthropic powiedziaÅ, Åže dostroiÅ zabezpieczenia w sposÃģb konserwatywny i oczekiwaÅ, Åže bÄdÄ one uruchamiane w mniej niÅž 5% sesji.
Pokrycie biologiczne byÅo najszersze z trzech. Uzasadnienie Anthropic, przedstawione w poÅcie startowym i karcie systemu, polega na tym, Åže modele klasy Mythos mogÄ przewyÅžszaÄ ekspertÃģw w niektÃģrych zÅoÅžonych zadaniach biologicznych i zapewniaÄ wsparcie operacyjne w innych â moÅžliwoÅÄ, ktÃģrÄ firma ocenia jako potencjalnie znaczÄ ce wsparcie dla osoby o zÅych intencjach. Karta systemu traktuje model jako majÄ cy âCB-1â moÅžliwoÅci, co oznacza, Åže moÅže znacznie pomÃģc osobom o podstawowych umiejÄtnoÅciach technicznych w znanych procesach istotnych dla broni, podczas gdy ocenia, Åže nie przekracza progu âCB-2â zastÄpowania rzadkiego, Åwiatowej klasy ekspertyzy za rozwÃģj nowych broni biologicznych â ocenÄ, ktÃģrÄ sama karta opisuje jako âznacznie mniej klarownÄ â niÅž w przypadku poprzednich modeli.
DziÅ aktualizacja cytuje 2026 RocznÄ Ocena ZagroÅžeÅ spoÅecznoÅci wywiadowczej USA, ktÃģra ostrzega, Åže postÄp w biotechnologii, w tym biologii syntetycznej i edycji genomowej, âmoÅže prowadziÄ do nowych biologicznych zagroÅžeÅâ i zauwaÅža, Åže kilka paÅstw prawdopodobnie prowadzi aktywne ofensywne programy broni biologicznej i chemicznej.
Co siÄ zmieniÅo w klasyfikatorach
W ciÄ gu ostatnich kilku tygodni Anthropic przepisaÅ konstytucjÄ klasyfikatora biologicznego â zbiÃģr reguÅ, ktÃģrych uÅžywa model ekranujÄ cy do rozrÃģÅžnienia chronionego i dozwolonego contenu â wycinajÄ c nieszkodliwe zastosowania w wiÄkszych szczegÃģÅach, zbierajÄ c opinie od wewnÄtrznych i zewnÄtrznych ekspertÃģw, ponownie trenujÄ c klasyfikator na aktualnych danych i weryfikujÄ c, czy nadal wyzwala siÄ na szkodliwych i wielozadaniowych badaniach. Konfiguracja startowa celowo bÅÄdnie wykrywaÅa duÅžy volumen faÅszywie pozytywnych w zamian za to, Åže Fable 5 dotarÅ do ogÃģlnych uÅžytkownikÃģw tygodnie lub miesiÄ ce wczeÅniej, niÅž wÄÅžsze zabezpieczenie by to umoÅžliwiÅo.
WÅasny diagram firmy przedstawiajÄ cy zmianÄ pokazuje granicÄ klasyfikatora, ktÃģra przesuwa siÄ, aby dopuÅciÄ ÅžÄ dania, ktÃģre wczeÅniej byÅy pochwycone w samookreÅlonym marginesie bezpieczeÅstwa â zawartoÅÄ, ktÃģrÄ Anthropic ocenia jako bardzo prawdopodobnie nieszkodliwÄ , ale zablokowanÄ ze wzglÄdÃģw ostroÅžnoÅci. WczeÅniejsze pisanie firmy na temat tego samego podejÅcia w dziedzinie cyberbezpieczeÅstwa opisuje podobnÄ napiÄcie miÄdzy szerokim zasiÄgiem a wytrzymaÅoÅciÄ na wyÅamanie â stawkami, ktÃģrych Unite.AI opisywaÅ, gdy modele Claude bez tych zabezpieczeÅ zamieniÅy benchmark cybernetyczny w trzy prawdziwe wÅamania.
Kompromis, ktÃģry Anthropic teraz zarzÄ dza publicznie
OgÅoszenie jest dokumentem zarzÄ dzania tak samo jak notatkÄ produktowÄ . Anthropic uruchomiÅ Fable 5 z prawie wszystkimi zapytaniami biologicznymi zablokowanymi, zaabsorbowanymi tygodniami faÅszywie pozytywnych w kosztach szybkiego wydania ogÃģlnego, i teraz publikuje zmierzone wyniki zawÄÅženia tego bloku â w tym redukcje przekierowaÅ na powierzchni, ktÃģre dajÄ zewnÄtrznym obserwatorom konkretnÄ bazÄ dla nastÄpnej rewizji. PozostaÅe ograniczenia leÅžÄ tam, gdzie firma twierdzi, Åže rzeczywiste ryzyko leÅžy: profesjonalne badania wielozadaniowe pozostajÄ za fallbackami Opus 5, dopÃģki zaufane ÅcieÅžki dostÄpu, ktÃģre Anthropic rozwija od czerwca dla zweryfikowanych badaczy biologii, nie przejmÄ tego ruchu.
Firma uznaje, Åže pozostaÅe faÅszywie pozytywne bÄdÄ pozostawaÄ wewnÄ trz marginesu bezpieczeÅstwa i mÃģwi, Åže ulepszanie zabezpieczeÅ jest kontynuowane. To, co napisaÅa w zwiÄ zku z aktualizacjÄ 7 sierpnia, to mierzalna definicja postÄpu: stawki fallback, ktÃģre bÄdÄ teraz oceniane.












