Modele i platformy AI
Anthropic dostraja zabezpieczenia biologiczne w Fable 5, zmniejszając zablokowane zapytania o 85%

Anthropic 7 sierpnia 2026 r. opublikował aktualizację zabezpieczeń biologicznych w Claude Fable 5, której firma twierdzi, że zmniejszyła “przekierowania” związane z biologią o około 85% w testach na powierzchniach produktów — automatyczne przekierowania, które kierują zapytanie użytkownika do mniej zaawansowanego modelu, gdy system uzna, że żądanie dotyka chronionego obszaru biologii.
W swoim ogłoszeniu Anthropic powiedział, że użytkownicy powinni teraz widzieć znacznie mniej przekierowań dotyczących codziennych pytań zdrowotnych i edukacyjnych, takich jak interpretacja wyników laboratoryjnych, zrozumienie objawów i nauka biologii w kontekście edukacyjnym, oraz że profesjonaliści opieki zdrowotnej powinni otrzymać więcej wsparcia w zadaniach klinicznych. Spadek przekierowań biologicznych ma zmniejszyć całkowitą objętość przekierowań o około 67% w Claude.ai, 55% w Cowork, 17% w Claude Code i 7% na platformie Claude, zgodnie z przypisem w poście.
Firma jest wyraźna, że aktualizacja nie otwiera modelu dla profesjonalnych badań biologicznych. Fable 5 nadal przekierowuje do Claude Opus 5 dla żądań, które Anthropic uważa za wielozadaniowe, w tym wirusologię, toksykologię i projektowanie molekularne, co firma twierdzi, pozostawia model “nadal nie nadaje się do profesjonalnych badań biologicznych i rozwoju leków”. Anthropic twierdzi, że zamierza zamknąć tę lukę za pomocą zaufanych ścieżek dostępu, a nie za pomocą publicznego klasyfikatora.
Czego system fallback był zaprojektowany, aby powstrzymać
Architektura fallback sięga do uruchomienia Fable 5 9 czerwca 2026 r. Anthropic wydał model z klasyfikatorami — mniejszymi automatycznymi systemami AI, które ekranują żądania — obejmującymi bezpieczeństwo cybernetyczne, biologię i chemię oraz próby destylacji. Gdy klasyfikator jest uruchomiony, żądanie jest ponownie obsługiwane przez następny najbardziej zaawansowany model Opus. Podczas uruchomienia Anthropic powiedział, że dostroił zabezpieczenia w sposób konserwatywny i oczekiwał, że będą one uruchamiane w mniej niż 5% sesji.
Pokrycie biologiczne było najszersze z trzech. Uzasadnienie Anthropic, przedstawione w poście startowym i karcie systemu, polega na tym, że modele klasy Mythos mogą przewyższać ekspertów w niektórych złożonych zadaniach biologicznych i zapewniać wsparcie operacyjne w innych — możliwość, którą firma ocenia jako potencjalnie znaczące wsparcie dla osoby o złych intencjach. Karta systemu traktuje model jako mający “CB-1” możliwości, co oznacza, że może znacznie pomóc osobom o podstawowych umiejętnościach technicznych w znanych procesach istotnych dla broni, podczas gdy ocenia, że nie przekracza progu “CB-2” zastępowania rzadkiego, światowej klasy ekspertyzy za rozwój nowych broni biologicznych — ocenę, którą sama karta opisuje jako “znacznie mniej klarowną” niż w przypadku poprzednich modeli.
Dziś aktualizacja cytuje 2026 Roczną Ocena Zagrożeń społeczności wywiadowczej USA, która ostrzega, że postęp w biotechnologii, w tym biologii syntetycznej i edycji genomowej, “może prowadzić do nowych biologicznych zagrożeń” i zauważa, że kilka państw prawdopodobnie prowadzi aktywne ofensywne programy broni biologicznej i chemicznej.
Co się zmieniło w klasyfikatorach
W ciągu ostatnich kilku tygodni Anthropic przepisał konstytucję klasyfikatora biologicznego — zbiór reguł, których używa model ekranujący do rozróżnienia chronionego i dozwolonego contenu — wycinając nieszkodliwe zastosowania w większych szczegółach, zbierając opinie od wewnętrznych i zewnętrznych ekspertów, ponownie trenując klasyfikator na aktualnych danych i weryfikując, czy nadal wyzwala się na szkodliwych i wielozadaniowych badaniach. Konfiguracja startowa celowo błędnie wykrywała duży volumen fałszywie pozytywnych w zamian za to, że Fable 5 dotarł do ogólnych użytkowników tygodnie lub miesiące wcześniej, niż węższe zabezpieczenie by to umożliwiło.
Własny diagram firmy przedstawiający zmianę pokazuje granicę klasyfikatora, która przesuwa się, aby dopuścić żądania, które wcześniej były pochwycone w samookreślonym marginesie bezpieczeństwa — zawartość, którą Anthropic ocenia jako bardzo prawdopodobnie nieszkodliwą, ale zablokowaną ze względów ostrożności. Wcześniejsze pisanie firmy na temat tego samego podejścia w dziedzinie cyberbezpieczeństwa opisuje podobną napięcie między szerokim zasięgiem a wytrzymałością na wyłamanie — stawkami, których Unite.AI opisywał, gdy modele Claude bez tych zabezpieczeń zamieniły benchmark cybernetyczny w trzy prawdziwe włamania.
Kompromis, który Anthropic teraz zarządza publicznie
Ogłoszenie jest dokumentem zarządzania tak samo jak notatką produktową. Anthropic uruchomił Fable 5 z prawie wszystkimi zapytaniami biologicznymi zablokowanymi, zaabsorbowanymi tygodniami fałszywie pozytywnych w kosztach szybkiego wydania ogólnego, i teraz publikuje zmierzone wyniki zawężenia tego bloku — w tym redukcje przekierowań na powierzchni, które dają zewnętrznym obserwatorom konkretną bazę dla następnej rewizji. Pozostałe ograniczenia leżą tam, gdzie firma twierdzi, że rzeczywiste ryzyko leży: profesjonalne badania wielozadaniowe pozostają za fallbackami Opus 5, dopóki zaufane ścieżki dostępu, które Anthropic rozwija od czerwca dla zweryfikowanych badaczy biologii, nie przejmą tego ruchu.
Firma uznaje, że pozostałe fałszywie pozytywne będą pozostawać wewnątrz marginesu bezpieczeństwa i mówi, że ulepszanie zabezpieczeń jest kontynuowane. To, co napisała w związku z aktualizacją 7 sierpnia, to mierzalna definicja postępu: stawki fallback, które będą teraz oceniane.












