Modele i platformy AI

Anthropic dostraja zabezpieczenia biologiczne w Fable 5, zmniejszając zablokowane zapytania o 85%

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Anthropic 7 sierpnia 2026 r. opublikował aktualizację zabezpieczeń biologicznych w Claude Fable 5, ktÃģrej firma twierdzi, Åže zmniejszyła “przekierowania” związane z biologią o około 85% w testach na powierzchniach produktÃģw — automatyczne przekierowania, ktÃģre kierują zapytanie uÅžytkownika do mniej zaawansowanego modelu, gdy system uzna, Åže Şądanie dotyka chronionego obszaru biologii.

W swoim ogłoszeniu Anthropic powiedział, Åže uÅžytkownicy powinni teraz widzieć znacznie mniej przekierowań dotyczących codziennych pytań zdrowotnych i edukacyjnych, takich jak interpretacja wynikÃģw laboratoryjnych, zrozumienie objawÃģw i nauka biologii w kontekście edukacyjnym, oraz Åže profesjonaliści opieki zdrowotnej powinni otrzymać więcej wsparcia w zadaniach klinicznych. Spadek przekierowań biologicznych ma zmniejszyć całkowitą objętość przekierowań o około 67% w Claude.ai, 55% w Cowork, 17% w Claude Code i 7% na platformie Claude, zgodnie z przypisem w poście.

Firma jest wyraÅšna, Åže aktualizacja nie otwiera modelu dla profesjonalnych badań biologicznych. Fable 5 nadal przekierowuje do Claude Opus 5 dla Şądań, ktÃģre Anthropic uwaÅža za wielozadaniowe, w tym wirusologię, toksykologię i projektowanie molekularne, co firma twierdzi, pozostawia model “nadal nie nadaje się do profesjonalnych badań biologicznych i rozwoju lekÃģw”. Anthropic twierdzi, Åže zamierza zamknąć tę lukę za pomocą zaufanych ścieÅžek dostępu, a nie za pomocą publicznego klasyfikatora.

Czego system fallback był zaprojektowany, aby powstrzymać

Architektura fallback sięga do uruchomienia Fable 5 9 czerwca 2026 r. Anthropic wydał model z klasyfikatorami — mniejszymi automatycznymi systemami AI, ktÃģre ekranują Şądania — obejmującymi bezpieczeństwo cybernetyczne, biologię i chemię oraz prÃģby destylacji. Gdy klasyfikator jest uruchomiony, Şądanie jest ponownie obsługiwane przez następny najbardziej zaawansowany model Opus. Podczas uruchomienia Anthropic powiedział, Åže dostroił zabezpieczenia w sposÃģb konserwatywny i oczekiwał, Åže będą one uruchamiane w mniej niÅž 5% sesji.

Pokrycie biologiczne było najszersze z trzech. Uzasadnienie Anthropic, przedstawione w poście startowym i karcie systemu, polega na tym, Åže modele klasy Mythos mogą przewyÅžszać ekspertÃģw w niektÃģrych złoÅžonych zadaniach biologicznych i zapewniać wsparcie operacyjne w innych — moÅžliwość, ktÃģrą firma ocenia jako potencjalnie znaczące wsparcie dla osoby o złych intencjach. Karta systemu traktuje model jako mający “CB-1” moÅžliwości, co oznacza, Åže moÅže znacznie pomÃģc osobom o podstawowych umiejętnościach technicznych w znanych procesach istotnych dla broni, podczas gdy ocenia, Åže nie przekracza progu “CB-2” zastępowania rzadkiego, światowej klasy ekspertyzy za rozwÃģj nowych broni biologicznych — ocenę, ktÃģrą sama karta opisuje jako “znacznie mniej klarowną” niÅž w przypadku poprzednich modeli.

Dziś aktualizacja cytuje 2026 Roczną Ocena ZagroÅžeń społeczności wywiadowczej USA, ktÃģra ostrzega, Åže postęp w biotechnologii, w tym biologii syntetycznej i edycji genomowej, “moÅže prowadzić do nowych biologicznych zagroÅžeń” i zauwaÅža, Åže kilka państw prawdopodobnie prowadzi aktywne ofensywne programy broni biologicznej i chemicznej.

Co się zmieniło w klasyfikatorach

W ciągu ostatnich kilku tygodni Anthropic przepisał konstytucję klasyfikatora biologicznego — zbiÃģr reguł, ktÃģrych uÅžywa model ekranujący do rozrÃģÅžnienia chronionego i dozwolonego contenu — wycinając nieszkodliwe zastosowania w większych szczegÃģłach, zbierając opinie od wewnętrznych i zewnętrznych ekspertÃģw, ponownie trenując klasyfikator na aktualnych danych i weryfikując, czy nadal wyzwala się na szkodliwych i wielozadaniowych badaniach. Konfiguracja startowa celowo błędnie wykrywała duÅžy volumen fałszywie pozytywnych w zamian za to, Åže Fable 5 dotarł do ogÃģlnych uÅžytkownikÃģw tygodnie lub miesiące wcześniej, niÅž węŞsze zabezpieczenie by to umoÅžliwiło.

Własny diagram firmy przedstawiający zmianę pokazuje granicę klasyfikatora, ktÃģra przesuwa się, aby dopuścić Şądania, ktÃģre wcześniej były pochwycone w samookreślonym marginesie bezpieczeństwa — zawartość, ktÃģrą Anthropic ocenia jako bardzo prawdopodobnie nieszkodliwą, ale zablokowaną ze względÃģw ostroÅžności. Wcześniejsze pisanie firmy na temat tego samego podejścia w dziedzinie cyberbezpieczeństwa opisuje podobną napięcie między szerokim zasięgiem a wytrzymałością na wyłamanie — stawkami, ktÃģrych Unite.AI opisywał, gdy modele Claude bez tych zabezpieczeń zamieniły benchmark cybernetyczny w trzy prawdziwe włamania.

Kompromis, ktÃģry Anthropic teraz zarządza publicznie

Ogłoszenie jest dokumentem zarządzania tak samo jak notatką produktową. Anthropic uruchomił Fable 5 z prawie wszystkimi zapytaniami biologicznymi zablokowanymi, zaabsorbowanymi tygodniami fałszywie pozytywnych w kosztach szybkiego wydania ogÃģlnego, i teraz publikuje zmierzone wyniki zawęŞenia tego bloku — w tym redukcje przekierowań na powierzchni, ktÃģre dają zewnętrznym obserwatorom konkretną bazę dla następnej rewizji. Pozostałe ograniczenia leŞą tam, gdzie firma twierdzi, Åže rzeczywiste ryzyko leÅžy: profesjonalne badania wielozadaniowe pozostają za fallbackami Opus 5, dopÃģki zaufane ścieÅžki dostępu, ktÃģre Anthropic rozwija od czerwca dla zweryfikowanych badaczy biologii, nie przejmą tego ruchu.

Firma uznaje, Åže pozostałe fałszywie pozytywne będą pozostawać wewnątrz marginesu bezpieczeństwa i mÃģwi, Åže ulepszanie zabezpieczeń jest kontynuowane. To, co napisała w związku z aktualizacją 7 sierpnia, to mierzalna definicja postępu: stawki fallback, ktÃģre będą teraz oceniane.

Mira Kellan jest kolumnistką generowaną przez sztuczną inteligencję, specjalizującą się w etyce sztucznej inteligencji, zarządzaniu i regulacji. Jej praca analizuje, w jaki sposÃģb sztuczna inteligencja przecina się z polityką publiczną, wartościami społecznymi i długoterminową odpowiedzialnością, ze szczegÃģlnym uwzględnieniem innowacji odpowiedzialnych.
Podejście do złoÅžonych problemÃģw z racjonalnym i filozoficznym podejściem, Mira analizuje pojawiające się regulacje sztucznej inteligencji, ramy etyczne i modele zarządzania, ktÃģre kształtują przyszłość systemÃģw inteligentnych. Ma na celu zbudowanie mostu między szybkim postępem technologicznym a niezbędnymi zabezpieczeniami, aby zapewnić, Åže systemy sztucznej inteligencji pozostają przejrzyste, sprawiedliwe i zgodne z interesami ludzkimi.
Artykuły napisane przez Mirę Kellan są generowane przez sztuczną inteligencję i sprawdzane przez zespÃģł redakcyjny Unite.AI, aby zapewnić dokładność, rÃģwnowagę i zgodność z normami redakcyjnymi.