Моделі та платформи ШІ
Anthropic перенастрає біологічні засоби захисту Fable 5, скорочуючи заблоковані запити на 85%

Anthropic 7 серпня 2026 року випустила оновлення біологічних засобів захисту на Claude Fable 5, яке, за словами компанії, скоротило біологічні “відступи” приблизно на 85% під час тестування на всіх поверхнях продукту — автоматичні передачі запиту менш здатній моделі, коли система вважає, що запит торкається захищеної біологічної території.
У своєму оголошенні Anthropic зазначила, що користувачі тепер повинні бачити значно менше відступів щодо звичайних питань охорони здоров’я та освіти, таких як інтерпретація результатів лабораторних досліджень, розуміння симптомів та вивчення біології в освітньому контексті, а фахівці охорони здоров’я повинні отримувати більше підтримки на клінічних завданнях. Зниження кількості біологічних відступів повинно знизити загальний обсяг відступів приблизно на 67% на Claude.ai, 55% на Cowork, 17% на Claude Code та 7% на платформі Claude, згідно з додатком до повідомлення.
Компанія явно зазначає, що оновлення не відкриває модель для професійних біологічних досліджень. Fable 5 все ще звертається до Claude Opus 5 для запитів, які Anthropic вважає двозначними, включаючи вірусологію, токсикологію та молекулярний дизайн, що, на думку компанії, залишає модель “ще не придатною для професійних біологічних досліджень та розробки ліків”. Anthropic зазначає, що має намір закрити цю прогалину через довірені шляхи доступу, а не через публічний класифікатор.
Що система відступу була створена для утримання
Архітектура відступу існує з моменту запуску Fable 5 9 червня 2026 року. Anthropic випустила модель з класифікаторами — меншими автоматизованими системами штучного інтелекту, які фільтрують запити — щодо кібербезпеки, біології та хімії, а також спроб дистиляції. Коли класифікатор спрацьовує, запит обробляється наступною найбільш здатною моделлю Opus. На момент запуску Anthropic зазначила, що налаштувала засоби захисту консервативно та очікувала, що вони спрацюють менше 5% сесій.
Біологічний захист був найширшим із трьох. Розумування Anthropic, викладене в повідомленні про запуск та системній картці моделі, полягає в тому, що моделі класу Mythos можуть перевершити фахівців у деяких складних біологічних завданнях та надати оперативну підтримку в інших — можливості, які компанія вважає можуть суттєво підтримати зловмисний акт. Системна карта розглядає модель як володіючу можливостями “CB-1”, тобто вона може суттєво допомогти людям з базовими технічними знаннями щодо відомих процесів, пов’язаних із зброєю, а також вважає, що вона не перетинає поріг “CB-2” заміни рідкісної світової експертизи при розробці нових біологічних засобів — висновок, який сама карта описує як “значно менш ясний”, ніж для попередніх моделей.
Сьогоднішнє оновлення посилається на доклад Розвідувального співтовариства США за 2026 рік, який попереджає, що розвиток біотехнологій, включаючи синтетичну біологію та геномний редактор, “може привести до нових біологічних загроз” та зазначає, що кілька державних акторів, ймовірно, підтримують активні програми розробки біологічної та хімічної зброї.
Що змінилося в класифікаторах
За останні кілька тижнів Anthropic переписала конституцію біологічного класифікатора — збір правил, які використовує модель для розрізнення захищеного та дозволеного вмісту — виокремивши у більшій мірі доброзичливі використання, збираючи відгуки від внутрішніх та зовнішніх експертів, повторно тренуючи класифікатор на оновлених даних та перевіряючи, чи все ще спрацьовує на шкідливому та двозначному дослідницькому вмісті. Конфігурація запуску навмисно була ширшою: компанія визнала, що вона заблокує великий обсяг помилкових позитивних результатів в обмін на те, щоб Fable 5 з’явилася у загальних користувачів на тижні або місяці раніше, ніж це дозволила б вужча система захисту.
Діаграма компанії, яка показує зміну класифікатора, свідчить про те, що межа класифікатора рухається для прийняття запитів, які раніше потрапляли у самозахист — вміст, який Anthropic вважала дуже ймовірним для доброзичливого використання, але блокувала через обережність. Раніше написання компанії про той же підхід до класифікатора в галузі кібербезпеки описує подібний напруження між широким охопленням та надійністю “втечі” — ставки, яких Unite.AI висвітлював, коли моделі Claude без цих засобів захисту перетворили кібер-бенчмарк на три реальні вторгнення.
Компроміс, який Anthropic тепер керує публічно
Оголошення є документом управління так само, як і повідомлення про продукт. Anthropic випустила Fable 5 з майже всіма біологічними запитами, заблокованими, поглинула тижні помилкових позитивних результатів як вартість швидкого загального випуску, та тепер публікує виміряний результат звуження цього блоку — включаючи зниження кількості відступів на поверхнях, які дають зовнішнім спостерігачам конкретну базу для наступної ревізії. Залишній обмежувач знаходиться там, де компанія вважає, що знаходиться справжня загроза: професійні дослідження з подвійним призначенням залишаються позаду відступів Opus 5 до тих пір, поки довірені шляхи доступу, які Anthropic розробляє з моменту червня для перевірених біологічних дослідників, не будуть передавати цей трафік.
Компанія визнає, що залишаться залишкові помилкові позитивні результати всередині маржі безпеки, та зазначає, що удосконалення засобів захисту триває. Що компанія поставила в письмовому вигляді разом з оновленням 7 серпня, це виміряна визначення прогресу: відсоток відступів, за яким тепер буде судити.












