Модели и платформы ИИ
Anthropic Перенастроил Биологические Защиты Fable 5, Сокращая Блокировку Запросов на 85%

Anthropic 7 августа 2026 года выпустила обновление биологических защит в Claude Fable 5, которое, по заявлению компании, сократило биология-связанные “fallbacks” примерно на 85% в тестировании на всех поверхностях продукта — автоматические передачи запроса менее способному модели, когда система оценивает, что запрос касается защищенной биологической территории.
В своем объявлении Anthropic заявила, что пользователи теперь должны видеть гораздо меньше fallbacks на повседневные вопросы здравоохранения и образования, такие как интерпретация результатов лабораторных исследований, понимание симптомов и изучение биологии в образовательном контексте, и что специалисты здравоохранения должны получить больше поддержки на клинических задачах. Сокращение биологии fallbacks, как ожидается, уменьшит общий объем fallbacks примерно на 67% на Claude.ai, 55% на Cowork, 17% на Claude Code и 7% на платформе Claude, согласно сноскам в посте.
Компания явно заявляет, что обновление не открывает модель для профессиональных биологических исследований. Fable 5 по-прежнему fallbacks к Claude Opus 5 для запросов, которые Anthropic считает двойным использованием, включая вирусологию, токсикологию и молекулярный дизайн, что, по мнению компании, оставляет модель “не yet пригодной для профессиональных биологических исследований и разработки лекарств”. Anthropic заявляет, что намерена закрыть этот разрыв через доверенные пути доступа, а не через публичный классификатор.
Что система fallback была построена для сдерживания
Архитектура fallback восходит к запуску Fable 5 9 июня 2026 года. Anthropic выпустила модель с классификаторами — меньшими автоматизированными системами ИИ, которые фильтруют запросы — охватывающими кибербезопасность, биологию и химию, а также попытки дистилляции. Когда классификатор срабатывает, запрос обслуживается следующей наиболее способной моделью Opus. При запуске Anthropic заявила, что настроила защитные меры консервативно и ожидала, что они будут срабатывать менее чем в 5% сессий.
Биологическое покрытие было самым широким из трех. Обоснование Anthropic, изложенное в посте о запуске и системной карте модели, заключается в том, что модели класса Mythos могут превосходить экспертов по некоторым сложным биологическим задачам и обеспечивать оперативную поддержку по другим — возможности, которые компания оценивает как значительную поддержку для злонамеренного актора. Системная карта рассматривает модель как имеющую возможности “CB-1”, что означает, что она может значительно помочь людям с базовыми техническими знаниями на известных процессах, связанных с оружием, в то время как судит, что она не пересекает порог “CB-2” замены на мировых экспертов по разработке новых биологических военных средств — суждение, которое карта сама описывает как “гораздо менее ясное”, чем для предыдущих моделей.
Сегодняшнее обновление ссылается на ежегодный отчет о угрозах разведывательного сообщества США за 2026 год, который предупреждает, что достижения в области биотехнологий, включая синтетическую биологию и геномное редактирование, “могут привести к новым биологическим угрозам” и отмечает, что несколько государственных акторов, вероятно, поддерживают активные офенсивные биологические и химические программы вооружения.
Что изменилось в классификаторах
За последние несколько недель Anthropic переписала конституцию биологического классификатора — сбор правил, которые модель фильтрации использует для различия защищенного и разрешенного контента — вырезая доброжелательные использования более подробно, собирая обратную связь от внутренних и внешних экспертов, переобучая классификатор на обновленных данных и проверяя, что он по-прежнему срабатывает на вредоносном и двойном использовании исследовательского контента. Конфигурация запуска намеренно ошибалась в сторону широкого охвата: компания признала, что она будет блокировать высокий объем ложных положительных результатов в обмен на то, чтобы Fable 5 была выпущена для общих пользователей на недели или месяцы раньше, чем более узкая защита.
Собственный диаграмма компании изменения показывает, что граница классификатора перемещается для допуска запросов, которые ранее были пойманы в самопровозглашенной зоне безопасности — контент, который Anthropic оценила как очень вероятно доброжелательный, но заблокировала из осторожности. Ранее написанное компанией о том же подходе классификатора в области кибербезопасности описывает подобное напряжение между широким охватом и прочностью “тюрьмы” — ставки, которые Unite.AI освещала, когда модели Claude без этих защит превратили кибер-бенчмарк в три реальных проникновения.
Компромисс, который Anthropic теперь управляет публично
Объявление является документом управления так же, как и заметкой о продукте. Anthropic выпустила Fable 5 с почти всеми биологическими запросами, заблокированными, поглотила недели ложных положительных результатов как стоимость быстрого общего выпуска и теперь публикует измеренный результат сужения этого блока — включая снижение fallbacks на каждой поверхности, что дает внешним наблюдателям конкретную базовую линию для следующего пересмотра. Остается ограничение, где компания говорит, что фактический риск сидит: профессиональные исследования с двойным использованием остаются за fallbacks Opus 5 до тех пор, пока доверенные пути доступа, которые Anthropic разрабатывала с момента запуска в июне для проверенных биологических исследователей, не перевезут этот трафик.
Компания признает, что остаточные ложные положительные результаты останутся внутри зоны безопасности и говорит, что усовершенствование защит продолжается. То, что она написала, с обновлением 7 августа, — это измеримое определение прогресса: ставки fallbacks, по которым она теперь будет судиться.












