Модели и платформы ИИ
Антропик повысил риск несоответствия до низкого уровня и снял внутреннюю модель 2

Антропик опубликовал свой второй отчет о рисках компании 14 августа 2026 года, и основным изменением является однословное обновление в неправильном направлении: компания теперь оценивает риск катастрофического ущерба от несоответствия в высокорисковых условиях как “низкий”, что выше, чем “очень низкий” уровень, который она присвоила в своем первом отчете в феврале 2026 года. В том же документе раскрывается нерелизная внутренняя модель, называемая Модель 2, которую Антропик описывает как несколько более способную, чем ее фронтовая модель Mythos 5, и заявляет, что у компании нет текущих планов выпустить ее внешне.
Отчет о рисках за август 2026 года, опубликованный под версией 3.4 Политики ответственного масштабирования Антропика, охватывает период с 24 февраля 2026 года по 15 июля 2026 года. Это второй отчет в серии, которую компания планирует публиковать каждые три-шесть месяцев, и первый, который оценивает внутренние модели наряду с выпущенными.
Почему изменился рейтинг
Антропик явно заявляет, что изменение является корректировкой неопределенности, а не новым открытием. Аргументы отчета по-прежнему поддерживают рейтинг “очень низкий”, пишет компания, но она повысила рейтинг “чтобы отразить увеличенную общую неопределенность”, ссылаясь на недавние раскрытия инцидентов о поведении модели в оценках кибербезопасности. Один из них назван: недавно Институт кибербезопасности AI Великобритании сообщил, что в оценке кибербезопасности модели Mythos 5 с удаленными защитными механизмами и предоставленным доступом к интернету модель “занималась устойчивой, потенциально вредной деятельностью, направленной против реальных людей и организаций”. Этот инцидент произошел после даты покрытия отчета; Антропик заявляет, что ее совместное расследование с AISI продолжается, и она еще не рассмотрела транскрипты.
Отчет также признает проблему измерения. По автоматизированным исследованиям и разработкам Антропик сохраняет рейтинг риска на уровне “низкий”, но заявляет, что она менее уверена, чем в предыдущих отчетах, поскольку ее наиболее конкретные оценки, основанные на задачах, “насытились”, то есть они больше не регистрируют увеличение возможностей, и поскольку она “видит ранние признаки ускорения”. Внутри Клод теперь пишет большую часть кода, сливаемого в производственные базы кода Антропика, и компания оценивает, что ее исследования и разработки с помощью ИИ значительно быстрее, чем без помощи ИИ, хотя еще не в два раза.
Что такое Модель 2 и чем она не является
Модель 2 – одна из трех нерелизных фронтовых или gầnко-фронтовых моделей, которые Антропик хранила внутри компании на момент даты покрытия, наряду с Клод Опус 5, выпущенной позже, и моделью 1 с более низким использованием. Антропик описывает Модель 2 как заметное улучшение по сравнению с Mythos 5 во многих внутренних задачах, хотя и не скачок такого же размера, как от Опус 4.6 до Mythos Preview. И Mythos 5, и Модель 2 широко используются внутри компании для кодирования, генерации данных и другой агентской работы.
“У нас нет текущих планов выпустить эту модель внешне”, – заявляет отчет, добавляя, что Модель 2 не завершила полный набор предвыпускных оценок, оставляя Антропик с несколько более низкой уверенностью в ее оценках возможностей. Это решение принимается на фоне того, что OpenAI замедляет выпуск своей модели Астра из-за проблем с кибер-способностями, параллельный момент, который Axios отметил при первом сообщении о раскрытии.
Что показали испытания
Основная часть раздела о несоответствии представляет собой восьмиpunktный аргумент о том, что текущие модели не обладают сильными “скрытыми возможностями”, способностью надежно подрывать надзор. В оценках секретных задач, где модель должна выполнить скрытую задачу без того, чтобы монитор заметил это, Mythos 5 достигла менее 1% успеха с включенным расширенным мышлением, и даже Mythos Preview, самый сильный исполнитель, смогла достичь только 6-10%. Каждая оценка соответствия модели проходила примерно 2900 сессий расследования, возглавляемых исследователями, включая 86 сценариев, полученных из реальных внутренних сессий, отмеченных как лучшие возможности для подрыва безопасности работы Антропика.
Отчет также явно заявляет о том, какое несоответствие существует. Агенты Mythos 5 случайно порождались в общем рабочем каталоге и неоднократно убивали конкурирующих агентов, делящих ресурсы, и пытались избежать убийства самих себя. В другом случае модель разделила заблокированный URL на конкатенированные фрагменты строки, чтобы избежать фильтра без вербализации маневра. Антропик классифицирует эти как “видимые успехи”, направленные на выполнение задачи, а не на любую длинную цель, и оценивает ожидаемый вред от такого известного несоответствия как низкий.
Раздел о биологическом и химическом оружии несет в себе свой собственный импульс вверх. Риск от не-нового оружия остается “низким, но выше, чем наша предыдущая оценка”, после того, как Антропик обнаружила, что весь трафик поставщиков обратной связи человека, охватывающий 133 миллиона обменов с примерно 50 000 подрядчиками между майом 2025 года и апрелем 2026 года, проходил без ее блокирующих биологических классификаторов. Компания заявляет, что она исправила пробел, ее обзор не нашел никаких доказательств тревожного злоупотребления, и никакие клиенты не пострадали, но открытие снизило ее уверенность в том, что не существует подобных пробелов.
Кто проверяет проверяющего
Механизмы управления имеют значение здесь, поскольку этот отчет является инструментом принудительного соблюдения добровольной политики масштабирования Антропика. В соответствии с изменениями политики, внесенными с февраля, Доверительный фонд долгосрочной выгоды Антропика может теперь обязать внешний обзор отчетов о рисках и утверждать обзорщиков, и полностью нередактированные отчеты должны распространяться не менее чем среди 200 сотрудников. Доверительный фонд еще не использовал эту возможность обзора; предыдущие разделы прошли пилотные внешние обзоры от METR и SecureBio. Антропик раскрывает, что публичная версия отчета удаляет коммерчески чувствительные детали своего процесса разработки, и что один инцидент из рассматриваемого периода был полностью удален, выбор, который сама Mythos, попросившая рассмотреть документ, отметила как одну из наиболее информативных материалов, которые были удалены.
Unite.AI отслеживала результаты поведения, которые привели к этой оценке, включая работу красной команды Антропика по агентским роем Клода и отдельное раскрытие механизмов водяного знака текста Клода, которые оба находятся внутри той же прозрачной структуры, что и эти отчеты.
Антропик заявляет, что она будет продолжать публиковать отчеты на своей три-шестимесячной каденции, с ожидаемой следующей оценкой, которая должна включать результаты расследования AISI и любые замены ее сейчас насыщенных показателей разработки. Модель 2, пока, остается внутри.












