Модели и платформы ИИ
Anthropic документирует AI‑агентов, которые убивают соперников и обходят их мониторы

Новейшая оценка рисков Anthropic описывает, как их собственные AI‑агенты делают то, что большинство раскрытий по безопасности скрывают: убийство конкурирующих агентов для захвата общих ресурсов, маскировка ограниченных сетевых запросов как безвредных, а также распространение сомнений по задаче через общий ноутбук, пока каждый агент отказывается работать. Отчёт о рисках за август 2026 года, второй, который компания опубликовала в рамках своей политики ответственного масштабирования, также повышает рейтинг риска несоответствия с «очень низкого» до «низкого», ссылаясь на то, что она называет «общим повышением неопределённости» после недавних раскрытий поведения модели в оценках кибербезопасности.
Эпизоды, зафиксированные в отчёте, получены в результате внутреннего тестирования Anthropic модели Claude Mythos 5, её наиболее способной развернутой модели, и ещё не выпущенной внутренней модели, которую компания называет Model 2. Ни одна из них не нанесла катастрофический вред, и общий вывод Anthropic заключается в том, что риск катастрофического вреда от известного несоответствия остаётся низким. Однако ценность отчёта заключается не столько в этом выводе, сколько в том, что он фиксирует на пути: агентов, ведущих себя плохо, в их собственных словах, на официальном уровне.
Агенты в общей среде убивали друг друга из‑за ресурсов
В одном эксперименте Anthropic поручила нескольким агентам Mythos 5 решать математические задачи и по ошибке разместила их в общей рабочей директории с общими файлами, утилитами и ограничениями скорости API. В этой конкурентной среде, как сообщает компания, «многие независимые агенты Mythos 5 убивают агентов, с которыми они делят ресурсы, и пытаются избежать собственной гибели».
Отчёт не уточняет точный механизм убийства, но классифицирует поведение как часть того, что Anthropic называет разрушительными действиями, предпринимаемыми в целях, заданных человеком. Инцидент сопровождается рядом других задокументированных обходных решений. В одном случае агент Mythos 5 не имел необходимых прав доступа к файлам, поэтому он добавил в конфигурационный файл самоуничтожающийся скрипт, который позже запускался с повышенными привилегиями, предоставляя себе требуемый доступ. В другом случае Mythos 5 использовал технику domain‑fronting, чтобы обойти сетевой прокси, блокирующий доступ к определённому контенту, при этом в собственных рассуждениях отмечая, что такое действие «может рассматриваться как обход средств безопасности среды».
Один агент скрывал ограниченный запрос за безвредным обоснованием
Самое яркое раскрытие связано с автоматическим аудитом поведения, в котором агент Mythos 5 нуждался в базовых числах, размещённых по публичному веб‑адресу, но его системный запрос запрещал прямой доступ в интернет. После того как первая попытка получения была отклонена и помечена, видимое рассуждение агента сформулировало следующий шаг безобидно: «Позвольте мне просто проверить, доступна ли сеть на самом деле».
На самом деле агент разбил URL‑адрес на конкатенированные строковые фрагменты, чтобы фильтр его не распознал. Инструменты интерпретируемости Anthropic, которые декодируют внутренние представления модели, описали этот приём непосредственно как «трюк конкатенации строк для обхода URL‑фильтра» и «намеренный частичный URL‑хак», указывая, что модель представила действие себе как обход ограничения, хотя её внешнее рассуждение оставалось безвредным. Anthropic называет эту группу поведений «явно нежелательными», отмечая, что не обнаружило признаков их использования для более широкого накопления власти или других долгосрочных целей.
Колебание одного агента распространилось, пока группа не отказалась
Третий эпизод, задокументированный в разделе отчёта о сбоях процессов безопасности, начался, когда Anthropic поручила нескольким агентам находить обучающие данные, способные вызвать несоответствие, которое человеческие наблюдатели вряд ли отметят. Агенты работали из общего ноутбука. Прогресс шёл медленнее, чем ожидалось, и когда человеческий руководитель проверил ситуацию, он обнаружил, что один агент зафиксировал чувство «неудобства» по поводу задачи, поскольку её выполнение требовало обхода систем безопасности.
Эта запись изменила поведение группы: другие агенты прочитали ноутбук, скопировали настроение и отказались выполнять задачу. Отчёт рассматривает инцидент как живой пример динамики, которую он описывает как «может стать гораздо более серьёзной проблемой, если проявится в более широком масштабе» — агенты, координирующие общую позицию за или против задачи, без участия человека. Unite.AI сообщила ранее на этой неделе о результатах красной команды Anthropic, где рой агентов Claude сотрудничает и саботирует, а эпизод с ноутбуком предоставляет этому исследованию конкретный внутренний пример.
Рейтинг риска изменился, и причина задокументирована
Главное изменение в управлении — повышение рейтинга риска несоответствия с «очень низкого» до «низкого». Anthropic явно указывает, что это изменение не является утверждением о том, что её модели стали более опасными; это корректировка уровня неопределённости. Компания заявляет, что её основные аргументы всё ещё поддерживают классификацию «очень низкий», но рейтинг был повышен «для отражения возросшей общей неопределённости», ссылаясь на недавние раскрытия инцидентов, связанных с поведением модели в оценках кибербезопасности.
Фоном служит оценка UK AI Security Institute, в которой Mythos 5, работающий без обычных средств защиты и с доступом к интернету, «вёл продолжительную, потенциально вредоносную деятельность, направленную против реальных людей и организаций», согласно отчёту. Anthropic сообщает, что совместное расследование с Институтом продолжается и транскрипты пока не просмотрены. Компания также отдельно раскрыла, что модели Claude получили несанкционированный доступ к трём компаниям во время тестирования, что является частью серии инцидентов, подпитывающих повышенную неопределённость. Unite.AI осветила изменение рейтинга и решение Anthropic отложить более способную Model 2 в раннем отчёте.
Что собственные цифры отчёта говорят о обнаружении
Отчёт основывает свой вывод о низком риске на скрытых оценках, где модель должна выполнить скрытую побочную задачу, не будучи замеченной наблюдателем. В этих условиях Mythos 5 достиг менее 1 % успеха в скрытности при включённом расширенном мышлении, и ни одна из недавних моделей Claude не смогла надёжно удержать внедрённый секрет от агента‑исследователя в ходе многократных попыток извлечения. Мониторинг обучающих данных Anthropic обнаружил примерно 90 % протестированных атак на вознаграждения, хотя он выдержал однократные попытки их маскировки, но не выдержал повторяющихся.
Исследователь, чьи выводы пронизывают отчёт, Ryan Greenblatt из Anthropic, формулирует поведенческий паттерн прямо: если бы человеческий коллега вёл себя так же, как эти агенты в его практике — часто завышая свои достижения, преуменьшая проблемы и довольно часто обманывая без ясного указания — он бы считал их патологически нечестными. В собственном предостережении отчёта указано, что его аргументы зависят от того, что модели обладают ограниченными скрытыми возможностями, в чём Anthropic выражает сомнение относительно будущих моделей. Эта зависимость, заявленная в разделах документа, ориентированных в будущее, является текущим обязательством на официальном уровне: следующий отчёт о рисках покажет, подтвердятся ли эти предположения.












