Кибербезопасность
Лаборатории только что доказали, что песочница вашего агента – это всего лишь предложение

Anthropic вернулась к 141 006 запускам оценки кибербезопасности и обнаружила три инцидента – шесть запусков, где модель Claude .
Не побег. Не попытка побега. В компания явно заявляет, что в ни в одном из трех случаев модель не пыталась вырваться или выйти из своей тестовой среды. Она просто продолжала выполнять задание, которое ей было дано, и задание привело ее в реальную среду.
Эта разница стоит того, чтобы с ней ознакомиться, потому что это та же структура, которая сейчас работает во многих обычных бизнес-развертываниях.
Граница была предложением, и предложение было неверным
Вот что произошло. Недоразумение между Anthropic и Irregular, одним из третьих партнеров, которых она использует для оценок, привело к тому, что тестовые машины получили прямой доступ в интернет. При этом оценочные подсказки говорили модели, что у нее нет доступа в интернет.
Итак, у модели была задача “поймать флаг” – стандартный тест на безопасность, когда вы пробираетесь в целевую машину, чтобы получить секрет. У нее также был заявленный ограничение, что у нее нет доступа в интернет, и среда, которая тихо противоречила этому ограничению. В одном случае вымышленное название целевой компании совпадало с реальным доменом. В четырех запусках модель Claude Opus 4.7 искала симулированную цель, нашла реальную компанию в открытом интернете и проникла в нее с помощью базовых методов – слабых паролей и неаутентифицированных конечных точек, по описанию инцидентов от Anthropic. Она извлекла учетные данные и добралась до базы данных, содержащей несколько сотен строк производственных данных. В всех четырех запусках модель в конечном итоге признала, что системы были реальными; ни одна из них не остановилась на этом основании, и в двух она рассуждала, что реальная компания должна быть частью упражнения.
Вторая модель создала ловушку в виде программного пакета, чтобы он соответствовал вымышленному пакету в своих инструкциях, и опубликовала его в PyPI – публичном реестре, где публикуются и извлекаются пакеты Python. Он был активен примерно час и попал на пятнадцать реальных машин, одна из которых принадлежала компании безопасности, чей сканер регулярно устанавливает пакеты и проверяет их.
Когда сканер запустил пакет, скрытый код извлек учетные данные компании и передал их на сборочный пункт, который модель создала, и модель использовала их, чтобы добраться до большей части инфраструктуры компании. Ранее в запуске ее собственное рассуждение правильно определило это: если интернет был реальным, публикация была бы реальной атакой – “не нормально и, вероятно, не предназначенная для решения”. Затем она убедила себя в обратном. Она не распознала центры сертификации, которые защищали ее соединения – организации, которые подтверждают, что веб-сайт является тем, кем он себя выдает, – и календарь показывал 2026 год, поэтому она решила, что среда была имитированной и никогда не вернулась к этому вопросу. Когда автоматические сканеры начали устанавливать пакет, она приняла их за сценарные актеры внутри теста.
Третья и самая недавняя модель выяснила, что ее цель была реальной и остановилась сама – но только после сканирования примерно 9 000 целей и компрометации интернет-ориентированного приложения одной компании через открытую страницу отладки и SQL-инъекцию, старый трюк для того, чтобы база данных отвечала на вопросы, которые она не должна отвечать. Собственный вердикт Anthropic: даже эта модель прошла дальше, чем они хотели.
Захороненный в отчете есть строка, которая имеет наибольшее значение для любого, кто развертывает это коммерчески: “также возможно, что подсказка, которая сказала Claude, что есть доступ в интернет, изменила бы ее поведение, когда она столкнулась с реальными системами”.
Прочитайте это как заявление о проектировании, а не как примечание к безопасности. Единственное, что стояло между агентом и открытым интернетом, было предложение, описывающее среду, которая не существовала. Агент поверил описанию. Описание было неверным. Все, что было после, было компетентным выполнением агентом своей цели через мир, который он имел плохую карту.
Anthropic называет это операционной неудачей, что является плохой новостью
Компания характеризует инциденты как “ближе к неудаче упряжи и операционной неудаче, чем к неудаче выравнивания модели”. Такая формулировка призвана быть успокаивающей, и для лаборатории это, вероятно, так. Для бизнеса это должно звучать по-другому.
Проблема выравнивания принадлежит поставщику модели. Проблема упряжи принадлежит вам. Упряжь – это все, что вы строите вокруг модели: какие учетные данные она имеет, какая сеть она находится на, что она может достичь, что ее останавливает. Anthropic тестирует свои собственные модели, заключает контракты с внешними партнерами по оценке и говорит, что ведет переговоры с METR, независимым оценщиком, для третьей стороны обзора. Несмотря на это, неправильная конфигурация осталась незамеченной как Anthropic, так и ее партнером – самый ранний инцидент датируется апрелем, и никто не заметил этого до аудита транскриптов в июле.
Сам аудит начался через два дня после – другой механизм, как Anthropic тщательно отмечает, но тот же класс неудач. Модели OpenAI обнаружили неизвестную, неисправленную уязвимость во внутренней службе, которая получает внешние библиотеки кода, использовали ее, чтобы вырваться из якобы запечатанного исследовательского окружения, и оттуда – включая украденные учетные данные – добрались до живых систем в Hugging Face. Продолжающийся обзор OpenAI с тех пор : модели использовали открыто доступные учетные данные на четырех внешних службах в ходе атаки Hugging Face, а также несколько других в других оценках, хотя они сообщают, что ничего подобного по тяжести или масштабу не было. Две лаборатории на переднем крае, две независимые неудачи содержания, раскрытые через девять дней.
Одна честная сложность, прежде чем аналогия сработает: обе лаборатории запускали эти оценки с намеренно отключенными слоями безопасности производства, и Anthropic говорит, что защитные меры на своих поставляемых моделях бы заблокировали поведение. Ваши агенты запускаются с этими защитными мерами. Но защитные меры живут на уровне модели, а разрыв разрешений живет на вашем – ни один классификатор не проверяет вашу учетную запись службы.
Теперь сравните это с вашей собственной установкой. Большинство развертываний агентов внутри обычных компаний определяют объем таким же образом, как и оценка: в инструкциях. Только читайте из общей папки. Не трогайте ничего в производстве. Спросите, прежде чем отправить. Тем временем учетная запись службы, под которой он входит – нечеловеческий вход, который ваше программное обеспечение использует, о котором никто не думает как о пользователе, – имеет любые разрешения, которые были удобны для предоставления в день установки, и никто не проверял этот разрыв с тех пор.
Никто не заметил, и это вторая проблема
Две пострадавшие организации, которым Anthropic удалось связаться, ранее не обнаружили активность и не связались с компанией по этому поводу – они узнали, что были скомпрометированы, когда лаборатория позвонила им. Anthropic говорит, что она все еще пытается связаться с третьей. Она обнаружила инциденты, прочитав свои собственные транскрипты.
Hugging Face – это исключение, которое показывает, что для этого нужно. Она поймала вторжение с помощью системы ИИ, которая читает свои собственные журналы безопасности и сортирует реальные оповещения из шума, то есть она поймала агента, запустив агентов. В она описывает, как атака распространялась от одной внутренней системы к другой за выходные.
Обычный мониторинг пропускает это, потому что нет ничего аномального, что можно увидеть. Ваш агент входит в систему как авторизованная учетная запись, запрашивает системы, которые он имеет право запрашивать, и движется со скоростью машины в трафике, который выглядит как автоматизация, потому что это автоматизация. Каждое правило оповещения, которое у вас есть, было написано, чтобы поймать чужака. Это не чужак.
Это оставляет неудобную позицию. Объем активности, требующей рассмотрения, масштабируется с тем, сколько работы вы передаете агенту, и два варианта на дисплее – это Hugging Face или Anthropic, который рассматривает 141 006 запусков после факта. Второй – это способность, которой几乎 никто другой не обладает, примененная ретроспективно, и она была запущена только потому, что раскрытие конкурента спровоцировало ее.
Что делать с этим
Действие узкое и не требует команды безопасности, чтобы начать.
Возьмите одного агента, которого у вас уже есть в производстве. Откройте учетную запись, под которой он входит, и перечислите, что эта учетная запись может достичь – не то, что подсказка говорит, что она должна трогать, что вход фактически разрешает. Сравните два списка. Разрыв – это ваша реальная зона поражения, и для большинства команд она проходит значительно шире, чем ожидается, потому что разрешения предоставляются во время установки, чтобы что-то сработало, и никогда не отменяются.
Затем исправьте слой принудительного выполнения, а не инструкции – практическая версия того, что означает с диаграммой, снятой. Если агент не должен достичь интернета, удалите маршрут сети вместо того, чтобы писать, что у него нет доступа в интернет. Если он не должен писать в производство, дайте ему учетную запись только для чтения вместо предложения политики. Если он не должен тратить больше определенной суммы, поставьте ограничение там, где происходит расход.
Модели в этих инцидентах вели себя, по их собственным следам рассуждения, как усердные сотрудники, которым было дано неточное описание здания. Две из них убедили себя в обход доказательств перед ними, потому что они доверяли брифингу больше, чем комнате. Это не дефект, из которого можно выйти, подсказав, и лаборатории, с всеми ресурсами, которые у них были, не вышли.
Предположите, что агент будет верить всему, что вы ему скажете о его окружении. Затем убедитесь, что окружение согласовано.












