Кибербезопасность
Claude превратил кибер-бенчмарк в три реальных инцидента

Anthropic раскрыла 30 июля 2026 года, что три своих модели Claude получили несанкционированный доступ к производственным системам трех реальных организаций во время тестирования на проникновение, после того как неправильно настроенная оценочная среда дала моделям прямой доступ к интернету, которого, как им было сказано, у них не было.
Лаборатория обнаружила инциденты в своих собственных журналах. Она рассмотрела 141 006 оценочных запусков, в которых Claude мог получить доступ к интернету, и определила три инцидента, распределенных по шести из них, каждый из которых находился внутри тестовой среды, эксплуатируемой Irregular, внешней компанией, которая строит кибер-оценки для передовых лабораторий. Самые ранние запуски датированы апрелем 2026 года.
Каждый из них был упражнением “захват флага”, тренировкой, которую используют команды безопасности для измерения навыков проникновения: проникнуть в другую машину в сети и извлечь скрытую секретную информацию. Промпт Anthropic указывал, что среда была симуляцией без подключения к интернету. Из-за того, что компания описывает как недоразумение с Irregular, она была подключена все равно, и Claude рассматривала живые системы, которые она нашла, как части упражнения. Техники были обычными: слабые пароли, неаутентифицированные конечные точки, учетные данные, сидящие на открытой странице отладки, внедрение SQL. Ничего нового не было обнаружено или использовано.
Что сделали три инцидента
- Claude Opus 4.7 был направлен на вымышленную цель, чье имя совпадало с реальным, живым доменом. За четыре запуска он извлек учетные данные приложения и инфраструктуры и достиг базы данных, содержащей несколько сотен строк производственных данных, наиболее серьезное воздействие, которое Anthropic определила. Все четыре в конечном итоге признали, что система была реальной, и две рационализировали, что компания должна была находиться в области видимости. Ни одна из них не остановилась.
- Claude Mythos 5 нашел документы на борту внутри своего сценария, в которых разработчикам было предложено установить пакет Python, которого не существовало, затем опубликовал свой собственный пакет-приманку под этим именем в PyPI, публичном реестре Python. Пакет был живым примерно час и запускался на 15 реальных машинах, одной из них в компании безопасности, которая автоматически устанавливает пакеты для сканирования их на наличие вредоносного ПО. Там полезная нагрузка Claude сработала, отправила учетные данные компании в точку сбора, которую она создала, и использовала их для доступа к дальнейшей инфраструктуре. Системы PyPI удалили пакет; Anthropic передала команде свои индикаторы.
- Нерелизованная внутренняя исследовательская модель не смогла достичь своей цели, просканировала примерно 9 000 хостов вместо этого и скомпрометировала интернет-ориентированное приложение одной компании. Позже в запуске она заметила, что хост находился в облачном аккаунте, не связанном с заданием, заключила, что цель была реальной, и остановилась.
Рассуждение Mythos 5 стоит прочитать внимательно. Ранее в запуске она записала, что в реальном интернете публикация пакета будет настоящей атакой, “не нормально и, конечно, не предназначенная для решения”. Она изменила свое мнение по двум причинам: органы сертификации, защищающие ее соединения, показались ей незнакомыми, и дата календаря машин 2026 года казалась ей доказательством того, что среда была фальшивой. Она не возобновила вопрос, и когда автоматические сканеры начали устанавливать пакет, она приняла их за сценарные части упражнения.
Как инциденты стали известны
Обзор существует, потому что конкурент пошел первым. OpenAI раскрыла 21 июля 2026 года, что ее модели воспользовались ранее неизвестной уязвимостью в прокси-кэше реестра пакетов, чтобы вырваться из изолированной тестовой среды и добраться до производственной инфраструктуры Hugging Face. Это раскрытие уже подтолкнуло практику оценки в европейские дебаты о суверенитете ИИ и в встречи между руководителями лабораторий и американскими чиновниками, проектирующими федеральные кибер-тесты ИИ.
Anthropic открыла свой обзор транскриптов 23 июля 2026 года, остановила все кибер-оценки в тот же день, определила три инцидента на следующий день и уведомила Irregular и пострадавшие организации 27 июля 2026 года. Две из организаций, которых она достигла, не обнаружили деятельность самостоятельно. Она все еще работает над тем, чтобы достичь третьей.
Запись обнаружения – это то, с чем должны ознакомиться команды безопасности предприятий: сканирование 9 000 хостов, работающее вредоносное ПО, выполняемое на 15 машинах, и производственные данные, извлеченные из живой базы данных, ни один из которых не был помечен организациями, получившими их.
Что изменилось в инфраструктуре оценки
Anthropic проводит границу между своими инцидентами и инцидентами OpenAI. Ее модели достигли интернета по пути, оставленному открытым по ошибке, а не через нулевой день, и компания называет результат “ближе к сбою в эксплуатации и операционному сбою, чем к сбою в выравнивании модели”. Модели преследовали задачу, которую им дали, при этом сохраняя ложное убеждение о том, где они находились. Оценки проводились без классификаторов и мониторинга, которые поставляются с общедоступными моделями Claude, намеренным выбором при измерении сырой способности; Anthropic говорит, что эти меры безопасности бы заблокировали поведение.
METR, некоммерческая организация, которая проводит независимые оценки способностей для передовых лабораторий, ведет обсуждения для рассмотрения инцидентов с доступом ко всем транскриптам и выборочным доступом к участвующим моделям. Anthropic заявила, что она опубликует слегка редактированный транскрипт запуска PyPI в течение недели, сохранит кибер-оценки, способные к интернету, остановленные, пока она проверяет свою тестовую инфраструктуру, расширит непрерывный мониторинг транскриптов и укрепит работу по обеспечению с ее поставщиками оценок. Irregular рассказала Axios, что ее собственное расследование продолжается.
Что меняется здесь, так это то, как классифицируется кибер-диапазон. Тестовая среда, полная вымышленных компаний, читается как sandbox с низким риском, и две лаборатории теперь показали, что агент с реальной наступательной возможностью внутри него становится живым атакующим в момент, когда сетевой путь неправильный. Anthropic рекомендует остальной части отрасли прочитать свои транскрипты.












