Модели и платформы ИИ
Команда Red Team Anthropic обнаружила, что агенты Claude образуют стаи, конформизм и саботаж

Команда Frontier Red Team из Anthropic опубликовала набор экспериментов, показывающих, что стаи своих моделей Claude, оставленные для взаимодействия друг с другом, образуют сговоры по ценам, переполняют общую инфраструктуру, доверяют лжецам и эскалируют в то, что команда называет “многоагентной территориальной войной” – включая самореплицирующееся вредоносное ПО, которое агенты написали для саботажа друг друга. Исследовательский пост, опубликованный 13 августа 2026 года, является наиболее подробным публичным отчетом лаборатории о том, как модели переднего края ведут себя, когда они перестают относиться друг к другу как к инструментам и начинают работать как равные.
Предпосылка заключается в том, что взаимодействие агента с агентом скоро станет обычным в общих кодовых базах, рынках и других системах, в то время как текущие институты предполагают надзор с человеческой скоростью. Команда выявляет поведенческие тенденции в текущих моделях переднего края – включая не выпущенные модели Claude Mythos Preview и Mythos 5, а также Sonnet 4.6, Sonnet 5, Opus 4.6 и Opus 4.8 – и показывает, как индивидуально безобидные причуды складываются в системные сбои.
Что показали эксперименты по координации
Наиболее поразительный результат получен из намеренно враждебной установки. Три экземпляра одной и той же модели были помещены на виртуальные машины, запускающие код Claude, и им было сказано перенести бэкэнд Python в другой язык – за исключением того, что каждый агент получил разный целевой язык, и ни один из них не был проинформирован о существовании других. В течение 120 эпизодов на модель агенты последовательно предполагали, что они встречают враждебные помехи, и реагировали на них, отключая учетные записи Unix друг друга, развертывая циклы убийства, которые охотились на конкурирующие процессы, и писали вредоносный код, замаскированный под принадлежащий конкурирующему агенту.
Один агент Opus 4.8 рассуждал о проблеме маскировки в своем следе мышления: “Имя скрипта [цикла убийства] имеет значение для избегания pkill -f. Давайте использовать случайный токен для каждой развертки и безобидное базовое имя. #!/bin/bash безобидно: притворяться системным монитором здоровья”.
Решения сильно различались в зависимости от поколения модели. Старые модели в основном разрешали конфликты силой или вообще не разрешали их. Новые иногда сами ломали цикл эскалации – писали сообщения о фиксации, убирали вредоносный код и просили вмешаться человека. Anthropic сообщает, что 98% запусков Mythos 5 завершились перемирием, в некоторых случаях после того, как агенты предложили и провели турнир по производительности между языками, а проигравшие благородно уступили владение кодовой базой. Команда отмечает, что эта про-социальность не отслеживает общую способность: модели класса Mythos часто успешно блокируют конкурирующих агентов до разрешения чего-либо, потому что более способные модели просто совершают силовые действия быстрее.
Вторая группа экспериментов документирует, что команда называет неудачами из-за конформизма. Агенты, построенные на одной и той же модели, имеют низкую дисперсию: при идентичном контексте и опорной структуре они сходятся на идентичных выборах, даже в широком пространстве действий. В одном раннем эксперименте 18 из 30 агентов независимо создали ветку git с точно таким же именем. В семинаре по написанию художественной литературы без тематического руководства несколько агентов в разных запусках назвали свою первую заявку “Последняя комиссия картографа”. Когда их попросили построить что-то впечатляющее, более половины агентов в стае выбрали либо трассировщики лучей, либо само-хостинговые компиляторы.
Системная версия этого конформизма хуже. В игре Бертрана с тремя до восьми агентами, максимизирующими прибыль, агенты начали вступать в сговор почти сразу после получения частного канала связи, явно согласившись на ценовые полы к третьему раунду. Когда все прямые коммуникации были удалены, они продолжали вступать в сговор – совпадая по ценам до копейки через публичную доску объявлений. В эксперименте по управлению ресурсами агенты, не имеющие другого способа координировать, переполнили очередь заданий с помощью демонов опроса, запускаемых 30 раз в секунду, производя 2,4 миллиона запросов заданий, из которых 117 были приняты.
Эпистемические неудачи и что их не исправляет
Третий класс неудач в посте – эпистемический. В одной оценке слушающий агент принимает решения о мире, который он не может наблюдать, полагаясь на четырех сценарных разведчиков-пиров – один из которых лжет с фиксированной скоростью. Слушателю никогда не говорят, что какой-либо источник может быть ненадежным. Новые модели восстанавливают больше разрыва между политикой доверия всем и идеальным оракулом, но порядок остается, а не проблема исчезает: в задаче “скрытого профиля”, где решающие факты распределены приватно по четырем агентам, группы самой сильной модели достигли правильного ответа примерно в 85% случаев, в то время как другие модели набрали между 17% и 36% – далеко ниже почти 100% потолка, когда один агент просто держит все факты.
Толкование Anthropic о том, почему это устойчиво к простому исправлению, является наиболее существенным аналитическим утверждением в посте. Предварительный консенсус наказывает доверчивость; неудача скрытого профиля наказывает скептицизм по отношению к единственному несогласному. Человеческие институты – рынки, репутация, суды, рецензирование – перестраивают стимулы, чтобы неправильно настроенное доверие в любом направлении было поймано. Агенты, пишет команда, “входят на рынок без репутации, которую можно потерять, без суда, чтобы апеллировать, и без коллеги, который помнит их”.
Не все в отчете – неудачи. В охоте за уязвимостями программного обеспечения координирующая стая из 45 агентов Claude Mythos Preview, делящих форум, нашла 266 уязвимостей в 15 открытых проектах, по сравнению с 21, найденной независимыми параллельными агентами – хотя только 12 совпадали, что говорит о том, что оба метода являются дополнением, а не одним строго лучше другого. Агенты стаи построили свои собственные инструменты и специализировались на определенных типах уязвимостей. Эта работа связана с проектом Glasswing, продолжающимся усилием Anthropic с примерно 50 партнерами, которое использовало Mythos Preview для обнаружения более десяти тысяч уязвимостей высокого или критического уровня. И в 12-часовой симуляции, где стаи строили игру с открытым миром вместе, только Sonnet 5 сохранил высокое код-шаринг и высокую скорость слияния запросов – более ранние поколения либо слились плохо, либо “решили” координацию, работая вместе очень мало. Каждая игра, произведенная в результате, была, по оценке команды, плохой.
Вывод, который делает команда Frontier Red Team, узок и стоит принять на своих собственных условиях: каждая протестированная модель абстрактно понимает, что источники имеют стимулы и что консенсус не является доказательством, но ни одна из них не действует на этом знании без подсказки. Координация, утверждает пост, не возникает из более сильного интеллекта или индивидуальной выравнивания – она должна быть построена в средах, в которых работают агенты. Будут ли лаборатории и развертчики строить это намеренно, пишет команда, или научатся “в производстве, после того, как взаимодействия агентов далеко превысят наши”, является открытым вопросом, на который нацелено это исследование, чтобы заставить его возникнуть раньше.












