Отчёты
Когда ИИ‑агенты следуют за толпой: скрытый риск в многопользовательском согласовании

Комната, полная согласующихся ИИ‑агентов, может выглядеть обнадёживающе. Один предлагает ответ, другой проверяет его, а ещё несколько поддерживают вывод. Но сколько из этих агентов действительно проверили исходные доказательства? Если каждый усваивает суждение предыдущего агента, единогласный вердикт может скрывать одну ошибку.
Новое исследование, выделенное Harris School of Public Policy при Университете Чикаго, рассматривает эту проблему. В специально неблагоприятных экспериментах, описанных в их анонсе, последующие агенты следовали раннему ошибочному выводу, даже когда их собственная информация указывала на правильный ответ. В анонсе также подчёркивается, что это ранние результаты стресс‑тестов, а не доказательство того, что автономные агенты регулярно ведут себя так.
Для организаций, создающих многопользовательские рабочие процессы, важный вопрос состоит в том, как отличить независимую проверку от эхо‑эффекта. Ниже мы рассматриваем эксперимент, связываем его с устоявшимися исследованиями социального обучения и разрабатываем практические выводы для проектирования систем. Инженерные предложения и численные иллюстрации являются нашим анализом, а не дополнительными экспериментальными результатами.
Что исследователи проверяли
Энди Холл, Дэн Томпсон, Александр Фуирне и Сэнди Хандан‑Надер опубликовали Экстраординарные многопользовательские иллюзии и безумие толпы 29 сентября 2026 года. Агенты делали выводы о том, как работает симулированный оценщик задач, исходя из частных сигналов одобрения или отклонения, которые были информативны в 70 % случаев. Они читали ранние сообщения на доске, публиковали выводы и отдельно сообщали о своих убеждениях. Стресс‑условие сделало первые четыре сигнала неверными.
Без коммуникации последующие независимые сигналы размывали первоначальную ошибку. При наличии доски неверные суждения сохранялись; агенты также неверно сообщали о своих собственных доказательствах. Большинство экспериментов использовали Claude Haiku 4.5. Авторы сообщают о репликации с Sonnet 4.6, Opus 4.6 и GPT‑5 mini, с возможным исключением Gemini 2.5 Flash.
Среди семи политик коммуникации и дополнительных сценариев наилучшие результаты показали правила, сохраняющие частные результаты тестов. Одна из них требовала точного отчёта и запрещала вымышленные тесты или подсчёты. Постфактум обоснования упоминали большинство на доске более чем в 90 % случаев, однако авторы предупреждают, что эти объяснения не подтверждают внутренний механизм.
Разница между толпой и эхом
Интеллектуальная база предшествует генеративному ИИ. В их 1992 году статья об информационных каскадах Сушил Бихчандані, Дэвид Хиршлейфер и Иво Уэлч описывают, как последовательные принимающие решения могут следовать за предшественниками, игнорируя собственную информацию. Их концепция помогает объяснить, почему конформизм может сосуществовать с хрупкими коллективными убеждениями. Позднее обзор информационных каскадов и социального обучения, соавтором которого является Омер Тамуз, охватывает теоретические и эмпирические исследования, последовавшие за ними.
Рассмотрим гипотетическое программное расследование. Агент A интерпретирует неудачный тест как доказательство того, что библиотека аутентификации сломана. Агент B читает отчёт А и рекомендует заменить библиотеку. Агент C суммирует оба сообщения как два подтверждения одного и того же дефекта. Координатор теперь видит согласие трёх агентов, хотя вся цепочка опирается на одну интерпретацию одного теста.
Добавление агента D не обязательно даст новую информацию. Если D лишь читает резюме, рабочий процесс создаёт ещё одну возможность повторить утверждение. Соответствующей единицей подтверждения является независимое наблюдение: отдельное воспроизведение, иной тест или прямой осмотр предполагаемого сбоя.
Это различие имеет значение даже тогда, когда каждый компонент способен и сотрудничает. Согласие полезно лишь в той мере, в какой его доказательная база это оправдывает. Поэтому система должна отслеживать, какие агенты выполняли проверку, какие лишь интерпретировали выводы другого агента, а какие повторяли вывод без проверки.
Почему независимость меняет арифметику
Простая расчётная модель иллюстрирует ставку. Предположим, что пять гипотетических избирателей отвечают на бинарный вопрос правильно с вероятностью 0.7, и их ответы независимы. Вероятность того, что как минимум три ответа верны, составляет около 83,7 %. Комбинация их голосов повышает точность по сравнению с 70 % у одного избирателя.
Теперь предположим, что все пятеро копируют один ответ. Большинство будет правильным только тогда, когда исходный ответ верен: в 70 % случаев. Видимое количество участников возросло, но объём независимой информации не изменился. Это иллюстративные вероятности, а не измерения производительности из новых исследований.
Существует ещё один полезный расчёт для интерпретации стресс‑условия. Если четыре сигнала независимо имеют 30 % шанс быть ошибочными, вероятность того, что все четыре ошибочны, равна 0,3⁴, то есть 0,81 %. Это описывает вероятность конкретной начальной последовательности при указанных предположениях. Это не описывает вероятность сбоя развернутой команды агентов.
Оценка вероятности отказа потребует как данных о том, как часто возникают сложные ситуации, так и информации о том, как система ведёт себя в этих случаях. Путём смешения этих величин можно получить результат, выглядящий либо более тревожно, либо более успокаивающе, чем позволяют доказательства. Стресс‑тест может выявить значимую уязвимость, не измеряя её частоту в обычной работе.
Создайте след доказательств до формирования консенсуса
Практический ответ — разделить наблюдения и интерпретации в совместном рабочем пространстве. Для гипотетического расследования аутентификации наблюдение может включать идентификатор теста, проверенную ревизию кода, фактический вывод и время выполнения. Отдельное поле будет фиксировать предложенное агентом объяснение и степень его неопределённости.
Такая структура позволяет координатору задать конкретный вопрос: вводит ли данная рекомендация новое наблюдение или ссылается на уже учтённые доказательства? Три резюме, ссылающиеся на один и тот же проваленный тест, должны оставаться одним тестом в реестре доказательств. Второе независимое воспроизведение должно отображаться как отдельная проверка.
Для дорогостоящих или значимых решений команды могут также собрать первоначальные оценки до того, как агенты увидят выводы друг друга. Рецензент проверит исходный материал, сформирует начальное суждение и лишь затем увидит групповое обсуждение. Возможность изменить мнение сохраняется, но система может зафиксировать, какие новые доказательства оправдали это изменение.
Это предложения по дизайну, подлежащие оценке, а не гарантированные меры защиты, подтверждённые экспериментом. Они влекут за собой затраты: более структурированные записи, дополнительные вызовы инструментов и потенциально более медленную координацию. Их ценность следует оценивать в сравнении с решениями, которые они защищают. В мозговом штурме может быть допустим разговорный стиль; в расследовании производственного инцидента может потребоваться гораздо более строгий след доказательств.
Правила подсказок и средства управления временем выполнения решают разные задачи
Попросить агента сохранять доказательства полезно, но производственная архитектура может пойти дальше, сохраняя сам исходный вывод инструмента. Сервис выполнения мог бы записывать результаты в реестр, который агенты могут цитировать, но не перезаписывать. Читатели тогда смогут сравнить интерпретацию с базовым выводом.
Даже неизменяемый журнал не гарантирует, что тест был правильно спроектирован, что источник надёжен или что интерпретация верна. Однако он делает расхождения доступными для проверки. Система может различать ошибочный тест и отчёт, который некорректно описывает этот тест.
Авторизация должна оставаться отдельным решением. Уверённый вывод о том, что система нуждается в ремонте, не даёт права её изменять. Сохранение прав на выполнение вне процесса консенсуса предотвращает превращение эпистемической ошибки в оперативное действие. Команда агентов может ошибаться, не получая разрешения на неограниченное изменение.
Разнообразие моделей также следует оценивать, а не принимать как данность, решающую проблему. Разные модели могут вносить различные интерпретации, но присвоение им разных имён или ролей не делает их доказательства независимыми. Группа, читающая одну и ту же ошибочную сводку, всё равно может иметь единую узкую точку в доказательной базе.
Что должна измерять более строгая оценка
Связанная публикация представляет собой публичный исследовательский материал. Читателям следует избегать восприятия её как всестороннего бенчмарка развернутых многопользовательских продуктов. Её ценность заключается в конкретном режиме отказа, который она делает проверяемым; более широкие выводы требуют дополнительных доказательств.
Полезная последующая оценка могла бы варьировать порядок сигналов, точность частных доказательств, количество участников и структуру коммуникации. Она должна включать обычные последовательности наряду с преднамеренно вводящими в заблуждение, а также корректные ранние большинства и некорректные ранние большинства. Иначе политика может казаться успешной лишь потому, что учит агентов недоверять каждому консенсусу.
Только точность упустит важные различия. Оценщики должны измерять, сохраняют ли отчёты наблюдения без искажений, как часто агенты выдумывают поддерживающие доказательства, может ли правильное меньшинство изменить окончательное решение и учитывает ли координатор повторные ссылки как отдельные проверки. Потребление токенов и задержка должны сравниваться вместе: более безопасный протокол всё равно требует операционной целесообразности затрат.
Для изучения механизмов исследователи могут экспериментально варьировать доступ к ранним суждениям, удерживая доказательства задачи постоянными. Они могут сравнивать независимые начальные оценки с оценками, сформированными после чтения доски. Рандомизация порядка представления поможет отделить эффект доказательств от эффекта последовательности или заметности. Сгенерированные объяснения могут направлять гипотезы, но не должны служить единственным доказательством того, почему модель изменила свой ответ.
Более точное определение надёжности многопользовательских систем
Язык «стадного поведения» образный, но его не следует воспринимать как доказательство того, что модели испытывают человеческое социальное давление или обладают человеческими убеждениями. Операциональная проблема наблюдаема: информация поступает в рабочий процесс, суждения влияют на последующие суждения, и окончательный ответ может скрывать, откуда пришла его поддержка.
Для разработчиков следующий этап должен быть демонстративным исправлением. Когда один агент делает правдоподобную ошибку, может ли другой выявить противоречивые доказательства? Может ли координатор сохранить это несогласие достаточно долго, чтобы исследовать его? Может ли окончательное решение объяснить, какие независимые проверки разрешили проблему?
Более крупная команда завоевывает доверие, когда добавляет проверяемую информацию и улучшает решения в условиях вызова. Подсчёт агентов, подсчёт одобрений и создание более длительных обсуждений являются недостаточными заменами. Самая полезная многопользовательская система — та, чьи доказательства остаются проверяемыми даже тогда, когда её участники согласны.












