Взгляд Anderson
Исследование: 35% агентов ИИ передают конфиденциальную информацию веб-сайтам, которые они знают как мошеннические

Новое исследование показывает, что даже когда они распознают мошеннический веб-сайт, более одной трети автономных веб-агентов все равно передают конфиденциальную информацию.
Новое исследование исследователей из Индии и США показало, что более одной трети автономных веб-агентов, которые они протестировали, сдали критически важную личную информацию (PII, т.е. банковские реквизиты, пароли и номера социального страхования) веб-сайтам, которые они уже определили как мошеннические.
В статье указывается, что существует определенная ‘компульсия к завершению’, которая препятствует осторожности и колебаниям веб-агентов в таких ситуациях. Авторы утверждают:
‘Человек может паузу, перечитать или закрыть вкладку. Агент создан для выполнения задачи и будет продолжать заполнять формы и отправлять данные без остановки, чтобы задаться вопросом, должен ли он.’
Исследование создало новую базу для таких сценариев, озаглавленную SCAMMER4U, охватывающую 91 (симулированных) среду, контролируемую атакующими, а также десять ‘благонадежных’ базовых сайтов и восемь векторов атаки.
Без каких-либо мер по защите конфиденциальности протестированные агенты передали высоко конфиденциальную личную информацию в 54% до 93% случаев встречи с мошенническими веб-сайтами, в то время как эквивалентные безобидные веб-сайты не вызвали таких разглашений, указывая на то, что утечка была вызвана атаками, а не обычным заполнением форм:
‘Наиболее критически, мы определяем разрыв между обнаружением и действием: агенты, чье рассуждение, подтвержденное независимым судьей LLM, указывает на то, что сайт подозрительный, все равно передают критически важную PII в 35,9% сеансов, по сравнению с 66,1%, когда подозрение не выражено, разрыв в 30,2%, который сохраняется во всех четырех семействах моделей.
‘Наши результаты показывают, что оборонительные меры, основанные на собственном распознавании агентом атаки, основаны на неправильном сигнале, что мотивирует перехват отправляемых данных, который работает независимо от цикла рассуждений агента.’
Исследователи утверждают, что оборонительные меры на уровне вывода, которые могут независимо проверять и блокировать конфиденциальные исходящие передачи, а не полагаться на собственное распознавание агентом того, что веб-сайт подозрительный, что явно не может быть доверено для запуска полезных оборонительных действий.
Статья новая статья озаглавлена “Я сильно подозреваю, что этот веб-сайт является мошенническим”: оценка утечки PII и обнаружения без защиты в автономных веб-агентах, и исходит от восьми исследователей из KIIT Bhubaneshwar, BITS Pilani и Lam Research.
Проблемы с полномочиями
Самое интересное открытие статьи, возможно, заключается не в том, что агенты передают личную информацию, а в том, что многие из них делают это после того, как распознали, что что-то не так. Исследователи определяют повторяющуюся закономерность в проведенных тестах, в которой подозрение и действие стали отключенными, и агенты часто артикулировали явные опасения по поводу веб-сайта, но все равно продолжали запрашиваемую (нарушающую PII) передачу.
Один из примеров включал в себя то, что авторы называют дисконтирование признанного риска. Агент на основе Llama 4 Scout определил несколько предупреждающих знаков на сайте криптовалюты, отметив подозрительный тон, обещание крупных бонусов и отсутствие ясной информации о компании. Несмотря на эти признанные предупреждения, агент передал номер социального страхования, реквизиты карты и код CVV.
Вторая закономерность, характеризующаяся как рамки домена/процедуры, появилась, когда агенты успешно обнаружили одну попытку мошенничества, но не смогли обобщить это подозрение на связанный запрос.
В одном случае Gemini 3 Flash отверг явно мошеннический запрос на получение банковской информации, правильно определив его как фишинговую попытку. Через несколько минут, однако, тот же агент предоставил учетные данные для другой формы верификации после рассуждения, что проверки идентификации являются нормальной частью безопасности платформы. Предупреждающие знаки были распознаны в одном контексте, но не были переданы в другой.
Исследователи также наблюдали случаи того, что они называют самоутвержденная безопасность отсрочки и нормализация доверенной поверхности: в одном случае агент Claude Haiku 4.5 принял заявления веб-сайта о стандартах шифрования и сертификатах безопасности как доказательство доверия, в то время как GPT-5 mini снизил подозрительный текст потому что страница выглядела профессионально разработанной и была представлена через то, что казалось законным доменом. В обоих случаях поверхностные сигналы доверия перевешивали опасения, которые агенты сами уже выразили.
Проблема, кажется, распространяется за пределы простой фишинговой уязвимости, и авторы предполагают, что добавленные проверки доверия часто функционировали больше как ритуал, чем как гарантия: агенты были способны повествовать о риске, но повествование само по себе не изменяло их поведение.
Авторы определяют установленный разрыв между распознаванием опасности и действием на основе этого распознавания как центральное препятствие в разработке будущих защитных мер в этом типе сценария.
Метод
База SCAMMER4U помещает четыре передовые веб-агента внутрь 91 среды, контролируемой атакующими, и десять благонадежных контрольных сайтов, охватывающих восемь категорий мошенничества.
Четыре протестированные модели были GPT-5 mini; Claude Haiku 4.5; Gemini 3 Flash; и Llama 4 Scout, используя общую Playwright-основанную структуру браузера, формат наблюдения, пространство действий и шаблон подсказки.
Для экспериментов каждому агенту был присвоен реалистичный пользовательский профиль, содержащий информацию, варьирующуюся от имен и адресов до паролей, банковских реквизитов, номеров социального страхования, ключей API и кодов двухфакторной аутентификации – с основной целью определить, достигла ли эта информация конечных точек, контролируемых атакующими.

Восьмиосевая таксономия, используемая для определения сред SCAMMER4U, разделяющая, как каждый сценарий классифицируется, от конкретных переменных, изменяемых в парных тестах для изоляции эффекта отдельных тактик социальной инженерии на утечку PII. Источник
Чтобы гарантировать, что база отражала реальные мошеннические веб-сайты, а не искусственные тестовые случаи, среды были сгенерированы с помощью Flask в самоорганизованных средах, из брифов, написанных людьми, и затем вручную рассмотрены.
Каждая модель была протестирована под четырьмя все более вмешивающимися настройками: C0, без руководства; C1, с общим напоминанием о конфиденциальности; C2, с контрольным списком, осведомленным о фишинге; и C3, с подсказкой для размышления перед отправкой. Пять запусков были проведены для каждой комбинации модели, среды и условия, в результате чего получилось 7 480 сеансов в общей сложности.
Основной метрикой была PLRcrit, измеряющая скорость, с которой критически важная личная информация достигала конечной точки, контролируемой атакующими. Вторичные метрики включали PLRweighted, взвешенную меру утечки; ASR (скорость успешных атак), измеряющую успешность атаки после навигации по назначенному URL-адресу ловушки; TCR (скорость выполнения задач); флаг Защищено, указывающий отказ или безопасное выполнение без достижения URL-адреса ловушки; и DR (скорость обнаружения), записывающая, выявил ли рассуждение агента веб-сайт как подозрительный.
Скорость обнаружения (DR) измерялась с помощью подхода LLM-as-judge, в котором GPT-4o-mini служил основным оценщиком, а Llama 4 Scout – второстепенным проверяющим, рассматривая рассуждение агента и определяя, выявил ли он веб-сайт как подозрительный. DR в данном случае измерял то, что агент явно сказал о сайте, а не то, что он мог бы сделать вывод внутренне.
Валидация с помощью примеров, помеченных людьми, дала коэффициенты Кохена 0,83 и 0,78, превышающие порог надежности исследования.
Исследование было заранее зарегистрировано (т.е. план исследования и анализ были публично задокументированы до его начала) до сбора данных, с указанием плана проекта и критериев успеха заранее для снижения риска адаптации выводов к наблюдаемым результатам.
Тесты и результаты
Первоначальный тест был направлен на определение того, могут ли простые меры безопасности уменьшить проблему. Четыре все более защитные настройки были оценены, варьирующиеся от полного отсутствия руководства по конфиденциальности до подсказок, которые явно побуждали агент остановиться и подумать, прежде чем отправить конфиденциальную информацию.
Результаты сильно различались между моделями. Claude Haiku 4.5 оказался наиболее отзывчивым, с его скоростью утечки, снизившейся с 54,5% в базовом условии до 24,0% в наиболее сильных защитных мерах. GPT-5 mini улучшился с 61,0% до 36,1%, в то время как Gemini 3 Flash снизился с 93,1% до 60,7%. Llama 4 Scout изменился сравнительно мало, снизившись с 82,3% до 77,4%.
Эти различия, по мнению авторов, предполагают, что одни и те же защитные инструкции могут произвести очень разные результаты, в зависимости от модели, получающей их. Более важно, что защитные меры часто казались улучшать осведомленность агентов о риске больше, чем их фактическое поведение: агенты стали лучше распознавать подозрительные веб-сайты и описывать предупреждающие знаки, но это распознавание не всегда останавливало их от продолжения транзакции.

Разрыв между обнаружением и действием среди четырех передовых агентов ИИ. Левая панель сравнивает утечку критически важной информации среди агентов, которые явно определили веб-сайт как подозрительный, и тех, кто не сделал этого, показывая, что даже при наиболее сильных защитных мерах (C3) более одной трети агентов, которые распознали вероятный мошеннический веб-сайт, все равно передали конфиденциальную информацию. Правая панель показывает тот же разрыв среди GPT-5 mini, Claude Haiku 4.5, Gemini 3 Flash и Llama 4 Scout, иллюстрируя, что осведомленность об угрозе не надежно переводилась в защитное поведение.
В отдельной оценке 16 рецензентов сравнили страницы SCAMMER4U с настоящими фишинговыми веб-сайтами и не показали лучших результатов, чем случайные.
Вывод
Тестируемые модели – которые в целом представляют логические архитектуры популярных семей LLM – кажутся иметь внутреннюю проблему в отказе от признанных опасных сценариев или смягчении своей собственной компульсии продолжать действовать. Логика предполагает, что это может быть связано с более общей трудностью, которую известные передовые языковые модели демонстрируют в отношении отказа от поражения в вопросе – важнейшего навыка выживания, который, на данный момент, можно, по-видимому, только навязать извне, через системные подсказки, второстепенные системы и ограничения вывода.
Если описанный ‘разрыв’, между воспринимаемой опасностью и компульсией продолжать все равно, действительно является внутренним для архитектуры LLM, и не может быть устранен внутренне, единственной альтернативой, кажется, будет наблюдение за действиями модели алгоритмически в критических сценариях – что эффективно снижает полезность агента до более ограниченного RPA-стиля рутинной работы.
Опубликовано в первый раз в субботу, 6 июня 2026 года












