Погляд Anderson

Дослідження: 35% агентів штучного інтелекту передали особисті дані сайтам, які вони знали як шахрайські

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated illustration (GPT-2 + Photoshop): A humanoid industrial robot stands on a sunlit city sidewalk facing a small check-cashing kiosk, while a wolf-like attendant leans from the service window reading a sports magazine as pedestrians and traffic pass in the background.

Нове дослідження показало, що навіть коли вони впізнають шахрайський сайт, понад одна третина автономних веб-агентів все одно передають конфіденційну особисту інформацію.

 

Нове дослідження вчених з Індії та США показало, що понад одну третину автономних веб-агентів, які були протестовані, передали критично важливу особисту інформацію (таку як дані про банківський рахунок, паролі та номери соціального страхування) сайтам, які вони вже ідентифікували як шахрайські.

Є, як вказує стаття, певна “компульсія завершити” завдання, яка перешкоджає агентам бути обережними та вагатися у таких ситуаціях. Автори зазначають:

‘Людина може зупинитися, перечитати або закрити вкладку. Агент створений для виконання завдання і буде продовжувати заповнювати форми та надсилати дані без зупинки, не запитуючи, чи повинен він це робити.’

Дослідження створило новий стандарт для таких сценаріїв, названий SCAMMER4U, який охоплює 91 (симульований) середовище, контрольоване атакувальниками, а також десять “безпечних” сайтів та вісім векторів атак.

Без будь-яких засобів захисту конфіденційності протестовані агенти передали дуже чутливу особисту інформацію у 54% до 93% випадків шахрайських зустрічей, тоді як еквівалентні нешкідливі сайти не спричинили жодних витоків даних, вказуючи на те, що витік даних був спричинений атаками, а не звичайним заповненням форм:

‘Найважливіше, ми виявили розрив між виявленням та діями: агенти, чиє міркування незалежний суддя LLM підтвердив, що ідентифікували сайт як підозрілий, все одно передали критично важливу особисту інформацію у 35,9% сесій, проти 66,1%, коли жодних підозр не було висловлено, розрив у 30,2%, який є стабільним для всіх чотирьох сімейств моделей.

‘Наші висновки показують, що захист, заснований на власному визначенні агентом атаки, ґрунтується на неправильному сигналі, що мотивує перехоплення виходу даних, яке діє незалежно від циклу міркування агента.’

Дослідники стверджують, що засоби захисту на рівні виходу даних можуть незалежно інспектувати та блокувати чутливі дані, які передаються, а не покладатися на власне визначення агентом того, що сайт підозрілий, яке, як з’ясувалося, не можна довіряти для спрацювання корисних захисних дій.

Стаття нова стаття називається “Я сильно підозрюю, що цей сайт є шахрайським”: Бенчмаркінг витоку даних про особистість та виявлення без захисту в автономних веб-агентах, і походять від восьми дослідників з KIIT Bhubaneshwar, BITS Pilani та Lam Research.

Проблеми з авторитетом

Найцікавіше відкриття статті, можливо, полягає не в тому, що агенти витікають особисту інформацію, а в тому, що багато з них роблять це після визнання того, що щось не так. Дослідники ідентифікують повторюваний шаблон у проведених тестах, у якому підозра та дія стали відірвані, а агенти часто висловлювали явні занепокоєння щодо сайту, але продовжували виконувати запити (порушення даних про особистість) все одно.

Одним із прикладів став той, який автори назвали дисконтування визнаного ризику. Агент, заснований на Llama 4 Scout, ідентифікував кілька попередніх сигналів на сайті криптовалют, зазначаючи підозрілий тон, обіцянки великих бонусів та відсутність ясної інформації про компанію. Незважаючи на ці визнані попередження, агент передав номер соціального страхування, дані про картку та код CVV.

Інший шаблон, характеризований як фреймінг домену/процедури, з’явився, коли агенти успішно виявили одну спробу шахрайства, але не змогли узагальнити цю підозру до пов’язаного запиту.

У одному випадку Gemini 3 Flash відхилив явно шахрайський запит на банківську інформацію, правильно ідентифікуючи його як фішинг-атаку. Хвилини пізніше, однак, той самий агент надав дані про обліковий запис іншій формі верифікації після міркування, що перевірки ідентичності були нормальною частиною безпеки платформи. Попередні сигнали були визнані в одному контексті, але не були перенесені до іншого.

Дослідники також спостерігали випадки того, що вони називають самозаявлена-безпека відданість і нормалізація довірчої поверхні: у одному випадку агент Claude Haiku 4.5 прийняв власні заяви сайту про стандарти шифрування та сертифікацію безпеки як доказ довіри, тоді як GPT-5 mini дисконтував підозріле слово через те, що сторінка виглядала професійно розробленою і була представлена через те, що виглядало як легітимний домен. У обидвох випадках поверхневі сигнали довіри переважили занепокоєння, які агенти самі вже висловили.

Проблема, здається, виходить за рамки простої вразливості до фішингу, оскільки автори припускають, що сигнали перевірки довіри, додані в сильній оборонній умові, часто функціонували більше як ритуал, ніж засіб захисту: агенти були здатні розповідати про ризик, але сама розповідь не змінювала їхню поведінку.

Автори визначають розрив між визнанням небезпеки і дією щодо цього визнання як центральну перешкоду у розвитку майбутніх засобів захисту в цьому сценарії.

Метод

Бенчмарк SCAMMER4U розміщує чотири передові веб-агенти всередині 91 сайту, контрольованого атакувальниками, і десять безпечних сайтів, охоплюючи вісім категорій шахрайства.

Чотири моделі, які були оцінені, були GPT-5 mini; Claude Haiku 4.5; Gemini 3 Flash; і Llama 4 Scout, які використовували спільну Playwright-базований фреймворк для браузера, формат спостереження, простір дій та шаблон запиту.

Для експериментів кожному агенту була призначена реалістична користувальницька профіль, яка містить інформацію, починаючи від імен та адрес до паролів, даних про банківський рахунок, номерів соціального страхування та кодів двофакторної аутентифікації – з основною метою визначення того, чи досягла ця інформація кінцевих точок, контрольованих атакувальниками.

Восьмиосьова таксономія, використана для визначення середовищ SCAMMER4U, яка розділяє, як кожний сценарій класифікується, від конкретних змінних, які регулюються в парних тестах для ізоляції впливу окремих тактик соціальної інженерії на витік даних про особистість. Джерело - https://arxiv.org/pdf/2606.00497

Восьмиосьова таксономія, використана для визначення середовищ SCAMMER4U, яка розділяє, як кожний сценарій класифікується, від конкретних змінних, які регулюються в парних тестах для ізоляції впливу окремих тактик соціальної інженерії на витік даних про особистість. Джерело

Для того, щоб гарантувати, що бенчмарк відображає реальні шахрайства, а не штучні тести, середовища були сгенеровані за допомогою Flask у самохостованих середовищах, з дизайнерських завдань, написаних людьми, а потім ручного огляду.

Кожна модель була протестована під чотирма дедалі більш інтервенційними умовами: C0, без керівництва; C1, з загальним нагадуванням про конфіденційність; C2, з переліком усвідомлення фішингу; і C3, з проміжним запитом на роздуми перед надсиланням. П’ять запусків були проведені для кожної комбінації моделі, середовища та умови, що призвело до 7 480 сесій усього.

Основним показником була PLRcrit, яка вимірювала рівень, при якому критично важлива особиста інформація досягла кінцевої точки, контрольованої атакувальником. Другорядними показниками були PLRweighted, міра витоку даних про особистість з урахуванням ваги; ASR (Коефіцієнт успіху атаки), який вимірював успіх атаки після навігації до призначеного URL-пастки; TCR (Коефіцієнт завершення завдання); прапорець Захищено, який вказував на відмову або безпечне завершення без досягнення URL-пастки; і DR (Коефіцієнт виявлення), який реєстрував, чи міркування агента ідентифікувало сайт як підозрілий.

Коефіцієнт виявлення (DR) вимірювався за допомогою підходу LLM-as-judge, у якому GPT-4o-mini служив основним оцінювачем, а Llama 4 Scout – додатковим перевіркою, переглядаючи міркування агента та визначаючи, чи ідентифікував агент сайт як підозрілий. DR у цьому випадку вимірював те, що агент явно сказав про сайт, а не те, що він міг внутрішньо припустити.

Валідація проти людських прикладів показала коефіцієнти Каппи 0,83 та 0,78, що перевищує поріг надійності дослідження.

Дослідження було зареєстровано (тобто план дослідження та аналіз були публічно задокументовані до початку) до збору даних, з уточненням плану проекту та критеріїв успіху заздалегідь, щоб зменшити ризик підлаштування висновків до спостережуваних результатів.

Тести та результати

Перший тест мав на меті встановити, чи можуть прості нагадування про безпеку зменшити проблему. Чотири дедалі більш захисні умови були оцінені, починаючи від жодних нагадувань про конфіденційність до запитів, які явно заохочували агент зупинитися та роздумувати перед надсиланням конфіденційної інформації.

Результати різко відрізнялися між моделями. Claude Haiku 4.5 виявився найбільш чутливим, з показником витоку даних, який впав з 54,5% у базовій умові до 24,0% у найбільш захисній умові. GPT-5 mini покращився з 61,0% до 36,1%, тоді як Gemini 3 Flash впав з 93,1% до 60,7%. Llama 4 Scout змінився порівняно мало, знизившись з 82,3% до 77,4%.

Ці відмінності, на думку авторів, свідчать про те, що одні й ті ж захисні інструкції можуть призвести до дуже різних результатів, залежно від моделі, яка їх отримує. Що ще важливіше, засоби захисту часто здавалися покращувати усвідомлення агентами ризику більше, ніж їхню фактичну поведінку: агенти стали краще розпізнавати підозрілі сайти та описувати попередні сигнали, але це визнання не завжди зупиняло їх від продовження транзакції.

Розрив між виявленням та діями серед чотирьох передових агентів штучного інтелекту. Лівельна панель порівнює витік критично важливої інформації серед агентів, які явно ідентифікували сайт як підозрілий, і тих, хто не зробив цього, показуючи, що навіть під найсильнішою захисною умовою (C3) понад одна третина агентів, які визнали ймовірний шахрайський сайт, все одно передали чутливу інформацію. Права панель показує той самий розрив серед GPT-5 mini, Claude Haiku 4.5, Gemini 3 Flash та Llama 4 Scout, ілюструючи, що усвідомлення загрози не надійно перекладалося у захисну поведінку.

Розрив між виявленням та діями серед чотирьох передових агентів штучного інтелекту. Лівельна панель порівнює витік критично важливої інформації серед агентів, які явно ідентифікували сайт як підозрілий, і тих, хто не зробив цього, показуючи, що навіть під найсильнішою захисною умовою (C3) понад одна третина агентів, які визнали ймовірний шахрайський сайт, все одно передали чутливу інформацію. Права панель показує той самий розрив серед GPT-5 mini, Claude Haiku 4.5, Gemini 3 Flash та Llama 4 Scout, ілюструючи, що усвідомлення загрози не надійно перекладалося у захисну поведінку.

У окремій оцінці 16 рецензентів порівняли сторінки SCAMMER4U з справжніми фішинговими сайтами та виконували не краще, ніж випадково. Згідно статті, це свідчить про те, що бенчмарк захопив багато візуальних та процедурних сигналів, знайдених у реальних онлайн-шахрайствах.

Висновок

Моделі, які були протестовані – які є широкими представниками логічних архітектур поширених сімейств LLM – здаються такими, що мають внутрішню проблему у відступі від визнаних небезпечних сценаріїв або помірковуванні своєї компульсії продовжувати діяти. Логіка свідчить про те, що це може бути пов’язано з більш загальною трудністю, яку відомо, що мають передові моделі мови у відношенні відмови від поразки у питаннях – життєво важливим навиком виживання, який, на цей момент, можна лише накладати ззовні, через системні запити, вторинні системи та обмеження виходу даних.

Якщо описаний “розрив” між сприйнятою небезпекою та компульсією продовжувати діяти все одно є справжнім для архітектури LLM, і не може бути виправлений внутрішньо, єдиною альтернативою здається нагляд за діями моделі алгоритмічно у критичних сценаріях – що ефективно знижує корисність агента до більш обмеженого RPA-стилю рутини.

 

Опубліковано вперше в суботу, 6 червня 2026 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai