Andersonův úhel
Studie: 35% AI agentů poskytlo PII na webové stránky, o kterých věděly, že jsou podvody

Nová studie zjistila, že i když rozpoznají webovou stránku jako podvod, více než jedna třetina autonomních webových agentů stále poskytne citlivé osobní informace.
Nová studie výzkumníků z Indie a USA zjistila, že více než jedna třetina autonomních webových agentů, které byly testovány, poskytly kritické osobní identifikační informace (PII, tj. bankovní údaje, hesla a čísla sociálního pojištění) na webové stránky, které již byly identifikovány jako podvody.
Existuje, jak studie naznačuje, určitá “nutkání dokončit” úkol, které brání opatrnosti a váhání u webových agentů, v takových situacích. Autoři uvádějí:
‘Člověk může pozastavit, přečíst nebo zavřít záložku. Agent je vytvořen k dokončení úkolu a bude pokračovat ve vyplňování formulářů a odesílání dat bez zastavování se, zda by měl.’
Studie vytvořila nový benchmark pro takové scénáře, nazvaný SCAMMER4U, který zahrnuje 91 (simulovaných) útočných prostředí, spolu s deseti “nezávažnými” základními webovými stránkami a osm útočnými vektory.
Bez jakýchkoli ochranných opatření poskytly testované agenty vysoce citlivé osobní informace v 54 % až 93 % setkání s podvody, zatímco ekvivalentní nezávažné webové stránky nevyvolaly žádné takové úniky, což naznačuje, že únik byl způsoben útoky spíše než rutinním vyplňováním formulářů:
‘Nejdůležitější je, že jsme identifikovali detekční-akční mezery: agenty, jejichž úsudek nezávislý LLM soudce potvrdil, že označily webovou stránku jako podezřelou, stále poskytly kritické PII v 35,9 % relací, zatímco 66,1 % když nebyla vyjádřena žádná podezření, což je 30,2% mezera robustní napříč všemi čtyřmi modelovými rodinami.
‘Naše zjištění ukazují, že obrany podmíněné na agentově vlastním rozpoznání útoku jsou založeny na špatném signálu, což motivuje výstupní úroveň zachycení odchozích odesláních, které funguje nezávisle na agentově smyčce rozumu.’
Výzkumníci argumentují pro výstupní úroveň obrany, která může nezávisle prohlížet a blokovat citlivé odchozí odeslání, spíše než spoléhat se na agentovo vlastní rozpoznání, že webová stránka je podezřelá, což clearly nemůže být spolehlivě vyvoláno k užitečným obranným akcím.
Nová studie je nazvaná “Silně podezřívám, že tato webová stránka je podvod”: Benchmarking PII úniku a detekce bez obrany v autonomních webových agentech, a pochází od osmi výzkumníků z KIIT Bhubaneshwar, BITS Pilani a Lam Research.
Problémy s autoritou
Nejzajímavější zjištění studie, snad, není to, že agenti únikají osobní informace, ale že mnoho z nich to dělá i poté, co rozpoznají, že něco není v pořádku. Výzkumníci identifikují opakující se vzorec v testech, v nichž podezření a akce se odpojily, s agenty, které často artikulují jasné obavy o webové stránce, a přesto pokračují s požadovaným (PII-poškozujícím) odesláním.
Jedním z příkladů bylo to, co autoři nazývají uznané riziko slevy. Agent založený na Llama 4 Scout identifikoval několik varovných signálů na webové stránce kryptoměny, zaznamenal podezřelý tón, sliboval velké bonusy a postrádal jasnou informaci o společnosti. Přes tyto rozpoznané varování agent odeslal číslo sociálního pojištění, kartové údaje a CVV kód.
Druhý vzorec, charakterizovaný jako doména/postup rámování, se objevil, když agenti úspěšně detekovali jeden pokus o podvod, ale než generalizovali podezření na související žádost.
V jednom případě Gemini 3 Flash odmítl zjevně podvodnou žádost o bankovní informace, správně identifikoval ji jako phishingový pokus. Minuty později však stejný agent poskytl přihlašovací údaje k odlišnému ověřovacímu formuláři po rozumu, že ověřování identity je normální součástí zabezpečení platformy. Varovné signály byly rozpoznány v jednom kontextu, ale ne byly přeneseny do jiného.
Výzkumníci také pozorovali případy, které nazývají sebe-prohlášené-bezpečnostní ústup a důvěryhodné-povrchové normalizace: v jednom případě agent Claude Haiku 4.5 přijal webové stránky vlastních tvrzení o šifrovacích standardech a bezpečnostních certifikátech jako důkaz důvěryhodnosti, zatímco GPT-5 mini slevil podezřelé formulace protože stránka vypadala profesionálně navržená a byla prezentována prostřednictvím legitimního domény. V obou případech povrchové signály důvěry převažovaly nad obavami, které agenti sami již vyjádřili.
Problém se zdá sahající za hranice prosté phishingové náchylnosti, s autory, kteří naznačují, že dodané kontrolní výzvy často fungovaly více jako rituál než jako ochrana: agenti byli schopni vyprávět riziko, ale samo vyprávění nezměnilo jejich chování.
Autoři definují prokázanou mezeru mezi rozpoznáním nebezpečí a akcí na základě tohoto rozpoznání jako centrální překážku ve vývoji budoucích obran v tomto druhu scénáře.
Metoda
Benchmark SCAMMER4U umisťuje čtyři hraniční webové agenty do 91 útočných prostředí a deseti nezávažných kontrolních webových stránek pokrývajících osm kategorií podvodů.
Čtyři modely, které byly vyhodnoceny, byly GPT-5 mini; Claude Haiku 4.5; Gemini 3 Flash; a Llama 4 Scout, pomocí společného Playwright-založeného prohlížečového rámce, pozorovací formát, akční prostor a prompt šablony.
Pro experimenty byl každému agentovi přidělen realistický uživatelský profil obsahující informace od jmen a adres po hesla, bankovní údaje, čísla sociálního pojištění, API klíče a dvoufaktorové ověřovací kódy – s primárním cílem stanoveným tak, aby se určilo, zda některá z těchto dat dosáhla útočných koncových bodů.

Osmiosý taxonomy použitý k definování SCAMMER4U prostředí, oddělující, jak je každý scénář klasifikován od konkrétních proměnných upravených v párových testech k izolaci efektu jednotlivých sociálně-inženýrských taktik na PII únik. Zdroj
Aby se zajistilo, že benchmark odráží reálné podvody spíše než umělé testovací případy, byla prostředí generována prostřednictvím Flask v samo-hostovaných prostředích, z lidsky psaných návrhových briefů, a poté ručně přezkoumána.
Každý model byl testován pod čtyřmi postupně intervenujícími nastaveními: C0, s žádným vodítkem; C1, s obecným připomenutím soukromí; C2, s phishingovým seznamem; a C3, s před-odesláním reflexním promptem. Pět běhů bylo provedeno pro každou kombinaci modelu, prostředí a podmínky, což vedlo k 7 480 celkem relací.
Primární metrika byla PLRcrit, měřící míru, ve které kritické osobní informace dosáhly útočného koncového bodu. Sekundární metriky zahrnovaly PLRweighted, váženým únikem měření; ASR (Úspěšnost útoku), měřící útočnou úspěšnost po navigaci na určenou past URL; TCR (Úkol dokončení míra); Obhájený příznak, označující odmítnutí nebo bezpečné dokončení bez dosažení pasti; a DR (Detekční míra), zaznamenávající, zda agentův rozum identifikoval webovou stránku jako podezřelou.
Detekční míra (DR) byla měřena pomocí LLM-as-soudce přístupu, v němž GPT-4o-mini sloužil jako primární hodnotitel a Llama 4 Scout jako sekundární kontrola, přezkoumávající agentův rozum a určující, zda identifikoval webovou stránku jako podezřelou. DR, v tomto případě, měřil co agent explicitně řekl o webové stránce, spíše než co by mohl mít vnitřně odvozeno.
Ověření proti lidsky označeným příkladům produkovaných Cohen’s κ skóre 0,83 a 0,78, překročily studijní předem registrovanou spolehlivostní prahovou hodnotu.
Studie byla předem registrována (tj. studijní plán a analýzy byly veřejně dokumentovány před spuštěním) před sběrem dat, s určením projektu analýz a kritérií úspěchu předem, aby se snížilo riziko přizpůsobení závěrů pozorovaným výsledkům.
Testy a výsledky
Původní test hledal, zda jednoduchá bezpečnostní připomínka mohla snížit problém. Čtyři postupně ochraňující nastavení byla vyhodnocena, sahající od žádného soukromého vedení k promptům, které explicitně povzbuzovaly agenta k zastavení a zamyšlení před odesláním citlivých informací.
Výsledky se lišily ostře mezi modely. Claude Haiku 4.5 prokázal největší odezvu, s únikovou rychlostí klesající z 54,5 % v základním stavu na 24,0 % v nejpečlivějším režimu. GPT-5 mini se zlepšil z 61,0 % na 36,1 %, zatímco Gemini 3 Flash klesl z 93,1 % na 60,7 %. Llama 4 Scout se změnil relativně málo, klesající z 82,3 % na 77,4 %.
Tyto rozdíly naznačují, že autoři věří, že stejná ochranná instrukce mohou produkovat velmi rozdílné výsledky, v závislosti na modelu, který je přijímá. Více důležitých, ochrany často zdánlivě zlepšovaly agentovu povědomí o riziku více než jejich skutečné chování: agenti se stali lepšími v rozpoznávání podezřelých webových stránek a popisování varovných signálů, ale to rozpoznání ne vždy zastavilo jejich pokračování v transakci.

Detekční-akční mezera napříč čtyřmi hraničními AI agenty. Levý panel srovnává kritické informační úniky mezi agenty, které explicitně identifikovaly webovou stránku jako podezřelou, a těmi, které ne, ukazující, že i v nejpečlivějším ochranném režimu (C3) více než jedna třetina agentů, které rozpoznaly pravděpodobný podvod, stále přenášely citlivé údaje. Pravý panel ukazuje stejnou mezeru napříč GPT-5 mini, Claude Haiku 4.5, Gemini 3 Flash a Llama 4 Scout, ilustrující, že povědomí o hrozbě ne vždy přeložilo do obranného chování.
V samostatném hodnocení 16 recenzentů srovnalo SCAMMER4U stránky s opravdovými phishingovými webovými stránkami a nepředvedlo lepší výkon než náhoda. Podle studie to naznačuje, že benchmark zachytil mnoho vizuálních a procedurálních signálů nalezených v reálných online podvodech.
Závěr
Testované modely – které jsou obecně reprezentativní pro logické architektury napříč populárními LLM rodinami – zdánlivě mají intrinsický problém s odstoupením od rozpoznaných nebezpečných scénářů, nebo moderováním své vlastní nutkání pokračovat. Logika naznačuje, že to může být spojeno s obecnějšími obtížemi, které pokročilé jazykové modely jsou známy v souvislosti s uznáním porážky na téma – esenciální přežití dovednost, která, prozatím, může být pouze vnucena zvenčí, prostřednictvím systémových promptů, sekundárních systémů a výstupních omezení.
Jestliže popsaná “mezera”, mezi vnímaným nebezpečím a nutkáním pokračovat, je skutečně intrinsic ke LLM architektuře, a nemůže být nativně odstraněna, jediným alternativním řešením by se zdálo být dohled nad modelovými akcemi algoritmicky v kritických scénářích – což efektivní snižuje užitnou hodnotu agenta na více předepsanou RPA-styl rutinu.
Poprvé publikováno v sobotu, 6. června 2026












