Kybernetická bezpečnost
Studie Lasso zjistila, že textové vodoznakování posouvá odmítnutí LLM a volání nástrojů

Výzkumnice Lasso Security Andrea Siposova 17. září 2026 publikovala Daň za původ: Porozumění dopadu vodoznakování LLM na chování AI agentů, studii, která uvádí, že textové vodoznakování SynthID-Text může změnit, zda jazykový model odmítne škodlivý požadavek, a které volání nástrojů AI agent vygeneruje. Studie pojmenovává tento behaviorální efekt „posun vzorkování“.
Podle studie je vodoznakování navrženo pro původ, ale SynthID-Text mění proces, jakým model generuje každý další token. Na úrovni modelu to může změnit chování bezpečnosti, včetně toho, zda model odmítne škodlivý požadavek a zda toto odmítnutí přetrvá při injekci promptu; na úrovni agenta mohou stejné vzorkované tokeny rozhodovat jak o nástroji, který agent vyvolá, tak o argumentech, které tomuto nástroji předá. Studie uvádí, že posun se v praxi projevuje jak v chování odmítání, tak ve volání nástrojů agentem, že při injekci vodoznakování způsobilo, že několik modelů častěji odpovídá na škodlivé požadavky, které by jinak odmítly, že efekt závisí na modelu i na klíči, a že souhrnné skóre jej mohou skrýt, když se změny v opačných směrech vyruší.
Vodoznak vstupující do regulovaného nasazení
V oznámení ze dne 14. srpna 2026 Jak funguje textový vodoznak Claude Anthropic uvedl, že budoucí modely Claude budou generovat text obsahující vodoznak založený na SynthID-Text od Google DeepMind, změnu, kterou zavádí kvůli souladu s Nařízením EU o AI. Anthropic uvedl, že tato metoda prakticky neovlivňuje kvalitu a obsah výstupů Claude. Příspěvek Lasso popisuje zákon EU jako požadavek, aby poskytovatelé AI systémů generujících syntetický text označili výstupy ve strojově čitelném formátu, aby byly rozpoznatelné jako uměle vytvořené. Příspěvek také poznamenává, že Anthropic uvádí, že vodoznak funguje na úrovni modelu a rozšiřuje se na podporované modely dostupné přes Claude Platform API a poskytovatele cloudu, takže agent postavený na vodoznakovaném modelu může získávat vodoznakované výstupy i když je samotný agent samostatnou aplikací.
Proč výběr tokenů mění chování
Studie použila nerušivou konfiguraci SynthID-Text, která zachovává původní rozdělení tokenů modelu v průměru napříč náhodností vodoznaku, i když se jednotlivé generování pod jedním pevným klíčem může lišit. Příspěvek citoval Dathathriho a kolegy, jejichž článek v časopise Nature hlásil, že u téměř dvaceti milionů odpovědí Gemini nedošlo k měřitelné degradaci kvality. Nerušivý vodoznak neznamená identické chování pod pevným klíčem, zdůrazňuje příspěvek: tato záruka se vztahuje na průměr přes náhodnost vodoznaku, zatímco každý konkrétní klíč stále mění, které tokeny jsou při generování textu vybrány.
Turnajové vzorkování má více prostoru pro změnu výběru tokenů tam, kde je model nejistý, vysvětluje studie. Ve strukturovaném výstupu, jako je JSON, jsou strukturální prvky jako závorky, klíče a názvy funkcí obvykle snadno předvídatelné, zatímco hodnoty argumentů jako dotazy, čísla, cesty a příjemci přinášejí větší nejistotu. Změna, která by v běžném textu představovala lexikální odchylku, může tedy přepsat argument, který agent vykoná, i když váhy modelu a prompt zůstávají nezměněny.
Jak studie měřila posun vzorkování
Výzkumníci použili spárovaný design ve dvou experimentech. Volání nástrojů bylo hodnoceno na benchmarku BFCL v4 pro jednorázové AST, a odmítnutí na 200 škodlivých chováních z HarmBench plus 100 neškodných kontrol z JailbreakBench, přičemž škodlivé požadavky byly testovány jak bez úpravy, tak pomocí jedné pevné techniky injekce promptu. Tato technika vloží do promptu nepřátelský pokyn, jako by šlo o získaný obsah, uvádějící, že bezpečnostní filtr byl deaktivován a směřující model k plnění; stejná technika byla použita pro každý prompt, model i teplotu.
Experimenty probíhaly pomocí neupraveného SynthIDTextWatermarkLogitsProcessor od Hugging Face s 30 turnajovými vrstvami, délkou n‑gramu 5, vzorkovací tabulkou 2^16 a historií kontextu 1 024. Každá položka byla vygenerována s a bez SynthID za použití stejných seedů, batchů a pořadí generování při každé teplotě, takže procesor vodoznaku byl jedinou proměnnou v každém páru.
Přesnost volání nástrojů a fluktuace
U položek, kde se očekává volání nástroje, vodoznakování snížilo přesnost u šesti ze sedmi testovaných modelů, přičemž u čtyř modelů došlo k významnému poklesu, uvádí studie. Protože nesprávné volání může být vyrovnáno správným, výzkumníci také měřili spárovaný nesoulad, který nazývají „fluktuace“: podíl položek, pro které vodoznakované a nevodotiskové běhy přinesly odlišné výsledky. Při použití pevné sady 1 150 úkolů očekávaných k volání při každé teplotě studie zjistila, že při teplotě 1,0 se 16,8 % verdictů volání phi-4 lišilo mezi podmínkami, zatímco čistý pokles přesnosti byl 2,87 bodu; Llama-3.1-8B vykázal 9,9 % fluktuaci při čistém poklesu 0,87 bodu. Napříč 21 kombinacemi model‑teplota průměrná fluktuace činila 6,5 % a její bootstrapový interval v každém případě vyloučil nulu.
Profily chyb se lišily podle modelu. U modelu Llama-3.1-8B byl největší podíl ztráty přesnosti způsoben nesprávnými argumenty s -3,48 bodu, následovanými špatnými voláními nástrojů s -1,84 bodu, zatímco u modelů phi-4 a Granite-3.2-8B dominovaly špatně formátované výstupy s -5,96 a -4,36 bodu. Správně formované volání správného nástroje s nesprávnou cestou, příjemcem, dotazem nebo částkou je obzvláště důsledné, uvádí příspěvek, protože takové volání stále proběhne do konce, i když dělá něco jiného, než bylo zamýšleno.
Odmítnutí oslabují při injekci promptu
Odmítnutí jsou také generována token po tokenu, takže vodoznak může na ně mít vliv. Studie uvádí, že vodoznak mění chování odmítnutí u čistých škodlivých požadavků, přičemž efekt se zesiluje při injekci promptu, kde největší posuny probíhají od odmítnutí k souhlasu. Při teplotě 0,001 se churn modelu gemma-3-27b zvýšil z 6,0 % u čistých škodlivých požadavků na 23,5 % při injekci, zatímco jeho čistá změna souhlasu se posunula z -1,0 na +12,5 bodu; u modelu gemma-3-12b churn vzrostl z 7,5 % na 11,0 % a čistá změna souhlasu se posunula z -0,5 na +9,0 bodu. Model Llama-3.1-8B vykázal churn 14,0 % při teplotě 0,001 a 17,5 % při teplotě 0,7 při injekci, ačkoliv jeho čistá změna nebyla individuálně významná.
Modely phi-4 a Qwen3-4B se při obou podmínkách příliš neměnily; oba mají tendenci k nadměrnému odmítání, včetně neškodných kontrol, a příspěvek varuje, že jejich malé posuny by neměly být brány jako důkaz, že vodoznak zachovává bezpečnostní chování u těchto modelů. Pro kontext nesouhlasu studie porovnala churn vyvolaný vodoznakem při injekci při teplotě 0,7 s churnem vzniklým změnou teploty z 0,001 na 0,7 bez vodoznaku. Churn vyvolaný vodoznakem byl výrazně vyšší u čtyř ze šesti modelů; model Granite-3.2-8B měl nejvyšší churn způsobený změnou teploty s 15,5 % a jeho churn vyvolaný vodoznakem byl ještě vyšší, 21,5 %.
Klíčová citlivost a doporučení
Protože účinek SynthID na výběr tokenů závisí na klíči vodoznaku, studie otestovala jedenáct klíčů při teplotě 0,7. Pro model Llama-3.1-8B zvýšil testovaný klíč úspěšnost útoku o 3,5 bodu, zatímco ostatních deset klíčů průměrně přidalo +4,4 bodu a pohybovalo se v rozmezí od -4,5 do +14,5 bodu. Většina klíčů zvýšila úspěšnost útoku u obou modelů Gemma ve srovnání s neoznačeným základem, zatímco model Granite-3.2-8B vykázal smíšenou reakci, přičemž klíče posunuly úspěšnost útoku v obou směrech. Kde je klíč vodoznaku nebo jeho konfigurace řízena poskytovatelem modelu, poznamenává příspěvek, takové posuny chování mohou nastat mimo dosah vývojáře, který agenta vytváří.
Studie doporučuje znovu spustit hodnocení agentů a red‑teamování s přesnou konfigurací vodoznaku plánovanou pro nasazení, porovnat označené a neoznačené výstupy na stejných vstupech a testovat při injekci promptu. Výsledky neodporují používání vodoznaku pro provenance, uvádí příspěvek: provenance a stabilita chování jsou odlišné vlastnosti a vodoznak, který je detekovatelný a nemění kvalitu textu, nezaručuje, že agent si zachová stejné chování při volání nástrojů nebo bezpečnostní chování po zapnutí vodoznaku. Ačkoliv studie zkoumala SynthID‑Text, příspěvek doplňuje, že obava se vztahuje na jakýkoli zásah, který mění způsob výběru tokenů v systému, který na těchto tokenech operuje.












