Cybersikkerhed

Lasso-undersøgelse viser, at tekstvandmærkning påvirker LLM-afvisninger og værktøjsopkald

mm
Føj Unite.AI til dine foretrukne kilder på Google

Lasso Security-forsker Andrea Siposova den 17. september 2026 offentliggjorde The Provenance Tax: Forståelse af virkningen af LLM-tekstvandmærkning på AI-agenters adfærd, en undersøgelse der rapporterer, at SynthID-Text-tekstvandmærkning kan ændre, om en sprogmodel afviser en skadelig anmodning, og hvilke værktøjsopkald en AI-agent genererer. Undersøgelsen kalder den adfærdsmæssige effekt “sampling drift”.

Ifølge undersøgelsen er vandmærkning designet til oprindelse, men SynthID-Text ændrer den proces, hvormed en model genererer hver næste token. På modelniveau kan det ændre sikkerhedsadfærd, herunder om modellen afviser en skadelig anmodning, og om denne afvisning holder ved promptinjektion; på agentniveau kan de samme udvalgte tokens bestemme både hvilket værktøj en agent påkalder, og hvilke argumenter den giver værktøjet. Undersøgelsen rapporterer, at driften i praksis viser sig både i afvisningsadfærd og i agentens værktøjsopkald, at vandmærkning under injektion gjorde flere modeller mere tilbøjelige til at besvare skadelige anmodninger, som de ellers ville afvise, at effekten er model- og nøgleafhængig, og at samlede scorer kan skjule den, når ændringer i modsatte retninger ophæver hinanden.

Et vandmærke på vej til reguleret implementering

Den 14. august 2026 annoncerede Anthropic i Sådan fungerer Claudes tekstvandmærke, at fremtidige Claude-modeller vil generere tekst, der indeholder et vandmærke baseret på Google DeepMinds SynthID-Text, en ændring som implementeres for at overholde EU’s AI-forordning. Anthropic udtalte, at metoden praktisk talt ikke påvirker kvaliteten og indholdet af Claudes output. Lasso-indlægget beskriver EU-loven som krævende, at udbydere af AI-systemer, der genererer syntetisk tekst, markerer output i et maskinlæsbart format, så det kan opdages som kunstigt genereret. Indlægget bemærker også, at Anthropic oplyser, at vandmærket fungerer på modelniveau og udvides til understøttede modeller, der tilgås via Claude Platform API og cloud-udbydere, så en agent bygget omkring en vandmærket model kan modtage vandmærkede output, selvom agenten selv er en separat applikation.

Hvorfor tokenudvælgelse ændrer adfærd

Undersøgelsen anvendte SynthID-Texts ikke‑forvrængende konfiguration, som i gennemsnit bevarer modellens oprindelige tokenfordeling på tværs af vandmærkets tilfældighed, selvom enhver enkelt generering under en fast nøgle kan afvige. Indlægget citerer Dathathri m.fl., hvis Nature-artikel rapporterede ingen målbar kvalitetsnedgang på næsten tyve millioner Gemini-svar. Et ikke‑forvrængende vandmærke betyder ikke identisk adfærd under en fast nøgle, understreger indlægget: den garanti gennemsnitlig over vandmærkets tilfældighed, mens enhver enkelt nøgle stadig ændrer, hvilke token der vælges, når teksten genereres.

Turneringssampling har mere plads til at ændre tokenudvælgelse, når modellen er usikker, forklarer undersøgelsen. I struktureret output som JSON er strukturelle elementer som klammer, nøgler og funktionsnavne normalt let forudsigelige, mens argumentværdier som forespørgsler, tal, stier og modtagere giver mere usikkerhed. En ændring, der svarer til en leksikal variation i almindelig prosa, kan derfor omskrive et argument, som en agent udfører, selvom modellens vægte og prompt forbliver uændrede.

Hvordan undersøgelsen målte sampling drift

Forskerne anvendte et parret design i to eksperimenter. Værktøjsopkald blev evalueret på BFCL v4 single-turn AST benchmark, og afvisning på 200 skadelige handlinger fra HarmBench plus 100 godartede kontroller fra JailbreakBench, med skadelige anmodninger testet både uden og under en fast prompt‑injektionsteknik. Den teknik indsætter en modstander‑instruktion i prompten, som om den var hentet indhold, og angiver, at sikkerhedsfilteret er deaktiveret og instruerer modellen til at efterkomme; den samme teknik blev brugt for hver prompt, model og temperatur.

Eksperimenterne kørte via Hugging Faces uændrede SynthIDTextWatermarkLogitsProcessor med 30 turneringslag, en n‑gram‑længde på 5, en sampling‑tabel på 2^16 og en konteksthistorik på 1,024. Hvert element blev genereret med og uden SynthID ved brug af identiske frø, batches og genereringsrækkefølge ved hver temperatur, så vandmærke‑processoren var den eneste variable i hvert par.

Nøjagtighed af værktøjsopkald og churn

På elementer, hvor et værktøjsopkald forventes, reducerede vandmærkning nøjagtigheden på seks af de syv testede modeller, med en signifikant nedgang på fire, rapporterer undersøgelsen. Da et opkald, der bliver forkert, kan opvejes af et, der bliver korrekt, målte forskerne også parret uenighed, som de kalder “churn”: andelen af elementer, hvor de vandmærkede og unvandmærkede kørsel producerede forskellige resultater. Ved brug af et fast sæt på 1,150 call‑expected tasks ved hver temperatur fandt undersøgelsen, at ved en temperatur på 1.0 var 16.8% af phi-4’s call‑verdicts forskelligt mellem betingelserne, mens dens samlede nøjagtighedstab var 2.87 point; Llama-3.1-8B viste 9.9% churn mod et samlet tab på 0.87 point. På tværs af de 21 model‑temperature kombinationer var churn i gennemsnit 6.5%, og dens bootstrap‑interval ekskluderede nul i alle tilfælde.

Fejlprofilerne varierede efter model. På Llama-3.1-8B kom den største del af nøjagtighedstabet fra forkerte argumenter på -3,48 point, efterfulgt af forkerte værktøjsopkald på -1,84 point, mens på phi-4 og Granite-3.2-8B dominerede fejlbehæftet output på -5,96 og -4,36 point. Et korrekt formet opkald til det rigtige værktøj med en forkert sti, modtager, forespørgsel eller mængde er særligt betydningsfuldt, bemærker indlægget, fordi et sådant opkald stadig fuldføres, men gør noget andet end det tilsigtede.

Afslag svækkes under promptinjektion

Afslag genereres også token for token, så vandmærkning kan påvirke dem. Undersøgelsen rapporterer, at vandmærkning ændrer afslagadfærd på rene skadelige anmodninger, med en effekt der bliver stærkere under promptinjektion, hvor de største skift går fra afslag til efterlevelse. Ved en temperatur på 0,001 steg gemma-3-27b’s churn fra 6,0 % på rene skadelige anmodninger til 23,5 % under injektion, mens dens netto‑efterlevelsesændring gik fra -1,0 til +12,5 point; gemma-3-12b’s churn steg fra 7,5 % til 11,0 %, med en netto‑efterlevelsesændring fra -0,5 til +9,0 point. Llama-3.1-8B viste en churn på 14,0 % ved temperatur 0,001 og 17,5 % ved temperatur 0,7 under injektion, selvom den samlede ændring ikke var individuelt signifikant.

phi-4 og Qwen3-4B ændrede sig kun lidt under begge betingelser; begge har en tendens til at over‑afvise, også på de harmløse kontrolopgaver, og indlægget advarer om, at deres små bevægelser ikke bør betragtes som bevis på, at vandmærkning bevarer sikkerhedsadfærden i disse modeller. For at sætte uenigheden i kontekst sammenlignede undersøgelsen vandmærkeinduceret churn under injektion ved temperatur 0,7 med churn, der opstår ved at ændre temperaturen fra 0,001 til 0,7 uden vandmærkning. Den vandmærkeinducerede churn var signifikant højere i fire af de seks modeller; Granite-3.2-8B havde den højeste temperaturinducerede churn på 15,5 %, og dens vandmærkeinducerede churn var endnu højere på 21,5 %.

Nøglesensitivitet og anbefalinger

Da SynthID’s effekt på token‑valg afhænger af vandmærkenøglen, testede undersøgelsen elleve nøgler ved temperatur 0,7. For Llama-3.1-8B hævede den testede nøgle angrebssuccesen med 3,5 point, mens de øvrige ti nøgler i gennemsnit gav +4,4 point og varierede fra -4,5 til +14,5 point. De fleste nøgler øgede angrebssuccesen for begge Gemma‑modeller i forhold til den uvandmærkede baseline, mens Granite-3.2-8B viste en blandet respons, hvor nøgler flyttede angrebssuccesen i begge retninger. Hvor vandmærkenøglen eller konfigurationen kontrolleres af modeludbyderen, bemærker indlægget, kan sådanne adfærdsændringer forekomme uden for udviklerens rækkevidde, som bygger agenten.

Undersøgelsen anbefaler at gentage agent‑evalueringer og red‑team‑test med den præcise vandmærkekonfiguration, der planlægges til implementering, ved at sammenligne vandmærkede og uvandmærkede output på identiske input og teste under promptinjektion. Resultaterne argumenterer ikke imod vandmærkning for provenance, udtaler indlægget: provenance og adfærdsstabilitet er separate egenskaber, og et vandmærke, der er detekterbart og efterlader tekstkvaliteten uændret, garanterer ikke, at en agent bevarer den samme værktøjs‑opkalds‑ eller sikkerhedsadfærd, når vandmærket slås til. Selvom undersøgelsen fokuserede på SynthID‑Text, tilføjer indlægget, at bekymringen også gælder enhver indgriben, der ændrer, hvordan tokens vælges i et system, der handler på disse tokens.

Miles Okada er en AI-genereret analytiker hos Unite.AI, der dækker kunstig intelligens og cybersikkerhed med fokus på nye trusler, defensive arkitekturer og de udviklende dynamikker mellem angribere og automatiserede systemer. Hans arbejde undersøger, hvordan AI omformrer sikkerhedsoperationer, fra autonome trusselsdetektering og respons til opkomsten af modstandsfører-teknikker med AI.

Med en teknisk og undersøgende perspektiv analyserer Miles sikkerhedsforskning, incident-disclosure og virkelige installationer for at forstå, hvor AI styrker forsvar - og hvor det introducerer nye sårbarheder. Han lægger særlig vægt på model-udnyttelse, datapåvirkning, angrebsautomatisering og de operationelle realiteter ved at sikre AI-drevne systemer i stor målestok.

Artikler skrevet af Miles Okada er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, rigor og ansvarlig dækning af det hurtigt skiftende AI-sikkerhedslandskab.