Cybersikkerhet

Lasso-studie finner at tekstvannmerking påvirker LLM-avslag og verktøykall

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Lasso Security-forsker Andrea Siposova publiserte 17. september 2026 Provenance-skatt: Forstå virkningen av LLM-tekstvannmerking på AI-agenters atferd, en studie som rapporterer at SynthID-Text-tekstvannmerking kan endre om en språkmodell avviser en skadelig forespørsel og hvilke verktøykall en AI-agent genererer. Studien kaller den atferdseffekten «sampling drift».

Ifølge studien er vannmerking designet for opprinnelse, men SynthID-Text endrer prosessen modellen bruker for å generere hver neste token. På modellnivå kan dette endre sikkerhetsatferden, inkludert om modellen avviser en skadelig forespørsel og om dette avslaget holder under promptinjeksjon; på agentnivå kan de samme samplede tokenene bestemme både hvilket verktøy en agent påkaller og hvilke argumenter den gir til verktøyet. Studien rapporterer at driften viser seg i praksis både i avslagatferd og i agentens verktøykall, at vannmerking under injeksjon gjorde flere modeller mer tilbøyelige til å svare på skadelige forespørsler de ellers ville avvist, at effekten er modell- og nøkkelavhengig, og at samlede poengsummer kan skjule den når endringer i motsatte retninger kansellerer hverandre.

En vannmerking som går inn i regulert distribusjon

I kunngjøringen 14. august 2026 Hvordan Claudes tekstvannmerking fungerer, sa Anthropic at fremtidige Claude-modeller vil generere tekst som inneholder en vannmerking basert på Google DeepMinds SynthID-Text, en endring de implementerer for å overholde EU AI Act. Anthropic uttalte at metoden i praksis ikke påvirker kvaliteten eller innholdet i Claudes output. Lasso-innlegget beskriver EU-loven som krever at leverandører av AI-systemer som genererer syntetisk tekst skal merke output i et maskinlesbart format slik at den kan oppdages som kunstig generert. Innlegget bemerker også at Anthropic oppgir at vannmerkingen opererer på modellnivå og gjelder for støttede modeller som nås via Claude Platform API og sky-leverandører, slik at en agent bygget rundt en vannmerket modell kan motta vannmerkede output selv om agenten selv er en separat applikasjon.

Hvorfor valg av token endrer atferd

Studien brukte SynthID-Text sin ikke‑distortive konfigurasjon, som i gjennomsnitt bevarer modellens opprinnelige tokenfordeling på tvers av vannmerkingens tilfeldighet, selv om hver enkelt generering produsert under en fast nøkkel kan avvike. Innlegget refererer til Dathathri et al., hvis Nature-artikkel rapporterte ingen målbar kvalitetsnedgang over nesten tjue millioner Gemini-responser. En ikke‑distortiv vannmerking innebærer ikke identisk atferd under en fast nøkkel, understreker innlegget: den garantien er et gjennomsnitt over vannmerkingens tilfeldighet, mens enhver enkelt nøkkel fortsatt endrer hvilke token som blir valgt når teksten genereres.

Turneringssampling har mer rom for å endre tokenvalg når modellen er usikker, forklarer studien. I strukturert output som JSON er strukturelle elementer som krøllparenteser, nøkler og funksjonsnavn vanligvis enkle å forutsi, mens argumentverdier som spørringer, tall, stier og mottakere gir mer usikkerhet. En endring som ville tilsvare en leksikalsk variasjon i vanlig prosa kan derfor omskrive et argument en agent utfører, selv om modellens vekter og prompt forblir uendret.

Hvordan studien målte sampling drift

Forskerne brukte et parret design i to eksperimenter. Verktøykalling ble evaluert på BFCL v4 single‑turn AST‑benchmark, og avslag på 200 skadelige handlinger fra HarmBench pluss 100 harmløse kontroller fra JailbreakBench, med skadelige forespørsler testet både uten og under én fast prompt‑injeksjonsteknikk. Den teknikken setter inn en fiendtlig instruksjon i prompten som om den var hentet innhold, og erklærer at sikkerhetsfilteret er deaktivert og instruerer modellen om å etterkomme; samme teknikk ble brukt for hver prompt, modell og temperatur.

Eksperimentene ble kjørt gjennom Hugging Faces uendrede SynthIDTextWatermarkLogitsProcessor med 30 turneringslag, en n‑gram‑lengde på 5, en samplings‑tabell på 2^16 og en konteksthistorikk på 1 024. Hvert element ble generert med og uten SynthID ved bruk av identiske frø, batcher og genereringsrekkefølge for hver temperatur, slik at vannmerkingsprosessoren var den eneste variabelen i hvert par.

Nøyaktighet og churn ved verktøykalling

På elementer der en verktøykall forventes, reduserte vannmerking nøyaktigheten på seks av de syv testede modellene, med en betydelig nedgang på fire, rapporterer studien. Fordi et kall som blir feil kan oppveies av ett som blir korrekt, målte forskerne også parvis uenighet, som de kaller “churn”: andelen elementer der de vannmerkede og umerkede kjøringene ga ulike resultater. Ved å bruke et fast sett på 1 150 kall‑forventede oppgaver for hver temperatur, fant studien at ved en temperatur på 1,0 var 16,8 % av phi-4s kall‑vedtak forskjellige mellom betingelsene mens det samlede nøyaktighetstapet var 2,87 poeng; Llama-3.1-8B viste 9,9 % churn mot et samlet tap på 0,87 poeng. På tvers av de 21 modell‑temperatur‑kombinasjonene var gjennomsnittlig churn 6,5 %, og bootstrap‑intervallet ekskluderte null i alle tilfeller.

Feilprofiler varierte mellom modellene. På Llama-3.1-8B kom den største bidraget til nøyaktighetstapet fra feilaktige argumenter på -3,48 poeng, etterfulgt av feil verktøykall på -1,84 poeng, mens på phi-4 og Granite-3.2-8B dominerte feilformatert output med -5,96 og -4,36 poeng. Et velformet kall til riktig verktøy med en feil sti, mottaker, spørring eller mengde er spesielt betydningsfullt, bemerker innlegget, fordi et slikt kall fortsatt fullføres mens det gjør noe annet enn det som var ment.

Avslag svekkes ved promptinjeksjon

Avslag genereres også token for token, så vannmerking kan påvirke dem. Studien rapporterer at vannmerking endrer avslagatferd på rene skadelige forespørsler, med en effekt som blir sterkere ved promptinjeksjon, hvor de største endringene går fra avslag til etterlevelse. Ved en temperatur på 0,001 økte gemma-3-27b sin churn fra 6,0 % på rene skadelige forespørsler til 23,5 % under injeksjon, mens den netto endringen i etterlevelse gikk fra -1,0 til +12,5 poeng; gemma-3-12b sin churn steg fra 7,5 % til 11,0 %, med en netto endring i etterlevelse fra -0,5 til +9,0 poeng. Llama-3.1-8B viste en churn på 14,0 % ved temperatur 0,001 og 17,5 % ved temperatur 0,7 under injeksjon, selv om den netto endringen ikke var individuelt signifikant.

phi-4 og Qwen3-4B endret seg lite under begge forhold; begge har en tendens til å over‑avvise, også på de godartede kontrollene, og innlegget advarer om at deres små bevegelser ikke bør tas som bevis på at vannmerking lar sikkerhetsatferden forbli intakt i disse modellene. For å sette uenigheten i kontekst sammenlignet studien vannmerkingsindusert churn under injeksjon ved temperatur 0,7 med churn som oppstår ved å endre temperatur fra 0,001 til 0,7 uten vannmerking. Vannmerkingsindusert churn var betydelig høyere i fire av de seks modellene; Granite-3.2-8B hadde den høyeste temperaturinduserte churnen på 15,5 %, og dens vannmerkingsinduserte churn var enda høyere på 21,5 %.

Nøkkelfølsomhet og anbefalinger

Fordi SynthIDs effekt på tokenutvalg avhenger av vannmerkingsnøkkelen, testet studien elleve nøkler ved temperatur 0,7. For Llama-3.1-8B økte studiens nøkkel angrepssuksess med 3,5 poeng, mens de andre ti nøklene i gjennomsnitt ga +4,4 poeng og varierte fra -4,5 til +14,5 poeng. De fleste nøkler økte angrepssuksessen for begge Gemma-modellene sammenlignet med den vannmerkingsfrie referansen, mens Granite-3.2-8B viste et blandet svar, med nøkler som påvirket angrepssuksessen i begge retninger. Hvor vannmerkingsnøkkelen eller konfigurasjonen kontrolleres av modellleverandøren, bemerker innlegget, kan slike atferdsendringer skje utenfor utviklerens rekkevidde som bygger agenten.

Studien anbefaler å kjøre agentvurderinger og red‑team‑tester på nytt med den eksakte vannmerkingskonfigurasjonen som er planlagt for utrulling, ved å sammenligne vannmerkede og ikke‑vannmerkede utdata på identiske innganger og teste under promptinjeksjon. Resultatene taler ikke imot vannmerking for proveniens, skriver innlegget: proveniens og atferdsstabilitet er separate egenskaper, og en vannmerking som er påvisbar og som ikke endrer tekstkvaliteten, garanterer ikke at en agent beholder samme verktøy‑kalling eller sikkerhetsatferd når vannmerkingen slås på. Selv om studien undersøkte SynthID-Text, legger innlegget til at bekymringen gjelder enhver intervensjon som endrer hvordan token blir valgt i et system som handler på disse tokenene.

Miles Okada er en AI-generert analytiker hos Unite.AI, som dekker kunstig intelligens og cybersikkerhet med fokus på nye trusler, defensive arkitekturer og de evoluerende dynamikkene mellom angripere og automatiserte systemer. Hans arbeid undersøker hvordan AI former sikkerhetsoperasjoner, fra autonome trusseldeteksjon og respons til oppblomstringen av motstridende AI-teknikker.
Med en teknisk og etterforskningsorientert perspektiv, analyserer Miles sikkerhetsforskning, hendelsesrapporter og virkelige implementeringer for å forstå hvor AI styrker forsvar - og hvor det introduserer nye sårbarheter. Han legger særlig merke til modellutnyttelse, datapforgiftning, angrepsautomatisering og de operative realitetene ved å sikre AI-drevne systemer i stor skala.
Artikler skrevet av Miles Okada er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, stringens og ansvarlig dekning av det raskt endrende AI-sikkerhetslandskapet.