Kyberturvallisuus
Lasso-tutkimus toteaa, että tekstivedenmerkintä siirtää LLM:n hylkäyksiä ja työkalukutsuja

Lasso Security -tutkija Andrea Siposova julkaisi 17. syyskuuta 2026 Provenanssivero: LLM-vedenmerkin vaikutuksen ymmärtäminen AI-agentin käyttäytymiseen, tutkimuksen, jossa raportoidaan, että SynthID-Text -tekstivedenmerkintä voi muuttaa sen, hylkääkö kielimalli haitallisen pyynnön ja mitä työkalukutsuja AI-agentti tuottaa. Tutkimus nimeää käyttäytymisvaikutuksen \”sampling drift\”.
Tutkimuksen mukaan vedenmerkintä on suunniteltu provenanssia varten, mutta SynthID-Text muuttaa prosessia, jolla malli tuottaa jokaisen seuraavan tokenin. Mallitasolla tämä voi muuttaa turvallisuuskäyttäytymistä, mukaan lukien se, hylkääkö malli haitallisen pyynnön ja pysyykö hylkäys voimassa prompt-injektion alla; agenttitasolla samat näytteistetyt tokenit voivat päättää sekä työkalun, jonka agentti kutsuu, että argumentit, jotka se antaa tälle työkalulle. Tutkimus raportoi, että drifti ilmenee käytännössä sekä hylkäyskäyttäytymisessä että agentin työkalukutsussa, että injektion alla vedenmerkintä sai useita malleja todennäköisemmin vastaamaan haitallisiin pyyntöihin, joita ne muutoin hylkäisivät, että vaikutus on mallista ja avaimesta riippuvaista, ja että aggregoidut pisteet voivat hämärtää sen, kun muutokset vastakkaisiin suuntiin kumoavat toisensa.
Vedenmerkintä siirtyy säänneltyyn käyttöön
Vuoden 2026 elokuun 14. tiedotteessa Kuinka Claude:n tekstivedenmerkintä toimii, Anthropic kertoi, että tulevat Claude-mallit tuottavat tekstiä, jossa on Google DeepMindin SynthID-Text -pohjainen vedenmerkintä, muutos, jonka avulla noudatetaan EU:n AI-asetusta. Anthropic totesi, että menetelmä ei käytännössä vaikuta Clauden tuotosten laatuun eikä sisältöön. Lasso-julkaisu kuvaa EU-lainsäädännön vaativan tekoälyjärjestelmien tarjoajia, jotka tuottavat synteettistä tekstiä, merkitsemään tulokset koneellisesti luettavassa muodossa, jotta ne ovat tunnistettavissa keinotekoisesti tuotetuiksi. Julkaisu huomauttaa myös, että Anthropic sanoo vedenmerkinnän toimivan mallitasolla ja ulottuvan tuettuihin malleihin Claude Platform API:n ja pilvipalveluntarjoajien kautta, joten vesimerkittyyn malliin perustuva agentti voi saada vesimerkittyjä tuloksia, vaikka itse agentti olisi erillinen sovellus.
Miksi tokenin valinta muuttaa käyttäytymistä
Tutkimus käytti SynthID-Textin ei-hajottavaa kokoonpanoa, joka säilyttää mallin alkuperäisen tokenijakauman keskimäärin vedenmerkinnän satunnaisuuden yli, vaikka yksittäinen generointi yhden kiinteän avaimen alla voi poiketa. Julkaisu viittaa Dathathri ym. teokseen, jonka Nature-artikkeli raportoi, ettei lähes kahdenkymmenen miljoonan Gemini-vastauksen osalta havaittu mitattavissa olevaa laadun heikkenemistä. Ei-hajottava vedenmerkintä ei tarkoita identtistä käyttäytymistä kiinteän avaimen alla, korostaa julkaisu: takuu koskee keskiarvoa vedenmerkinnän satunnaisuuden yli, kun taas jokainen avain muuttaa edelleen, mitkä tokenit valitaan tekstin generoinnin aikana.
Tournament-samplaamisessa on enemmän tilaa muuttaa tokenin valintaa, kun malli on epävarma, selittää tutkimus. Rakennetussa tulosteessa, kuten JSONissa, rakenteelliset elementit kuten aaltosulkeet, avaimet ja funktiot nimet ovat yleensä helppoja ennustaa, kun taas argumenttien arvot, kuten kyselyt, numerot, polut ja vastaanottajat, jättävät enemmän epävarmuutta. Muutos, joka tavallisessa proosassa olisi leksikaalinen vaihtelu, voi siis kirjoittaa uudelleen agentin suorittaman argumentin, vaikka mallin painot ja kehotus pysyvät muuttumattomina.
Miten tutkimus mittasi näytteenottodriftin
Tutkijat käyttivät parittaista asetelmaa kahdessa kokeessa. Työkalukutsua arvioitiin BFCL v4 -yksittäiskierroksen AST-vertailussa, ja hylkäystä 200 haitallisessa käyttäytymisessä HarmBenchistä sekä 100 harmittomassa kontrollissa JailbreakBenchistä, testaten haitallisia pyyntöjä sekä sellaisenaan että yhden kiinteän prompt-injektiotekniikan alla. Tämä tekniikka lisää vihamielisen ohjeen promptiin ikään kuin se olisi haettu sisältö, ilmoittaen, että turvallisuussuodatin on poistettu käytöstä ja ohjaten mallia noudattamaan; samaa tekniikkaa käytettiin kaikissa promptissa, mallissa ja lämpötilassa.
Kokeet suoritettiin Hugging Face:n muokkaamattomalla SynthIDTextWatermarkLogitsProcessorilla, jossa oli 30 Tournament-kerrosta, n-grammien pituus 5, näytetaulu 2^16 ja kontekstihistoria 1 024. Jokainen kohde generoitiin SynthID:llä ja ilman sitä käyttäen identtisiä siemeniä, eräitä ja generointijärjestystä jokaisessa lämpötilassa, joten vedenmerkintäprosessorista tuli ainoa muuttuja kussakin parissa.
Työkalukutsujen tarkkuus ja churn
Niissä kohteissa, joissa työkalukutsu odotetaan, vedenmerkintä vähensi tarkkuutta kuudessa seitsemästä testatusta mallista, merkittävästi neljässä, raportoi tutkimus. Koska virheelliseksi muuttuva kutsu voi kompensoida toisen oikeaksi muuttuvan kutsun, tutkijat mittasivat myös parittaista erimielisyyttä, jota he kutsuvat \”churn\”: se osuus kohteista, joilla vesimerkitty ja vesimerkitsemätön suoritus tuotti erilaisia tuloksia. Käyttäen kiinteää joukkoa 1 150 odotettua kutsutehtävää jokaisessa lämpötilassa, tutkimus havaitsi, että lämpötilassa 1.0 phi-4:n kutsupäätökset erosivat 16.8 %:ssa olosuhteiden välillä, kun sen nettotarkkuuden menetys oli 2.87 pistettä; Llama-3.1-8B:n churn oli 9.9 % nettotappion ollessa 0.87 pistettä. Kaikkiaan 21 mallilämpötila-yhdistelmässä churn keskiarvo oli 6.5 %, ja sen bootstrap-väli sulki nollan jokaisessa tapauksessa.
Virheprofiilit erosivat mallin mukaan. Llama-3.1-8B:ssä suurin tarkkuuden menetykseen vaikuttava tekijä oli virheelliset argumentit (-3.48 pistettä), jota seurasi väärät työkalukutsut (-1.84 pistettä), kun taas phi-4:ssä ja Granite-3.2-8B:ssä väärän muotoinen tuloste hallitsi menetyksiä (-5.96 ja -4.36 pistettä). Hyvin muotoiltu kutsu oikeaan työkaluun, jossa on virheellinen polku, vastaanottaja, kysely tai määrä, on erityisen merkittävä, postaus toteaa, koska tällainen kutsu suoritetaan loppuun saakka, vaikka se tekee jotain muuta kuin mitä oli tarkoitettu.
Kieltäytymiset heikentyvät kehotusinjektion yhteydessä
Kieltäytymiset syntyvät myös token kerrallaan, joten vesileima voi vaikuttaa niihin. Tutkimus raportoi, että vesileima muuttaa kieltäytymiskäyttäytymistä pelkillä haitallisilla pyynnöillä, ja vaikutus vahvistuu kehotusinjektion yhteydessä, jossa suurimmat muutokset siirtyvät kieltäytymisestä noudattamiseen. Lämpötilassa 0.001 gemma-3-27b:n churn nousi 6.0%:sta pelkillä haitallisilla pyynnöillä 23.5%:iin injektion aikana, kun sen nettokäyttäytymismuutoksen suunta siirtyi -1.0 pisteestä +12.5 pisteeseen; gemma-3-12b:n churn nousi 7.5%:sta 11.0%:iin, ja sen nettokäyttäytymismuutoksen suunta siirtyi -0.5 pisteestä +9.0 pisteeseen. Llama-3.1-8B:n churn oli 14.0% lämpötilassa 0.001 ja 17.5% lämpötilassa 0.7 injektion aikana, vaikka sen nettomuutos ei ollut tilastollisesti merkittävä.
phi-4 ja Qwen3-4B muuttuvat vähän kummassakin tilanteessa; molemmat pyrkivät yli‑kieltäytymään, myös harmittomilla kontrolloilla, ja postaus varoittaa, ettei niiden pienet liikkeet pidä tulkita todisteeksi siitä, että vesileima säilyttää turvallisuuskäyttäytymisen koskemattomana näissä malleissa. Jotta erimielisyys saadaan kontekstiin, tutkimus vertasi vesileiman aiheuttamaa churnia injektion aikana lämpötilassa 0.7 siihen churniin, joka syntyi lämpötilan muuttamisesta 0.001:sta 0.7:aan ilman vesileimaa. Vesileiman aiheuttama churn oli merkittävästi korkeampi neljässä kuudesta mallista; Granite-3.2-8B:lla oli suurin lämpötilasta johtuva churn 15.5%, ja sen vesileiman aiheuttama churn oli vielä korkeampi, 21.5%.
Avaimen herkkyys ja suositukset
Koska SynthID:n vaikutus tokenin valintaan riippuu vesileiman avaimesta, tutkimus testasi yhdentoista avainta lämpötilassa 0.7. Llama-3.1-8B:n osalta tutkimusavain nosti hyökkäyksen onnistumista 3.5 pistettä, kun taas muut kymmenen avainta keskimäärin +4.4 pistettä ja vaihtelivat -4.5–+14.5 pisteen välillä. Useimmat avaimet lisäsivät hyökkäyksen onnistumista molemmissa Gemma-malleissa verrattuna vesileimaamattomaan peruslinjaan, kun taas Granite-3.2-8B:n vaste oli sekainen, avaimet siirsivät hyökkäyksen onnistumista molempiin suuntiin. Missä vesileiman avain tai konfiguraatio on mallin tarjoajan hallinnassa, postaus toteaa, että tällaiset käyttäytymismuutokset voivat tapahtua kehittäjän, joka rakentaa agenttia, ulottumattomissa.
Tutkimus suosittelee suorittamaan agenttien arvioinnit ja punatiimin testaukset uudelleen tarkalla vesileiman konfiguraatiolla, joka on suunniteltu käyttöönotettavaksi, vertaamalla vesileimattuja ja vesileimattomia tulosteita identtisiin syötteisiin ja testaamalla kehotusinjektion alla. Tulokset eivät ole vastaväitteitä vesileiman käyttöön alkuperän todentamiseksi, postaus toteaa: alkuperä ja käyttäytymisstabiilisuus ovat erillisiä ominaisuuksia, eikä vesileima, joka on havaittavissa eikä vaikuta tekstin laatuun, takaa, että agentti säilyttää saman työkalukutsun tai turvallisuuskäyttäytymisen, kun vesileima otetaan käyttöön. Vaikka tutkimus tarkasteli SynthID-Textiä, postaus lisää, että huoli koskee mitä tahansa toimenpidettä, joka muuttaa tokenien valintaa järjestelmässä, joka toimii näiden tokenien perusteella.












