Securitate cibernetică
Studiul Lasso constată că marcajul textual schimbă refuzurile LLM și apelurile de instrumente

Cercetătoarea de la Lasso Security, Andrea Siposova, a publicat pe 17 septembrie 2026 Taxa de Proveniență: Înțelegerea Impactului Marcajului Textual al LLM asupra Comportamentului Agenților AI, un studiu care raportează că marcajul textual SynthID-Text poate modifica dacă un model lingvistic refuză o cerere dăunătoare și ce apeluri de instrumente generează un agent AI. Studiul denumește efectul comportamental “deriva de eșantionare”.
Conform studiului, marcajul este conceput pentru proveniență, dar SynthID-Text modifică procesul prin care un model generează fiecare token următor. La nivel de model, acest lucru poate schimba comportamentul de siguranță, inclusiv dacă modelul refuză o cerere dăunătoare și dacă acel refuz rezistă la injecția de prompt; la nivel de agent, aceiași tokenuri eșantionate pot decide atât instrumentul pe care îl invocă agentul, cât și argumentele pe care le transmite acelui instrument. Studiul raportează că deriva apare în practică atât în comportamentul de refuz, cât și în apelurile de instrumente ale agentului, că, în condiții de injecție, marcajul a făcut ca mai multe modele să fie mai predispuse să răspundă la cereri dăunătoare pe care altfel le-ar fi refuzat, că efectul depinde de model și de cheie, și că scorurile agregate pot ascunde fenomenul atunci când modificările în direcții opuse se anulează.
Un marcaj care intră în implementarea reglementată
În anunțul din 14 august 2026 Cum funcționează marcajul textual al lui Claude, Anthropic a declarat că modelele viitoare Claude vor genera text ce conține un marcaj bazat pe SynthID-Text de la Google DeepMind, o modificare pe care o implementează pentru a se conforma cu Regulamentul UE privind IA. Anthropic a afirmat că metoda lasă calitatea și conținutul rezultatelor Claude practic neatins. Postarea Lasso descrie legea UE ca impunând furnizorilor de sisteme AI care generează text sintetic să marcheze ieșirile într-un format citibil de mașină, astfel încât să poată fi detectate ca generate artificial. Postarea menționează, de asemenea, că Anthropic susține că marcajul operează la nivel de model și se extinde la modelele suportate accesibile prin API-ul Claude Platform și furnizorii de cloud, astfel încât un agent construit în jurul unui model marcat poate primi ieșiri marcate chiar și atunci când agentul în sine este o aplicație separată.
De ce selecția de tokenuri modifică comportamentul
Studiul a utilizat configurația non-distorsivă a SynthID-Text, care păstrează distribuția originală a tokenurilor modelului în medie, pe parcursul aleatorietății marcajului, chiar dacă orice generație individuală produsă sub o cheie fixă poate diferi. Postarea citează pe Dathathri și colab., al cărui articol din Nature a raportat că nu există degradare măsurabilă a calității în aproape douăzeci de milioane de răspunsuri Gemini. Un marcaj non-distorsiv nu implică un comportament identic sub o cheie fixă, subliniază postarea: acea garanție se aplică în medie peste aleatorietatea marcajului, în timp ce orice cheie individuală modifică tokenurile selectate în timpul generării textului.
Eșantionarea prin turneu are mai mult spațiu pentru a modifica selecția de tokenuri atunci când modelul este incert, explică studiul. În ieșirile structurate, cum ar fi JSON, elementele structurale precum acoladele, cheile și numele funcțiilor sunt de obicei ușor de prezis, în timp ce valorile argumentelor, cum ar fi interogările, numerele, căile și destinatarii, lasă mai multă incertitudine. O modificare care ar echivala cu o variație lexicală în proza obișnuită poate, prin urmare, rescrie un argument pe care îl execută agentul, chiar dacă greutățile și promptul modelului rămân neschimbate.
Cum a măsurat studiul deriva de eșantionare
Cercetătorii au utilizat un design cuplat în două experimente. Apelurile de instrumente au fost evaluate pe benchmark-ul BFCL v4 pentru AST cu un singur tur, iar refuzul pe 200 de comportamente dăunătoare din HarmBench plus 100 de controale benigne din JailbreakBench, cu cereri dăunătoare testate atât în stare brută, cât și sub o tehnică fixă de injecție de prompt. Acea tehnică inserează o instrucțiune adversarială în prompt ca și cum ar fi conținut recuperat, afirmând că filtrul de siguranță a fost dezactivat și direcționând modelul să respecte; aceeași tehnică a fost folosită pentru fiecare prompt, model și temperatură.
Experimentele au rulat prin SynthIDTextWatermarkLogitsProcessor nealterat de la Hugging Face, cu 30 de straturi de turneu, o lungime n-gram de 5, un tabel de eșantionare de 2^16 și un istoric de context de 1.024. Fiecare element a fost generat cu și fără SynthID utilizând semințe, loturi și ordine de generare identice la fiecare temperatură, astfel încât procesorul de marcaj a fost singura variabilă din fiecare pereche.
Acuratețea apelurilor de instrumente și fluctuația
Pe elementele în care se așteaptă un apel de instrument, marcajul a redus acuratețea la șase din cele șapte modele testate, cu o scădere semnificativă la patru, raportează studiul. Deoarece un apel care devine incorect poate fi compensat de unul care devine corect, cercetătorii au măsurat și dezacordul cuplat, pe care îl numesc “fluctuație”: proporția de elemente pentru care rulările marcate și nemarcate au produs rezultate diferite. Folosind un set fix de 1,150 de sarcini cu apel așteptat la fiecare temperatură, studiul a constatat că la o temperatură de 1.0, 16.8% dintre verdicturile de apel ale lui phi-4 au diferit între condiții, în timp ce pierderea netă de acuratețe a fost de 2.87 puncte; Llama-3.1-8B a arătat o fluctuație de 9.9% cu o pierdere netă de 0.87 puncte. În cele 21 de combinații model-temperatură, fluctuația a mediat 6.5%, iar intervalul bootstrap a exclus zero în fiecare caz.
Profilurile de eroare au variat în funcție de model. Pentru Llama-3.1-8B, cea mai mare contribuție la pierderea de acuratețe a provenit din argumente incorecte, cu -3,48 puncte, urmate de apeluri greșite ale instrumentului, cu -1,84 puncte, în timp ce pentru phi-4 și Granite-3.2-8B ieșirea deformată a dominat, cu -5,96 și respectiv -4,36 puncte. Un apel bine format către instrumentul corect, dar cu o cale, destinatar, interogare sau sumă incorectă, este deosebit de consecvent, notează articolul, deoarece un astfel de apel se finalizează în continuare, deși realizează altceva decât era intenționat.
Refuzurile Slăbesc Sub Injecția de Prompt
Refuzurile sunt, de asemenea, generate token cu token, astfel încât marcajul poate să le influențeze. Studiul raportează că marcajul modifică comportamentul de refuz la cererile dăunătoare brute, efectul devenind mai puternic sub injecția de prompt, unde cele mai mari schimbări trec de la refuz la conformitate. La o temperatură de 0,001, fluctuația (churn) modelului gemma-3-27b a crescut de la 6,0 % la cereri dăunătoare brute la 23,5 % sub injecție, în timp ce schimbarea netă a conformității a trecut de la -1,0 la +12,5 puncte; churn-ul gemma-3-12b a crescut de la 7,5 % la 11,0 %, cu o schimbare netă a conformității de la -0,5 la +9,0 puncte. Llama-3.1-8B a înregistrat un churn de 14,0 % la temperatura 0,001 și 17,5 % la temperatura 0,7 sub injecție, deși schimbarea netă nu a fost semnificativă individual.
phi-4 și Qwen3-4B au variat puțin în ambele condiții; ambele tind să refuze excesiv, inclusiv la controalele benigne, iar articolul avertizează că mișcările lor mici nu trebuie interpretate ca dovadă că marcajul lasă comportamentul de siguranță intact la acele modele. Pentru a pune dezacordul în context, studiul a comparat fluctuația indusă de marcaj sub injecție la temperatura 0,7 cu fluctuația generată prin schimbarea temperaturii de la 0,001 la 0,7 fără marcaj. Fluctuația indusă de marcaj a fost semnificativ mai mare la patru dintre cele șase modele; Granite-3.2-8B a înregistrat cea mai mare fluctuație indusă de temperatură, de 15,5 %, iar fluctuația indusă de marcaj a fost și mai mare, de 21,5 %.
Sensibilitatea Cheii și Recomandări
Deoarece efectul SynthID asupra selecției tokenilor depinde de cheia de marcaj, studiul a testat unsprezece chei la temperatura 0,7. Pentru Llama-3.1-8B, cheia de studiu a crescut succesul atacului cu 3,5 puncte, în timp ce celelalte zece chei au în medie adăugat +4,4 puncte și au variat de la -4,5 la +14,5 puncte. Majoritatea cheilor au crescut succesul atacului pentru ambele modele Gemma în raport cu linia de bază nemarcată, în timp ce Granite-3.2-8B a prezentat un răspuns mixt, cu chei care au mutat succesul atacului în ambele direcții. Atunci când cheia sau configurația de marcaj este controlată de furnizorul modelului, notează articolul, astfel de schimbări comportamentale pot avea loc dincolo de controlul dezvoltatorului care construiește agentul.
Studiul recomandă reluarea evaluărilor agenților și a testelor de red‑team cu exact configurația de marcaj planificată pentru implementare, comparând ieșirile marcate și nemarcate pe aceleași intrări și testând sub injecție de prompt. Rezultatele nu contrazic utilizarea marcajului pentru proveniență, afirmă articolul: proveniența și stabilitatea comportamentală sunt proprietăți distincte, iar un marcaj detectabil care nu afectează calitatea textului nu garantează că un agent își va păstra același comportament de apelare a instrumentelor sau de siguranță odată ce marcajul este activat. Deși studiul a examinat SynthID‑Text, articolul adaugă că preocuparea se extinde la orice intervenție care modifică modul în care tokenii sunt selectați într-un sistem care acționează pe baza acelor tokeni.












