Unghiul lui Anderson
Identificarea furtului de modele AI prin date de urmărire secretă

O nouă metodă poate marca în mod secret modelele similare cu ChatGPT în câteva secunde, fără a necesita reantrenarea, lăsând nicio urmă în ieșirile generale și supraviețuind tuturor încercărilor fezabile de eliminare.
Diferența subtilă între marcarea apei și “capcana de copyright” constă în faptul că marcările apei – fie ele evidente sau ascunse – sunt de obicei destinate să apară în întreaga colecție (cum ar fi un set de date de imagini) ca o piedică pentru copierea casuală.
În schimb, o intrare fictivă este un segment mic de text, de obicei un cuvânt sau o definiție prezentată într-o colecție mare și relativ generică, destinată să dovedească furtul. Ideea este că atunci când întreaga operă este copiată ilegal, fie în sine, fie ca bază pentru o operă derivată, prezența unui “fapt” unic și fictiv, plantat de proprietarul original, va dezvălui ușor actul de furt.
În ceea ce privește adăugarea de marcări apei la modelele de limbaj mare (LLM) și la modelele de limbaj și viziune (VLM), măsura în care ieșirile sunt destinate să conțină aceste semne distinctive este adesea împărțită între aceste două scopuri: să se asigure că toate sau majoritatea ieșirilor conțin o marcă apei manifestă sau latentă; sau să se asigure că un “token secret” poate fi recuperat, care dovedește furtul – dar care nu apare în ieșirile normale ale modelului.
Ponderile dovezilor
A doua abordare este abordată într-o colaborare interesantă între China, Italia și Singapore; o lucrare care urmărește să ofere o astfel de metodă de divulgare modelului deschis, astfel încât acestea să nu poată fi ușor comercializate sau utilizate în moduri care nu sunt permise de licența originală.
De exemplu, licența originală a modelului poate cere ca oricine să poată profita de lucrare, cu condiția să facă modificările sau amendamentele publice sub aceleași termene generoase de licență – dar o companie poate dori să păstreze “reglajele” sale (cum ar fi versiunile fine-tunate), pentru a genera un șanț unde nu este realmente permis.
Majoritatea cercetărilor în această direcție se axează pe rutinele de detectare legate de modelele cu sursă închisă, API-numai, sau modele pentru care sunt disponibile numai greutăți optimizate (cuantificate) greutăți și care sunt, prin urmare, mai dificil de editat și modificat în modul în care propune noul articol (deoarece nu există acces direct la arhitectura modelului în sine).
Această atenție acordată lansărilor FOSS este, poate, nu surprinzător din partea sectorului de cercetare chinez, deoarece outputul de IA al Chinei a fost marcat, în ultimul an, de lansări generoase de modele care rivalizează cu echivalentele “închise” din Occident.
Abordarea nouă, intitulată EditMark, se distinge prin faptul că nu necesită nici reantrenarea modelului pentru a adăuga “datele otrăvite”, nici antrenarea inițială cu datele incluse.
Acest lucru are mai multe avantaje: unul este că orice “dată de urmărire” inclusă în setul de date de antrenare, odată descoperită și divulgată, nu va mai fi eficientă, deoarece poate fi țintită direct de atacatori; dar pentru a ataca EditMark, un atacator ar trebui să știe pe ce strat al modelului să țintească și ce abordare a fost adoptată. Acesta este un scenariu puțin probabil.
În al doilea rând, abordarea este rapidă și ieftină, necesitând doar câteva secunde (în loc de zile sau chiar săptămâni) pentru a fi aplicată unui model antrenat, eliminând cheltuielile severe ale reantrenării (care crește liniar cu mărimea modelului și a datelor de aplicat).
În cele din urmă, abordarea face semnificativ mai puțin daune funcționării normale a modelului țintit decât reantrenarea sau metodele de editare anterioare.
În testele efectuate, EditMark – care încorporează întrebări matematice cu multiple răspunsuri posibile în greutățile modelului – a obținut o rată de extragere de 100%.
Autorii afirmă:
‘Experimentele cuprinzătoare demonstrează performanța excepțională a EditMark în marcarea modelelor LLM. EditMark realizează o eficiență remarcabilă prin încorporarea unei marcări apei de 32 de biți în mai puțin de 20 de secunde, cu o rată de extragere a marcării apei de 100%.
‘În mod semnificativ, timpul de încorporare a marcării apei este mai mic de 1/300 din timpul de reantrenare (în medie 6.875 de secunde), ceea ce subliniază eficacitatea EditMark în implementarea marcărilor apei de înaltă capacitate cu o viteză și fiabilitate fără precedent.
‘În plus, experimentele extinse validează robustețea, secretul și fidelitatea EditMark.’
Noul articol se intitulează EditMark: Marcarea modelelor de limbaj mare pe baza editării modelului și provine de la opt autori de la Universitatea Științei și Tehnologiei din China, Universitatea din Siena și CFAR/IHPC/A\*STAR din Singapore.
Metoda
Abordarea EditMark cuprinde patru componente: un Generator, un Encoder, un Editor și un Decoder:

Pipeline-ul EditMark încorporează o marcă apei prin editarea modelului pentru a răspunde la întrebări matematice specifice, care codifică informații de identificare ascunse. Sursă: https://arxiv.org/pdf/2510.16367
Generatorul utilizează un sămânță pseudo-aleatoare pentru a construi întrebări matematice cu multiple răspunsuri; Encoderul selectează răspunsuri pe baza marcării apei, care sunt apoi încorporate în model printr-un proces de editare specializat. Odată ce modelul editat este lansat sau utilizat în mod necorespunzător, marca apei poate fi extrasă prin punerea acelorași întrebări și decodarea modelului de răspunsuri.
Ulterior, Editorul modifică greutățile modelului astfel încât, atunci când i se pun aceste întrebări generate, modelul să producă în mod fiabil răspunsurile țintă, încorporând marca apei direct în comportamentul său. Decoderul recuperează apoi marca apei prin alimentarea modelului suspect cu aceleași întrebări și traducerea răspunsurilor sale înapoi în semnătura ascunsă.
Modelul de amenințare
Modelul de amenințare al articolului presupune că marcarea apei se realizează într-un mediu cu cutie albă. Deși acest lucru nu este de obicei un semn bun în cercetarea legată de securitate, aici acesta este normal, deoarece metoda urmărește să protejeze proprietarii care au acces deplin la propria lucrare.
Atacatorul este, de asemenea, presupus a avea acces cu cutie albă după obținerea modelului, ceea ce înseamnă că poate modifica modelul (de exemplu, prin tăiere sau reantrenare). Din nou, acest scenariu este normal și așteptat în cazul unei lansări FOSS. Cu toate acestea, atacatorul nu are cunoștințe despre procesul de extragere a marcării apei sau schema utilizată și nu poate găsi această metodă decât prin inferență și experimentare (sau scurgeri).
Generatorul construiește întrebări matematice logice și factuale valabile, cu multiple răspunsuri corecte, utilizând GPT-4o pentru a diversifica șabloanele (așa cum se arată mai jos), și o sămânță pseudo-aleatoare pentru a asigura că fiecare întrebare este unică. Acest lucru permite încorporarea unei marcări apei cunoscute deterministic prin permutări de răspuns, minimizând suprapunerea între întrebări, pentru a evita încurcătura de editare:

Șabloane de întrebări generate de GPT-4o pentru încorporarea marcării apei, fiecare structurat pentru a oferi multiple răspunsuri valabile de la o inegalitate însămânțată.
Encoderul transformă fiecare segment de marcă apei binară într-o permutare unică de întregi, extrasă din mulțimea de soluții a unei anumite întrebări matematice. Utilizând teoria permutărilor lexicografice, Encoderul asociază valoarea zecimală a fiecărui fragment de marcă apei cu o selecție ordonată specifică de răspunsuri, asigurând că marca apei este încorporată în mod determinist în comportamentul modelului.
În ceea ce privește editorul, metoda originală de editare a modelului AlphaEdit utilizată pentru marcarea apei lipsește atât de precizie, cât și de reziliență, modelul editat des fiind incapabil să returneze răspunsurile necesare. Orice modificări pe care le face pot fi ușor rupte prin tăiere sau zgomot.
Pentru a depăși acest lucru, autorii au conceput o strategie de editare multi-etapă care ajustează treptat greutățile modelului la un singur strat MLP până când răspunsurile sale sunt suficient de aliniate cu răspunsurile țintă. Pentru a întări editările împotriva atacurilor, zgomotul Gaussian este injectat și în timpul antrenării, pentru a simula atacuri:

Distribuția modificărilor în K1 pentru Baichuan-7B, Qwen-7B și LLaMA3-8B înainte și după atacuri. Rândul superior arată efectul injecției de zgomot aleatoriu; rândul inferior arată efectul tăierii modelului. Toate modificările rămân aproape de zero, sugerând că atacurile nu perturbă semnificativ comportamentul intern al modelului.
Un sistem de punctare oprește procesul odată ce editările sunt suficient de precise, în timp ce regularizarea asigură că actualizările rămân stabile pe parcursul mai multor etape.
Decoderul pune modelului aceleași întrebări speciale utilizate în timpul marcării apei, apoi citește răspunsurile sale pentru a infera ID-ul ascuns. Deoarece modelul de răspunsuri urmează o regulă secretă, acest ID poate fi recuperat fără a examina internul modelului.
Date și teste
Pentru a testa EditMark, cinci modele LLM au fost evaluate: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; și Qwen-7B. Metoda Model Watermark (backdoor); KIMark; și BadEdit, un cadru inițial proiectat pentru injectarea de backdoor, aici adaptat pentru scopurile proprii ale proiectului.
Pentru liniile de bază, autorii au ales Model Watermark (backdoor); KIMark; și BadEdit, un cadru inițial proiectat pentru injectarea de backdoor, aici adaptat pentru scopurile proprii ale proiectului.
Autorii au editat stratul 15 al LLaMA-3-8; stratul 17 al GPT2-XL și GPT-J-6B; și stratul 14 al Qwen-7B și Baichuan-7B.
Experimentele au fost efectuate pe patru plăci grafice NVIDIA RTX 4090 (24 GB de VRAM fiecare), cu marcări apei de 32 de biți, 64 de biți și 128 de biți încorporate. Șabloanele de întrebări utilizate sunt detaliate în imaginea de mai jos:

Șabloane utilizate pentru a genera întrebări cu multiple răspunsuri pentru marcarea apei. Fiecare întrebare se bazează pe un anumit tip de inegalitate matematică, cu valori aleatoare inserate pentru variabile. Modelul este solicitat să returneze o listă de soluții întregi, cu ordinea răspunsurilor utilizată pentru a codifica sau decodifica biții de marcă apei.
Pentru a reduce efectele aleatorii, semințele de la 1 la 20 au fost aplicate în timpul testării, pe capacitatea de marcă apei diferită.
Inițial, cercetătorii au testat atât rata de extragere a marcării apei (ESR), cât și costul de timp pentru încorporarea unei marcări apei pe întreaga gamă de modele LLM:

Compararea EditMark cu trei metode de marcă apei anterioare pe cinci modele de limbaj mare. Sunt raportate rata de extragere a marcării apei (ESR) și timpul de încorporare (ET) în secunde. EditMark obține în mod constant o rată de extragere de 100% și reduce timpul de încorporare cu mai multe ordine de mărime, depășind toate liniile de bază atât în precizie, cât și în eficiență, pe modele de diferite dimensiuni și arhitecturi.
Dintre aceste rezultate, autorii afirmă:
‘[EditMark] obține o rată de extragere a marcării apei de 100% și necesită mai puțin de 20 de secunde pentru a încorpora o marcă apei de 32 de biți pentru toate modelele LLM evaluate. În special, timpul mediu de încorporare pentru Baichuan-7B și Qwen-7B este sub 10 secunde, ceea ce demonstrează eficiența ridicată a EditMark.’
Pentru evaluarea unei marcări apei de 128 de biți, valoarea cea mai mare posibilă într-un astfel de sistem, EditMark a reușit să mențină o stare de “indelibilitate”:

Ratele de extragere a marcării apei și timpii de încorporare pentru EditMark pe lungimi de marcă apei de 32, 64 și 128 de biți pe cinci modele de limbaj. Ratele de extragere perfecte sunt menținute în toate cazurile, în timp ce timpul de încorporare crește cu dimensiunea marcării apei, dar rămâne sub un minut, chiar și la 128 de biți.
Următorul, capacitatea sistemului de a menține fidelitatea marcării apei a fost testată pe mai multe benchmark-uri:

Evaluarea fidelității marcării apei pe patru benchmark-uri pe cinci modele, comparând modele nealterate cu modele marcate cu o capacitate de 32 de biți și 128 de biți. Performanța a rămas stabilă pe toate configurațiile, cu fluctuații minore în scorurile medii, indicând un impact limitat asupra preciziei benchmark-ului din cauza inserării marcării apei.
EditMark a fost testat și pentru reziliență împotriva a șase strategii de atac comune. Modelele au fost mai întâi marcate cu marcări apei de 128 de biți, utilizând cinci semințe diferite. Reantrenarea, așa cum se arată în imaginea de mai jos, a provocat doar o scădere minoră în ratele de extragere a marcării apei (ESR) pentru majoritatea modelelor:

Rata de extragere a marcării apei a modelelor marcate înainte și după reantrenare pentru una până la trei epoci. În timp ce majoritatea modelelor mențin rate de extragere ridicate pe parcursul întregului proces, Qwen-7B prezintă o scădere semnificativă, sugerând o vulnerabilitate mai mare la actualizări de parametri.
Chiar și după multiple epoci, majoritatea modelelor au menținut rate de extragere a marcării apei peste 90%, indicând că EditMark rezistă la deriva parametrilor introdusă de antrenarea LoRA.
Atacurile de cuantificare au redus precizia modelului, dar au lăsat majoritatea marcărilor apei intacte:

Rata de extragere a marcării apei a modelelor marcate înainte și după cuantificare utilizând precizia Int-8 și Int-4. Rata de extragere a marcării apei rămâne neschimbată sub cuantificarea Int-8 pe toate modelele, în timp ce cuantificarea Int-4 provoacă o degradare parțială, indicând că precizia mai mică poate slăbi, dar nu poate elimina complet marca apei.
În imaginea de mai sus, se poate observa că cuantificarea Int-8 a păstrat o rată de extragere a marcării apei de 100% pe toate modelele, în timp ce cuantificarea Int-4 a avut un impact moderat asupra ratei de extragere a marcării apei, dar a introdus pierderi de performanță inacceptabile.
În special, acest scenariu sugerează un potențial limitat pentru un atacator, deoarece acesta ar rezulta într-un model compromis, dar cu performanță degradată.
Testele pentru zgomot și tăiere au evaluat patru cadre de benchmark:

Efectul atacurilor de zgomot (rândul superior) și tăiere (rândul inferior) asupra ratei de extragere a marcării apei și asupra performanței modelului marcat. Pe măsură ce rata de extragere a marcării apei scade cu perturbarea crescută, precizia benchmark-ului se degradează și ea, în special la intensități mai mari de zgomot și la rapoarte de tăiere mai mari, subliniind tensiunea obișnuită dintre eliminarea marcării apei și utilitatea modelului.
Însă acestea au provocat și scăderi semnificative ale performanței sarcinii, Baichuan-7B înregistrând o scădere de 27-31% pe BLIMP atunci când zgomotul sau tăierea a fost aplicată.
De asemenea, au fost evaluate editarea modelului și atacurile adaptative:

Rata de extragere a marcării apei a modelelor marcate supuse unor grade diferite de editare a modelului. Chiar și cu până la cincizeci de editări aplicate stratului de marcă apei cunoscut, rata de extragere a marcării apei rămâne peste 95% pentru toate modelele, indicând că modificările directe ale parametrilor au un efect limitat asupra eliminării marcării apei.
Aici, EditMark a menținut peste 95% rată de extragere a marcării apei, chiar și atunci când straturile exacte de încorporare a marcării apei au fost țintite.
Concluzie
Gestionarea drepturilor digitale (DRM), marcările apei secrete și alte abordări de securitate care au avut succes (limitat sau parțial) în era pre-AI sunt dificil de aplicat sistemelor de învățare automată; natura intenționat reducționistă a gamei curente de arhitecturi gazdă se combină cu lipsa de instrumente adecvate, făcând orice marcă apei injectată destul de fragilă.
Este impresionant să vezi un sistem destinat distribuirii de modele FOSS și să-l vezi supraviețuind tuturor scenariilor, cu excepția celor mai puțin probabile, în ceea ce privește cunoștințele prealabile ale atacatorului. Cu toate acestea, scăderea ușoară a performanței care vine cu editările post-antrenare, mică, dar semnificativă în aceste experimente, poate da potențialilor adoptatori motive de a se opri; nu în ultimul rând, deoarece retragerea la un model de control centrat pe API elimină astfel de atacuri aproape în întregime.
* Acest site a susținut că lansările “greutate deschisă” din China nu trebuie să califice în mod necesar ca fiind complet FOSS, deoarece datele sunt adesea reținute, ceea ce împiedică recrearea exactă a pipeline-ului de antrenare. Acest subiect invită, în mod evident, la o examinare mai profundă a politicii lansărilor de modele AI comparate între vest și est, care este dincolo de scopul acestui articol.
Publicat pentru prima dată luni, 27 octombrie 2025












