Unghiul lui Anderson

Modele lingvistice personalizate sunt ușor de creat – și mai greu de detectat

mm
Adaugă Unite.AI la sursele tale preferate pe Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Clonele open-source ale ChatGPT pot fi fine-tune la scară și cu expertiză limitată sau inexistentă, facilitând modele lingvistice “private” care evită detectarea. Majoritatea instrumentelor nu pot urmări de unde provin aceste modele sau la ce au fost antrenate, permițând studenților și altor utilizatori să genereze texte AI fără a fi prinși; dar o nouă metodă afirmă că poate identifica aceste variante ascunse prin detectarea “trăsăturilor de familie” comune în ieșirile modelelor.

 

Conform unui studiu nou din Canada, modelele de chat AI personalizate, asemănătoare cu ChatGPT, sunt capabile să producă conținut de social media care seamănă îndeaproape cu scrierea umană și care poate păcăli algoritmii de detectare de ultimă generație și oamenii deopotrivă.

Articolul afirmă:

‘Un atacator realist motivat este probabil să fine-tuneze un model pentru stilul și cazul de utilizare specific, deoarece este ieftin și ușor de făcut. Cu un efort minim, timp și bani, am produs generatoare fine-tune care sunt capabile de tweet-uri de social media mult mai realiste, atât din punct de vedere al caracteristicilor lingvistice, cât și al acurateței de detectare, și verificate prin annotări umane.’

Autorii subliniază că modelele personalizate de acest tip nu sunt limitate la conținutul de social media de scurtă durată:

‘Deși motivat de răspândirea conținutului AI pe rețelele de socializare și de riscurile asociate cu astroturfingul și campaniile de influență, subliniem că principalele constatări se extind la toate domeniile textuale.

‘Într-adevăr, fine-tuningul modelelor pentru generarea de conținut specific unui anumit stil este o metodă general aplicabilă, și una care este probabil deja utilizată de mulți utilizatori de inteligență artificială – ceea ce pune la îndoială dacă metodele existente de detectare a textului generat de IA sunt la fel de eficiente în lumea reală ca și în laboratorul de cercetare.’

După cum observă articolul, metoda utilizată pentru a crea aceste modele lingvistice personalizate este fine-tuningul, unde utilizatorii selectează o cantitate limitată de date țintă și le introduc într-un număr tot mai mare de instrumente de antrenare online ușor de utilizat și ieftine.

De exemplu, renumitul repository Hugging Face ofere fine-tuning pentru modelele de limbaj mare (LLM) prin intermediul unui sistem simplificat, utilizând sistemul AutoTrain Advanced, care poate fi rulat pentru câteva dolari prin intermediul unui GPU online sau gratuit, dacă utilizatorul are hardware adecvat:

Diverse structuri de preț pentru gama de GPU-uri disponibile pentru sistemul Hugging Face AutoTrain. Sursă: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Diverse structuri de preț pentru gama de GPU-uri disponibile pentru sistemul Hugging Face AutoTrain. Sursă: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Alte metode și platforme simplificate includ Axolotl, Unsloth și TorchTune.

Un exemplu de caz de utilizare ar fi un student care este obosit să scrie singur eseurile, dar se teme să fie prins de instrumentele de detectare AI online, care poate utiliza eseurile sale istorice reale ca date de antrenare pentru a fine-tune un model deschis foarte eficient, cum ar fi seria Mistral.

Deși fine-tuningul unui model tinde să încline performanța către datele de antrenare suplimentare și să degradeze performanța generală, modelele “personalizate” pot fi utilizate pentru a “de-AI” ieșirile din ce în ce mai distinctive ale sistemelor precum ChatGPT, într-un mod care reflectă stilul istoric al utilizatorului (și, pentru o autenticitate sporită, și limitele sale).

Cu toate acestea, s-ar putea utiliza exclusiv un model fine-tune, special conceput pentru o sarcină sau un set de sarcini îngust, cum ar fi un LLM fine-tune pe cursul unui modul universitar specific. Un astfel de model ar avea o perspectivă miopică, dar mult mai profundă asupra domeniului respectiv, decât un LLM general, cum ar fi ChatGPT, și ar costa probabil mai puțin de 10-20 de dolari pentru a fi antrenat.

Gheața LLM

Este dificil de spus care este amploarea acestei practici. Din punct de vedere anecdotice, pe diverse platforme de social media, am întâlnit recent multe exemple de afaceri care utilizează fine-tuningul LLM – cu siguranță mult mai multe decât acum un an; într-un caz, o companie a fine-tune un model de limbaj pe propriile sale piese de gândire publicate, care a putut să transforme o discuție haotică de pe Zoom cu un client nou într-o postare B2B politicoasă, aproape într-o singură trecere, la cerere.

Un model de acest fel necesită date pereche (exemplu înainte și după, la scară), în timp ce crearea unui “strat” personalizat al caracteristicilor unui anumit scriitor este o sarcină mai ușoară, mai asemănătoare cu transferul de stil.

Deși această practică este una clandestină (în ciuda numeroaselor titluri și studii academice pe această temă), unde nu există cifre disponibile, același simț comun care a condus la adoptarea legii TAKE IT DOWN în acest an se aplică și aici: activitatea țintă este posibilă și accesibilă, și există o înțelegere comună că utilizatorii potențiali sunt foarte motivați.

Există suficientă fricțiune în cele mai “simplificate” sisteme de fine-tuning online, astfel încât practica antrenării și utilizării modelelor fine-tune în mod “necinstit” rămâne, pentru moment, un caz de utilizare de nișă – deși, cu siguranță, nu dincolo de inventivitatea tradițională a studenților.

PhantomHunter

Acest lucru ne aduce la articolul principal de interes aici – o nouă abordare din China care reunește o varietate de tehnici într-un singur cadru – numit PhantomHunter – care afirmă că poate identifica ieșirile modelelor de limbaj fine-tune, care altfel ar putea trece drept lucrări originale ale oamenilor.

Sistemul este conceput pentru a funcționa chiar și atunci când modelul fine-tune specific nu a fost întâlnit anterior, bazându-se în schimb pe urme reziduale lăsate de modelul de bază original – pe care autorii le caracterizează ca “trăsături de familie” care supraviețuiesc procesului de fine-tuning.

În testele efectuate, articolul – intitulat PhantomHunter: Detecting Unseen Privately-Tuned LLM-Generated Text via Family-Aware Learning – raportează o acuratețe de detectare puternică, sistemul depășind evaluarea zero-shot GPT-4-mini în urmărirea unei mostre de text până la familia sa de modele.

Acest lucru sugerează că, cu cât un model este mai mult fine-tune, cu atât mai mult revelează despre ascendența sa, contrar ipotezei că fine-tuningul privat întotdeauna maschează originea unui model; în schimb, procesul de fine-tuning poate lăsa o amprentă detectabilă care, dacă este citită corect, dă de gol – cel puțin până la apariția unor progrese suplimentare, care par să apară săptămânal în acest moment.

Articolul afirmă*:

‘[Textul generat de mașină] detectarea în general distinge textul generat de LLM și textul scris de oameni prin clasificare binară. Metodele existente fie învață caracteristici textuale comune partajate de LLM-uri utilizând învățarea reprezentării sau proiectează metrice distinctive între texte umane și LLM prin semnale interne ale LLM-urilor (de exemplu, probabilități de token).

‘Pentru ambele categorii, testele au fost efectuate în principal pe date de la LLM-uri disponibile public, presupunând că utilizatorii generează texte utilizând servicii off-the-shelf publice.

Noi argumentăm că această situație este schimbată datorită dezvoltării recente a comunității LLM open-source. Cu ajutorul platformelor precum HuggingFace și tehnici de antrenare LLM eficiente, cum ar fi adaptarea de rang scăzut (LoRA), construirea de modele LLM fine-tune cu seturi de date private personalizate a devenit mult mai ușoară decât înainte.

‘De exemplu, au existat peste 60.000 de modele derivate Llama pe HuggingFace. După fine-tuningul privat pe un corpus necunoscut, caracteristicile învățate ale modelelor de bază ar putea să se schimbe, iar detectoarele LLMGT ar putea eșua, creând un risc nou, și anume că utilizatorii răuvoitori pot genera texte dăunătoare în mod privat, fără a fi prinși de detectoarele LLMGT.

‘O nouă provocare apare: Cum să detectăm textul generat de LLM-urile fine-tune private și open-source?

Metodă și antrenament

Sistemul PhantomHunter utilizează o strategie de învățare conștientă de familie, combinând trei componente: un extractor de caracteristici, care captează probabilitățile de ieșire de la modelele de bază cunoscute; un encoder contrastiv antrenat pentru a distinge între familii; și (așa cum se detaliază mai jos) un clasificator de amestec de experți care atribuie etichete de familie mostrelor de text noi:

Schema sistemului. PhantomHunter procesează o mostră de text prin extragerea caracteristicilor de probabilitate din multiple modele de bază, care sunt apoi codificate utilizând straturi CNN și transformer. Acesta estimează familia de modele pentru a calcula greutățile de porționare, care conduc un modul de amestec de experți în prezicerea dacă textul este generat de LLM. O pierdere contrastivă este aplicată în timpul antrenamentului pentru a rafina separarea între familii de modele. Sursă: https://arxiv.org/pdf/2506.15683

Schema sistemului. PhantomHunter procesează o mostră de text prin extragerea caracteristicilor de probabilitate din multiple modele de bază, care sunt apoi codificate utilizând straturi CNN și transformer. Sursă: https://arxiv.org/pdf/2506.15683

PhantomHunter funcționează prin trecerea unei bucăți de text prin mai multe modele de bază cunoscute și înregistrarea probabilității ca fiecare model să considere că următorul cuvânt este, la fiecare pas. Aceste modele sunt apoi introduse într-o rețea neuronală care învață caracteristicile distinctive ale fiecărei familii de modele.

În timpul antrenamentului, sistemul compară texte din aceeași familie și învață să le grupeze împreună, diferențiindu-le în același timp de cele din alte familii, ceea ce ajută la identificarea conexiunilor ascunse între modelele fine-tune și modelele de bază.

MOE

Pentru a decide dacă o bucăță de text a fost scrisă de un om sau de un model AI, PhantomHunter utilizează un sistem de amestec de experți, în care fiecare “expert” este ajustat pentru a detecta text dintr-o anumită familie de modele.

Odată ce sistemul ghicește din ce familie provine cel mai probabil textul, acesta utilizează acea presupunere pentru a decide câtă greutate să acorde opiniei fiecărui expert. Aceste opinii ponderate sunt apoi combinate pentru a lua decizia finală: AI sau om.

Antrenamentul sistemului implică multiple obiective: învățarea recunoașterii familiilor de modele; învățarea distincției între textul AI și cel uman; și învățarea separării diferitelor familii prin învățarea contrastivă – obiective care sunt echilibrate în timpul antrenamentului prin parametri ajustabili.

Prin concentrarea asupra modelelor partajate de fiecare familie, mai degrabă decât a particularităților modelelor individuale, PhantomHunter ar trebui, în teorie, să poată detecta chiar și modele fine-tune pe care nu le-a întâlnit anterior.

Date și teste

Pentru a dezvolta date pentru teste, autorii s-au concentrat pe cele două scenarii academice cele mai comune: scrierea și răspunsul la întrebări. Pentru scriere, au colectat 69.297 de rezumate din arhiva academică Arxiv, împărțite în domenii principale. Pentru răspunsul la întrebări, au curat 2.062 de perechi din setul de date HC3 din trei subiecte: ELI5; finanțe; și medicină:

Listă de surse de date și numărul acestora, în date curate pentru studiu.

Listă de surse de date și numărul acestora, în date curate pentru studiu.

În total, au fost antrenate douăsprezece modele pentru test. Cele trei modele de bază au fost LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; și Gemma 7B-it), din care au derivat nouă variante fine-tune, fiecare adaptat pentru a imita un domeniu sau un stil autorial diferit, utilizând date specifice de domeniu:

Statistici ale setului de date de evaluare, unde 'FT Domeniu' se referă la domeniul utilizat în timpul fine-tuningului și 'bază' indică faptul că nu s-a efectuat fine-tuning.

Statistici ale setului de date de evaluare, unde ‘FT Domeniu’ se referă la domeniul utilizat în timpul fine-tuningului și ‘bază’ indică faptul că nu s-a efectuat fine-tuning.

În total, prin urmare, trei modele de bază au fost fine-tune utilizând atât tehnici de fine-tuning complete, cât și LoRA în trei domenii distincte în fiecare dintre cele două scenarii de utilizare: scrierea de abstracte academice și răspunsul la întrebări. Pentru a reflecta provocările de detectare din lumea reală, modelele fine-tune pe date de științe computaționale au fost retrase din testele de scriere, în timp ce cele fine-tune pe date de finanțe au fost retrase din evaluările de răspuns la întrebări.

Framework-urile rivale selectate au fost RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; și DeTeCtive.

PhantomHunter a fost antrenat utilizând două tipuri de straturi de rețele neuronale: trei straturi convolutive cu max-pooling pentru a capta modele locale de text, și două straturi transformer cu patru capete de atenție fiecare pentru a modela relații pe termen lung.

Pentru învățarea contrastivă, care încurajează sistemul să diferențieze între diferitele familii de modele, parametrul temperatură a fost setat la 0,07.

Obiectivul de antrenament a combinat trei termeni de pierdere: L1 (pentru clasificarea familiilor) și L2 (pentru detectarea binară), fiecare ponderat cu 1,0, și L3 (pentru învățarea contrastivă), ponderat cu 0,5.

Modelul a fost optimizat utilizând Adam cu o rată de învățare de 2e-5 și o dimensiune a lotului de 32. Antrenamentul a avut loc timp de zece epoci complete, cu punctul de control cu cel mai bun randament selectat utilizând un set de validare. Toate experimentele au fost efectuate pe un server cu patru GPU-uri NVIDIA A100.

Metricele utilizate au fost scorul F1 pentru fiecare subset de testare, împreună cu rata de detectare adevărată, pentru comparație cu detectoarele comerciale.

Scoruri F1 pentru detectarea textului din modele fine-tune nevăzute. Primele două rezultate din fiecare categorie sunt încadrate și subliniate. 'BFE' se referă la extragerea caracteristicilor de probabilitate de bază, 'CL' la învățarea contrastivă, și 'MoE' la modulul de amestec de experți.

Scoruri F1 pentru detectarea textului din modele fine-tune nevăzute. Primele două rezultate din fiecare categorie sunt încadrate și subliniate.

Rezultatele testului inițial, vizualizate în tabelul de mai sus, arată că PhantomHunter a depășit toate sistemele de referință, menținând scoruri F1 peste 90% atât pentru textul uman, cât și pentru cel generat de mașină, chiar și atunci când a fost evaluat pe ieșiri de la modele fine-tune excluse din antrenament.

Autorii comentează:

‘Cu fine-tuning complet, PhantomHunter îmbunătățește scorul MacF1 cu 3,65% și 2,96% pe ambele seturi de date, respectiv; și cu fine-tuning LoRA, îmbunătățirile sunt de 2,01% și 6,09% respectiv.

‘Rezultatul demonstrează capacitatea puternică de detectare a lui PhantomHunter pentru texte generate de LLM-uri fine-tune nevăzute.’

Studiile de ablație au fost efectuate pentru a evalua rolul fiecărui component de bază în PhantomHunter. Atunci când elemente individuale au fost eliminate, cum ar fi extractorul de caracteristici, encoderul contrastiv sau clasificatorul de amestec de experți, s-a observat o scădere constantă a acurateței, indicând faptul că arhitectura se bazează pe coordonarea tuturor părților.

Autorii au examinat, de asemenea, dacă PhantomHunter poate generaliza dincolo de distribuția sa de antrenament și au stabilit că, chiar și atunci când a fost aplicat pe ieșiri de la modele de bază complet absente în timpul antrenamentului, a continuat să depășească metodele rivale – sugerând că semnăturile la nivel de familie rămân detectabile peste variantele fine-tune.

Concluzie

Un argument în favoarea modelelor de limbaj generative antrenate de utilizatori este acela că, cel puțin, aceste fine-tune și LoRA obscure păstrează gustul și excentricitățile individuale ale unui autor, într-un climat în care idiomul generic, inspirat de SEO, al chatbot-urilor AI amenință să genericizeze orice limbaj în care AI devine un contributor major sau dominant.

Cu devalorizarea eseurilor universitare, și cu studenții care acum înregistrează sesiuni masive de scriere pentru a dovedi că nu au utilizat AI la lucrările lor, mai mulți profesori din afara Europei (unde examenele orale sunt normalize) iau în considerare examenul oral ca o alternativă la lucrările prezentate. Mai recent, s-a propus revenirea la lucrul scris de mână.

Se poate argumenta că ambele soluții sunt superioare unei posibile reluări a curselor de arme deepfake; deși acestea vin cu costul efortului uman și al atenției, pe care cultura tehnologică încearcă în prezent să le automatizeze.

 

Vă rugăm să consultați secțiunea finală, după rezultatele principale, în lucrarea sursă, pentru detalii despre acest aspect.

* Conversia mea a citărilor inline ale autorilor în legături hipertext. Accentuările textului aparțin autorilor, nu mie.

Publicat pentru prima dată joi, 19 iunie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai