Angolo di Anderson

I modelli linguistici personalizzati sono facili da creare – e più difficili da rilevare

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

I cloni open-source di ChatGPT possono essere adattati su larga scala e con limitata o nessuna esperienza, facilitando i “modelli linguistici privati” che evitano la rilevazione. La maggior parte degli strumenti non può tracciare da dove provengono questi modelli o a cosa sono stati addestrati, consentendo agli studenti e ad altri utenti di generare testi AI senza essere scoperti; ma un nuovo metodo afferma di poter identificare queste varianti nascoste rilevando “caratteristiche di famiglia” condivise negli output dei modelli.

 

Secondo uno studio recente del Canada, i modelli di chat AI personalizzati dall’utente, simili a ChatGPT, sono in grado di produrre contenuti per i social media che assomigliano molto alla scrittura umana e possono ingannare gli algoritmi di rilevamento di stato dell’arte e gli esseri umani.

Il documento afferma:

‘Un attaccante realisticamente motivato probabilmente adatterà un modello per il proprio stile e caso d’uso specifico, poiché è economico e facile da fare. Con uno sforzo minimo, tempo e denaro, abbiamo prodotto generatori adattati in grado di produrre tweet per i social media molto più realistici, sia in base alle caratteristiche linguistiche che all’accuratezza della rilevazione, e verificati attraverso annotazioni umane.’

Gli autori sottolineano che i modelli personalizzati di questo tipo non sono limitati ai contenuti dei social media a breve termine:

‘Sebbene motivati dalla diffusione di contenuti AI sui social media e dai rischi associati di astroturfing e campagne di influenza, sottolineiamo che i principali risultati si estendono a tutti i domini del testo.

‘In effetti, l’adattamento dei modelli per la generazione di contenuti specifici di stile è un metodo generalmente applicabile, e probabilmente già in uso da molti utenti di generativi AI – mettendo in discussione se i metodi esistenti per la rilevazione di AIGT siano così efficaci nel mondo reale come in laboratorio.’

Come osserva il documento, il metodo utilizzato per creare questi modelli linguistici personalizzati è l’adattamento, in cui gli utenti curano una quantità limitata dei propri dati di destinazione e li inseriscono in un numero crescente di strumenti di formazione online facili da usare e a buon mercato.

Ad esempio, il popolare repository Hugging Face offre l’adattamento del modello linguistico di grandi dimensioni (LLM) tramite un’interfaccia semplificata, utilizzando il suo sistema AutoTrain Advanced, che può essere eseguito per pochi dollari tramite un’unità di elaborazione grafica (GPU) online o gratuitamente, se l’utente ha un hardware adeguato:

Varie strutture dei prezzi attraverso la gamma di GPU disponibili per il sistema AutoTrain di Hugging Face. Fonte: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Varie strutture dei prezzi attraverso la gamma di GPU disponibili per il sistema AutoTrain di Hugging Face. Fonte: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Altri metodi e piattaforme semplificati includono Axolotl, Unsloth e il più capace ma impegnativo TorchTune.

Un caso d’uso esemplificativo sarebbe uno studente che è stanco di scrivere i propri saggi, ma teme di essere scoperto dagli strumenti di rilevamento AI online, che può utilizzare i propri saggi storici come dati di formazione per adattare un modello open-source popolare come la serie Mistral.

Sebbene l’adattamento di un modello tende a distorcere le sue prestazioni verso i dati di formazione aggiuntivi e a degradare le prestazioni generali, i modelli “personalizzati” possono essere utilizzati per “de-AI” l’output sempre più distintivo dei sistemi come ChatGPT, in un modo che riflette lo stile storico dell’utente (e, per aumentare l’autenticità, le sue carenze).

Tuttavia, si potrebbe utilizzare esclusivamente un modello adattato specificamente per un compito o un insieme di compiti ristretti, come un LLM adattato sul corso di lavoro di un modulo universitario specifico. Un modello così specifico avrebbe una visione miope, ma molto più approfondita di quel dominio rispetto a un LLM generico come ChatGPT, e probabilmente costerebbe meno di 10-20 dollari per la formazione.

Il ghiacciaio dei modelli linguistici

È difficile dire quale sia l’entità di questa pratica. Aneddoticamente, su diverse piattaforme dei social media, ho recentemente incontrato molti esempi di adattamento dei modelli linguistici orientati agli affari – sicuramente molti più di quanti ne avessi incontrati un anno fa; in un caso, un’azienda ha adattato un modello linguistico sui propri pezzi di pensiero leader, che è stato in grado di convertire una telefonata Zoom un po’ confusionaria con un nuovo cliente in un post B2B lucido quasi in un solo passaggio, su richiesta.

Un modello di tale natura richiede dati accoppiati (esempi prima e dopo, su larga scala), mentre la creazione di un “lucido” personalizzato delle caratteristiche di uno scrittore è un compito più semplice, più simile al trasferimento di stile.

Sebbene questo sia un inseguimento clandestino (nonostante numerosi titoli e studi accademici sull’argomento), dove non sono disponibili cifre, la stessa logica che ha portato l’atto TAKE IT DOWN a diventare legge quest’anno si applica qui: l’attività target è possibile e accessibile, e c’è una forte comprensione comune del fatto che gli utenti potenziali sono altamente motivati.

C’è ancora abbastanza attrito lasciato nei sistemi di adattamento online più “semplificati” che la pratica di addestrare e utilizzare modelli adattati in modo disonesto rimane un caso d’uso relativamente di nicchia, per il momento – sebbene certamente non al di là dell’inventiva tradizionale degli studenti.

PhantomHunter

Ciò ci porta al principale articolo di interesse qui – un nuovo approccio dalla Cina che riunisce una vasta gamma di tecniche in un unico framework – chiamato PhantomHunter – che afferma di identificare l’output dei modelli linguistici adattati, che altrimenti passerebbero come lavoro umano originale.

Il sistema è progettato per funzionare anche quando il modello adattato specifico non è stato mai incontrato prima, affidandosi invece alle tracce residue lasciate dal modello base originale – che gli autori caratterizzano come “caratteristiche di famiglia” che sopravvivono al processo di adattamento.

Nelle prove, il documento – intitolato PhantomHunter: Rilevamento di testo generato da LLM adattati privatamente tramite apprendimento consapevole della famiglia – riporta una forte accuratezza di rilevamento, con il sistema che supera la valutazione zero-shot di GPT-4-mini nel rintracciare un campione di testo al suo modello di famiglia.

Ciò suggerisce che più un modello è adattato, più rivela informazioni sulla sua ascendenza, contraddicendo l’ipotesi che l’adattamento privato mascheri sempre l’origine di un modello; invece, il processo di adattamento potrebbe lasciare un’impronta rilevabile che, se letta correttamente, rivela il gioco – almeno, in attesa di ulteriori progressi che sembrano arrivare settimanalmente ora.

Il documento afferma*:

‘La rilevazione del testo generato da macchina (MGT) distingue generalmente il testo generato da LLM e il testo scritto da umani tramite classificazione binaria. I metodi esistenti o imparano caratteristiche testuali comuni condivise tra LLM tramite apprendimento di rappresentazione o progettano metriche distinguibili tra testi umani e LLM in base ai segnali interni di LLM (ad esempio, probabilità di token).

‘Per entrambe le categorie, i loro test sono stati condotti principalmente su dati da LLM pubblicamente disponibili, assumendo che gli utenti generino testi utilizzando servizi pubblici, pronti all’uso.

Sosteniamo che questa situazione sta cambiando a causa dello sviluppo recente della comunità open-source LLM. Con l’aiuto di piattaforme come HuggingFace e le tecniche di formazione LLM efficienti come l’adattamento di basso rango (LoRA), costruire LLM adattati con dataset privati personalizzati è diventato molto più facile che in passato.

‘Ad esempio, ci sono stati oltre 60.000 modelli derivati Llama su HuggingFace. Dopo l’adattamento privato su un corpus sconosciuto, le caratteristiche apprese dei modelli base potrebbero cambiare e i rilevatori LLMGT potrebbero [fallire], plasmando un nuovo rischio che gli utenti malintenzionati possano generare testi dannosi privatamente senza essere scoperti dai rilevatori LLMGT.

‘Sorge una nuova sfida: Come rilevare il testo generato da LLM adattati privatamente?

Metodo e formazione

Il sistema PhantomHunter utilizza una strategia di apprendimento consapevole della famiglia, che combina tre componenti: un estraettore di caratteristiche, che cattura le probabilità di output da modelli base noti; un encoder contrastivo addestrato per distinguere tra famiglie; e (come descritto di seguito) un classificatore a miscela di esperti che assegna etichette di famiglia a nuovi campioni di testo:

Schema del sistema. PhantomHunter elabora un campione di testo estraendo prima le caratteristiche di probabilità da più modelli base, che vengono poi codificate utilizzando layer CNN e trasformatori. Stima la famiglia del modello per calcolare i pesi di controllo, che guidano un modulo a miscela di esperti nella previsione se il testo è generato da LLM. Una perdita contrastiva viene applicata durante l'addestramento per raffinare la separazione tra le famiglie dei modelli. Fonte: https://arxiv.org/pdf/2506.15683

Schema del sistema. PhantomHunter elabora un campione di testo estraendo prima le caratteristiche di probabilità da più modelli base, che vengono poi codificate utilizzando layer CNN e trasformatori. Fonte: https://arxiv.org/pdf/2506.15683

PhantomHunter funziona passando un pezzo di testo attraverso più modelli base noti e registrando quanto probabile sia che ogni modello pensi che la parola successiva sia, a ogni passaggio. Questi modelli vengono poi inseriti in una rete neurale che apprende le caratteristiche distintive di ogni famiglia di modelli.

Durante l’addestramento, il sistema confronta testi della stessa famiglia e impara a raggrupparli insieme, mentre distingue quelli di famiglie diverse, aiutando a identificare collegamenti nascosti tra modelli adattati e i loro modelli base.

MOE

Per decidere se un pezzo di testo sia stato scritto da un umano o da un’intelligenza artificiale, PhantomHunter utilizza un sistema a miscela di esperti, in cui ogni “esperto” è tarato per rilevare testi da una famiglia di modelli specifica.

Una volta che il sistema ipotizza da quale famiglia provenga il testo, utilizza quell’ipotesi per decidere quanto peso dare all’opinione di ogni esperto. Queste opinioni pesate vengono poi combinate per prendere la decisione finale: AI o umano.

L’addestramento del sistema comporta più obiettivi: imparare a riconoscere le famiglie dei modelli; imparare a distinguere il testo AI da quello umano; e imparare a separare le diverse famiglie utilizzando l’apprendimento contrastivo – obiettivi che vengono bilanciati durante l’addestramento attraverso parametri regolabili.

Focalizzandosi sui modelli condivisi all’interno di ogni famiglia, piuttosto che sulle peculiarità dei singoli modelli, PhantomHunter dovrebbe in teoria essere in grado di rilevare anche modelli adattati che non ha mai visto prima.

Dati e prove

Per sviluppare dati per le prove, gli autori si sono concentrati sui due scenari accademici più comuni: scrittura e risposta a domande. Per la scrittura, hanno raccolto 69.297 abstract dall’archivio accademico Arxiv, divisi in domini principali. Per la risposta a domande, 2.062 paia sono stati curati dal set di dati HC3 su tre soggetti: ELI5; finanza; e medicina:

Elenco delle fonti di dati e dei numeri, nel set di dati curato per lo studio.

Elenco delle fonti di dati e dei numeri, nel set di dati curato per lo studio.

In totale, dodici modelli sono stati addestrati per la prova. I tre modelli base erano LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; e Gemma 7B-it), da cui nove varianti adattate sono state derivate, ciascuna adattata per mimare un dominio o uno stile di scrittura diverso, utilizzando dati specifici del dominio:

Statistiche del set di dati di valutazione, dove 'FT Domain' si riferisce al dominio utilizzato durante l'adattamento e 'base' indica nessun adattamento.

Statistiche del set di dati di valutazione, dove ‘FT Domain’ si riferisce al dominio utilizzato durante l’adattamento e ‘base’ indica nessun adattamento.

In totale, quindi, tre modelli base sono stati adattati utilizzando sia la tecnica di adattamento completo che LoRA attraverso tre domini distinti in ciascuno dei due scenari di utilizzo: scrittura di abstract accademici e risposta a domande. Per riflettere le sfide di rilevamento del mondo reale, i modelli adattati sui dati di informatica sono stati esclusi dai test di scrittura, mentre quelli adattati sui dati di finanza sono stati esclusi dalle valutazioni di risposta a domande.

I framework rivali selezionati erano RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; e DeTeCtive.

PhantomHunter è stato addestrato utilizzando due tipi di layer di reti neurali: tre layer convoluzionali con pooling massimo per catturare modelli di testo locali, e due layer trasformatori con quattro teste di attenzione ciascuno per modellare relazioni a lungo raggio.

Per l’apprendimento contrastivo, che incoraggia il sistema a distinguere tra diverse famiglie di modelli, il parametro temperatura è stato impostato su 0,07.

L’obiettivo di addestramento combinava tre termini di perdita: L1 (per la classificazione della famiglia) e L2 (per la rilevazione binaria), ciascuno pesato a 1,0, e L3 (per l’apprendimento contrastivo), pesato a 0,5.

Il modello è stato ottimizzato utilizzando Adam con un tasso di apprendimento di 2e-5 e una dimensione del batch di 32. L’addestramento ha avuto luogo per dieci epoche complete, con il checkpoint che si esegue meglio selezionato utilizzando un set di convalida. Tutti gli esperimenti sono stati condotti su un server con quattro GPU NVIDIA A100.

Le metriche utilizzate erano F1 scoring per ogni subset di test, insieme al tasso di true positive, per il confronto con i rilevatori commerciali.

Punteggi F1 per la rilevazione di testo da modelli linguistici adattati non visti. I due risultati migliori in ogni categoria sono in grassetto e sottolineati. 'BFE' si riferisce all'estrazione delle caratteristiche di probabilità di base, 'CL' all'apprendimento contrastivo e 'MoE' al modulo a miscela di esperti.

Punteggi F1 per la rilevazione di testo da modelli linguistici adattati non visti. I due risultati migliori in ogni categoria sono in grassetto e sottolineati.

I risultati del test iniziale, visualizzati nella tabella sopra, mostrano che PhantomHunter ha superato tutti i sistemi di base, mantenendo punteggi F1 sopra il 90% sia per il testo umano che per quello generato da macchina, anche quando valutato su output da modelli adattati esclusi dall’addestramento.

Gli autori commentano:

‘Con l’adattamento completo, PhantomHunter migliora il punteggio MacF1 del 3,65% e del 2,96% su entrambi i set di dati, rispettivamente; e con l’adattamento LoRA, i miglioramenti sono del 2,01% e del 6,09% rispettivamente.

‘Il risultato dimostra la potente capacità di rilevamento di PhantomHunter per i testi generati da LLM adattati non visti.’

Sono stati condotti studi di ablazione per valutare il ruolo di ogni componente chiave in PhantomHunter. Quando sono stati rimossi elementi individuali, come l’estraettore di caratteristiche, l’encoder contrastivo o il classificatore a miscela di esperti, è stata osservata una diminuzione costante dell’accuratezza, indicando che l’architettura si basa sulla coordinazione di tutte le parti.

Gli autori hanno anche esaminato se PhantomHunter potesse generalizzare al di là della sua distribuzione di addestramento e hanno stabilito che anche quando applicato agli output di modelli base completamente assenti durante l’addestramento, ha continuato a superare i metodi rivali – suggerendo che le firme a livello di famiglia rimangono rilevabili attraverso le varianti adattate.

Conclusione

Un argomento a favore dei modelli linguistici generativi addestrati dall’utente è che almeno questi piccoli adattamenti e LoRA preservano il sapore e le eccentricità individuali di uno scrittore, in un clima in cui l’idioma generico, ispirato al SEO, dei chatbot AI minaccia di generizzare qualsiasi lingua in cui l’AI diventa un contributore importante o dominante.

Con la svalutazione del saggio universitario, e con gli studenti che ora registrano sessioni di scrittura massive per dimostrare che non hanno utilizzato l’AI nei loro saggi, più insegnanti al di fuori dell’Europa (dove gli esami orali sono normalizzati) stanno considerando gli esami faccia a faccia come alternativa ai testi inviati. Più recentemente, è stata proposta un ritorno al lavoro scritto a mano.

Arguibilmente, entrambe queste soluzioni sono superiori a ciò che minaccia di essere una corsa agli armamenti basata su LLM; sebbene queste soluzioni comportino un costo in termini di sforzo umano e attenzione, che la cultura tecnologica sta attualmente cercando di automatizzare.

 

Si prega di vedere la sezione finale dopo i principali risultati, nel documento di origine, per i dettagli su questo.

* La mia conversione delle citazioni in linea degli autori in collegamenti ipertestuali. Enfasi del testo degli autori, non mia.

Pubblicato per la prima volta giovedì 19 giugno 2025

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai