Modelli e piattaforme di IA
Dimenticare i dati coperti da copyright da un LLM addestrato – È possibile?
Nel dominio dell’intelligenza artificiale (AI) e dell’apprendimento automatico (ML), i modelli linguistici di grandi dimensioni (LLM) mostrano sia risultati che sfide. Addestrati su vasti set di dati testuali, i modelli LLM racchiudono la lingua e la conoscenza umana.
Tuttavia, la loro capacità di assorbire e mimare la comprensione umana presenta sfide legali, etiche e tecnologiche. Inoltre, i vasti set di dati che alimentano gli LLM possono contenere materiale tossico, testi coperti da copyright, inesattezze o dati personali.
Far dimenticare ai modelli LLM i dati selezionati è diventata una questione urgente per garantire la conformità legale e la responsabilità etica.
Esploriamo il concetto di far dimenticare ai modelli LLM i dati coperti da copyright per affrontare una domanda fondamentale: è possibile?
Perché è necessario il dimenticamento degli LLM?
Gli LLM spesso contengono dati controversi, tra cui dati coperti da copyright. La presenza di tali dati negli LLM presenta sfide legali relative alle informazioni private, alle informazioni distorte, ai dati coperti da copyright e agli elementi falsi o dannosi.
Pertanto, il dimenticamento è essenziale per garantire che gli LLM rispettino le norme sulla privacy e si conformino alle leggi sul copyright, promuovendo modelli LLM responsabili ed etici.

Tuttavia, estrarre i contenuti coperti da copyright dalla vasta conoscenza acquisita da questi modelli è difficile. Ecco alcune tecniche di dimenticamento che possono aiutare a risolvere questo problema:
- Filtraggio dei dati: consiste nell’identificare e rimuovere sistematicamente gli elementi coperti da copyright, i dati rumorosi o distorti, dai dati di addestramento del modello. Tuttavia, il filtraggio può portare alla perdita potenziale di informazioni non coperte da copyright durante il processo di filtraggio.
- Metodi basati sul gradiente: questi metodi regolano i parametri del modello in base al gradiente della funzione di perdita, affrontando il problema dei dati coperti da copyright nei modelli di apprendimento automatico. Tuttavia, gli aggiustamenti possono influire negativamente sulle prestazioni generali del modello sui dati non coperti da copyright.
- Dimenticamento in contesto: questa tecnica elimina efficientemente l’impatto di punti di addestramento specifici sul modello aggiornando i suoi parametri senza influire sulla conoscenza non correlata. Tuttavia, il metodo presenta limitazioni nel raggiungere un dimenticamento preciso, soprattutto con modelli di grandi dimensioni, e la sua efficacia richiede ulteriore valutazione.
Queste tecniche sono intensive in termini di risorse e richiedono molto tempo, rendendole difficili da implementare.
Casi di studio
Per comprendere l’importanza del dimenticamento degli LLM, questi casi reali evidenziano come le aziende siano alle prese con sfide legali relative ai modelli linguistici di grandi dimensioni (LLM) e ai dati coperti da copyright.
Cause legali contro OpenAI: OpenAI, un’azienda di spicco nel settore AI, è stata colpita da numerose cause legali relative ai dati di addestramento degli LLM. Queste azioni legali mettono in discussione l’utilizzo di materiale coperto da copyright nell’addestramento degli LLM. Inoltre, hanno scatenato inchieste sui meccanismi che i modelli utilizzano per ottenere il permesso per ogni opera coperta da copyright integrata nel loro processo di addestramento.
Causa legale di Sarah Silverman: il caso di Sarah Silverman riguarda un’accusa secondo cui il modello ChatGPT ha generato riassunti dei suoi libri senza autorizzazione. Questa azione legale sottolinea le importanti questioni relative al futuro dell’AI e ai dati coperti da copyright.
L’aggiornamento dei quadri legali per allinearli con il progresso tecnologico garantisce l’utilizzo responsabile e legale dei modelli AI. Inoltre, la comunità di ricerca deve affrontare queste sfide in modo globale per rendere gli LLM etici e equi.
Tecniche tradizionali di dimenticamento degli LLM
Il dimenticamento degli LLM è come separare ingredienti specifici da una ricetta complessa, assicurandosi che solo i componenti desiderati contribuiscano al piatto finale. Le tecniche tradizionali di dimenticamento degli LLM, come il fine-tuning con dati curati e il riaddestramento, mancano di meccanismi diretti per rimuovere i dati coperti da copyright.
Il loro approccio a larga scala si rivela spesso inefficiente e richiede molte risorse per il compito sofisticato del dimenticamento selettivo, poiché richiedono un lungo riaddestramento.
Sebbene questi metodi tradizionali possano regolare i parametri del modello, lottano per mirare precisamente ai contenuti coperti da copyright, rischiando la perdita di dati non intenzionale e una conformità subottimale.
Di conseguenza, le limitazioni delle tecniche tradizionali e le soluzioni robuste richiedono l’esperimentazione con tecniche di dimenticamento alternative.
Tecnica innovativa: dimenticamento di un subset dei dati di addestramento
La ricerca di Microsoft (MSFT ) introduce una tecnica innovativa per far dimenticare ai modelli LLM i dati coperti da copyright. Concentrandosi sull’esempio del modello Llama2-7b e dei libri di Harry Potter, il metodo prevede tre componenti fondamentali per far dimenticare ai modelli LLM il mondo di Harry Potter. Queste componenti includono:
- Identificazione del modello rinforzato: la creazione di un modello rinforzato prevede il fine-tuning dei dati di destinazione (ad esempio, Harry Potter) per rafforzare la sua conoscenza del contenuto da dimenticare.
- Sostituzione di espressioni idiosincratiche: le espressioni uniche di Harry Potter nei dati di destinazione vengono sostituite con espressioni generiche, facilitando una comprensione più generalizzata.
- Fine-tuning su previsioni alternative: il modello di base subisce un fine-tuning in base a queste previsioni alternative. In sostanza, elimina efficacemente il testo originale dalla sua memoria quando si confronta con un contesto rilevante.
Sebbene la tecnica di Microsoft sia ancora in fase iniziale e possa avere limitazioni, rappresenta un progresso promettente verso modelli LLM più potenti, etici e adattabili.
Esito della tecnica innovativa
Il metodo innovativo per far dimenticare ai modelli LLM i dati coperti da copyright presentato nella ricerca di Microsoft è un passo verso modelli responsabili ed etici.
La tecnica innovativa prevede la cancellazione dei contenuti relativi a Harry Potter dal modello Llama2-7b di Meta, noto per essere stato addestrato sul set di dati “books3” che contiene opere coperte da copyright. In particolare, le risposte originali del modello hanno dimostrato una comprensione intricata dell’universo di J.K. Rowling, anche con prompt generici.
Tuttavia, la tecnica proposta da Microsoft ha trasformato notevolmente le sue risposte. Ecco esempi di prompt che mostrano le differenze significative tra il modello Llama2-7b originale e la versione fine-tuned.

Questa tabella illustra che i modelli di dimenticamento fine-tuned mantengono le loro prestazioni across diversi benchmark (come Hellaswag, Winogrande, piqa, boolq e arc).

Il metodo di valutazione, basato su prompt del modello e successive analisi delle risposte, si rivela efficace ma potrebbe trascurare metodi di estrazione di informazioni più intricati e avversari.
Sfide della tecnica di dimenticamento innovativa
Sebbene la tecnica di dimenticamento di Microsoft mostri promesse, esistono diverse sfide e limitazioni relative ai diritti d’autore e ai vincoli dell’AI.
Le limitazioni chiave e le aree di miglioramento includono:
- Perdite di informazioni coperte da copyright: il metodo potrebbe non mitigare completamente il rischio di perdite di informazioni coperte da copyright, poiché il modello potrebbe conservare alcune conoscenze del contenuto di destinazione durante il processo di fine-tuning.
- Valutazione di diversi set di dati: per valutare l’efficacia, la tecnica deve essere sottoposta a ulteriore valutazione su set di dati diversi, poiché l’esperimento iniziale si è concentrato solo sui libri di Harry Potter.
- Scalabilità: è fondamentale testare la tecnica su set di dati più grandi e modelli linguistici più complessi per valutare la sua applicabilità e adattabilità in scenari reali.
L’aumento dei casi legali relativi all’AI, in particolare le cause per violazione del copyright contro gli LLM, evidenzia la necessità di linee guida chiare. Sviluppi promettenti, come il metodo di dimenticamento proposto da Microsoft, aprono la strada verso un’AI etica, legale e responsabile.
Non perdere le ultime notizie e analisi sull’AI e sull’apprendimento automatico – visita unite.ai oggi.












