Modele și platforme AI
Dezvoltarea capacității de a uita date cu drepturi de autor dintr-un model LLM antrenat – Este posibilă?
În domeniile inteligenței artificiale (IA) și a învățării automatizate (ML), modelele de limbaj mare (LLM) prezintă atât realizări, cât și provocări. Antrenate pe seturi de date textuale vaste, modelele LLM încorporează limbajul și cunoștințele umane.
Cu toate acestea, capacitatea lor de a absorbi și de a imita înțelegerea umană prezintă provocări legale, etice și tehnologice. Mai mult, seturile de date masive care alimentează LLM-urile pot conține materiale toxice, texte cu drepturi de autor, inexactități sau date personale.
Făcând ca LLM-urile să uite date selectate a devenit o problemă presantă pentru a asigura conformitatea legală și responsabilitatea etică.
Să explorăm conceptul de a face LLM-urile să uite date cu drepturi de autor pentru a aborda o întrebare fundamentală: Este posibil?
De ce este necesară dezvoltarea capacității de a uita a LLM-urilor?
LLM-urile conțin adesea date disputate, inclusiv date cu drepturi de autor. Prezența unor astfel de date în LLM-uri ridică provocări legale legate de informații private, informații biasate, date cu drepturi de autor și elemente false sau dăunătoare.
Prin urmare, uitarea este esențială pentru a garanta că LLM-urile respectă reglementările privind confidențialitatea și se conformează legilor privind drepturile de autor, promovând LLM-uri responsabile și etice.

Cu toate acestea, extragerea conținutului cu drepturi de autor din cunoștințele vaste pe care aceste modele le-au dobândit este o provocare. Iată câteva tehnici de uitare care pot ajuta la rezolvarea acestei probleme:
- Filtrarea datelor: Aceasta implică identificarea sistematică și înlăturarea elementelor cu drepturi de autor, a datelor zgomotoase sau biasate din datele de antrenare ale modelului. Cu toate acestea, filtrarea poate duce la pierderea potențială a informațiilor neprotejate de drepturi de autor valoroase în timpul procesului de filtrare.
- Metodele de gradient: Aceste metode ajustează parametrii modelului pe baza gradientului funcției de pierdere, abordând problema datelor cu drepturi de autor în modelele ML. Cu toate acestea, ajustările pot afecta negativ performanța generală a modelului pe date neprotejate de drepturi de autor.
- Uitarea în context: Această tehnică elimină eficient impactul unor puncte de antrenare specifice asupra modelului, actualizând parametrii fără a afecta cunoștințele nerelaționate. Cu toate acestea, metoda se confruntă cu limitări în realizarea unei uitări precise, în special cu modele mari, și eficacitatea sa necesită o evaluare suplimentară.
Aceste tehnici sunt intensiv resursive și consumatoare de timp, făcându-le dificil de implementat.
Studii de caz
Pentru a înțelege importanța uitării LLM-urilor, aceste cazuri din lumea reală subliniază modul în care companiile se confruntă cu provocări legale legate de modelele de limbaj mare (LLM) și datele cu drepturi de autor.
Procesele intentate companiei OpenAI: OpenAI, o companie de inteligență artificială de seamă, a fost vizată de numeroase procese legate de datele de antrenare ale LLM-urilor. Aceste acțiuni legale pun sub semnul întrebării utilizarea materialului cu drepturi de autor în antrenarea LLM-urilor. De asemenea, ele au declanșat anchete cu privire la mecanismele pe care le folosesc modelele pentru a obține permisiunea pentru fiecare operă cu drepturi de autor integrată în procesul de antrenare.
Procesul intentat de Sarah Silverman: Cazul Sarah Silverman implică o acuzație potrivit căreia modelul ChatGPT a generat rezumate ale cărților sale fără autorizație. Această acțiune legală subliniază problemele importante legate de viitorul inteligenței artificiale și datelor cu drepturi de autor.
Actualizarea cadrului legal pentru a se alinia cu progresul tehnologic asigură utilizarea responsabilă și legală a modelelor de inteligență artificială. Mai mult, comunitatea de cercetare trebuie să abordeze aceste provocări în mod cuprinzător pentru a face LLM-urile etice și corecte.
Tehnici tradiționale de uitare a LLM-urilor
Uitarea LLM-urilor este similară cu separarea unor ingrediente specifice dintr-o rețetă complexă, asigurându-se că doar componentele dorite contribuie la felul de mâncare final. Tehnicile tradiționale de uitare a LLM-urilor, cum ar fi reglarea fină cu date curate și reantrenarea, lipsesc mecanismele straightforward pentru înlăturarea datelor cu drepturi de autor.
Aproachul lor de tip “perie largă” se dovedește adesea ineficient și consumator de resurse pentru sarcina sofisticată de uitare selectivă, deoarece necesită o reantrenare extinsă.
Deși aceste metode tradiționale pot ajusta parametrii modelului, ele luptă pentru a ținti precis conținutul cu drepturi de autor, riscând pierderea neintenționată de date și o conformitate suboptimală.
Prin urmare, limitările tehnicilor tradiționale și soluțiile robuste necesită experimentarea unor tehnici alternative de uitare.
Tehnică nouă: Uitarea unui subset de date de antrenare
Un articol de cercetare Microsoft (MSFT ) introduce o tehnică revoluționară pentru uitarea datelor cu drepturi de autor în LLM-uri. Concentrându-se pe exemplul modelului Llama2-7b și al cărților Harry Potter, metoda implică trei componente de bază pentru a face ca LLM-ul să uite lumea lui Harry Potter. Aceste componente includ:
- Identificarea modelului întărit: Crearea unui model întărit implică reglarea fină a datelor țintă (de exemplu, Harry Potter) pentru a consolida cunoștințele sale despre conținutul care urmează a fi uitat.
- Înlocuirea expresiilor idiosincratice: Expresiile unice ale lui Harry Potter din datele țintă sunt înlocuite cu expresii generice, facilitând o înțelegere mai generalizată.
- Reglarea fină pe predicții alternative: Modelul de bază suferă o reglare fină pe baza acestor predicții alternative. În esență, aceasta șterge eficient textul original din memoria sa atunci când este confruntat cu un context relevant.
Deși tehnica Microsoft se află într-un stadiu incipient și poate avea limitări, reprezintă o avansare promițătoare către LLM-uri mai puternice, etice și adaptabile.
Rezultatul tehnicii noi
Metoda inovatoare de a face LLM-urile să uite date cu drepturi de autor, prezentată în articolul de cercetare Microsoft, este un pas către modele responsabile și etice.
Tehnica nouă implică ștergerea conținutului legat de Harry Potter din modelul Llama2-7b al Meta, cunoscut a fi fost antrenat pe setul de date “books3” care conține lucrări cu drepturi de autor. Notabil, răspunsurile originale ale modelului au demonstrat o înțelegere complexă a universului creat de J.K. Rowling, chiar și cu prompturi generice.
Cu toate acestea, tehnica propusă de Microsoft a transformat semnificativ răspunsurile sale. Iată exemple de prompturi care prezintă diferențele notabile între modelul Llama2-7b original și versiunea reglată fin.

Acest tabel ilustrează faptul că modelele de uitare reglate fin mențin performanța lor pe diverse benchmark-uri (cum ar fi Hellaswag, Winogrande, piqa, boolq și arc).

Metoda de evaluare, care se bazează pe analiza prompturilor modelului și a răspunsurilor ulterioare, se dovedește eficientă, dar poate ignora metodele mai complexe de extragere a informațiilor.
Deși tehnica este promițătoare, sunt necesare cercetări suplimentare pentru rafinarea și extinderea sa, în special în ceea ce privește sarcinile de uitare mai ample în cadrul LLM-urilor.
Provocările tehnicii noi de uitare
Deși tehnica de uitare a Microsoft arată promițător, există provocări și limitări ale inteligenței artificiale și ale drepturilor de autor.
Principalele limitări și domenii de îmbunătățire includ:
- Scurgeri de informații cu drepturi de autor: Metoda poate nu înlătură complet riscul scurgerii de informații cu drepturi de autor, deoarece modelul poate păstra cunoștințe despre conținutul țintă în timpul procesului de reglare fină.
- Evaluarea diverselor seturi de date: Pentru a evalua eficacitatea, tehnica trebuie supusă unor evaluări suplimentare pe diverse seturi de date, deoarece experimentul inițial s-a concentrat exclusiv pe cărțile Harry Potter.
- Scalabilitate: Testarea pe seturi de date mai mari și pe modele de limbaj mai complexe este imperativă pentru a evalua aplicabilitatea și adaptabilitatea tehnicii în scenarii din lumea reală.
Creșterea numărului de cazuri legale legate de inteligența artificială, în special procese pentru încălcarea drepturilor de autor care vizează LLM-urile, subliniază nevoia unor ghiduri clare. Dezvoltări promițătoare, cum ar fi metoda de uitare propusă de Microsoft, deschid calea către o inteligență artificială etică, legală și responsabilă.
Nu ratați ultimele știri și analize din domeniul inteligenței artificiale și al învățării automate – vizitați unite.ai astăzi.












