Unghiul lui Anderson

Aproximativ 80% din seturile de date de antrenament pot fi un pericol legal pentru inteligența artificială a întreprinderilor

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT and Adobe Firefly.

O lucrare recentă de la LG AI Research sugerează că seturile de date “deschise” utilizate pentru antrenarea modelelor de inteligență artificială pot oferi o falsă senzație de securitate, constatând că aproape patru din cinci seturi de date etichetate ca “utilizabile comercial” conțin riscuri legale ascunse.

Asemenea riscuri variază de la includerea de material protejat prin drepturi de autor neînregistrate la termeni de licențiere restrictivă îngropați adânc în dependențele unui set de date. Dacă descoperirile lucrării sunt exacte, companiile care se bazează pe seturi de date publice ar putea fi nevoite să-și reconsidere conductele actuale de inteligență artificială, sau să se expună riscurilor legale în aval.

Cercetătorii propun o soluție radicală și posibil controversată: agenți de conformitate bazati pe inteligență artificială capabili să scaneze și să auditeze istoricul seturilor de date mai rapid și mai precis decât avocații umani.

Lucrarea afirmă:

‘Acest articol susține că riscul legal al seturilor de date de antrenament nu poate fi determinat numai prin examinarea termenilor de licență de nivel superior; o analiză amănunțită, de la capăt la capăt, a redistribuirii setului de date este esențială pentru asigurarea conformității.

‘Deoarece o astfel de analiză este dincolo de capacitățile umane din cauza complexității și amploarei sale, agenții de inteligență artificială pot acoperi acest gol prin efectuarea acesteia cu o viteză și o acuratețe mai mare. Fără automatizare, riscurile legale critice rămân în mare măsură neexamininate, periclitând dezvoltarea etică a inteligenței artificiale și respectarea reglementărilor.

‘Îndemnăm comunitatea de cercetare a inteligenței artificiale să recunoască analiza legală de la capăt la capăt ca o cerință fundamentală și să adopte abordări conduse de inteligență artificială ca o cale viabilă către conformitatea seturilor de date la scară largă.’

Prin examinarea a 2.852 de seturi de date populare care au apărut ca fiind utilizabile comercial pe baza licențelor individuale, sistemul automatizat al cercetătorilor a constatat că doar 605 (aproximativ 21%) erau într-adevăr sigure din punct de vedere legal pentru comercializare odată ce toate componentele și dependențele lor au fost urmărite

Noua lucrare se intitulează Nu aveți încredere în licențele pe care le vedeți — Conformitatea setului de date necesită urmărirea ciclului de viață pe scară largă condusă de inteligență artificială și provine de la opt cercetători de la LG AI Research.

Drepturi și greșeli

Autorii subliniază provocările cu care se confruntă companiile care promovează dezvoltarea inteligenței artificiale într-un peisaj legal din ce în ce mai incert – pe măsură ce mentalitatea academică “de utilizare corectă” din jurul antrenamentului seturilor de date cedează locul unui mediu fragmentat în care protecțiile legale sunt neclare și adăpostul sigur nu mai este garantat.

După cum a subliniat o publicație recent, companiile devin din ce în ce mai defensive cu privire la sursele datelor lor de antrenament. Autorul Adam Buick comentează*:

‘[În timp ce] OpenAI a dezvăluit sursele principale de date pentru GPT-3, articolul care introduce GPT-4 a dezvăluit doar că datele pe care modelul a fost antrenat erau un amestec de ‘date disponibile public (cum ar fi date de internet) și date licențiate de la furnizori terți’.

‘Motivațiile din spatele acestei mișcări de a se îndepărta de transparență nu au fost articulate în niciun detaliu particular de către dezvoltatorii de inteligență artificială, care în multe cazuri nu au oferit nicio explicație deloc.

‘Pentru partea sa, OpenAI și-a justificat decizia de a nu dezvălui detalii suplimentare cu privire la GPT-4 pe baza preocupărilor cu privire la ‘peisajul competitiv și implicațiile de securitate ale modelelor de inteligență artificială la scară largă’, fără nicio explicație suplimentară în raport.’

Transparența poate fi un termen înșelător – sau pur și simplu greșit; de exemplu, modelul generativ de top al Adobe, Firefly, antrenat pe date stoc pe care Adobe le-a avut dreptul de a le exploata, a oferit supozează clienților asigurări cu privire la legalitatea utilizării sistemului. Mai târziu, au apărut dovezi că oala de date Firefly s-a “îmbogățit” cu date cu drepturi de autor potențial protejate de la alte platforme.

După cum am discutat mai devreme în această săptămână, există inițiative în creștere menite să asigure conformitatea cu licența în seturile de date, inclusiv una care va extrage doar videouri de pe YouTube cu licențe Creative Commons flexibile.

Problema este că licențele în sine pot fi eronate sau acordate în mod greșit, așa cum pare să indice noua cercetare.

Examinarea seturilor de date deschise

Este dificil să se dezvolte un sistem de evaluare, cum ar fi cel al autorilor, Nexus, când contextul se schimbă în mod constant. Prin urmare, lucrarea afirmă că sistemul de conformitate a datelor NEXUS se bazează pe “diverse precedente și temeiuri legale la acest moment”.

NEXUS utilizează un agent condus de inteligență artificială numit AutoCompliance pentru conformitatea automată a datelor. AutoCompliance este alcătuit din trei module cheie: un modul de navigare pentru explorarea web-ului; un modul de întrebare și răspuns (QA) pentru extragerea de informații; și un modul de notare pentru evaluarea riscului legal.

AutoCompliance începe cu o pagină web furnizată de utilizator. Inteligența artificială extrage detalii cheie, caută resurse conexe, identifică termeni de licență și dependențe și atribuie un scor de risc legal. Sursă: https://arxiv.org/pdf/2503.02784

AutoCompliance începe cu o pagină web furnizată de utilizator. Inteligența artificială extrage detalii cheie, caută resurse conexe, identifică termeni de licență și dependențe și atribuie un scor de risc legal. Sursă: https://arxiv.org/pdf/2503.02784

Aceste module sunt alimentate de modele de inteligență artificială ajustate, inclusiv modelul EXAONE-3.5-32B-Instruct, antrenat pe date sintetice și etichetate de oameni. AutoCompliance utilizează, de asemenea, o bază de date pentru stocarea rezultatelor pentru a îmbunătăți eficiența.

AutoCompliance începe cu o adresă URL a setului de date furnizată de utilizator și o tratează ca entitatea principală, căutând termenii săi de licență și dependențe, și urmărind recursiv seturile de date legate pentru a construi un grafic de dependență a licenței. Odată ce toate conexiunile sunt cartografiate, calculează scoruri de conformitate și atribuie clasificări de risc.

Cadrul de conformitate a datelor prezentat în noua lucrare identifică diverse tipuri de entități implicate în ciclul de viață al datelor, inclusiv seturi de date, care formează intrarea principală pentru antrenamentul inteligenței artificiale; software de prelucrare a datelor și modele de inteligență artificială, care sunt utilizate pentru a transforma și a utiliza datele; și furnizorii de servicii de platformă, care facilitează manipularea datelor.

Sistemul evaluează holistic riscurile legale, luând în considerare aceste diverse entități și interdependențele lor, mergând dincolo de evaluarea simplă a licențelor seturilor de date pentru a include un ecosistem mai larg al componentelor implicate în dezvoltarea inteligenței artificiale.

Conformitatea datelor evaluează riscul legal de-a lungul întregului ciclu de viață al datelor. Atribuie scoruri pe baza detaliilor setului de date și pe baza a 14 criterii, clasificând entitățile individuale și agregând riscul de-a lungul dependențelor.

Conformitatea datelor evaluează riscul legal de-a lungul întregului ciclu de viață al datelor. Atribuie scoruri pe baza detaliilor setului de date și pe baza a 14 criterii, clasificând entitățile individuale și agregând riscul de-a lungul dependențelor.

Antrenament și metrici

Autorii au extras URL-urile celor 1.000 de seturi de date cele mai descărcate de la Hugging Face, eșantionând aleatoriu 216 de articole pentru a constitui un set de test.

Modelul EXAONE a fost ajustat pe setul de date personalizat al autorilor, cu modulul de navigare și modulul de întrebare și răspuns (QA) utilizând date sintetice, și modulul de notare utilizând date etichetate de oameni.

Etichetele de referință au fost create de cinci experți juridici instruiți cel puțin 31 de ore în sarcini similare. Acești experți umani au identificat manual dependențe și termeni de licență pentru 216 de cazuri de test, apoi au agregat și rafinat descoperirile lor prin discuție.

Prin testarea sistemului AutoCompliance antrenat și calibrat de oameni împotriva ChatGPT-4o și Perplexity Pro, s-au descoperit dependențe notabile în cadrul termenilor de licență:

Acuratețe în identificarea dependențelor și a termenilor de licență pentru 216 de seturi de date de evaluare.

Acuratețe în identificarea dependențelor și a termenilor de licență pentru 216 de seturi de date de evaluare.

Lucrarea afirmă:

‘AutoCompliance depășește semnificativ toți ceilalți agenți și experții umani, obținând o acuratețe de 81,04% și 95,83% în fiecare sarcină. În contrast, atât ChatGPT-4o, cât și Perplexity Pro arată o acuratețe relativ scăzută pentru sarcinile Sursă și Licență, respectiv.

‘Aceste rezultate subliniază performanța superioară a AutoCompliance, demonstrându-i eficacitatea în gestionarea ambelor sarcini cu o acuratețe remarcabilă, și indicând, de asemenea, o diferență semnificativă de performanță între modelele conduse de inteligență artificială și experții umani în aceste domenii.’

În ceea ce privește eficiența, abordarea AutoCompliance a durat doar 53,1 secunde pentru a rula, în contrast cu 2.418 secunde pentru evaluarea echivalentă umană pentru aceleași sarcini.

Mai mult, rularea evaluării a costat 0,29 USD, comparativ cu 207 USD pentru experții umani. Trebuie remarcat, cu toate acestea, că acest lucru se bazează pe închirierea unui nod GCP a2-megagpu-16gpu lunar la o rată de 14.225 USD pe lună – ceea ce indică faptul că acest tip de eficiență a costurilor este legat în primul rând de o operațiune la scară largă.

Investigarea setului de date

Pentru analiza, cercetătorii au selectat 3.612 seturi de date, combinând 3.000 de seturi de date cele mai descărcate de la Hugging Face cu 612 seturi de date din Inițiativa de proveniență a datelor din 2023.

Lucrarea afirmă:

‘Începând cu 3.612 de entități țintă, am identificat un total de 17.429 de entități unice, dintre care 13.817 de entități au apărut ca dependențe directe sau indirecte ale entităților țintă.

‘Pentru analiza noastră empirică, considerăm o entitate și graficul său de dependență a licenței ca având o structură cu un singur strat dacă entitatea nu are dependențe și o structură cu mai multe straturi dacă are una sau mai multe dependențe.

‘Dintre 3.612 de seturi de date țintă, 2.086 (57,8%) au avut structuri cu mai multe straturi, în timp ce celelalte 1.526 (42,2%) au avut structuri cu un singur strat, fără dependențe.’

Seturile de date protejate prin drepturi de autor pot fi redistribuite doar cu autoritate legală, care poate proveni dintr-o licență, excepții de drepturi de autor sau termeni de contract. Redistribuirea neautorizată poate duce la consecințe legale, inclusiv încălcarea drepturilor de autor sau încălcarea contractului. Prin urmare, identificarea clară a neconformității este esențială.

Încălcări ale distribuirii găsite sub Criterionul 4.4. al Conformității datelor menționat în lucrare.

Încălcări ale distribuirii găsite sub Criterionul 4.4. al Conformității datelor menționat în lucrare.

Studiul a găsit 9.905 de cazuri de redistribuire neconformă a seturilor de date, împărțite în două categorii: 83,5% au fost interzise în mod explicit de termenii de licență, făcând redistribuirea o încălcare clară a legii; și 16,5% au implicat seturi de date cu condiții de licență conflictuale, unde redistribuirea era permisă în teorie, dar nu a îndeplinit termenii ceruți, creând riscuri legale în aval.

Autorii recunosc că criteriile de risc propuse în NEXUS nu sunt universale și pot varia în funcție de jurisdicție și aplicație de inteligență artificială, și că îmbunătățirile viitoare ar trebui să se concentreze pe adaptarea la reglementările globale în schimbare și pe rafinarea revizuirii legale conduse de inteligență artificială.

Concluzii

Acesta este un articol prolix și în mare măsură nefamiliar, dar abordează poate cel mai mare factor care încetinește adoptarea actuală a inteligenței artificiale în industrie – posibilitatea ca datele “deschise” să fie revendicate ulterior de diverse entități, persoane și organizații.

Sub DMCA, încălcările pot atrage amenzi masive pe bază de caz. În cazurile în care încălcările pot ajunge la milioane, așa cum au descoperit cercetătorii, răspunderea legală potențială este cu adevărat semnificativă.

În plus, companiile care pot fi dovedite a fi beneficiat de datele de upstream nu pot (de obicei) să invoce ignorarea ca scuză, cel puțin pe piața influentă din SUA. Nici nu au în prezent instrumente realiste cu care să pătrundă în implicațiile labirintice îngropate în acordurile de licență ale seturilor de date “deschise”.

Problema constă în faptul că formularea unui sistem, cum ar fi NEXUS, este suficient de dificilă pentru a-l calibra pe o bază per stat în interiorul SUA sau pe o bază per națiune în interiorul UE; perspectiva de a crea un cadru global adevărat (o “Interpol pentru proveniența seturilor de date”) este subminată nu numai de motivele conflictuale ale diverse guverne implicate, dar și faptul că atât aceste guverne, cât și starea actualelor lor legi în această privință sunt în constantă schimbare.

 

* Înlocuirea mea a citatelor autorilor cu legături.
Șase tipuri sunt prescrise în lucrare, dar ultimele două nu sunt definite.

Publicat pentru prima dată vineri, 7 martie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai