Modele și platforme AI
Cum afectează datele sintetice halucinațiile IA?
Deși datele sintetice sunt un instrument puternic, ele pot reduce halucinațiile inteligenței artificiale doar în anumite circumstanțe. În aproape toate celelalte cazuri, le vor amplifica. De ce se întâmplă acest lucru? Ce înseamnă acest fenomen pentru cei care au investit în el?
Cum se diferențiază datele sintetice de datele reale?
Datele sintetice sunt informații generate de inteligența artificială. În loc să fie colectate din evenimente sau observații din lumea reală, ele sunt produse artificial. Cu toate acestea, ele semănă suficient de mult cu originalul pentru a produce ieșiri precise și relevante. Acesta este ideea, oricum.
Pentru a crea un set de date artificial, inginerii inteligenței artificiale antrenează un algoritm generativ pe o bază de date relațională reală. Când sunt solicitați, ei produc un al doilea set care reflectă îndeaproape primul, dar conține informații false. Deși tendințele generale și proprietățile matematice rămân intacte, există suficient zgomot pentru a masca relațiile originale.
Un set de date generat de inteligența artificială merge dincolo de deidentificare, replicând logica subiacentă a relațiilor dintre câmpuri, în loc să înlocuiască pur și simplu câmpurile cu alternative echivalente. Deoarece nu conține detalii de identificare, companiile pot să le folosească pentru a ocoli reglementările privind confidențialitatea și drepturile de autor. Mai important, ele pot să le partajeze sau să le distribuie liber, fără teama unei încălcări a securității.
Cu toate acestea, informațiile false sunt utilizate mai frecvent pentru suplimentare. Companiile pot să le folosească pentru a îmbogăți sau a extinde dimensiunile mostrelor care sunt prea mici, făcându-le suficient de mari pentru a antrena sistemele de inteligență artificială în mod eficient.
Reduc datele sintetice halucinațiile inteligenței artificiale?
Uneori, algoritmii se referă la evenimente inexistente sau fac sugestii logice imposibile. Aceste halucinații sunt adesea nonsensuale, înșelătoare sau incorecte. De exemplu, un model de limbaj mare poate să scrie un articol despre cum să domesticești lei sau să devii doctor la vârsta de 6 ani. Cu toate acestea, nu toate sunt atât de extreme, ceea ce poate face dificilă recunoașterea lor.
Dacă sunt curate corespunzător, datele artificiale pot reduce aceste incidente. O bază de date de antrenare relevantă și autentică este fundamentul oricărui model, astfel că este logic că, cu cât mai multe detalii are cineva, cu atât mai precisă va fi ieșirea modelului. Un set de date suplimentar permite scalabilitate, chiar și pentru aplicații de nișă cu informații publice limitate.
Dezvoltarea este o altă modalitate prin care o bază de date sintetică poate reduce halucinațiile inteligenței artificiale. Conform Școlii de Management Sloan a MIT, poate ajuta la abordarea prejudecăților deoarece nu este limitată la dimensiunea mostrei originale. Profesionistii pot să folosească detalii realiste pentru a umple golurile în care subpopulațiile selectate sunt sub sau suprareprezentate.
Cum fac datele artificiale halucinațiile mai grave
Deoarece algoritmii inteligenței artificiale nu pot raționa sau contextualiza informațiile, ele sunt predispuse la halucinații. Modelele generative — în special modelele de limbaj mare preantrenate — sunt deosebit de vulnerabile. În unele moduri, faptele artificiale compun problema.
Amplificarea prejudecăților
La fel ca oamenii, inteligența artificială poate învăța și reproduce prejudecăți. Dacă o bază de date artificială supravalorizează anumite grupuri, în timp ce subreprezintă altele — ceea ce este ușor de făcut accidental — logica sa de luare a deciziilor se va distorsiona, afectând negativ precizia ieșirii.
Un problemă similară poate apărea atunci când companiile folosesc date false pentru a elimina prejudecățile lumii reale, deoarece ele nu mai reflectă realitatea. De exemplu, deoarece peste 99% din cazurile de cancer mamar apar la femei, utilizarea informațiilor suplimentare pentru a echilibra reprezentarea poate distorsiona diagnosticarea.
Halucinații intersecționale
Intersecționalitatea este un cadru sociologic care descrie modul în care demografii precum vârsta, sexul, rasa, ocupația și clasa se intersectează. Analizează modul în care identitățile sociale suprapuse ale grupurilor duc la combinații unice de discriminare și privilegii.
Când un model generativ este solicitat să producă detalii artificiale pe baza celor pe care le-a învățat, el poate genera combinații care nu au existat în original sau sunt logic imposibile.
Ericka Johnson, profesor de gen și societate la Universitatea Linköping, a lucrat cu un om de știință în domeniul inteligenței artificiale pentru a demonstra acest fenomen. Ei au folosit o rețea adversă generativă pentru a crea versiuni sintetice ale cifrelor recensământului Statelor Unite din 1990.
Imediat, ei au observat o problemă evidentă. Versiunea artificială avea categorii intitulate „soție și necăsătorit” și „soți niciodată căsătoriți”, ambele fiind halucinații intersecționale.
Fără o curare corespunzătoare, baza de date replică va reprezenta întotdeauna subpopulațiile dominante din seturile de date, în timp ce va subreprezenta — sau chiar exclude — grupurile subreprezentate. Cazurile marginale și outlierii pot fi ignorați complet în favoarea tendințelor dominante.
Prăbușirea modelului
O dependență excesivă de modele și tendințe artificiale conduce la prăbușirea modelului — unde performanța unui algoritm se deterioră drastic, devenind mai puțin adaptabil la observațiile și evenimentele lumii reale.
Acest fenomen este deosebit de evident în inteligența artificială generativă de ultimă generație. Utilizarea repetată a unei versiuni artificiale pentru a antrena aceste modele duce la un cerc vicios. Un studiu a constatat că calitatea și rechemarea lor scad progresiv, fără suficiente cifre recente și reale în fiecare generație.
Supraajustare
Supraajustarea este o dependență excesivă de datele de antrenare. Algoritmul funcționează bine inițial, dar va halucina atunci când i se prezintă noi puncte de date. Informațiile sintetice pot compune această problemă, dacă nu reflectă cu acuratețe realitatea.
Implicațiile utilizării continue a datelor sintetice
Piața datelor sintetice este în plină expansiune. Companiile din acest sector de nișă au strâns aproximativ 328 de milioane de dolari în 2022, față de 53 de milioane de dolari în 2020 — o creștere de 518% în doar 18 luni. Este important de remarcat că aceasta este doar finanțarea publică cunoscută, ceea ce înseamnă că suma reală poate fi și mai mare. Este sigur să spunem că firmele sunt incredibil de investite în această soluție.
Dacă firmele continuă să utilizeze o bază de date artificială fără o curare și o dezvoltare corespunzătoare, performanța modelului lor va scădea progresiv, stricând investițiile lor în inteligența artificială. Rezultatele pot fi mai severe, în funcție de aplicație. De exemplu, în domeniul sănătății, o creștere a halucinațiilor poate duce la diagnosticări greșite sau planuri de tratament incorecte, ceea ce poate duce la rezultate mai slabe pentru pacienți.
Soluția nu va implica revenirea la datele reale
Sistemele de inteligență artificială au nevoie de milioane, dacă nu miliarde, de imagini, texte și videoclipuri pentru antrenare, multe dintre acestea fiind extrase din site-urile publice și compilate în seturi de date masive și deschise. Din nefericire, algoritmii consumă aceste informații mai rapid decât oamenii pot să le genereze. Ce se întâmplă când învață totul?
Liderii de afaceri se tem de lovitura peretelui de date — punctul în care toate informațiile publice de pe internet au fost epuizate. Acest moment poate fi mai aproape decât cred.
Deși cantitatea de text simplu de pe o pagină web obișnuită și numărul de utilizatori de internet cresc cu 2% până la 4% anual, algoritmii se epuizează de date de calitate. Doar 10% până la 40% pot fi utilizate pentru antrenare fără a compromite performanța. Dacă tendințele continuă, stocul de informații publice generate de oameni ar putea fi epuizat până în 2026.
Probabil, sectorul inteligenței artificiale va lovi peretele de date și mai devreme. Boomul inteligenței artificiale generative din ultimii ani a crescut tensiunile legate de proprietatea informațiilor și de încălcarea drepturilor de autor. Mai mulți proprietari de site-uri web utilizează Protocolul de Excludere a Robotilor — un standard care utilizează un fișier robots.txt pentru a bloca crawlerele web — sau fac clar că site-ul lor este închis.
Un studiu din 2024, publicat de un grup de cercetare condus de MIT, a arătat că restricțiile din setul de date Colossal Cleaned Common Crawl (C4) — un corpus de crawlers web la scară largă — sunt în creștere. Peste 28% din sursele cele mai active și critice din C4 au fost restricționate în total. Mai mult, 45% din C4 este acum desemnat ca fiind închis de condițiile de serviciu.
Dacă firmele respectă aceste restricții, prospețimea, relevanța și acuratețea faptelor publice din lumea reală vor scădea, forțându-le să se bazeze pe baze de date artificiale. Este posibil să nu aibă multă alegere, dacă instanțele decid că orice alternativă este o încălcare a drepturilor de autor.
Viitorul datelor sintetice și al halucinațiilor inteligenței artificiale
Pe măsură ce legile drepturilor de autor se modernizează și mai mulți proprietari de site-uri web ascund conținutul de crawlerele web, generarea de seturi de date artificiale va deveni tot mai populară. Organizațiile trebuie să se pregătească pentru a face față amenințării halucinațiilor.












