Lideri de opinie

Ascensiunea datelor sintetice și de ce vor completa, nu vor înlocui datele reale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Elon Musk a declarat recent că am epuizat datele umane disponibile pentru antrenarea modelelor de inteligență artificială. Avertizarea sa este ultimul comentariu cu privire la nevoia de surse de date noi, dacă inteligența artificială urmează să-și continue progresul rapid. În industrii precum sănătatea și finanele, reglementările stricte de confidențialitate fac ca lipsa de date să fie și mai acută.

În timp ce datele sintetice – o soluție posibilă pentru această lipsă – nu sunt noi, importanța lor continuă să crească, așa cum se vede din recentele valuri de fuziuni și investiții în acest domeniu. Există, totuși, incertitudini profunde cu privire la utilizarea datelor sintetice, în special riscul de colaps al modelului, în care calitatea ieșirii unui model de limbaj mare multimodal (LLM) se deteriorează fără date din lumea reală pentru a fi antrenat. Dacă această problemă se dovedește a fi insurmontabilă sau soluționabilă, poate avea un impact semnificativ asupra viitorului inteligenței artificiale generative (Gen AI).

Ce sunt datele sintetice și cum sunt create?

Datele sintetice sunt create artificial, în loc de a fi colectate din evenimente reale. Datele sintetice generate de inteligența artificială sunt acum forma cea mai răspândită, care implică antrenarea de modele pe date din lumea reală pentru a detecta modele și corelații, apoi generarea de date noi care imită aceste proprietăți statistice.

Modelele LLM sunt utilizate pentru a genera o varietate de tipuri de date sintetice, inclusiv date structurate, cum ar fi datele tabulare, și date nestructurate, cum ar fi textele libere, videourile și imaginile. O serie de metode sunt utilizate, în funcție de tipul de date care sunt produse.

De exemplu, două metode comune utilizate pentru generarea de date sintetice de imagine sunt GAN și modelele de difuzie. GAN utilizează două rețele neuronale: un generator creează versiuni artificiale ale datelor reale, în timp ce un discriminator identifică care dintre ele sunt reale și care sunt generate. Lucrând împreună în mod continuu, generatorul încearcă să “înșele” discriminatorul, îmbunătățind în mod constant realismul și diversitatea datelor artificiale. Modelele de difuzie adoptă o abordare diferită, învățând să distorsioneze datele reale și apoi să inverseze acest proces pentru a “denoiza” datele. Odată antrenate eficient, pot produce date sintetice de înaltă calitate, atât audio, cât și vizuale.

Importanța crescândă a datelor sintetice

A existat un interes de lungă durată pentru datele sintetice. Cu toate acestea, în ultimii 5 ani, dezvoltarea rapidă a modelelor LLM a crescut atât cererea de date sintetice, cât și a creat un mijloc și mai eficient de a le genera la scară. Ca urmare, utilizarea datelor sintetice a explodat.

Gartner a prevăzut că datele sintetice vor reprezenta 60% din toate datele utilizate pentru antrenarea modelelor LLM până în 2024, de la doar 1% în 2021. Există toate motivele să credem că această estimare este în general corectă. De exemplu, modelul Phi-4 al Microsoft, care depășește alte modele LLM, deși este mult mai mic, a fost antrenat cu succes pe date sintetice. Între timp, inginerii de la Amazon Alexa exploră utilizarea unui model “profesor/elev” în care modelul “profesor” generează date sintetice, care sunt apoi utilizate pentru a ajusta un model “elev” mai mic.

Acestă adoptare pe scară largă este reflectată și de mișcările majore de pe piață. Sectorul datelor sintetice a cunoscut o explozie de investiții în 2021-22. Gretel AI și Tonic.ai au obținut runde de investiții Seria B de 50 de milioane de dolari, respectiv 35 de milioane de dolari. Acestea au fost urmate de MOSTLY AI, care a închis o rundă de investiții Seria B de 25 de milioane de dolari și Synthesis AI, care a obținut 17 milioane de dolari într-o rundă de investiții Seria A.

Mai recent, tendința a fost spre achiziții la scară largă. Achiziția Gretel de către NVIDIA în această primăvară va sprijini propriile eforturi ale gigantului tehnologic în acest domeniu. La fel, compania de soluții AI SAS a achiziționat startup-ul de date sintetice Hazy în noiembrie 2024.

Firma de analize Cognilytica a estimat că piața pentru generarea de date sintetice a fost de aproximativ 110 milioane de dolari în 2021. Compania estimează că va ajunge la 1,15 miliarde de dolari până în 2027. Alte previziuni anticipă o rată anuală de creștere de 31% pentru sector, pe măsură ce va ajunge la 2,33 miliarde de dolari până în 2030.

Colapsul modelului

Cu toate acestea, potențialul excitant al datelor sintetice vine cu un inconvenient semnificativ: colapsul modelului. Acesta este un fenomen în care modelele LLM antrenate exclusiv pe date sintetice încep să producă ieșiri mai puțin precise sau mai puțin diverse.

În timp ce datele din lumea reală tind să fie complexe, datele sintetice sunt adesea simplificate și condensate de modele. De exemplu, cercetătorii au descoperit că acuratețea unui model antrenat pentru a detecta alunițe canceroase din fotografii era invers proporțională cu cantitatea de date sintetice de antrenare. Un studiu recent realizat de academicieni de la Oxford, Cambridge, Imperial College și Universitatea din Toronto a constatat că utilizarea datelor generate de model în mod indiscriminat a dus la “defecte ireversibile în modelul rezultat.”

Mai rău, majoritatea modelelor LLM sunt “cutii negre”, făcând dificilă înțelegerea modului în care vor răspunde la date sintetice. Cercetătorii de la Universitatea Rice și Stanford au concluzionat că, fără unele date proaspete din lumea reală, “modelele generative viitoare sunt condamnate să aibă calitatea (precizia) sau diversitatea (recalcularea) lor să scadă progresiv.”

Nevoia continuă de date din lumea reală

Evident, chiar și cu creșterea cererii de date sintetice, nevoia de date din lumea reală rămâne. De fapt, cererea de date de înaltă calitate din lumea reală poate chiar să crească. Motivul este dublu. În primul rând, datele din lumea reală vor fi întotdeauna necesare pentru a antrena modelele de inteligență artificială care generează datele sintetice. În al doilea rând, pentru a evita colapsul modelului, este necesar să se sincronizeze în mod continuu datele sintetice cu datele din lumea reală.

Date reale pentru antrenarea modelelor de inteligență artificială care produc date sintetice

Așa cum s-a menționat anterior, majoritatea datelor sintetice de astăzi sunt create utilizând Gen AI. Și aceste modele Gen AI trebuie antrenate pe date din lumea reală pentru a crea date sintetice utilizabile. Acest lucru se datorează faptului că ele pot crea date sintetice doar replicând modelele și proprietățile statistice ale unui set de date din lumea reală.

Luați în considerare exemplul recent al unei companii de asigurări care a putut utiliza date sintetice pentru a testa diferiți furnizori fără a compromite datele sensibile ale clienților. Pentru a genera acest set de date sintetice, care a mimat cu acuratețe realitatea, a trebuit să utilizeze propriile date din lumea reală pentru a antrena modelul de inteligență artificială care a generat apoi datele sintetice.

Date reale pentru mitigarea colapsului modelului

Există multiple strategii pentru a mitigarea riscului de colaps al modelului. Acestea includ validarea și revizuirea regulată a seturilor de date sintetice, precum și verificarea calității datelor sintetice înainte de a fi utilizate în modele generative. Cu toate acestea, abordarea cea mai comună este diversificarea datelor utilizate prin combinarea datelor sintetice cu date umane. Sondda Gartner a constatat că 63% dintre respondenți preferă utilizarea unui set de date parțial sintetic, cu doar 13% spunând că utilizează date sintetice în totalitate.

Chiar și adăugarea unor cantități modice de date din lumea reală poate îmbunătăți semnificativ performanța unui model. Cercetătorii de la Universitatea din California de Sud au descoperit că companiile pot înlocui până la 90% din datele lor reale cu date sintetice fără a observa o scădere semnificativă a performanței. Cu toate acestea, înlocuirea acelui ultim 10% de date umane duce la o scădere semnificativă.

Calitatea contează, așa cum este ilustrat de cazul succesului Microsoft cu Phi-4. Acest LLM a fost antrenat pe date sintetice predominant generate de GPT-4o. Cu toate acestea, o parte semnificativă a datelor de preantrenare – un set general de date utilizat pentru prima etapă de antrenare înainte ca un model să fie ajustat – a fost cu grijă selectate, de înaltă calitate, date din lumea reală, incluzând cărți și articole de cercetare.

Beneficiile potențiale pe care le pot aduce datele sintetice

Atunci când datele sintetice sunt utilizate în mod inteligent și combinate eficient cu datele din lumea reală, ele au potențialul de a rezolva șase probleme specifice în ceea ce privește datele de antrenare pentru inteligența artificială: lipsa de date, accesibilitatea, omogenitatea, prejudecățile, problemele de confidențialitate și costurile.

Lipsa de date

Pe măsură ce companiile de inteligență artificială se luptă pentru a câștiga cotă de piață și pentru a realiza noi performanțe, cererea insațiabilă de date pentru a antrena modelele LLM crește. Datele sintetice au potențialul de a umple acest gol, cel puțin conform cercetărilor Gartner. Cu toate acestea, ar trebui remarcat faptul că utilizarea unei cantități semnificative de date reale în seturile de date de preantrenare și pentru sincronizarea pentru a evita colapsul modelului va fi încă necesară.

Accesibilitatea

Companiile mari de tehnologie acționează din ce în ce mai mult ca gardieni ai datelor, creând o barieră pentru intrarea companiilor mai mici. Datele sintetice au potențialul de a democratiza inteligența artificială generativă, făcând volume mari de date de antrenare accesibile și ieftine. Cu toate acestea, acest lucru nu va elimina responsabilitatea companiilor mari de a îmbunătăți accesul la datele din lumea reală, deoarece acestea sunt încă necesare pentru antrenarea modelelor care produc date sintetice.

Omogenitatea

În anumite cazuri de nișă, cum ar fi antrenarea inteligenței artificiale pentru conducerea autonomă, seturile de date din lumea reală sunt prea omogene. În cazul conducerii, dezvoltatorii pot genera date sintetice pentru a umple golurile din date pentru situații neobișnuite. Acest lucru permite modelelor să se antreneze pentru evenimente rare pe drum.

Prejudecățile

Unele seturi de date reale conțin prejudecăți inerente, astfel încât datele sintetice pot fi generate pentru a asigura că modelele de inteligență artificială primesc o imagine mai echilibrată. De exemplu, în finanțe, Autoritatea de Supraveghere Financiară a Regatului Unit (FCA) a argumentat că datele sintetice au potențialul de a contracara prejudecățile potențiale cauzate de faptul că anumite grupuri sunt subreprezentate în seturile de date umane.

Confidențialitatea

În sectoare precum sănătatea și finanele, cerințele de confidențialitate fac ca lipsa de date să fie și mai acută. Cu datele sintetice, companiile pot construi seturi de date de antrenare pentru modelele lor fără a compromite confidențialitatea clienților. Cu toate acestea, așa cum un raport comandat de Societatea Regală a Regatului Unit a subliniat cu referire la datele sintetice în cercetarea medicală, există o presupunere că datele sintetice sunt “inherent private”. Acesta este un “concepție greșită”. Așa cum cercetătorii subliniază, datele sintetice pot scurge informații despre datele din care au fost derivate.

În mod specific, modelele antrenate pe date sensibile sunt vulnerabile la atacuri de inversare a modelului, în care hackerii pot reconstitui porțiuni ale setului de date original.

Costul

În general, datele sintetice sunt generate la un cost mai mic decât datele din lumea reală. De asemenea, acestea vin etichetate, ceea ce economisește timp și costuri. În unele proiecte de antrenare a inteligenței artificiale, până la 80% din proiect este dedicat pregătirii datelor, incluzând etichetarea. Acest lucru explică de ce companii dedicate au apărut special pentru a satisface nevoile de procesare a datelor ale giganților din Valea Siliconului.

Completarea datelor reale, nu înlocuirea lor

Aceste beneficii ale datelor sintetice pot fi valorificate, cu condiția să nu fie tratate ca o înlocuire a datelor reale. În schimb, rolul lor ar trebui să fie să completeze seturile de date reale, oferind modalități de a crește scala punctelor de date disponibile.

În context, noul model LLM al Meta, LLAMA Behemoth, este antrenat pe 30 de trilioane de puncte de date. Evident, găsirea de date reale la această scară este o provocare, dacă nu imposibilă. Cu toate acestea, așa cum s-a menționat, utilizarea datelor din lumea reală este încă o necesitate, fie pentru antrenarea modelelor care produc date sintetice, fie pentru sincronizarea cu datele sintetice pentru a asigura acuratețea și a evita colapsul modelului. La scara la care modelele LLM funcționează în prezent, chiar dacă datele sintetice reprezintă o proporție semnificativă a datelor de antrenare utilizate, va exista încă o cerere substanțială de date din lumea reală. Și acest lucru înseamnă că vor rămâne probleme complexe de rezolvat în jurul gardienilor, accesului, prejudecăților, costurilor și timpului.

Pentru mai mult de 13 ani, Gediminas Rickevicius a fost o forță de creștere în companii de top din domeniul IT, publicitate și logistică din întreaga lume. El a schimbat abordarea tradițională a dezvoltării afacerilor și vânzărilor prin integrarea datelor mari în procesul de luare a deciziilor strategice. Ca Senior VP de Parteneriate Globale la Oxylabs, Gediminas continuă misiunea sa de a împuternici companiile cu soluții de colectare a datelor publice de pe web de ultimă generație.