Lideri de opinie
Costul ridicat al datelor murdare în dezvoltarea inteligenței artificiale
Nu este un secret că există o goană după aur în dezvoltarea inteligenței artificiale. Conform Indexului de tendințe de lucru 2024 de la Microsoft (MSFT ) și Linkedin, peste 40% dintre liderii de afaceri anticipează o redesenare completă a proceselor de afaceri de la zero, utilizând inteligența artificială (IA) în următorii câțiva ani. Această schimbare seismică nu este doar o actualizare tehnologică, ci o transformare fundamentală a modului în care funcționează afacerile, iau decizii și interacționează cu clienții. Această dezvoltare rapidă alimentează o cerere de date și instrumente de gestionare a datelor de primă parte. Conform Forrester, un procent impresionant de 92% dintre liderii tehnologici plănuiesc să crească bugetele pentru gestionarea datelor și IA în 2024.
În cel mai recent Studiu global McKinsey despre IA, 65% dintre respondenți au indicat că organizațiile lor utilizează în mod regulat tehnologii de inteligență artificială generativă. În timp ce această adoptare semnifică un salt semnificativ înainte, ea evidențiază și o provocare critică: calitatea datelor care alimentează aceste sisteme IA. Într-o industrie în care IA eficientă este la fel de bună ca datele pe care este antrenată, datele fiabile și precise devin din ce în ce mai greu de obținut.
Costul ridicat al datelor de proastă calitate
Datele de proastă calitate nu sunt o problemă nouă, dar impactul lor este amplificat în era inteligenței artificiale. În urmă cu câțiva ani, un studiu al Institutului de Tehnologie din Massachusetts (MIT) a estimat că datele de proastă calitate costă companiile un procent uluitor de 15% până la 25% din venituri. În 2021, Gartner a estimat că datele de proastă calitate costă organizațiile o medie de 12,9 milioane de dolari pe an.
Datele murdare – date incomplete, inexacte sau inconsistente – pot avea un efect de cascadă asupra sistemelor IA. Când modelele IA sunt antrenate pe date de proastă calitate, insight-urile și previziunile rezultate sunt fundamental defecte. Acest lucru nu numai că subminează eficacitatea aplicațiilor IA, dar prezintă și riscuri semnificative pentru afacerile care se bazează pe aceste tehnologii pentru luarea deciziilor critice.
Acest lucru creează o problemă majoră pentru echipele de știință a datelor corporative, care au trebuit să-și concentreze resursele limitate pe curățarea și organizarea datelor. Într-un recent raport de inginerie al analizei realizat de DBT, 57% dintre profesioniștii în știința datelor au menționat calitatea slabă a datelor ca o problemă predominantă în munca lor.
Implicațiile asupra modelelor IA
Impactul datelor de proastă calitate asupra dezvoltării IA se manifestă în trei moduri principale:
- Reducerea acurateței și fiabilității: Modelele IA prosperă pe modele și corelații derivate din date. Când datele de intrare sunt compromise, modelele produc ieșiri neverosimile; cunoscute sub numele de “halucinații IA”. Acest lucru poate duce la strategii înșelătoare, eșecuri de produse și pierderea încrederii clienților.
- Amplificarea prejudecăților: Datele murdare conțin adesea prejudecăți care, dacă nu sunt controlate, sunt încorporate în algoritmii IA. Acest lucru poate duce la practici discriminatorii, în special în domenii sensibile precum angajarea, împrumuturile și aplicarea legii. De exemplu, dacă un instrument de recrutare IA este antrenat pe date istorice de angajare biasate, poate favoriza în mod injust anumite demografii față de altele.
- Creșterea costurilor operaționale: Sistemele IA defecte necesită ajustări și reantrenări constante, ceea ce consumă timp și resurse suplimentare. Companiile pot găsi că se află într-un ciclu perpetuu de corectare a erorilor, în loc de inovare și îmbunătățire.
Apocalipsa datelor
“Ne apropiem rapid de un “punct de cotitură” – în care conținutul generat de non-umani va depăși cantitatea de conținut generat de oameni. Progresele în IA însăși oferă noi instrumente pentru curățarea și validarea datelor. Cu toate acestea, cantitatea imensă de conținut generat de IA pe internet este în creștere exponențială.
Pe măsură ce mai mult conținut generat de IA este distribuit pe internet și acest conținut este generat de LLM-uri antrenate pe conținut generat de IA, ne confruntăm cu un viitor în care datele de primă parte și datele de încredere devin bunuri rare și valoroase.
Provocările diluării datelor
Proliferarea conținutului generat de IA creează mai multe provocări majore pentru industrie:
- Controlul calității: Distingerea între date generate de oameni și date generate de IA devine din ce în ce mai dificilă, făcându-l mai greu să se asigure calitatea și fiabilitatea datelor utilizate pentru antrenarea modelelor IA.
- Probleme de proprietate intelectuală: Pe măsură ce modelele IA învață și extrag date generate de IA, apar întrebări cu privire la proprietatea și drepturile asociate cu datele, ceea ce poate duce la complicații legale.
- Implicații etice: Lipsa transparenței cu privire la originea datelor poate duce la probleme etice, cum ar fi răspândirea informațiilor false sau consolidarea prejudecăților.
Datele ca serviciu devin fundamentale
Soluțiile de Date ca Serviciu (DaaS) sunt din ce în ce mai solicitate pentru a completa și îmbunătăți datele de primă parte pentru scopuri de antrenare. Adevărata valoare a DaaS constă în faptul că datele însele au fost normalizate, curățate și evaluate pentru diferite cazuri de utilizare comerciale, precum și standardizarea proceselor pentru a se potrivi cu sistemul care digeră datele. Pe măsură ce această industrie se maturizează, prezic că vom începe să vedem această standardizare în întreaga industrie a datelor.
Pe măsură ce IA continuă să pătrundă în diverse industrii, importanța calității datelor va crește. Companiile care prioritizează datele curate vor obține un avantaj competitiv, în timp ce cele care neglijează acest aspect vor cădea rapid în urmă.
Costul ridicat al datelor murdare în dezvoltarea IA este o problemă presantă care nu poate fi ignorată. Calitatea slabă a datelor subminează fundamentul sistemelor IA, ducând la insight-uri defecte, costuri crescute și potențiale capcane etice. Prin adoptarea unor strategii cuprinzătoare de gestionare a datelor și promovarea unei culturi care valorizează integritatea datelor, organizațiile pot atenua aceste riscuri.
Într-o eră în care datele sunt noul petrol, asigurarea purității lor nu este doar o necesitate tehnică, ci și un imperativ strategic. Companiile care investesc în date curate astăzi vor fi cele care vor conduce inovația de mâine.












