Ajatusjohtajat

Likaisen datan korkea hinta tekoälykehityksessä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tehtävässä ei ole salaisuutta, että tekoälykehityksessä on meneillään nykyajan kultaryntäys. Microsoftin ja LinkedInin vuoden 2024 työntekijöiden trendiraportin mukaan yli 40 % yritysjohtajista odottaa, että he suunnittelevat liiketoimintaprosessinsa kokonaan uudelleen tekoälyä (AI) käyttäen seuraavien vuosien aikana. Tämä maanjäristysmäinen muutos ei ole pelkästään teknologinen päivitys; se on perustavanlaatuinen muutos siinä, miten yritykset toimivat, tekevät päätöksiä ja vuorovaikuttavat asiakkaiden kanssa. Tämä nopea kehitys luo suuren tarpeen datalle ja ensimmäisen osapuolen datahallintatyökaluille. Forresterin mukaan hämmästyttävät 92 % teknologiajohtajista aikovat lisätä datahallinta- ja tekoälybudjettejaan vuonna 2024.

(MSFT )

Viimeisimmässä McKinsey Global Survey on AI -tutkimuksessa 65 % vastaajista ilmoitti, että heidän organisaatiot käyttävät säännöllisesti generatiivisia tekoälytekniikoita. Vaikka tämä omaksuminen merkitsee merkittävää loikkaa eteenpäin, se korostaa myös kriittistä haastetta: datan laatu, jota nämä tekoälyjärjestelmät syöttävät. Teollisuudessa, jossa tehokas tekoäly on yhtä hyvä kuin siihen koulutettu data, luotettava ja tarkka data on yhä vaikeampi löytää.

Likaisen datan korkea hinta

Likainen data ei ole uusi ongelma, mutta sen vaikutus on voimistunut tekoälyn aikakaudella. Vuonna 2017 Massachusettsin teknillisen korkeakoulun (MIT) tutkimuksen mukaan likainen data maksaa yrityksille hämmästyttävät 15-25 % liikevaihdostaan. Vuonna 2021 Gartnerin arvion mukaan huono data maksaa organisaatioille keskimäärin 12,9 miljoonaa dollaria vuodessa.

Likainen data – data, joka on epätäydellistä, epätarkkaa tai epäjohdonmukaista – voi aiheuttaa ketjureaktion tekoälyjärjestelmissä. Kun tekoälymallit koulutetaan huonolaatuisella datalla, tulokset ja ennusteet ovat perustavanlaatuisesti virheellisiä. Tämä ei vain heikenna tekoälysovellusten tehokkuutta, vaan aiheuttaa myös merkittäviä riskejä yrityksille, jotka riippuvat näistä teknologioista kriittisissä päätöksissä.

Tämä luo suuren päänvaivan yritysten data-tiedeyksiköille, jotka ovat joutuneet yhä enemmän keskittämään rajatut resurssinsa datan puhdistamiseen ja järjestämiseen. Viimeisimmässä insinööritutkimuksessa, jonka DBT teki, 57 % data-tutkijoista mainitsi huonon datan laadun merkittävimpänä ongelmana työssään.

Vaikutukset tekoälymalliin

Likaisen datan vaikutus tekoälykehitykseen ilmenee kolmella tavalla:

  1. Vähentynyt tarkkuus ja luotettavuus: Tekoälymallit menestyvät datasta johdettujen mallien ja korrelaatioiden ansiosta. Kun syötedata on tahriintunut, mallit tuottavat epäluotettavia tuloksia; yleisesti tunnettuja “tekoälyharhoja”. Tämä voi johtaa harhaanjohtaviin strategioihin, tuotepetoksiin ja asiakastiedon menetykseen.
  2. Harhan voimistuminen: Likainen data sisältää usein harhoja, jotka, jos ne jätetään tarkistamatta, sisällytetään tekoälyalgoritmeihin. Tämä voi johtaa syrjiviin käytäntöihin, erityisesti herkillä aloilla kuten palkkaamisessa, lainoissa ja lainvalvonnassa. Esimerkiksi, jos tekoälypalkkaamistyökalu on koulutettu syrjivällä historiallisella palkkausdatalla, se voi epäoikeudenmukaisesti suosia tiettyjä demografioita toisten kustannuksella.
  3. Lisääntyneet toimintakustannukset: Virheelliset tekoälyjärjestelmät vaativat jatkuvaa säätämistä ja uudelleenkoulutusta, mikä kuluttaa lisää aikaa ja resursseja. Yritykset saattavat löytää itsensä jatkuvasta virheiden korjaamisesta innovoinnin ja parantamisen sijaan.

Tuleva datakatastrofi

“Lähennemme nopeasti “kääntöpistettä” – jossa ei-ihmisen luoma sisältö ylittää merkittävästi ihmisen luoman sisällön määrän. Tekoälyn itsensä edistäminen tarjoaa uusia työkaluja datan puhdistamiseen ja validointiin. Kuitenkin verkkosisällön määrä, jota tekoäly tuottaa, kasvaa eksponentiaalisesti.

Kun enemmän tekoälyluotua sisältöä siirretään verkkoon ja tämä sisältö on luotu LLM:llä, joka on koulutettu tekoälyluotuisella sisällöllä, katselemme tulevaisuutta, jossa ensimmäisen osapuolen ja luotettava data muuttuvat uhanalaisiksi ja arvokkaiksi hyödykkeiksi.

Haasteet datan diluutiossa

Tekoälyluotuisen sisällön lisääntyminen luo useita suuria haasteita teollisuudelle:

  • Laadunvalvonta: Ihmisen luoman ja tekoälyluotuisen datan erottaminen muodostuu yhä vaikeammaksi, mikä vaikeuttaa datan laadun ja luotettavuuden varmistamista tekoälymallien koulutukseen.
  • Tekijänoikeusongelmat: Kun tekoälymallit vahingossa keräävät ja oppivat tekoälyluotuisesta sisällöstä, herää kysymyksiä datan omistajuudesta ja oikeuksista, mikä voi johtaa oikeudellisiin seikkailuihin.
  • Eettiset vaikutukset: Datansyynnin puute voi johtaa eettisiin ongelmiin, kuten virheellisen tiedon leviämiseen tai harhaisuuksien vahvistamiseen.

Data-palveluista tulee perustavanlaatuinen

Yhä useammin Data-palvelu (DaaS) -ratkaisuja etsitään ensimmäisen osapuolen datan täydentämiseksi ja parantamiseksi koulutustarkoituksiin. DaaS:n todellinen arvo on datan itsessään olevan normalisoidun, puhdistetun ja arvioituun eri uskottavuuden ja kaupallisen soveltamisen asiakastapauksissa, sekä prosessien standardisoinnin järjestelmän sulattamiseksi. Kun tämä teollisuus kypsyy, ennustan, että näemme tämän standardisoinnin laajenemisen koko data-alalle. Olemme jo näkemässä tämän yhdenmukaisuuden pyrkimystä vähittäiskaupan mediasektorilla.

Kun tekoäly jatkaa tunkeutumistaan eri teollisuusaloille, datan laadun merkitys korostuu entisestään. Yritykset, jotka priorisoivat puhdasdataa, saavat kilpailuedun, kun taas ne, jotka laiminlyövät sen, jäävät nopeasti jälkeen.

Likaisen datan korkea hinta tekoälykehityksessä on painava ongelma, jota ei voida jättää huomiotta. Huono datan laatu heikentää tekoälyjärjestelmien perustaa, johtaen virheisiin, kustannuksiin ja mahdollisiin eettisiin ongelmiiin. Ottamalla käyttöön kattavat datahallintastrategiat ja edistämällä datan eheysarvoa yritykset voivat lieventää näitä riskejä.

Aikakaudella, jossa data on uusi öljy, sen puhtauden varmistaminen ei ole pelkästään tekninen välttämättömyys, vaan strateginen imperatiivi. Yritykset, jotka investoivat puhdasdataan tänään, ovat ne, jotka johtavat innovaatioetua huomenna.

Eli Goodman on Datosin toimitusjohtaja ja perustaja, Semrushin tytäryhtiö. Yli 25 vuoden kokemuksella digitaalisessa ja data-alaan liittyvässä toiminnassa, Eli on toiminut johtotehtävissä useissa vaihtoehtoisissa data-yrityksissä, mukaan lukien 9 vuoden ajan ComScorella.