Tankeledere

Den høye kostnaden av dårlig data i AI-utvikling

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Det er ingen hemmelighet at det pågår en moderne gullrush i AI-utvikling. Ifølge 2024 Work Trend Index av Microsoft (MSFT ) og Linkedin, forventer over 40% av bedriftsledere å gjennomføre en fullstendig omstrukturering av sine forretningsprosesser ved hjelp av kunstig intelligens (AI) innen de neste få årene. Dette seizmiske skiftet er ikke bare en teknologisk oppgradering, men en grunnleggende transformasjon av hvordan bedrifter opererer, tar beslutninger og samhandler med kunder. Denne raske utviklingen driver en etterspørsel etter data og første-part-data-håndtering-verktøy. Ifølge Forrester, planlegger en overveldende 92% av teknologiledere å øke sine datahåndtering- og AI-budsjett i 2024.

I den seneste McKinsey Global Survey on AI, indikerte 65% av respondentene at deres organisasjoner regelmessig bruker generative AI-teknologier. Mens denne tilpasningen markerer et betydelig sprang fremover, høylytter den også en kritisk utfordring: kvaliteten på dataene som mates inn i disse AI-systemene. I en bransje hvor effektiv AI bare er like god som dataene den er trenet på, blir pålitelige og nøyaktige data stadig vanskeligere å få tak i.

Den høye kostnaden av dårlig data

Dårlig data er ikke et nytt problem, men dens påvirkning er forsterket i AI-tiden. Tilbake i 2017 estimerte en studie ved Massachusetts Institute of Technology (MIT) at dårlig data kostet bedrifter en overveldende 15% til 25% av deres inntekter. I 2021 estimerte Gartner at dårlig data kostet organisasjoner i gjennomsnitt 12,9 millioner dollar per år.

Dårlig data – data som er ufullstendig, uriktig eller inkonsistent – kan ha en kaskadeffekt på AI-systemer. Når AI-modeller er trenet på dårlig kvalitetsdata, er de resulterende innsiktene og forutsagnene fundamentalt feil. Dette undergraver ikke bare effektiviteten av AI-applikasjoner, men utgjør også betydelige risikoer for bedrifter som avhenger av disse teknologiene for kritiske beslutninger.

Dette skaper en stor hodepine for bedriftens datavitenskapelige team som har måttet øke fokus på å rense og organisere data. I en nylig statlige ingeniørrapport utført av DBT, 57% av datavitenskapsfolkene pekte på dårlig datakvalitet som et dominerende problem i deres arbeid.

Konsekvensene for AI-modeller

Påvirkningen av dårlig data på AI-utvikling manifesterer seg på tre hovedmåter:

  1. Redusert nøyaktighet og pålitelighet: AI-modeller blomstrer på mønster og korrelasjoner avledet fra data. Når inndataene er forurenset, produserer modellene upålitelige utdata; kjent som “AI-hallusinasjoner”. Dette kan føre til feilaktige strategier, produktfeil og tap av kundetillit.
  2. Forsterket bias: Dårlig data inneholder ofte bias som, hvis de ikke kontrolleres, blir innarbeidet i AI-algoritmer. Dette kan føre til diskriminerende praksiser, spesielt i følsomme områder som rekruttering, långivning og lovverk. For eksempel, hvis et AI-rekrutteringsverktøy er trenet på fordomsfulle historiske rekrutteringsdata, kan det urettferdig favorisere visse demografiske grupper over andre.
  3. Økte driftskostnader: Feilaktige AI-systemer krever konstant justering og om-trening, noe som forbruker ekstra tid og ressurser. Bedrifter kan finne seg i en evig syklus av feilretting i stedet for innovasjon og forbedring.

Den kommende datapokalypsen

“Vi nærmer oss raskt en “tipping point” – hvor ikke-menneskegenerert innhold vil overstige mengden av menneskegenerert innhold. Fremgangen i AI selv gir nye verktøy for datarensing og validering. Likevel er mengden AI-generert innhold på nettet økende eksponentielt.

Ettersom mer AI-generert innhold publiseres på nettet, og dette innholdet er generert av LLM-er trenet på AI-generert innhold, ser vi frem til en fremtid hvor førstegenerert og pålitelig data blir truet og verdifulle varer.

Utfordringene med datautspredning

Spredningen av AI-generert innhold skaper flere store industrielle utfordringer:

  • Kvalitetskontroll: Å skille mellom menneskegenerert og AI-generert data blir stadig vanskeligere, noe som gjør det vanskeligere å sikre kvaliteten og påliteligheten av data brukt til å trene AI-modeller.
  • Eierskaps- og rettighetsproblemer: Når AI-modeller uforvarende skraper og lærer av AI-generert innhold, oppstår spørsmål om eierskap og rettigheter knyttet til dataene, noe som kan føre til juridiske komplikasjoner.
  • Etiske implikasjoner: Mangel på åpenhet om dataens opphav kan føre til etiske problemer, som spredning av feilaktig informasjon eller forsterkning av fordommer.

Data-as-a-Service blir grunnleggende

Økende Data-as-a-Service (DaaS)-løsninger søkes etter for å komplementere og forbedre første-part-data for trening. Den sanne verdien av DaaS er dataene selv som har blitt normalisert, rensket og evaluert for varierende troverdighet og kommersiell anvendelse, samt standardisering av prosessene for å passe systemet som fordøyer dataene. Ettersom denne industrien modnes, forventer jeg at vi kommer til å se denne standardiseringen over hele dataindustrien. Vi ser allerede denne drivkraften mot enhetlighet innen detaljhandelsmedie-sektoren.

Ettersom AI fortsetter å trenge inn i ulike bransjer, vil betydningen av datakvalitet bare øke. Bedrifter som prioriterer ren data vil få en konkurransefordel, mens de som neglisjerer det vil raskt falle bakover.

Den høye kostnaden av dårlig data i AI-utvikling er et presserende problem som ikke kan ignoreres. Dårlig datakvalitet undergraver fundamentet for AI-systemer, noe som fører til feilaktige innsikter, økte kostnader og potensielle etiske fallgruber. Ved å adoptere omfattende datahåndteringstrategier og fremme en kultur som verdsetter dataintegritet, kan organisasjoner mildne disse risikoene.

I en tid hvor data er det nye oljen, er det ikke bare en teknisk nødvendighet å sikre dataens renhet, men også en strategisk imperativ. Bedrifter som investerer i ren data i dag vil være de som leder innovasjonsfronten i morgen.

Eli Goodman er administrerende direktør og medgrunnlegger av Datos, A Semrush Company. Med over 25 års erfaring i det digitale og datarommet, har Eli hatt ledelsesroller i en rekke alternative data-selskaper, inkludert en 9-års periode i ComScore.