Tankeledare

Den höga kostnaden för smutsig data i AI-utveckling

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Det är ingen hemlighet att det pågår en modern guldfeber i AI-utveckling. Enligt 2024 års Work Trend Index från Microsoft (MSFT ) och Linkedin, förväntar sig över 40% av företagsledare att helt omstrukturera sina affärsprocesser med hjälp av artificiell intelligens (AI) inom de närmaste åren. Denna seismiska förändring är inte bara en teknisk uppgradering, utan en grundläggande omvandling av hur företag fungerar, fattar beslut och interagerar med kunder. Denna snabba utveckling driver en efterfrågan på data och första-partens datahanteringsverktyg. Enligt Forrester planerar hela 92% av teknikledare att öka sina datahanterings- och AI-budgetar 2024.

I den senaste McKinsey Global Survey on AI angav 65% av respondenterna att deras organisationer regelbundet använder generativa AI-teknologier. Medan denna tillämpning betyder ett betydande språng framåt, betonar den också en kritisk utmaning: kvaliteten på data som matar dessa AI-system. I en bransch där effektiv AI endast är så bra som den data den tränas på, blir tillförlitlig och exakt data allt svårare att få tag på.

Den höga kostnaden för dålig data

Dålig data är inte ett nytt problem, men dess påverkan förstärks i AI-eran. Redan 2017 uppskattade en studie från Massachusetts Institute of Technology (MIT) att dålig data kostar företag en förbluffande 15% till 25% av deras intäkter. 2021 uppskattade Gartner att dålig data kostar organisationer i genomsnitt 12,9 miljoner dollar per år.

Smutsig data – data som är ofullständig, felaktig eller inkonsekvent – kan ha en kaskadeffekt på AI-system. När AI-modeller tränas på dålig kvalitetsdata, är de resulterande insikterna och förutsägelserna grundläggande felaktiga. Detta undergräver inte bara effektiviteten hos AI-applikationer, utan utgör också betydande risker för företag som förlitar sig på dessa teknologier för kritiska beslutsfattanden.

Detta skapar ett stort huvudbry för företagens data science-team som har varit tvungna att alltmer fokusera sina begränsade resurser på att rensa och organisera data. I en nyligen publicerad rapport om tillståndet för analytics engineering från DBT, angav 57% av data science-proffs att dålig datakvalitet var ett dominerande problem i deras arbete.

Effekterna på AI-modeller

Påverkan av dålig data på AI-utveckling manifesterar sig på tre stora sätt:

  1. Minskad noggrannhet och tillförlitlighet: AI-modeller blomstrar på mönster och korrelationer som härrör från data. När indata är förorenad, producerar modellerna opålitliga utdata; allmänt kända som “AI-hallucinationer”. Detta kan leda till missledande strategier, produktmisslyckanden och förlust av kundförtroende.
  2. Förstärkt bias: Smutsig data innehåller ofta bias som, om de lämnas okontrollerade, införs i AI-algoritmer. Detta kan resultera i diskriminerande metoder, särskilt inom känsliga områden som anställning, utlåning och lagstiftning. Om till exempel ett AI-rekryteringsverktyg tränas på partisk historisk anställningsdata, kan det orättvist gynna vissa demografiska grupper framför andra.
  3. Ökade driftskostnader: Felaktiga AI-system kräver konstant justering och omträning, vilket konsumerar extra tid och resurser. Företag kan hamna i en evig cykel av att fixa fel snarare än att innovativa och förbättra.

Den kommande datapokalypsen

“Vi närmar oss snabbt en ‘vändpunkt’ – där icke-mänskligt genererat innehåll kommer att vida överstiga mängden mänskligt genererat innehåll. Framsteg inom AI själv tillhandahåller nya verktyg för datarening och validering. Men den enorma mängden AI-genererat innehåll på webben växer exponentiellt.

När alltmer AI-genererat innehåll publiceras på webben, och det innehållet genereras av LLM:er tränade på AI-genererat innehåll, ser vi fram emot en framtid där första-partens och pålitlig data blir hotade och värdefulla varor.

Utmaningarna med datautspädning

Spridningen av AI-genererat innehåll skapar flera stora branschutmaningar:

  • Kvalitetskontroll: Att skilja mellan mänskligt genererat och AI-genererat data blir allt svårare, vilket gör det svårt att säkerställa kvaliteten och tillförlitligheten hos data som används för att träna AI-modeller.
  • Immateriella rättigheter: När AI-modeller oavsiktligt skrapar och lär av AI-genererat innehåll, uppstår frågor om ägande och rättigheter i förhållande till data, vilket kan leda till juridiska komplikationer.
  • Etiska implikationer: Bristen på transparens om dataursprung kan leda till etiska problem, såsom spridning av desinformation eller förstärkning av bias.

Data som en tjänst blir grundläggande

Alltmer Data som en tjänst (DaaS)-lösningar efterfrågas för att komplettera och förbättra första-partens data för träningsändamål. Det verkliga värdet av DaaS är att data själv har normaliserats, rengjorts och utvärderats för varierande trovärdighet och kommersiella användningsfall, samt standardiseringen av processer för att passa system som konsumerar data. När denna industri mognar, förutspår jag att vi kommer att se denna standardisering inom hela dataindustrin. Vi ser redan denna strävan efter enhetlighet inom detaljhandelsmediebranschen.

När AI fortsätter att genomsyra olika branscher, kommer betydelsen av datakvalitet att öka. Företag som prioriterar ren data kommer att få en konkurrensfördel, medan de som försummar det kommer att falla efter snabbt.

Den höga kostnaden för smutsig data i AI-utveckling är ett brådskande problem som inte kan ignoreras. Dålig datakvalitet undergräver själva grunden för AI-system, vilket leder till felaktiga insikter, ökade kostnader och potentiella etiska fallgropar. Genom att anta omfattande datahanteringsstrategier och främja en kultur som värdesätter dataintegritet, kan organisationer mildra dessa risker.

I en era där data är det nya oljan, är det inte bara en teknisk nödvändighet utan en strategisk imperativ att säkerställa dess renhet. Företag som investerar i ren data idag kommer att vara de som leder innovationsfronten imorgon.

Eli Goodman är VD och medgrundare av Datos, ett företag inom Semrush. Med över 25 års erfarenhet inom digitala och dataområdet har Eli haft ledande roller i ett antal alternativa dataföretag, inklusive en 9-årig tjänstgöring på ComScore.