Thought leaders

De Hoge Kosten van Vuile Data in AI-Ontwikkeling

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het is geen geheim dat er een moderne goudkoorts gaande is in AI-ontwikkeling. Volgens de 2024 Work Trend Index van Microsoft (MSFT ) en Linkedin, verwachten meer dan 40% van de zakelijke leiders hun bedrijfsprocessen volledig te herschikken met behulp van kunstmatige intelligentie (AI) binnen de komende jaren. Deze seismische verschuiving is niet alleen een technologische upgrade; het is een fundamentele transformatie van hoe bedrijven opereren, beslissingen nemen en interactie hebben met klanten. Deze snelle ontwikkeling zet een vraag naar data en first-party databeheertools in gang. Volgens Forrester, zijn 92% van de technologie-leiders van plan om hun databeheer- en AI-begrotingen in 2024 te verhogen.

In de laatste McKinsey Global Survey on AI, gaven 65% van de respondenten aan dat hun organisaties regelmatig generatieve AI-technologieën gebruiken. Terwijl deze adoptie een significante sprong voorwaarts betekent, benadrukt het ook een kritieke uitdaging: de kwaliteit van de data die deze AI-systemen voedt. In een industrie waar effectieve AI alleen zo goed is als de data waarop het getraind is, wordt betrouwbare en nauwkeurige data steeds moeilijker te vinden.

De Hoge Kosten van Slechte Data

Slechte data is geen nieuw probleem, maar de impact ervan wordt versterkt in de tijd van AI. Terug in 2017 schatte een studie van het Massachusetts Institute of Technology (MIT) dat slechte data bedrijven een verbijsterende 15% tot 25% van hun omzet kost. In 2021 schatte Gartner dat slechte data organisaties gemiddeld $12,9 miljoen per jaar kost.

Vuile data – data die onvolledig, onnauwkeurig of inconsistent is – kan een cascade-effect hebben op AI-systemen. Wanneer AI-modellen getraind worden op slechte kwaliteit data, zijn de resulterende inzichten en voorspellingen fundamenteel gebrekkig. Dit ondermijnt niet alleen de effectiviteit van AI-toepassingen, maar vormt ook significante risico’s voor bedrijven die deze technologieën voor kritieke besluitvorming gebruiken.

Dit creëert een groot hoofdpijn voor corporate data science-teams die hun beperkte middelen steeds vaker moeten richten op het schoonmaken en organiseren van data. In een recente state of engineering report van DBT, citeerden 57% van de data science-professionals slechte datakwaliteit als een overheersend probleem in hun werk.

De Gevolgen voor AI-Modellen

De impact van slechte data op AI-ontwikkeling manifesteert zich op drie belangrijke manieren:

  1. Verlaagde Nauwkeurigheid en Betrouwbaarheid: AI-modellen gedijen op patronen en correlaties afgeleid van data. Wanneer de invoerdata verontreinigd is, produceren de modellen onbetrouwbare uitvoer; algemeen bekend als “AI-hallucinaties”. Dit kan leiden tot misleide strategieën, productfalen en verlies van klantvertrouwen.
  2. Versterking van Vooroordelen: Vuile data bevat vaak vooroordelen die, als ze ongecontroleerd blijven, in AI-algoritmes worden ingebed. Dit kan leiden tot discriminatoire praktijken, vooral in gevoelige gebieden zoals werving, lenen en handhaving van de wet. Als bijvoorbeeld een AI-wervingsgereedschap getraind is op vooroordeelbevattende historische wervingsdata, kan het ongerechtvaardigd bepaalde demografische groepen boven anderen bevoordelen.
  3. Verhoogde Operationele Kosten: Gebrekkige AI-systemen vereisen constante aanpassingen en opnieuw trainen, wat extra tijd en middelen verbruikt. Bedrijven kunnen zich in een permanente cyclus van fouten repareren vinden in plaats van innoveren en verbeteren.

De Aanstormende Datapocalyps

“We naderen snel een “keerpunt” – waar niet door mensen gegenereerde inhoud de hoeveelheid door mensen gegenereerde inhoud zal overtreffen. Vooruitgang in AI zelf biedt nieuwe instrumenten voor datavalidatie en -schoonmaak. Echter, de enorme hoeveelheid AI-gegenereerde inhoud op het web groeit exponentieel.

Naarmate meer AI-gegenereerde inhoud op het web wordt geplaatst en die inhoud wordt gegenereerd door LLM’s getraind op AI-gegenereerde inhoud, kijken we naar een toekomst waar first-party en vertrouwde data gevaar lopen en waardevolle handelsware worden.

De Uitdagingen van Data-Dilutie

De verspreiding van AI-gegenereerde inhoud creëert verschillende grote industrie-uitdagingen:

  • Kwaliteitscontrole: Het onderscheiden tussen door mensen gegenereerde en AI-gegenereerde data wordt steeds moeilijker, waardoor het moeilijker wordt om de kwaliteit en betrouwbaarheid van data voor AI-modellen te garanderen.
  • Intellectueel Eigendomsrechten: Aangezien AI-modellen onbewust AI-gegenereerde inhoud scannen en leren, rijzen vragen over het eigendom en de rechten verbonden aan de data, wat kan leiden tot juridische complicaties.
  • Ethische Implicaties: Het gebrek aan transparantie over de oorsprong van data kan leiden tot ethische problemen, zoals de verspreiding van misinformatie of het versterken van vooroordelen.

Data-as-a-Service Wordt Fundamenteel

Steeds vaker worden Data-as-a-Service (DaaS)-oplossingen gezocht om first-party data voor trainingsdoeleinden aan te vullen en te verbeteren. De ware waarde van DaaS ligt in de data zelf, die genormaliseerd, gereinigd en geëvalueerd is voor wisselende geloofwaardigheid en commerciële toepassingsgevallen, evenals de standaardisatie van processen om te passen bij het systeem dat de data verwerkt. Naarmate deze industrie volwassener wordt, voorspel ik dat we standaardisatie in de gehele data-industrie zullen zien. We zien deze drang naar uniformiteit al in de retailmedia-sector.

Naarmate AI verschillende industrieën doordringt, zal de belangrijkheid van datakwaliteit alleen maar toenemen. Bedrijven die schone data prioriteren, zullen een concurrentievoordeel behalen, terwijl diegenen die het negeren snel achter zullen blijven.

De hoge kosten van vuile data in AI-ontwikkeling zijn een dringend probleem dat niet genegeerd kan worden. Slechte datakwaliteit ondermijnt de fundamenten van AI-systemen, leidend tot gebrekkige inzichten, verhoogde kosten en potentiële ethische valkuilen. Door het adopteren van uitgebreide databeheerstrategieën en het bevorderen van een cultuur die data-integriteit waardeert, kunnen organisaties deze risico’s mitigeren.

In een tijdperk waarin data de nieuwe olie is, is het waarborgen van de zuiverheid ervan niet alleen een technische noodzaak, maar een strategisch imperatief. Bedrijven die vandaag in schone data investeren, zullen morgen de innovatiegrens leiden.

Eli Goodman is CEO en mede-oprichter van Datos, een Semrush-bedrijf. Met meer dan 25 jaar ervaring in de digitale en dataruimte, heeft Eli leidinggevende rollen gehad bij verschillende alternatieve datamaatschappijen, waaronder een 9-jarige periode bij ComScore.