Thought leaders
Onze rommelige data opruimen: Hoe AI het spel verandert

We verdrinken in data. Elk platform, smartwatch en smartphone fragmenteert ons leven in kwantificeerbare brokjes, maar het merendeel ervan blijft onbegrijpelijk en onbruikbaar.
Bedrijven weten dit, en dat is waarom de technologiegigant Meta 14 miljard dollar investeerde om een aandeel van 49% te verwerven in het data-labeling-startup Scale AI, waarmee het een berekende en strategische zet deed om hoge kwaliteit trainingsdata voor zijn AI-modellen te verkrijgen.
De betrouwbaarheid van grote taalmodellen hangt geheel af van de kwaliteit van de data waarop ze worden gevoed – in het kort, “rommel in, rommel uit”. Vandaag echter is de echte uitdaging die bedrijven tegenkomen het omzetten van een overvloed aan ruwe informatie in actiegerichte data.
De oplossing kan in het zicht zijn: AI zelf kan helpen door strategieën te genereren om de saaie taak van het labelen van grote datasets of het doorzoeken van eindeloze spreadsheets te omzeilen, waardoor chaos wordt omgezet in bruikbare, menselijke intelligentie.
Wanneer data rommelig wordt: De verborgen kosten voor bedrijven
Volgens onderzoek van Gartner uit 2020 kosten slechte datakwaliteit organisaties minstens 12,9 miljoen dollar per jaar, waardoor de productiviteit wordt aangetast en slecht geïnformeerde beslissingen en onnauwkeurige rapportage ontstaan.
De gevolgen van rommelige data zijn des te meer zichtbaar in sectoren zoals de gezondheidszorg. Onvolledige gezondheidsdossiers, factureringen en niet-overeenkomende data in systemen kunnen leiden tot misdiagnoses, behandelfouten en inefficiënte toewijzing van middelen. Op lange termijn leidt dit tot hogere kosten en een afname van het vertrouwen in deze systemen.
Ondertussen kan in de logistiek niet-overeenkomende data onder leveranciers en distributeurs leiden tot vertragingen of tekorten in de voorraad. Een onjuist afleveradres of een verouderd voorraadrecord kan een kettingreactie door de hele toeleveringsketen veroorzaken, waardoor deadlines worden gemist en klanten ontevreden raken.
“Door te kunnen anticiperen of te begrijpen wat kan gebeuren [langs de route] – op basis van gecombineerde, historische data – kun je deze inefficiënties echt verminderen,” Asparuh Koev, CEO van het logistieke AI-bedrijf Transmetrics, merkte op in een gesprek met Unite AI.
In praktische zin is rommelige data duur. De 1-10-100-regel illustreert dit: het kost 1 dollar om de data te controleren wanneer deze wordt ingevoerd, 10 dollar om deze later op te schonen en 100 dollar als er niets wordt gedaan.
Wat AI-gebaseerde platforms te bieden hebben
Terwijl bedrijven worstelen met groeiende hoeveelheden vuile data, zoeken ze naar oplossingen bij AI. Nieuwkomende AI-gebaseerde platforms automatiseren nu het proces van data-opschoning, waardoor ze kostenefficiënt en nauwkeurig zijn.
Robert Giardina, oprichter van Claritype, een dergelijk platform, legde het AI-proces uit:
“Het convergeert data naar een gemeenschappelijk formaat: onderdeel van het proces is om elke gegeven om te zetten in een canoniek formaat dat geschikt is voor het bedrijf.”
Claritype’s AI gaat verder dan eenvoudige standaardisatie. Het platform’s begeleide reparatie stelt organisaties in staat om systeemgrenzen te overschrijden bij het zoeken naar antwoorden op hun meest dringende vragen, waardoor silo’s worden afgebroken.
“Systemen die eerder afzonderlijk werden gehouden, hebben elk een deel van het antwoord op vragen die de hele onderneming omvatten,” zei Giardina tegen Unite AI.
Als een belangrijke leverancier bijvoorbeeld wordt getroffen door een vertraging in de levering, kan een bedrijf alleen door leveranciers te koppelen aan bestellingen en klantgeschiedenis bepalen welke van hun belangrijkste klanten het eerst over de vertraging moeten worden geïnformeerd.
“Ons uiteindelijke doel is om deze verbonden denkwijze uit te breiden om elke scherf van data in de onderneming te verenigen, zodat we elke vraag gemakkelijk en onmiddellijk kunnen beantwoorden,” zei Giardina.
Deze soort verbonden denkwijze is representatief voor de bredere verandering in mentaliteit die vandaag de dag plaatsvindt in bedrijven, aangezien ze overgaan van ad-hoc data-opschoning naar systematische data-governance. In plaats van datakwaliteit te behandelen als een eenmalige oplossing, ontwikkelen organisaties gestructureerde processen om consistentie en betrouwbaarheid over alle systemen te garanderen.
Data-governance wordt nu beschouwd als een waardevol bedrijfsproces, niet alleen als een IT-karwei. Door databeheer in hun algemene strategieën te integreren, kunnen bedrijven betere beslissingen nemen en meer zinvolle inzichten uit hun data verkrijgen.
Hoe AI data opschont en de uitdagingen die het tegenkomt
Te veel vertrouwen op AI kan gevaarlijk zijn. Volgens Giardina zijn “de verontrustende geautomatiseerde dataconversies die verder gaan dan standaardisatie en in giswerk terechtkomen.”
Bijvoorbeeld kan een afkorting gemakkelijk verkeerd worden geïnterpreteerd. “International Business Machines, Inc.” of “I.B.M.” zou meestal worden omgezet in “IBM”, maar als de conversie geautomatiseerd was en “I.B.” per ongeluk werd omgezet in “IBM”, zou dit significante problemen kunnen veroorzaken voor beide bedrijven.
Ontbrekende en onnauwkeurige data zijn twee van de meest voorkomende problemen, en het enkel vertrouwen op AI om de lacunes op te vullen volgens context kan gemakkelijk terugvuren. Zoals Giardina opmerkt, “wanneer de effecten op enigerlei wijze significant zijn, hebben we een mens nodig om elke gok te goedkeuren.”
Automatisering in balans brengen met menselijke inzichten
Rommelige data benadrukt diepe fouten in de manier waarop organisaties informatie behandelen. Om vooruit te komen en besluitvorming te verbeteren, moeten bedrijven ophouden met het zien van data als een louter technisch probleem en overgaan naar governance-modellen die menselijke expertise, ethische bewustzijn en een langetermijnstrategische visie combineren.
Schoonere data creëert meer effectieve AI, die op zijn beurt helpt om de datakwaliteit te verbeteren; deze wederzijds versterkende cyclus is veelbelovend, maar dient als herinnering dat automatisering alleen ons rommelige dataprobleem niet zal oplossen. Dit potentieel kan alleen worden gerealiseerd door algoritmirische precisie te koppelen aan menselijke oordeelkundigheid en bewustzijn van de vooroordelen die het kan introduceren, waardoor transparantie en meer vertrouwen in de systemen die we bouwen worden gegarandeerd.
Alex Sandoval, CEO van het AI-bedrijf voor fabricage-intelligentie Allie AI, benadrukte ook hoe generatieve AI-co-piloten niet alleen op algoritmen draaien, maar vertrouwen op menselijke vaardigheid in de logica van de fabriek.
“Vandaag zijn de meest succesvolle implementaties niet alleen maar over het voeden van modellen met uitgebreide programmeerbare logicacontrollers (PLC)-data, operatorenootjes en compliance-protocollen. Ze zijn afhankelijk van een nieuw soort voorhoedewerker: iemand die kan vertalen tussen machinegedrag en digitale intuïtie,” besloot hij.












