Tankeledere
Rensning af vores beskidte data: Hvordan AI ændrer spillet

Vi drukner i data. Hver platform, smartwatch og smartphone fragmenterer vores liv i kvantificerbare bidder, men det meste af det forbliver inkohærent og ubrugeligt.
Virksomheder ved dette, hvilket er hvorfor tech-giganten Meta investerede 14 milliarder USD sidste sommer for at købe en 49% ejerandel i data-mærkningsstartuppen Scale AI, hvilket var en beregnet og strategisk beslutning for at sikre højkvalitets træningsdata til deres AI-modeller.
Pålideligheden af store sprogmodeller afhænger fuldstændigt af kvaliteten af de data, de får – kort sagt, “skrald ind, skrald ud.” I dag er den virkelige udfordring, virksomheder står overfor, dog at omdanne en flod af rå information til handlingsdata.
Løsningen kan være skjult i åbenlysighed: AI selv kan hjælpe ved at generere strategier til at omgå den kedelige opgave at mærke massive datasæt eller gennemgå endeløse regneark, og omdanne kaos til brugbar, menneskelig intelligens.
Når data bliver beskidt: De skjulte omkostninger for virksomheder
Ifølge Gartner-forskning fra 2020 koster dårlig datakvalitet organisationer mindst 12,9 millioner USD om året, hvilket påvirker produktiviteten og fører til dårligt informerede beslutninger og ukorrekt rapportering.
Konsekvenserne af beskidt data er endnu mere tydelige i sektorer som sundhedssektoren. Ufuldstændige sundhedsjournaler, fakturadetaljer og forkerte data over systemerne kan føre til misdiagnoser, behandlingsfejl og ineffektiv ressourceallokering. På lang sigt driver dette op for omkostningerne og undergraver tilliden til disse systemer.
Imens kan forkerte data mellem leverandører og distributører i logistiksektoren føre til forsinkelser eller mangel på lager. En forkert leveringsadresse eller en forældet lageroptegnelse kan have en rippleffekt gennem hele forsyningskæden, hvilket fører til missede deadlines og utilfredse kunder.
“Ved at kunne forudsige eller forstå, hvad der kan ske [langs ruten] – baseret på kombineret, tidligere data – kan du virkelig reducere disse ineffektiviteter,” Asparuh Koev, CEO af logistik-AI-virksomheden Transmetrics, bemærkede i en samtale med Unite AI.
I mere praktiske termer er beskidt data dyrt. 1-10-100-reglen illustrerer dette: det koster 1 dollar at tjekke data, mens de indtastes, 10 dollar at rense dem bagefter, og 100 dollar, hvis intet gøres.
Hvad AI-drevne platforme bringer til bordet
Da virksomheder kæmper med stadig større mængder af beskidt data, vender de sig til AI for løsninger. Fremvoksende AI-drevne platforme automatiserer nu datarengøringsprocessen, hvilket sikrer omkostningseffektivitet og forbedrer nøjagtighed.
Robert Giardina, grundlægger af Claritype, en sådan platform, forklarede AI-processen:
“Det konvergerer data til et fælles format: en del af processen er at konvertere hver dato til et kanonisk format, der passer til virksomheden.”
Claritypes AI går dog ud over enkel standardisering. Platformens supervised reparation tillader organisationer at krydse systemgrænser i jagten på svar på deres mest presserende spørgsmål, og bryder ned siloer.
“Systemer, der tidligere var adskilt, indeholder hver især en del af svaret på spørgsmål, der omfatter hele virksomheden,” sagde Giardina til Unite AI.
Hvis en nøgleleverandør er berørt af en forsinkelse, kan virksomheden kun afgøre, hvilke af deres største kunder, der skal underrettes først om forsinkelsen, ved at tilkoble leverandører til ordrer og kundeinformation.
“Vores ultimative mål er at udvide denne sammenhængende tænkning til at samle alle shards af data i virksomheden, så vi kan gøre hvert spørgsmål let og øjeblikkeligt at besvare,” sagde Giardina.
Denne type sammenhængende tænkning er repræsentativ for den bredere ændring i mindset, der sker i virksomheder i dag, da de går over fra ad hoc-datarengøring til systematisk datastyring. I stedet for at behandle datakvalitet som en engangs-løsning udvikler organisationer strukturerede processer til at sikre konsistens og pålidelighed på tværs af alle deres systemer.
Datastyring anses nu for at være en værdifuld forretningsproces, ikke bare en IT-opgave. Ved at integrere datastyring i deres overordnede strategier kan virksomheder træffe bedre beslutninger og opnå mere meningsfulde indsigt i deres data.
Hvordan AI rensker data og de udfordringer, det står overfor
At afhænge for meget af AI kan være farligt. For Giardina er “de bekymrende automatiske datakonverteringer dem, der går ud over standardisering og ind i gætteri.”
For eksempel kan forkortelser let misfortolkes. “International Business Machines (IBM ), Inc.” eller “I.B.M.” ville normalt blive konverteret til “IBM”, men hvis konverteringen var automatiseret, og “I.B.” blev forkert konverteret til “IBM”, kunne det føre til betydelige problemer for begge virksomheder.
Manglende og ukorrekte data er to af de mest almindelige problemer, og at afhænge udelukkende af AI til at udfylde hullerne efter kontekst kan let mislykkes. Som Giardina påpeger, “når effekterne er af nogen betydning, har vi brug for en menneskelig godkendelse af hvert gæt.”
Balance mellem automatisering og menneskelig indsigt
Beskidt data fremhæver dybe fejl i, hvordan organisationer håndterer information. For at gå fremad og forbedre beslutningstagningen må virksomheder stoppe med at se på data som en ren teknisk sag og gå over til styringsmodeller, der kombinerer menneskelig ekspertise, etisk bevidsthed og en langsigtede strategisk vision.
Renere data skaber mere effektiv AI, der igen hjælper med at forbedre datakvaliteten; denne gensidigt forstærkende cyklus er lovende, men minder os om, at automatisering alene ikke vil løse vores beskidte data-problem. Denne potentiale kan kun realiseres ved at parre algoritmisk præcision med menneskelig dømmekraft og en bevidsthed om de fordomme, det kan introducere, og sikre gennemsigtighed og mere tillid til de systemer, vi bygger.
Alex Sandoval, CEO af fremstillingsintelligens-AI-virksomheden Allie AI, fremhævede også, hvordan generative AI-co-piloter ikke kun kører på algoritmer, men også afhænger af menneskelig flydighed i fabrikkens logik.
“I dag er de mest succesfulde implementeringer ikke kun om at føde modeller med enorme mængder af data fra programmable logik-kontrollere (PLC), operatørnoter og overholdelsesprotokoller. De afhænger af en ny type frontlinje-arbejder: en, der kan oversætte mellem maskinadfærd og digital intuition,” sluttede han.












