Tankeledere

Hvorfor Datakvalitet Afgør, Om Enterprise AI Lykkes eller Mislykkes

mm
Føj Unite.AI til dine foretrukne kilder på Google

Siden OpenAI’s debut med ChatGPT i slutningen af 2022, har hver virksomhed været ivrig efter at gå hurtigere med AI. Store hardware-spillere som Nvidia sælger mere GPU’er end nogensinde før, mens store model-byggere som OpenAI og Anthropic fortsætter med at bygge større og større modeller.

Men selv med de mest avancerede modeller og de største budgetter, mislykkes mange AI-projekter stadig. Vi har set dette ske på tværs af brancher, fra sundhedssektor til transport til finans og mere. Årsagen er ikke langt fra: AI er kun så god som de data, den er trænet på, og de data, den modtager i realtid. Når disse data er dårligt mærkede, forældede eller ufuldstændige, kan ingen model levere konsekvente eller troværdige resultater.

Dette er det store problem, mange virksomheder står overfor i dag. De investerer kraftigt i AI-værktøjer, mens deres datasystemer forbliver spredte og upålidelige. Resultatet er en illusion af fremgang. Mens modeller producerer imponerende svar, er indsigtene ofte baseret på svage grundlag. Den virkelige barriere for AI-succes er ikke modelpræstation. Det er datakvalitet.

Hvad God Data Virkelig Betyder

Høj kvalitetsdata handler ikke kun om nøjagtighed. Det betyder information, der er aktuel, fuldstændig og relevant for det problem, der er på hånden. Forestil dig en kunde, der forsøger at annullere en ordre på en e-handels-side. Systemet skal kontrollere ordredetaljer, leveringstatus og betalingsregistrering. Hvis nogen af disse datapunkter bor i forskellige systemer, der ikke taler sammen, vil AI-assistenten ikke være i stand til at give et nyttigt svar.

God data forbinder disse punkter øjeblikkeligt. Det giver AI mulighed for at se et fuldt billede i stedet for fragmenter af det. Dårlig data, på den anden side, tvinger modellen til at gætte. Og når AI begynder at gætte, begår det fejl, der koster penge og skader tillid. Nylige eksempler viser, hvor farligt sådanne antagelser kan være.

New York Citys forretnings-chatbot gav ulovlig råd, fordi den trak fra forældede eller ufuldstændige juridiske oplysninger. Air Canadas kundeservice-bot fremførte falske refusionskrav, fordi den manglede kontekst fra virksomhedspolitik. Selv store rekrutteringssystemer har forkert filteret kandidater på grund af fordomsfulde eller mislabelede data, som set i EEOCs første AI-relaterede forlig. Disse fejl er ikke kun tekniske. De er også reputations- og finansielle, og de stammer fra AI-systemer, der er trænet på upålidelige data.

Branchestudier bekræfter omfanget af dette problem. Gartner rapporterer, at 80 procent af AI-projekter mislykkes med at skala på grund af dårlig datakvalitet og styring. Ligeledes fandt en undersøgelse fra MIT Sloan Management Review, at data-problemer, ikke algoritmer, er den øverste årsag til, at enterprise AI-projekter kollapser.

Kultur Måske Lige Så Meget Som Kode

Forbedring af datakvalitet er ikke noget, du kan løse med et enkelt værktøj eller kommando. Det kræver en kulturel ændring. Derfor skal erhvervsledere behandle data som et levende system, der kræver omsorg og ansvarlighed. Dette handler ikke kun om at erklære, at du vil “gøre data bedre” – det er ikke nok. Hver del af organisationen skal forstå, hvordan information flytter sig, hvem ejer den, og hvad der sker, når den ændres.

Vi har set, hvordan dette spiller ud i virkelige systemer. Mange AI-applikationer afhænger af natlige dataopdateringer. Hvis din database opdateres en gang om dagen, vil modellens viden altid være bagud i forhold til virkeligheden. I hurtigt bevægelige miljøer kan denne forsinkelse betyde forældede indsigt og dårlige beslutninger. Virksomheder skal omstrukturere deres hele dataflow fra, hvordan information indsamles, til hvordan den leveres til modellen.

At gøre dette godt kan spare enorm tid og omkostninger. Når datapipelines er designet med klarhed og formål, kan AI-systemer lære og handle på de mest aktuelle og relevante oplysninger. Når de ikke er, bruger hold mere tid på at rense data end på at bruge dem.

Eksperter i datastyring påpeger ofte, at nøglen til stærk datakvalitet er en feedback-løkke mellem mennesker, processer og platforme. Uden denne løkke bliver informationen stædig, og modellerne mister kontakten med virkelige forhold – et problem, der nogle gange kaldes data-drift.

Balance Mellem Hastighed Og Integritet

Der er ofte en spænding mellem at gå hurtigt og at holde præcision. Mange organisationer ønsker øjeblikkelige resultater fra deres AI-investeringer, men hastværk kan føre til større problemer senere. Målet skal være data-agilitet med integritet. Med andre ord, bygning af systemer, der kan flytte sig hurtigt uden at miste præcision.

Derfor skal hver virksomhed definere klare vejledninger for, hvordan data skal flyde fra kilden til modellen i realtid. Det hjælper også at definere, hvilken type information der er tilladt, og hvad der skal holdes udenfor. Følsomme eller private data skal aldrig nå modellen, selvom brugeren teknisk har adgang til det. Beskyttelse af denne grænse bygger tillid og holder AI-systemer fra at lække eller misbruge information.

Da AI bliver mere autonom, vil menneskelig oversigt forblive kritisk. Modellen skal ikke have fuld kontrol over forretningshandlingerne. Den skal heller ikke træffe beslutninger. I stedet skal den anmode om tilladelse. Endnu vigtigere er, at mennesker altid skal gennemgå og godkende dens handlinger for at sikre, at de er i overensstemmelse med virksomhedspolitik og regulering.

Bygning Til Kvalitet Fra Bund Til Top

At opretholde datakvalitet i stor skala er ikke kun en sag om at rense fejl. Det starter med arkitektur. Du skal identificere, hvor dine mest pålidelige data bor, og derefter designe et system, der bringer dem sammen på én troværdig lokalitet. Derfra kan du spore, hvilke data modellen bruger, og hvor de kommer fra.

Dette tilgangsforhold forhindrer forvirring og holder systemet gennemsigtigt. Det hjælper også hold med at fejlfinde hurtigere, når noget går galt. Når du ved præcis, hvilke data modellens svar er baseret på, kan du verificere og korrigere fejl, før de spreder sig.

Fremtiden for enterprise AI vil tilhøre virksomheder, der integrerer kvalitet i deres infrastruktur som standard. Vi forventer at se mere plug-and-play AI-systemer, der håndterer både resonnering og dataintegration i én pakke. Disse “AI-appliances” kunne gøre det lettere for organisationer at implementere intelligente systemer uden at miste kontrollen over deres data.

Analytikere forudser, at organisationer, der kan samle og styre deres data effektivt, vil se hurtigere adoption og højere ROI fra AI-projekter. En ny rapport om data-beredskab forklarer, at denne evne adskiller virksomheder, der innovrer kontinuerligt, fra dem, der stopper efter tidlige pilotprojekter. Forskellen kommer ofte ned til, om deres AI-systemer er bygget på konsekvent, velstruktureret information.

Det Er Det Vigtigste

Datakvalitet må ikke lyde spændende i forhold til gennembrud i modeldesign, men det er den stille kraft, der afgør, om AI lykkes eller mislykkes. Uden ren, aktuel og konsekvent data, vil selv de smarteste systemer snuble. Med det kan selv beskedne AI-projekter skabe varig værdi.

Hver leder, der investerer i AI, skal stille sig et enkelt spørgsmål: Kan vi stole på de data, der driver vores beslutninger? Fra hvad vi har set, er virksomhederne, der kan svare “ja” med sikkerhed, allerede førende i AI-kapgangen.

Oren Eini er grundlægger og administrerende direktør for RavenDB, en multi-model NoSQL-dokumentdatabase, som er betroet af udviklere og virksomheder verden over. Ud over at være den drivende kraft bag væksten og udvidelsen af RavenDB-databasen, er Oren en ivrig blogger og taler regelmæssigt ved branchemøder verden over.