Tankeledare

VarfÃķr datakvalitet avgÃķr om fÃķretags AI lyckas eller misslyckas

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Sedan OpenAI lanserade ChatGPT i slutet av 2022 har varje fÃķretag kÃĪmpat fÃķr att gÃĨ fortare med AI. Stora hÃĨrdvarutillverkare som Nvidia sÃĪljer fler GPU:er ÃĪn nÃĨgonsin, medan stora modellbyggare som OpenAI och Anthropic fortsÃĪtter att bygga allt stÃķrre modeller.

Men ÃĪven med de mest avancerade modellerna och de stÃķrsta budgetarna misslyckas mÃĨnga AI-projekt fortfarande. Vi har sett detta hÃĪnda inom olika branscher, frÃĨn hÃĪlsovÃĨrd till transport till finans och mer. Orsaken ÃĪr inte svÃĨr att fÃķrstÃĨ: AI ÃĪr bara sÃĨ bra som de data den trÃĪnas pÃĨ och de data den fÃĨr i realtid. NÃĪr dessa data ÃĪr dÃĨligt mÃĪrkta, fÃķrÃĨldrade eller ofullstÃĪndiga kan ingen modell leverera konsekventa eller tillfÃķrlitliga resultat.

Och det ÃĪr det stora problemet som mÃĨnga fÃķretag stÃĨr infÃķr idag. De investerar kraftigt i AI-verktyg, medan deras datasystem fÃķrblir utspridda och opÃĨlitliga. Resultatet ÃĪr en illusion av framsteg. Medan modellerna producerar imponerande svar ÃĪr insikterna ofta baserade pÃĨ svaga grunder. Den verkliga barriÃĪren fÃķr AI-succes ÃĪr inte modellprestanda. Det ÃĪr datakvalitet.

Vad bra data verkligen betyder

HÃķgkvalitativa data handlar inte bara om noggrannhet. Det handlar om information som ÃĪr aktuell, fullstÃĪndig och relevant fÃķr problemet i frÃĨga. TÃĪnk dig en kund som fÃķrsÃķker avbryta en bestÃĪllning pÃĨ en e-handelswebbplats. Systemet behÃķver kontrollera bestÃĪllningsinformationen, leveransstatusen och betalningsposten. Om nÃĨgon av dessa datapunkter finns i olika system som inte kommunicerar med varandra kommer AI-assistenten att misslyckas med att ge ett anvÃĪndbart svar.

Bra data kopplar ihop dessa punkter omedelbart. Det tillÃĨter AI att se en fullstÃĪndig bild snarare ÃĪn fragment av den. DÃĨlig data, ÃĨ andra sidan, tvingar modellen att gissa. Och nÃĪr AI bÃķrjar gissa gÃķr den misstag som kostar pengar och skadar fÃķrtroendet. Nya exempel visar hur farliga sÃĨdana antaganden kan vara.

New York Citys fÃķretagschatbot gav olagligt rÃĨd eftersom den drog frÃĨn fÃķrÃĨldrad eller ofullstÃĪndig juridisk information. Air Canadas kundtjÃĪnstbot gjorde falska ÃĨterbetalningsansprÃĨk eftersom den saknade sammanhang frÃĨn fÃķretagspolicy. Även stora rekryteringssystem har felaktigt filtrerat kandidater pÃĨ grund av partisk eller felmÃĪrkt data, som visas i EEOCs fÃķrsta AI-relaterade avtal. Dessa misslyckanden ÃĪr inte bara tekniska. De ÃĪr ryktesskadande och ekonomiska, och de hÃĪrrÃķr frÃĨn AI-system som trÃĪnats pÃĨ opÃĨlitliga data.

Branschstudier bekrÃĪftar omfattningen av detta problem. Gartner rapporterar att 80 procent av AI-projekt misslyckas med att skala pÃĨ grund av dÃĨlig datakvalitet och styrning. PÃĨ liknande sÃĪtt fann en MIT Sloan Management Review undersÃķkning att dataproblem, inte algoritmer, ÃĪr den frÃĪmsta anledningen till att fÃķretags AI-projekt kollapsar.

Kultur ÃĪr lika viktigt som kod

Att fÃķrbÃĪttra datakvalitet ÃĪr inte nÃĨgot som kan lÃķsas med ett enda verktyg eller kommando. Det krÃĪver en kulturell fÃķrÃĪndring. DÃĪrfÃķr mÃĨste fÃķretagsledare behandla data som ett levande system som behÃķver omvÃĨrdnad och ansvar. Detta handlar inte bara om att fÃķrklara att man vill “gÃķra data bÃĪttre” – det rÃĪcker inte. Varje del av organisationen mÃĨste fÃķrstÃĨ hur information flyttas, vem som ÃĪger den och vad som hÃĪnder nÃĪr den ÃĪndras.

Vi har sett hur detta fungerar i verkliga system. MÃĨnga AI-applikationer fÃķrlitar sig pÃĨ nattliga datauppdateringar. Om din databas uppdateras en gÃĨng om dagen kommer modellens kunskap alltid att ligga efter verkligheten. I snabbt fÃķrÃĪnderliga miljÃķer kan den fÃķrdrÃķjningen innebÃĪra fÃķrÃĨldrade insikter och dÃĨliga beslut. FÃķretag mÃĨste omvÃĪrdera hela sin dataflÃķde, frÃĨn hur information samlas in till hur den levereras till modellen.

Att gÃķra detta vÃĪl kan spara enorm tid och kostnad. NÃĪr datapipeliner ÃĪr utformade med tydlighet och syfte kan AI-system lÃĪra sig och agera pÃĨ den senaste och mest relevanta informationen. NÃĪr de inte ÃĪr det tillbringar team mer tid med att rensa data ÃĪn att anvÃĪnda dem.

Experter inom datahantering pÃĨpekar ofta att nyckeln till stark datakvalitet ÃĪr en ÃĨterkopplingsloop mellan mÃĪnniskor, processer och plattformar. Utan den ÃĨterkopplingsloopen blir informationen fÃķrÃĨldrad och modellerna fÃķrlorar kontakten med verkliga fÃķrhÃĨllanden – ett problem som ibland kallas data-drift.

Att balansera hastighet med integritet

Det finns ofta en spÃĪnning mellan att gÃĨ fort och att vara exakt. MÃĨnga organisationer vill ha omedelbara resultat frÃĨn sina AI-investeringar, men att skynda kan leda till stÃķrre problem senare. MÃĨlet bÃķr vara data-agilitet med integritet. Med andra ord, bygga system som kan rÃķra sig snabbt utan att fÃķrlora precision.

FÃķr att uppnÃĨ detta bÃķr varje fÃķretag definiera tydliga vÃĪgar fÃķr data att flÃķda frÃĨn kÃĪllan till modellen i realtid. Det hjÃĪlper ocksÃĨ att definiera vilken typ av information som ÃĪr tillÃĨten och vad som mÃĨste hÃĨllas utanfÃķr. KÃĪnslig eller privat data bÃķr aldrig nÃĨ modellen, ÃĪven om anvÃĪndaren tekniskt sett har tillgÃĨng till den. Att skydda den grÃĪnsen bygger fÃķrtroende och hindrar AI-system frÃĨn att lÃĪcka eller missbruka information.

NÃĪr AI blir mer autonom kommer mÃĪnsklig tillsyn att fÃķrbli avgÃķrande. Modellen bÃķr inte ha full kontroll Ãķver affÃĪrsbeslut. Den bÃķr inte heller fatta beslut. IstÃĪllet bÃķr den gÃķra fÃķrfrÃĨgningar. Mer viktigt ÃĪr att mÃĪnniskor alltid mÃĨste granska och godkÃĪnna dess handlingar fÃķr att sÃĪkerstÃĪlla att de ÃķverensstÃĪmmer med fÃķretagspolicy och reglering.

Att bygga fÃķr kvalitet frÃĨn grunden

Att upprÃĪtthÃĨlla datakvalitet i stor skala ÃĪr inte bara en frÃĨga om att rensa fel. Det bÃķrjar med arkitektur. Du mÃĨste identifiera var din mest tillfÃķrlitliga data bor, sedan utforma ett system som samlar den i en enda tillfÃķrlitlig plats. DÃĪrifrÃĨn kan du spÃĨra vilken data modellen anvÃĪnder och var den kommer ifrÃĨn.

Denna approach fÃķrhindrar fÃķrvirring och hÃĨller systemet transparent. Det hjÃĪlper ocksÃĨ team att felsÃķka snabbare nÃĪr nÃĨgot gÃĨr fel. NÃĪr du exakt vet vilken data som gav modellens svar kan du verifiera och korrigera problem innan de sprids.

Framtiden fÃķr fÃķretags AI kommer att tillhÃķra fÃķretag som integrerar kvalitet i sin infrastruktur som standard. Vi fÃķrvÃĪntar oss att se fler plug-and-play AI-system som hanterar bÃĨde resonemang och dataintegration i ett paket. Dessa “AI-appliancer” kan gÃķra det enklare fÃķr organisationer att distribuera smarta system utan att fÃķrlora kontrollen Ãķver sina data.

Analytiker fÃķrutspÃĨr att organisationer som kan ena och styra sina data effektivt kommer att se snabbare antagande och hÃķgre ROI frÃĨn AI-projekt. En nylig rapport om data-beredskap fÃķrklarar att denna fÃķrmÃĨga skiljer fÃķretag som innovativa kontinuerligt frÃĨn de som stannar efter tidiga piloter. Skillnaden beror ofta pÃĨ om deras AI-system ÃĪr byggda pÃĨ konsekventa, vÃĪlstrukturerade data.

Slutsatsen

Datakvalitet kan inte vara spÃĪnnande jÃĪmfÃķrt med genombrott i modellutformning, men det ÃĪr den tysta kraften som avgÃķr om AI lyckas eller misslyckas. Utan ren, aktuell och konsekvent data kommer de smartaste systemen att snava. Med den kan till och med blygsamma AI-projekt skapa bestÃĨende vÃĪrde.

Varje ledare som investerar i AI bÃķr stÃĪlla en enkel frÃĨga: Litar vi pÃĨ de data som driver vÃĨra beslut? FrÃĨn vad vi har sett ÃĪr fÃķretagen som kan svara “ja” med tillfÃķrsikt de som redan leder i AI-lÃķpningen.

Oren Eini ÃĪr grundare och VD fÃķr RavenDB, en multi-modell NoSQL-dokumentdatabas som anvÃĪnds av utvecklare och fÃķretag Ãķver hela vÃĪrlden. UtÃķver att vara den drivande kraften bakom tillvÃĪxten och expansionen av RavenDB-databasen, ÃĪr Oren en flitig bloggare och talar regelbundet pÃĨ branschevenemang runt om i vÃĪrlden.