Tankeledare

Vikten av datakvalitet vid AI-implementering

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Artificiell intelligens och maskinlÃĪrningstekniker kan ge betydande fÃķrdelar fÃķr fÃķretag av alla storlekar. Enligt en rapport frÃĨn McKinsey rapport, kommer fÃķretag som anvÃĪnder artificiell intelligens att fÃķrdubbla sin likviditet till 2030. OmvÃĪnt kommer fÃķretag som inte implementerar AI att uppleva en minskning av 20% i sin likviditet. Men sÃĨdana fÃķrdelar gÃĨr utÃķver ekonomin. AI kan hjÃĪlpa fÃķretag att bekÃĪmpa arbetskraftsbrist. AI fÃķrbÃĪttrar ocksÃĨ kundupplevelsen och fÃķretagsresultat, vilket gÃķr fÃķretagen mer tillfÃķrlitliga.

Eftersom AI har sÃĨ mÃĨnga fÃķrdelar, varfÃķr anvÃĪnder inte alla AI? 2019 avslÃķjade en PwC undersÃķkning att 76% av fÃķretagen planerar att anvÃĪnda AI fÃķr att fÃķrbÃĪttra sin affÃĪrsverksamhet. Men endast 15% har tillgÃĨng till hÃķgkvalitativa data fÃķr att uppnÃĨ sina affÃĪrsmÃĨl. En annan studie frÃĨn Refinitiv visade att 66% av respondenterna sa att dÃĨlig datakvalitet hindrar deras fÃķrmÃĨga att implementera och anvÃĪnda AI effektivt.

UndersÃķkningen fann att de tre stÃķrsta utmaningarna med att arbeta med maskinlÃĪrning och AI-teknik handlar om – “exakt information om datatÃĪckning, historia och befolkning”, “identifiering av ofullstÃĪndiga eller korrupta poster” och “rengÃķring och standardisering av data”. Detta visar att dÃĨlig datakvalitet ÃĪr det stÃķrsta hindret fÃķr fÃķretag att fÃĨ hÃķgkvalitativa AI-drivna analyser.

VarfÃķr ÃĪr data sÃĨ viktigt?

Det finns mÃĨnga anledningar till varfÃķr datakvalitet ÃĪr avgÃķrande fÃķr AI-implementering. HÃĪr ÃĪr nÃĨgra av de viktigaste:

1. SkrÃĪp in och skrÃĪp ut

Det ÃĪr ganska enkelt att fÃķrstÃĨ att utdata beror tungt pÃĨ indata. I det hÃĪr fallet, om datamÃĪngderna ÃĪr fulla av fel eller snedvridna, kommer resultatet ocksÃĨ att sÃĪtta dig pÃĨ fel fot. De flesta datarelaterade problem handlar inte om mÃĪngden data, utan om kvaliteten pÃĨ data som du matar in i AI-modellen. Om du har lÃĨgkvalitativa data, kommer dina AI-modeller inte att fungera ordentligt, oavsett hur bra de kan vara.

2. Inte alla AI-system ÃĪr lika

NÃĪr vi tÃĪnker pÃĨ datamÃĪngder, tÃĪnker vi vanligtvis i termer av kvantitativ data. Men det finns ocksÃĨ kvalitativ data i form av videor, personliga intervjuer, ÃĨsikter, bilder osv. I AI-system ÃĪr kvantitativa datamÃĪngder strukturerade och kvalitativa datamÃĪngder ostrukturerade. Inte alla AI-modeller kan hantera bÃĨda typerna av datamÃĪngder. SÃĨ, att vÃĪlja rÃĪtt datatyp fÃķr lÃĪmplig modell ÃĪr avgÃķrande fÃķr att fÃĨ det fÃķrvÃĪntade utdata.

3. Kvalitet vs. kvantitet

Man tror att AI-system behÃķver ÃĪta en stor mÃĪngd data fÃķr att lÃĪra sig av den. I en debatt om kvalitet kontra kvantitet, fÃķredrar fÃķretag vanligtvis den senare. Men om datamÃĪngderna ÃĪr av hÃķg kvalitet, men kortare till naturen, kommer det att ge dig en viss garanti fÃķr att utdata ÃĪr relevant och robust.

4. Egenskaper hos en bra datamÃĪngd

Egenskaperna hos en bra datamÃĪngd kan vara subjektiva och beror frÃĪmst pÃĨ den applikation som AI tjÃĪnar. Men det finns nÃĨgra allmÃĪnna funktioner som man bÃķr leta efter nÃĪr man analyserar datamÃĪngder.

  • FullstÃĪndighet: DatamÃĪngden mÃĨste vara fullstÃĪndig med inga tomma celler eller luckor i datamÃĪngden. Varje cell mÃĨste ha en dataenhet i den.
  • Översikt: DatamÃĪngderna bÃķr vara sÃĨ omfattande som mÃķjligt. Till exempel, om du letar efter en cyberhotvektor, mÃĨste du ha alla signaturprofiler och all nÃķdvÃĪndig information.
  • Konsekvens: DatamÃĪngderna mÃĨste passa under de bestÃĪmda variabler de har tilldelats. Till exempel, om du modellerar paketlÃĨdor, mÃĨste dina valda variabler (plast, papper, kartong osv.) ha lÃĪmpliga priser fÃķr att passa in i dessa bestÃĪmda kategorier.
  • Noggrannhet: Noggrannhet ÃĪr nyckeln till en bra datamÃĪngd. All information du matar in i AI-modellen mÃĨste vara tillfÃķrlitlig och helt korrekt. Om stora delar av dina datamÃĪngder ÃĪr felaktiga, kommer utdata att vara felaktiga ocksÃĨ.
  • Unikhet: Detta punkt ÃĪr liknande konsekvens. Varje dataenhet mÃĨste vara unik fÃķr den variabel den tjÃĪnar. Till exempel, du vill inte att priset pÃĨ en plastfÃķrpackning ska hamna under nÃĨgon annan kategori fÃķr fÃķrpackning.

SÃĪkerstÃĪlla datakvalitet

Det finns mÃĨnga sÃĪtt att sÃĪkerstÃĪlla att datakvaliteten ÃĪr hÃķg, som att sÃĪkerstÃĪlla att datakÃĪllan ÃĪr tillfÃķrlitlig. HÃĪr ÃĪr nÃĨgra av de bÃĪsta teknikerna fÃķr att sÃĪkerstÃĪlla att du fÃĨr den bÃĪsta kvaliteten pÃĨ data fÃķr dina AI-modeller:

1. Dataprofileringsverktyg

Dataprofileringsverktyg ÃĪr avgÃķrande fÃķr att fÃķrstÃĨ data innan du anvÃĪnder den. Dataprofileringsverktyg ger insikt i fÃķrdelningen av vÃĪrden, maximala, minsta, genomsnittsvÃĪrden och avvikelser. Dessutom hjÃĪlper det till att formatera inkonsekvenser i data. Dataprofileringsverktyg hjÃĪlper till att fÃķrstÃĨ om datamÃĪngden ÃĪr anvÃĪndbar eller inte.

2. UtvÃĪrdering av datakvalitet

Med hjÃĪlp av en central bibliotek med fÃķrbyggda datakvalitetsregler kan du validera valfri datamÃĪngd med en central bibliotek. Om du har en datakatalog med inbyggda dataverktyg kan du enkelt ÃĨteranvÃĪnda dessa regler fÃķr att validera kundnamn, e-postadresser och produktkoder. Dessutom kan du ocksÃĨ berika och standardisera vissa data.

3. Övervakning och utvÃĪrdering av datakvalitet

Forskare har datakvalitet fÃķrkalkylerad fÃķr de flesta datamÃĪngder de vill anvÃĪnda. De kan begrÃĪnsa det till att se vilket specifikt problem ett attribut har och sedan bestÃĪmma om de ska anvÃĪnda det attributet eller inte.

4. Datapreparation

Forskare och vetenskapsmÃĪn mÃĨste vanligtvis justera data en aning fÃķr att fÃķrbereda dem fÃķr AI-modellering. Dessa forskare behÃķver lÃĪttanvÃĪnda verktyg fÃķr att parska attribut, transponera kolumner och berÃĪkna vÃĪrden frÃĨn data.

VÃĪrlden av artificiell intelligens fÃķrÃĪndras kontinuerligt. Medan varje fÃķretag anvÃĪnder data pÃĨ ett annat sÃĪtt, fÃķrblir datakvalitet avgÃķrande fÃķr alla AI-implementeringsprojekt. Om du har tillfÃķrlitliga, hÃķgkvalitativa data, eliminerar du behovet av stora datamÃĪngder och Ãķkar dina chanser till framgÃĨng. Om ditt fÃķretag ÃĪr pÃĨ vÃĪg mot AI-implementering, kontrollera om du har hÃķgkvalitativa data. Se till att dina kÃĪllor ÃĪr tillfÃķrlitliga och utfÃķr due diligence fÃķr att kontrollera om de uppfyller dina datakrav.

Amy Groden-Morrison har varit verksam i mer ÃĪn 15 ÃĨr i ledande roller inom marknadsfÃķringskommunikation pÃĨ fÃķretag som TIBCO Software, RSA Security och Ziff-Davis. Hennes tidigare prestationer inkluderar att etablera det fÃķrsta sambrÃĪnda teknologiprogrammet med CNN, lansera ett evenemangsfÃķretag pÃĨ NYSE, omprofilera ett NASDAQ-noterat fÃķretag mitt i en kris och positionera och marknadsfÃķra ett startup-fÃķretag i Boston-omrÃĨdet fÃķr en lyckad fÃķrvÃĪrv. FÃķr nÃĪrvarande ÃĪr hon VP fÃķr marknadsfÃķring och fÃķrsÃĪljningsverksamhet pÃĨ Alpha Software.