Tankeledere

Vigtigheden af Datakvalitet i AI-Implementering

mm
Føj Unite.AI til dine foretrukne kilder på Google

Kunstig intelligens og maskinlærings-teknologier kan betydeligt forbedre virksomheder af alle størrelser. Ifølge en McKinsey rapport, vil virksomheder, der anvender kunstig intelligens-teknologier, fordoble deres kontantstrøm i 2030. Omvendt vil virksomheder, der ikke implementerer AI, opleve en reduktion på 20% i deres kontantstrøm. Men disse fordele går udover finanser. AI kan hjælpe virksomheder at bekæmpe arbejdskraftmangel. AI forbedrer også kundeservice og forretningsresultater betydeligt, hvilket gør virksomheder mere pålidelige.

Da AI har så mange fordele, hvorfor ikke alle anvender AI? I 2019 afslørede en PwC-undersøgelse, at 76% af virksomheder planlægger at anvende AI for at forbedre deres forretningsværdi. Men kun 15% har adgang til højkvalitetsdata for at opnå deres forretningsmål. En anden undersøgelse fra Refinitiv viste, at 66% af respondentende sagde, at dårlig kvalitetsdata forhindrer deres evne til at implementere og anvende AI effektivt.

Undersøgelsen fandt, at de tre største udfordringer ved at arbejde med maskinlærings- og AI-teknologier drejer sig om – “præcis information om dækning, historie og befolkning af data”, “identifikation af ufuldstændige eller korrupte poster” og “rensning og normalisering af data”. Dette viser, at dårlig kvalitetsdata er den største hindring for virksomheder til at få højkvalitets AI-drevne analyser.

Hvorfor er Data så vigtig?

Der er mange grunde til, at datakvalitet er afgørende for AI-implementation. Her er nogle af de vigtigste:

1. Skrald ind og skrald ud

Det er ret simpelt at forstå, at output afhænger tungt af input. I dette tilfælde, hvis datasættene er fulde af fejl eller skæve, vil resultatet også være forkert. De fleste data-relaterede problemer handler ikke nødvendigvis om mængden af data, men om kvaliteten af data, du føder ind i AI-modellen. Hvis du har lavkvalitetsdata, vil dine AI-modeller ikke fungere ordentligt, uanset hvor gode de måtte være.

2. Ikke alle AI-systemer er lige

Når vi tænker på datasæt, tænker vi normalt i kvantitative data. Men der er også kvalitative data i form af videoer, personlige interviews, meninger, billeder osv. I AI-systemer er kvantitative datasæt strukturerede, og kvalitative datasæt er ustrukturerede. Ikke alle AI-modeller kan håndtere begge typer datasæt. Så, valg af den rette datatyp til den passende model er afgørende for at få det forventede output.

3. Kvalitet vs. Kvantitet

Man tror, at AI-systemer skal indtage en masse data for at lære af den. I en debat om kvalitet vs. kvantitet foretrækker virksomheder ofte den sidste. Men hvis datasættene er af høj kvalitet, selvom de er kortere, giver det en vis garanti for, at outputtet er relevant og robust.

4. Egenskaberne ved et godt datasæt

Egenskaberne ved et godt datasæt kan være subjektive og afhænger primært af den anvendelse, som AI tjener. Men der er nogle generelle funktioner, som man skal søge efter, når man analyserer datasæt.

  • Kompletthed: Datasættet skal være komplet med ingen tomme felter eller huller i datasættene. Hvert felt skal have en dataenhed i det.
  • Omfattende: Datasættene skal være så omfattende som muligt. For eksempel, hvis du søger efter en cybertrusel, skal du have alle signaturprofiler og alle nødvendige oplysninger.
  • Konsistens: Datasættene skal passe under de bestemte variable, de er tildelt. For eksempel, hvis du modellerer pakkebokse, skal dine valgte variable (plastik, papir, karton osv.) have passende priser for at falde ind under disse bestemte kategorier.
  • Nøjagtighed: Nøjagtighed er nøglen til et godt datasæt. Alle oplysninger, du føder ind i AI-modellen, skal være troværdige og helt nøjagtige. Hvis store dele af dine datasæt er forkerte, vil dit output også være forkert.
  • Unikhed: Dette punkt ligner konsistens. Hvert datapunkt skal være unikt for den variabel, det tjener. For eksempel, ønsker du ikke, at prisen på en plastikindpakning skal falde under en anden kategori for indpakning.

Sikring af Datakvalitet

Der er mange måder at sikre, at datakvaliteten er høj, som at sikre, at datakilden er troværdig. Her er nogle af de bedste teknikker til at sikre, at du får den bedste kvalitetsdata til dine AI-modeller:

1. Data-profilering

Data-profilering er afgørende for at forstå data, før du anvender det. Data-profilering giver indsigt i fordelingen af værdier, maksimum-, minimum- og gennemsnitsværdier samt outliers. Desuden hjælper det med at formate inkonsistenser i data. Data-profilering hjælper med at forstå, om datasættet er brugbart eller ej.

2. Evaluering af Datakvalitet

Ved at anvende en central bibliotek af forudbyggede datakvalitetsregler kan du validere ethvert datasæt med en central bibliotek. Hvis du har en datakatalog med indbyggede data-værktøjer, kan du blot genanvende disse regler til at validere kunde-navne, e-mail-adresser og produkt-koder. Desuden kan du også berige og standardisere nogle data.

3. Overvågning og Evaluering af Datakvalitet

Forskere har datakvalitet forudberegnede for de fleste datasæt, de ønsker at anvende. De kan indsnævre det til at se, hvilket specifikt problem et attribut har, og derefter beslutte, om de skal anvende det attribut eller ej.

4. Data-forberedelse

Forskere og videnskabsmænd skal ofte justere dataene lidt for at forberede dem til AI-modellering. Disse forskere har brug for letanvendelige værktøjer til at parse attributter, transponere kolonner og beregne værdier fra data.

Verden af kunstig intelligens ændrer sig konstant. Mens hver virksomhed anvender data på en anden måde, forbliver datakvalitet afgørende for ethvert AI-implementation-projekt. Hvis du har pålidelig, godkvalitetsdata, eliminerer du behovet for massive datasæt og øger dine chancer for succes. Ligesom alle andre organisationer, hvis din organisation er på vej mod AI-implementation, skal du tjekke, om du har godkvalitetsdata. Sørg for, at dine kilder er troværdige, og udfør due diligence for at tjekke, om de overholder dine datakrav.

Amy Groden-Morrison har været ansat i mere end 15 år i ledende markedsførings- og kommunikationsroller i virksomheder som TIBCO Software, RSA Security og Ziff-Davis. Hendes tidligere præstationer omfatter etablering af det første co-branded teknologiprogram med CNN, lancering af et eventselskab på NYSE, rebranding af et NASDAQ-noteret selskab midt i en krise og positionering og markedsføring af et startup-selskab i Boston-området til en succesfuld overtagelse. For nuværende er hun VP for Marketing og Salgsoperationer i Alpha Software.