Tankeledere
Viktigheten av datakvalitet i AI-implementering

Artificiell intelligens og maskinlæringsteknologier kan være svært nyttige for bedrifter av alle størrelser. Ifølge en rapport fra McKinsey rapport, vil bedrifter som bruker artificiell intelligens-teknologier doble sin kontantstrøm innen 2030. Omvendt vil bedrifter som ikke implementerer AI være vitne til en 20% reduksjon i kontantstrømmen. Men disse fordelen går langt utenfor økonomi. AI kan hjelpe bedrifter å bekjempe arbeidskraftmangel. AI kan også betydelig forbedre kundeopplevelsen og bedriftsresultatene, og gjøre bedriftene mer pålitelige.
Fordi AI har så mange fordeler, hvorfor ikke alle bedrifter implementerer AI? I 2019 avslørte en PwC -undersøkelse at 76% av bedriftene planlegger å bruke AI til å forbedre sine forretningsverdier. Men bare 15% har tilgang til høykvalitetsdata for å nå sine forretningsmål. En annen studie fra Refinitiv viste at 66% av respondentene sa at dårlig kvalitetsdata hindrer deres evne til å implementere og bruke AI effektivt.
Undersøkelsen fant at de tre største utfordringene med å arbeide med maskinlæring og AI-teknologier er – “nøyaktig informasjon om dekning, historikk og befolkning av data”, “identifisering av ufullstendige eller korrupte poster” og “rensing og normalisering av data”. Dette viser at dårlig kvalitetsdata er den største hindringen for bedrifter for å få høykvalitets AI-drevne analyser.
Hvorfor er data så viktig?
Det er mange grunner til at datakvalitet er avgjørende i AI-implementering. Her er noen av de viktigste:
1. Avfall inn og avfall ut
Det er ganske enkelt å forstå at utgangen avhenger tungt av inngangen. I dette tilfellet, hvis datasettene er fulle av feil eller skjev, vil resultatet også sette deg på feil fot. De fleste data-relaterte problemene er ikke nødvendigvis om mengden av data, men kvaliteten på dataene du matet inn i AI-modellen. Hvis du har lavkvalitetsdata, vil dine AI-modeller ikke fungere ordentlig, uansett hvor gode de måtte være.
2. Ikke alle AI-systemer er like
Når vi tenker på datasett, tenker vi vanligvis i kvantitative data. Men det finnes også kvalitative data i form av videoer, personlige intervjuer, meninger, bilder osv. I AI-systemer er kvantitative datasett strukturerte og kvalitative datasett ustukturerte. Ikke alle AI-modeller kan håndtere begge typer datasett. Så, å velge riktig datatyp for modellen er essensielt for å få det forventede utgangen.
3. Kvalitet vs. kvantitet
Det troes at AI-systemer må innta mye data for å lære av det. I en debatt om kvalitet versus kvantitet, foretrekkes vanligvis den siste av bedrifter. Men hvis datasettene er høykvalitets, men kortere i natur, vil det gi deg en viss garanti for at utgangen er relevant og robust.
4. Egenskaper ved et godt datasett
Egenskapene ved et godt datasett kan være subjektive og avhenge hovedsakelig av applikasjonen som AI tjener. Men det finnes noen generelle egenskaper som en må se etter når en analyserer datasett.
- Fullstendighet: Datasettet må være fullstendig med ingen tomme celler eller hull i datasettene. Hver celle må ha en data-enhet i den.
- Omfattende: Datasettene må være så omfattende som mulig. For eksempel, hvis du søker etter en cybertrussel-vektor, må du ha alle signaturprofiler og all nødvendig informasjon.
- Konsistens: Datasettene må passe under de bestemte variablene de er tildelt. For eksempel, hvis du modellerer pakkebokser, må dine valgte variabler (plast, papir, kartong osv.) ha passende prisdata for å falle inn under disse bestemte kategoriene.
- Nøyaktighet: Nøyaktighet er nøkkel til et godt datasett. All informasjon du matet inn i AI-modellen må være pålitelig og fullstendig nøyaktig. Hvis store deler av datasettene dine er feil, vil utgangen din også være feil.
- Unikhet: Dette punktet er lignende konsistens. Hver data-enhet må være unik for variabelen den tjener. For eksempel, du ønsker ikke prisen på en plastisk wrapper å falle under noen annen kategori for pakking.
Sikre datakvalitet
Det finnes mange måter å sikre at datakvaliteten er høy, som å sikre at datakilden er pålitelig. Her er noen av de beste teknikkene for å sikre at du får den beste kvalitetsdata for dine AI-modeller:
1. Data-profilering
Data-profilering er essensielt for å forstå data før du bruker det. Data-profilering gir innsikt i fordelingen av verdier, maksimum-, minimum-, gjennomsnittsverdier og outlier. I tillegg hjelper det med å formatering inkonsistenser i data. Data-profilering hjelper med å forstå om datasettet er brukbart eller ikke.
2. Evaluering av datakvalitet
Ved å bruke en sentral bibliotek med forhåndsbygde datakvalitetsregler, kan du validerer ethvert datasett med en sentral bibliotek. Hvis du har en datakatalog med innebygde data-verktøy, kan du enkelt gjenbruke disse reglene for å validerer kundenavn, e-post og produktkoder. I tillegg kan du også berike og standardisere noen data.
3. Overvåking og evaluering av datakvalitet
Forskere har datakvalitet forhåndsregnet for de fleste datasett de ønsker å bruke. De kan nå ned til å se hva spesifikke problem et attributt har og deretter bestemme om å bruke det attributtet eller ikke.
4. Data-forberedelse
Forskere og vitenskapsmenn må vanligvis justere dataene litt for å forberede dem for AI-modellering. Disse forskerne trenger enkle å bruke verktøy for å parsere attributter, transponere kolonner og beregne verdier fra data.
Verden av artificiell intelligens er kontinuerlig i endring. Mens hver bedrift bruker data på en annen måte, forblir datakvalitet avgjørende for ethvert AI-implementeringsprosjekt. Hvis du har pålitelige, høykvalitetsdata, eliminerer du behovet for massive datasett og øker sjansen for suksess. Liksom alle andre organisasjoner, hvis din organisasjon går mot AI-implementering, sjekk om du har god kvalitetsdata. Sørg for at dine kilder er pålitelige og utfør due diligence for å sjekke om de overholder dine datakrav.












