Thought leaders

Belang van gegevenskwaliteit bij AI-implementatie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Artificiële intelligentie en machine learning technologieën kunnen bedrijven van alle maten aanzienlijk voordeel bieden. Volgens een rapport van McKinsey zullen bedrijven die artificiële intelligentie technologieën gebruiken, hun kasstroom verdubbelen tegen 2030. Omgekeerd zullen bedrijven die geen AI implementeren, een daling van 20% in hun kasstroom zien. Echter, deze voordelen gaan verder dan financiën. AI kan bedrijven helpen tegen arbeids tekorten te vechten. AI verbetert ook aanzienlijk de klantbeleving en bedrijfsresultaten, waardoor bedrijven betrouwbaarder worden.

Aangezien AI zo veel voordelen heeft, waarom gebruiken niet alle bedrijven AI? In 2019 onthulde een onderzoek van PwC dat 76% van de bedrijven van plan zijn om AI te gebruiken om hun bedrijfswaarde te verbeteren. Echter, slechts 15% heeft toegang tot hoogwaardige gegevens om hun bedrijfsdoelen te bereiken. Een ander onderzoek van Refinitiv suggereerde dat 66% van de respondenten zei dat slechte gegevenskwaliteit hun vermogen om AI effectief te implementeren, belemmert.

Het onderzoek vond dat de top drie uitdagingen bij het werken met machine learning en AI technologieën draaien om – “nauwkeurige informatie over de dekking, geschiedenis en populatie van de gegevens”, “identificatie van onvolledige of corrupte records” en “schoonmaken en normaliseren van de gegevens”. Dit toont aan dat slechte gegevenskwaliteit de belangrijkste hindernis is voor bedrijven om hoogwaardige AI-gebaseerde analyses te krijgen.

Waarom is gegevenskwaliteit zo belangrijk?

Er zijn veel redenen waarom gegevenskwaliteit cruciaal is bij AI-implementatie. Hier zijn enkele van de belangrijkste:

1. Garbage In en Garbage Out

Het is vrij eenvoudig om te begrijpen dat de output afhankelijk is van de input. In dit geval, als de gegevenssets vol fouten of scheef zijn, zal het resultaat ook verkeerd zijn. De meeste gegevensgerelateerde problemen zijn niet noodzakelijkerwijs gerelateerd aan de hoeveelheid gegevens, maar aan de kwaliteit van de gegevens die u aan het AI-model voert. Als u lage kwaliteit gegevens heeft, zullen uw AI-modellen niet goed werken, ongeacht hoe goed ze zijn.

2. Niet alle AI-systemen zijn gelijk

Wanneer we denken aan gegevenssets, denken we meestal in termen van kwantitatieve gegevens. Maar er zijn ook kwalitatieve gegevens in de vorm van video’s, persoonlijke interviews, meningen, afbeeldingen, etc. In AI-systemen zijn kwantitatieve gegevenssets gestructureerd en kwalitatieve gegevenssets ongestructureerd. Niet alle AI-modellen kunnen beide soorten gegevenssets verwerken. Het selecteren van de juiste gegevenstype voor het geschikte model is essentieel om het verwachte resultaat te krijgen.

3. Kwaliteit vs. Kwantity

Men denkt dat AI-systemen veel gegevens nodig hebben om er van te leren. In een debat over kwaliteit versus kwantiteit, wordt de laatste meestal door bedrijven verkozen. Echter, als de gegevenssets van hoge kwaliteit zijn, maar korter in aard, geeft dit u enige garantie dat de output relevant en robuust is.

4. Kenmerken van een goede gegevensset

De kenmerken van een goede gegevensset kunnen subjectief zijn en afhankelijk van de toepassing die AI dient. Echter, er zijn enkele algemene kenmerken die u moet zoeken bij het analyseren van gegevenssets.

  • Volledigheid: De gegevensset moet volledig zijn met geen lege cellen of gaten in de gegevens. Elke cel moet een stukje gegevens bevatten.
  • Uitgebreidheid: De gegevenssets moeten zo uitgebreid mogelijk zijn. Als u bijvoorbeeld naar een cyberdreigingsvector zoekt, moet u alle signatuurprofielen en alle noodzakelijke informatie hebben.
  • Consistentie: De gegevenssets moeten onder de definitieve variabelen vallen die ze zijn toegewezen. Als u bijvoorbeeld pakketdozen modelleert, moeten uw geselecteerde variabelen (plastic, papier, karton, etc.) de juiste prijsgegevens hebben om in die definitieve categorieën te vallen.
  • Nauwkeurigheid: Nauwkeurigheid is de sleutel tot een goede gegevensset. Alle informatie die u aan het AI-model voert, moet betrouwbaar en volledig nauwkeurig zijn. Als grote delen van uw gegevenssets onjuist zijn, zal uw output ook onnauwkeurig zijn.
  • Uniekheid: Dit punt is vergelijkbaar met consistentie. Elk gegevenspunt moet uniek zijn voor de variabele die het dient. Als u bijvoorbeeld de prijs van een plastic verpakking niet wilt laten vallen onder een andere categorie van verpakkingen.

Gegevenskwaliteit waarborgen

Er zijn veel manieren om ervoor te zorgen dat de gegevenskwaliteit hoog is, zoals het waarborgen dat de gegevensbron betrouwbaar is. Hier zijn enkele van de beste technieken om ervoor te zorgen dat u de beste kwaliteit gegevens voor uw AI-modellen krijgt:

1. Gegevensprofielen

Gegevensprofielen zijn essentieel om gegevens te begrijpen voordat u ze gebruikt. Gegevensprofielen bieden inzicht in de verdeling van waarden, de maximale, minimale, gemiddelde waarden en uitschieters. Bovendien helpt het bij het opsporen van inconsistenties in de gegevens. Gegevensprofielen helpen u te begrijpen of de gegevensset bruikbaar is of niet.

2. Gegevenskwaliteit evalueren

Met behulp van een centrale bibliotheek van vooraf gedefinieerde gegevenskwaliteitsregels, kunt u elke gegevensset valideren met een centrale bibliotheek. Als u een gegevenscatalogus met ingebouwde gegevenstools heeft, kunt u deze regels opnieuw gebruiken om klantnamen, e-mailadressen en productcodes te valideren. Bovendien kunt u sommige gegevens ook verrijken en standaardiseren.

3. Gegevenskwaliteit controleren en evalueren

Wetenschappers hebben de gegevenskwaliteit vooraf berekend voor de meeste gegevenssets die ze willen gebruiken. Ze kunnen deze gegevens verfijnen om te zien welk specifiek probleem een attribuut heeft en vervolgens beslissen of ze dat attribuut al dan niet willen gebruiken.

4. Gegevensvoorbereiding

Onderzoekers en wetenschappers moeten de gegevens meestal een beetje aanpassen om ze voor te bereiden voor AI-modellering. Deze onderzoekers hebben gemakkelijk te gebruiken tools nodig om attributen te parseren, kolommen om te zetten en waarden uit de gegevens te berekenen.

De wereld van artificiële intelligentie verandert voortdurend. Terwijl elk bedrijf gegevens op een andere manier gebruikt, blijft gegevenskwaliteit essentieel voor elk AI-implementatieproject. Als u betrouwbare, hoogwaardige gegevens heeft, elimineert u de behoefte aan grote gegevenssets en vergroot u uw kansen op succes. Net als alle andere organisaties, als uw organisatie overgaat tot AI-implementatie, controleert u of u over goede kwaliteit gegevens beschikt. Zorg ervoor dat uw bronnen betrouwbaar zijn en voer due diligence uit om te controleren of ze voldoen aan uw gegevensvereisten.

Amy Groden-Morrison heeft meer dan 15 jaar ervaring in leidinggevende marketingcommunicatierollen bij bedrijven zoals TIBCO Software, RSA Security en Ziff-Davis. Haar voorgaande prestaties omvatten het opzetten van het eerste co-gebrande technologieprogramma met CNN, het lanceren van een evenementenbedrijf op de NYSE, het rebranden van een NASDAQ-genoteerd bedrijf te midden van een crisis en het positioneren en marketing van een startup in de regio Boston voor een succesvolle overname. Momenteel is zij VP van Marketing en Sales Operation voor Alpha Software.