AI-basisprincipes

Wat is Data Science?

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het veld van data science lijkt elke dag groter en populairder te worden. Volgens LinkedIn was data science een van de snelst groeiende beroepsgebieden in 2017 en in 2020 rangschikte Glassdoor de baan van data scientist als een van de drie beste banen in de Verenigde Staten. Gezien de groeiende populariteit van data science, is het geen verrassing dat meer mensen geïnteresseerd raken in het veld. Toch is de vraag wat data science precies is nog steeds niet duidelijk.

Laten we kennis maken met data science, door eerst een definitie van data science te geven, vervolgens te onderzoeken hoe big data en kunstmatige intelligentie het veld veranderen, enkele veelvoorkomende data science-tools te leren kennen en enkele voorbeelden van data science te onderzoeken.

Wat is Data Science?

Voordat we enige data science-tools of -voorbeelden kunnen onderzoeken, willen we eerst een korte definitie van data science geven.

Het definiëren van “data science” is eigenlijk een beetje lastig, omdat de term wordt toegepast op veel verschillende taken en methoden van onderzoek en analyse. We kunnen beginnen met onszelf te herinneren aan wat de term “wetenschap” betekent. Wetenschap is de systematische studie van de fysieke en natuurlijke wereld door middel van observatie en experimenten, met als doel de menselijke kennis van natuurlijke processen te vergroten. De belangrijke woorden in deze definitie zijn “observatie” en “begrip”.

Als data science het proces is van het begrijpen van de wereld door middel van patronen in data, dan is de verantwoordelijkheid van een data scientist om data te transformeren, te analyseren en patronen uit data te halen. Met andere woorden, een data scientist krijgt data en gebruikt verschillende tools en technieken om de data voor te bereiden (klaar te maken voor analyse) en vervolgens de data te analyseren op zoek naar betekenisvolle patronen.

De rol van een data scientist is vergelijkbaar met die van een traditionele wetenschapper. Beiden zijn bezig met de analyse van data om hypothesen over de werking van de wereld te ondersteunen of te weerleggen, en proberen patronen in de data te begrijpen om onze kennis van de wereld te vergroten. Data scientists gebruiken dezelfde wetenschappelijke methoden als traditionele wetenschappers. Een data scientist begint met het verzamelen van observaties over een fenomeen dat hij wil bestuderen. Vervolgens formuleert hij een hypothese over het fenomeen in kwestie en probeert hij data te vinden die zijn hypothese op de een of andere manier weerlegt.

Als de hypothese niet wordt weerlegt door de data, kan hij mogelijk een theorie of model over de werking van het fenomeen construeren, die hij vervolgens kan testen door te zien of deze waar blijft voor andere vergelijkbare datasets. Als een model voldoende robuust is, als het patronen goed verklaart en niet wordt weerlegt tijdens andere tests, kan het zelfs worden gebruikt om toekomstige gebeurtenissen te voorspellen.

Een data scientist verzamelt meestal geen eigen data door middel van een experiment. Hij ontwerpt meestal geen experimenten met controlegroepen en dubbelblinde tests om storende variabelen te ontdekken die de hypothese kunnen beïnvloeden. De meeste door een data scientist geanalyseerde data zijn verkregen door middel van observationele studies en systemen, wat een manier is waarop de taak van een data scientist kan verschillen van die van een traditionele wetenschapper, die meestal meer experimenten uitvoert.

Desalniettemin kan een data scientist worden gevraagd om een vorm van experimenten uit te voeren, genaamd A/B-testen, waarbij aanpassingen worden gemaakt aan een systeem dat data verzamelt om te zien hoe de datapatronen veranderen.

Ongeacht de gebruikte technieken en tools, heeft data science uiteindelijk tot doel onze kennis van de wereld te vergroten door zin te geven aan data, en data wordt verkregen door middel van observatie en experimenten. Data science is het proces van het gebruiken van algoritmes, statistische principes en verschillende tools en machines om inzichten uit data te halen, inzichten die ons helpen om patronen in de wereld om ons heen te begrijpen.

Wat doen data scientists?

U ziet misschien dat elke activiteit die de analyse van data op een wetenschappelijke manier omvat, data science kan worden genoemd, en dat is deels waarom het definiëren van data science zo moeilijk is. Om het duidelijker te maken, laten we enkele activiteiten onderzoeken die een data scientist elke dag kan doen.

Data science brengt veel verschillende disciplines en specialisaties samen. Foto: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

Op elke gegeven dag kan een data scientist worden gevraagd om: een gegevensopslag- en -ophalingsschema te maken, gegevens-ETL-pijpleidingen (extract, transform, load) te maken en gegevens schoon te maken, statistische methoden te gebruiken, gegevensvisualisaties en dashboards te maken, kunstmatige intelligentie en machine learning-algoritmen te implementeren, aanbevelingen te doen op basis van de gegevens.

Laten we de bovenstaande taken een beetje uitbreiden.

Een data scientist kan worden gevraagd om de installatie van technologieën te behandelen die nodig zijn om gegevens op te slaan en op te halen, waarbij zowel hardware als software wordt meegenomen. De persoon die verantwoordelijk is voor deze positie kan ook ” Data Engineer” worden genoemd. Sommige bedrijven nemen deze verantwoordelijkheden echter op in de rol van data scientists. Een data scientist kan ook worden gevraagd om te helpen bij het maken van ETL-pijpleidingen. Gegevens komen zelden in de gewenste formaat voor een data scientist. In plaats daarvan moeten de gegevens in ruwe vorm van de gegevensbron worden ontvangen, getransformeerd in een bruikbaar formaat en voorbewerkt (dingen zoals het standaardiseren van de gegevens, het verwijderen van redundante gegevens en het verwijderen van beschadigde gegevens).

Statistische methoden van Data Science

De toepassing van statistiek is noodzakelijk om het simpelweg bekijken van gegevens en interpreteren ervan om te zetten in een echte wetenschap. Statistische methoden worden gebruikt om relevante patronen uit datasets te extraheren, en een data scientist moet goed op de hoogte zijn van statistische concepten. Hij moet in staat zijn om betekenisvolle correlaties van spurious correlaties te onderscheiden door controle te houden over storende variabelen. Hij moet ook weten welke tools hij moet gebruiken om te bepalen welke kenmerken in de dataset belangrijk zijn voor zijn model / hebben voorspellende kracht. Een data scientist moet weten wanneer hij een regressiebenadering moet gebruiken in plaats van een classificatiebenadering, en wanneer hij zich zorgen moet maken over het gemiddelde van een steekproef versus het mediaan van een steekproef. Een data scientist zou geen wetenschapper zijn zonder deze cruciale vaardigheden.

Data Visualisatie

Een cruciaal onderdeel van de taak van een data scientist is het overbrengen van zijn bevindingen aan anderen. Als een data scientist zijn bevindingen niet effectief aan anderen kan overbrengen, dan heeft het geen zin. Een data scientist moet ook een effectieve verhalenverteller zijn. Dit betekent het produceren van visualisaties die relevante punten over de dataset en de patronen die erin zijn ontdekt, communiceren. Er zijn veel verschillende data visualisatie-tools die een data scientist kan gebruiken, en hij kan gegevens visualiseren voor het doel van initiële, basisexploratie (exploratory data-analyse) of visualiseren van de resultaten die een model produceert.

Aanbevelingen en bedrijfsapplicaties

Een data scientist moet enige intuïtie hebben van de vereisten en doelen van zijn organisatie of bedrijf. Een data scientist moet deze dingen begrijpen omdat hij moet weten welke soorten variabelen en kenmerken hij moet analyseren, patronen die zijn organisatie helpen om haar doelen te bereiken. De data scientists moeten zich bewust zijn van de beperkingen waaronder ze opereren en de aannamen die het leiderschap van de organisatie maken.

Machine Learning en AI

Machine learning en andere kunstmatige intelligentie-algoritmen en -modellen zijn tools die door data scientists worden gebruikt om gegevens te analyseren, patronen in gegevens te identificeren, relaties tussen variabelen te onderscheiden en voorspellingen over toekomstige gebeurtenissen te doen.

Traditionele Data Science vs. Big Data Science

Naarmate gegevensverzamelingstechnieken geavanceerder zijn geworden en databases groter zijn geworden, is een verschil ontstaan tussen traditionele data science en “big data”-science.

Traditionele data-analyse en data science worden uitgevoerd met beschrijvende en exploratoire analyse, met als doel patronen te vinden en de prestatie-resultaten van projecten te analyseren. Traditionele data-analyse-methoden richten zich meestal op alleen verleden en huidige gegevens. Data-analisten hebben meestal te maken met gegevens die al zijn schoongemaakt en gestandaardiseerd, terwijl data scientists meestal te maken hebben met complexe en vuile gegevens. Geavanceerdere data-analyse- en data science-technieken kunnen worden gebruikt om toekomstig gedrag te voorspellen, hoewel dit vaker wordt gedaan met big data, aangezien voorspellende modellen meestal grote hoeveelheden gegevens nodig hebben om betrouwbaar te zijn.

“Big data” verwijst naar gegevens die te groot en complex zijn om te worden behandeld met traditionele data-analyse- en wetenschapstechnieken en -tools. Big data wordt meestal verzameld via online-platforms en geavanceerde data-transformatie-tools worden gebruikt om de grote hoeveelheden gegevens klaar te maken voor inspectie door data science. Naarmate meer gegevens worden verzameld, neemt het onderdeel van de taak van een data scientist dat big data-analyse omvat toe.

Data Science Tools

Gemeenschappelijke data science-tools omvatten tools om gegevens op te slaan, exploratoire data-analyse uit te voeren, gegevens te modelleren, ETL uit te voeren en gegevens te visualiseren. Platforms zoals Amazon Web Services, Microsoft Azure en Google Cloud bieden tools om data scientists te helpen gegevens op te slaan, te transformeren, te analyseren en te modelleren. Er zijn ook zelfstandige data science-tools zoals Airflow (data-infrastructuur) en Tableau (gegevensvisualisatie en -analyse).

In termen van machine learning- en kunstmatige intelligentie-algoritmen die worden gebruikt om gegevens te modelleren, worden deze meestal aangeboden via data science-modules en -platforms zoals TensorFlow, PyTorch en de Azure Machine Learning-studio. Deze platforms stellen data scientists in staat om hun datasets te bewerken, machine learning-architecturen te maken en machine learning-modellen te trainen.

Andere veelvoorkomende data science-tools en -bibliotheken zijn SAS (voor statistisch modelleren), Apache Spark (voor de analyse van streaming-gegevens), D3.js (voor interactieve visualisaties in de browser) en Jupyter (voor interactieve, deelbare code-blokken en visualisaties).

Foto: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Voorbeelden van Data Science

Voorbeelden van data science en zijn toepassingen zijn overal. Data science heeft toepassingen in alles, van voedselbezorging, sport, verkeer en gezondheid. Gegevens zijn overal en dus kan data science op alles worden toegepast.

Wat voedsel betreft, investeert Uber in een uitbreiding van zijn ritdienstensysteem gericht op de bezorging van voedsel, Uber Eats. Uber Eats moet mensen hun eten op tijd bezorgen, terwijl het nog warm en vers is. Om dit te laten gebeuren, moeten data scientists van het bedrijf statistische modellen gebruiken die aspecten zoals de afstand van restaurants tot bezorgpunten, feestdagen, kooktijd en zelfs weersomstandigheden meenemen, allemaal met het doel om bezorgtijden te optimaliseren.

Sportstatistieken worden door teammanagers gebruikt om te bepalen wie de beste spelers zijn en sterke, betrouwbare teams te vormen die wedstrijden zullen winnen. Een opvallend voorbeeld is de data science die is gedocumenteerd door Michael Lewis in het boek Moneyball, waarin de algemeen directeur van het Oakland Athletics-team een verscheidenheid aan statistieken analyseerde om kwaliteitspelers te identificeren die tegen een relatief lage kosten konden worden aangetrokken.

De analyse van verkeerspatronen is cruciaal voor de creatie van zelfrijdende voertuigen. Zelfrijdende voertuigen moeten in staat zijn om de activiteit om hen heen te voorspellen en te reageren op veranderingen in de wegomstandigheden, zoals de toegenomen stopafstand die nodig is wanneer het regent, evenals de aanwezigheid van meer auto’s op de weg tijdens spitsuren. Buiten zelfrijdende voertuigen analyseren apps zoals Google Maps verkeerspatronen om forensen te vertellen hoe lang het zal duren om hun bestemming te bereiken met behulp van verschillende routes en vervoermiddelen.

Wat gezondheidsdata science betreft, wordt computerzicht vaak gecombineerd met machine learning en andere AI-technieken om beeldclassificatoren te maken die in staat zijn om dingen zoals röntgenfoto’s, FMRIs en echografische beelden te onderzoeken om te zien of er mogelijke medische problemen zijn die in de scan kunnen verschijnen. Deze algoritmen kunnen worden gebruikt om clinicians te helpen bij de diagnose van ziekten.

Uiteindelijk omvat data science talloze activiteiten en brengt het aspecten van verschillende disciplines samen. Toch is data science altijd bezig met het vertellen van overtuigende, interessante verhalen vanuit gegevens, en met het gebruik van gegevens om de wereld beter te begrijpen.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.