Grundlæggende AI
Hvad er Datavidenskab?
Datavidenskabsfeltet synes at vokse og blive mere populært hver dag. Ifølge LinkedIn var datavidenskab en af de hurtigst voksende jobområder i 2017 og i 2020 rangerede Glassdoor jobbet som datavidenskabsmand som en af de tre bedste job i USA. Givet datavidenskabsfeltets voksende popularitet er det ikke overraskende, at flere mennesker bliver interesseret i feltet. Men hvad er datavidenskab egentlig?
Lad os blive bekendt med datavidenskab, tage lidt tid til at definere datavidenskab, udforske, hvordan big data og kunstig intelligens ændrer feltet, lære om nogle almindelige datavidenskabsværktøjer og undersøge nogle eksempler på datavidenskab.
Hvad er Datavidenskab?
Før vi kan udforske nogen datavidenskabsværktøjer eller eksempler, vil vi gerne have en præcis definition af datavidenskab.
At definere “datavidenskab” er faktisk lidt svært, fordi begrebet anvendes på mange forskellige opgaver og metoder til undersøgelse og analyse. Vi kan begynde med at mindske os selv om, hvad begrebet “videnskab” betyder. Videnskab er den systematiske studie af den fysiske og naturlige verden gennem observation og eksperiment, med det formål at fremme menneskets forståelse af naturlige processer. De vigtige ord i den definition er “observation” og “forståelse”.
Hvis datavidenskab er processen med at forstå verden fra mønstre i data, så er ansvaret for en datavidenskabsmand at transformere data, analysere data og udtrække mønstre fra data. Med andre ord er en datavidenskabsmand blevet tildelt data og bruger en række forskellige værktøjer og metoder til at forberede data (gøre det klar til analyse) og derefter analysere data for meningsfulde mønstre.
Rollen som datavidenskabsmand ligner rollen som en traditionel videnskabsmand. Begge er beskæftiget med analysen af data for at støtte eller afvise hypoteser om, hvordan verden fungerer, og forsøger at give mening til mønstre i data for at forbedre vores forståelse af verden. Datavidenskabsmænd bruger de samme videnskabelige metoder, som en traditionel videnskabsmand gør. En datavidenskabsmand starter med at samle observationer om et fænomen, de gerne vil studere. De formulerer derefter en hypotese om fænomenet i spørgsmål og forsøger at finde data, der modsiger deres hypotese på en eller anden måde.
Hvis hypotesen ikke modsiges af data, kan de måske konstruere en teori eller model om, hvordan fænomenet fungerer, som de kan teste igen og igen ved at se, om den holder sig for andre lignende datasæt. Hvis en model er tilstrækkeligt robust, hvis den forklarer mønstre godt og ikke modsiges under andre tests, kan den endda bruges til at forudsige fremtidige forekomster af det fænomen.
En datavidenskabsmand vil normalt ikke selv indsamle data gennem et eksperiment. De vil normalt ikke designe eksperimenter med kontroller og dobbelt-blindede forsøg for at opdage forstyrrende variabler, der kan påvirke en hypotese. Det meste af data, der analyseres af en datavidenskabsmand, vil være data, der er erhvervet gennem observationsstudier og systemer, hvilket er en måde, hvorpå jobbet som datavidenskabsmand kan adskille sig fra jobbet som en traditionel videnskabsmand, der tenderer til at udføre flere eksperimenter.
Det sagde, en datavidenskabsmand kan blive bedt om at udføre en form for eksperiment kaldet A/B-test, hvor ændringer bliver foretaget i et system, der indsamler data for at se, hvordan data-mønstrene ændrer sig.
Uanset hvilke metoder og værktøjer, der bliver brugt, har datavidenskab til formål at forbedre vores forståelse af verden ved at give mening til data, og data bliver erhvervet gennem observation og eksperiment. Datavidenskab er processen med at bruge algoritmer, statistiske principper og forskellige værktøjer og maskiner til at udtrække indsigt fra data, indsigt, der hjælper os med at forstå mønstre i verden omkring os.
Hvad gør Datavidenskabsmænd?
Du kan se, at enhver aktivitet, der involverer analysen af data på en videnskabelig måde, kan kaldes datavidenskab, hvilket er en del af, hvad der gør det svært at definere datavidenskab. For at gøre det mere klart, lad os udforske nogle af de aktiviteter, en datavidenskabsmand kan udføre på en daglig basis.

Datavidenskab bringer mange forskellige discipliner og specialer sammen. Foto: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)
På en given dag kan en datavidenskabsmand blive bedt om at: oprette data-lagring og -hentningsskema, oprette data-ETL (extract, transform, load) pipelines og rydde op i data, anvende statistiske metoder, skabe data-visualiseringer og dashboards, implementere kunstig intelligens og maskinlæringsalgoritmer, give anbefalinger for handlinger baseret på data.
Lad os bryde de ovennævnte opgaver lidt ned.
En datavidenskabsmand kan være påkrævet at håndtere installationen af teknologier, der er nødvendige for at lagre og hente data, og være opmærksom på både hardware og software. Personerne, der er ansvarlige for denne position, kan også blive kaldt “Dataingeniør“. Dog kan nogle virksomheder inkludere disse ansvarsområder under rollen som datavidenskabsmand. En datavidenskabsmand kan også være nødt til at oprette, eller hjælpe med at oprette, ETL-pipelines. Data kommer sjældent i en form, der er klar til brug for en datavidenskabsmand. I stedet skal data modtages i en rå form fra datakilden, transformeres til en brugbar form og forberedes (såsom standardisering af data, fjernelse af redundanser og fjernelse af korrupte data).
Statistiske Metoder i Datavidenskab
Anvendelsen af statistik er nødvendig for at omdanne blot at se på data og fortolke det til en rigtig videnskab. Statistiske metoder bliver brugt til at udtrække relevante mønstre fra datasæt, og en datavidenskabsmand skal være godt fortrolig med statistiske begreber. De skal være i stand til at skelne mellem meningsfulde korrelationer og spurious korrelationer ved at kontrollere for forstyrrende variabler. De skal også vide, hvilke værktøjer at bruge til at bestemme, hvilke funktioner i datasættet er vigtige for deres model/har forudsigelseskraft. En datavidenskabsmand skal vide, hvornår at bruge en regressionstilgang vs. en klassificeringstilgang, og hvornår at være bekymret for middelværdien af en stikprøve vs. medianen af en stikprøve. En datavidenskabsmand ville ikke være en videnskabsmand uden disse afgørende færdigheder.
Data-Visualisering
En afgørende del af en datavidenskabsmands job er at kommunikere deres resultater til andre. Hvis en datavidenskabsmand ikke kan kommunikere deres resultater effektivt til andre, så betyder implikationerne af deres resultater ikke noget. En datavidenskabsmand skal være en effektiv fortæller også. Dette betyder at producere visualiseringer, der kommunikerer relevante punkter om datasættet og mønstrene, der er opdaget i det. Der er et stort antal forskellige data-visualiseringsværktøjer, som en datavidenskabsmand kan bruge, og de kan visualisere data for formålet med den første, grundlæggende udforskning (eksplorativ data-analyse) eller visualisere resultaterne, som en model producerer.
Anbefalinger og Forretningsapplikationer
En datavidenskabsmand skal have en vis intuition omkring kravene og målene for deres organisation eller virksomhed. En datavidenskabsmand skal forstå disse ting, fordi de skal vide, hvilke typer af variabler og funktioner, de skal analysere, og hvilke mønstre, der kan hjælpe deres organisation med at opnå sine mål. Datavidenskabsmændene skal være bekendt med de begrænsninger, de opererer under, og de antagelser, organisationens ledelse gør.
Maskinlæring og Kunstig Intelligens
Maskinlæring og andre kunstige intelligensalgoritmer og -modeller er værktøjer, der bruges af datavidenskabsmænd til at analysere data, identificere mønstre inden for data, skelne mellem variabler og forudsige fremtidige begivenheder.
Traditionel Datavidenskab vs. Big Datavidenskab
Da dataindsamlingsteknikker er blevet mere avancerede og databaser større, er der opstået en forskel mellem traditionel datavidenskab og “big data”-videnskab.
Traditionel data-analyse og datavidenskab udføres med deskriptiv og eksplorativ analyse, med det formål at finde mønstre og analysere resultaterne af projekter. Traditionelle data-analyseteknikker fokuserer ofte kun på tidligere data og nuværende data. Data-analytikere beskæftiger sig ofte med data, der allerede er renset og standardiseret, mens datavidenskabsmænd ofte beskæftiger sig med komplekse og “beskidte” data. Mere avancerede data-analyseteknikker og datavidenskab kan bruges til at forudsige fremtidig adfærd, selvom dette oftere udføres med big data, da forudsigelsesmodeller ofte kræver store mængder data for at være pålidelige.
“Big data” refererer til data, der er for stort og komplekst til at blive behandlet med traditionelle data-analyse- og datavidenskabsteknikker og -værktøjer. Big data indsamles ofte gennem online-platforme, og avancerede data-transformationsteknikker bruges til at gøre de store mængder data klar til inspektion af datavidenskab. Da der indsamles mere data hele tiden, involverer en større del af en datavidenskabsmands job analysen af big data.
Datavidenskabsværktøjer
Almindelige datavidenskabsværktøjer inkluderer værktøjer til at lagre data, udføre eksplorativ data-analyse, modeldata, udføre ETL og visualisere data. Platforme som Amazon Web Services, Microsoft Azure og Google Cloud tilbyder værktøjer til at hjælpe datavidenskabsmænd med at lagre, transformere, analysere og modeldata. Der er også selvstændige datavidenskabsværktøjer som Airflow (data-infrastruktur) og Tableau (data-visualisering og -analyse).
I forhold til maskinlæring og kunstig intelligens-algoritmer, der bruges til at modeldata, bliver de ofte leveret gennem datavidenskabsmoduler og -platforme som TensorFlow, PyTorch og Azure Machine Learning-studio. Disse platforme giver datavidenskabsmænd mulighed for at redigere deres datasæt, komponere maskinlæringsarkitekturer og træne maskinlæringsmodeller.
Andre almindelige datavidenskabsværktøjer og -biblioteker inkluderer SAS (til statistisk modelering), Apache Spark (til analyse af strømmende data), D3.js (til interaktive visualiseringer i browseren) og Jupyter (til interaktive, delbare kodeblokke og visualiseringer).

Foto: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)
Eksempler på Datavidenskab
Eksempler på datavidenskab og dets anvendelser findes overalt. Datavidenskab har anvendelser i alt fra madlevering, sport, trafik og sundhed. Data findes overalt, og derfor kan datavidenskab anvendes på alt.
I forhold til mad investerer Uber i en udvidelse af deres ride-sharing-system, der fokuserer på levering af mad, Uber Eats. Uber Eats skal få mennesker deres mad i en rimelig tid, mens den stadig er varm og frisk. For at dette kan ske, skal datavidenskabsmændene i virksomheden bruge statistisk modelering, der tager hensyn til aspekter som afstand fra restauranter til leveringspunkter, feriedage, tilberedningstid og selv vejret, alt sammen med det formål at optimere leveringstider.
Sportsstatistik bruges af holdledere til at bestemme, hvem de bedste spillere er, og danne stærke, pålidelige hold, der kan vinde kampe. Et bemærkelsesværdigt eksempel er datavidenskaben, der er dokumenteret af Michael Lewis i bogen Moneyball, hvor generalsekretæren for Oakland Athletics-holdet analyserede en række statistikker for at identificere kvalitets spillere, der kunne tilføjes holdet til en relativt lav pris.
Analysen af trafikmønstre er afgørende for skabelsen af selvkørende køretøjer. Selvkørende køretøjer skal kunne forudsige aktivitet omkring sig og reagere på ændringer i vejforhold, såsom den øgede stopafstand, der kræves, når det regner, samt tilstedeværelsen af flere biler på vejen under myldretid. Ud over selvkørende køretøjer analyserer apps som Google Maps trafikmønstre for at fortælle pendlere, hvor lang tid det vil tage dem at nå deres destination ved hjælp af forskellige ruter og former for transport.
I forhold til sundhedsdatavidenskab kombineres computerseende ofte med maskinlæring og andre kunstige intelligens-teknikker for at skabe billedklassificatorer, der kan undersøge ting som røntgenbilleder, FMRIs og ultralydsbilleder for at se, om der er nogen potentielle medicinske problemer, der kan dukke op på billedet. Disse algoritmer kan bruges til at hjælpe klinikere med at diagnostisere sygdom.
Til sidst dækker datavidenskab en lang række aktiviteter og bringer aspekter af forskellige discipliner sammen. Dog er datavidenskab altid beskæftiget med at fortælle overbevisende, interessante historier fra data og med at bruge data til bedre at forstå verden.












