Grunnleggende AI
Hva er datavitenskap?
Feltet datavitenskap ser ut til å bli større og mer populært hver dag. Ifølge LinkedIn var datavitenskap ett av de raskest voksende jobbområdene i 2017 og i 2020 rangerte Glassdoor jobben som datavitenskapsmann som en av de tre beste jobbene i USA. Gitt den økende populariteten til datavitenskap, er det ingen overraskelse at flere mennesker blir interessert i feltet. Likevel, hva er datavitenskap egentlig?
La oss bli kjent med datavitenskap, og ta litt tid til å definere datavitenskap, utforske hvordan store data og kunstig intelligens endrer feltet, lære om noen vanlige datavitenskap-verktøy og undersøke noen eksempler på datavitenskap.
Hva er datavitenskap?
Før vi kan utforske noen datavitenskap-verktøy eller eksempler, ønsker vi å få en kort definisjon av datavitenskap.
Å definere “datavitenskap” er faktisk litt vanskelig, fordi begrepet brukes til mange forskjellige oppgaver og metoder for undersøkelse og analyse. Vi kan begynne med å minne oss på hva begrepet “vitenskap” betyr. Vitenskap er den systematiske studien av den fysiske og naturlige verden gjennom observasjon og eksperimentering, med mål om å fremme mennesklig forståelse av naturlige prosesser. De viktige ordene i denne definisjonen er “observasjon” og “forståelse”.
Hvis datavitenskap er prosessen med å forstå verden fra mønster i data, så er ansvaret til en datavitenskapsmann å transformere data, analysere data og trekke ut mønster fra data. Med andre ord, en datavitenskapsmann får data og bruker en rekke forskjellige verktøy og metoder til å forberede dataene (gjøre dem klare for analyse) og deretter analysere dataene for meningsfulle mønster.
Rollen til en datavitenskapsmann er lignende rollen til en tradisjonell vitenskapsmann. Begge er opptatt av analysen av data for å støtte eller avvise hypoteser om hvordan verden fungerer, og prøver å gjøre mening av mønster i data for å forbedre vår forståelse av verden. Datavitenskapsmenn bruker de samme vitenskapelige metodene som en tradisjonell vitenskapsmann. En datavitenskapsmann starter med å samle inn observasjoner om et fenomen de ønsker å studere. De formulerer deretter en hypotese om fenomenet i question og prøver å finne data som motbeviser hypotesen på noen måte.
Hvis hypotesen ikke motbevises av dataene, kan de kanskje konstruere en teori eller modell om hvordan fenomenet fungerer, som de kan gå videre og teste igjen og igjen for å se om den holder sant for andre lignende datasett. Hvis en modell er tilstrekkelig robust, hvis den forklarer mønster godt og ikke motbevises under andre tester, kan den sogar brukes til å forutsi fremtidige hendelser.
En datavitenskapsmann vil vanligvis ikke samle inn sine egne data gjennom et eksperiment. De vil vanligvis ikke designe eksperimenter med kontroller og dobbel-blinded prøver for å oppdage forstyrrende variable som kan interferere med en hypotese. De fleste dataene som analyseres av en datavitenskapsmann vil være data som er innhentet gjennom observasjonsstudier og systemer, som er en måte hvorpå jobben til en datavitenskapsmann kan være forskjellig fra jobben til en tradisjonell vitenskapsmann, som ofte utfører flere eksperimenter.
Det sagt, en datavitenskapsmann kan bli bedt om å gjøre en form for eksperimentering kalt A/B-testing hvor justeringer gjøres i et system som samler inn data for å se hvordan datapatternene endrer seg.
Uansett hvilke teknikker og verktøy som brukes, har datavitenskap til slutt som mål å forbedre vår forståelse av verden ved å gjøre mening av data, og data er innhentet gjennom observasjon og eksperimentering. Datavitenskap er prosessen med å bruke algoritmer, statistiske prinsipper og forskjellige verktøy og maskiner til å trekke ut innsikt fra data, innsikt som hjelper oss å forstå mønster i verden rundt oss.
Hva gjør datavitenskapsmenn?
Du kan se at enhver aktivitet som involverer analysen av data på en vitenskapelig måte kan kalles datavitenskap, som er en del av hva som gjør definisjonen av datavitenskap så vanskelig. For å gjøre det mer klart, la oss utforske noen av aktivitetene som en datavitenskapsmann kan gjøre på en daglig basis.

Datavitenskap bringer mange forskjellige disipliner og spesialiteter sammen. Foto: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)
På en hvilken som helst dag kan en datavitenskapsmann bli bedt om å: lage data lagring og hentingsskjema, lage data ETL (extract, transform, load) pipelines og rense data, anvende statistiske metoder, lage data visualiseringer og dashboards, implementere kunstig intelligens og maskinlæring algoritmer, gi anbefalinger for handlinger basert på data.
La oss bryte ned oppgavene ovenfor litt.
En datavitenskapsmann kan bli bedt om å håndtere installasjonen av teknologier som trengs for å lagre og hente data, og å betale attention til både hardware og software. Personen som er ansvarlig for denne stillingen kan også bli kalt “Dataingeniør“. Likevel, noen selskaper inkluderer disse ansvarsområdene under rollen til datavitenskapsmenn. En datavitenskapsmann kan også bli bedt om å lage, eller assistere i å lage, ETL-pipelines. Data kommer sjelden i en form som en datavitenskapsmann trenger. I stedet må dataene mottas i en rå form fra datakilden, transformeres til en brukenbar form og forberedes (ting som standardisering av data, fjerning av redundanser og fjerning av korrupte data).
Statistiske metoder for datavitenskap
Anvendelsen av statistikk er nødvendig for å gjøre dataanalysen til en egentlig vitenskap. Statistiske metoder brukes til å trekke ut relevante mønster fra datasett, og en datavitenskapsmann må være godt kjent med statistiske konsepter. De må kunne skille mellom meningsfulle korrelasjoner og tilfeldige korrelasjoner ved å kontrollere for forstyrrende variable. De må også vite hvilke verktøy å bruke for å bestemme hvilke egenskaper i datasettet som er viktige for modellen/ har prediktiv kraft. En datavitenskapsmann må vite når å bruke en regresjonsmetode vs. en klassifiseringsmetode, og når å bry seg om gjennomsnittet av en prøve vs. medianen av en prøve. En datavitenskapsmann ville ikke være en vitenskapsmann uten disse kritiske ferdighetene.
Data visualisering
En kritisk del av en datavitenskapsmanns jobb er å kommunisere sine funn til andre. Hvis en datavitenskapsmann ikke kan kommunisere sine funn effektivt til andre, så har implikasjonene av funnene ingen betydning. En datavitenskapsmann bør være en effektiv forteller også. Dette innebærer å produsere visualiseringer som kommuniserer relevante punkter om datasettet og mønsterne som er funnet i det. Det finnes et stort antall forskjellige data visualisering verktøy som en datavitenskapsmann kan bruke, og de kan visualisere data for å utforske grunnleggende data (eksplorativ dataanalyse) eller visualisere resultater som en modell produserer.
Anbefalinger og forretningsapplikasjoner
En datavitenskapsmann må ha litt forståelse for kravene og målene til sin organisasjon eller bedrift. En datavitenskapsmann må forstå disse tingene fordi de må vite hvilke typer variabler og egenskaper de bør analysere, og utforske mønster som vil hjelpe organisasjonen å nå sine mål. Datavitenskapsmennene må være klar over begrensningene de opererer under og antagelsene ledelsen i organisasjonen gjør.
Maskinlæring og kunstig intelligens
Maskinlæring og andre kunstig intelligens algoritmer og modeller er verktøy som datavitenskapsmenn bruker til å analysere data, identifisere mønster i data, og gjøre prediksjoner om fremtidige hendelser.
Tradisjonell datavitenskap vs. stor datavitenskap
Ettersom datainnsamlingsteknikkene har blitt mer sofistikerte og databasene større, har det oppstått en forskjell mellom tradisjonell datavitenskap og “stor data” vitenskap.
Tradisjonell dataanalyse og datavitenskap gjøres med beskrivende og eksplorativ analyse, med mål om å finne mønster og analysere resultater av prosjekter. Tradisjonelle dataanalysemetoder fokuserer ofte bare på tidligere data og nåværende data. Dataanalytikere jobber ofte med data som allerede er renset og standardisert, mens datavitenskapsmenn ofte jobber med komplekse og “urene” data. Mer avanserte dataanalyse- og datavitenskapsteknikker kan brukes til å forutsi fremtidig atferd, selv om dette oftere gjøres med stor data, da prediksjonsmodeller ofte trenger store mengder data for å være pålitelige.
“Stor data” refererer til data som er for stor og kompleks til å håndteres med tradisjonelle dataanalyse- og vitenskapsteknikker og verktøy. Stor data samles ofte inn gjennom nettbaserte plattformer og avanserte data transformasjonsverktøy brukes til å gjøre de store datamengdene klare for inspeksjon av datavitenskap. Ettersom mer data samles inn hele tiden, blir en større del av en datavitenskapsmanns jobb å analysere stor data.
Datavitenskap-verktøy
Vanlige datavitenskap-verktøy inkluderer verktøy for å lagre data, utføre eksplorativ dataanalyse, modellere data, utføre ETL og visualisere data. Plattformer som Amazon Web Services, Microsoft Azure og Google Cloud tilbyr verktøy for å hjelpe datavitenskapsmenn å lagre, transformere, analysere og modellere data. Det finnes også selvstendige datavitenskap-verktøy som Airflow (datainfrastruktur) og Tableau (data visualisering og analyse).
I forhold til maskinlæring og kunstig intelligens algoritmer som brukes til å modellere data, tilbys de ofte gjennom datavitenskap-moduler og plattformer som TensorFlow, PyTorch og Azure Machine Learning-studio. Disse plattformene lar datavitenskapsmenn gjøre endringer i datasettene sine, komponere maskinlæring-arkitektur og trene maskinlæring-modeller.
Andre vanlige datavitenskap-verktøy og biblioteker inkluderer SAS (for statistisk modellering), Apache Spark (for analyse av strømmende data), D3.js (for interaktive visualiseringer i nettleseren) og Jupyter (for interaktive, delbare kodeblokker og visualiseringer).

Foto: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)
Eksempler på datavitenskap
Eksempler på datavitenskap og dets anvendelser er overalt. Datavitenskap har anvendelser i alt fra matlevering, idrett, trafikk og helse. Data er overalt, og datavitenskap kan derfor anvendes på alt.
I forhold til mat, investerer Uber i en utvidelse av sin tjeneste for matlevering, Uber Eats. Uber Eats må levere maten til kundene på en rimelig tid, mens den er varm og fersk. For å oppnå dette, må datavitenskapsmennene i selskapet bruke statistisk modellering som tar hensyn til faktorer som avstand fra restauranter til leveringssteder, helligdager, tilberedningstid og selv værforhold, alt med mål om å optimalisere leveringstidene.
Idrettsstatistikk brukes av lagledere til å bestemme hvilke spillere som er de beste og danne sterke, pålitelige lag som vil vinne kamper. Et bemerkelsesverdig eksempel er datavitenskapen som er dokumentert av Michael Lewis i boken Moneyball, hvor generalsekretæren for Oakland Athletics-analyserer en rekke statistikker for å identifisere kvalitets spillere som kan signeres til laget til en relativt lav kostnad.
Analysen av trafikkmønster er kritisk for å skape selvkjørende kjøretøy. Selvkjørende kjøretøy må kunne forutsi aktivitetene rundt seg og reagere på endringer i veiforhold, som den økte stoppeavstanden som kreves når det regner, samt tilstedeværelsen av flere biler på veien under rushtiden. Foruten selvkjørende kjøretøy, analyserer apper som Google Maps trafikkmønster for å fortelle pendlerne hvor lenge det vil ta å komme til destinasjonen deres ved å bruke forskjellige ruter og transportmidler.
I forhold til helsedatavitenskap, kombineres ofte datamaskin-syn med maskinlæring og andre kunstig intelligens-teknikker for å skape bilde-klassifiseringsprogrammer som kan undersøke ting som røntgenbilder, FMRIs og ultralyd for å se om det finnes noen potensielle medisinske problemer som kan dukke opp i skanningen. Disse algoritmene kan brukes til å hjelpe kliniske leger å diagnostisere sykdom.
Til slutt dekker datavitenskap en rekke aktiviteter og bringer sammen aspekter fra forskjellige disipliner. Likevel, datavitenskap er alltid opptatt av å fortelle overbevisende, interessante historier fra data, og å bruke data til å forbedre vår forståelse av verden.












