AI:n perusteet
Mitä on data science?
Data science -alue on kasvanut jokapäiväisesti ja on yhä suositumpi. LinkedInin mukaan data science oli yksi nopeimmin kasvavista työaloista vuonna 2017 ja vuonna 2020 Glassdoor sijoitti data scientist -työn yhdeksi kolmesta parhaasta työstä Yhdysvalloissa. Data scientisteja kiinnostaa yhä enemmän, mutta mitä data science oikein on?
Tutustutaan data scienceen, määritellään data science, tarkastellaan, miten big data ja tekoäly muuttavat alaa, opitaan joitain yleisiä data science -työkaluja ja tarkastellaan joitain data science -esimerkkejä.
Mitä on data science?
Ennen kuin voimme tutkia data science -työkaluja tai -esimerkkejä, haluamme määritellä data science -termin.
Data science -termin määrittely on hieman hankalaa, koska termiä sovelletaan moniin eri tehtäviin ja analyysimenetelmiin. Voimme aloittaa muistamalla, mitä “tiede” tarkoittaa. Tiede on järjestelmällinen tutkimus fyysisestä ja luonnollisesta maailmasta havainnoinnin ja kokeiden kautta, pyrkien edistämään ihmisen ymmärrystä luonnollisista prosesseista. Tärkeät sanat tässä määritelmissä ovat “havainnointi” ja “ymmärrys”.
Jos data science on prosessi, jossa ymmärretään maailmaa datasta, niin data scientistin vastuu on muuttaa dataa, analysoida dataa ja poistaa datasta merkityksellisiä kuvioita. Toisin sanoen data scientistille annetaan data, ja he käyttävät erilaisia työkaluja ja menetelmiä datan esikäsittelyyn (valmisteluun analyysiä varten) ja sitten datan analysointiin merkityksellisten kuvioiden löytämiseksi.
Data scientistin rooli on samanlainen kuin perinteisen tutkijan rooli. Molemmat ovat kiinnostuneita datan analysoinnista hypoteesien tueksi tai vastustukseksi, yrittäen ymmärtää datassa olevia kuvioita maailman ymmärtämiseksi. Data scientistit käyttävät samoja tieteellisiä menetelmiä kuin perinteiset tutkijat. Data scientist kerää havaintoja jostakin ilmiöstä, jota he haluavat tutkia. He muodostavat hypoteesin ilmiöstä ja yrittävät löytää dataa, joka vastustaa heidän hypoteesiaan jollain tavoin.
Jos hypoteesi ei ole ristiriidassa datan kanssa, he voivat rakentaa teorian tai mallin ilmiön toiminnasta, jonka he voivat testata uudelleen ja uudelleen nähdäkseen, pitävätkö se paikkansa muissa samanlaisissa tietokannoissa. Jos malli on riittävän vankka, jos se selittää kuvioita hyvin eikä ole ristiriidassa muiden testien kanssa, sitä voidaan jopa käyttää tulevien ilmiöiden ennustamiseen.
Data scientist ei yleensä kerää itse dataa kokeiden kautta. He eivät yleensä suunnittele kokeita, joissa on kontrolliryhmä ja kaksoissokkoutus, jotta voidaan löytää häiritseviä muuttujia, jotka voivat vaikuttaa hypoteesiin. Suurin osa dataa, jota data scientist analysoi, on saatu havaintotutkimuksista ja -järjestelmistä, mikä on tapa, jolla data scientistin työ voi poiketa perinteisen tutkijan työstä, joka suorittaa usein enemmän kokeita.
Sanotaan, että data scientist voi joutua tekemään jonkinlaista kokeilua, jota kutsutaan A/B-testiksi, jossa tehdään muutoksia järjestelmään, joka kerää dataa, ja tarkastellaan, miten datan kuvioita muutetaan.
Riippumatta käytetyistä menetelmistä ja työkaluista data science pyrkii lopulta parantamaan maailman ymmärrystä tekemällä järkeä datasta, ja data saadaan havainnoinnin ja kokeiden kautta. Data science on prosessi, jossa käytetään algoritmeja, tilastollisia periaatteita ja erilaisia työkaluja ja laitteita johtamaan oivalluksia datasta, oivalluksia, jotka auttavat meitä ymmärtämään maailman ympärillämme olevia kuvioita.
Mitä data scientistit tekevät?
Voit huomata, että mikä tahansa toiminta, joka sisältää datan analyysin tieteellisellä tavalla, voidaan kutsua data scienceksi, mikä on osa siitä, miksi data science -termin määrittely on niin hankalaa. Selventääksemme asiaa, tarkastellaan joitain toimintoja, joita data scientist voi tehdä päivittäin.

Data science yhdistää monia eri aloja ja erikoisaloja. Kuva: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)
Millä tahansa päivällä data scientist voi joutua tekemään seuraavia tehtäviä: luomaan data tallennus- ja hakujärjestelmän, luomaan data ETL (extract, transform, load) -putkijohtoja ja puhdistamaan dataa, käyttämään tilastollisia menetelmiä, luomaan data visualisointeja ja dashboard -raportteja, käyttämään tekoälyä ja koneoppimisen algoritmeja, antamaan suosituksia toimista datan perusteella.
Tarkastellaan yllä lueteltuja tehtäviä tarkemmin.
Data scientist voi joutua vastaanottamaan teknologioiden asennuksen, joita tarvitaan datan tallentamiseen ja hakemiseen, kiinnittäen huomiota sekä laitteistoon että ohjelmistoon. Henkilö, joka on vastuussa tästä asemasta, voidaan kutsua myös “Data Engineeriksi”. Joissakin yrityksissä nämä vastuut sisällytetään data scientistin rooliin. Data scientist voi myös joutua luomaan tai avustamaan ETL-pipeline -luomisessa. Data ei yleensä tule valmiina data scientistin tarpeisiin. Sen sijaan data tulee raakamuodossa datalähteestä, muunnetaan käyttökelpoiseen muotoon ja esikäsitellään (esim. standardisoidaan data, poistetaan redundanssit ja poistetaan vioittunut data).
Data science -tilastolliset menetelmät
Tilastojen soveltaminen on välttämätöntä, jotta datan tarkastelu ja tulkinta voidaan muuttaa oikeaksi tieteeksi. Tilastollisia menetelmiä käytetään merkityksellisten kuvioiden löytämiseen tietokannoista, ja data scientistin on oltava perehtynyt tilastollisiin käsitteisiin. Heidän on oltava kykeneviä erottamaan merkitykselliset korrelaatiot spurssisista korrelaatioista hallitsemalla häiritseviä muuttujia. Heidän on myös oltava tietoisia oikeista työkaluista, joita käytetään määrittämään, mitkä ominaisuudet tietokannassa ovat tärkeitä mallille / ennustevallalle. Data scientistin on oltava tietoinen, milloin käyttää regressio lähestymistapaa ja milloin luokittelulähestymistapaa, ja milloin pitää huolta otosarvon keskiarvosta ja milloin otosarvon mediaanista. Data scientist ei olisi tutkija ilman näitä tärkeitä taitoja.
Data visualisointi
Data scientistin työn tärkeä osa on tuloksien viestintä muille. Jos data scientist ei voi viestiä tuloksiaan muille, niin tuloksien vaikutukset eivät merkitse mitään. Data scientistin on oltava myös tehokas kertomuksen kertoja. Tämä tarkoittaa visualisointien tuottamista, jotka viestivät tärkeitä kohtia tietokannasta ja siinä havaituista kuvioista. On suuri määrä erilaisia data visualisointityökaluja, joita data scientist voi käyttää, ja he voivat visualisoida dataa alkuvaiheen perustutkimiseksi (exploratory data analysis) tai visualisoida mallin tuottamia tuloksia.
Suositukset ja liiketoimintasovellukset
Data scientistin on oltava jonkinlaista intuitiota organisaationsa tai liiketoimintansa vaatimuksista ja tavoitteista. Data scientistin on oltava tietoinen näistä asioista, koska heidän on oltava tietoisia siitä, mitä muuttujia ja ominaisuuksia heidän on analysoitava, etsimällä kuvioita, jotka auttavat heidän organisaatiotaan saavuttamaan tavoitteensa. Data scientistien on oltava tietoisia rajoituksista, joiden alaisuudessa he toimivat, ja oletuksista, joita organisaation johto tekee.
Machine Learning ja tekoäly
Machine Learning ja muut tekoälyalgoritmit ja -mallit ovat työkaluja, joita data scientistit käyttävät datan analysointiin, kuvioitten löytämiseen datassa, suhteiden määrittämiseen muuttujien välillä ja tulevien tapahtumien ennustamiseen.
Perinteinen data science vs. Big Data Science
Kun datakeruumenetelmät ovat kehittyneet ja tietokannat ovat kasvaneet, on syntynyt ero perinteisen data science – ja “big data” -tieteen välille.
Perinteinen data-analyysi ja data science tehdään kuvailevalla ja tutkimuksellisella analyysillä, pyrkien löytämään kuvioita ja analysoimaan projektien suorituskykyä. Perinteiset data-analyysimenetelmät keskittyvät usein vain menneisiin ja nykyisiin tietoihin. Data-analyytikot työskentelevät usein jo puhdistetun ja standardoidun datan kanssa, kun taas data scientistit työskentelevät usein monimutkaisen ja likaisen datan kanssa. Edistyneemmät data-analyysimenetelmät ja data science -tekniikat voidaan käyttää myös tulevien tapahtumien ennustamiseen, vaikka tämä on usein tehtävissä big data -menetelmin, koska ennustemallit vaativat usein suuria määriä dataa voidakseen rakentua luotettavasti.
“Big data” viittaa dataan, joka on liian suurta ja monimutkaista käsiteltäväksi perinteisin data-analyysi- ja data science -tekniikoin ja -työkaluin. Big dataa kerätään usein verkkopalustoista ja edistyneistä data-muunnostyökaluista, joita käytetään suurten datamäärien valmisteluun data science -tarkastelua varten. Koska yhä enemmän dataa kerätään jatkuvasti, data scientistin työssä on yhä enemmän mukana big data -analyysi.
Data Science -työkalut
Yleisiä data science -työkaluja ovat työkalut datan tallentamiseen, exploratory data analysis -tehtäviin, datan mallintamiseen, ETL:ään ja datan visualisointiin. Alustat kuten Amazon Web Services, Microsoft Azure ja Google Cloud tarjoavat työkaluja data scientisteille datan tallentamiseen, muuntamiseen, analysointiin ja mallintamiseen. On myös itsenäisiä data science -työkaluja, kuten Airflow (data-infrastruktuuri) ja Tableau (data visualisointi ja analyysi).
Koneoppimisen ja tekoälyalgoritmien osalta, joita käytetään datan mallintamiseen, ne tarjotaan usein data science -moduuleina ja -alustoina, kuten TensorFlow, PyTorch ja Azure Machine Learning -studio. Nämä alustat mahdollistavat data scientisteille datan muokkauksen, koneoppimisarkkitehtuurin suunnittelun ja koneoppimismallien kouluttamisen.
Muita yleisiä data science -työkaluja ja kirjastoja ovat SAS (tilastollinen mallinnus), Apache Spark (virtausdatan analyysi), D3.js (interaktiiviset visualisoinnit selaimessa) ja Jupyter (interaktiiviset, jaettavat koodipalikat ja visualisoinnit).

Kuva: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)
Data Science -esimerkkejä
Data science -sovelluksia ja -esimerkkejä on joka paikassa. Data science soveltuu kaikkeen, alkaen ruoasta, urheilusta, liikenteestä ja terveydestä. Data on joka paikassa, joten data science voidaan soveltaa kaikkeen.
Ruuan osalta Uber panostaa Uber Eats -ruokatoimitusjärjestelmään, joka tarvitsee datatieteen menetelmiä toimittaa ruoka ajallaan ja lämpimänä. Data scientisteilla on tärkeä rooli Uber Eats -järjestelmässä, jossa he käyttävät tilastollista mallinnusta, joka ottaa huomioon tekijät kuten etäisyydet ravintoloista toimituspisteisiin, lomaruhvat, ruoanvalmistusaika ja jopa sääolot, kaikki ottaen huomioon toimitusaikojen optimointi.
Urheilutilastoja käytetään joukkueenjohtajien valitsemaan parhaat pelaajat ja muodostamaan vahvat, luotettavat joukkueet, jotka voittavat pelejä. Yksi tunnettu esimerkki on data science -dokumentti, jonka Michael Lewis on kirjoittanut kirjassa Moneyball, jossa Oakland Athletics -joukkueen johtaja analysoi erilaisia tilastoja löytääkseen laadukkaita pelaajia, jotka voidaan palkata edullisesti.
Liikenteen kuvioiden analyysi on kriittinen itseajavien ajoneuvojen kehittämisessä. Itseajavat ajoneuvot tarvitsevat dataa ympäröivästä liikenteestä voidakseen ennustaa muutoksia tiellä ja reagoida niihin. Google Maps -sovellus analysoi liikenteen kuviota kertoakseen kuljettajille, kuinka kauan kestää päästä kohteeseen eri reiteillä ja liikennemuodoilla.
Terveydenhuollossa data science yhdistetään usein koneoppimiseen ja tekoälyyn luomaan kuvantunnistimia, jotka voivat tarkastella röntgenkuvia, magneettikuvaus- ja ultraääni- tutkimuksia etsimään mahdollisia terveydellisiä ongelmia.
Lopulta data science kattaa monia eri toimintoja ja yhdistää eri aloja. Data science on kuitenkin aina kiinnostunut kertomasta mielenkiintoisia tarinoita datasta ja käyttämästä dataa maailman ymmärtämiseen.












