AI:n perusteet
MikÃĪ on Lineaari Regressio?
MikÃĪ on Lineaari Regressio?
Lineaari regressio on algoritmi, jota kÃĪytetÃĪÃĪn ennustamaan tai visualisoimaan suhdetta kahden eri ominaisuuden/muuttujan vÃĪlillÃĪ. Lineaari regressio tehtÃĪvissÃĪ on kaksi tyyppiÃĪ muuttujia, joita tutkitaan: riippuvainen muuttuja ja riippumaton muuttuja. Riippumaton muuttuja on muuttuja, joka on itsenÃĪinen eikÃĪ ole vaikuttunut toiseen muuttujaan. Kun riippumatonta muuttujaa sÃĪÃĪtellÃĪÃĪn, riippuvan muuttujan tasot vaihtelevat. Riippuvainen muuttuja on muuttuja, jota tutkitaan, ja se on se, mihin regressiomalli pyrkii ratkaisemaan tai ennustamaan. Lineaari regressio tehtÃĪvissÃĪ jokainen havainto/esiintymÃĪ koostuu sekÃĪ riippuvan muuttujan arvosta ettÃĪ riippumattoman muuttujan arvosta.
TÃĪmÃĪ oli nopea selitys lineaari regressiosta, mutta varmistetaan, ettÃĪ saadaan parempi ymmÃĪrrys lineaari regressiosta tarkastelemalla esimerkkiÃĪ siitÃĪ ja tutkimalla kaavaa, jota se kÃĪyttÃĪÃĪ.
YmmÃĪrtÃĪminen Lineaari Regressio
Oletetaan, ettÃĪ meillÃĪ on tietokanta, joka kattaa kiintolevyjen koot ja niiden hinnat.
Oletetaan, ettÃĪ meillÃĪ on tietokanta, joka koostuu kahdesta eri ominaisuudesta: muistin mÃĪÃĪrÃĪstÃĪ ja kustannuksista. MitÃĪ enemmÃĪn muistia ostetaan tietokoneeseen, sitÃĪ enemmÃĪn ostoksen hinta nousee. Jos piirrettÃĪisiin yksittÃĪiset datapisteet pisteettÃĪessÃĪ, saataisiin graafi, joka nÃĪyttÃĪÃĪ jotain tÃĪltÃĪ:

Tarkan muisti-kustannus-suhteen voi vaihdella valmistajien ja kiintolevyjen mallejen mukaan, mutta yleisesti ottaen datan trendi on sellainen, joka alkaa alhaalta vasemmasta (missÃĪ kiintolevyt ovat sekÃĪ halvempia ettÃĪ pienempiÃĪ) ja siirtyy ylÃĪoikealle (missÃĪ aseet ovat kalliimpia ja suurempia).
Jos asetettaisiin muisti akseleille ja kustannukset Y-akselelle, lineaari suhde X- ja Y-muuttujien vÃĪlillÃĪ olisi linea, joka alkaa alhaalta vasemmasta ja kulkee ylÃĪoikealle.

Regressiomallin tehtÃĪvÃĪ on mÃĪÃĪrittÃĪÃĪ lineaarinen funktio X- ja Y-muuttujien vÃĪlillÃĪ, joka parhaiten kuvaa suhdetta kahden muuttujan vÃĪlillÃĪ. Lineaari regressiossa oletetaan, ettÃĪ Y voidaan laskea jostakin syÃķtemuuttujien yhdistelmÃĪstÃĪ. Suhteen X- (syÃķte-) ja Y- (kohde-) muuttujien vÃĪlillÃĪ voidaan havainnollistaa piirtÃĪmÃĪllÃĪ linea datapisteiden lÃĪpi. Linja edustaa funktiota, joka parhaiten kuvaa suhdetta X:n ja Y:n vÃĪlillÃĪ (esim. jokaisen X:n kasvun aikana Y kasvaa 2). Tavoitteena on lÃķytÃĪÃĪ optimaalinen âregressio linjaâ eli linja/funktio, joka parhaiten sopii dataan.
Linjoja edustetaan yleensÃĪ kaavalla: Y = m * X + b. X viittaa riippumattomaan muuttujaan, kun taas Y on riippuvainen muuttuja. Samalla m on linjan kulma, mÃĪÃĪritelty ânousunâ ja âjuoksunâ suhteen. Koneoppimisen harjoittajat edustavat kuuluisaa kulma-linjan kaavaa hieman eri tavalla, kÃĪyttÃĪen tÃĪtÃĪ kaavaa sen sijaan:
y(x) = w0 + w1 * x
YllÃĪ olevassa kaavassa y on kohde-muuttuja, kun taas âwâ on mallin parametreja ja syÃķte on âxâ. Kaava luetaan: âFunktio, joka antaa Y:n riippuen X:stÃĪ, on yhtÃĪ suuri kuin mallin parametreja kerrottuna ominaisuuksillaâ. Mallin parametreja sÃĪÃĪtellÃĪÃĪn koulutuksen aikana saadakseen parhaan sopivan regressio linjan.
Moniulotteinen Lineaari Regressio

Kuva: Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)
YllÃĪ kuvattu prosessi koskee yksinkertaista lineaarista regressiota eli regressiota, jossa on vain yksi ominaisuus/riippumaton muuttuja. Regressiota voidaan kuitenkin tehdÃĪ myÃķs useiden ominaisuuksien kanssa. Moniulotteisessa lineaarisessa regressiossa kaava laajenee lÃķydettyjen muuttujien mÃĪÃĪrÃĪllÃĪ. Toisin sanoen, kun yksinkertaisen lineaarisen regressio kaava on y(x) = w0 + w1 * x, moniulotteisen lineaarisen regressio kaava olisi y(x) = w0 + w1x1 plussa painot ja syÃķtteet eri ominaisuuksille. Jos edustamme kaikkien painojen ja ominaisuuksien yhteistÃĪ mÃĪÃĪrÃĪÃĪ w(n)x(n):na, voimme esittÃĪÃĪ kaavan seuraavasti:
y(x) = w0 + w1x1 + w2x2 + âĶ + w(n)x(n)
Lineaarisessa regressio kaavan mÃĪÃĪrittÃĪmisen jÃĪlkeen koneoppimismalli kÃĪyttÃĪÃĪ eri arvoja painoille ja piirtÃĪÃĪ eri sovite linjoja. Muista, ettÃĪ tavoitteena on lÃķytÃĪÃĪ linja, joka parhaiten sopii dataan, jotta voidaan mÃĪÃĪrittÃĪÃĪ, mikÃĪ mahdollinen painojen yhdistelmÃĪ (ja siten mikÃĪ mahdollinen linja) sopii parhaiten dataan ja selittÃĪÃĪ muuttujien vÃĪlisen suhteen.
Kustannusfunktiota kÃĪytetÃĪÃĪn mittaamaan, kuinka lÃĪhellÃĪ oletetut Y-arvot ovat todellisista Y-arvoista annetulla painoarvolla. Lineaarisessa regressiossa kustannusfunktioksi kÃĪytetÃĪÃĪn keskineliÃķvirhettÃĪ, joka laskee keskimÃĪÃĪrÃĪisen (neliÃķitetyn) virheen ennustetun arvon ja todellisen arvon vÃĪlillÃĪ kaikissa datapisteissÃĪ. Kustannusfunktiota kÃĪytetÃĪÃĪn laskea kustannus, joka havainnollistaa ennustetun kohdearvon ja todellisen kohdearvon vÃĪlisen eron. Jos sovite linja on kaukana datapisteistÃĪ, kustannus on suurempi, kun taas kustannus pienenee, kun linja lÃĪhestyy datapisteiden vÃĪlisen suhteen havainnollistamista. Mallin painot sÃĪÃĪtellÃĪÃĪn, kunnes lÃķydetÃĪÃĪn painojen konfiguraatio, joka tuottaa pienimmÃĪn mÃĪÃĪrÃĪn virhettÃĪ.












