Grunnleggende AI

Hva er lineÃĶr regresjon?

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Hva er lineÃĶr regresjon?

LineÃĶr regresjon er en algoritme som brukes til ÃĨ forutsi eller visualisere en relasjon mellom to forskjellige variabler. I lineÃĶr regresjon, er det to typer variabler som undersÃļkes: den avhengige variabel og den uavhengige variabel. Den uavhengige variabel er den variabelen som stÃĨr for seg selv, uten ÃĨ vÃĶre pÃĨvirket av den andre variabelen. NÃĨr den uavhengige variabelen justeres, vil nivÃĨet av den avhengige variabelen fluctuere. Den avhengige variabelen er den variabelen som studeres, og det er hva regresjonsmodellen lÃļser for eller forsÃļker ÃĨ forutsi. I lineÃĶr regresjon, bestÃĨr hver observasjon/eksempel av bÃĨde den avhengige variabelverdien og den uavhengige variabelverdien.

Dette var en kort forklaring av lineÃĶr regresjon, men la oss sikre at vi kommer til en bedre forstÃĨelse av lineÃĶr regresjon ved ÃĨ se pÃĨ et eksempel og undersÃļke formelen den bruker.

ForstÃĨ lineÃĶr regresjon

Anta at vi har en datasett som dekker harddisk-stÃļrrelser og kostnaden av disse harddiskene.

La oss anta at datasettene vÃĨre bestÃĨr av to forskjellige variabler: mengden minne og kostnad. Jo mer minne vi kjÃļper for en datamaskin, jo mer Ãļker kostnaden av kjÃļpet. Hvis vi plottet ut de enkelte datapunktene pÃĨ et spredningsdiagram, kunne vi fÃĨ et graf som ser ut sÃĨnn:

Den nÃļyaktige forholdet mellom minne og kostnad kan variere mellom produsenter og modeller av harddisker, men generelt sett er trenden i data en som starter i nedre venstre hjÃļrne (der harddisker er bÃĨde billigere og har mindre kapasitet) og beveger seg til Ãļvre hÃļyre (der harddiskene er dyrere og har hÃļyere kapasitet).

Hvis vi hadde mengden minne pÃĨ x-aksen og kostnaden pÃĨ y-aksen, ville en linje som fanger relasjonen mellom x- og y-variablene starte i nedre venstre hjÃļrne og lÃļpe til Ãļvre hÃļyre.

Funksjonen til en regresjonsmodell er ÃĨ bestemme en lineÃĶr funksjon mellom x- og y-variablene som best beskriver relasjonen mellom de to variablene. I lineÃĶr regresjon, antas det at y kan beregnes fra en kombinasjon av inndata-variablene. Relasjonen mellom inndata-variablene (x) og mÃĨl-variablene (y) kan portretteres ved ÃĨ tegne en linje gjennom punktene i grafen. Linjen representerer funksjonen som best beskriver relasjonen mellom x og y (for eksempel, for hvert punkt x Ãļker med 3, Ãļker y med 2). MÃĨlet er ÃĨ finne en optimal “regresjonslinje”, eller linjen/funksjonen som best passer til dataene.

Linjer blir vanligvis representert av ligningen: Y = m*X + b. X refererer til den avhengige variabelen, mens Y er den uavhengige variabelen. Mens m er linjens helning, definert som “stigning” over “lÃļp”. MaskinlÃĶringspraktikere representerer den berÃļmte helnings-ligningen pÃĨ en litt annen mÃĨte, ved ÃĨ bruke denne ligningen isteden:

y(x) = w0 + w1 * x

I ligningen over, er y mÃĨl-variabelen, mens “w” er modellens parametre og inndata er “x”. SÃĨ ligningen leses som: “Funksjonen som gir Y, avhengig av X, er lik modellens parametre multiplisert med funksjonene”. Modellens parametre justeres under trening for ÃĨ fÃĨ den beste tilpassede regresjonslinjen.

Flere lineÃĶr regresjon

Foto: Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)

Prosessen som er beskrevet over, gjelder for enkel lineÃĶr regresjon, eller regresjon pÃĨ datasett hvor det bare er en enkelt variabel/uavhengig variabel. Men en regresjon kan ogsÃĨ gjÃļres med flere variabler. I tilfelle “flere lineÃĶr regresjon“, utvides ligningen med antall variabler funnet i datasett. Med andre ord, mens ligningen for vanlig lineÃĶr regresjon er y(x) = w0 + w1 * x, ville ligningen for flere lineÃĶr regresjon vÃĶre y(x) = w0 + w1x1 pluss vektene og inndata for de forskjellige variablene. Hvis vi representerer det totale antall vekter og variabler som w(n)x(n), kunne vi representere formelen slik:

y(x) = w0 + w1x1 + w2x2 + â€Ķ + w(n)x(n)

Etter ÃĨ ha etablert formelen for lineÃĶr regresjon, vil maskinlÃĶringsmodellen bruke forskjellige verdier for vektene, og tegne forskjellige linjer for tilpasning. Husk at mÃĨlet er ÃĨ finne linjen som best passer til dataene for ÃĨ bestemme hvilken av de mulige vekt-kombinasjonene (og dermed hvilken mulig linje) best passer til dataene og forklarer relasjonen mellom variablene.

En kostnadsfunksjon brukes til ÃĨ mÃĨle hvor nÃĶre de antatte Y-verdiene er til de faktiske Y-verdiene nÃĨr en bestemt vektverdi gis. Kostnadsfunksjonen for lineÃĶr regresjon er gjennomsnittlig kvadratisk feil, som bare tar gjennomsnittet (kvadrert) feil mellom den forutsagte verdien og den sanne verdien for alle datapunktene i datasett. Kostnadsfunksjonen brukes til ÃĨ beregne en kostnad, som fanger forskjellen mellom den forutsagte mÃĨlverdien og den sanne mÃĨlverdien. Hvis tilpasningslinjen er langt fra datapunktene, vil kostnaden vÃĶre hÃļyere, mens kostnaden blir mindre jo nÃĶrmere linjen kommer til ÃĨ fange de sanne relasjonene mellom variablene. Vektene til modellen justeres deretter til den vekt-konfigurasjonen som produserer den minste feilen, blir funnet.

Blogger og programmerer med spesialomrÃĨder i Machine Learning og Deep Learning emner. Daniel hÃĨper ÃĨ hjelpe andre med ÃĨ bruke kraften av AI for sosialt godt.