GrundlÃĶggende AI

Hvad er LineÃĶr Regression?

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Hvad er LineÃĶr Regression?

LineÃĶr regression er en algoritme, der bruges til at forudsige eller visualisere en relation mellem to forskellige funktioner/variabler. I lineÃĶre regressionsopgaver er der to typer af variabler, der undersÃļges: den afhÃĶngige variabel og den uafhÃĶngige variabel. Den uafhÃĶngige variabel er den variabel, der stÃĨr alene, uden at vÃĶre pÃĨvirket af den anden variabel. NÃĨr den uafhÃĶngige variabel justeres, vil niveauerne af den afhÃĶngige variabel fluktuerere. Den afhÃĶngige variabel er den variabel, der undersÃļges, og det er, hvad regressionmodellen lÃļser for/forsÃļger at forudsige. I lineÃĶre regressionsopgaver bestÃĨr hver observation/eksempel af bÃĨde den afhÃĶngige variabelvÃĶrdi og den uafhÃĶngige variabelvÃĶrdi.

Det var en kort forklaring af lineÃĶr regression, men lad os sikre, at vi fÃĨr en bedre forstÃĨelse af lineÃĶr regression ved at se pÃĨ et eksempel pÃĨ det og undersÃļge formelen, som det bruger.

ForstÃĨ LineÃĶr Regression

Antag, at vi har en dataset, der dÃĶkker harddiskstÃļrrelser og omkostningerne ved disse harddiske.

Lad os antage, at datasettet vi har, bestÃĨr af to forskellige funktioner: mÃĶngden af hukommelse og omkostning. Jo mere hukommelse vi kÃļber til en computer, jo mere stiger omkostningerne ved kÃļbet. Hvis vi plottede de enkelte datapunkter pÃĨ et scatterplot, kunne vi mÃĨske fÃĨ et diagram, der ser ud sÃĨdan:

Den prÃĶcise hukommelse-til-omkostningsforhold kan variere mellem fabrikanter og modeller af harddiske, men generelt er trenden i data en, der starter i venstre nedre hjÃļrne (hvor harddiske er bÃĨde billigere og har mindre kapacitet) og bevÃĶger sig til hÃļjre Ãļverste hjÃļrne (hvor diske er mere dyre og har hÃļjere kapacitet).

Hvis vi havde mÃĶngden af hukommelse pÃĨ x-aksen og omkostning pÃĨ y-aksen, ville en linje, der fanger relationen mellem x- og y-variablerne, starte i venstre nedre hjÃļrne og lÃļbe til hÃļjre Ãļverste hjÃļrne.

FormÃĨlet med en regressionmodel er at bestemme en lineÃĶr funktion mellem x- og y-variablerne, der bedst beskriver relationen mellem de to variabler. I lineÃĶr regression antages det, at y kan beregnes fra en kombination af inputvariablerne. Relationen mellem inputvariablerne (x) og mÃĨlvariablerne (y) kan portrÃĶtteres ved at tegne en linje gennem punkterne i grafen. Linjen reprÃĶsenterer den funktion, der bedst beskriver relationen mellem x og y (f.eks. for hvert niveau, x Ãļger med 3, Ãļger y med 2). MÃĨlet er at finde en optimal “regressionslinje” eller den linje/funktion, der bedst passer til data.

Linjer reprÃĶsenteres typisk ved ligningen: Y = m*X + b. X henviser til den afhÃĶngige variabel, mens Y er den uafhÃĶngige variabel. Imens er m linjens hÃĶldning, som defineres af “stigning” over “lÃļb”. MaskinlÃĶringspraktikere reprÃĶsenterer den berÃļmte hÃĶldnings-linje-ligning lidt anderledes, ved at bruge denne ligning i stedet:

y(x) = w0 + w1 * x

I ovenstÃĨende ligning er y mÃĨlvariablen, mens “w” er modellens parametre, og input er “x”. SÃĨ ligningen lÃĶses som: “Funktionen, der giver Y, afhÃĶngigt af X, er lig med modellens parametre multipliceret med funktionerne”. Modellens parametre justeres under trÃĶning for at fÃĨ den bedste tilpasningsregressionslinje.

Flervariabel LineÃĶr Regression

Foto: Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)

Processen beskrevet ovenfor gÃĶlder for simpel lineÃĶr regression eller regression pÃĨ datasets, hvor der kun er en enkelt funktion/uafhÃĶngig variabel. Men en regression kan ogsÃĨ udfÃļres med multiple funktioner. I tilfÃĶldet af “flervariabel lineÃĶr regression” udvides ligningen med antallet af variabler i datasettet. Med andre ord, mens ligningen for almindelig lineÃĶr regression er y(x) = w0 + w1 * x, ville ligningen for flervariabel lineÃĶr regression vÃĶre y(x) = w0 + w1x1 plus vÃĶgt og input for de forskellige funktioner. Hvis vi reprÃĶsenterer det totale antal vÃĶgte og funktioner som w(n)x(n), kunne vi reprÃĶsentere formelen sÃĨdan:

y(x) = w0 + w1x1 + w2x2 + â€Ķ + w(n)x(n)

Efter at have etableret formelen for lineÃĶr regression, vil maskinlÃĶringsmodellen bruge forskellige vÃĶrdier for vÃĶgtene og tegne forskellige linjer for tilpasning. Husk, at mÃĨlet er at finde den linje, der bedst passer til data for at bestemme, hvilken af de mulige vÃĶgtkombinationer (og dermed hvilken mulig linje) bedst passer til data og forklarer relationen mellem variablerne.

En kostfunktion bruges til at mÃĨle, hvor tÃĶt de antagede y-vÃĶrdier er pÃĨ de faktiske y-vÃĶrdier, nÃĨr der gives en bestemt vÃĶgtvÃĶrdi. Kostfunktionen for lineÃĶr regression er gennemsnitlig kvadratisk fejl, der blot tager gennemsnittet (kvadreret) fejl mellem den forudsagte vÃĶrdi og den sande vÃĶrdi for alle datapunkter i datasettet. Kostfunktionen bruges til at beregne en kost, der fanger forskellen mellem den forudsagte mÃĨlvÃĶrdi og den sande mÃĨlvÃĶrdi. Hvis tilpasningslinjen er langt fra datapunkterne, vil kosten vÃĶre hÃļjere, mens kosten vil blive mindre, jo tÃĶttere linjen kommer pÃĨ at fange den sande relation mellem variablerne. VÃĶgtene af modellen justeres herefter, indtil vÃĶgtkonfigurationen, der producerer den mindste fejl, er fundet.

Blogger og programmÃļr med specialer i Machine Learning og Deep Learning emner. Daniel hÃĨber at hjÃĶlpe andre med at bruge AI's kraft til sociale formÃĨl.