AI-basisprincipes

Wat is Lineaire Regressie?

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Wat is Lineaire Regressie?

Lineaire regressie is een algoritme dat wordt gebruikt om een relatie tussen twee verschillende kenmerken/variabelen te voorspellen of te visualiseren. Bij lineaire regressietaken zijn er twee soorten variabelen die worden onderzocht: de afhankelijke variabele en de onafhankelijke variabele. De onafhankelijke variabele is de variabele die op zichzelf staat, niet beïnvloed door de andere variabele. Als de onafhankelijke variabele wordt aangepast, zullen de niveaus van de afhankelijke variabele fluctueren. De afhankelijke variabele is de variabele die wordt onderzocht en is wat het regressiemodel probeert te voorspellen. Bij lineaire regressietaken bestaat elke observatie/instance uit zowel de afhankelijke variabelewaarde als de onafhankelijke variabelewaarde.

Dat was een korte uitleg van lineaire regressie, maar laten we ervoor zorgen dat we een beter begrip van lineaire regressie krijgen door naar een voorbeeld te kijken en de formule die het gebruikt te onderzoeken.

Lineaire Regressie Begrijpen

Stel dat we een dataset hebben met harde schijfgroottes en de kosten van die harde schijven.

Latent ons aannemen dat de dataset waarover we beschikken uit twee verschillende kenmerken bestaat: de hoeveelheid geheugen en de kosten. Hoe meer geheugen we kopen voor een computer, hoe hoger de kosten van de aankoop. Als we de individuele datapunten op een scatterplot zouden uitzetten, zouden we mogelijk een grafiek krijgen die er ongeveer zo uitziet:

De exacte verhouding tussen geheugen en kosten kan variëren tussen fabrikanten en modellen van harde schijven, maar over het algemeen is de trend van de gegevens een die begint in de linkeronderhoek (waar harde schijven zowel goedkoop als klein zijn) en naar de rechterbovenhoek gaat (waar de schijven duurder en groter zijn).

Als we de hoeveelheid geheugen op de X-as en de kosten op de Y-as zouden zetten, zou een lijn die de relatie tussen de X- en Y-variabelen vastlegt, in de linkeronderhoek beginnen en naar de rechterbovenhoek gaan.

De functie van een regressiemodel is om een lineaire functie tussen de X- en Y-variabelen te bepalen die de relatie tussen de twee variabelen het beste beschrijft. Bij lineaire regressie wordt aangenomen dat Y kan worden berekend uit een combinatie van de invoervariabelen. De relatie tussen de invoervariabelen (X) en de doelvariabelen (Y) kan worden weergegeven door een lijn door de punten in de grafiek te trekken. De lijn vertegenwoordigt de functie die de relatie tussen X en Y het beste beschrijft. Het doel is om een optimale “regressielijn” te vinden, of de lijn/functie die de gegevens het beste past.

Lijnen worden meestal weergegeven door de vergelijking: Y = m*X + b. X verwijst naar de afhankelijke variabele, terwijl Y de onafhankelijke variabele is. Ondertussen is m de helling van de lijn, gedefinieerd door de “stijging” over de “loop”. Machine learning-praktijkmensen vertegenwoordigen de beroemde helling-lijnvergelijking op een iets andere manier, met behulp van deze vergelijking:

y(x) = w0 + w1 * x

In de bovenstaande vergelijking is y de doelvariabele, terwijl “w” de parameters van het model zijn en de invoer “x” is. Dus wordt de vergelijking gelezen als: “De functie die Y geeft, afhankelijk van X, is gelijk aan de parameters van het model vermenigvuldigd met de kenmerken”. De parameters van het model worden tijdens de training aangepast om de beste regressielijn te krijgen.

Meervoudige Lineaire Regressie

Foto: Cbaf via Wikimedia Commons, Publiek Domein (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)

Het bovenstaande proces is van toepassing op eenvoudige lineaire regressie, of regressie op datasets waarin slechts één kenmerk/onafhankelijke variabele aanwezig is. Een regressie kan echter ook worden uitgevoerd met meerdere kenmerken. In het geval van “meervoudige lineaire regressie” wordt de vergelijking uitgebreid met het aantal variabelen dat in de dataset wordt aangetroffen. Met andere woorden, terwijl de vergelijking voor gewone lineaire regressie y(x) = w0 + w1 * x is, zou de vergelijking voor meervoudige lineaire regressie y(x) = w0 + w1x1 plus de gewichten en invoeren voor de verschillende kenmerken zijn. Als we het totale aantal gewichten en kenmerken als w(n)x(n) vertegenwoordigen, kunnen we de formule als volgt weergeven:

y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)

Nadat de formule voor lineaire regressie is vastgesteld, gebruikt het machine learning-model verschillende waarden voor de gewichten, waardoor verschillende lijnen van fit ontstaan. Onthoud dat het doel is om de lijn te vinden die de gegevens het beste past, om te bepalen welke van de mogelijke gewichtcombinaties (en dus welke mogelijke lijn) de gegevens het beste past en de relatie tussen de variabelen verklaart.

Een kostfunctie wordt gebruikt om te meten hoe dicht de veronderstelde Y-waarden bij de werkelijke Y-waarden liggen wanneer een bepaalde gewichtswaarde wordt gegeven. De kostfunctie voor lineaire regressie is de gemiddelde kwadratische fout, die alleen de gemiddelde (gekwadrateerde) fout tussen de voorspelde waarde en de werkelijke waarde voor alle datapunten in de dataset neemt. De kostfunctie wordt gebruikt om een kost te berekenen, die het verschil tussen de voorspelde doelwaarde en de werkelijke doelwaarde vastlegt. Als de fit-lijn ver van de datapunten ligt, zal de kost hoger zijn, terwijl de kost kleiner wordt naarmate de lijn dichter bij de werkelijke relaties tussen variabelen komt. De gewichten van het model worden vervolgens aangepast totdat de gewichtconfiguratie die het kleinste aantal fouten oplevert, wordt gevonden.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.