Fondamenti di IA

Che cos’è la Regressione Lineare?

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Che cos’è la Regressione Lineare?

La regressione lineare è un algoritmo utilizzato per prevedere o visualizzare una relazione tra due diverse caratteristiche/variabili. Nei compiti di regressione lineare, ci sono due tipi di variabili esaminate: la variabile dipendente e la variabile indipendente. La variabile indipendente è la variabile che sta da sola, non influenzata dall’altra variabile. Mentre la variabile indipendente viene regolata, i livelli della variabile dipendente fluttueranno. La variabile dipendente è la variabile che viene studiata e che il modello di regressione risolve o cerca di prevedere. Nei compiti di regressione lineare, ogni osservazione/istanza è composta da entrambi i valori della variabile dipendente e della variabile indipendente.

Questo è stato un rapido spiegazione della regressione lineare, ma assicuriamoci di capire meglio la regressione lineare esaminando un esempio e il formula che utilizza.

Comprensione della Regressione Lineare

Supponiamo di avere un set di dati che copre le dimensioni dei dischi rigidi e il costo di quei dischi rigidi.

Supponiamo che il set di dati che abbiamo sia composto da due caratteristiche diverse: la quantità di memoria e il costo. Più memoria acquistiamo per un computer, più aumenta il costo dell’acquisto. Se tracciassimo i singoli punti di dati su un grafico a dispersione, potremmo ottenere un grafico che assomiglia a questo:

La precisa relazione tra la memoria e il costo potrebbe variare tra i produttori e i modelli di dischi rigidi, ma in generale, la tendenza dei dati è una che inizia in basso a sinistra (dove i dischi rigidi sono più economici e hanno una capacità inferiore) e si sposta verso l’alto a destra (dove i dischi rigidi sono più costosi e hanno una capacità superiore).

Se avessimo la quantità di memoria sull’asse X e il costo sull’asse Y, una linea che cattura la relazione tra le variabili X e Y inizierebbe nell’angolo inferiore sinistro e si estenderebbe verso l’alto a destra.

La funzione di un modello di regressione è determinare una funzione lineare tra le variabili X e Y che descriva meglio la relazione tra le due variabili. Nella regressione lineare, si suppone che Y possa essere calcolato da una combinazione delle variabili di input. La relazione tra le variabili di input (X) e le variabili di destinazione (Y) può essere rappresentata disegnando una linea attraverso i punti del grafico. La linea rappresenta la funzione che meglio descrive la relazione tra X e Y (ad esempio, per ogni aumento di X di 3, Y aumenta di 2). L’obiettivo è trovare una “linea di regressione” ottimale, o la linea/funzione che meglio si adatta ai dati.

Le linee sono solitamente rappresentate dall’equazione: Y = m*X + b. X si riferisce alla variabile dipendente, mentre Y è la variabile indipendente. Nel frattempo, m è la pendenza della linea, definita come il “risultato” sul “percorso”. I praticanti di apprendimento automatico rappresentano l’equazione della pendenza della linea in modo leggermente diverso, utilizzando questa equazione invece:

y(x) = w0 + w1 * x

Nell’equazione sopra, y è la variabile di destinazione, mentre “w” sono i parametri del modello e l’input è “x”. Quindi l’equazione si legge come: “La funzione che fornisce Y, in base a X, è uguale ai parametri del modello moltiplicati per le caratteristiche”. I parametri del modello vengono regolati durante l’addestramento per ottenere la linea di regressione migliore.

Regressione Lineare Multipla

Foto: Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)

Il processo descritto sopra si applica alla regressione lineare semplice, o alla regressione sui set di dati in cui c’è solo una caratteristica/variabile indipendente. Tuttavia, una regressione può anche essere eseguita con più caratteristiche. Nel caso della “regressione lineare multipla“, l’equazione viene estesa dal numero di variabili presenti nel set di dati. In altre parole, mentre l’equazione per la regressione lineare regolare è y(x) = w0 + w1 * x, l’equazione per la regressione lineare multipla sarebbe y(x) = w0 + w1x1 più i pesi e gli input per le varie caratteristiche. Se rappresentiamo il numero totale di pesi e caratteristiche come w(n)x(n), potremmo rappresentare la formula in questo modo:

y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)

Dopo aver stabilito la formula per la regressione lineare, il modello di apprendimento automatico utilizzerà diversi valori per i pesi, disegnando diverse linee di adattamento. Ricordate che l’obiettivo è trovare la linea che meglio si adatta ai dati per determinare quale delle possibili combinazioni di pesi (e quindi quale possibile linea) si adatta meglio ai dati e spiega la relazione tra le variabili.

Una funzione di costo viene utilizzata per misurare quanto vicini sono i valori Y assunti ai valori Y effettivi quando viene fornito un particolare valore di peso. La funzione di costo per la regressione lineare è l’errore quadratico medio, che prende semplicemente la media (errore quadratico) tra il valore previsto e il valore effettivo per tutti i punti di dati nel set di dati. La funzione di costo viene utilizzata per calcolare un costo, che cattura la differenza tra il valore di destinazione previsto e il valore di destinazione effettivo. Se la linea di adattamento è lontana dai punti di dati, il costo sarà più alto, mentre il costo diventerà più piccolo man mano che la linea si avvicina a catturare le relazioni vere tra le variabili. I pesi del modello vengono quindi regolati fino a quando non si trova la configurazione di peso che produce la quantità minima di errore.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.