Fondamentaux de l’IA

Qu’est-ce que la régression linéaire ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Qu’est-ce que la régression linéaire ?

La régression linéaire est un algorithme utilisé pour prédire ou visualiser une relation entre deux caractéristiques/variables différentes. Dans les tâches de régression linéaire, il existe deux types de variables examinées : la variable dépendante et la variable indépendante. La variable indépendante est la variable qui se tient seule, sans être affectée par l’autre variable. Lorsque la variable indépendante est ajustée, les niveaux de la variable dépendante fluctueront. La variable dépendante est la variable qui est étudiée, et c’est ce que le modèle de régression résout ou tente de prédire. Dans les tâches de régression linéaire, chaque observation/instance est composée à la fois de la valeur de la variable dépendante et de la valeur de la variable indépendante.

C’était une explication rapide de la régression linéaire, mais assurons-nous de mieux comprendre la régression linéaire en examinant un exemple et en examinant la formule qu’elle utilise.

Comprendre la régression linéaire

Supposons que nous avons un ensemble de données couvrant les tailles de disque dur et le coût de ces disques durs.

Supposons que l’ensemble de données que nous avons est composé de deux caractéristiques différentes : la quantité de mémoire et le coût. Plus nous achetons de mémoire pour un ordinateur, plus le coût de l’achat augmente. Si nous traçons les points de données individuels sur un graphique de dispersion, nous pourrions obtenir un graphique qui ressemble à ceci :

Le rapport exact entre la mémoire et le coût peut varier entre les fabricants et les modèles de disque dur, mais en général, la tendance des données est celle qui commence en bas à gauche (où les disques durs sont à la fois moins chers et ont une capacité plus petite) et se déplace vers le haut à droite (où les disques sont plus chers et ont une capacité plus élevée).

Si nous avions la quantité de mémoire sur l’axe des X et le coût sur l’axe des Y, une ligne capturant la relation entre les variables X et Y commencerait dans le coin inférieur gauche et se dirigerait vers le coin supérieur droit.

La fonction d’un modèle de régression est de déterminer une fonction linéaire entre les variables X et Y qui décrit le mieux la relation entre les deux variables. Dans la régression linéaire, on suppose que Y peut être calculé à partir d’une combinaison des variables d’entrée. La relation entre les variables d’entrée (X) et les variables cibles (Y) peut être représentée en traçant une ligne à travers les points du graphique. La ligne représente la fonction qui décrit le mieux la relation entre X et Y (par exemple, pour chaque fois que X augmente de 3, Y augmente de 2). L’objectif est de trouver une ligne de régression optimale, ou la ligne/fonction qui correspond le mieux aux données.

Les lignes sont généralement représentées par l’équation : Y = m*X + b. X fait référence à la variable dépendante tandis que Y est la variable indépendante. Pendant ce temps, m est la pente de la ligne, définie par la « montée » sur la « course ». Les praticiens de l’apprentissage automatique représentent l’équation de la pente de la ligne de manière légèrement différente, en utilisant cette équation à la place :

y(x) = w0 + w1 * x

Dans l’équation ci-dessus, y est la variable cible tandis que « w » est le paramètre du modèle et l’entrée est « x ». L’équation se lit donc : « La fonction qui donne Y, en fonction de X, est égale aux paramètres du modèle multipliés par les fonctionnalités ». Les paramètres du modèle sont ajustés pendant la formation pour obtenir la ligne de régression la plus adaptée.

Régression linéaire multiple

Photo : Cbaf via Wikimedia Commons, Domaine public (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)

Le processus décrit ci-dessus s’applique à la régression linéaire simple, ou à la régression sur des ensembles de données où il n’y a qu’une seule caractéristique/variable indépendante. Cependant, une régression peut également être effectuée avec plusieurs caractéristiques. Dans le cas de la « régression linéaire multiple », l’équation est étendue par le nombre de variables trouvées dans l’ensemble de données. En d’autres termes, alors que l’équation pour la régression linéaire régulière est y(x) = w0 + w1 * x, l’équation pour la régression linéaire multiple serait y(x) = w0 + w1x1 plus les poids et les entrées pour les différentes fonctionnalités. Si nous représentons le nombre total de poids et de fonctionnalités comme w(n)x(n), nous pourrions représenter la formule comme suit :

y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)

Après avoir établi la formule pour la régression linéaire, le modèle d’apprentissage automatique utilisera différentes valeurs pour les poids, traçant différentes lignes d’ajustement. Rappelez-vous que l’objectif est de trouver la ligne qui correspond le mieux aux données afin de déterminer laquelle des combinaisons de poids possibles (et donc laquelle des lignes possibles) correspond le mieux aux données et explique la relation entre les variables.

Une fonction de coût est utilisée pour mesurer à quel point les valeurs Y supposées sont proches des valeurs Y réelles lorsqu’une valeur de poids particulière est donnée. La fonction de coût pour la régression linéaire est l’erreur quadratique moyenne, qui prend simplement la moyenne (erreur au carré) entre la valeur prédite et la valeur réelle pour tous les points de données de l’ensemble de données. La fonction de coût est utilisée pour calculer un coût, qui capture la différence entre la valeur cible prédite et la valeur cible réelle. Si la ligne d’ajustement est loin des points de données, le coût sera plus élevé, tandis que le coût deviendra plus petit à mesure que la ligne se rapproche de la capture des relations réelles entre les variables. Les poids du modèle sont alors ajustés jusqu’à ce que la configuration de poids qui produit la plus petite quantité d’erreur soit trouvée.

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.