Fundamentos de la IA
¿Qué es la Regresión Lineal?
¿Qué es la Regresión Lineal?
La regresión lineal es un algoritmo utilizado para predecir o visualizar una relación entre dos características/variables diferentes. En las tareas de regresión lineal, hay dos tipos de variables que se examinan: la variable dependiente y la variable independiente. La variable independiente es la variable que se mantiene por sí sola, sin ser afectada por la otra variable. A medida que se ajusta la variable independiente, los niveles de la variable dependiente fluctuarán. La variable dependiente es la variable que se está estudiando, y es lo que el modelo de regresión resuelve o intenta predecir. En las tareas de regresión lineal, cada observación/instancia consta de ambos valores de la variable dependiente y la variable independiente.
Esa fue una explicación rápida de la regresión lineal, pero asegurémonos de entender mejor la regresión lineal examinando un ejemplo de ella y examinando la fórmula que utiliza.
Entendiendo la Regresión Lineal
Supongamos que tenemos un conjunto de datos que cubre los tamaños de los discos duros y el costo de esos discos duros.
Supongamos que el conjunto de datos que tenemos consta de dos características diferentes: la cantidad de memoria y el costo. Cuanto más memoria compramos para una computadora, más aumenta el costo de la compra. Si trazamos los puntos de datos individuales en un gráfico de dispersión, podríamos obtener un gráfico que se parece a esto:

La relación exacta entre la memoria y el costo puede variar entre fabricantes y modelos de disco duro, pero en general, la tendencia de los datos es una que comienza en la esquina inferior izquierda (donde los discos duros son más baratos y tienen menor capacidad) y se mueve hacia la esquina superior derecha (donde los discos duros son más caros y tienen mayor capacidad).
Si tenemos la cantidad de memoria en el eje X y el costo en el eje Y, una línea que capture la relación entre las variables X e Y comenzaría en la esquina inferior izquierda y se extendería hacia la esquina superior derecha.

La función de un modelo de regresión es determinar una función lineal entre las variables X e Y que mejor describa la relación entre las dos variables. En la regresión lineal, se asume que Y se puede calcular a partir de alguna combinación de las variables de entrada. La relación entre las variables de entrada (X) y las variables de destino (Y) se puede representar dibujando una línea a través de los puntos en el gráfico. La línea representa la función que mejor describe la relación entre X e Y (por ejemplo, por cada vez que X aumenta en 3, Y aumenta en 2). El objetivo es encontrar una “línea de regresión” óptima, o la línea que mejor se ajusta a los datos.
Las líneas suelen representarse mediante la ecuación: Y = m*X + b. X se refiere a la variable dependiente, mientras que Y es la variable independiente. Mientras que m es la pendiente de la línea, definida por el “ascenso” sobre el “recorrido”. Los practicantes de aprendizaje automático representan la famosa ecuación de la pendiente de la línea de una manera ligeramente diferente, utilizando esta ecuación en su lugar:
y(x) = w0 + w1 * x
En la ecuación anterior, y es la variable de destino, mientras que “w” son los parámetros del modelo y la entrada es “x”. Entonces, la ecuación se lee como: “La función que da Y, dependiendo de X, es igual a los parámetros del modelo multiplicados por las características”. Los parámetros del modelo se ajustan durante el entrenamiento para obtener la línea de regresión que mejor se ajusta.
Regresión Lineal Múltiple

Foto: Cbaf a través de Wikimedia Commons, Dominio Público (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)
El proceso descrito anteriormente se aplica a la regresión lineal simple, o la regresión en conjuntos de datos donde solo hay una característica/variable independiente. Sin embargo, también se puede realizar una regresión con múltiples características. En el caso de la “regresión lineal múltiple“, la ecuación se extiende por el número de variables que se encuentran en el conjunto de datos. En otras palabras, mientras que la ecuación para la regresión lineal regular es y(x) = w0 + w1 * x, la ecuación para la regresión lineal múltiple sería y(x) = w0 + w1x1 más los pesos y las entradas para las diversas características. Si representamos el número total de pesos y características como w(n)x(n), entonces podríamos representar la fórmula de la siguiente manera:
y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)
Después de establecer la fórmula para la regresión lineal, el modelo de aprendizaje automático utilizará diferentes valores para los pesos, dibujando diferentes líneas de ajuste. Recuerde que el objetivo es encontrar la línea que mejor se ajusta a los datos para determinar cuál de las posibles combinaciones de pesos (y, por lo tanto, cuál de las posibles líneas) se ajusta mejor a los datos y explica la relación entre las variables.
Se utiliza una función de costo para medir qué tan cerca están los valores Y asumidos de los valores Y reales cuando se da un valor de peso particular. La función de costo para la regresión lineal es el error cuadrático medio, que simplemente toma el promedio (error cuadrado) entre el valor predicho y el valor real para todos los puntos de datos en el conjunto de datos. La función de costo se utiliza para calcular un costo, que captura la diferencia entre el valor de destino predicho y el valor de destino real. Si la línea de ajuste está lejos de los puntos de datos, el costo será mayor, mientras que el costo se volverá más pequeño cuanto más cerca esté la línea de capturar las relaciones reales entre las variables. Los pesos del modelo se ajustan hasta que se encuentra la configuración de pesos que produce la menor cantidad de error.












