Основы ИИ
Что такое линейная регрессия?
Что такое линейная регрессия?
Линейная регрессия – это алгоритм, используемый для прогнозирования или визуализации отношения между двумя различными признаками/переменными. В задачах линейной регрессии существует два типа переменных, которые изучаются: зависимая переменная и независимая переменная. Независимая переменная – это переменная, которая стоит самостоятельно, не затронутая другой переменной. Когда независимая переменная изменяется, уровни зависимой переменной будут колебаться. Зависимая переменная – это переменная, которая изучается, и это то, что модель регрессии решает/пытается предсказать. В задачах линейной регрессии каждое наблюдение/экземпляр состоит из обоих значений зависимой переменной и независимой переменной.
Это было быстрое объяснение линейной регрессии, но давайте убедимся, что мы лучше поймем линейную регрессию, рассмотрев пример ее и изучив формулу, которую она использует.
Понимание линейной регрессии
Предположим, что у нас есть набор данных, охватывающий размеры жестких дисков и стоимость этих жестких дисков.
Давайте предположим, что наш набор данных состоит из двух различных признаков: количество памяти и стоимость. Чем больше памяти мы покупаем для компьютера, тем больше растет стоимость покупки. Если мы изобразим отдельные точки данных на графике рассеяния, мы можем получить график, который выглядит примерно так:

Точное соотношение между памятью и стоимостью может варьироваться между производителями и моделями жестких дисков, но в целом тенденция данных – это та, которая начинается в нижнем левом углу (где жесткие диски дешевле и имеют меньшую емкость) и переходит в верхний правый угол (где диски более дорогие и имеют большую емкость).
Если бы мы имели количество памяти на оси X и стоимость на оси Y, линия, отражающая отношение между переменными X и Y, начала бы в нижнем левом углу и шла бы в верхний правый.

Функция модели регрессии – определить линейную функцию между переменными X и Y, которая лучше всего описывает отношение между двумя переменными. В линейной регрессии предполагается, что Y можно рассчитать из некоторой комбинации входных переменных. Отношение между входными переменными (X) и целевыми переменными (Y) можно изобразить, нарисовав линию через точки на графике. Линия представляет функцию, которая лучше всего описывает отношение между X и Y (например, для каждого увеличения X на 3, Y увеличивается на 2). Цель – найти оптимальную “регрессионную линию” или линию/функцию, которая лучше всего подходит к данным.
Линии обычно представляются уравнением: Y = m*X + b. X относится к зависимой переменной, а Y – к независимой переменной. Тем временем m – это наклон линии, определяемый как “рост” над “бегом”. Практики машинного обучения представляют знаменитое уравнение наклона линии немного иначе, используя это уравнение вместо этого:
y(x) = w0 + w1 * x
В этом уравнении y – это целевая переменная, а “w” – это параметры модели, а вход – “x”. Итак, уравнение читается как: “Функция, которая дает Y, в зависимости от X, равна параметрам модели, умноженным на входные данные”. Параметры модели корректируются во время обучения, чтобы получить лучшую регрессионную линию.
Множественная линейная регрессия

Фото: Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)
Процесс, описанный выше, применяется к простой линейной регрессии или регрессии на наборах данных, где есть только одна особенность/независимая переменная. Однако регрессию также можно выполнить с несколькими особенностями. В случае “множественной линейной регрессии” уравнение расширяется на количество переменных, найденных в наборе данных. Другими словами, хотя уравнение для обычной линейной регрессии имеет вид y(x) = w0 + w1 * x, уравнение для множественной линейной регрессии будет иметь вид y(x) = w0 + w1x1 плюс веса и входные данные для различных особенностей. Если мы представим общее количество весов и особенностей как w(n)x(n), то мы могли бы представить формулу так:
y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)
После установления формулы для линейной регрессии модель машинного обучения будет использовать различные значения для весов, рисуя различные линии подгонки. Помните, что цель – найти линию, которая лучше всего подходит к данным, чтобы определить, какая из возможных комбинаций весов (и, следовательно, какая возможная линия) лучше всего подходит к данным и объясняет отношение между переменными.
Функция стоимости используется для измерения того, насколько близки предполагаемые значения Y к фактическим значениям Y при заданном значении веса. Функция стоимости для линейной регрессии – это средняя квадратичная ошибка, которая просто берет среднюю (квадратичную) ошибку между прогнозируемым значением и истинным значением для всех точек данных в наборе данных. Функция стоимости используется для расчета стоимости, которая отражает разницу между прогнозируемым целевым значением и истинным целевым значением. Если линия подгонки далеко от точек данных, стоимость будет выше, а стоимость будет уменьшаться, когда линия приближается к отражению истинных отношений между переменными. Веса модели затем корректируются до тех пор, пока не будет найдена конфигурация весов, которая производит наименьшее количество ошибок.












