Модели и платформы ИИ
Простая линейная регрессия в области науки о данных
Наука о данных – это обширная область, которая растет с каждым днем. Сегодня ведущие компании ищут профессиональных специалистов по науке о данных, обладающих глубокими знаниями об этой области и ее связанных концепциях. Чтобы хорошо работать в этой области, важно иметь прочные знания обо всех алгоритмах науки о данных. Одним из наиболее基本ных алгоритмов науки о данных является простая линейная регрессия. Каждый специалист по науке о данными должен уметь использовать этот алгоритм для решения проблем и получения осмысленных результатов.
Простая линейная регрессия – это методология определения отношения между входными и выходными переменными. Входные переменные считаются независимыми переменными или предикторами, а выходные переменные – зависимыми переменными или ответами. В простой линейной регрессии учитывается только одна входная переменная.
Реальный пример простой линейной регрессии
Рассмотрим набор данных, состоящий из двух параметров: количество отработанных часов и количество выполненной работы. Простая линейная регрессия стремится угадать количество выполненной работы, если известно количество отработанных часов. Строится регрессионная линия, которая генерирует минимальную ошибку. Также формируется линейное уравнение, которое можно использовать для几乎 любого набора данных.
Принципы, которые изображают цель простой линейной регрессии:
Простая линейная регрессия используется для прогнозирования отношения между переменными в наборе данных и получения осмысленных выводов. Простая линейная регрессия в основном используется для получения статистического отношения между переменными, которое не достаточно точное. Четыре основных принципа изображают использование простой линейной регрессии. Эти принципы перечислены ниже:
- Отношение между двумя переменными считается линейным и аддитивным: Установлена прямая функция для каждой пары зависимых и независимых переменных. Наклон этой линии отличается от значений переменных, имеющихся в наборе данных. Зависимые переменные имеют аддитивное воздействие на значения независимых переменных.
- Ошибки статистически независимы: Этот принцип можно рассматривать для набора данных, содержащего информацию, связанную с временем и серией. Последовательные ошибки такого набора данных не коррелируют и являются статистически независимыми.
- Ошибки имеют постоянную дисперсию (гомоскедастичность): Гомоскедастичность ошибок можно рассматривать на основе различных параметров. Эти параметры включают время, другие прогнозы и другие переменные.
- Нормальность распределения ошибок: Это важный принцип, поскольку он поддерживает другие три упомянутых выше. Если между переменными в наборе данных не может быть установлено отношение, или если любой из вышеуказанных принципов не установлен, то все прогнозы и выводы, полученные моделью, неверны. Эти выводы не могут быть использованы дальше в проекте, поскольку не будут получены реальные результаты, если используются неправильные и вводящие в заблуждение данные.
Преимущества простой линейной регрессии
- Эта методология чрезвычайно проста в использовании, и результаты можно получить легко.
- Этот метод имеет чрезвычайно меньшую сложность по сравнению с другими алгоритмами науки о данных, особенно если отношение между зависимыми и независимыми переменными известно.
- Переобучение – это распространенная проблема, которая возникает, когда эта методология принимает бессмысленную информацию. Чтобы решить эту проблему, доступен метод регуляризации, который уменьшает проблему переобучения, уменьшая сложность.
Недостатки простой линейной регрессии
- Хотя проблема переобучения может быть устранена, ее нельзя игнорировать. Метод может принять бессмысленные данные и также устранить осмысленную информацию. В таком случае все прогнозы и выводы о конкретном наборе данных будут неверными и неэффективными.
- Проблема выбросов данных также очень распространена. Выбросы считаются неправильными значениями, которые не соответствуют точным данным. Когда такие значения учитываются, вся модель будет производить вводящие в заблуждение результаты, которые бесполезны.
- В простой линейной регрессии набор данных считается независимым. Это предположение неверно, поскольку между переменными может быть некоторая зависимость.
Простая линейная регрессия – это полезная техника для определения отношений между входными и выходными переменными в наборе данных. Существует несколько реальных применений простой линейной регрессии. Этот алгоритм не требует высокой вычислительной мощности и может быть легко реализован. Уравнения и выводы, полученные из него, могут быть использованы для дальнейшего построения и являются чрезвычайно простыми для понимания. Однако некоторые профессионалы также считают, что простая линейная регрессия не является правильной методологией для использования в различных приложениях, поскольку существует много предположений, которые делаются. Эти предположения могут быть доказаны неверными. Поэтому необходимо использовать эту технику там, где она может быть правильно применена.












