AI 기초

선형 회귀 분석이란?

mm
Unite.AI를 Google의 선호 소스에 추가

선형 회귀 분석이란?

선형 회귀 분석은 두 개의 다른 특성/변수 간의 관계를 예측하거나 시각화하는 데 사용되는 알고리즘입니다. 선형 회귀 분석 작업에서 두 종류의 변수가 검토됩니다. 독립 변수와 종속 변수입니다. 독립 변수는 다른 변수에 영향을 받지 않는 변수입니다. 독립 변수를 조정하면 종속 변수의 수준이 변동합니다. 종속 변수는 연구 대상 변수이며 회귀 모델이 해결하거나 예측하려고 하는 변수입니다. 선형 회귀 분석 작업에서 모든 관찰/인스턴스는 종속 변수 값과 독립 변수 값으로 구성됩니다.

선형 회귀 분석에 대한 간단한 설명이었습니다. 그러나 선형 회귀 분석을 더 잘 이해하기 위해 예를 살펴보고 사용하는 수식을 살펴보겠습니다.

선형 회귀 분석 이해

하드 드라이브 크기와 해당 하드 드라이브의 비용을 다루는 데이터 세트를 있다고 가정해 보겠습니다.

데이터 세트가 두 가지 특성으로 구성되어 있다고 가정해 보겠습니다. 메모리 양과 비용입니다. 컴퓨터에 더 많은 메모리를 구매할수록 구매 비용이 증가합니다. 개별 데이터 포인트를 산점도에 플로팅하면 다음과 같은 그래프가 나올 수 있습니다.

정확한 메모리-비용 비율은 제조업체와 하드 드라이브 모델에 따라 다를 수 있지만 일반적으로 데이터의 경향은 하드 드라이브가 더 저렴하고 용량이 작은 하드 드라이브에서 시작하여 더 비싼 하드 드라이브와 용량이 큰 하드 드라이브로 이동하는 것입니다.

X 축에 메모리 양을 표시하고 Y 축에 비용을 표시하면 X와 Y 변수 간의 관계를 나타내는 선은 왼쪽 아래 모서리에서 시작하여 오른쪽 위로 이동합니다.

회귀 모델의 기능은 X와 Y 변수 간의 관계를 가장 잘 설명하는 선형 함수를 결정하는 것입니다. 선형 회귀 분석에서는 Y가 입력 변수의 일부 조합으로 계산될 수 있다고 가정합니다. 입력 변수(X)와 대상 변수(Y) 간의 관계는 그래프의 점을 통해 선을 그리면 나타낼 수 있습니다. 이 선은 X와 Y 간의 관계를 나타냅니다. 예를 들어, X가 3씩 증가할 때마다 Y가 2씩 증가합니다. 목표는 데이터에 가장 잘 맞는 “회귀 선” 또는 함수를 찾는 것입니다.

선은 일반적으로 다음 방정식으로 표시됩니다. Y = m*X + b. X는 독립 변수를 나타내고 Y는 종속 변수를 나타냅니다. 한편, m은 선의 기울기를 나타내며 “상승”과 “주행”으로 정의됩니다. 기계 학습 실무자는 유명한 기울기-선 방정식을 약간 다르게 표시합니다.

y(x) = w0 + w1 * x

위 방정식에서 y는 대상 변수를 나타내고 “w”는 모델의 매개변수를 나타냅니다. 입력은 “x”입니다. 따라서 방정식은 “X에 따라 Y를 주는 함수는 모델의 매개변수에 입력 특성을 곱한 값”으로 읽을 수 있습니다. 모델의 매개변수는 훈련 중에 최적의 회귀 선을 얻기 위해 조정됩니다.

다중 선형 회귀

Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)

위에서 설명한 과정은 단순 선형 회귀 또는 단일 독립 변수/특성이 있는 데이터 세트에 대한 회귀에 적용됩니다. 그러나 회귀는 여러 특성으로도 수행할 수 있습니다. 다중 선형 회귀의 경우 데이터 세트에 있는 변수 수만큼 방정식이 확장됩니다. 즉, 일반적인 선형 회귀의 방정식은 y(x) = w0 + w1 * x이지만 다중 선형 회귀의 방정식은 y(x) = w0 + w1x1 및 다양한 특성의 가중치 및 입력입니다. 가중치와 특성의 총 수를 w(n)x(n)로 표시하면 다음 방정식과 같이 표시할 수 있습니다.

y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)

선형 회귀의 공식이 설정된 후 기계 학습 모델은 가중치의 다양한 값을 사용하여 데이터에 대한 다양한 피팅 선을 생성합니다. 목표는 데이터를 가장 잘 설명하는 선, 즉 변수 간의 관계를 가장 잘 설명하는 선을 찾는 것입니다. 비용 함수는 특정 가중치 값을 사용하여 예측된 Y 값과 실제 Y 값 간의 차이를 측정하는 데 사용됩니다. 선형 회귀의 비용 함수는 평균 제곱 오차로, 데이터 세트의 모든 데이터 포인트에서 예측 값과 실제 값 간의 평균 제곱 오차를 계산합니다. 비용 함수는 예측 대상 값과 실제 대상 값 간의 차이를 캡처하는 비용을 계산하는 데 사용됩니다. 피팅 선이 데이터 포인트에서 멀수록 비용이 높아지며, 선이 실제 변수 간의 관계를 더 잘 캡처할수록 비용이 작아집니다. 모델의 가중치는 최소 오차를 발생시키는 가중치 구성이 찾을 때까지 조정됩니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.