AI 기초
선형 회귀란 무엇인가?
선형 회귀는 연속적인 목표 변수를 하나 이상의 입력 특성의 선형 결합으로 모델링합니다. 예측, 추정 및 보다 복잡한 모델이 의미 있는 가치를 추가하는지 이해하기 위한 투명한 기준선으로 사용됩니다.
단어 독립 변수와 종속 변수는 모델 내 역할을 설명할 뿐, 인과 관계를 증명하는 것이 아닙니다. 회귀는 연관성을 식별할 수 있지만, 교란, 선택 편향, 역인과성 또는 측정 오류가 관계를 설명할 수 있습니다.
핵심 요점
- 목표 y는 입력 특성 X로부터 모델링됩니다; 이 글의 이전 버전에서는 하나의 공식 설명에서 이러한 레이블을 뒤바꿨습니다.
- 보통 최소 제곱법은 제곱 잔차의 합을 최소화합니다.
- 잔차 진단과 가정은 추론 및 불확실성에 중요합니다.
- 예측 변수가 많거나 상관관계가 있을 때 Ridge와 Lasso 정규화가 도움이 됩니다.

단순 선형 회귀
특성이 하나일 때, 모델은:
ŷ = β₀ + β₁x
β₀는 절편이고 β₁은 기울기입니다. 관측치 i에 대한 잔차는 yᵢ - ŷᵢ입니다. 보통 최소 제곱법(OLS)은 제곱 잔차의 합을 최소화하는 계수를 선택합니다.
기울기는 적합된 모델에서 특성이 한 단위 변할 때 목표 변수의 기대 변화를 추정합니다. 연구 설계와 가정이 인과적 식별을 뒷받침하지 않는 한 인과 효과로 설명해서는 안 됩니다.
다중 선형 회귀
p개의 특성이 있을 때:
ŷ = β₀ + β₁x₁ + β₂x₂ + … + βₚxₚ
각 계수는 다른 포함된 특성들을 고정한 조건에서 해석됩니다. 다중 회귀는 인코딩, 다항식 항, 상호작용을 통해 범주형 변수를 포함할 수 있습니다. 변환된 특성인 x²가 포함되더라도 계수에 대해 선형이므로 “선형”이라고 부릅니다.
가정 및 진단
예측을 위해 핵심 질문은 모델이 얼마나 잘 일반화되는가입니다. 고전적인 계수 검정과 구간을 위해서는 추가적인 가정이 중요해집니다:
- 선형성: 조건부 평균이 선택된 선형 형태로 표현됩니다.
- 독립적이거나 올바르게 모델링된 오류: 반복, 그룹화, 공간적 또는 시계열 관측은 다른 오류 구조가 필요할 수 있습니다.
- 오차 분산의 일정성: 이분산성은 표준 오차와 불확실성 추정에 영향을 미칩니다.
- 다중공선성 제한: 강하게 상관된 예측 변수는 개별 계수를 불안정하게 만듭니다.
- 잔차 분포: 정규성은 소표본 추론에 일부 관련이 있지만 모든 특성이 정규분포해야 한다는 요구는 아닙니다.
잔차 플롯, 레버리지 및 영향도 측정, 그리고 도메인 검토를 통해 이상치, 비선형성, 변동성 변화, 혹은 모델에 과도하게 영향을 미치는 관측치를 식별할 수 있습니다.
예측 평가
- 평균 절대 오차 (MAE)는 절대 잔차 크기의 평균을 구합니다.
- 평균 제곱 오차 (MSE)는 큰 오류에 더 큰 가중치를 부여합니다.
- 제곱근 평균 제곱 오차 (RMSE)는 제곱 오차를 목표 단위로 되돌립니다.
- R²는 평가된 데이터에서 잔차 변동을 일정 기준선과 비교합니다.
R²는 정확도를 의미하지 않으며, 인과 관계를 확립하지 못하고, 보류 데이터에서는 음수가 될 수 있습니다. 검증은 실제 예측 상황과 일치해야 하며, 필요할 경우 시간 또는 그룹을 고려한 분할을 포함해야 합니다.
Ridge, Lasso 및 Elastic Net
Ridge 회귀는 계수를 축소하고 상관된 예측 변수를 안정화하는 L2 페널티를 추가합니다. Lasso는 L1 페널티를 추가하여 계수를 0으로 만들 수 있습니다. Elastic Net은 두 가지를 결합합니다. 이러한 페널티를 비교하기 전에 특징은 보통 호환되는 스케일링이 필요합니다.
정규화는 편향을 도입하지만 분산을 낮추어 과적합을 줄일 수 있습니다. 페널티 강도는 최종 테스트 세트가 아니라 검증을 통해 선택됩니다.
선형 회귀가 부적절한 경우
관계가 강하게 비선형이거나 오류가 과거 값에 의존하거나 목표 분포가 특수한 모델링을 요구하거나 소수의 이상치가 제곱 손실을 지배할 때 선형 모델은 실패할 수 있습니다. 의사결정 트리, 일반화 선형 모델, 시계열 모델, 강인 회귀 또는 비선형 방법이 더 적합할 수 있습니다.
복잡한 모델이 우수하더라도 선형 회귀는 여전히 가치 있는 기준선입니다. 대규모 시스템이 이를 안정적으로 능가하지 못한다면 추가된 복잡성은 정당화되지 않을 수 있습니다.
모델 가정, 추정 및 진단
선형 회귀는 숫자 결과의 조건부 평균을 절편과 가중 예측 변수의 합으로 모델링합니다. 보통 최소 제곱법은 제곱 잔차를 최소화하는 계수를 선택합니다. 계수는 다른 포함된 변수를 고정한 상태에서 예측 변수가 한 단위 변할 때 기대되는 결과 변화량을 설명합니다. 이는 인과 식별 가정과 연구 설계가 더 강력히 뒷받침되지 않는 한 연관성에 불과합니다. 단위, 코딩, 변환, 상호작용 및 기준 범주는 해석을 결정하므로 데이터 사전 정의가 없으면 계수는 불완전합니다.
고전적인 추론은 함수 형태, 독립 오류, 일정 분산 및 특정 검정과 구간을 위한 오류 분포에 대한 가정에 의존합니다. 잔차 대 적합값 플롯은 비선형성이나 이분산성을 드러내고, Q–Q 플롯은 꼬리 행동을 평가합니다; 레버리지와 영향 진단은 추정치에 크게 영향을 미치는 관측치를 식별합니다. 상관된 예측 변수는 불확실성을 부풀리고 개별 계수를 불안정하게 만들지만 예측 자체는 충분히 적절할 수 있습니다. 강인 표준 오차, 변환, 스플라인, 계층 구조 또는 다른 모델이 불편한 데이터 포인트를 삭제하는 대신 필요할 수 있습니다.
정규화, 평가 및 책임 있는 사용
Ridge 회귀는 L2 페널티로 계수를 축소하고, Lasso는 L1 페널티로 일부를 0으로 만들 수 있으며, Elastic Net은 두 가지를 결합합니다; 페널티 규모가 비교 가능하도록 예측 변수를 표준화하고 검증 또는 교차 검증을 통해 강도를 선택합니다. 평균 절대 오차, 제곱근 평균 제곱 오차, 잔차 분포, 구간별 보정 및 불확실성을 평가하고, 사용을 반영하는 시간 또는 그룹 분할을 적용합니다. 평균 기준선 및 비선형 대안과 비교하되 투명성과 안정성이 가치 있을 때 선형 모델을 유지합니다.
관측된 예측 변수 범위를 벗어난 외삽은 근거 없이 적합된 선을 따라 진행되며 위험할 수 있습니다. 특징 범위, 결측, 잔차 및 하위 그룹 오류를 프로덕션에서 모니터링합니다. 예측 구간은 개별 결과 불확실성을 설명하며 평균에 대한 신뢰 구간보다 넓습니다; 두 구간 모두 가정을 필요로 합니다. 효과 추정이 목표라면 인과 편향을 도입하는 변수를 통제하지 않도록 주의합니다. 선형 회귀는 정의된 관계에 대한 정밀한 도구이며, 세계가 선형이거나 계수가 개입을 의미한다는 보장은 아닙니다.
작업 예시: 배송 시간 추정
물류 팀은 거리, 서비스 수준, 지역, 요일 및 알려진 날씨를 사용해 배송 소요 시간을 모델링합니다. 비선형 잔차 패턴을 검사하고, 선형 방정식을 문자 그대로 물리법칙으로 취급하기보다 정당한 스플라인과 상호작용을 추가합니다. 운송사와 경로 그룹은 검증 폴드를 정의합니다. 평균 절대 오차, 꼬리 오류, 구간 커버리지 및 체계적 편향을 보고합니다. 취소된 배송과 도착 후 기록된 데이터는 제외하거나 명시적으로 모델링합니다.
계수는 단위와 함께 문서화되고 상관된 예측 변수 하에서 불안정성이 확인됩니다. 모델은 검증된 거리와 지역 범위를 넘어선 외삽을 거부합니다. 예측 구간이 추정치와 함께 제공되며, 하위 일정 계획은 그 불확실성을 활용합니다. 모니터링은 특징 범위, 잔차, 구간 커버리지 및 네트워크 변화 후 편향을 추적합니다. 운송사나 날씨에 대한 인과 주장은 예측 계수만으로는 제시되지 않으며, 개입을 뒷받침하려면 운영 실험이나 더 강력한 식별이 필요합니다.
구현 증거 및 운영 준비
생산 의사결정에는 성공적인 시연 이상의 것이 필요합니다. 의도된 사용자, 운영 환경, 입력, 출력, 종속성, 소유자 및 각 중요한 실패의 결과를 정의합니다. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 설정합니다. 일반 사례, 경계 조건, 잘못된 또는 누락된 입력, 분포 이동, 종속성 중단, 오용 및 소외될 가능성이 높은 그룹이나 환경을 테스트합니다. 작업 품질을 보정 또는 불확실성, 지연, 처리량, 자원 비용, 접근성, 프라이버시 및 보안과 함께 측정합니다. 모든 변환과 임계값을 기록하여 독립 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있도록 합니다.
출시 전에 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 지정합니다. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며 고의로 삽입된 실패를 통해 모니터링을 검증합니다. 운영 텔레메트리는 입력 품질, 출력 행동, 모델 또는 규칙 버전, 종속성 상태, 인간 개입 및 불필요한 민감 데이터 수집 없이 확인된 결과를 보여야 합니다. 알림 임계값과 대응 책임자를 정의한 뒤 배포 후 실제 증거를 검토하고 오프라인 성능이 지속될 것이라고 가정하지 않습니다. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어 또는 목표가 변경될 때마다 재평가합니다. 유지되는 시스템은 복구, 사고 학습, 삭제 및 보존 절차, 그리고 비활성화 또는 교체 시점을 문서화해야 합니다.
자주 묻는 질문
선형 회귀는 입력 변수가 하나만 필요합니까?
아니요. 단순 회귀는 하나의 예측 변수를 사용하지만, 다중 선형 회귀는 많은 수치형, 인코딩된 범주형, 변환된 및 상호작용 특성을 사용할 수 있습니다.
선형 회귀가 인과관계를 증명할 수 있습니까?
아니요. 인과 해석은 방어 가능한 연구 설계와 교란, 선택, 측정 및 개입에 대한 가정을 필요로 합니다. 예측 계수만으로는 적합된 모델에서의 연관성을 설명할 뿐입니다.












