AI 기초

베이즈 정리는 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

베이즈 정리는 증거를 관찰한 후 가설의 확률을 어떻게 업데이트하는지를 설명합니다. 이는 가설이 주어졌을 때 증거의 확률과 증거가 주어졌을 때 가설의 확률을 연결합니다.

이 구분은 통계적 추론과 머신 러닝의 핵심입니다. 상태가 존재할 때 테스트는 매우 정확할 수 있지만, 그 상태가 드물 경우 양성 결과가 상태를 나타낼 확률은 여전히 낮을 수 있습니다.

핵심 요점

  • 사후 확률은 사전 신념과 관찰된 증거의 가능도를 결합합니다.
  • 증거 항은 가능한 가설들을 정규화합니다.
  • 기본 비율이 겉보기에 강한 증거보다 우세할 수 있습니다.
  • 나이브 베이즈는 특징들이 클래스가 주어졌을 때 조건부 독립이라고 가정하며, 모든 상황에서 독립이라고 가정하지는 않습니다.
Bayes theorem diagram showing prior probability multiplied by likelihood and normalized by evidence to produce a posterior, with a 1000-person probability tree example
베이즈 업데이트는 테스트 결과를 단독으로 고려하는 대신 사전 확률과 새로운 증거를 결합합니다.

수식

P(A|B) = P(B|A)P(A) / P(B)

  • P(A)는 가설 A의 사전 확률입니다.
  • P(B|A)는 A가 참일 때 증거 B를 관찰할 가능도입니다.
  • P(B)는 증거의 전체 확률입니다.
  • P(A|B)는 B를 관찰한 후 A의 사후 확률입니다.

이 정리는 결합 확률에 대한 두 개의 동등한 표현, P(A ∩ B) = P(B|A)P(A)와 P(A ∩ B) = P(A|B)P(B)에서 유도됩니다.

수치적 기본 비율 예시

인구의 1%가 특정 질환에 걸렸다고 가정합니다. 테스트의 민감도는 90%이고 위양성 비율은 5%입니다. 1,000명을 고려하면:

  • 약 10명이 질환을 가지고 있으며, 테스트는 그 중 9명을 정확히 양성으로 표시합니다.
  • 약 990명은 질환이 없으며, 5% 위양성 비율에 따라 대략 50명이 잘못 양성으로 표시됩니다.
  • 따라서 총 약 59개의 양성 결과가 나오고, 그 중 9개가 진양성입니다.

양성 결과 후 질환이 있을 확률은 9 / 59 ≈ 15%이며, 90%가 아닙니다. 테스트의 민감도는 P(positive | condition)을 제공하지만, 사용자는 일반적으로 P(condition | positive)을 원합니다. 베이즈 정리는 기본 비율을 사용해 두 확률을 연결합니다.

베이즈 업데이트

새로운 증거가 들어올 때마다 사후 확률을 다음 업데이트의 사전 확률로 사용할 수 있습니다. 완전한 베이즈 모델은 가능한 가설들, 사전 분포, 가능도, 그리고 추론하려는 양을 명시합니다. 불확실성은 단일 추정값이 아니라 사후 분포로 표현됩니다.

사전은 문서화하고 민감도 분석을 통해 테스트해야 합니다. 약하게 정보가 있는 사전은 비현실적인 값을 규제할 수 있지만, 부적절하게 강한 사전은 제한된 데이터에 과도하게 영향을 미칠 수 있습니다.

나이브 베이즈 분류기

나이브 베이즈는 베이즈 정리와 다음 가정을 사용해 특징 x₁ … xₙ으로부터 클래스 y를 예측합니다:

P(x₁, …, xₙ | y) = Π P(xᵢ | y)

클래스가 알려진 후 특징들은 조건부 독립이라고 가정합니다. 이는 현실적으로는 부정확할 수 있지만, 결과 클래스 점수가 여전히 유용하면 분류기는 잘 작동할 수 있습니다.

일반적인 변형

  • Multinomial Naive Bayes는 카운트와 유사한 특징을 모델링하며 문서 분류에 흔히 사용됩니다.
  • Bernoulli Naive Bayes는 이진 특징 존재 여부를 모델링합니다.
  • Gaussian Naive Bayes는 각 연속 특징을 클래스 조건부 가우시안 분포로 모델링합니다.
  • Categorical Naive Bayes는 이산 범주를 모델링합니다.

스무딩 및 수치적 안정성

학습 중 어떤 특징값이 특정 클래스와 전혀 나타나지 않으면, 스무딩되지 않은 확률 추정은 0이 되어 전체 곱을 0으로 만들 수 있습니다. 가법 또는 라플라스식 스무딩이 이를 방지합니다. 구현에서는 로그 확률을 계산해 많은 작은 값을 곱하는 대신 안정적인 로그 값을 더합니다.

확률, 점수 및 보정

특징들이 상관관계가 있을 경우 나이브 베이즈의 확률 출력은 과대계산될 수 있어 보정이 필요합니다. 분류기는 클래스 순위를 잘 매길 수 있지만 신뢰도를 과대평가할 수 있습니다. 확률이 의사결정에 사용될 때는 보정 여부를 별도 검증 데이터로 평가해야 합니다.

베이즈: 나이브 베이즈를 넘어

베이즈 추론은 계층 모델, A/B 테스트, 과학적 파라미터 추정, 예측, 불확실성을 고려한 의사결정, 확률 그래프 모델 등을 지원합니다. 사후 분포를 닫힌 형태로 계산할 수 없을 때는 마코프 체인 몬테카를로와 변분 추론 같은 근사 방법을 사용합니다.

일반적인 추론 오류

  • P(A|B)와 P(B|A)를 혼동합니다.
  • 희귀하거나 흔한 기본 비율을 무시합니다.
  • 사전을 객관적인 것으로 여기거나 문서화하지 않습니다.
  • 높은 가능도가 자동으로 높은 사후 확률을 의미한다고 가정합니다.
  • 예측적 연관성을 인과관계로 해석합니다.

조건부 확률, 배당률 및 증거

베이즈 정리는 증거가 주어졌을 때 가설의 확률을 사전 확률, 가설 하에서 증거를 관찰할 가능도, 그리고 증거의 전체 확률과 연결합니다. 배당률 형태에서는 사후 배당률이 사전 배당률에 가능도 비를 곱한 값과 같습니다. 이는 테스트 이전에 믿었던 것과 테스트가 가설을 얼마나 구분하는지를 분리합니다. 상태가 드물 경우, 기본 비율이 사후 확률에 크게 작용해 높은 정확도를 가진 테스트라도 많은 위양성을 만들 수 있습니다.

가능도는 고정된 관측 데이터에 대해 가설의 함수이며, 가설의 확률과 혼동해서는 안 됩니다. 증거 정규화는 경쟁 가설들 전체에 걸쳐 합산하거나 적분합니다. 조건부 독립 가정은 계산을 단순화하지만, 그 결과가 실제 상황에 맞는지 검증해야 합니다. 여러 증거가 원인을 공유하거나 정보를 중복하면 독립으로 곱할 수 없습니다. 인과 방향도 중요합니다: P(증거|가설) 은 일반적으로 P(가설|증거)와 같지 않으며, 이는 고전적인 역확률 오류입니다.

모델링 선택, 계산 및 의사결정 활용

베이즈 분석은 사전, 가능도, 그리고 사후 예측 분포를 명시합니다. 사전은 기존 지식을 인코딩하거나 작은 표본을 규제하거나 약하게 정보가 있게 설정할 수 있으며, 정당화와 민감도 분석을 통해 검증해야 합니다. 공액 모델은 해석적 업데이트를 제공하고, 마코프 체인 몬테카를로, 변분 추론, 순차 방법은 복잡한 사후를 근사합니다. 수렴, 유효 표본 크기, 근사 오차, 사전 예측 타당성을 진단하고 단순히 사후 수치만 보고하지 않도록 합니다.

사후 확률은 정보를 제공하지만 스스로 행동을 결정하지는 못합니다. 의사결정에는 손실, 이득, 제약, 가능한 대안이 필요합니다. 확률 모델은 보정, 적절한 점수 규칙, 새로운 데이터에 대한 사후 예측 검증을 통해 평가합니다. 모델링된 과정 하에서 수집된 증거만 사용하고, 선택 편향과 데이터셋 이동이 가능도에 영향을 줄 수 있음을 인지해야 합니다. 신뢰 구간과 가정을 제시하되 이를 보장된 빈도 범위로 오해하지 않도록 합니다. 베이즈 정리는 정확한 확률 대수이지만, 베이즈 결론의 품질은 모델과 제공된 증거에 달려 있습니다.

실제 예시: 진단 테스트 해석

한 테스트의 민감도는 95%, 특이도는 90%이지만, 해당 질환은 전체 인구의 1%만 영향을 받습니다. 10,000명에 대해 약 95명의 진양성과 990명의 위양성이 예상되어 양성 예측값은 9% 미만이 됩니다. 베이즈 정리는 기본 비율 효과를 명확히 보여줍니다. 계산은 인구, 테스트 임계값, 불확실성을 명시하며, 단순히 민감도를 양성 결과가 정확할 확률로 광고하지 않습니다. 이 구분은 데이터 과학에서도 근본적입니다.

임상의는 추가 증거가 있을 때만 확률을 업데이트합니다. 이는 테스트 간 의존성을 모델링한 경우에 해당합니다. 의사결정 임계값은 놓친 질환의 위험, 확인 테스트 위험, 비용, 환자 선호 등을 포함합니다. 보정은 지역 인구에서 확인하고, 유병률 변화가 있으면 검토합니다. 사후는 논의와 다음 단계에 도움을 주지만 확인 진단을 대체하지는 않습니다. 보고서는 자연 빈도와 민감도 분석을 사용해 환자와 실무자가 합리적인 가정 하에 결론이 어떻게 변하는지 볼 수 있게 합니다.

구현 증거 및 운영 준비성

프로덕션 단계에서는 성공적인 시연만으로는 충분하지 않습니다. 대상 사용자, 운영 환경, 입력·출력, 의존성, 소유자, 중요한 실패 시 결과 등을 정의해야 합니다. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 구축합니다. 일반 케이스, 경계 조건, 손상되거나 누락된 입력, 분포 이동, 의존성 장애, 오용, 그리고 소외될 가능성이 높은 그룹·환경을 테스트합니다. 작업 품질을 보정·불확실성과 함께 측정하고, 지연 시간, 처리량, 자원 비용, 접근성, 프라이버시, 보안을 평가합니다. 모든 변환과 임계값을 기록해 독립 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있게 합니다.

출시 전에는 릴리스, 예외, 변경, 롤백, 폐기에 대한 권한을 지정합니다. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 고의로 삽입한 실패를 통해 모니터링을 검증합니다. 운영 텔레메트리는 입력 품질, 출력 행동, 모델·규칙 버전, 의존성 상태, 인간 개입, 확인된 결과를 보여주어야 하며, 불필요한 민감 데이터를 수집해서는 안 됩니다. 알림 임계값과 대응 담당자를 정의하고, 배포 후 실제 증거를 검토하며 오프라인 성능이 지속될 것이라고 가정하지 않습니다. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어, 목표가 변하면 재평가합니다. 유지되는 시스템은 복구 절차, 사고 학습, 삭제·보존 절차, 그리고 비활성화·교체 시점을 문서화해야 합니다.

자주 묻는 질문

가능도와 확률의 차이는 무엇인가요?

매개변수가 고정된 경우, 모델은 가능한 데이터에 확률을 할당합니다. 관측된 데이터가 고정된 경우, 동일한 식을 가능한 매개변수 값에 대한 가능도 함수로 볼 수 있습니다. 수식 자체는 동일할 수 있지만 해석은 다릅니다.

나이브 베이즈는 완전한 베이즈 추론인가요?

나이브 베이즈는 강한 조건부 독립 모델 하에서 분류를 위해 베이즈 정리를 사용합니다. 보다 넓은 베이즈 추론은 미지의 양에 대해 분포를 두고 사후 분포와 함께 추론합니다.

주요 참고문헌

블로거이자 프로그래머로 Machine Learning과 Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.