AI 기초
데이터 과학이란 무엇인가?
Data science는 데이터를 방어 가능한 지식, 예측 또는 의사결정으로 전환하는 실천이다. 도메인 전문 지식, 통계, 컴퓨팅, 데이터 엔지니어링, 시각화 및 커뮤니케이션을 결합한다. 모델이 작업의 일부가 될 수 있지만, 이 분야는 모델링 이전에 시작하여 배포 이후에도 계속된다.
가장 중요한 질문은 “어떤 알고리즘을 사용해야 할까?”가 아니라 “우리가 지원하는 의사결정은 무엇이며, 이를 답할 증거는 무엇이고, 결과가 여전히 유용한지 어떻게 알 수 있는가?”이다.
핵심 요점
- 데이터 과학은 머신러닝의 동의어가 아니라, 끝‑끝 증거 워크플로우이다.
- 문제 정의, 측정 및 데이터 거버넌스가 모델 복잡성보다 성공을 결정하는 경우가 많다.
- 예측 질문과 인과 질문은 서로 다른 가정과 평가 설계가 필요하다.
- 배포된 분석은 사용자에 적합한 모니터링, 문서화 및 커뮤니케이션이 필요하다.

결정과 추정량으로 시작하기
프로젝트는 사용자, 의사결정, 개입 및 오류 비용을 식별해야 한다. 설명적 질문의 경우 목표는 비율이나 추세가 될 수 있다. 예측의 경우 미래 수요나 위험이 될 수 있다. 인과 질문의 경우, 추정량은 명시된 가정 하에 정의된 개입의 효과를 설명한다.
“인사이트 찾기”와 같은 모호한 목표는 평가를 불가능하게 만든다. 측정 가능한 목표는 데이터 수집의 경계를 설정하고 분석이 모든 가능한 영역으로 확장되는 것을 방지한다.
데이터 수집, 거버넌스 및 이해
팀은 데이터 소스, 소유권, 동의, 보존, 계보 및 접근성을 목록화한다. 그들은 구조화된 데이터와 비구조화된 데이터를 구분하고, 단위와 타임스탬프를 정의하며, 기록이 관심 대상인 모집단 및 기간을 대표하는지 검토한다.
정제는 단순히 누락된 행을 삭제하는 것이 아니다. 중복 제거, 불가능한 값 처리, 라벨 모호성 해소, 스키마 변동, 검열, 분석 단위를 변경하는 조인 등을 포함한다. 모든 변환은 재현 가능하고 문서화되어야 한다.
모델링 전에 탐색하기
탐색적 분석은 분포, 결측, 관계 및 잠재적 측정 아티팩트를 조사한다. 시각화는 요약 평균이 숨기는 이상치와 하위 그룹 차이를 드러낼 수 있다. 탐색은 가설을 형성하는 데 도움을 주어야 하며, 확인 증거로 오해되어서는 안 된다.
특성 엔지니어링, 차원 축소 및 표현 학습은 모델링을 개선할 수 있지만, 변환은 누수를 방지하기 위해 훈련 데이터에만 적용되어야 한다.
질문에 맞는 방법 선택
통계적 추정은 관심 대상 양에 대한 불확실성을 정량화한다. 머신러닝은 주요 목표가 새로운 데이터에 대한 예측 성능일 때 유용하다. 목표가 개입 효과인 경우 실험 및 인과 추론 방법이 필요하다.
베이스라인은 이해하기 충분히 단순해야 한다. 더 복잡한 모델은 더 나은 검증 성능, 보정된 불확실성, 운영 가치 또는 이미지·언어 처리와 같은 필수 기능을 통해 추가 비용을 정당화해야 한다.
평가, 커뮤니케이션 및 모니터링
평가는 의사결정에 맞춰야 한다. 분류기는 정확도만이 아니라 정밀도, 재현율, 보정 및 하위 그룹 분석이 필요할 수 있으며, 예측 시스템은 시간 인식 백테스트가 필요하다. 과적합과 누수는 모델 특성뿐 아니라 프로세스 실패이다.
커뮤니케이션에는 가정, 불확실성, 한계 및 권고 조치가 포함된다. 모델이나 대시보드가 사용되면 팀은 입력 품질, 결과 드리프트, 사용자 행동 및 하위 영향을 모니터링한다. 폐기된 의사결정 프로세스는 아카이브와 명확한 소유권이 필요하며, 배포된 프로세스는 운영자가 필요하다.
데이터 과학 라이프사이클 및 분석 질문
데이터 과학은 도메인 지식, 통계, 컴퓨팅 및 커뮤니케이션을 결합해 데이터를 의사결정을 위한 증거로 전환한다. 설명, 진단, 예측, 인과 추론을 구분하는 것부터 시작한다. 발생한 일을 보고하는 대시보드, 이탈 가능성을 예측하는 모델, 개입이 이탈에 변화를 주는지를 추정하는 실험은 각각 다른 질문에 답한다. 데이터를 추출하기 전에 단위, 모집단, 시간 창, 결과, 행동 및 오류 비용을 정의한다. 많은 실패 프로젝트는 의도된 결정을 지원하지 못하는 측정 가능한 프록시를 해결한다.
데이터 획득에는 출처, 권한, 샘플링 설계 및 데이터 계약이 필요하다. 탐색은 분포, 결측, 중복, 이상치, 관계, 측정 변화 및 잠재적 누수를 확인한다. 정제 선택은 분석 가정이다: 누락된 행을 삭제하거나 값을 대체하거나 이상치를 제한하면 모집단과 결론이 바뀔 수 있다. 원시 데이터를 불변하게 버전 관리하고 변환을 코드로 관리하며, 단위와 의미를 포함한 데이터 사전을 만든다. 변환을 학습하거나 가설을 반복 테스트하기 전에 평가 데이터를 분할한다.
모델링, 추론 및 재현성
통계적 추론은 가정 하에 불확실성을 정량화한다; 예측 모델링은 샘플 외 성능을 추정한다; 인과 분석은 설계 또는 방어 가능한 가정을 통한 식별이 필요한다. 질문과 데이터 생성 과정을 맞추는 방법을 선택한다. 간단한 베이스라인과 비교하고, 그룹화 혹은 시간 인식 검증을 사용하며, 불확실성과 민감도를 보고한다. 높은 상관관계나 특성 중요도가 인과성을 입증하지는 않는다. 다중 검정, 연구자의 자유도, 선택적 보고는 설득력 있는 패턴을 만들 수 있으므로 사전 등록이나 명확히 구분된 확인 단계가 도움이 된다.
재현성은 코드, 환경, 데이터 스냅샷, 랜덤 시드, 쿼리 정의 및 수동 결정 기록을 포함한다. 자동화 테스트는 스키마, 비즈니스 불변식, 변환 및 메트릭을 포괄해야 한다. 노트북은 탐색에 유용하지만 프로덕션 작업은 모듈식이며 검토 가능한 파이프라인이 필요하다. 동료 검토는 가정, 누수, 목표 타당성 및 결과 일반화를 도전해야 한다. 효과 크기, 불확실성, 한계 및 반증을 전달하고, 통계적 유의성이나 모델 점수만을 강조하지 않는다.
배포 및 의사결정 영향
분석이 반복적인 프로세스를 주도한다면, 소유자를 지정하고 데이터 최신성 및 결과 품질을 모니터링하며 롤백 또는 폐기를 정의한다. 최소화, 접근 제어, 보존 및 안전한 출력으로 개인 및 기밀 정보를 보호한다. 하위 그룹 효과와 사용자가 모델에 어떻게 반응하는지를 평가하고, 피드백 루프가 미래 데이터를 바꿀 수 있다. 의사결정이 실제 목표를 개선했는지 측정하고, 단순히 모델이 배포됐는지 여부만은 따지지 않는다. 데이터 과학은 증거가 신뢰성 있게 행동을 변화시킬 때 성공이며, 조직이 소유권 없이 대시보드, 기능, 실험을 축적할 때는 성공이 아니다.
실제 예시: 유지율 개입 측정
제품 팀은 낮은 유지율을 관찰하고 활성 사용자, 코호트, 기간, 제외 항목 및 의사결정을 정의한다. 분석가는 모델링 전에 계측, 누락 이벤트 및 획득 믹스를 감사한다. 설명적 코호트는 감소가 발생한 지점을 식별하고, 예측 모델은 연구 참여자를 우선순위화하며, 무작위 온보딩 실험은 제안된 변경이 유지율을 개선하는지 추정한다. 이들은 별개의 가정과 결과를 가진 세 가지 독립적인 분석이다.
노트북, 쿼리, 데이터 스냅샷, 메트릭 정의 및 실험 계획은 버전 관리되고 동료 검토된다. 결과는 효과 크기와 불확실성을 보고하며, 지원 수요와 접근성을 위한 가드레일을 포함한다. 대시보드는 실험을 모니터링하지만 사전에 선언된 분석을 대체하지 않는다. 개입이 성공하면 단계적 롤아웃을 유지하고 장기 행동을 확인한다. 작업은 복잡한 모델이나 시각적으로 매력적인 차트가 만들어졌기 때문이 아니라, 재현 가능한 의사결정을 지원할 때만 가치가 있다.
구현 증거 및 운영 준비성
프로덕션 의사결정은 성공적인 시연보다 더 많은 것이 필요한다. 의도된 사용자, 운영 환경, 입력, 출력, 의존성, 소유자 및 각 주요 실패의 결과를 정의한다. 튜닝 전에 재현 가능한 베이스라인과 버전 관리된 평가 세트를 구축한다. 일반적인 경우, 경계 조건, 형식이 잘못되었거나 누락된 입력, 분포 변화, 의존성 중단, 오용 및 소외될 가능성이 높은 그룹이나 환경을 테스트한다. 작업 품질을 보정 또는 불확실성, 지연, 처리량, 자원 비용, 접근성, 프라이버시 및 보안과 함께 측정한다. 모든 변환 및 임계값을 기록하여 독립 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있게 한다.
출시 전에는 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 지정한다. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 의도적으로 삽입한 실패로 모니터링을 검증한다. 운영 텔레메트리는 불필요한 민감 데이터를 수집하지 않으면서 입력 품질, 출력 동작, 모델·규칙 버전, 의존성 상태, 인간 개입 및 확인된 결과를 보여줘야 한다. 알림 임계값과 대응 담당자를 정의하고, 오프라인 성능이 지속될 것이라 가정하지 말고 배포 후 실제 증거를 검토한다. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어 또는 목표가 변경될 때마다 재평가한다. 유지되는 시스템은 문서화된 복구, 사고 학습, 삭제 및 보존 절차와 함께 언제 비활성화하거나 교체해야 하는 명확한 시점이 필요하다.
자주 묻는 질문
데이터 과학은 데이터 분석과 동일한가요?
두 용어는 겹치는 부분이 있다. 데이터 과학은 종종 데이터 제품 및 예측 시스템 구축을 포함하지만, 데이터 분석은 설명적·진단적 의사결정 지원에 더 초점을 맞출 수 있다. 조직에 따라 사용 방식이 다르다.
모든 데이터 과학 프로젝트에 AI가 필요한가요?
아니요. 잘 설계된 쿼리, 차트, 실험 또는 통계 추정이 복잡한 모델보다 더 유용하고 신뢰할 수 있다.












