AI 기초

차원 축소란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

차원 축소는 작업에 유용한 정보를 유지하면서 변수를 적게 하여 데이터를 표현합니다. 저장 공간과 노이즈를 줄이고, 시각화를 개선하며, 중복된 특징을 완화하고, 후속 모델 학습을 용이하게 할 수 있습니다.

어떤 방법도 모든 관계를 보존하지는 못합니다. 유용한 축소는 무엇을 유지할지 명시하는 것에서 시작합니다: 분산, 클래스 구분, 지역 이웃, 전역 기하, 재구성 품질 또는 해석 가능성.

핵심 요점

  • 특징 선택은 원래 변수를 유지하고; 특징 추출은 새로운 저차원 좌표를 생성합니다.
  • PCA는 선형이며 분산 중심이며; t-SNE와 UMAP은 시각화를 위해 이웃 구조를 강조합니다.
  • 시각화 임베딩은 거리, 클러스터 크기 및 전역 구분을 왜곡할 수 있습니다.
  • 축소는 훈련 데이터에만 적용하고, 학습된 변환을 검증 및 테스트 데이터에 적용합니다.
What is Dimensionality Reduction? diagram showing high-d data, scale, choose method, fit on train, transform, validate
각 방법은 일부 관계를 보존하고 다른 관계는 왜곡합니다.

특징 선택 vs 투영

특징 선택은 도메인 규칙, 결측, 중복, 예측 테스트 또는 정규화를 사용해 변수를 제거합니다. 원래 의미를 보존하여 거버넌스와 설명에 도움이 될 수 있습니다.

투영 방법은 변수를 새로운 좌표로 결합합니다. 분산된 구조를 포착할 수 있지만 각 좌표를 해석하기 어려울 수 있습니다. 오토인코더는 재구성을 통해 비선형 투영을 학습합니다.

PCA와 SVD

주성분 분석은 데이터를 중심화한 후 분산이 감소하는 직교 방향을 식별합니다. 특이값 분해는 일반적인 수치적 방법을 제공합니다. 스케일링이 중요합니다: 높은 분산을 가진 측정 단위가 구성 요소를 지배할 수 있습니다.

PCA는 부호와 중복 고유값을 제외하고는 결정적이며, 샘플 외 변환을 지원하고 설명된 분산 요약을 제공합니다. 높은 분산이 항상 작업에 관련된 것은 아니며, 선형 구성 요소는 모든 곡면 매니폴드를 펼칠 수 없습니다.

t-SNE와 UMAP

t-SNE는 이웃에 대한 확률 분포를 구성하고 지역 유사성을 강조하는 저차원 지도를 최적화합니다. UMAP은 가중 이웃 그래프를 구축하고 관련된 지역 구조 목표를 갖는 저차원 표현을 최적화합니다.

두 방법 모두 강력한 탐색 도구이지만 전처리, 거리 측정 및 하이퍼파라미터에 민감합니다. 2D 플롯에서 빈 공간, 클러스터 영역 및 클러스터 간 거리에게 자동으로 실제 세계 해석을 부여해서는 안 됩니다.

지도 학습 방법 및 작업 인식 표현

선형 판별 분석은 클래스 레이블을 사용해 구분을 추구하므로 비지도 PCA와 다릅니다. 신경 표현 학습은 재구성 대신 예측 또는 대비 목표를 최적화할 수 있습니다.

레이블이 축소를 안내한다면, 모든 적합 및 튜닝은 학습 과정 내에 머물러야 합니다. 그렇지 않으면 테스트 세트의 정보가 모델 선택에 유출되어 과도하게 낙관적인 결과를 초래할 수 있습니다.

방법 선택 및 검증

전처리와 간단한 베이스라인부터 시작합니다. 압축의 경우 차원별 재구성 또는 하위 작업 성능을 측정합니다. 시각화의 경우 시드와 하이퍼파라미터에 대한 안정성을 테스트하고 도메인 지식과 이웃 보존을 비교합니다.

프로덕션 환경에서는 방법이 새로운 레코드를 변환할 수 있는지, 결측값을 어떻게 처리하는지, 재학습 시 변동이 있는지, 사용자가 원본 특징 설명이 필요한지를 물어야 합니다. 과적합은 최종 모델과 마찬가지로 축소 단계에서도 발생할 수 있습니다.

선형 및 비선형 축소 방법

차원 축소는 고차원 데이터를 선택된 구조를 보존하면서 더 적은 좌표로 매핑합니다. 주성분 분석은 중심화 후 최대 분산의 직교 방향을 찾으며, 단위가 비슷하게 기여하도록 스케일링이 필요합니다. 특이값 분해는 관련 저랭크 구조를 계산하고 희소 행렬을 지원합니다. 선형 판별 분석은 레이블을 사용해 클래스를 구분하는 방향을 찾습니다. 이러한 방법은 명시적인 변환을 제공하지만, 분산이나 클래스 구분이 하위 작업에 필요한 정보를 보존하지 못할 수도 있습니다.

t‑SNE와 UMAP과 같은 매니폴드 방법은 이웃을 구성하고 저차원 레이아웃을 최적화합니다. 탐색에 강력하지만 전역 거리, 밀도, 클러스터 크기 및 때때로 구분을 왜곡합니다. 결과는 전처리, 측정 기준, 이웃 수 또는 퍼플렉시티, 초기화 및 시드에 따라 달라집니다. 두 차원에서 매력적인 클러스터는 이산적인 그룹이 없어도 나타날 수 있습니다. 여러 설정을 사용하고, 피팅에 사용되지 않은 메타데이터만 색상으로 표시하며, 원본 공간이나 독립 레이블을 통해 겉보이는 구조를 검증하십시오.

특징 선택, 임베딩 및 평가

특징 선택은 필터, 래퍼 또는 모델 기반 중요도를 통해 원래 변수를 유지합니다; 표현 학습은 오토인코더나 지도 모델을 사용해 새로운 잠재 특징을 생성합니다. 랜덤 투영은 특정 조건 하에 거리를 대략 보존하며 효율적인 베이스라인을 제공합니다. 압축, 시각화, 노이즈 감소, 속도, 저장 또는 모델 성능을 기준으로 방법을 선택하십시오. 축소 모델은 훈련 데이터에만 적합하고, 검증 및 테스트 세트에 변환을 적용합니다. 지도 축소는 레이블 누수를 방지하기 위해 교차 검증 내부에 중첩되어야 합니다.

선형 압축에서는 설명된 분산 또는 재구성을 평가하고, 시각화에서는 신뢰도와 이웃 보존을 평가하며, 예측에서는 하위 정확도, 보정, 지연 및 견고성을 평가합니다. 샘플 및 시드 전반에 걸친 안정성을 측정합니다. 희귀 클래스나 민감한 그룹이 합쳐졌는지, 역매핑이 가능한지 검토하십시오. 축소된 좌표는 여전히 개인 정보를 포함할 수 있으며, 2차원 플롯이 익명화를 의미하지는 않습니다. 변환, 스케일러, 특징 순서 및 제한 사항을 문서화하십시오.

프로덕션 사용

서비스 제공에는 정확히 적합된 변환과 입력 스키마가 필요합니다. 결측 특징, 범위 변동, 구성 요소 점수 분포, 재구성 오류 및 하위 결과를 모니터링합니다. 새로운 카테고리나 센서가 등장하면, 조용히 열을 추가하기보다 전체 파이프라인을 재학습하고 버전 관리하십시오. 축소는 계산 효율을 높이고 모델의 노이즈를 제거할 수 있지만, 희귀 이벤트에 중요한 약한 신호를 놓칠 수도 있습니다. 이를 학습된 측정 단계로 간주하고, 유지된 정보와 손실된 정보를 의사결정에 대해 테스트해야 합니다.

실제 예시: 고객 행동 특징 축소

분석가는 200개의 행동 측정값을 표준화하고 훈련 고객에만 PCA를 적용합니다. 교차 검증은 2차원 산점도가 아니라 하위 이탈률 성능 및 안정성을 기준으로 구성 요소 수를 선택합니다. 로딩은 지배적인 소스와 결측을 검사합니다. PCA, 특징 선택, 랜덤 투영 및 축소되지 않은 정규화 모델을 보정, 지연 및 희귀 고객 세그먼트 결과 측면에서 비교합니다. 반복 샘플을 통해 주요 구성 요소와 하위 결론이 지속적으로 안정적인지도 테스트합니다.

배포된 파이프라인은 특징 순서, 스케일러 및 구성 요소를 고정하고 누락된 스키마 버전을 거부합니다. 모니터링은 구성 요소 분포, 재구성 오류 및 하위 결과를 추적합니다. 겉보이는 클러스터가 있는 시각화는 질문을 생성하는 데 사용되며, 고객 페르소나를 할당하는 데 사용되지 않습니다. 잠재 구성 요소가 여전히 행동을 인코딩하고 있기 때문에 접근 및 유지가 통제됩니다. 소스 정의가 변경되면, 호환되지 않는 데이터를 기존 구성 요소에 투영하기보다 전체 변환과 모델을 재구축하고 검증합니다.

구현 증거 및 운영 준비성

프로덕션 의사결정은 성공적인 시연보다 더 많은 것이 필요합니다. 대상 사용자, 운영 환경, 입력·출력, 의존성, 소유자 및 각 중요한 실패의 결과를 정의하십시오. 튜닝 전에 재현 가능한 베이스라인과 버전 관리된 평가 세트를 구축합니다. 일반적인 사례, 경계 조건, 형식이 잘못되었거나 누락된 입력, 분포 변동, 의존성 장애, 오용 및 소외될 가능성이 높은 그룹이나 환경을 테스트합니다. 작업 품질을 보정·불확실성, 지연, 처리량, 자원 비용, 접근성, 프라이버시 및 보안과 함께 측정합니다. 모든 변환 및 임계값을 기록하여 독립 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있도록 합니다.

출시 전에, 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 지정합니다. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 의도적으로 삽입한 실패를 통해 모니터링을 검증합니다. 운영 텔레메트리는 불필요한 민감 데이터 수집 없이 입력 품질, 출력 동작, 모델·규칙 버전, 의존성 상태, 인간 오버라이드 및 확인된 결과를 밝혀야 합니다. 알림 임계값과 대응 담당자를 정의한 뒤, 오프라인 성능이 지속될 것이라고 가정하지 말고 배포 후 실제 증거를 검토합니다. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어 또는 기타 요인이 변경될 때마다 재평가합니다.

자주 묻는 질문

차원 축소가 항상 모델을 개선합니까?

아니요. 예측 정보를 버리거나 해석을 복잡하게 만들 수 있습니다. 보류된 데이터에서 차원 축소를 하지 않은 베이스라인과 비교하십시오.

분리된 t-SNE 클러스터가 실제 클래스를 증명합니까?

아니요. 이 지도는 이웃 관계를 최적화한 시각화이며 겉보이는 구분을 만들 수 있습니다. 클러스터를 독립적인 증거로 검증하십시오.

주요 참고문헌

블로거이자 프로그래머로 머신러닝과 딥러닝 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회에 도움이 되도록 사용하는 것을 돕기를 희망합니다.