AI 기초

지도 학습 대 비지도 학습

mm
Unite.AI를 Google의 선호 소스에 추가

기계 학습에서 대부분의 작업은 쉽게 두 가지 다른 클래스 중 하나로 분류될 수 있습니다. 지도 학습 문제 또는 비지도 학습 문제입니다. 지도 학습에서 데이터에 레이블이나 클래스가附加되어 있습니다. 반면 비지도 학습의 경우 데이터는 레이블이 없습니다. 이 구분이 중요한 이유와 각 유형의 학습에 관련된 알고리즘을 살펴보겠습니다.

지도 학습 vs 비지도 학습

대부분의 기계 학습 작업은 지도 학습 영역에 있습니다. 지도 학습 알고리즘에서 데이터셋의 개별 인스턴스/데이터 포인트에 클래스 또는 레이블이 할당됩니다. 즉, 기계 학습 모델은 특정 클래스와 관련된 기능을 구별하는 것을 학습할 수 있으며 기계 학습 엔지니어는 모델의 성능을 확인하기 위해 올바르게 분류된 인스턴スの 수를 확인할 수 있습니다. 분류 알고리즘은 데이터가 올바른 클래스로 레이블이 지정된 경우 복잡한 패턴을 식별하는 데 사용할 수 있습니다. 예를 들어, 기계 학습 알고리즘은 “수염”, “꼬리”, “발톱” 등의 특징을 기반으로 다른 동물들을 구별하는 것을 학습할 수 있습니다.

지도 학습과 대조적으로, 비지도 학습은 레이블이 없는 데이터에서 패턴을 추출하는 모델을 생성하는 것을涉及합니다. 즉, 컴퓨터는 입력 기능을 분석하고 가장 중요한 기능과 패턴을 스스로 결정합니다. 비지도 학습은 다양한 인스턴스 사이의 내재된 유사성을 찾으려고 합니다. 지도 학습 알고리즘이 알려진 클래스로 데이터 포인트를 분류하는 것을 목표로 한다면, 비지도 학습 알고리즘은 객체 인스턴스의 기능을 검사하고 이러한 기능을 기반으로 그룹으로 분류합니다. 본질적으로, 비지도 학습은自己的 클래스를 생성합니다.

지도 학습 알고리즘의 예로는 선형 회귀, 로지스틱 회귀, K-최근접 이웃, 의사 결정 트리, 및 서포트 벡터 머신이 있습니다.

한편, 비지도 학습 알고리즘의 예로는 주성분 분석과 K-평균 클러스터링이 있습니다.

지도 학습 알고리즘

선형 회귀는 두 가지 기능을 가져와서 그 관계를 그래프로 나타내는 알고리즘입니다. 선형 회귀는 다른 수치 변수와 관련된 수치 값을 예측하는 데 사용됩니다. 선형 회귀의 방정식은 Y = a + bX로, b는 선의 기울기이며 a는 y축과 교차하는 점입니다.

로지스틱 회귀는 이진 분류 알고리즘입니다. 알고리즘은 수치 기능과 두 가지 클래스 중 하나로 분류될 수 있는 인스턴스의 확률을 조사합니다. 확률 값은 0 또는 1로 압축됩니다. 즉, 강한 확률은 0.99에 근접하고 약한 확률은 0에 근접합니다.

K-최근접 이웃은 훈련 세트의 일부 이웃의 할당된 클래스를 기반으로 새로운 데이터 포인트에 클래스를 할당합니다. 알고리즘이 고려하는 이웃의 수는 중요하며, 너무 적거나 너무 많은 이웃은 데이터 포인트를 잘못 분류할 수 있습니다.

의사 결정 트리는 분류 및 회귀 알고리즘의 일종입니다. 의사 결정 트리는 데이터셋을 작고 작게 나누어 트리와 리프 노드로 구성합니다. 노드는 데이터 포인트에 대한 결정이 다른 필터링 기준을 사용하여 이루어지는 곳입니다. 리프 노드는 분류된 인스턴스입니다. 의사 결정 트리 알고리즘은 수치 및 범주형 데이터를 모두 처리할 수 있습니다. 트리에서 분할은 특정 변수/기능에서 이루어집니다.

서포트 벡터 머신은 분류 알고리즘으로, 데이터 포인트를 클래스로 구분하는 하이퍼 평면을 그립니다. 데이터 포인트는 하이퍼 평면의 어느 쪽에 있는지에 따라 클래스로 구분됩니다. 여러 하이퍼 평면을 평면에 그릴 수 있으며, 데이터셋을 여러 클래스로 나눌 수 있습니다. 분류기는 하이퍼 평면과 평면의 양쪽에 있는 점 사이의 거리를 최대화하려고 합니다. 하이퍼 평면과 점 사이의 거리가 클수록, 분류기가 더 자신감을 갖게 됩니다.

비지도 학습 알고리즘

주성분 분석은 차원ality 감소 기술로, 데이터의 차원ality 또는 복잡성을 더 단순한 형태로 나타냅니다. 주성분 분석 알고리즘은 데이터에 직교하는 새로운 차원을 찾습니다. 데이터의 차원ality가 감소하는 동안, 데이터 간의 분산은 가능한 한 많이 보존되어야 합니다. 이는 실제로 데이터셋의 기능을 더 적은 기능으로 요약하여 데이터를 나타내는 것을 의미합니다.

K-평균 클러스터링은 데이터 포인트를 유사한 기능을 기반으로 클러스터로 자동 그룹화하는 알고리즘입니다. 데이터셋 내의 패턴을 분석하고 데이터 포인트를 이러한 패턴을 기반으로 그룹으로 나눕니다. 본질적으로, K-평균은 자신의 클래스를 생성합니다. K-평균 알고리즘은 클러스터의 중심 또는 중심을 할당하여 작동하며, 중심을 최적의 위치로 이동하여 중심과 클러스터 내의 데이터 포인트 사이의 거리를 최소화합니다. K-평균 클러스터링의 “K”는 선택된 중심의 수를 나타냅니다.

요약

마지막으로, 지도 학습과 비지도 학습의 주요 차이를 간략하게 살펴보겠습니다.

앞서 논의한 대로, 지도 학습 작업에서는 입력 데이터가 레이블이 지정되고 클래스의 수가 알려져 있습니다. 반면, 비지도 학습의 경우 입력 데이터는 레이블이 지정되지 않으며 클래스의 수가 알려져 있지 않습니다. 비지도 학습은 일반적으로 계산적으로 복잡하지 않습니다. 반면, 지도 학습은 계산적으로 복잡할 수 있습니다. 지도 학습의 결과는 일반적으로 매우 정확하지만, 비지도 학습의 결과는 덜 정확하거나 중간 정도의 정확도를 가집니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.