Grundlæggende AI

Overvåget mod Uovervåget Læring

mm
Føj Unite.AI til dine foretrukne kilder på Google

I maskinlæring kan de fleste opgaver let kategoriseres i en af to forskellige klasser: overvåget læring eller uovervåget læring. I overvåget læring har data etiketter eller klasser tilføjet, mens i tilfældet af uovervåget læring er data ikke-etiketteret. Lad os tage en nærmere kig på, hvorfor denne forskel er vigtig, og se på nogle af algoritmerne, der er forbundet med hver type læring.

Overvåget vs Uovervåget Læring

De fleste maskinlæringsopgaver er i domænet for overvåget læring. I overvågede læringosalgoritmer har de enkelte instanser/data punkter i datasset en klasse eller etiket tilføjet. Dette betyder, at maskinlæringsmodellen kan lære at skelne, hvilke funktioner der er korreleret med en given klasse, og at maskinlæringsingeniøren kan kontrollere modellens ydeevne ved at se, hvor mange instanser der blev korrekt klassificeret. Klassificeringsalgoritmer kan bruges til at skelne mange komplekse mønstre, så længe data er etiketteret med de korrekte klasser. For eksempel kan en maskinlæringsalgoritme lære at skelne forskellige dyr fra hinanden på basis af karakteristika som “pisker”, “hale”, “kløer” osv.

I modsætning til overvåget læring indebærer uovervåget læring at oprette en model, der kan udtrække mønstre fra ikke-etiketteret data. Med andre ord analyserer computeren inputfunktionerne og bestemmer selv, hvilke funktioner og mønstre der er vigtigst. Uovervåget læring forsøger at finde de indre ligheder mellem forskellige instanser. Hvis en overvåget læringosalgoritme sigter mod at placere datapunkter i kendte klasser, vil uovervågede læringosalgoritmer undersøge funktionerne, der er fælles for objektforslagene, og placere dem i grupper baseret på disse funktioner, hvilket i virkeligheden opretter deres egne klasser.

Eksempler på overvågede læringosalgoritmer er Lineær Regression, Logistisk Regression, K-nærmeste Naboer, Beslutningstræer og Support Vector Maskiner.

Imens er nogle eksempler på uovervågede læringosalgoritmer Principal Component Analysis og K-Means Clustering.

Overvåget Læring Algoritme

Lineær Regression er en algoritme, der tager to funktioner og plotter ud forholdet mellem dem. Lineær Regression bruges til at forudsige numeriske værdier i forhold til andre numeriske variable. Lineær Regression har ligningen Y = a + bX, hvor b er linjens hældning og a er, hvor y krydser x-aksen.

Logistisk Regression er en binær klassificeringsalgoritme. Algoritmen undersøger forholdet mellem numeriske funktioner og finder sandsynligheden for, at instansen kan klassificeres i en af to forskellige klasser. Sandsynligheds-værdierne “presses” mod enten 0 eller 1. Med andre ord vil stærke sandsynligheder nærme sig 0,99, mens svage sandsynligheder vil nærme sig 0.

K-nærmeste Naboer tildeles en klasse til nye datapunkter på basis af de tildelte klasser for et valgt antal naboer i træningsmængden. Antallet af naboer, der overvejes af algoritmen, er vigtigt, og for få eller for mange naboer kan mis klassificere punkter.

Beslutningstræer er en type klassificerings- og regressionsalgoritme. En beslutningstræ opererer ved at splitte en datamængde ned i mindre og mindre dele, indtil undermængderne ikke kan splittes yderligere, og hvad der resulterer er et træ med knuder og blade. Knuderne er, hvor beslutninger om datapunkter træffes ved hjælp af forskellige filtreringskriterier, mens bladene er de instanser, der er tildelt en given etiket (et datapunkt, der er klassificeret). Beslutningstræ-algoritmer kan håndtere både numeriske og kategoriske data. Splitninger i træet sker på bestemte variabler/funktioner.

Support Vector Maskiner er en klassificeringsalgoritme, der opererer ved at tegne hyperplaner, eller adskillelinjer, mellem datapunkter. Datapunkter adskilles i klasser på basis af, hvilken side af hyperplanen de er på. Flere hyperplaner kan tegnes over en plane, og datamængden kan deles i multiple klasser. Klassificatoren vil prøve at maksimere afstanden mellem den adskillede hyperplane og punkterne på begge sider af planet, og jo større afstanden mellem linjen og punkterne er, jo mere sikker er klassificatoren.

Uovervåget Læring Algoritmer

Principal Component Analysis er en teknik, der bruges til dimensionaleduktion, hvilket betyder, at dimensionaleden eller kompleksiteten af data repræsenteres på en mere enkel måde. Principal Component Analysis-algoritmen finder nye dimensioner for data, der er ortogonale. Mens dimensionaleden af data reduceres, skal variationen mellem dataene bevares så meget som muligt. Dette betyder i praksis, at det tager funktionerne i datamængden og destillerer dem ned til færre funktioner, der repræsenterer det meste af data.

K-Means Clustering er en algoritme, der automatisk grupperer datapunkter i kluster på basis af lignende funktioner. Mønstrene i datamængden analyseres, og datapunkterne deles i grupper på basis af disse mønstre, hvilket i virkeligheden opretter deres egne klasser. K-Means-algoritmen opererer ved at tildele centre til klusterne, eller centroider, og flytte centroiderne, indtil den optimale position for centroiderne er fundet. Den optimale position vil være en, hvor afstanden mellem centroiderne og de omgivende datapunkter inden for klassen er minimiseret. “K” i K-Means Clustering henviser til, hvor mange centroider der er valgt.

Resumé

For at afslutte lad os hurtigt gennemgå de vigtigste forskelle mellem overvåget og uovervåget læring.

Som vi tidligere diskuterede, har inputdata i overvågede læringssituationer etiketter, og antallet af klasser er kendt. Imens er inputdata ikke-etiketteret, og antallet af klasser er ikke kendt i uovervågede læringssituationer. Uovervåget læring har tendens til at være mindre kompleks, mens overvåget læring har tendens til at være mere kompleks. Mens overvåget læringens resultater tenderer til at være meget præcise, tenderer uovervåget læringens resultater til at være mindre præcise/moderat præcise.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.