Tankeledere

Hvordan trænes maskinlæringsmodeller?

mm
Føj Unite.AI til dine foretrukne kilder på Google

Mange mennesker associerer maskinlæring (ML) med AI, om de erkender det eller ej. ML er en af de mest spændende og lovende undergrupper i dette felt, og det hele hviler på maskinlæringsmodeltræning.

Hvis du vil have, at en algoritme skal besvare spørgsmål eller arbejde selvstændigt, må du først lære den at genkende mønstre. Denne proces kaldes træning og er sandsynligvis det vigtigste trin i maskinlæringsrejsen. Træning lægger grundlaget for ML-modellers fremtidige anvendelser og er, hvor deres succes eller fiasko stammer fra. Her er en nærmere beskrivelse af, hvordan det fungerer.

Maskinlæringsmodeltræningens grundlag

Maskinlærings-træning begynder ofte med dataudvinding. Dette er den ressource, som du vil bruge til at lære din algoritme, så pålidelig træning begynder med at indsamle relevante, nøjagtige oplysninger. Datavidenskabsmænd vil ofte starte med datasæt, som de er fortrolige med, for at hjælpe med at spotte uændringer, og forebygge problemer længere nede ad vejen. Husk, at din ML-model kun kan være så effektiv, som dens oplysninger er nøjagtige og rene.

Dernæst vælger datavidenskabsmænd en model, der passer til mønstergenkendelsen, de ønsker. Disse varierer i kompleksitet, men det hele kommer til at finde ligheder og forskelle i datasæt. Du vil give modellen nogle regler for at identificere forskellige mønstre eller typer af oplysninger, og derefter justere den, indtil den kan genkende disse tendenser med nøjagtighed.

Herefter er træningsprocessen en lang række af prøver og fejl. Du vil give algoritmen noget mere data, se, hvordan den fortolker det, og derefter justere den, som nødvendigt for at gøre den mere nøjagtig. Da processen fortsætter, skal modellen blive mere og mere pålidelig og kunne håndtere mere komplekse problemer.

ML-træningsteknikker

Maskinlærings-træningens grundlag forbliver stort set det samme mellem metoder, men specifikke tilgange varierer bredt. Her er nogle af de mest almindelige maskinlærings-træningsteknikker, du vil se i brug i dag.

1. Overvåget læring

De fleste ML-teknikker falder i to store kategorier: overvåget eller uovervåget læring. Overvågede tilgange bruger mærkede datasæt til at forbedre deres nøjagtighed. Mærkede input og output giver en baseline for modellen til at måle sin præstation imod, og hjælper den med at lære over tid.

Overvåget læring tjener generelt ét af to formål: klassifikation, der placerer data i kategorier, eller regression, der analyserer relationerne mellem forskellige variabler, ofte med henblik på at gøre forudsigelser ud fra denne indsigt. I begge tilfælde tilbyder overvågede modeller høj nøjagtighed, men kræver en del indsats fra datavidenskabsmænd for at mærke dem.

2. Uovervået læring

Til gengæld bruger uovervåede tilgange til maskinlæring ikke mærket data. Som følge heraf kræver de minimal menneskelig indgriben, hvilket er årsagen til, at de kaldes “uovervåede”. Det kan være nyttigt, når man tager i betragtning den voksende mangel på datavidenskabsmænd, men da de fungerer anderledes, er disse modeller bedre egnet til andre opgaver.

Overvågede ML-modeller er gode til at handle på relationer i et datasæt, mens uovervåede modeller afslører, hvad disse forbindelser er. Uovervået er vejen at gå, hvis du har brug for at træne en model til at afsløre indsigt fra data, som f.eks. i afvigelsesdetektering eller procesoptimering.

3. Fordelt træning

Fordelt træning er en mere specifik teknik i ML-modeltræning. Den kan være enten overvåget eller uovervået og fordeler arbejdsbyrden over flere processorer for at accelerere processen. I stedet for at køre ét datasæt ad gangen gennem en model, bruger denne tilgang distribueret beregning til at behandle multiple datasæt samtidigt.

Fordi den kører mere på én gang, kan fordelte træning betydeligt forkorte den tid, det tager at træne en model. Denne hastighed giver også mulighed for at skabe mere nøjagtige algoritmer, da du kan gøre mere for at finjustere dem inden for samme tidsramme.

4. Multitasklæring

Multitasklæring er en anden type ML-træning, der gør flere ting samtidigt. I disse teknikker lærer du en model at udføre flere relaterede opgaver på én gang i stedet for at lære nye ting én ad gangen. Idéen er, at denne gruppe-tilgang producerer bedre resultater end nogen enkelt opgave kan.

Multitasklæring er nyttig, når du har to problemer med overlap mellem deres datasæt. Hvis det ene har mindre mærket information end det andet, kan det, modellen lærer fra det mere velafbalancerede sæt, hjælpe den med at forstå det mindre.

5. Overført læring

Overført læring er lignende, men tager en mere lineær tilgang. Denne teknik lærer en model en opgave og bruger derefter denne som en baseline til at starte læring af noget relateret. Som følge heraf kan algoritmen blive mere og mere nøjagtig over tid og håndtere mere komplekse problemer.

Mange dybe læring-algoritmer bruger overført læring, fordi det er en god måde at bygge op til stadig mere udfordrende og komplekse opgaver. Da dyb læring står for 40% af den årlige værdi af alle dataanalyser, er det værd at vide, hvordan disse modeller kommer til.

Maskinlæringsmodeltræning er et bredt felt

Disse fem teknikker er kun et udvalg af, hvordan du kan træne en maskinlæringsmodel. De grundlæggende principper forbliver de samme på tværs af forskellige tilgange, men ML-modeltræning er et stort og varieret område. Nye læringmetoder vil opstå, da teknologien forbedres, og dette felt vil blive endnu bredere.

Zac Amos er en teknisk forfatter, der fokuserer på kunstig intelligens. Han er også Features Editor på ReHack, hvor du kan læse mere af hans arbejde.