AI-modeller og platforme
Hvad er NLP (Naturlig Sprogbehandling)?
Naturlig Sprogbehandling (NLP) er studiet og anvendelsen af teknikker og værktøjer, der muliggør, at computere kan behandle, analysere, fortolke og resonere om menneskesprog. NLP er et tværfagligt område og kombinerer teknikker etableret i fag som lingvistik og datalogi. Disse teknikker anvendes i samarbejde med AI til at skabe chatbots og digitale assistenter som Google Assistant og Amazon’s Alexa.
Lad os tage lidt tid til at udforske baggrunden for Naturlig Sprogbehandling, nogle af de teknikker, der anvendes i NLP, og nogle almindelige anvendelsesområder for NLP.
Hvorfor Naturlig Sprogbehandling (NLP) er vigtig
For at computere kan fortolke menneskesprog, skal de konverteres til en form, som en computer kan manipulere. Det er dog ikke så enkelt som at konvertere tekstdata til tal. For at udlede mening fra menneskesprog, skal mønstre udtrækkes fra de hundredvis eller tusindvis af ord, der udgør en tekstdokument. Dette er ingen let opgave. Der er få faste regler, der kan anvendes til fortolkning af menneskesprog. For eksempel kan det samme sæt af ord have forskellige betydninger afhængigt af konteksten. Menneskesprog er et komplekst og ofte tvetydigt fænomen, og en udtalelse kan udtrykkes med oprigtighed eller sarkasme.
Trods dette findes der nogle generelle retningslinjer, der kan anvendes, når man fortolker ord og tegn, såsom tegnet “s”, der anvendes til at angive, at et objekt er flertal. Disse generelle retningslinjer skal anvendes i samarbejde med hinanden for at udlede mening fra teksten og skabe funktioner, som en maskinel læringsalgoritme kan fortolke.
Naturlig Sprogbehandling indebærer anvendelsen af forskellige algoritmer, der kan tage ikke-struktureret data og konvertere dem til struktureret data. Hvis disse algoritmer anvendes på forkert måde, vil computeren ofte fejlfortolke meningen i teksten. Dette kan ofte ses i oversættelsen af tekst mellem sprog, hvor den præcise betydning af sætningen ofte går tabt. Mens maskinoversættelse har forbedret sig betydeligt over de seneste år, sker maskinoversættelsesfejl stadig hyppigt.
Naturlig Sprogbehandling (NLP) Teknikker

Foto: Tamur via WikiMedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:ParseTree.svg)
Mange af de teknikker, der anvendes i naturlig sprogbehandling, kan inddeles i to kategorier: syntaks eller semantik. Syntaksteknikker er dem, der beskæftiger sig med ordens rækkefølge, mens semantiske teknikker er dem, der handler om ordens betydning.
Syntaks NLP Teknikker
Eksempler på syntaks inkluderer:
- Lematisering
- Morfologisk segmentering
- Part-of-Speech tagging
- Parsing
- Sætningsafbrud
- Stamning
- Ordsegmentering
Lematisering refererer til at reducere de forskellige bøjninger af et ord til en enkelt form. Lematisering tager ting som tid og flertal og forenkler dem, for eksempel kan “fødder” blive “fod” og “striber” kan blive “streg”. Denne forenklede ordform gør det lettere for en algoritme at fortolke ordene i en dokument.
Morfologisk segmentering er processen med at dividere ord i morfemer eller de grundlæggende enheder af et ord. Disse enheder er ting som frie morfemer (der kan stå alene som ord) og præfikser eller suffikser.
Part-of-speech tagging er blot processen med at identificere, hvilken del af tale hver ord i en inputdokument er.
Parsing refererer til at analysere alle ord i en sætning og korrelere dem med deres formelle grammatikmærker eller at udføre grammatisk analyse for alle ordene.
Sætningsafbrud, eller sætningsgrænsesegmentering, refererer til at afgøre, hvor en sætning begynder og slutter.
Stamning er processen med at reducere ord til deres rodform. For eksempel ville “tilsluttet”, “tilslutning” og “tilslutninger” alle blive reduceret til “tilslut”.
Ordsegmentering er processen med at dividere store stykker af tekst ned i små enheder, der kan være ord eller stammede/lematiserede enheder.
Semantiske NLP Teknikker
Semantiske NLP-teknikker inkluderer teknikker som:
- Navngivet enhedsigenkendelse
- Naturlig sproggenerering
- Ord-sans-differentiering
Navngivet enhedsigenkendelse indebærer at mærke bestemte tekstdele, der kan placeres i en af en række foruddefinerede grupper. Foruddefinerede kategorier inkluderer ting som datoer, byer, steder, virksomheder og personer.
Naturlig sproggenerering er processen med at anvende databases til at omdanne struktureret data til naturligt sprog. For eksempel kunne statistik om vejret, som temperatur og vindhastighed, sammenfattes med naturligt sprog.
Ord-sans-differentiering er processen med at tildele betydning til ord i en tekst baseret på konteksten, de optræder i.
Dybe Læringsmodeller til NLP
Regulære multilag-perceptroner kan ikke håndtere fortolkningen af sekventielle data, hvor rækkefølgen af informationen er vigtig. For at kunne håndtere rækkefølgen af sekventielle data, anvendes en type neural netværk, der bevarer information fra tidligere tidspunkter i træningen.
Rekurrente neurale netværk er typer af neurale netværk, der løber over data fra tidligere tidspunkter, og tager dem i betragtning, når de beregner vægtningen af det nuværende tidspunkt. I virkeligheden har RNN’er tre parametre, der anvendes under den fremadgående træningspassering: en matrix baseret på den tidligere skjulte tilstand, en matrix baseret på den nuværende input, og en matrix, der er mellem den skjulte tilstand og output. Fordi RNN’er kan tage information fra tidligere tidspunkter i betragtning, kan de udtrække relevante mønstre fra tekstdata ved at tage tidligere ord i sætningen i betragtning, når de fortolker meningen af et ord.
En anden type dyb læringsarkitektur, der anvendes til at behandle tekstdata, er en Lang Kort-Term-Hukommelse (LSTM) netværk. LSTM-netværk er lignende til RNN’er i struktur, men på grund af nogle forskelle i deres arkitektur, tendere de til at fungere bedre end RNN’er. De undgår et bestemt problem, der ofte opstår, når man anvender RNN’er, kaldet eksploderende gradient-problemet.
Disse dybe neurale netværk kan være enten unidirektionelle eller bidirektionelle. Bidirektionelle netværk kan tage ikke kun de ord, der kommer før det nuværende ord, i betragtning, men også de ord, der kommer efter det. Selvom dette fører til højere nøjagtighed, er det mere beregningskrævende.
Anvendelsesområder for Naturlig Sprogbehandling (NLP)

Foto: mohammed_hassan via Pixabay, Pixabay License (https://pixabay.com/illustrations/chatbot-chat-application-artificial-3589528/)
Fordi Naturlig Sprogbehandling indebærer analysen og manipulationen af menneskesprog, har det en utrolig bred vifte af anvendelsesområder. Mulige anvendelsesområder for NLP inkluderer chatbots, digitale assistenter, sentimentanalyse, dokumentorganisation, talentrekruttering og sundhedspleje.
Chatbots og digitale assistenter som Amazon’s Alexa og Google Assistant er eksempler på talegenkendelse og synteseplatforme, der anvender NLP til at fortolke og svare på vokale kommandoer. Disse digitale assistenter hjælper mennesker med en lang række opgaver, og lader dem aflaste nogle af deres kognitive opgaver til en anden enhed og frigøre noget af deres hjernekapacitet til andre, vigtigere ting. I stedet for at søge efter den bedste rute til banken på en travl morgen, kan vi blot lade vores digitale assistent gøre det.
Sentimentanalyse er anvendelsen af NLP-teknikker til at studere menneskers reaktioner og følelser over for et fænomen, som kommunikeret gennem deres sprogbrug. At fange sentimentet af en udtalelse, som at fortolke, om en anmeldelse af et produkt er god eller dårlig, kan give virksomheder væsentlig information om, hvordan deres produkt modtages.
Automatisk organisering af tekstdokumenter er et andet anvendelsesområde for NLP. Virksomheder som Google og Yahoo anvender NLP-algoritmer til at klassificere e-maildokumenter, og placerer dem i de rigtige mapper, såsom “sociale” eller “fremhævninger”. De anvender også disse teknikker til at identificere spam og forhindre, at det når din indbakke.
Grupper har også udviklet NLP-teknikker til at identificere potentielle jobkandidater, og finder dem baseret på relevante færdigheder. Rekrutteringschefer anvender også NLP-teknikker til at hjælpe dem med at sortere gennem lister af ansøgere.
NLP-teknikker anvendes også til at forbedre sundhedsplejen. NLP kan anvendes til at forbedre sygdomsdiagnosticering. Sundhedsjournaler kan analyseres, og symptomer kan udtrækkes af NLP-algoritmer, der derefter kan anvendes til at foreslå mulige diagnoser. Et eksempel på dette er Amazon’s (AMZN ) Comprehend Medical-platform, der analyserer sundhedsjournaler og udtrækker sygdomme og behandlinger. Sundhedsanvendelser af NLP omfatter også psykisk sundhed. Der er apps som WoeBot, der taler brugere igennem en række angstbehandlings-teknikker baseret på kognitiv adfærdsterapi.












