AI-modeller og platforme

Hvad er NLP (Naturlig Sprogbehandling)?

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Naturlig Sprogbehandling (NLP) er studiet og anvendelsen af teknikker og vÃĶrktÃļjer, der muliggÃļr, at computere kan behandle, analysere, fortolke og resonere om menneskesprog. NLP er et tvÃĶrfagligt omrÃĨde og kombinerer teknikker etableret i fag som lingvistik og datalogi. Disse teknikker anvendes i samarbejde med AI til at skabe chatbots og digitale assistenter som Google Assistant og Amazon’s Alexa.

Lad os tage lidt tid til at udforske baggrunden for Naturlig Sprogbehandling, nogle af de teknikker, der anvendes i NLP, og nogle almindelige anvendelsesomrÃĨder for NLP.

Hvorfor Naturlig Sprogbehandling (NLP) er vigtig

For at computere kan fortolke menneskesprog, skal de konverteres til en form, som en computer kan manipulere. Det er dog ikke sÃĨ enkelt som at konvertere tekstdata til tal. For at udlede mening fra menneskesprog, skal mÃļnstre udtrÃĶkkes fra de hundredvis eller tusindvis af ord, der udgÃļr en tekstdokument. Dette er ingen let opgave. Der er fÃĨ faste regler, der kan anvendes til fortolkning af menneskesprog. For eksempel kan det samme sÃĶt af ord have forskellige betydninger afhÃĶngigt af konteksten. Menneskesprog er et komplekst og ofte tvetydigt fÃĶnomen, og en udtalelse kan udtrykkes med oprigtighed eller sarkasme.

Trods dette findes der nogle generelle retningslinjer, der kan anvendes, nÃĨr man fortolker ord og tegn, sÃĨsom tegnet “s”, der anvendes til at angive, at et objekt er flertal. Disse generelle retningslinjer skal anvendes i samarbejde med hinanden for at udlede mening fra teksten og skabe funktioner, som en maskinel lÃĶringsalgoritme kan fortolke.

Naturlig Sprogbehandling indebÃĶrer anvendelsen af forskellige algoritmer, der kan tage ikke-struktureret data og konvertere dem til struktureret data. Hvis disse algoritmer anvendes pÃĨ forkert mÃĨde, vil computeren ofte fejlfortolke meningen i teksten. Dette kan ofte ses i oversÃĶttelsen af tekst mellem sprog, hvor den prÃĶcise betydning af sÃĶtningen ofte gÃĨr tabt. Mens maskinoversÃĶttelse har forbedret sig betydeligt over de seneste ÃĨr, sker maskinoversÃĶttelsesfejl stadig hyppigt.

Naturlig Sprogbehandling (NLP) Teknikker

Foto: Tamur via WikiMedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:ParseTree.svg)

Mange af de teknikker, der anvendes i naturlig sprogbehandling, kan inddeles i to kategorier: syntaks eller semantik. Syntaksteknikker er dem, der beskÃĶftiger sig med ordens rÃĶkkefÃļlge, mens semantiske teknikker er dem, der handler om ordens betydning.

Syntaks NLP Teknikker

Eksempler pÃĨ syntaks inkluderer:

  • Lematisering
  • Morfologisk segmentering
  • Part-of-Speech tagging
  • Parsing
  • SÃĶtningsafbrud
  • Stamning
  • Ordsegmentering

Lematisering refererer til at reducere de forskellige bÃļjninger af et ord til en enkelt form. Lematisering tager ting som tid og flertal og forenkler dem, for eksempel kan “fÃļdder” blive “fod” og “striber” kan blive “streg”. Denne forenklede ordform gÃļr det lettere for en algoritme at fortolke ordene i en dokument.

Morfologisk segmentering er processen med at dividere ord i morfemer eller de grundlÃĶggende enheder af et ord. Disse enheder er ting som frie morfemer (der kan stÃĨ alene som ord) og prÃĶfikser eller suffikser.

Part-of-speech tagging er blot processen med at identificere, hvilken del af tale hver ord i en inputdokument er.

Parsing refererer til at analysere alle ord i en sÃĶtning og korrelere dem med deres formelle grammatikmÃĶrker eller at udfÃļre grammatisk analyse for alle ordene.

SÃĶtningsafbrud, eller sÃĶtningsgrÃĶnsesegmentering, refererer til at afgÃļre, hvor en sÃĶtning begynder og slutter.

Stamning er processen med at reducere ord til deres rodform. For eksempel ville “tilsluttet”, “tilslutning” og “tilslutninger” alle blive reduceret til “tilslut”.

Ordsegmentering er processen med at dividere store stykker af tekst ned i smÃĨ enheder, der kan vÃĶre ord eller stammede/lematiserede enheder.

Semantiske NLP Teknikker

Semantiske NLP-teknikker inkluderer teknikker som:

  • Navngivet enhedsigenkendelse
  • Naturlig sproggenerering
  • Ord-sans-differentiering

Navngivet enhedsigenkendelse indebÃĶrer at mÃĶrke bestemte tekstdele, der kan placeres i en af en rÃĶkke foruddefinerede grupper. Foruddefinerede kategorier inkluderer ting som datoer, byer, steder, virksomheder og personer.

Naturlig sproggenerering er processen med at anvende databases til at omdanne struktureret data til naturligt sprog. For eksempel kunne statistik om vejret, som temperatur og vindhastighed, sammenfattes med naturligt sprog.

Ord-sans-differentiering er processen med at tildele betydning til ord i en tekst baseret pÃĨ konteksten, de optrÃĶder i.

Dybe LÃĶringsmodeller til NLP

RegulÃĶre multilag-perceptroner kan ikke hÃĨndtere fortolkningen af sekventielle data, hvor rÃĶkkefÃļlgen af informationen er vigtig. For at kunne hÃĨndtere rÃĶkkefÃļlgen af sekventielle data, anvendes en type neural netvÃĶrk, der bevarer information fra tidligere tidspunkter i trÃĶningen.

Rekurrente neurale netvÃĶrk er typer af neurale netvÃĶrk, der lÃļber over data fra tidligere tidspunkter, og tager dem i betragtning, nÃĨr de beregner vÃĶgtningen af det nuvÃĶrende tidspunkt. I virkeligheden har RNN’er tre parametre, der anvendes under den fremadgÃĨende trÃĶningspassering: en matrix baseret pÃĨ den tidligere skjulte tilstand, en matrix baseret pÃĨ den nuvÃĶrende input, og en matrix, der er mellem den skjulte tilstand og output. Fordi RNN’er kan tage information fra tidligere tidspunkter i betragtning, kan de udtrÃĶkke relevante mÃļnstre fra tekstdata ved at tage tidligere ord i sÃĶtningen i betragtning, nÃĨr de fortolker meningen af et ord.

En anden type dyb lÃĶringsarkitektur, der anvendes til at behandle tekstdata, er en Lang Kort-Term-Hukommelse (LSTM) netvÃĶrk. LSTM-netvÃĶrk er lignende til RNN’er i struktur, men pÃĨ grund af nogle forskelle i deres arkitektur, tendere de til at fungere bedre end RNN’er. De undgÃĨr et bestemt problem, der ofte opstÃĨr, nÃĨr man anvender RNN’er, kaldet eksploderende gradient-problemet.

Disse dybe neurale netvÃĶrk kan vÃĶre enten unidirektionelle eller bidirektionelle. Bidirektionelle netvÃĶrk kan tage ikke kun de ord, der kommer fÃļr det nuvÃĶrende ord, i betragtning, men ogsÃĨ de ord, der kommer efter det. Selvom dette fÃļrer til hÃļjere nÃļjagtighed, er det mere beregningskrÃĶvende.

AnvendelsesomrÃĨder for Naturlig Sprogbehandling (NLP)

Foto: mohammed_hassan via Pixabay, Pixabay License (https://pixabay.com/illustrations/chatbot-chat-application-artificial-3589528/)

Fordi Naturlig Sprogbehandling indebÃĶrer analysen og manipulationen af menneskesprog, har det en utrolig bred vifte af anvendelsesomrÃĨder. Mulige anvendelsesomrÃĨder for NLP inkluderer chatbots, digitale assistenter, sentimentanalyse, dokumentorganisation, talentrekruttering og sundhedspleje.

Chatbots og digitale assistenter som Amazon’s Alexa og Google Assistant er eksempler pÃĨ talegenkendelse og synteseplatforme, der anvender NLP til at fortolke og svare pÃĨ vokale kommandoer. Disse digitale assistenter hjÃĶlper mennesker med en lang rÃĶkke opgaver, og lader dem aflaste nogle af deres kognitive opgaver til en anden enhed og frigÃļre noget af deres hjernekapacitet til andre, vigtigere ting. I stedet for at sÃļge efter den bedste rute til banken pÃĨ en travl morgen, kan vi blot lade vores digitale assistent gÃļre det.

Sentimentanalyse er anvendelsen af NLP-teknikker til at studere menneskers reaktioner og fÃļlelser over for et fÃĶnomen, som kommunikeret gennem deres sprogbrug. At fange sentimentet af en udtalelse, som at fortolke, om en anmeldelse af et produkt er god eller dÃĨrlig, kan give virksomheder vÃĶsentlig information om, hvordan deres produkt modtages.

Automatisk organisering af tekstdokumenter er et andet anvendelsesomrÃĨde for NLP. Virksomheder som Google og Yahoo anvender NLP-algoritmer til at klassificere e-maildokumenter, og placerer dem i de rigtige mapper, sÃĨsom “sociale” eller “fremhÃĶvninger”. De anvender ogsÃĨ disse teknikker til at identificere spam og forhindre, at det nÃĨr din indbakke.

Grupper har ogsÃĨ udviklet NLP-teknikker til at identificere potentielle jobkandidater, og finder dem baseret pÃĨ relevante fÃĶrdigheder. Rekrutteringschefer anvender ogsÃĨ NLP-teknikker til at hjÃĶlpe dem med at sortere gennem lister af ansÃļgere.

NLP-teknikker anvendes ogsÃĨ til at forbedre sundhedsplejen. NLP kan anvendes til at forbedre sygdomsdiagnosticering. Sundhedsjournaler kan analyseres, og symptomer kan udtrÃĶkkes af NLP-algoritmer, der derefter kan anvendes til at foreslÃĨ mulige diagnoser. Et eksempel pÃĨ dette er Amazon’s Comprehend Medical-platform, der analyserer sundhedsjournaler og udtrÃĶkker sygdomme og behandlinger. Sundhedsanvendelser af NLP omfatter ogsÃĨ psykisk sundhed. Der er apps som WoeBot, der taler brugere igennem en rÃĶkke angstbehandlings-teknikker baseret pÃĨ kognitiv adfÃĶrdsterapi.

Blogger og programmÃļr med specialer i Machine Learning og Deep Learning emner. Daniel hÃĨber at hjÃĶlpe andre med at bruge AI's kraft til sociale formÃĨl.