AI-modeller och plattformar
Vad ÃĪr NLP (Natural Language Processing)?
Natural Language Processing (NLP) ÃĪr studiet och tillÃĪmpningen av tekniker och verktyg som mÃķjliggÃķr fÃķr datorer att bearbeta, analysera, tolka och resonera om mÃĪnskligt sprÃĨk. NLP ÃĪr ett tvÃĪrvetenskapligt omrÃĨde och kombinerar tekniker etablerade inom omrÃĨden som lingvistik och datavetenskap. Dessa tekniker anvÃĪnds i kombination med AI fÃķr att skapa chatbots och digitala assistenter som Google Assistant och Amazons Alexa.
LÃĨt oss ta oss tid att utforska bakgrunden till Natural Language Processing, nÃĨgra av de tekniker som anvÃĪnds i NLP och nÃĨgra vanliga anvÃĪndningsfall fÃķr NLP.
VarfÃķr Natural Language Processing (NLP) ÃĪr viktigt
FÃķr att datorer ska kunna tolka mÃĪnskligt sprÃĨk mÃĨste de omvandlas till en form som en dator kan manipulera. Men detta ÃĪr inte sÃĨ enkelt som att omvandla textdata till siffror. FÃķr att utvinna mening frÃĨn mÃĪnskligt sprÃĨk mÃĨste mÃķnster extraheras frÃĨn de hundratals eller tusentals ord som utgÃķr en textdokument. Detta ÃĪr ingen lÃĪtt uppgift. Det finns fÃĨ hÃĨrda och snabba regler som kan tillÃĪmpas pÃĨ tolkningen av mÃĪnskligt sprÃĨk. Till exempel kan samma uppsÃĪttning ord ha olika betydelser beroende pÃĨ sammanhanget. MÃĪnskligt sprÃĨk ÃĪr ett komplext och ofta tvetydigt fenomen, och ett uttalande kan uttalas med uppriktighet eller sarkasm.
Trots detta finns det nÃĨgra allmÃĪnna riktlinjer som kan anvÃĪndas nÃĪr man tolkar ord och tecken, sÃĨsom att tecknet âsâ anvÃĪnds fÃķr att ange att en artikel ÃĪr i pluralform. Dessa allmÃĪnna riktlinjer mÃĨste anvÃĪndas i kombination med varandra fÃķr att utvinna mening frÃĨn texten, fÃķr att skapa funktioner som en maskinlÃĪringsalgoritm kan tolka.
Natural Language Processing innebÃĪr tillÃĪmpningen av olika algoritmer som kan ta ostrukturerad data och omvandla den till strukturerad data. Om dessa algoritmer tillÃĪmpas pÃĨ fel sÃĪtt kommer datorn ofta att misslyckas med att utvinna den riktiga meningen frÃĨn texten. Detta kan ofta ses i ÃķversÃĪttningen av text mellan sprÃĨk, dÃĪr den exakta meningen av meningen ofta fÃķrloras. Medan maskinÃķversÃĪttning har fÃķrbÃĪttrats avsevÃĪrt under de senaste ÃĨren fÃķrekommer fortfarande maskinÃķversÃĪttningsfel.
Natural Language Processing (NLP) tekniker

Foto: Tamur via WikiMedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:ParseTree.svg)
MÃĨnga av de tekniker som anvÃĪnds i natural language processing kan placeras i en av tvÃĨ kategorier: syntax eller semantik. Syntaxtekniker ÃĪr de som hanterar ordens ordning, medan semantiska tekniker ÃĪr de som involverar ordens betydelse.
Syntax NLP-tekniker
Exempel pÃĨ syntax inkluderar:
- Lematisering
- Morfologisk segmentering
- Part-of-speech-tagging
- Parsing
- Meningbrytning
- Stamning
- Orddelning
Lematisering innebÃĪr att destillera de olika bÃķjningarna av ett ord till en enda form. Lematisering tar saker som tempus och pluralformer och fÃķrenklar dem, till exempel kan âfÃķtterâ bli âfotâ och ârÃĪnderâ kan bli ârandâ. Denna fÃķrenklade ordform gÃķr det lÃĪttare fÃķr en algoritm att tolka orden i ett dokument.
Morfologisk segmentering ÃĪr processen att dela upp ord i morfem eller de grundlÃĪggande enheterna i ett ord. Dessa enheter ÃĪr saker som fria morfem (som kan stÃĨ som ord) och prefix eller suffix.
Part-of-speech-tagging ÃĪr enkelt processen att identifiera vilken del av talet varje ord i en inmatningsdokument ÃĪr.
Parsing refererar till att analysera alla ord i en mening och korrelera dem med deras formella grammatiska etiketter eller gÃķra grammatisk analys fÃķr alla ord.
Meningbrytning, eller meningsgrÃĪnssegmentering, refererar till att bestÃĪmma var en mening bÃķrjar och slutar.
Stamning ÃĪr processen att reducera ord till roten av ordet. Till exempel skulle âanslutnaâ, âanslutningâ och âanslutningarâ alla reduceras till âanslutaâ.
Orddelning ÃĪr processen att dela upp stora textstycken i smÃĨ enheter, som kan vara ord eller stamade/lematiserade enheter.
Semantiska NLP-tekniker
Semantiska NLP-tekniker inkluderar tekniker som:
- Namngiven entitetsigenkÃĪnning
- Naturlig sprÃĨkgenerering
- Ordbetydelsediskriminering
Namngiven entitetsigenkÃĪnning innebÃĪr att markera vissa textdelar som kan placeras i en av flera fÃķrdefinierade grupper. FÃķrdefinierade kategorier inkluderar saker som datum, stÃĪder, platser, fÃķretag och individer.
Naturlig sprÃĨkgenerering ÃĪr processen att anvÃĪnda databaser fÃķr att omvandla strukturerad data till naturligt sprÃĨk. Till exempel kunde statistik om vÃĪdret, som temperatur och vindhastighet, sammanfattas med naturligt sprÃĨk.
Ordbetydelsediskriminering ÃĪr processen att tilldela betydelse till ord inom en text baserat pÃĨ sammanhanget som orden fÃķrekommer i.
DjupinlÃĪrningsmodeller fÃķr NLP
ReguljÃĪra multilagrade perceptron ÃĪr ofÃķrmÃķgna att hantera tolkningen av sekventiell data, dÃĪr ordningen pÃĨ informationen ÃĪr viktig. FÃķr att hantera ordningens betydelse i sekventiell data anvÃĪnds en typ av neurala nÃĪtverk som bevarar information frÃĨn tidigare tidssteg under utbildningen.
Recurrent Neural Networks ÃĪr typer av neurala nÃĪtverk som loopar Ãķver data frÃĨn tidigare tidssteg, och tar dem i beaktande nÃĪr de berÃĪknar vikterna fÃķr det aktuella tidssteget. I princip har RNN:er tre parametrar som anvÃĪnds under den frÃĪmre utbildningspassagen: en matris baserad pÃĨ den tidigare dolda tillstÃĨndet, en matris baserad pÃĨ den aktuella inmatningen och en matris som ÃĪr mellan det dolda tillstÃĨndet och utmatningen. Eftersom RNN:er kan ta information frÃĨn tidigare tidssteg i beaktande kan de extrahera relevanta mÃķnster frÃĨn textdata genom att ta tidigare ord i meningen i beaktande nÃĪr de tolkar meningen av ett ord.
En annan typ av djupinlÃĪrningsarkitektur som anvÃĪnds fÃķr att bearbeta textdata ÃĪr en Long Short-Term Memory (LSTM)-nÃĪtverk. LSTM-nÃĪtverk ÃĪr liknande RNN:er i struktur, men pÃĨ grund av vissa skillnader i deras arkitektur tenderar de att fungera bÃĪttre ÃĪn RNN:er. De undviker ett specifikt problem som ofta fÃķrekommer nÃĪr man anvÃĪnder RNN:er som kallas exploderande gradientproblem.
Dessa djupa neurala nÃĪtverk kan vara antingen unidirektionella eller bidirektionella. Bidirektionella nÃĪtverk kan ta inte bara de ord som fÃķregÃĨr det aktuella ordet i beaktande, utan ocksÃĨ de ord som fÃķljer efter det. Medan detta leder till hÃķgre precision ÃĪr det mer berÃĪkningskrÃĪvande.
AnvÃĪndningsfall fÃķr Natural Language Processing (NLP)

Foto: mohammed_hassan via Pixabay, Pixabay-licens (https://pixabay.com/illustrations/chatbot-chat-application-artificial-3589528/)
Eftersom Natural Language Processing innebÃĪr analysen och manipulationen av mÃĪnskliga sprÃĨk har det en otroligt bred tillÃĪmpning. MÃķjliga tillÃĪmpningar fÃķr NLP inkluderar chatbots, digitala assistenter, sentimentanalys, dokumentorganisation, talangrekrytering och hÃĪlsovÃĨrd.
Chatbots och digitala assistenter som Amazons Alexa och Google Assistant ÃĪr exempel pÃĨ rÃķstigenkÃĪnning och syntesplattformar som anvÃĪnder NLP fÃķr att tolka och svara pÃĨ rÃķstkommandon. Dessa digitala assistenter hjÃĪlper mÃĪnniskor med en mÃĪngd olika uppgifter, och lÃĨter dem avlasta en del av sina kognitiva uppgifter till en annan enhet och frigÃķra en del av sin hjÃĪrnkraft fÃķr andra, viktigare saker. IstÃĪllet fÃķr att leta upp den bÃĪsta vÃĪgen till banken pÃĨ en hektisk morgon kan vi bara lÃĨta vÃĨr digitala assistent gÃķra det.
Sentimentanalys ÃĪr anvÃĪndningen av NLP-tekniker fÃķr att studera mÃĪnniskors reaktioner och kÃĪnslor till ett fenomen, som kommuniceras genom deras anvÃĪndning av sprÃĨk. Att fÃĨnga sentimentet i ett uttalande, som att tolka om en produktrecension ÃĪr bra eller dÃĨlig, kan ge fÃķretag betydande information om hur deras produkt tas emot.
Att automatiskt organisera textdokument ÃĪr en annan tillÃĪmpning av NLP. FÃķretag som Google och Yahoo anvÃĪnder NLP-algoritmer fÃķr att klassificera e-postdokument, och placera dem i lÃĪmpliga kategorier som âsocialtâ eller âreklamâ. De anvÃĪnder ocksÃĨ dessa tekniker fÃķr att identifiera skrÃĪppost och fÃķrhindra att den nÃĨr din inkorg.
Grupper har ocksÃĨ utvecklat NLP-tekniker fÃķr att identifiera potentiella jobbkandidater, och hitta dem baserat pÃĨ relevanta fÃĪrdigheter. Rekryteringschefer anvÃĪnder ocksÃĨ NLP-tekniker fÃķr att hjÃĪlpa dem sortera genom listor av sÃķkande.
NLP-tekniker anvÃĪnds ocksÃĨ fÃķr att fÃķrbÃĪttra hÃĪlsovÃĨrden. NLP kan anvÃĪndas fÃķr att fÃķrbÃĪttra upptÃĪckten av sjukdomar. HÃĪlsojournaler kan analyseras och symtom extraheras av NLP-algoritmer, som sedan kan anvÃĪndas fÃķr att fÃķreslÃĨ mÃķjliga diagnoser. Ett exempel pÃĨ detta ÃĪr Amazons Comprehend Medical-plattform, som analyserar hÃĪlsojournaler och extraherar sjukdomar och behandlingar. HÃĪlsovÃĨrdstillÃĪmpningar av NLP strÃĪcker sig ocksÃĨ till mental hÃĪlsa. Det finns appar som WoeBot, som talar med anvÃĪndare genom en mÃĪngd ÃĨngesthanteringsmetoder baserade pÃĨ kognitiv beteendeterapi.












