Modele i platformy AI

Co to jest NLP (Przetwarzanie Języka Naturalnego)?

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Przetwarzanie Języka Naturalnego (NLP) jest studium i zastosowaniem technik i narzędzi, ktÃģre umoÅžliwiają komputerom przetwarzanie, analizę, interpretację i wnioskowanie o języku ludzkim. NLP jest dziedziną interdyscyplinarną i łączy techniki ustanowione w dziedzinach takich jak lingwistyka i informatyka. Te techniki są stosowane w połączeniu z AI w celu tworzenia chatbotÃģw i asystentÃģw cyfrowych, takich jak Google Assistant i Amazon’s (AMZN ) Alexa.

Zajmijmy się bliÅžej racjonalnością za Przetwarzaniem Języka Naturalnego, niektÃģrymi z technik stosowanych w NLP oraz niektÃģrymi przypadkami uÅžycia NLP.

Dlaczego Przetwarzanie Języka Naturalnego (NLP) jest waÅžne

Aby komputery mogły interpretować język ludzki, muszą być przekształcone w postać, ktÃģrą komputer moÅže manipulować. Jednak nie jest to tak proste, jak przekształcenie danych tekstowych w liczby. Aby wywnioskować znaczenie z języka ludzkiego, muszą być wyodrębnione wzorce z setek lub tysięcy słÃģw, ktÃģre tworzą dokument tekstowy. Nie jest to łatwe zadanie. Są niewiele twardych i szybkich zasad, ktÃģre mogą być stosowane do interpretacji języka ludzkiego. Na przykład, ten sam zestaw słÃģw moÅže oznaczać rÃģÅžne rzeczy w zaleÅžności od kontekstu. Język ludzki jest złoÅžonym i często niejasnym, a zdanie moÅže być wypowiedziane ze szczerością lub sarkazmem.

Pomimo tego, istnieją pewne ogÃģlne wytyczne, ktÃģre mogą być stosowane przy interpretowaniu słÃģw i znakÃģw, takich jak znak „s” uÅžywany do oznaczenia, Åže przedmiot jest liczony. Te ogÃģlne wytyczne muszą być stosowane w połączeniu z sobą, aby wyodrębnić znaczenie z tekstu, aby utworzyć funkcje, ktÃģre mogą być interpretowane przez algorytm uczenia maszynowego.

Przetwarzanie Języka Naturalnego obejmuje zastosowanie rÃģÅžnych algorytmÃģw, ktÃģre mogą przekształcić nieustrukturyzowane dane w strukturyzowane dane. Jeśli te algorytmy są stosowane w niewłaściwy sposÃģb, komputer często nie jest w stanie wywnioskować poprawnego znaczenia z tekstu. MoÅže to być często widoczne w tłumaczeniu tekstu między językami, gdzie dokładne znaczenie zdania jest często tracone. ChociaÅž tłumaczenie maszynowe znacznie się poprawiło w ciągu ostatnich kilku lat, błędy tłumaczenia maszynowego nadal zdarzają się często.

Techniki Przetwarzania Języka Naturalnego (NLP)

Photo: Tamur via WikiMedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:ParseTree.svg)

Wiele z technik, ktÃģre są stosowane w przetwarzaniu języka naturalnego, moÅže być umieszczone w jednej z dwÃģch kategorii: składnia lub semantyka. Techniki składniowe są tymi, ktÃģre dotyczą kolejności słÃģw, podczas gdy techniki semantyczne są tymi, ktÃģre dotyczą znaczenia słÃģw.

Techniki NLP Składniowe

Przykłady składni obejmują:

  • Lematyzacja
  • Segmentacja morfologiczna
  • Oznaczanie części mowy
  • Parsowanie
  • Rozdzielanie zdań
  • Odcięcie
  • Segmentacja słÃģw

Lematyzacja odnosi się do destylacji rÃģÅžnych odmian słowa do jednej postaci. Lematyzacja bierze rzeczy takie jak czasy i liczby mnogie i upraszcza je, na przykład „stopy” mogą stać się „stopa” i „paski” mogą stać się „pasek”. Ta uproszczona postać słowa ułatwia algorytmowi interpretację słÃģw w dokumencie.

Segmentacja morfologiczna jest procesem dzielenia słÃģw na morfemy lub podstawowe jednostki słowa. Te jednostki są rzeczami takimi jak wolne morfemy (ktÃģre mogą samodzielnie funkcjonować jako słowa) i przedrostki lub przyrostki.

Oznaczanie części mowy jest po prostu procesem identyfikacji, jaka część mowy jest kaÅžde słowo w wejściowym dokumencie.

Parsowanie odnosi się do analizy wszystkich słÃģw w zdaniu i skorelowania ich z formalnymi etykietami gramatycznymi lub wykonywania analizy gramatycznej dla wszystkich słÃģw.

Rozdzielanie zdań, lub segmentacja granic zdań, odnosi się do decyzji, gdzie zdanie zaczyna się i kończy.

Odcięcie jest procesem redukowania słÃģw do postaci korzeniowej słowa. Na przykład, połączone, połączenie i połączenia byłyby wszystkie odcięte do „połączyć”.

Segmentacja słÃģw jest procesem dzielenia duÅžych części tekstu na małe jednostki, ktÃģre mogą być słowami lub odciętymi/lematyzowanymi jednostkami.

Techniki NLP Semantyczne

Techniki semantyczne NLP obejmują techniki takie jak:

  • Rozpoznawanie nazwanych jednostek
  • Generowanie języka naturalnego
  • RozrÃģÅžnianie znaczenia słÃģw

Rozpoznawanie nazwanych jednostek obejmuje oznaczanie pewnych części tekstu, ktÃģre mogą być umieszczone w jednej z wielu predefiniowanych grup. Predefiniowane kategorie obejmują rzeczy takie jak daty, miasta, miejsca, firmy i osoby.

Generowanie języka naturalnego jest procesem uÅžywania baz danych do transformacji strukturyzowanych danych w język naturalny. Na przykład, statystyki o pogodzie, takie jak temperatura i prędkość wiatru, mogą być podsumowane w języku naturalnym.

RozrÃģÅžnianie znaczenia słÃģw jest procesem przypisywania znaczenia słowom w tekście na podstawie kontekstu, w ktÃģrym występują.

Głębokie Modele Uczenia Maszynowego Dla NLP

Regularne wielowarstwowe perceptrony są niezdolne do radzenia sobie z interpretacją sekwencyjnych danych, gdzie kolejność informacji jest waÅžna. Aby poradzić sobie z waÅžnością kolejności w sekwencyjnych danych, uÅžywa się typu sieci neuronowej, ktÃģra zachowuje informacje z poprzednich krokÃģw czasowych podczas treningu.

Sieci Neuronowe Rekurencyjne są typem sieci neuronowej, ktÃģra przechodzi przez dane z poprzednich krokÃģw czasowych, biorąc je pod uwagę podczas obliczania wag bieŞącego kroku czasowego. Podstawowo, sieci neuronowe rekurencyjne mają trzy parametry, ktÃģre są uÅžywane podczas przodu treningu: macierz oparta na poprzednim ukrytym stanie, macierz oparta na bieŞącym wejściu i macierz pomiędzy stanem ukrytym a wyjściem. PoniewaÅž sieci neuronowe rekurencyjne mogą brać pod uwagę informacje z poprzednich krokÃģw czasowych, mogą wyodrębnić istotne wzorce z danych tekstowych, biorąc pod uwagę wcześniejsze słowa w zdaniu podczas interpretacji znaczenia słowa.

Inny typ głębokiej architektury uczenia maszynowego stosowany do przetwarzania danych tekstowych to Sieć Pamięciowa Długoterminowej (LSTM). Sieci LSTM są podobne do sieci neuronowych rekurencyjnych w strukturze, ale ze względu na pewne rÃģÅžnice w ich architekturze, mają tendencję do lepszego działania niÅž sieci neuronowe rekurencyjne. Unikają pewnego problemu, ktÃģry często występuje podczas uÅžywania sieci neuronowych rekurencyjnych, zwanego problemem wybuchających gradientÃģw.

Te głębokie sieci neuronowe mogą być albo jednokierunkowe, albo dwukierunkowe. Sieci dwukierunkowe są w stanie brać pod uwagę nie tylko słowa, ktÃģre poprzedzają bieŞące słowo, ale takÅže słowa, ktÃģre następują po nim. ChociaÅž prowadzi to do wyÅžszej dokładności, jest bardziej kosztowne obliczeniowo.

Przypadki UÅžycia Przetwarzania Języka Naturalnego (NLP)

Photo: mohammed_hassan via Pixabay, Pixabay License (https://pixabay.com/illustrations/chatbot-chat-application-artificial-3589528/)

PoniewaÅž Przetwarzanie Języka Naturalnego obejmuje analizę i manipulację językami ludzkimi, ma niezwykle szeroki zakres zastosowań. MoÅžliwe zastosowania NLP obejmują chatboty, asystentÃģw cyfrowych, analizę nastrojÃģw, organizację dokumentÃģw, rekrutację talentÃģw i opiekę zdrowotną.

Chatboty i asystenci cyfrowi, takie jak Amazon’s Alexa i Google Assistant, są przykładami platform rozpoznawania i syntezowania mowy, ktÃģre uÅžywają NLP do interpretacji i odpowiedzi na polecenia głosowe. Te asystenci cyfrowi pomagają ludziom w szerokim zakresie zadań, pozwalając im przerzucić niektÃģre z ich zadań poznawczych na inny urządzenie i uwolnić niektÃģre z ich mocy mÃģzgu na inne, bardziej waÅžne rzeczy. Zamiast szukać najlepszej trasy do banku w zajętym poranku, moÅžemy po prostu poprosić naszego asystenta cyfrowego, aby to zrobił.

Analiza nastrojÃģw jest uÅžyciem technik NLP do badania reakcji i uczuć ludzi na zjawisko, tak jak jest ono komunikowane przez ich uÅžycie języka. Przechwycenie nastroju wypowiedzi, takiego jak interpretacja, czy recenzja produktu jest dobra czy zła, moÅže dostarczyć firmom znacznych informacji na temat tego, jak ich produkt jest odbierany.

Automatyczna organizacja dokumentÃģw tekstowych jest innym zastosowaniem NLP. Firmy takie jak Google i Yahoo uÅžywają algorytmÃģw NLP do klasyfikacji dokumentÃģw e-mail, umieszczając je w odpowiednich kategoriach, takich jak „społeczne” lub „promocje”. UÅžywają rÃģwnieÅž tych technik do identyfikacji spamu i zapobiegania mu, aby trafił do Twojej skrzynki.

Grupy rÃģwnieÅž opracowały techniki NLP, ktÃģre są uÅžywane do identyfikacji potencjalnych kandydatÃģw do pracy, znajdując ich na podstawie odpowiednich umiejętności. MenadÅžerowie ds. rekrutacji rÃģwnieÅž uÅžywają technik NLP, aby pomÃģc im przeglądać listy kandydatÃģw.

Techniki NLP są rÃģwnieÅž uÅžywane do poprawy opieki zdrowotnej. NLP moÅže być uÅžyty do poprawy wykrywania chorÃģb. Rejestracje zdrowia mogą być analizowane, a objawy mogą być wyodrębnione przez algorytmy NLP, ktÃģre mogą być następnie uÅžyte do sugerowania moÅžliwych rozpoznań. Jednym z przykładÃģw jest platforma Amazon’s Comprehend Medical, ktÃģra analizuje rejestracje zdrowia i wyodrębnia choroby i leczenia. Zastosowania opieki zdrowotnej NLP sięgają rÃģwnieÅž do zdrowia psychicznego. Są aplikacje takie jak WoeBot, ktÃģre rozmawiają z uÅžytkownikami przez rÃģÅžne techniki zarządzania lękami oparte na Terapii Poznawczo-Behawioralnej.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, Åže pomoÅže innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.