AI-modeller og platforme
Hvordan sprogbehandling forbedres gennem Googles åbne kildekode BERT-model
Bidirectional Encoder Representations fra Transformers, også kendt som BERT; er en træningsmodel, der har forbedret effektiviteten og virkningen af NLP-modeller dramatisk. Nu hvor Google (GOOGL ) har gjort BERT-modeller åbne, kan det forbedre NLP-modeller på tværs af alle brancher. I denne artikel ser vi på, hvordan BERT gør NLP til en af de mest kraftfulde og nyttige AI-løsninger i dagens verden.
Applying BERT-modeller til søgning
Googles søgemaskine er verdenskendt for sin evne til at præsentere relevant indhold, og de har gjort denne naturlige sprogbehandlingsprogram åben til verden.
Evnen til, at et system kan læse og fortolke naturligt sprog, bliver mere og mere vital, da verden eksponentielt producerer nye data. Googles bibliotek af ord betydninger, fraser og generel evne til at præsentere relevant indhold, er åben kildekode. Ud over naturlig sprogbehandling har deres BERT-model evnen til at trække information ud af store mængder ustuktureret data og kan anvendes til at oprette søgegrænseflader til enhver bibliotek. I denne artikel vil vi se, hvordan denne teknologi kan anvendes i energisektoren.
BERT (Bidirectional Encoder Representations fra Transformers) er en for-træningstilgang foreslået af Google AI Language-gruppen, udviklet til at overvinde et almindeligt problem med tidlige NLP-modeller: manglen på tilstrækkelige træningsdata.
Lad os forklare uden at gå for dybt ind i detaljer:
Træning af modeller
Lav-niveau (f.eks. navngivet enhedsgenkendelse, emne segmentering) og høj-niveau (f.eks. sentimentanalyse, talegenkendelse) NLP-opgaver kræver opgave-specifikke annoterede datasæt. Selvom de er svære at komme i gang med og dyre at samle, spiller annoterede datasæt en afgørende rolle i præstationen af både overfladiske og dybe neurale netværksmodeller. Høj-kvalitets slutresultater kunne kun opnås, når millioner eller endda milliarder af annoterede trænings eksempler var tilgængelige. Og det var et problem, der gjorde mange NLP-opgaver utilgængelige. Det var, indtil BERT blev udviklet.
BERT er en generel formål sprogrepræsentationsmodel, trænet på store korpus af uannoteret tekst. Når modellen udsættes for store mængder tekstindhold, lærer den at forstå kontekst og relationer mellem ord i en sætning. I modsætning til tidligere læringsmodeller, der kun repræsenterede betydning på ordniveau (bank ville betyde det samme i “bankkonto” og “græsbanke”), BERT er faktisk interesseret i kontekst. Det vil sige, hvad der kommer før og efter ordet i en sætning. Kontekst viste sig at være en stor manglende evne i NLP-modeller, med en direkte indvirkning på modellens præstation. At designe en kontekst-bevidst model som BERT er kendt af mange som begyndelsen på en ny æra i NLP.
Træning af BERT på store mængder tekstindhold er en teknik kendt som for-træning. Dette betyder, at modellens vægte justeres for generelle tekstforståelsesopgaver, og at mere fin-granedede modeller kan bygges oven på den. Forfatterne har bevist overlegenheden af denne teknik, da de anvendte BERT-baserede modeller på 11 NLP-opgaver og opnåede state-of-the-art resultater.
For-trænede modeller
Det bedste er: for-trænede BERT-modeller er åben kildekode og offentligt tilgængelige. Dette betyder, at alle kan tackle NLP-opgaver og bygge deres modeller oven på BERT. Intet kan slå det, vel? Oh, vent: dette betyder også, at NLP-modeller nu kan trænes (finjusteres) på mindre datasæt, uden behov for at træne fra scratch. Begyndelsen på en ny æra, sandelig.
Disse for-trænede modeller hjælper virksomheder med at reducere omkostningerne og tiden til at implementere NLP-modeller til intern eller ekstern brug. Effektiviteten af vel-trænede NLP-modeller understreges af Michael Alexis, CEO af virtuel team-kulturbygningsvirksomhed, teambuilding.com.
“Den største fordel ved NLP er den skalerbare og konsekvente slutning og behandling af information.” – Michael Alexis, CEO af teambuilding.com
Michael nævner, hvordan NLP kan anvendes til kultur-fremmende programmer såsom icebreakere eller undersøgelser. En virksomhed kan få værdifuld indsigt i, hvordan virksomhedskulturen er, ved at analysere medarbejdernes svar. Dette opnås ikke kun gennem tekstanalyse, men også gennem annotation af tekst. I virkeligheden “læser” modellen også “mellem linjerne” for at trække slutninger om følelse, fornemmelse og overordnet udtryk. BERT kan hjælpe i situationer som denne ved at for-træne modeller med en basis af indikatorer, der kan anvendes til at afsløre nuancerne i sprog og give mere præcise indsigt.
Forbedring af forespørgsler
Evnen til at modellere kontekst har gjort BERT til en NLP-helt og har revolutioneret Google Søgning selv. Herunder er et citat fra Google Søgnings produktteam og deres testoplevelser, mens de justerede BERT til at forstå intentionen bag en forespørgsel.
“Her er nogle eksempler, der demonstrerer BERTs evne til at forstå intentionen bag din søgning. Her er en søgning efter “2019 brazil traveler to USA needs a visa.” Ordet “to” og dets relation til de andre ord i forespørgslen er særligt vigtigt for at forstå betydningen. Det handler om en brasiliansk, der rejser til USA og ikke omvendt. Tidligere ville vores algoritmer ikke have forstået betydningen af denne forbindelse, og vi ville have returneret resultater om amerikanske statsborgere, der rejser til Brasilien. Med BERT kan Søgning fatte denne nuance og vide, at det meget almindelige ord “to” faktisk betyder meget her, og vi kan give et langt mere relevant resultat for denne forespørgsel.” – Forstå søgninger bedre end nogensinde før, af Pandu Nayak, Google Fellow og Vice President for Søgning.

BERT søgeeksempel, før og efter. Kilde blog
I vores sidste artikel om NLP og OCR, har vi illustreret nogle NLP-brugssager i ejendomssektoren. Vi har også nævnt, hvordan “NLP-værktøjer er ideelle informationsudtrækningsværktøjer”. Lad os se på energisektoren og se, hvordan disruptiv NLP-teknologi som BERT muliggør nye anvendelsesmuligheder.
NLP-modeller kan trække information ud af store mængder ustuktureret data
En måde, hvorpå NLP-modeller kan anvendes, er til at trække kritisk information ud af ustuktureret tekstdata. E-mails, tidsskrifter, noter, logfiler og rapporter er alle eksempler på tekstdatakilder, der er en del af virksomheders daglige drift. Nogle af disse dokumenter kan vise sig at være afgørende i virksomhedens bestræbelser på at øge driftseffektiviteten og reducere omkostningerne.
Når man søger at implementere præventivt vedligehold af vindmøller, fejlrapporter kan indeholde kritisk information om opførslen af forskellige komponenter. Men da forskellige vindmølleproducenter har forskellige dataindsamlingnormer (dvs. vedligeholdelsesrapporter kommer i forskellige formater og sprog), kan manuelt identificere relevante datapunkter hurtigt blive dyrt for anlægs ejeren. NLP-værktøjer kan trække relevante begreber, attributter og begivenheder ud af ustuktureret indhold. Tekstanalyse kan derefter anvendes til at finde sammenhænge og mønstre i forskellige datakilder. Dette giver anlægs ejerne mulighed for at implementere præventivt vedligehold baseret på kvantitative målinger identificeret i deres fejlrapporter.
NLP-modeller kan give naturligt sprog-søgegrænseflader
På samme måde kan geovidenskabsfolk, der arbejder for olie- og gasselskaber, ofte gennemgå mange dokumenter relateret til tidligere boring-operationer, brøndlogger og seismiske data. Da disse dokumenter også kommer i forskellige formater og ofte er spredt ud over flere lokaliteter (både fysiske og digitale), spilder de meget tid på at lede efter informationen på de forkerte steder. En livskraftig løsning i sådanne tilfælde ville være en NLP-drevet søgegrænseflade, der ville give brugerne mulighed for at søge efter data på naturligt sprog. Så kan en NLP-model korrelerer data på tværs af hundredvis af dokumenter og returnere en samling af svar på forespørgslen. Arbejderne kan derefter validere outputtet på basis af deres egen ekspertviden, og feedback’en ville yderligere forbedre modellen.
Der er dog også tekniske overvejelser for at implementere sådanne modeller. En aspekt ville være, at branche-specifikke jargon kan forvirre traditionelle læringsmodeller, der ikke har den rette semantiske forståelse. For det andet kan modellens ydeevne være påvirket af størrelsen af træningsdatasættet. Det er her, for-trænede modeller som BERT kan vise sig at være nyttige. Kontekstuelle repræsentationer kan modelere den rette ord betydning og fjerne enhver forvirring forårsaget af branche-specifikke termer. Ved at anvende for-trænede modeller kan det være muligt at træne netværket på mindre datasæt. Dette sparer tid, energi og ressourcer, der ellers ville have været nødvendige for at træne fra scratch.
Hvad med din egen virksomhed?
Kan du tænke på nogen NLP-opgaver, der kunne hjælpe dig med at reducere omkostningerne og øge driftseffektiviteten?
Det Blue Orange Digital datavidenskabs hold er glade for at tilpasse BERT til din fordel også!










