AI-modeller og plattformer

Hvordan språkbehandling forbedres gjennom Googles åpne kildekode-BERT-modell

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Bidirectional Encoder Representations fra Transformers, også kjent som BERT, er en treningsmodell som har forbedret effektiviteten og effekten av NLP-modeller dramatisk. Nå som Google (GOOGL ) har gjort BERT-modellene åpne kildekoder, kan NLP-modellene forbedres over hele verden. I denne artikkelen ser vi på hvordan BERT gjør NLP til en av de mest kraftfulle og nyttige AI-løsningene i dagens verden.

Applying BERT-modeller til søk

Googles søkemotor er verdensberømt for sin evne til å presentere relevant innhold, og de har gjort denne naturlige språkbehandlingsprogrammet åpen kildekode for verden.

Evnen til å lese og tolke naturlig språk blir mer og mer vital ettersom verden eksponentielt produserer ny data. Googles bibliotek av ordmeaninger, fraser og generell evne til å presentere relevant innhold er ÅPEN KILDEKODE. Utenom naturlig språkbehandling har deres BERT-modell evnen til å trekke ut informasjon fra store mengder ustukt data og kan brukes til å lage søkegrensesnitt for enhver samling. I denne artikkelen skal vi se på hvordan denne teknologien kan brukes i energisektoren.

BERT (Bidirectional Encoder Representations fra Transformers) er en for-treningstilnærming foreslått av Google AI Language-gruppen, utviklet for å overvinne et vanlig problem med tidlige NLP-modeller: mangelen på tilstrekkelig treningsdata.

La oss forklare, uten å gå for dypt inn i detaljene:

Treningsmodeller

Lav-nivå (f.eks. navngitt enhetsgjenkjenning, emne-segmentering) og høy-nivå (f.eks. meninganalyse, talegjenkjenning) NLP-oppdrag krever oppgave-spesifikke annoterte datasett. Mens de er vanskelige å komme over og dyre å samle inn, spiller merket datasett en avgjørende rolle i ytelsen til både grunnleggende og dype neurale nettverksmodeller. Høykvalitets inferensresultater kunne bare oppnås når millioner eller til og med milliarder av merket treningsEksempler var tilgjengelige. Og det var et problem som gjorde mange NLP-oppdrag utilgjengelige. Det var før BERT ble utviklet.

BERT er en generell språkrepresentasjonsmodell, trent på store korpus av ustukt tekst. Når modellen blir utsatt for store mengder tekstinnhold, lærer den å forstå kontekst og relasjoner mellom ord i en setning. I motsetning til tidligere læringsmodeller som bare representerte mening på et ordnivå (bank ville bety det samme i “bankkonto” og “grønn bank”), bryr BERT seg faktisk om kontekst. Det vil si, hva som kommer før og etter ordet i en setning. Kontekst viste seg å være en stor manglende evne i NLP-modeller, med en direkte innvirkning på modellens ytelse. Å designe en kontekst-bevisst modell som BERT er kjent av mange som begynnelsen på en ny æra i NLP.

Trenings-BERT på store mengder tekstinnhold er en teknikk kjent som for-trening. Dette betyr at modellens vekter justeres for generelle tekstforståelsesoppdrag, og at mer finmaskede modeller kan bygges på toppen av det. Forfatterne har bevist overlegenheten til en slik teknikk da de anvendte BERT-baserte modeller på 11 NLP-oppdrag og oppnådde state-of-the-art-resultater.

For-trente modeller

Det beste er: for-trente BERT-modeller er åpne kildekoder og offentlig tilgjengelige. Dette betyr at hvem som helst kan håndtere NLP-oppdrag og bygge sine modeller på toppen av BERT. Ingen kan slå det, rett? Nei, vent: dette betyr også at NLP-modeller nå kan trenes (finjusteres) på mindre datasett, uten behov for å trenes fra scratch. Begynnelsen på en ny æra, i sannhet.

Disse for-trente modellene hjelper selskaper å kutte ned kostnadene og tiden for å deployere NLP-modeller for intern eller ekstern bruk. Effektiviteten av godt trenede NLP-modeller understrekes av Michael Alexis, CEO av virtuell team-kultur-bygging selskap, teambuilding.com.

“Den største fordelen med NLP er den skalerbare og konsistente inferens og prosessering av informasjon.” – Michael Alexis, CEO av teambuilding.com

Michael uttaler hvordan NLP kan brukes til å fremme kulturprogrammer som isbrytere eller undersøkelser. Et selskap kan få verdifull innsikt i hvordan selskapets kultur er gjennom å analysere svarene fra ansatte. Dette oppnås ikke bare gjennom å analysere tekst, men også gjennom annotering av tekst. I virkeligheten “leser” modellen også mellom linjene for å trekke slutninger om følelse, føle og generell holdning. BERT kan hjelpe i situasjoner som denne ved å for-treningsmodeller med en basis av indikatorer som den kan bruke til å avdekke nyansene i språk og gi mer nøyaktige innsikter.

Forbedring av spørsmål

Evnen til å modellere kontekst har gjort BERT til en NLP-helt og har revolusjonert Google-søk selv. Under er et sitat fra Google-søkeproduktteamet og deres test-erfaringer, mens de justerte BERT for å forstå intensjonen bak et spørsmål.

“Her er noen eksempler som demonstrerer BERTs evne til å forstå intensjonen bak ditt søk. Her er et søk på “2019 brasiliansk reisende til USA trenger et visum.” Ordet “til” og dets forhold til andre ord i spørsmålet er spesielt viktig for å forstå meningen. Det handler om en brasiliansk som reiser til USA og ikke omvendt. Tidligere ville våre algoritmer ikke forstå viktigheten av denne tilkoblingen, og vi returnerte resultater om amerikanske borgere som reiser til Brasil. Med BERT kan Søk forstå denne nyansen og vite at det meget vanlige ordet “til” faktisk betyr mye her, og vi kan gi et langt mer relevant resultat for dette spørsmålet.”Forstå søk bedre enn noensinne før, av Pandu Nayak, Google Fellow og visepresident for Søk.

BERT-søkeeksempel

BERT-søkeeksempel, før og etter. Kilde blog

I vår siste artikkel om NLP og OCR, har vi illustrert noen NLP-bruk i eiendomssektoren. Vi har også nevnt hvordan “NLP-verktøy er ideelle informasjons-uttrekkingsverktøy”. La oss se på energisektoren og se hvordan disruptive NLP-teknologier som BERT muliggjør nye anvendelseseksempler.

NLP-modeller kan trekke ut informasjon fra store mengder ustukt data

En måte å bruke NLP-modeller på er for å trekke ut kritisk informasjon fra ustukt tekstdata. E-poster, tidsskrifter, notater, logger og rapporter er alle eksempler på tekstdatakilder som er en del av bedrifters daglige drift. Noen av disse dokumentene kan vise seg å være avgjørende i organisatoriske bestrebelser for å øke operasjonell effektivitet og redusere kostnader.

Når man søker å implementere forutsigbar vedlikehold av vindturbiner, feilrapporter kan inneholde kritisk informasjon om oppførselen til ulike komponenter. Men siden ulike vindturbinprodusenter har ulike datainnsamlingsnormer (dvs. vedlikeholdsrapporter kommer i ulike formater og språk), kan det bli dyrt for anleggs-eieren å manuelt identifisere relevante dataelementer. NLP-verktøy kan trekke ut relevante konsepter, attributter og hendelser fra ustukt innhold. Tekstanalyse kan deretter brukes til å finne korrelasjoner og mønster i ulike datakilder. Dette gir anleggs-eierne muligheten til å implementere forutsigbar vedlikehold basert på kvantitative mål identifisert i deres feilrapporter.

NLP-modeller kan gi naturlige språksøkegrensesnitt

På samme måte kan geovitere som arbeider for olje- og gassselskaper vanligvis se gjennom mange dokumenter relatert til tidligere boreoperasjoner, brønner og seismiske data. Siden slike dokumenter også kommer i ulike formater og vanligvis er spredt over flere steder (både fysiske og digitale), spiller de mye tid på å lete etter informasjon på feil steder. En løsning i et slikt tilfelle ville være et NLP-drevet søkegrensesnitt, som ville tillate brukerne å søke etter data på naturlig språk. Deretter kunne en NLP-modell korrelere data over hundrevis av dokumenter og returnere en samling av svar på spørsmålet. Arbeiderne kan deretter validere utgangen basert på deres egen ekspertkunnskap, og tilbakemeldingen ville videre forbedre modellen.

Det er imidlertid også tekniske overveielser for å deployere slike modeller. Et aspekt ville være at bransjespesifikke jargon kan forvirre tradisjonelle læringsmodeller som ikke har den riktige semantiske forståelsen. For det andre kan modellens ytelse bli påvirket av størrelsen på treningsdatasettet. Dette er når for-trente modeller som BERT kan vise seg å være nyttige. Kontekstuelle representasjoner kan modellere den riktige ordmeningen og fjerne eventuell forvirring forårsaket av bransjespesifikke termer. Ved å bruke for-trente modeller er det mulig å trene nettverket på mindre datasett. Dette sparer tid, energi og ressurser som ellers ville ha vært nødvendig for å trene fra scratch.

Hva med ditt eget selskap?

Kan du tenke på noen NLP-oppdrag som kan hjelpe deg å kutte ned kostnader og øke operasjonell effektivitet?

Det Blue Orange Digital data science-teamet er glad for å justere BERT for din skyld også!

Josh Miramant er administrerende direktør og grunnlegger av Blue Orange Digital, et topprangert datasvitenskap og maskinlæringbyrå med kontorer i New York City og Washington DC. Miramant er en populær foredragsholder, fremtidsforsker og en strategisk forretnings- og teknologirådgiver for bedrifter og startup-selskaper. Han hjelper organisasjoner med å optimalisere og automatisere sine forretninger, implementere data-drevne analytiske teknikker og forstå implikasjonene av nye teknologier som kunstig intelligens, big data og Internett-of-Things.