AI-mallit ja alustat

Kuinka kielen prosessointi parani Google:n avoimen lähdekoodin BERT-mallin ansiosta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Bidirectional Encoder Representations from Transformers, eli BERT, on koulutusmalli, joka on parantanut merkittävästi NLP-mallien tehokkuutta ja vaikuttavuutta. Koska Google (GOOGL ) on tehnyt BERT-malleista avoimen lähdekoodin, se mahdollistaa NLP-mallien parantamisen kaikilla aloilla. Tässä artikkelissa tarkastelemme, miten BERT tekee NLP:stä yhden nykyään voimakkaimmista ja hyödyllisimmistä tekoälyratkaisuista.

BERT-mallien soveltaminen hakuihin

Google:n hakukone on maailmanlaajuisesti tunnettu kyvystään esittää relevantteja sisältöjä, ja he ovat tehneet tämän luonnollisen kielen prosessointiohjelman avoimen lähdekoodin maailmalle.

Järjestelmän kyky lukea ja tulkita luonnollista kieltä on tulevaisuudessa yhä tärkeämpää, koska maailma tuottaa eksponentiaalisesti uutta dataa. Google:n sanastoa, lauseita ja yleistä kykyä esittää relevantteja sisältöjä on avoimen lähdekoodin. Luonnollisen kielen prosessoinnin ohella BERT-malli kykenee hakemaan tietoa suurista määristä rakenteettomia dataa ja soveltamaan hakuliittymiä mihin tahansa kirjastoon. Tässä artikkelissa tarkastelemme, miten tämä teknologia voidaan soveltaa energiasektorilla.

BERT (Bidirectional Encoder Representations from Transformers) on esikoulutuslähestymistapa, jota Google AI Language -ryhmä on ehdottanut, ja se on kehitetty ylittämään yleinen ongelma varhaisissa NLP-malleissa: riittämättömän koulutusdatan puute.

Selitämme tarkemmin ilman liian syvää mennään:

Koulutusmallit

Alatasoiset (esim. nimien tunnistaminen, aiheen segmentointi) ja korkeatasoiset (esim. mielipideanalyysi, puheentunnistus) NLP-tehtävät vaativat tehtäväkohtaisia merkittyjä tietoja. Vaikka ne ovat hankalia saada ja kalliita koota, merkityt tiedot ovat avainasemassa sekä pinnallisten että syvien neuroverkkomallien suorituskyvyssä. Laadukkaat johtopäätökset voivat vain saavutettaa, kun miljoonia tai jopa miljardeja merkittyjä koulutusehkäisyyksiä on saatavilla. Ja se oli ongelma, joka teki monista NLP-tehtävistä lähestymiskelvottomia. Kunnes BERT kehitettiin.

BERT on yleispurposeinen kielen esitysmalli, joka on koulutettu suurilla korpuksilla rakenteettomia tekstejä. Kun malli altistetaan suurille määrille tekstisisältöä, se oppii ymmärtämään kontekstin ja suhteet sanojen välillä lauseessa. Toisin kuin aiemmat oppimismallit, jotka edustivat merkitystä vain sanatasolla (pankki merkitsisi samaa asiassa “pankkitili” ja “ruohoinen pankki”), BERT huomioi kontekstin. Tämä tarkoittaa, mitä edeltää ja seuraa sanaa lauseessa. Konteksti osoittautui merkittäväksi puutteeksi NLP-malleissa, ja sillä on suora vaikutus mallin suorituskykyyn. BERT-mallin suunnittelu on tunnettu monissa kuin uuden aikakauden alkuna NLP:ssä.

BERT-mallin kouluttaminen suurilla määrillä tekstisisältöä on tekniikka, jota kutsutaan esikoulutukseksi. Tämä tarkoittaa, että mallin painotukset säätövät yleisiin tekstiymmärtämistehtäviin, ja siitä voidaan rakentaa tarkemmin hiotuja malleja. Tekijät ovat osoittaneet tämän tekniikan ylemmän tasoisuuden, kun he sovelsivat BERT-pohjaisia malleja 11 NLP-tehtävään ja saavuttivat huipputulokset.

Esikoulutetut mallit

Paras asia on: esikoulutetut BERT-mallit ovat avoimen lähdekoodin ja julkaistuina. Tämä tarkoittaa, että kuka tahansa voi käsitellä NLP-tehtäviä ja rakentaa omia mallejaan BERT:n päälle. Mitä voisi olla parempaa? Odota, tämä tarkoittaa myös, että NLP-mallit voidaan kouluttaa (hioa) pienemmillä tietoja joukoilla ilman koulutusta alusta alkaen. Uuden aikakauden alku, tosiaan.

Nämä esikoulutetut mallit auttavat yrityksiä leikata kustannuksia ja aikaa NLP-mallien käyttöönottoon sisäisesti tai ulkoisesti. NLP-mallien tehokkuutta korostaa Michael Alexis, virtual team -kulttuurin rakentamisen yrityksen, teambuilding.com, toimitusjohtaja. 

“NLP:n suurin etu on skaalautuva ja johdonmukainen informaation prosessointi ja jalostus.”   – Michael Alexis, teambuilding.com:n toimitusjohtaja

Michael kertoo, miten NLP voidaan soveltaa kulttuurin edistämiseen, kuten jäämurtajat tai kyselyt. Yritys voi saada arvokkaita näkemyksiä yrityskulttuurin tilasta analysoimalla työntekijöiden vastauksia. Tämä saavutetaan ei vain analysoimalla tekstiä, vaan myös tekstin annotaatioita. Itse asiassa malli “lukee välillä” ja tekee johtopäätöksiä tunteista, fiiliksestä ja yleisestä asenteesta. BERT voi auttaa tilanteissa, joissa se esikoulutetaan indikaattoreiden pohjalta, jotta se voi paljastaa kielen nuansseja ja antaa tarkempia näkemyksiä.  

Parantaminen kyselyissä

Kontekstin mallintamiskyky on tehnyt BERT:stä NLP-sankarin ja vallankumouksellisen Google-haun itsessään. Alla on lainaus Google-haku-tuoteryhmältä ja heidän testikokemuksistaan, kun he säätivät BERT:iä ymmärtämään kyselyn taustalla olevan aikeen.

“Tässä on joitakin esimerkkejä, jotka osoittavat BERT:n kyvyn ymmärtää kyselyn taustalla oleva aikomus. Tässä on hakusana “2019 Brasilian matkailija Yhdysvaltoihin tarvitsee viisumin.” Sana “to” ja sen suhde muihin sanoihin kyselyssä on erittäin tärkeää ymmärtääkseen merkitystä. Se on brasilialaisen matkailijan, joka matkustaa Yhdysvaltoihin, eikä toisinpäin. Aikaisemmin algoritmimme eivät ymmärtäneet tämän yhteyden merkitystä, ja palautimme tuloksia Yhdysvaltalaisista matkailijoista, jotka matkustavat Brasiliaan. BERT:n avulla hakukone pystyy ymmärtämään tämän nuansen ja tietää, että hyvin yleinen sana “to” on todella tärkeä tässä tapauksessa, ja voimme antaa paljon relevantimman tuloksen tälle kyselylle.”
Ymmärtäen hakusanoja paremmin kuin koskaan aiemmin, Pandu Nayak, Google Fellow ja hakuryhmän varapresidentti.

BERT-hakuesimerkki

BERT-hakuesimerkki, ennen ja jälkeen. Lähde blogi

Aiemmassa kirjoituksessamme NLP:stä ja OCR:stä osoitimme joitakin NLP-käyttötapauksia kiinteistösektorilla. Mainitsimme myös, miten “NLP-työkalut ovat ihanteellisia tietojen hakutyökaluja”. Tarkastellaan nyt energiasektoria ja miten disruptiiviset NLP-teknologiat, kuten BERT, mahdollistavat uudet soveltamistapaukset. 

NLP-mallit voivat hakia tietoa suurista määristä rakenteettomia dataa

Yksi tapa, jolla NLP-malleja voidaan käyttää, on kriittisen informaation hakeminen rakenteettomista tekstidatista. Sähköpostit, lehdet, muistiinpanot, lokit ja raportit ovat kaikki esimerkkejä tekstidatamuodoista, jotka ovat osa yritysten päivittäistä toimintaa. Jotkut näistä asiakirjoista voivat osoittautua olennaisiksi yritysten pyrkimyksissä parantaa toiminnan tehokkuutta ja leikata kustannuksia. 

Kun tavoitteena on toteuttaa tuuliturbiinien ennakoiva huolto, häiriöraportit saattavat sisältää kriittistä tietoa eri komponenttien käyttäytymisestä. Mutta koska eri tuuliturbiinien valmistajilla on erilaiset datan keräämisen normit (ts. huolto-ohjeet tulevat eri muodoissa ja jopa eri kielillä), manuaalinen relevanttien tietojen tunnistaminen voi nopeasti tulla kalliiksi voimalaitoksen omistajalle. NLP-työkalut voivat hakia relevantteja käsitteitä, ominaisuuksia ja tapahtumia rakenteettomasta sisällöstä. Tekstianalyysi voidaan soveltaa löytämään korrelaatioita ja malleja eri datalähteissä. Tämä antaa voimalaitoksen omistajalle mahdollisuuden toteuttaa ennakoivan huollon määrättyjen mittareiden perusteella, jotka on tunnistettu häiriöraporteista.

NLP-mallit voivat tarjota luonnollisen kielen hakuliittymiä

Vastaavasti, geotieteelliset tutkijat, jotka työskentelevät öljy- ja kaasuyrityksissä, tarvitsevat usein tarkastella monia asiakirjoja aiemmista poraustoimista, porauslokeista ja seismisistä tietoista. Koska nämä asiakirjat myös tulevat eri muodoissa ja ovat usein levittynyt useisiin paikkoihin (sekä fyysisesti että digitaalisesti), he viettävät paljon aikaa etsimällä tietoa väärissä paikoissa. Toimiva ratkaisu tällaisessa tapauksessa olisi NLP-pohjainen hakuliittymä, joka mahdollistaisi käyttäjien etsiä tietoa luonnollisella kielellä. Sitten NLP-malli voisi korreloidata tietoja sadoista asiakirjoista ja palauttaa joukon vastauksia kyselyyn. Työntekijät voivat sitten vahvistaa tuloksen omalla asiantuntemuksellaan, ja palautteen avulla malli paranee edelleen. 

On kuitenkin myös teknisiä huomioita mallien käyttöönotossa. Yksi näistä on, että alanomaiset termejä voi sekoittaa perinteisiin oppimismalleihin, jotka eivät ole semanttisesti ymmärrettäviä. Toisaalta mallien suorituskyky voi vaikuttaa koulutusdatan koosta. Tässä voidaan hyödyntää esikoulutettuja malleja, kuten BERT:iä. Kontekstuaaliset esitykset voivat mallintaa asianmukaisen sanan merkityksen ja poistaa alanomaisilla termeillä aiheutuneen sekaannuksen. Käyttämällä esikoulutettuja malleja, voidaan kouluttaa verkkoa pienemmillä tietoja joukoilla. Tämä säästää aikaa, energiaa ja resursseja, jotka olisivat olleet tarpeen kouluttamiseen alusta alkaen.

Mitenkä omassa liiketoiminnassasi?

Voitko ajatella NLP-tehtäviä, jotka voisivat auttaa leikkaamaan kustannuksia ja parantamaan toiminnan tehokkuutta?

Blue Orange Digitalin data-tieteen tiimi on valmis mukauttamaan BERT:in hyödyksi myös sinun liiketoimintaa varten!

Josh Miramant on Blue Orange Digitalin toimitusjohtaja ja perustaja, Blue Orange Digital on korkeasti arvostettu data science ja machine learning -toimisto, jolla on toimistot New Yorkissa ja Washington DC:ssa. Miramant on suosittu puhuja, futuristi ja strateginen liiketoiminta- ja teknologia-asiantuntija yrityksille ja startup-yrityksille. Hän auttaa organisaatioita optimoimaan ja automatisoimaan liiketoimintaa, toteuttamaan dataohjattuja analytiikkaa ja ymmärtämään uusien teknologioiden vaikutuksia, kuten tekoäly, big data ja Internet of Things.