Modele și platforme AI

Cum este îmbunătățită procesarea limbajului prin modelul BERT open source al Google

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Reprezentările bidirecționale ale encoderului din transformatori, cunoscute și sub numele de BERT, este un model de antrenare care a îmbunătățit considerabil eficiența și efectul modelelor de procesare a limbajului natural. Acum că Google (GOOGL ) a făcut modelele BERT open source, permite îmbunătățirea modelelor de procesare a limbajului natural în toate industriile. În acest articol, vom arunca o privire asupra modului în care BERT face ca procesarea limbajului natural să devină una dintre cele mai puternice și utile soluții de inteligență artificială din lumea de astăzi.

Aplicarea modelelor BERT în căutare

Motorul de căutare al Google este renumit pentru capacitatea sa de a prezenta conținut relevant și a făcut acest program de procesare a limbajului natural open source pentru întreaga lume.

Capacitatea unui sistem de a citi și interpreta limbajul natural devine din ce în ce mai vitală, pe măsură ce lumea produce noi date în mod exponențial. Biblioteca de înțelesuri ale cuvintelor, frazelor și capacitatea generală de a prezenta conținut relevant a Google este open source. Dincolo de procesarea limbajului natural, modelul BERT are capacitatea de a extrage informații din cantități mari de date nestructurate și poate fi aplicat pentru a crea interfețe de căutare pentru orice bibliotecă. În acest articol, vom vedea cum poate fi aplicată această tehnologie în sectorul energetic.

BERT (Reprezentările bidirecționale ale encoderului din transformatori) este o abordare de pre-antrenare propusă de grupul Google AI Language, dezvoltată pentru a depăși o problemă comună a modelelor de procesare a limbajului natural timpuriu: lipsa datelor de antrenare suficiente.

Să explicăm, fără a intra în prea multe detalii:

Antrenarea modelelor

Sarcinile de procesare a limbajului natural de nivel scăzut (de exemplu, recunoașterea entităților numite, segmentarea tematică) și de nivel înalt (de exemplu, analiza sentimentului, recunoașterea vorbirii) necesită seturi de date etichetate specifice sarcinii. Deși sunt greu de obținut și scumpe de asamblat, seturile de date etichetate joacă un rol crucial în performanța atât a modelelor de rețele neuronale superficiale, cât și a celor adânci. Rezultatele inferenței de înaltă calitate pot fi obținute doar atunci când sunt disponibile milioane sau chiar miliarde de exemple de antrenare etichetate. Și aceasta a fost o problemă care a făcut multe sarcini de procesare a limbajului natural inaccesibile. Acest lucru s-a schimbat odată cu dezvoltarea BERT.

BERT este un model de reprezentare a limbajului general, antrenat pe corpora mari de text neanotat. Atunci când modelul este expus la cantități mari de conținut text, el învață să înțeleagă contextul și relațiile dintre cuvinte într-o propoziție. În contrast cu modelele de învățare anterioare care reprezentau doar sensul la nivel de cuvânt (de exemplu, “banca” ar avea același sens în “cont bancar” și “malul râului”), BERT ia în considerare contextul. Adică, ce vine înainte și după cuvânt într-o propoziție. Contextul s-a dovedit a fi o capacitate lipsă majoră a modelelor de procesare a limbajului natural, cu un impact direct asupra performanței modelului. Proiectarea unui model conștient de context, cum ar fi BERT, este considerată de mulți ca începutul unei noi ere în procesarea limbajului natural.

Antrenarea BERT pe cantități mari de conținut text este o tehnică cunoscută sub numele de pre-antrenare. Acest lucru înseamnă că greutățile modelului sunt ajustate pentru sarcini generale de înțelegere a textului și că pot fi construite modele mai fine pe baza acestuia. Autorii au demonstrat superioritatea acestei tehnici atunci când au utilizat modele bazate pe BERT pe 11 sarcini de procesare a limbajului natural și au obținut rezultate de ultimă generație.

Modele pre-antrenate

Cea mai bună parte este: modelele BERT pre-antrenate sunt open source și disponibile public. Acest lucru înseamnă că oricine poate aborda sarcini de procesare a limbajului natural și construi modele pe baza BERT. Nimic nu poate fi mai bun decât acest lucru, nu? Oh, așteptați: acest lucru înseamnă și că modelele de procesare a limbajului natural pot fi antrenate (rafinate) pe seturi de date mai mici, fără a fi nevoie de antrenare de la zero. Începutul unei noi ere, într-adevăr.

Aceste modele pre-antrenate ajută companiile să reducă costurile și timpul de implementare a modelelor de procesare a limbajului natural pentru uz intern sau extern. Eficacitatea modelelor de procesare a limbajului natural bine antrenate este subliniată de Michael Alexis, CEO al companiei de construire a culturii virtuale, teambuilding.com.

“Cel mai mare beneficiu al procesării limbajului natural este inferența și procesarea informației în mod scalabil și consistent.” – Michael Alexis, CEO al teambuilding.com

Michael explică cum procesarea limbajului natural poate fi aplicată în programe de promovare a culturii, cum ar fi jocuri de încălzire sau chestionare. O companie poate obține informații valoroase despre modul în care cultura companiei se desfășoară prin analizarea răspunsurilor angajaților. Acest lucru se realizează nu numai prin analiza textului, ci și prin analiza anotării textului. Esențialmente, modelul “citește între linii” pentru a trage inferențe despre emoție, sentiment și perspectivă generală. BERT poate ajuta în astfel de situații prin pre-antrenarea modelelor cu o bază de indicatori care pot fi utilizați pentru a descoperi nuanțele limbajului și a oferi insight-uri mai precise.

Îmbunătățirea interogărilor

Capacitatea de a modela contextul a transformat BERT într-un erou al procesării limbajului natural și a revoluționat chiar și motorul de căutare Google. Mai jos este o citat din echipa de produs Google Search și experiențele lor de testare, în timp ce ajustau BERT pentru a înțelege intenția din spatele unei interogări.

“Iată câteva exemple care demonstrează capacitatea BERT de a înțelege intenția din spatele căutării. Iată o căutare pentru “2019 brazilian care călătorește în SUA are nevoie de viză.” Cuvântul “către” și relația sa cu celelalte cuvinte din interogare sunt deosebit de importante pentru a înțelege sensul. Este vorba despre un brazilian care călătorește în SUA și nu invers. Înainte, algoritmii noștri nu înțelegeau importanța acestei legături și returnau rezultate despre cetățeni americani care călătoresc în Brazilia. Cu BERT, căutarea poate înțelege această nuanță și știe că cuvântul “către” are o importanță deosebită aici, și putem oferi un rezultat mult mai relevant pentru această interogare.” – Înțelegerea căutărilor mai bine ca niciodată, de Pandu Nayak, Google Fellow și Vicepreședinte al căutării.

Exemplu de căutare BERT

Exemplu de căutare BERT, înainte și după. Sursa blog

În ultimul nostru articol despre procesarea limbajului natural și OCR, am ilustrat câteva utilizări ale procesării limbajului natural în sectorul imobiliar. Am menționat și cum “uneltele de procesare a limbajului natural sunt ideale pentru extragerea informațiilor”. Să aruncăm o privire asupra sectorului energetic și să vedem cum tehnologiile de procesare a limbajului natural, cum ar fi BERT, permit noi cazuri de utilizare.

Modelele de procesare a limbajului natural pot extrage informații din cantități mari de date nestructurate

Un mod în care modelele de procesare a limbajului natural pot fi utilizate este pentru extragerea informațiilor critice din datele text nestructurate. E-mailurile, jurnalele, notele, jurnalele de evenimente și rapoartele sunt toate exemple de surse de date text care fac parte din operațiunile zilnice ale companiilor. Unele dintre aceste documente pot dovedi a fi cruciale în eforturile organizaționale de a crește eficiența operațională și de a reduce costurile.

Atunci când se urmărește implementarea întreținerii predictive a turbinelor eoliene, rapoartele de defect pot conține informații critice despre comportamentul diferitelor componente. Dar, deoarece diferiții producători de turbine eoliene au norme diferite de colectare a datelor (de exemplu, rapoartele de întreținere vin în formate și limbi diferite), identificarea manuală a datelor relevante poate deveni rapid costisitoare pentru proprietarul centralei. Uneltele de procesare a limbajului natural pot extrage concepte, atribute și evenimente relevante din conținutul nestructurat. Analiza textului poate fi apoi utilizată pentru a găsi corelații și tipare în diferite surse de date. Acest lucru oferă proprietarilor de centrale electrice oportunitatea de a implementa întreținerea predictivă pe baza măsurilor cantitative identificate în rapoartele de defect.

Modelele de procesare a limbajului natural pot oferi interfețe de căutare în limbaj natural

În mod similar, geoscientiștii care lucrează pentru companiile de petrol și gaze trebuie adesea să revizuie documente legate de operațiunile de foraj din trecut, jurnale de sonde și date seismice. Deoarece aceste documente vin și ele în formate diferite și sunt de obicei răspândite în mai multe locații (atât fizice, cât și digitale), ei pierd mult timp căutând informațiile în locurile greșite. O soluție viabilă în acest caz ar fi o interfață de căutare bazată pe procesarea limbajului natural, care le-ar permite utilizatorilor să caute date în limbaj natural. Apoi, un model de procesare a limbajului natural ar putea corela datele din sute de documente și returna un set de răspunsuri la interogare. Lucrătorii pot apoi valida ieșirile pe baza cunoștințelor lor de specialitate, iar feedback-ul ar îmbunătăți în continuare modelul.

Cu toate acestea, există și considerații tehnice pentru implementarea unor astfel de modele. Un aspect ar fi că jargonul specific industriei poate confunda modelele de învățare tradiționale care nu au o înțelegere semantică adecvată. În al doilea rând, performanța modelului poate fi afectată de dimensiunea setului de date de antrenare. Acesta este momentul în care modelele pre-antrenate, cum ar fi BERT, pot dovedi a fi benefice. Reprezentările contextuale pot modela sensul adecvat al cuvântului și pot elimina orice confuzie cauzată de termeni specifici industriei. Prin utilizarea modelelor pre-antrenate, este posibil să antrenați rețeaua pe seturi de date mai mici. Acest lucru economisește timp, energie și resurse care ar fi fost necesare altfel pentru antrenarea de la zero.

Și despre afacerea dumneavoastră?

Puteți gândi la vreo sarcină de procesare a limbajului natural care v-ar putea ajuta să reduceți costurile și să creșteți eficiența operațională?

Echipa de știință a datelor Blue Orange Digital este bucuroasă să ajusteze BERT în beneficiul dumneavoastră!

Josh Miramant este CEO și fondator al Blue Orange Digital, o agenție de știință a datelor și învățare automată clasificată în top, cu sedii în New York City și Washington DC. Miramant este un vorbitor popular, futurist și un consilier strategic de afaceri și tehnologie pentru companii și startup-uri. El ajută organizațiile să-și optimizeze și să-și automatizeze afacerile, să implementeze tehnici analitice bazate pe date și să înțeleagă implicațiile noilor tehnologii, cum ar fi inteligența artificială, big data și Internetul lucrurilor.