Unghiul lui Anderson

De ce limba istorică este o provocare pentru inteligența artificială

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Una dintre provocările centrale ale sistemelor de procesare a limbajului natural (NLP) este de a obține insight-uri esențiale dintr-o varietate largă de materiale scrise. Sursele care contribuie la un set de date de antrenament pentru un nou algoritm NLP pot fi la fel de diverse din punct de vedere lingvistic ca Twitter, ziare de largă circulație și reviste științifice, cu toate excentricitățile apelante unice fiecăruia dintre aceste trei surse.

În majoritatea cazurilor, aceasta se aplică doar pentru limba engleză; și doar pentru surse de text actuale sau recente. Când un algoritm NLP trebuie să ia în considerare materiale care provin din multiple epoci, el se confruntă de obicei cu dificultăți în a reconcilia modurile foarte diferite în care oamenii vorbesc sau scriu în cadrul comunităților naționale și sub-naționale, și mai ales în diferite perioade istorice.

Însă, utilizarea datelor text (cum ar fi tratate istorice și lucrări științifice vechi) care acoperă epoci diferite este o metodă utilă pentru a obține o perspectivă istorică asupra unui subiect și pentru a formula reconstrucții cronologice statistice care preced adoptarea și menținerea metricilor pentru un domeniu.

De exemplu, informațiile meteorologice care contribuie la modelele de inteligență artificială predictive pentru schimbările climatice nu au fost înregistrate adecvat în întreaga lume până în 1880, în timp ce mineritul de date din texte clasice oferă înregistrări mai vechi ale evenimentelor meteorologice majore care pot fi utile pentru a furniza date meteorologice pre-victoriene.

Decalaj temporal

O lucrare nouă de la Universitatea din Washington și Institutul Allen pentru Inteligență Artificială a descoperit că chiar și un interval atât de scurt ca cinci ani poate cauza decalaj temporal, care poate compromite utilitatea unui model NLP pre-antrenat.

În toate cazurile, scorurile mai mari sunt mai bune. Aici vedem o hartă de căldură a degradării temporale pe patru corpuri de text care acoperă o perioadă de cinci ani. Asemenea neconcordanțe între datele de antrenament și evaluare, conform autorilor lucrării noi, pot cauza o 'scădere masivă a performanței'.

În toate cazurile, scorurile mai mari sunt mai bune. Aici vedem o hartă de căldură a degradării temporale pe patru corpuri de text care acoperă o perioadă de cinci ani. Asemenea neconcordanțe între datele de antrenament și evaluare, conform autorilor lucrării noi, pot cauza o ‘scădere masivă a performanței’. Sursă: https://arxiv.org/pdf/2111.07408.pdf

Lucrarea afirmă:

‘Am descoperit că decalajul temporal afectează atât generalizarea modelului de limbă, cât și performanța la sarcini. Am găsit o variație considerabilă a degradării pe domenii de text și sarcini. Pe o perioadă de cinci ani, scorul F1 al clasificatorilor poate scădea cu până la 40 de puncte (afiliere politică pe Twitter) sau cu doar 1 punct (evaluări Yelp). Două sarcini distincte definite pe același domeniu pot arăta niveluri diferite de degradare în timp.’

Diviziuni inegale

Problema de bază este că seturile de date de antrenament sunt, de obicei, împărțite în două grupuri, uneori într-un raport destul de neechilibrat de 80/20, din cauza lipsei de date. Grupul mai mare de date este antrenat pe o rețea neurală, în timp ce datele rămase sunt folosite ca grup de control pentru a testa acuratețea algoritmului rezultat.

În seturi de date mixte care conțin material din mai multe perioade, o distribuție inegală a datelor din diverse perioade poate însemna că datele de evaluare sunt compuse în mod disproporționat din material dintr-o anumită epocă.

Acest lucru va face ca acestea să fie un teren de testare slab pentru un model antrenat pe un amestec mai divers de epoci (adică pe mai multe din datele disponibile). În esență, în funcție de faptul că datele de evaluare minoritare reprezintă material mai nou sau mai vechi, este ca și cum ai cere bunicului tău să evalueze noii idoli K-Pop.

Soluția pe termen lung ar fi să se antreneze mai multe modele pe seturi de date mai restrictive din punct de vedere temporal și să se încerce să se combine caracteristici compatibile din rezultatele fiecărui model. Cu toate acestea, practicile de inițializare aleatorie a modelului însele implică o serie de probleme în atingerea parității și echității între modele – chiar înainte de a considera dacă seturile de date contributoare erau suficient de asemănătoare între ele pentru a face experimentul semnificativ.

Date și antrenament

Pentru a evalua decalajul temporal, autorii au antrenat patru corpuri de text pe patru domenii;

Twitter
…unde au colectat date neetichetate prin extragerea unei selecții aleatorii de 12 milioane de tweet-uri uniform distribuite între 2015-2020, unde autorii au studiat entitățile numite (adică oameni și organizații) și afilierile politice.

Articole științifice
…unde autorii au obținut date neetichetate din corpusul Semantic Scholar, constituit din 650.000 de documente care acoperă o perioadă de 30 de ani, și pe care au studiat clasificarea mențiunilor (SciERC) și clasificarea locurilor de desfășurare a conferințelor (AIC, care distinge dacă o lucrare a fost publicată în AAAI sau ICML).

Articole de știri
…unde autorii au utilizat nouă milioane de articole din setul de date Newsroom care acoperă o perioadă de 2009-2016, pe care au efectuat trei sarcini: rezumarea articolelor de știri, clasificarea editorilor și clasificarea cadrului mediatic (MFC), care examinează prioritizarea percepută a diferitelor subiecte în cadrul producției de știri.

Recenzii de alimente
…unde cercetătorii au utilizat setul de date deschis Yelp pentru o singură sarcină: clasificarea evaluărilor (YELPCLS), o provocare clasică de analiză a sentimentului tipică pentru multe cercetări NLP în acest sector.

Rezultate

Modelele au fost evaluate pe GPT-2, cu o serie de scoruri F1 rezultate. Autorii au descoperit că pierderea de performanță din cauza decalajului temporal este bidirecțională, ceea ce înseamnă că modelele antrenate pe date recente pot fi afectate negativ de influența datelor mai vechi, și viceversa (vezi imaginea de la începutul articolului pentru grafice). Autorii notează că acest lucru are implicații deosebite pentru aplicațiile științifice sociale.

În general, rezultatele arată că decalajul temporal deteriorează substanțial pierderea de performanță și are un efect larg asupra majorității sarcinilor. Seturile de date care acoperă perioade foarte lungi, cum ar fi deceniile, exacerbează în mod natural problema.

Autorii observă, de asemenea, că decalajul temporal afectează atât datele etichetate, cât și cele neetichetate de pre-antrenament. În plus, încercările lor de a atenua efectele prin adaptarea la domeniu (a se vedea mai jos) nu au îmbunătățit semnificativ situația, deși afirmă că ajustarea fină a informațiilor din setul de date poate ajuta într-o anumită măsură.

Concluzie

Cercetătorii confirmă constatările anterioare că remedii precum adaptarea la domeniu (DAPT, unde se face o adaptare pentru disparitatea datelor) și adaptarea temporală (unde datele sunt selectate după perioadă) nu fac prea mult pentru a atenua problema.

Lucrarea conchide*:

‘Experimentele noastre au arătat o variație considerabilă a degradării temporale pe sarcini, mai mult decât s-a găsit în studii anterioare. Aceste constatări motivează continuarea studiului decalajului temporal în aplicațiile NLP, luarea în considerare a acestuia în evaluările de referință și vigilenta din partea practicienilor care pot monitoriza performanța sistemelor live în timp.

‘În mod deosebit, am observat că antrenamentul continuu al modelelor de limbă pe date temporale aliniate nu are un efect semnificativ, motivând cercetări suplimentare pentru a găsi metode de adaptare temporală eficiente care să fie mai puțin costisitoare decât colectarea continuă a seturilor de date etichetate în timp.’

Autorii sugerează că o investigație suplimentară asupra învățării continue, în care datele sunt actualizate constant, poate fi de folos în acest sens, și că decalajul de concept și alte metode de detectare a schimbărilor în sarcini ar putea fi un ajutor util pentru actualizarea seturilor de date.

 

* Conversia mea a citatelor inline în legături.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai