Modele și platforme AI
Anastassia Loukina, cercetător științific senior (NLP/Vorbire) la ETS – Seria de interviuri

Anastassia Loukina este cercetător științific la Serviciile de Testare Educațională (ETS), unde lucrează la evaluarea automată a vorbirii.
Interesele sale de cercetare acoperă o gamă largă de subiecte. A lucrat, printre altele, la dialectele grecești moderne, la ritmul vorbirii și la analiza automată a prozodiei.
Lucrarea sa actuală se concentrează pe combinarea unor instrumente și metode din tehnologiile vorbirii și învățarea automată cu insight-uri din studii despre percepția și producerea vorbirii, pentru a construi modele de evaluare automate pentru evaluarea vorbirii non-native.
Ați avut evident o pasiune pentru limbile, ce v-a introdus în această pasiune?
M-am născut vorbind rusă la St. Petersburg, Rusia și îmi amintesc că am fost fascinat atunci când am fost introdus pentru prima dată în limba engleză: pentru unele cuvinte, exista un model care făcea posibilă “conversia” unui cuvânt rus într-un cuvânt englez. Și apoi dădeam peste un cuvânt unde “modelul meu” eșua și încercam să vin cu o regulă mai bună, mai generală. La acea vreme, desigur, nu știam nimic despre tipologia lingvistică sau despre diferența dintre cuvintele împrumutate și cele native, dar aceasta a alimentat curiozitatea și dorința mea de a învăța mai multe limbi. Această pasiune pentru identificarea modelelor în vorbirea oamenilor și testarea lor pe date este ceea ce m-a condus la fonetică, învățarea automată și la lucrul pe care îl fac în prezent.
Înainte de a lucra la prelucrarea limbajului natural (NLP), ați fost traducător între engleză-rusă și greacă modernă-rusă. Credeți că lucrul dvs. ca traducător v-a oferit perspective suplimentare asupra nuanțelor și problemelor asociate cu NLP?
Identitatea mea principală a fost întotdeauna cea de cercetător. Este adevărat că am început cariera mea academică ca savant al limbii grecești moderne, sau mai specific, al foneticii limbii grecești moderne. Pentru lucrarea mea de doctorat, am explorat diferențele fonetice dintre mai multe dialecte ale limbii grecești moderne și cum aceste diferențe puteau fi legate de istoria zonei. Am argumentat că unele dintre aceste diferențe ar fi putut apărea ca urmare a contactului lingvistic dintre fiecare dialect și alte limbi vorbite în zonă. Deși nu mai lucrez la limba greacă modernă, schimbările care au loc atunci când două limbi intră în contact una cu cealaltă sunt încă în centrul lucrării mele: doar că de data aceasta mă concentrez asupra a ceea ce se întâmplă atunci când un individ învață o nouă limbă și cum tehnologia poate ajuta la acest proces în modul cel mai eficient.
Când vine vorba de limba engleză, există o multitudine de accente. Cum proiectați un NLP care să poată înțelege toate dialectele diferite? Este oare o chestiune simplă de a hrăni algoritmul de învățare profundă cu date suplimentare mari de la fiecare tip de accent?
Au existat mai multe abordări folosite în trecut pentru a aborda această problemă. Pe lângă construirea unui model mare care să acopere toate accentele, puteți identifica mai întâi accentul și apoi utiliza un model personalizat pentru acel accent, sau puteți încerca mai multe modele deodată și alegeți cel care funcționează cel mai bine. În cele din urmă, pentru a obține o performanță bună pe o gamă largă de accente, aveți nevoie de date de antrenare și evaluare reprezentative pentru multe accente pe care sistemul le-ar putea întâlni.
La ETS, efectuăm evaluări cuprinzătoare pentru a ne asigura că scorurile produse de sistemele noastre automate reflectă diferențele reale în abilitățile pe care dorim să le măsurăm și nu sunt influențate de caracteristicile demografice ale învățăcelui, cum ar fi sexul, rasa sau țara de origine.
Copiii și/sau învățătorii de limbă au adesea dificultăți cu pronunția perfectă. Cum depășiți problema pronunției?
Nu există o “pronunție perfectă”: modul în care vorbim este strâns legat de identitatea noastră și, ca dezvoltatori și cercetători, scopul nostru este să ne asigurăm că sistemele noastre sunt corecte pentru toți utilizatorii.
Atât copiii, cât și învățătorii de limbă prezintă provocări speciale pentru sistemele bazate pe vorbire. De exemplu, voci de copii nu numai că au o calitate acustică foarte diferită, dar copiii vorbesc și într-un mod diferit de adulți, iar există o mare varietate între copii. Ca urmare, dezvoltarea unui sistem de recunoaștere automată a vorbirii pentru copii este de obicei o sarcină separată care necesită o cantitate mare de date de vorbire de la copii.
La fel, deși există multe asemănări între învățătorii de limbă din același mediu, învățătorii pot varia foarte mult în utilizarea modelelor fonetice, gramaticale și lexicale, făcând recunoașterea vorbirii o sarcină deosebit de dificilă. Atunci când construim sistemele noastre pentru evaluarea competenței lingvistice în limba engleză, folosim date de la învățători de limbă cu o gamă largă de competențe și limbi materne.
În ianuarie 2018, ați publicat ‘Folosirea răspunsurilor exemplare pentru antrenarea și evaluarea sistemelor automate de evaluare a vorbirii‘. Care sunt câteva dintre principalele descoperiri fundamentale care ar trebui înțelese din această lucrare?
În această lucrare, am examinat modul în care calitatea datelor de antrenare și testare afectează performanța sistemelor automate de evaluare.
Sistemele automate de evaluare, ca și multe alte sisteme automate, sunt antrenate pe date care au fost etichetate de către oameni. În acest caz, acestea sunt scoruri atribuite de evaluatorii umani. Evaluatorii umani nu sunt întotdeauna de acord cu privire la scorurile pe care le atribuie. Există mai multe strategii folosite în evaluare pentru a asigura că scorul final raportat testatorului rămâne foarte fiabil, în ciuda variației în acordul uman la nivelul întrebării individuale. Cu toate acestea, deoarece motoarele de evaluare automată sunt de obicei antrenate utilizând scoruri la nivel de răspuns, orice inconsistențe în astfel de scoruri, din cauza varietății de motive menționate mai sus, pot afecta negativ sistemul.
Am avut acces la o cantitate mare de date cu diferite niveluri de acord între evaluatorii umani și am putut compara performanța sistemului în diferite condiții. Ceea ce am descoperit este că antrenarea sistemului pe date perfecte nu îmbunătățește în mod semnificativ performanța sa față de un sistem antrenat pe date cu etichete mai zgomotoase. Etichetele perfecte oferă un avantaj numai atunci când dimensiunea totală a setului de antrenare este foarte mică. Pe de altă parte, calitatea etichetelor umane a avut un efect uriaș asupra evaluării sistemului: estimările dvs. de performanță pot fi cu până la 30% mai mari dacă evaluați pe etichete curate.
Mesajul principal este că, dacă aveți multe date și resurse pentru a curăța etichetele dvs. de referință, ar putea fi mai inteligent să curățați etichetele din setul de evaluare, mai degrabă decât etichetele din setul de antrenare. Și această constatare se aplică nu numai evaluării automate, ci și multor alte domenii.
Ne puteți descrie o parte din lucrarea dvs. la ETS?
Lucrul meu se concentrează pe un sistem de evaluare a vorbirii care procesează limba vorbită într-un context educațional. Un astfel de sistem este SpeechRater®, care utilizează tehnologie avansată de recunoaștere și analiză a vorbirii pentru a evalua și a oferi feedback detaliat despre competența lingvistică în limba engleză. SpeechRater este o aplicație foarte matură care există de peste 10 ani. Construiesc modele de evaluare pentru diferite aplicații și lucrez cu alți colegi de la ETS pentru a ne asigura că scorurile noastre sunt fiabile, corecte și valabile pentru toți testatorii. De asemenea, lucrăm cu alte grupuri de la ETS pentru a monitoriza în mod constant performanța sistemului.
Pe lângă menținerea și îmbunătățirea sistemelor noastre operaționale, prototipăm sisteme noi. Unul dintre proiectele la care sunt foarte entuziasmat este RelayReader™: o aplicație proiectată pentru a ajuta cititorii în dezvoltare să câștige fluență și încredere. Atunci când citiți cu RelayReader, un utilizator alternează între ascultarea și citirea cu voce tare a unei cărți. Citirea lor este apoi trimisă pe serverele noastre pentru a oferi feedback. În ceea ce privește procesarea vorbirii, principala provocare a acestei aplicații este modul de măsurare a învățării și de a oferi feedback acționabil și fiabil, fără a interfera cu implicarea cititorului în cartea respectivă.
Care este partea dvs. preferată a lucrului cu ETS?
Ceea ce m-a atras inițial la ETS este faptul că este o organizație non-profit cu o misiune de a îmbunătăți calitatea educației pentru toți oamenii din lume. Deși este minunat atunci când cercetarea conduce la un produs, apreciez oportunitatea de a lucra la proiecte care sunt mai fundamentale, dar care vor ajuta la dezvoltarea de produse în viitor. De asemenea, prețuiesc faptul că ETS ia foarte în serios aspectele legate de confidențialitatea datelor și de corectitudine, iar toate sistemele noastre sunt supuse unei evaluări foarte stricte înainte de a fi lansate operațional.
Dar ceea ce face cu adevărat ETS un loc minunat de lucru este oamenii. Avem o comunitate extraordinară de oameni de știință, ingineri și dezvoltatori din diverse medii, ceea ce permite o mulțime de colaborări interesante.
Credeti că un AI va putea vreodată să treacă testul Turing?
De la anii 1950, au existat multe interpretări cu privire la modul în care testul Turing ar trebui să fie realizat în practică. Probabil că există un acord general că testul Turing nu a fost trecut în sensul filosofic că nu există niciun sistem AI care să gândească ca un om. Cu toate acestea, acesta a devenit un subiect foarte de nișă. Majoritatea oamenilor nu construiesc sisteme pentru a trece testul Turing – dorim ca acestea să atingă obiective specifice.
Pentru unele dintre aceste sarcini, de exemplu, recunoașterea vorbirii sau înțelegerea limbajului natural, performanța umană poate fi considerată în mod justificat ca standardul de aur. Dar există și multe alte sarcini în care ne-am aștepta ca un sistem automat să facă mult mai bine decât oamenii sau în care un sistem automat și un expert uman trebuie să lucreze împreună pentru a obține cel mai bun rezultat. De exemplu, într-un context educațional, nu dorim ca un sistem AI să înlocuiască un profesor: dorim ca acesta să ajute profesorii, fie prin identificarea modelelor în traiectoriile de învățare ale elevilor, fie prin ajutorul la notare sau prin găsirea celor mai bune materiale didactice.
Există altceva pe care ați dori să-l împărtășiți despre ETS sau NLP?
Mulți oameni cunosc ETS pentru evaluările și sistemele sale de evaluare automată. Dar facem mult mai mult decât atât. Avem multe capacități, de la biometria vocală la aplicații de dialog vorbit și suntem întotdeauna în căutarea unor modalități noi de integrare a tehnologiei în procesul de învățare. Acum, că mulți studenți învață de acasă, am deschis câteva dintre capacitățile noastre de cercetare pentru publicul larg.
Mulțumim pentru interviu și pentru a ne oferi această perspectivă asupra ultimelor avansuri în NLP și recunoașterea vorbirii. Cine dorește să afle mai multe poate vizita Serviciile de Testare Educațională.












