Modele și platforme AI
Nitin Madnani, Senior Research Scientist la ETS – Seria de interviuri

Nitin Madnani este Senior Research Scientist în cadrul grupului de cercetare Natural Language Processing (NLP) de la Educational Testing Service (ETS). ETS a fost fondat în 1947 și este cea mai mare organizație privată non-profit de testare și evaluare educațională din lume.
Puteți începe prin a explica care este misiunea ETS?
Misiunea ETS este de a promova calitatea și echitatea în educație pentru toți învățătorii din întreaga lume. Această misiune stă la baza produselor, serviciilor, cercetărilor și eforturilor noastre de dezvoltare, cu scopul de a promova învățarea, de a sprijini educația, dezvoltarea profesională și de a măsura cunoștințele și abilitățile, pentru toată lumea.
Credem că oricine, oriunde, poate face o diferență în viața sa prin învățare și că munca noastră de cercetare, evaluare, măsurare și politici poate juca un rol important în facilitarea acestei învățări.
Ce este atât de pasionant în ceea ce privește NLP?
Toate limbile umane sunt atât de complexe și haotice. Ele ne permit să exprimăm o gamă de emoții în vorbire și chiar în scris și evoluează în timp. Pe de altă parte, un computer este atât de determinist și clinic în procesarea intrărilor sale. Procesarea limbajului natural (NLP) este o zonă a inteligenței artificiale care încearcă să facă acest dispozitiv suprem non-uman să înțeleagă complexitățile limbajului uman prin combinarea tehnicilor din știința calculatoarelor, lingvistică și statistică. Cum puteți să nu găsiți acest lucru fascinant?
Oamenii de știință ETS NLP și vorbire au dezvoltat recent RSMTool. Puteți să ne spuneți ce face RSMTool?
În ultimii ani, toate modelele de învățare automată pot să prezinte un comportament părtinitor, indiferent de domeniul în care sunt aplicate, educația nefiind o excepție. Sistemele de notare automate utilizate pentru a atribui note sau calificative elevilor pentru vorbirea sau eseurile lor în teste sau în săli de clasă adesea utilizează modele de învățare automată. Prin urmare, este absolut posibil ca astfel de sisteme să se comporte într-un mod părtinitor. Un astfel de comportament părtinitor poate avea consecințe grave, mai ales dacă notele de la astfel de sisteme sunt utilizate pentru a lua decizii importante.
RSMTool este un instrument open-source pe care l-am dezvoltat împreună cu colega mea Anastassia Loukina (prezentată anterior pe Unite.AI) la ETS pentru a ajuta la identificarea oricăror prejudecăți sistemice dăunătoare în sistemele de notare automate, cât mai curând posibil, sperăm chiar înainte de a fi implementate în lumea reală. RSMTool este proiectat pentru a oferi o evaluare cuprinzătoare a motoarelor de notare AI, inclusiv nu numai metrici standard de acuratețe a prezicerii, ci și măsuri de echitate a modelului și metrici bazate pe teoria testării, ajutând dezvoltatorii de astfel de motoare să identifice posibile prejudecăți sau alte probleme în sistemele lor.
De unde vine numele RSMTool?
În domeniul evaluării educaționale, o persoană care atribuie o notă (sau “evaluează”) un eseu este adesea numită “evaluator”. Există evaluatori umani și evaluatori automatizați. RSMTool – prescurtare de la Rater Scoring Modeling Tool – este proiectat pentru a ajuta la crearea (și evaluarea) modelelor de notare utilizate de evaluatori automatizați.
Cum poate acest instrument să ajute dezvoltatorii să identifice posibile prejudecăți sau alte probleme în motoarele lor de notare AI?
În ultimele cinci decenii, oamenii de știință din domeniul măsurării educaționale – inclusiv mulți colegi de-ai noștri de la ETS – au efectuat cercetări valoroase cu privire la ceea ce face ca notarea automată (și umană) să fie corectă. Ca parte a acestei cercetări, ei au dezvoltat multe analize statistice și psihometrice pentru calcularea indicatorilor de prejudecată sistematică. Cu toate acestea, deoarece comunitățile psihometrice și NLP rareori interacționează, există puține oportunități de schimb de idei. Rezultatul este că cercetătorii și dezvoltatorii NLP care construiesc sisteme de notare automate – în special cercetătorii individuali și cei din companii mici – nu au acces facil la analizele psihometrice pe care ar trebui să le utilizeze pentru a verifica sistemele lor pentru prejudecăți. RSMTool încearcă să rezolve această problemă prin oferirea unui set mare și divers de analize psihometrice într-un pachet Python ușor de utilizat care poate fi incorporat cu ușurință de orice cercetător NLP în fluxul său de cercetare sau de operare.
Într-un caz de utilizare tipic, un cercetător ar furniza ca intrare un fișier sau un cadru de date cu notele sistemului numeric, notele standard (umane) și metadatele, dacă este cazul. RSMTool procesează aceste date și generează un raport HTML cuprinzător care include statistici descriptive, precum și multiple măsuri de performanță și echitate ale sistemului, printre altele. Un raport de exemplu RSMTool poate fi găsit la https://bit.ly/fair-tool. RSMTool poate funcționa cu modele de învățare automată tradiționale, bazate pe caracteristici (de exemplu, din biblioteca scikit-learn) și cu modele de învățare profundă. Deși ieșirea principală a RSMTool este raportul HTML care facilitează partajarea, acesta generează de asemenea fișiere de date tabulare (în formate CSV, TSV sau XLSX) ca ieșiri intermediare pentru utilizatori avansați. În cele din urmă, pentru a păstra lucrurile extrem de personalizabile, RSMTool implementează fiecare secțiune a raportului său sub formă de notebook Jupyter, astfel încât utilizatorii nu numai că pot alege care secțiuni sunt relevante pentru modelele lor de notare specifice, dar pot implementa cu ușurință analize personalizate și le pot include în raport cu foarte puțin efort.
Există multe studii recente despre notarea automată care au utilizat RSMTool pentru a evalua modelele lor de notare propuse.
Care sunt tipurile comune de prejudecăți care pot afecta sistemele de notare automate?
Tipul cel mai comun de prejudecată care afectează un sistem de notare automată este performanța diferită a subgrupurilor, adică atunci când sistemul automat se comportă diferit pentru diferite subgrupuri ale populației. De exemplu, un sistem de notare părtinitor ar putea produce note sistematic mai mici pentru eseuri scrise de, de exemplu, femei negre comparativ cu cele pentru bărbați albi, chiar dacă nu există diferențe sistematice în abilitățile de scriere reale afișate de aceste două subgrupuri în eseurile lor, din punctul de vedere al unui om.
ETS are o istorie bogată de cercetare privind echitatea pentru motoarele de notare automată. De exemplu, am examinat dacă e-rater® – motorul nostru de notare automată AI – prezintă vreo performanță diferențiată pentru subgrupuri definite de etnie, sex și țară (au găsit unele diferențe minore care au fost adresate prin modificări de politică ulterioare). Studii au examinat dacă e-rater® tratează răspunsurile scrise de către persoane cu dizabilități de învățare și/sau ADHD în mod sistematic diferit în medie (nu o face). Cel mai recent, un studiu examină dacă un sistem automat de notare a vorbirii prezintă vreo prejudecată sistematică împotriva persoanelor care au fost obligate să poarte măști de față comparativ cu cele care nu au purtat măști de față (nu o face). RSMTool conține mai multe analize psihometrice care încearcă să cuantifice performanța diferențiată a subgrupurilor peste subgrupuri pe care utilizatorul le poate defini pe datele sale.
ETS a ales să facă RSMTool open-source, puteți explica rațiunile și importanța din spatele acestei decizii?
Da, RSMTool este disponibil pe GitHub cu o licență Apache 2.0. Credem că este important ca un astfel de instrument să fie open-source și non-proprietar, astfel încât comunitatea să poată (a) verifica codul sursă al analizei deja disponibile pentru a se asigura că respectă standardele de echitate și (b) să contribuie cu noi analize pe măsură ce standardele evoluează și se schimbă. De asemenea, dorim să facem ușor pentru cercetătorii și dezvoltatorii NLP să utilizeze RSMTool în munca lor și să ne ajute în îmbunătățirea lui. Faptul că RSMTool este open-source este un exemplu clar al angajamentului continuu al ETS față de utilizarea responsabilă a IA în educație.
Care sunt unele dintre lecțiile pe care le-ați învățat din dezvoltarea și întreținerea RSMTool?
În ultimii cinci ani, în care Anastassia și eu am dezvoltat și întreținut RSMTool – cu ajutorul multor colegi de la ETS și contribuitori non-ETS de pe GitHub – am învățat două lecții cuprinzătoare. Prima este că diferiți utilizatori au nevoi diferite și abordarea “un singur dimensiune se potrivește tuturor” nu va funcționa pentru software interdisciplinar ca RSMTool. A doua lecție pe care am învățat-o a fost că, pentru a face ca software-ul open-source să fie adoptat, trebuie să faceți un efort suplimentar pentru a-l face cât mai robust posibil.
În calitate de administratori ai RSMTool, am identificat multe tipuri de utilizatori ai RSMTool. Unii dintre ei sunt “utilizatori puternici” (de exemplu, cercetători și dezvoltatori NLP) care doresc să selecteze funcționalități specifice RSMTool pentru a le integra în fluxul lor de învățare automată, utilizând în același timp și alte pachete Python. Pentru a satisface astfel de utilizatori, am creat o interfață API cuprinzătoare pentru a expune diverse funcții de pre- și post-procesare, precum și metrici personalizați conținute în RSMTool. O altă grupă de utilizatori sunt ceea ce numim “minimaliști”: analiști de date și ingineri care pot să nu aibă cunoștințe statistice sau de programare pentru a interacționa cu API-ul și preferă o pipeline “out-of-the-box” în schimb. Pentru a satisface astfel de utilizatori, am creat unelte de linie de comandă care pot fi ușor apelate în scripturi de înveliș, de exemplu. Am descoperit, de asemenea, că utilizatorii minimaliști sunt adesea reticenți să parcurgă lista (adesea lungă) de opțiuni de configurare RSMTool. Prin urmare, am construit un generator interactiv de configurare cu autocompletare care poate ajuta astfel de utilizatori să creeze fișiere de configurare pe baza nevoilor lor specifice.
În scopul de a satisface nevoile tuturor grupurilor noastre de utilizatori, am fost nevoiți să adoptăm practici pe care le-am considerat necesare pentru a face RSMTool robust. Ce înțelegem prin software robust? Pentru a fi robust, orice piesă de software trebuie să îndeplinească următoarele criterii: impactul oricărei modificări de cod asupra acurateței și performanței sale poate fi măsurat (bine testat), documentația sa este întotdeauna actualizată (bine documentat), iar software-ul (împreună cu dependențele sale) este ușor de instalat de către utilizatori. Pentru RSMTool, am utilizat diverse unelte și servicii open-source pentru a face ca acesta să îndeplinească definiția noastră. Avem un pachet de test cuprinzător (>90% acoperire de cod) pe care îl rulăm automat prin integrare continuă pentru orice și toate modificările trimise codului. Păstrăm o documentație extinsă (inclusiv multiple tutoriale din lumea reală) și orice funcționalitate nouă propusă pentru RSMTool trebuie să includă o componentă de documentație care este, de asemenea, revizuită ca parte a revizuirii codului. În cele din urmă, lansăm RSMTool sub formă de pachete care pot fi instalate cu ușurință (prin pip sau conda) și toate dependențele necesare sunt instalate automat.
Ce speră ETS să realizeze prin lansarea RSMTool?
Sectorul educației a cunoscut una dintre cele mai semnificative extinderi ale IA în ultimii ani, notarea automată a textului și a vorbirii devenind o aplicație din ce în ce mai frecventă a NLP. ETS a fost de multă vreme un lider în domeniul notării automate și, de la înființarea sa, a fost dedicat construirii de produse și evaluări corecte, destinate a servi învățătorilor din întreaga lume. Prin lansarea RSMTool, dezvoltat în colaborare strânsă între oameni de știință NLP și psihometricieni, ETS dorește să continue să promoveze utilizarea responsabilă a IA în educație într-un mod foarte concret; în special, dorim să subliniem că atunci când cercetătorii IA gândesc despre “performanța” unui sistem de notare automat, ar trebui să ia în considerare nu numai metricile standard de acuratețe a prezicerii (de exemplu, corelația Pearson), ci și cele de echitate a modelului. Mai larg, am dori ca RSMTool să servească ca exemplu de moduri în care cercetătorii NLP și psihometricienii pot și ar trebui să colaboreze.
Există altceva pe care ați dori să-l împărtășiți despre RSMTool?
Dorim să încurajăm cititorii să ne ajute să îmbunătățim RSMTool! Ei nu trebuie să fie psihometricieni sau experți NLP pentru a contribui. Avem multe probleme deschise legate de documentație și de programare Python care ar fi perfecte pentru orice programator Python începător sau intermediar. De asemenea, invităm contribuții la SKLL (Scikit-Learn Laboratory), – un alt pachet open-source ETS pentru rularea eficientă a experimentelor de învățare automată configurabile de utilizator și în lot – care este utilizat în mod subiacent de RSMTool.












