Modele și platforme AI
Viitorul evaluării vorbirii – Lideri de opinie
În întreaga lume, numărul celor care învață limba engleză continuă să crească. Instituțiile de învățământ și angajatorii trebuie să poată evalua competența lingvistică a celor care învață limba engleză – în special, abilitatea de a vorbi, deoarece limba vorbită rămâne una dintre cele mai importante abilități lingvistice. Provocarea, atât pentru dezvoltatorii de evaluări, cât și pentru utilizatorii finali, este de a găsi o modalitate de a face acest lucru în mod precis, rapid și financiar viabil. Ca parte a acestei provocări, evaluarea acestor evaluări vine cu propriul set de factori, în special atunci când luăm în considerare diferitele domenii (vorbire, scriere etc.) care sunt testate. Având în vedere că cererea de competențe lingvistice în limba engleză la nivel global este de așteptat să crească, cum ar trebui să arate viitorul evaluării vorbirii pentru a satisface aceste nevoi?
Răspunsul la această întrebare, în parte, se găsește în evoluția evaluării vorbirii până în prezent. Evaluarea răspunsurilor vorbite construite a fost realizată în mod tradițional de către evaluatori umani. Acest proces, totuși, are tendința de a fi scump și lent și are provocări suplimentare, inclusiv scalabilitatea și diversele limitări ale evaluatorilor umani (de exemplu, subiectivitatea sau prejudecățile evaluatorilor). Așa cum se discută în cartea noastră Evaluarea vorbirii automate: Utilizarea tehnologiilor lingvistice pentru a evalua vorbirea spontană, pentru a aborda aceste provocări, un număr tot mai mare de evaluări utilizează tehnologia de evaluare a vorbirii automate ca singură sursă de evaluare sau în combinație cu evaluatori umani. Înainte de a utiliza evaluarea automată, totuși, performanța acestor motoare trebuie să fie evaluată cu atenție, în special în ceea ce privește fiabilitatea scorului, valabilitatea (măsoară sistemul ceea ce este destinat să măsoare?) și echitatea (adică, sistemul nu trebuie să introducă prejudecăți legate de subgrupuri de populație, cum ar fi sexul sau limba maternă).
De la 2006, motorul de evaluare a vorbirii al ETS, SpeechRater®, a fost operaționalizat în evaluarea TOEFL® Practice Online (TPO) (utilizată de cei care se pregătesc pentru evaluarea TOEFL iBT®) și, din 2019, SpeechRater a fost utilizat și, împreună cu evaluatori umani, pentru evaluarea secțiunii de vorbire a evaluării TOEFL iBT®. Motorul evaluează o gamă largă de abilități de vorbire pentru vorbirea spontană non-nativă, inclusiv pronunția și fluența, vocabularul și gramatica, și abilitățile de vorbire de nivel superior legate de coerență și progresia ideilor. Aceste caracteristici sunt calculate utilizând procesarea limbajului natural (NLP) și algoritmi de procesare a vorbirii. Un model statistic este apoi aplicat acestor caracteristici pentru a atribui un scor final răspunsului unui examinat.
Deși acest model este instruit pe date observate anterior evaluate de către evaluatori umani, el este, de asemenea, revizuit de către experți în conținut pentru a-și maximiza valabilitatea. Dacă un răspuns este considerat a fi non-scorabil din cauza calității audio sau a altor probleme, motorul poate marca acest răspuns pentru revizuire suplimentară pentru a evita generarea unui scor potențial nesigur sau invalid. Evaluatorii umani sunt întotdeauna implicați în evaluarea răspunsurilor vorbite în evaluarea TOEFL iBT cu nivel ridicat de risc.
În timp ce evaluatorii umani și SpeechRater sunt utilizați în prezent împreună pentru a evalua răspunsurile examinaților în evaluări cu nivel ridicat de risc, ambele joacă un rol în ceea ce poate fi viitorul evaluării competenței lingvistice în limba engleză. Evaluatorii umani au capacitatea de a înțelege conținutul și organizarea discursului unui răspuns vorbit într-un mod profund. În contrast, motoarele de evaluare a vorbirii automate pot măsura cu mai multă precizie anumite aspecte detaliate ale vorbirii, cum ar fi fluența sau pronunția, pot arăta o consistență perfectă în timp, pot reduce timpul și costul general de evaluare și pot fi mai ușor de scalat pentru a susține volume mari de testare. Când evaluatorii umani și sistemele de evaluare a vorbirii automate sunt combinate, sistemul rezultat poate beneficia de punctele forte ale fiecărei abordări de evaluare.
Pentru a evolua în mod continuu motoarele de evaluare a vorbirii automate, cercetarea și dezvoltarea trebuie să se concentreze pe următoarele aspecte, printre altele:
- Construirea sistemelor de recunoaștere automată a vorbirii cu o acuratețe mai mare: Deoarece majoritatea caracteristicilor unui sistem de evaluare a vorbirii depind direct sau indirect de această componentă a sistemului care convertește vorbirea examinatului într-o transcriere text, o recunoaștere automată a vorbirii de înaltă acuratețe este esențială pentru obținerea unor caracteristici valabile;
- Explorarea unor modalități noi de combinare a scorurilor umane și automate: Pentru a profita pe deplin de punctele forte ale scorurilor evaluatorilor umani și ale motoarelor de evaluare automate, trebuie explorate mai multe modalități de combinare a acestor dovezi;
- Luarea în considerare a anomaliilor în răspunsuri, atât tehnice, cât și comportamentale: Filtrii de înaltă performanță, capabili să semnaleze astfel de răspunsuri și să le excludă din evaluarea automată, sunt necesari pentru a asigura valabilitatea și fiabilitatea scorurilor de evaluare rezultate;
- Evaluarea vorbirii spontane sau conversaționale care are loc cel mai frecvent în viața de zi cu zi: Deși evaluarea automată a unor astfel de discursuri interactive este un obiectiv important, acestea prezintă numeroase provocări de evaluare, inclusiv evaluarea generală și scorarea;
- Explorarea tehnologiilor de învățare profundă pentru evaluarea vorbirii automate: Acest paradigma relativ recent din învățarea mașinilor a produs creșteri semnificative ale performanței în multe sarcini de inteligență artificială (IA) în ultimii ani (de exemplu, recunoașterea automată a vorbirii, recunoașterea imaginilor), și, prin urmare, este probabil ca evaluarea automată să poată beneficia, de asemenea, de utilizarea acestei tehnologii. Cu toate acestea, deoarece majoritatea acestor sisteme pot fi considerate abordări „cutie neagră”, atenția acordată interpretării scorului rezultat va fi importantă pentru a menține un anumit nivel de transparență.
Pentru a se adapta la o populație de vorbitori de limba engleză în creștere și în schimbare, sistemele de evaluare a vorbirii de următoare generație trebuie să extindă automatizarea și să măsoare o gamă mai largă de aspecte, permițând consistență și scalabilitate. Acest lucru nu înseamnă că elementul uman va fi eliminat, în special pentru evaluările cu nivel ridicat de risc. Evaluatorii umani vor rămâne, probabil, esențiali pentru capturarea anumitor aspecte ale vorbirii care vor rămâne greu de evaluat în mod precis de către sistemele de evaluare automate pentru o perioadă de timp, inclusiv aspectele detaliate ale conținutului vorbit și discursului. Utilizarea sistemelor de evaluare a vorbirii automate în mod izolat pentru evaluări cu consecințe semnificative prezintă, de asemenea, riscul de a nu identifica răspunsurile problematice ale examinaților – de exemplu, răspunsuri care sunt în afara subiectului sau plagiate, și, ca urmare, pot duce la o valabilitate și fiabilitate redusă. Utilizarea atât a evaluatorilor umani, cât și a sistemelor de evaluare automate în combinație poate fi cea mai bună modalitate de evaluare a vorbirii în evaluări cu nivel ridicat de risc pentru perioada previzibilă, în special dacă se evaluează vorbirea spontană sau conversațională.
Scris de: Keelan Evanini, Director de cercetare a vorbirii, ETS și Klaus Zechner, Științificior senior de gestionare, Vorbire, ETS
ETS lucrează cu instituții de învățământ, întreprinderi și guverne pentru a desfășura cercetări și a dezvolta programe de evaluare care oferă informații semnificative pe care acestea le pot folosi pentru a evalua oameni și programe. ETS dezvoltă, administrează și evaluează peste 50 de milioane de teste anual în peste 180 de țări și peste 9.000 de locații din întreaga lume. Proiectăm evaluările noastre cu o perspectivă de înțelegere a industriei, cercetare riguroasă și un angajament neclintit față de calitate, astfel încât putem ajuta comunitățile de învățământ și de la locul de muncă să ia decizii informate. Pentru a afla mai multe, vizitați ETS.













