Моделі та платформи ШІ

Майбутнє оцінювання мови – лідери думок

mm mm
Додайте Unite.AI до бажаних джерел у Google

По всьому світу кількість учнів англійської мови продовжує зростати. Освітні установи та роботодавці повинні能够 оцінювати рівень англійської мови учнів, особливо їхню мовну здатність, оскільки розмовна мова залишається однією з найважливіших мовних здібностей. Виклик, як для розробників оцінок, так і для кінцевих користувачів, полягає в тому, щоб знайти спосіб зробити це точно, швидко та фінансово досяжним. Як частина цього виклику, оцінка цих оцінок супроводжується своєю власною групою факторів, особливо коли ми розглядаємо різні галузі (мова, письмо тощо), яким піддається тестування. З огляду на те, що попит на англійську мову по всьому світу очікується лише збільшиться, яким повинно бути майбутнє оцінювання мови, щоб задовольнити ці потреби?

Відповідь на це питання, частково, знаходиться в еволюції оцінювання мови на сьогоднішній день. Оцінка конструктивних усних відповідей історично проводилася за допомогою людських оцінювачів. Однак цей процес схильний бути дорогим і повільним, і має додаткові виклики, включаючи масштабованість та різні недоліки людських оцінювачів самих (наприклад, суб’єктивність або упередженість оцінювача). Як обговорюється в нашій книзі Автоматична оцінка мови: Використання мовних технологій для оцінювання спонтанної мови, щоб подолати ці виклики, все більше оцінок зараз використовують технологію автоматичної оцінки мови як єдине джерело оцінювання або в поєднанні з людськими оцінювачами. Однак перед розгортанням автоматичних систем оцінювання їхню продуктивність потрібно ретельно оцінити, особливо щодо надійності оцінки, валідності (чи система вимірює те, що повинна?) та справедливості (тобто система не повинна вводити упередженість, пов’язану з підгрупами населення, такими як стать чи рідна мова).

З 2006 року власний двигун оцінювання мови ETS, SpeechRater®, був впроваджений в оцінці TOEFL® Practice Online (TPO) (яку використовують майбутні тести для підготовки до оцінки TOEFL iBT®), а з 2019 року SpeechRater також використовується разом з людськими оцінювачами для оцінювання розділу мовлення оцінки TOEFL iBT®. Двигун оцінює широкий спектр мовної здатності для спонтанної нерідної мови, включаючи вимову та плавність, лексичний діапазон і граматику, а також вищу мовну здатність, пов’язану з узгодженість та розвиток ідей. Ці функції обчислюються за допомогою алгоритмів обробки природної мови (NLP) та мовлення. Потім застосовується статистична модель до цих функцій для призначення остаточного балу відповіді тестируемого.

Хоча ця модель тренується на раніше спостережуваних даних, оцінених людськими оцінювачами, її також переглядають експерти з вмісту, щоб максимізувати її валідність. Якщо відповідь визнається несортованою через якість аудіо чи інші проблеми, двигун може позначити її для подальшого перегляду, щоб уникнути генерації потенційно ненадійної або недійсної оцінки. Людські оцінювачі завжди залучені до оцінювання усних відповідей у високоризикових оцінках мовлення TOEFL iBT.

Оскільки людські оцінювачі та SpeechRater зараз використовуються разом для оцінювання відповідей тестируемих у високоризикових оцінках мовлення, обидва грають роль у тому, яким може бути майбутнє оцінювання мови. Людські оцінювачі мають можливість глибоко зрозуміти вміст та організацію дискурсу усної відповіді. Навпаки, автоматичні системи оцінювання мови можуть більш точно виміряти певні деталі мови, такі як плавність або вимова, демонструють ідеальну послідовність у часі, можуть скоротити загальний час та вартість оцінювання, і легше масштабуються для підтримки великих обсягів тестування. Коли людські оцінювачі та автоматичні системи оцінювання мови поєднуються, результуjící система може користуватися сильними сторонами кожного підходу до оцінювання.

Для того щоб продовжувати еволюціонувати автоматичні двигуни оцінювання мови, дослідження та розвиток повинні зосередитися на таких аспектах, серед інших:

  • Створення автоматичних систем розпізнавання мови з вищою точністю: Оскільки більшість функцій системи оцінювання мови залежать безпосередньо або опосередковано від цього компонента системи, який перетворює мову тестируемого у текстовий транскрипт, висока точність автоматичного розпізнавання мови є важливою для отримання валідних функцій;
  • Дослідження нових способів поєднання людських та автоматичних оцінок: Щоб повністю використати сильні сторони оцінок людських оцінювачів та оцінок автоматичних двигунів, потрібно дослідити більше способів поєднання цих даних;
  • Врахування аномалій у відповідях, як технічних, так і поведінкових: Потужні фільтри, здатні позначити такі відповіді та виключити їх з автоматичної оцінки, необхідні для забезпечення валідності та надійності результатів оцінювання;
  • Оцінка спонтанної чи розмовної мови, яка відбувається найчастіше в повсякденному житті: Хоча автоматична оцінка такої інтерактивної мови є важливою метою, ці елементи представляють численні виклики для оцінювання, включаючи загальну оцінку та оцінювання;
  • Дослідження технологій глибокого навчання для автоматичної оцінки мови: Ця відносно недавня парадигма у машинному навчанні призвела до суттєвого покращення результатів багатьох завдань штучного інтелекту (наприклад, автоматичного розпізнавання мови, розпізнавання зображень) за останні роки, і тому ймовірно, що автоматична оцінка також може виграти від використання цієї технології. Однак, оскільки більшість цих систем можна вважати “чорними скриньками”, увага до інтерпретації результатів оцінювання буде важливою для підтримання певного рівня прозорості.

Щоб задовольнити зростаюче та змінюване населення учнів англійської мови, наступні системи оцінювання мови повинні розширити автоматизацію та діапазон того, що вони можуть виміряти, забезпечуючи послідовність та масштабованість. Це не означає, що людський елемент буде видалений, особливо для високоризикових оцінок. Людські оцінювачі, ймовірно, залишаться важливими для захоплення певних аспектів мови, які будуть важко оцінити точно автоматичними системами оцінювання мови протягом деякого часу, включаючи детальні аспекти мовного вмісту та дискурсу. Використання автоматичних систем оцінювання мови в ізоляції для оцінок з наслідками також несе ризик неідентифікації проблемних відповідей тестируемих – наприклад, відповідей, які є поза темою або плагіатом, і, як наслідок, можуть привести до зниження валідності та надійності. Використання як людських оцінювачів, так і автоматичних систем оцінювання мови в поєднанні може бути найкращим способом оцінювання мови в високоризикових оцінках протягом найближчого майбутнього, особливо якщо оцінюється спонтанна чи розмовна мова.

Написано: Кілан Еваніні, Директор досліджень мови, ETS та Клаус Зехнер, Старший науковий співробітник, Мова, ETS

ETS працює з освітніми закладами, підприємствами та урядами для проведення досліджень та розробки програм оцінювання, які забезпечують значущу інформацію, яку вони можуть використовувати для оцінювання людей та програм. ETS розробляє, проводить та оцінює понад 50 мільйонів тестів щорічно у понад 180 країнах у понад 9 000 місцях по всьому світу. Ми проектуємо наші оцінки з інсайтом, отриманим з галузі, суворими дослідженнями та непохитним зобов’язанням щодо якості, щоб допомогти освітнім та робочим спільнотам приймати обґрунтовані рішення. Дізнайтеся більше на сайті ETS.

Директор відділу дослідження мови в дослідженні та розробці в Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).