Модели и платформы ИИ
Будущее оценки речи – лидеры мнений
По всему миру количество изучающих английский язык продолжает расти. Образовательным учреждениям и работодателям необходимо иметь возможность оценивать уровень владения английским языком у изучающих, в частности, их способность говорить, поскольку устная речь остается одним из наиболее важных языковых навыков. Вызовом, как для разработчиков оценок, так и для конечных пользователей, является найти способ сделать это точно, быстро и финансово эффективно. В рамках этого вызова оценка этих оценок имеет свои собственные факторы, особенно когда мы рассматриваем различные области (речь, письмо и т. д.), которые тестируются. С учетом того, что спрос на навыки английского языка во всем мире ожидается только увеличиться, каким должно быть будущее оценки речи, чтобы удовлетворить эти потребности?
Ответ на этот вопрос, частично, заключается в эволюции оценки речи на сегодняшний день. Оценка конструктивных устных ответов исторически осуществлялась с помощью человеческих оценщиков. Однако этот процесс, как правило, является дорогим и медленным, и имеет дополнительные проблемы, включая масштабируемость и различные недостатки человеческих оценщиков themselves (например, субъективность или предвзятость оценщика). Как обсуждается в нашей книге Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech, для решения этих проблем все больше оценок используют технологию автоматической оценки речи в качестве единственного источника оценки или в сочетании с человеческими оценщиками. Однако перед развертыванием автоматических систем оценки их производительность должна быть тщательно оценена, особенно в отношении надежности оценки, валидности (измеряет ли система то, что она должна измерять?) и справедливости (т. е. система не должна вводить предвзятость, связанную с подгруппами населения, такими как пол или родной язык).
С 2006 года собственный движок оценки речи ETS, SpeechRater, используется в оценке TOEFL Practice Online (TPO) (используется потенциальными тестируемыми для подготовки к оценке TOEFL iBT) и с 2019 года SpeechRater также используется, вместе с человеческими оценщиками, для оценки раздела речи в оценке TOEFL iBT. Движок оценивает широкий спектр навыков речи для спонтанной неродной речи, включая произношение и плавность, словарный запас и грамматику, и более высокие навыки речи, связанные с связностью и прогрессией идей. Эти функции вычисляются с помощью алгоритмов обработки естественного языка (NLP) и речи. Затем статистическая модель применяется к этим функциям для присвоения окончательного балла ответу тестируемого.
Хотя эта модель обучена на ранее наблюдаемых данных, оцененных человеческими оценщиками, она также проверяется экспертами по содержанию для максимизации ее валидности. Если ответ не может быть оценен из-за качества аудио или других проблем, движок может пометить его для дальнейшего рассмотрения, чтобы избежать генерации потенциально ненадежной или недействительной оценки. Человеческие оценщики всегда участвуют в оценке устных ответов в высокорисковых оценках речи TOEFL iBT.
Поскольку человеческие оценщики и SpeechRater в настоящее время используются вместе для оценки ответов тестируемых в высокорисковых оценках речи, оба играют роль в том, каким может быть будущее оценки английского языка. Человеческие оценщики имеют возможность глубоко понять содержание и организацию дискурса устного ответа. Напротив, автоматические системы оценки речи могут более точно измерять определенные детальные аспекты речи, такие как плавность или произношение, демонстрируют идеальную последовательность во времени, могут сократить общее время и стоимость оценки и более легко масштабируются для поддержки больших объемов тестирования. Когда человеческие оценщики и автоматические системы оценки речи объединяются, результирующая система может извлечь выгоду из сильных сторон каждого подхода к оценке.
Для того чтобы автоматические системы оценки речи могли постоянно эволюционировать, исследования и разработка должны сосредоточиться на следующих аспектах, среди прочего:
- Создание систем автоматического распознавания речи с более высокой точностью: Поскольку большинство функций системы оценки речи напрямую или косвенно зависят от этой компоненты системы, которая преобразует речь тестируемого в текстовую транскрипцию, высокая точность автоматического распознавания речи необходима для получения действительных функций;
- Изучение новых способов объединения человеческих и автоматических оценок: Чтобы максимально использовать сильные стороны оценок человеческих оценщиков и автоматических систем оценки, необходимо изучить больше способов объединения этих данных;
- Учет аномалий в ответах, как технических, так и поведенческих: Высокопроизводительные фильтры, способные пометить такие ответы и исключить их из автоматической оценки, необходимы для обеспечения валидности и надежности результирующих оценок;
- Оценка спонтанной или разговорной речи, которая происходит чаще всего в повседневной жизни: Хотя автоматическая оценка такой интерактивной речи является важной целью, эти элементы представляют многочисленные проблемы оценки, включая общую оценку и оценку;
- Изучение технологий глубокого обучения для автоматической оценки речи: Этот относительно недавний парадигма в машинном обучении произвела значительные улучшения производительности на многих задачах искусственного интеллекта (AI) в последние годы (например, автоматическое распознавание речи, распознавание изображений), и поэтому вероятно, что автоматическая оценка также может извлечь выгоду из использования этой технологии. Однако, поскольку большинство этих систем можно считать “черными ящиками”, внимание к интерпретируемости результирующей оценки будет важно для поддержания некоторого уровня прозрачности.
Чтобы удовлетворить растущее и меняющееся население изучающих английский язык, системы следующего поколения оценки речи должны расширить автоматизацию и диапазон того, что они могут измерить, обеспечивая последовательность и масштабируемость. Это не означает, что человеческий элемент будет удален, особенно для высокорисковых оценок. Человеческие оценщики, вероятно, останутся необходимыми для захвата определенных аспектов речи, которые будут трудно оценить точно автоматическими системами оценки в течение некоторого времени, включая детальные аспекты устного содержания и дискурса. Использование автоматических систем оценки речи в изоляции для значимых оценок также несет риск не выявления проблемных ответов тестируемых – например, ответов, которые не связаны с темой или являются плагиатом, и, как следствие, могут привести к снижению валидности и надежности. Использование как человеческих оценщиков, так и автоматических систем оценки в сочетании может быть лучшим способом оценки речи в высокорисковых оценках в течение некоторого времени, особенно если оценивается спонтанная или разговорная речь.
Написано: Килин Эванини, Директор исследования речи, ETS и Клаус Зехнер, Старший научный сотрудник, Речь, ETS
ETS работает с образовательными учреждениями, предприятиями и правительствами для проведения исследований и разработки программ оценки, которые предоставляют значимую информацию, на которую они могут положиться для оценки людей и программ. ETS разрабатывает, проводит и оценивает более 50 миллионов тестов ежегодно в более чем 180 странах на более чем 9 000 объектах по всему миру. Мы проектируем наши оценки с ведущими идеями, строгими исследованиями и непримиримой приверженностью качеству, чтобы мы могли помочь образовательным и рабочим сообществам принимать обоснованные решения. Чтобы узнать больше, посетите ETS.













