AI 모델 및 플랫폼
스피치 평가의 미래 – 사상가들
전 세계적으로 영어 학습자의 수가 계속 증가하고 있습니다. 교육 기관과 고용주는 영어 학습자의 영어 능력을 평가할 수 있어야 하며, 특히 말하기 능력은 가장 중요한 언어 능력 중 하나입니다. 그러나 이 평가를 정확하게, 빠르게, 그리고 경제적으로行하는 방법을 찾는 것이 도전입니다. 이 도전의 일부는 평가를 채점하는 것입니다. 특히 시험에서 평가하는 영역(스피치, 글쓰기 등)이 다르기 때문에 채점에는 여러 가지 요인이 고려되어야 합니다. 영어 언어 능력이全球적으로 더욱 중요해질 것으로 예상됨에 따라, 스피치 평가의 미래는 이러한需求을 충족하기 위해 어떻게 vypad해야 하는지에 대한 답을 찾을 수 있습니다.
그 답은 부분적으로 스피치 평가의 현재까지의 발전에서 찾을 수 있습니다. 구성된 구두 응답을 평가하는 것은 역사적으로 인간 평가자를 통해行해 왔습니다. 그러나 이 과정은 비용이 많이 들고 시간이 오래 걸리며, 확장성과 인간 평가자의 여러 가지 약점(예: 평가자의 주관성 또는 편향성)과 같은 추가적인 도전을 안겨줍니다. 우리의 책 Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech에서 논의한 바와 같이, 이러한 도전을 극복하기 위해 점점 더 많은 평가에서 자동화된 스피치 평가 기술을 사용하고 있습니다. 그러나 자동화된 채점 엔진을 배포하기 전에, 그들의 성능을 철저히 평가해야 합니다. 특히 채점의 신뢰성, 타당성(시스템이 측정해야 하는 것을 측정하는가?), 공정성(시스템이 인구 하위 그룹에 대한 편향을 도입하지 않는지)에 대한 평가입니다.
2006년부터 ETS의 스피치 평가 엔진인 SpeechRater는 TOEFL Practice Online(TPO) 평가에서 운영되고 있으며, 2019년부터는 TOEFL iBT 평가의 스피치 섹션에서도 인간 평가자와 함께 사용되고 있습니다. 이 엔진은 비원어민의 tự發적인 스피치에 대한 다양한 스피치 능력을 평가합니다. 발음, 유창성, 어휘 범위, 문법, 그리고 일관성과 아이디어의 진행과 같은 높은 수준의 스피치 능력입니다. 이러한 기능은 자연어 처리(NLP)와 스피치 처리 알고리즘을 사용하여 계산됩니다. 그런 다음 통계 모델을 적용하여 시험자의 응답에 대한 최종 점수를 할당합니다.
이 모델은 이전에 인간 평가자가 평가한 데이터에 기반하여 훈련되며, 또한 내용 전문가에 의해 검토되어 타당성을 최대화합니다. 응답이 오디오 품질 또는 기타 문제로 인해 평가할 수 없는 경우, 엔진은 잠재적으로 신뢰할 수 없거나 부정확한 점수를 생성하지 않도록 추가 검토를 위해 플래그할 수 있습니다. 인간 평가자는 높은 이해도 평가에서 스피치 응답의 채점에 항상 참여합니다.
현재 인간 평가자와 SpeechRater가 함께 사용되고 있는 높은 이해도 평가에서, 두 가지 방법 모두 영어 언어 능력 평가의 미래에 기여할 수 있습니다. 인간 평가자는 깊은 수준에서 스피치 응답의 내용과 담론 조직을 이해할 수 있습니다. 반면에, 자동화된 스피치 평가 엔진은 유창성 또는 발음과 같은 스피치의 세부적인 측면을 더 정확하게 측정할 수 있습니다. 또한 일관성을 유지하고, 채점 시간과 비용을 줄일 수 있으며, 더 쉽게 확장하여大量의 시험을 지원할 수 있습니다. 인간 평가자와 자동화된 스피치 평가 시스템을 결합하면, 각 평가 방법의 강점을 활용할 수 있습니다.
자동화된 스피치 평가 엔진을 지속적으로 발전시키기 위해, 연구와 개발은 다음 영역에 집중해야 합니다.
- 더 높은 정확도의 자동 음성 인식 시스템 구축: 대부분의 스피치 평가 시스템의 기능은 이 시스템의 구성 요소에 직접 또는 간접적으로 의존하기 때문에, 높은 정확도의 자동 음성 인식은 유효한 기능을 얻기 위해 필수적입니다.
- 인간과 자동 평가의 새로운 결합 방법 탐색: 인간 평가자 점수와 자동 엔진 점수의 각각의 강점을 최대한 활용하기 위해, 이러한 증거를 결합하는 더 많은 방법을 탐색해야 합니다.
- 응답의 비정상성에 대한 처리: 기술적 또는 행동적 비정상성을 플래그하고 자동 평가에서 제외하는 고성능 필터는 평가 점수의 타당성과 신뢰성을 보장하기 위해 필요합니다.
- 일상 생활에서 가장 자주 발생하는 자발적 또는 대화형 스피치 평가: 자동화된 대화형 스피치 평가 목표는 중요하지만, 이러한 항목은 평가와 채점에 많은 도전을 제기합니다.
- 자동화된 스피치 평가를 위한 딥 러닝 기술 탐색: 이 최근의 기계 학습 패러다임은 많은 인공 지능(AI) 작업에서 상당한 성능 향상을 보여주었으므로, 자동화된 평가에도 이 기술을 사용할 수 있을 것입니다. 그러나 이러한 시스템은 “블랙박스” 접근 방식으로 간주될 수 있으므로, 결과 점수의 해석 가능성을 유지하기 위해 주의가 필요합니다.
영어 학습자 인구의 증가와 변화에 대응하기 위해, 차세대 스피치 평가 시스템은 자동화와 평가할 수 있는 범위를 확장해야 하며, 일관성과 확장성을 제공해야 합니다. 그러나 높은 이해도 평가에서는 인간 요소가 제거되지 않을 것입니다. 인간 평가자는 자동화된 평가 시스템이 정확하게 평가하기 어려운 스피치의 특정 측면을 포착하는 데 계속해서 필수적입니다. 또한, CONSEQUENTIAL 평가에서 자동화된 스피치 평가 시스템을 단독으로 사용하는 경우, 오프토픽 또는 표절된 응답과 같은 문제가 있는 응답을 식별하지 못할 수 있으며, 이는 타당성과 신뢰성을 감소시킬 수 있습니다. 따라서 높은 이해도 평가에서 인간 평가자와 자동화된 평가 시스템을 결합하는 것이 가장 좋은 방법일 수 있습니다.
작성자: Keelan Evanini, Speech Research 책임자, ETS & Klaus Zechner, Speech 연구 과장, ETS
ETS는 교육 기관, 기업, 정부와 협력하여 의미 있는 정보를 제공할 수 있는 평가 프로그램을 개발하고, 평가를 실시하며, 채점합니다. ETS는 전 세계 180개국 이상의 9,000개 이상의 위치에서 매년 5,000만 건 이상의 평가를 개발하고, 실시하며, 채점합니다. 우리는 산업을 선도하는 통찰력, 엄격한 연구, 그리고 품질에 대한妥協하지 않는 헌신을 통해 평가를 설계하여 교육 및 직장 커뮤니티가 정보에 기반한 결정을 내릴 수 있도록 지원합니다. 자세한 정보는 ETS를 방문하십시오.













