AIモデルとプラットフォーム

スピーチスコアリングの未来 – 思考のリーダー

mm mm
Unite.AI を Google の優先ソースに追加

世界中で、英語学習者の数は増加し続けています。教育機関や雇用主は、英語学習者の英語能力を評価する必要があります。特に、話す能力は、最も重要な言語能力の1つです。課題は、評価開発者とエンドユーザーにとって、英語能力を評価する方法を見つけることです。その方法は、正確で、迅速で、経済的に実行可能でなければなりません。評価のスコアリングは、特に、話す、書くなどのさまざまな分野で評価される場合、独自の要因を伴います。英語能力の需要は世界中で増加するだけなので、英語の話す能力を評価するために、スコアリングの未来はどのようなものであるべきでしょうか。

その質問の答えは、スピーチスコアリングの進化にあります。構築されたスピーチの評価は、従来、人間の評価者によって行われてきました。しかし、このプロセスは、高価で遅く、スケーラビリティや人間の評価者の限界などの課題があります。私たちの本「Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech」では、自動スピーチスコアリング技術が、評価の唯一のスコアリング源または人間の評価者と組み合わせて使用されることが増えています。自動スコアリングエンジンを展開する前に、そのパフォーマンスをスコアの信頼性、妥当性(システムが測定するべきものを測定しているか)、公平性(システムが人口サブグループに対する偏見を導入しない)に関して徹底的に評価する必要があります。

2006年以来、ETSのスピーチスコアリングエンジンであるSpeechRaterは、TOEFL Practice Online(TPO)評価で実用化されています。2019年以来、SpeechRaterは、人間の評価者とともに、TOEFL iBT評価のスピーチセクションのスコアリングにも使用されています。エンジンは、発音、流暢性、語彙の範囲、文法、アイデアの連結性などの幅広いスピーチ能力を評価します。これらの機能は、自然言語処理(NLP)とスピーチ処理アルゴリズムを使用して計算されます。統計モデルは、これらの機能に適用されて、テスト受験者の回答に最終的なスコアを割り当てます。

このモデルは、人間の評価者によって評価された過去のデータでトレーニングされていますが、コンテンツの専門家によってレビューされて、妥当性を最大化します。回答がオーディオの品質やその他の問題によりスコアリングできない場合、エンジンは、信頼性や妥当性のないスコアを生成するのを避けるために、回答を人間の評価者に転送できます。人間の評価者は、TOEFL iBTスピーチ評価のスコアリングに常に参加しています。

人間の評価者とSpeechRaterは現在、ハイステークスのスピーチ評価でテスト受験者の回答をスコアリングするために使用されています。人間の評価者は、スピーチの内容や談話の組織を深く理解できます。一方、自動スピーチスコアリングエンジンは、流暢性や発音などのスピーチの詳細な側面をより正確に測定できます。さらに、自動スコアリングエンジンは、一貫性を保ち、スコアリング時間とコストを削減し、スケーラビリティを向上させることができます。人間の評価者と自動スピーチスコアリングシステムを組み合わせると、スコアリングシステムの強みを最大化できます。

自動スピーチスコアリングエンジンの進化を続けるために、研究と開発は以下の側面に焦点を当てる必要があります。

  • より高い精度の自動音声認識システムの構築:スピーチスコアリングシステムのほとんどの機能は、直接的または間接的に、このシステムのコンポーネントに依存しているため、正確な自動音声認識は、妥当な機能を取得するために不可欠です。
  • 人間と自動スコアリングの組み合わせの新しい方法の探索:人間の評価者の強みと自動エンジンの強みを最大限に活用するために、スコアリングの証拠を組み合わせる新しい方法を探索する必要があります。
  • 回答の技術的および行動的異常の考慮:有効なフィルタリングが必要です。そうでない場合、自動スコアリングから除外する必要があります。
  • 日常生活で最も頻繁に発生する即興または会話的なスピーチの評価:自動スコアリングの重要な目標ですが、評価とスコアリングの課題があります。
  • 自動スピーチスコアリングのためのディープラーニング技術の探索:この機械学習の新しいパラダイムは、最近のAIタスクで大きなパフォーマンスの向上をもたらしてきました。ただし、スコアの解釈可能性に注意する必要があります。

英語学習者の人口が増加し変化するため、次世代のスピーチスコアリングシステムは、自動化と評価可能な範囲を拡大し、一貫性とスケーラビリティを実現する必要があります。ただし、ハイステークスの評価では、人間の評価者が除去されることはありません。人間の評価者は、自動スコアリングシステムが正確に評価するのが難しい、スピーチの内容や談話の組織などの側面を捉えるために不可欠です。自動スピーチスコアリングシステムを単独で使用すると、問題のある回答(例:オフトピックまたは盗作)を特定できない可能性があり、妥当性と信頼性が低下する可能性があります。人間の評価者と自動スコアリングシステムを組み合わせることが、ハイステークスのスピーチ評価のスコアリングの最良の方法である可能性があります。

著者:キーラン・エヴァニーニ、スピーチ研究ディレクター、ETS、クラウス・ツェヒナー、スピーチのシニアリサーチサイエンティスト、ETS

ETSは、教育機関、企業、政府と協力して、研究を実施し、評価プログラムを開発しています。これらのプログラムは、人やプログラムを評価するための有意義な情報を提供します。ETSは、年間5,000万件以上のテストを180以上の国で9,000以上の場所で開発、管理、スコアリングしています。業界をリードする洞察、厳格な研究、品質への妥協のない取り組みをもとに、評価を設計しています。教育と職場のコミュニティが情報に基づいた決定を下すのを支援するために、ETSを参照してください。

研究開発部門でのスピーチ研究ディレクター at Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).