Modèles et plateformes d’IA

L’avenir de la notation de la parole – Leaders de pensée

mm mm
Ajouter Unite.AI à vos sources préférées sur Google

À travers le monde, le nombre d’apprenants de la langue anglaise continue d’augmenter. Les établissements d’enseignement et les employeurs doivent être en mesure d’évaluer la maîtrise de l’anglais des apprenants de la langue – en particulier, leur capacité à s’exprimer, puisque la langue parlée reste l’une des compétences linguistiques les plus essentielles. Le défi, pour les concepteurs d’évaluations et les utilisateurs finals, est de trouver un moyen de le faire de manière précise, rapide et financièrement viable. Dans ce défi, la notation de ces évaluations comporte ses propres facteurs, en particulier lorsqu’on considère les différentes compétences (parole, écriture, etc.) qui sont testées. Étant donné que la demande de compétences en anglais à l’échelle mondiale ne devrait que croître, à quoi ressemblera l’avenir de la notation de la parole pour répondre à ces besoins ?

La réponse à cette question se trouve en partie dans l’évolution de la notation de la parole à ce jour. La notation des réponses parlées construites a historiquement été effectuée à l’aide de notateurs humains. Ce processus, cependant, tend à être coûteux et lent, et comporte des défis supplémentaires, notamment la scalabilité et les limites des notateurs humains eux-mêmes (par exemple, la subjectivité ou les préjugés des notateurs). Comme nous le discutons dans notre livre Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech, afin de relever ces défis, un nombre croissant d’évaluations utilisent désormais la technologie de notation de la parole automatisée comme seule source de notation ou en combinaison avec des notateurs humains. Cependant, avant de déployer des moteurs de notation automatisés, leur performance doit être soigneusement évaluée, en particulier en ce qui concerne la fiabilité des scores, la validité (le système mesure-t-il ce qu’il est censé mesurer ?) et l’équité (le système ne doit pas introduire de biais liés à des sous-groupes de population tels que le sexe ou la langue maternelle).

Depuis 2006, le moteur de notation de la parole d’ETS, SpeechRater®, a été opérationnalisé dans l’évaluation TOEFL® Practice Online (TPO) (utilisée par les futurs candidats pour se préparer à l’évaluation TOEFL iBT®), et depuis 2019, SpeechRater a également été utilisé, aux côtés de notateurs humains, pour noter la section de parole de l’évaluation TOEFL iBT®. Le moteur évalue un large éventail de compétences en parole pour des discours spontanés non natifs, y compris la prononciation et la fluidité, la gamme de vocabulaire et la grammaire, ainsi que des compétences en parole de niveau supérieur liées à la cohérence et à la progression des idées. Ces fonctionnalités sont calculées à l’aide d’algorithmes de traitement du langage naturel (NLP) et de traitement de la parole. Un modèle statistique est ensuite appliqué à ces fonctionnalités pour attribuer une note finale à la réponse d’un candidat.

Bien que ce modèle soit formé à partir de données précédemment observées notées par des notateurs humains, il est également examiné par des experts en contenu pour maximiser sa validité. Si une réponse est considérée comme non notifiable en raison de la qualité audio ou d’autres problèmes, le moteur peut la signaler pour un examen plus approfondi afin d’éviter de générer une note potentiellement non fiable ou non valide. Les notateurs humains sont toujours impliqués dans la notation des réponses parlées dans l’évaluation de parole à haut risque TOEFL iBT.

Étant donné que les notateurs humains et SpeechRater sont actuellement utilisés ensemble pour noter les réponses des candidats dans les évaluations de parole à haut risque, les deux jouent un rôle dans ce que peut être l’avenir de la notation de la compétence en anglais. Les notateurs humains ont la capacité de comprendre le contenu et l’organisation du discours d’une réponse parlée de manière approfondie. En revanche, les moteurs de notation de la parole automatisés peuvent mesurer avec plus de précision certains aspects détaillés de la parole, tels que la fluidité ou la prononciation, présentent une constance parfaite dans le temps, peuvent réduire le temps de notation global et le coût, et sont plus facilement mis à l’échelle pour prendre en charge des volumes de test importants. Lorsque les notateurs humains et les systèmes de notation de la parole automatisés sont combinés, le système résultant peut bénéficier des forces de chaque approche de notation.

Afin d’évoluer continuellement les moteurs de notation de la parole automatisés, la recherche et le développement doivent se concentrer sur les aspects suivants, entre autres:

  • Construire des systèmes de reconnaissance automatique de la parole avec une plus grande précision: Puisque la plupart des fonctionnalités d’un système de notation de la parole dépendent directement ou indirectement de ce composant du système qui convertit la parole du candidat en transcription textuelle, une reconnaissance automatique de la parole hautement précise est essentielle pour obtenir des fonctionnalités valides;
  • Explorer de nouvelles façons de combiner les notes humaines et automatisées: Afin de tirer pleinement parti des forces respectives des notes des notateurs humains et des notes des moteurs automatisés, il est nécessaire d’explorer davantage de façons de combiner ces preuves;
  • Prendre en compte les anomalies dans les réponses, à la fois techniques et comportementales: Des filtres de haute performance capables de signaler ces réponses et de les exclure de la notation automatisée sont nécessaires pour aider à garantir la validité et la fiabilité des notes d’évaluation résultantes;
  • Évaluation de la parole spontanée ou conversationnelle qui se produit le plus souvent dans la vie quotidienne: Bien que la notation automatisée de tels discours interactifs soit un objectif important, ces éléments présentent de nombreux défis de notation, notamment l’évaluation globale et la notation;
  • Explorer les technologies d’apprentissage profond pour la notation de la parole automatisée: Ce paradigme relativement récent dans l’apprentissage automatique a produit des augmentations de performance substantielles sur de nombreuses tâches d’intelligence artificielle (IA) ces dernières années (par exemple, reconnaissance automatique de la parole, reconnaissance d’images), et il est probable que la notation automatisée puisse également bénéficier de l’utilisation de cette technologie. Cependant, puisque la plupart de ces systèmes peuvent être considérés comme des approches « boîte noire », il est important de prêter attention à l’interprétabilité de la note résultante pour maintenir un certain niveau de transparence.

Afin d’accueillir une population d’apprenants de la langue anglaise en constante évolution, les systèmes de notation de la parole de nouvelle génération doivent élargir l’automatisation et la gamme de ce qu’ils sont en mesure de mesurer, permettant ainsi la constance et la scalabilité. Cela ne signifie pas que l’élément humain sera supprimé, en particulier pour les évaluations à haut risque. Les notateurs humains seront probablement toujours essentiels pour capturer certains aspects de la parole qui seront difficiles à évaluer avec précision par les systèmes de notation automatisés pendant un certain temps, notamment les aspects détaillés du contenu parlé et du discours. L’utilisation de systèmes de notation de la parole automatisés en isolation pour les évaluations à conséquences importantes comporte également le risque de ne pas identifier les réponses problématiques des candidats – par exemple, les réponses qui sont hors sujet ou plagiées, et, par conséquent, peuvent entraîner une validité et une fiabilité réduites. L’utilisation à la fois de notateurs humains et de systèmes de notation automatisés en combinaison peut être la meilleure façon de noter la parole dans les évaluations à haut risque pour un avenir prévisible, en particulier si la parole spontanée ou conversationnelle est évaluée.

Écrit par: Keelan Evanini, Directeur de la recherche sur la parole, ETS & Klaus Zechner, Scientifique principal de recherche, Parole, ETS

ETS travaille avec des établissements d’enseignement, des entreprises et des gouvernements pour mener des recherches et développer des programmes d’évaluation qui fournissent des informations significatives qu’ils peuvent compter pour évaluer les personnes et les programmes. ETS conçoit, administre et note plus de 50 millions de tests par an dans plus de 180 pays et plus de 9 000 emplacements dans le monde. Nous concevons nos évaluations avec une perspicacité de pointe de l’industrie, des recherches rigoureuses et un engagement inconditionnel en faveur de la qualité afin de pouvoir aider les communautés éducatives et professionnelles à prendre des décisions éclairées. Pour en savoir plus, visitez ETS.

Directeur de la recherche sur le discours dans la recherche et le développement chez Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).