KI-Modelle und Plattformen

Die Zukunft der Sprachbewertung – Thought Leaders

mm mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Weltweit steigt die Zahl der Englischlerner stetig. Bildungseinrichtungen und Arbeitgeber müssen in der Lage sein, die Englischkenntnisse von Lernenden – insbesondere ihre Sprechfähigkeit – zu beurteilen, da die gesprochene Sprache zu den wichtigsten Sprachfähigkeiten gehört. Die Herausforderung für Entwickler von Bewertungen und Endnutzer besteht darin, eine Möglichkeit zu finden, dies genau, schnell und finanziell tragbar zu tun. Als Teil dieser Herausforderung birgt die Bewertung dieser Prüfungen ihre eigenen Faktoren, insbesondere wenn man die verschiedenen Bereiche (Sprechen, Schreiben usw.) berücksichtigt, die getestet werden. Da die Nachfrage nach Englischkenntnissen weltweit nur zu steigen erwartet wird, wie muss die Zukunft der Sprachbewertung aussehen, um diese Bedürfnisse zu erfüllen?

Die Antwort auf diese Frage liegt teilweise in der Evolution der Sprachbewertung bis heute. Die Bewertung konstruierter mündlicher Antworten wurde historisch von menschlichen Bewertern durchgeführt. Dieser Prozess ist jedoch teuer und langwierig und hat zusätzliche Herausforderungen, einschließlich Skalierbarkeit und verschiedenen Mängeln menschlicher Bewerter (z. B. Subjektivität oder Voreingenommenheit). Wie in unserem Buch Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech diskutiert, um diese Herausforderungen zu bewältigen, nutzen immer mehr Prüfungen automatisierte Sprachbewertungstechnologie als alleinige Bewertungsquelle oder in Kombination mit menschlichen Bewertern. Bevor jedoch automatisierte Bewertungssysteme eingesetzt werden, muss ihre Leistung gründlich bewertet werden, insbesondere in Bezug auf die Zuverlässigkeit, Gültigkeit (misst das System, was es messen soll?) und Fairness (d. h. das System sollte keine Voreingenommenheit in Bezug auf Bevölkerungsuntergruppen wie Geschlecht oder Muttersprache einführen).

Seit 2006 ist der eigene Sprachbewertungsmotor von ETS, SpeechRater®, im TOEFL® Practice Online (TPO)-Test (der von potenziellen Testteilnehmern verwendet wird, um sich auf den TOEFL iBT®-Test vorzubereiten) operationalisiert, und seit 2019 wird SpeechRater auch für die Bewertung des Sprechteils des TOEFL iBT®-Tests verwendet, zusammen mit menschlichen Bewertern. Der Motor bewertet ein breites Spektrum an Sprechfähigkeiten für spontane nicht-muttersprachliche Sprache, einschließlich Aussprache und Flüssigkeit, Wortschatz und Grammatik sowie höhere Sprechfähigkeiten im Zusammenhang mit Kohärenz und Ideenfortschritt. Diese Merkmale werden durch die Verwendung von Natural Language Processing (NLP) und Sprachverarbeitungsalgorithmen berechnet. Anschließend wird ein statistisches Modell auf diese Merkmale angewendet, um dem Antwort eines Testteilnehmers eine endgültige Bewertung zuzuweisen.

Obwohl dieses Modell auf zuvor beobachteten Daten trainiert wird, die von menschlichen Bewertern bewertet wurden, wird es auch von Inhaltsexperten überprüft, um seine Gültigkeit zu maximieren. Wenn eine Antwort aufgrund von Audioqualitätsproblemen oder anderen Problemen nicht bewertbar ist, kann der Motor sie für eine weitere Überprüfung kennzeichnen, um die Generierung einer potenziell unzuverlässigen oder ungültigen Bewertung zu vermeiden. Menschliche Bewerter sind immer an der Bewertung mündlicher Antworten im hochrangigen TOEFL iBT-Sprechtest beteiligt.

Da menschliche Bewerter und SpeechRater derzeit zusammen verwendet werden, um die Antworten von Testteilnehmern in hochrangigen Sprechtests zu bewerten, spielen beide eine Rolle bei der Zukunft der Bewertung der Englischsprachkenntnisse. Menschliche Bewerter können den Inhalt und die Diskursorganisation einer mündlichen Antwort auf tiefere Weise verstehen. Im Gegensatz dazu können automatisierte Sprachbewertungsmotoren bestimmte detaillierte Aspekte der Sprache, wie Flüssigkeit oder Aussprache, präziser messen, zeigen eine perfekte Konsistenz über die Zeit, können die Gesamtbewertungszeit und -kosten reduzieren und sind leichter skalierbar, um große Testvolumina zu unterstützen. Wenn menschliche Bewerter und automatisierte Sprachbewertungssysteme kombiniert werden, kann das resultierende System von den Stärken jedes Bewertungsansatzes profitieren.

Um automatisierte Sprachbewertungsmotoren kontinuierlich weiterzuentwickeln, muss die Forschung und Entwicklung auf die folgenden Aspekte konzentriert werden:

  • Automatische Spracherkennungssysteme mit höherer Genauigkeit aufbauen: Da die meisten Merkmale eines Sprachbewertungssystems direkt oder indirekt auf diesem Systemkomponenten basieren, der die Sprache des Testteilnehmers in eine Texttranskription umwandelt, ist eine hochgenaue automatische Spracherkennung für die Erlangung gültiger Merkmale unerlässlich;
  • Neue Wege zur Kombination von menschlichen und automatisierten Bewertungen erforschen: Um die jeweiligen Stärken von menschlichen Bewertungen und automatisierten Motorbewertungen voll auszunutzen, müssen mehr Wege zur Kombination dieser Beweise erforscht werden;
  • Abnormalitäten in Antworten, sowohl technischer als auch verhaltensbedingter Art, berücksichtigen: Hochleistungsfähige Filter, die solche Antworten erkennen und von der automatischen Bewertung ausschließen können, sind notwendig, um die Gültigkeit und Zuverlässigkeit der resultierenden Testbewertungen sicherzustellen;
  • Bewertung spontaner oder konversationeller Sprache, die am häufigsten im Alltagsleben vorkommt: Obwohl die automatisierte Bewertung solcher interaktiven Sprache ein wichtiges Ziel ist, stellen diese Elemente zahlreiche Bewertungsherausforderungen dar, einschließlich der Gesamtbewertung und Bewertung;
  • Tiefes Lernen für automatisierte Sprachbewertung erforschen: Dieses relativ neue Paradigma im maschinellen Lernen hat in den letzten Jahren erhebliche Leistungssteigerungen bei vielen künstlichen Intelligenzaufgaben (z. B. automatische Spracherkennung, Bilderkennung) erzielt und es ist wahrscheinlich, dass die automatisierte Bewertung auch von dieser Technologie profitieren kann. Es ist jedoch wichtig, die Interpretierbarkeit des resultierenden Bewertungsergebnisses zu beachten, um einen gewissen Grad an Transparenz zu wahren.

Um einer wachsenden und sich ändernden Englischlerner-Bevölkerung gerecht zu werden, müssen next-generation-Sprachbewertungssysteme die Automatisierung und den Umfang dessen, was sie messen können, erweitern, um Konsistenz und Skalierbarkeit zu ermöglichen. Das bedeutet jedoch nicht, dass das menschliche Element entfernt wird, insbesondere bei hochrangigen Bewertungen. Menschliche Bewerter werden wahrscheinlich weiterhin unerlässlich sein, um bestimmte Aspekte der Sprache zu erfassen, die für automatisierte Bewertungssysteme schwer zu bewerten sind, einschließlich der detaillierten Aspekte des gesprochenen Inhalts und der Diskursorganisation. Die Verwendung automatisierter Sprachbewertungssysteme in Isolation für folgenschwere Bewertungen birgt auch das Risiko, problematische Antworten von Testteilnehmern nicht zu erkennen – beispielsweise Antworten, die nicht zum Thema gehören oder plagiiert sind – und kann zu einer verringerten Gültigkeit und Zuverlässigkeit führen. Die Kombination von menschlichen Bewertern und automatisierten Bewertungssystemen kann der beste Weg für die Bewertung von Sprache in hochrangigen Bewertungen für die absehbare Zukunft sein, insbesondere wenn spontane oder konversationelle Sprache bewertet wird.

Geschrieben von: Keelan Evanini, Direktor der Sprachforschung, ETS & Klaus Zechner, leitender Senior-Forschungswissenschaftler, Sprache, ETS

ETS arbeitet mit Bildungseinrichtungen, Unternehmen und Regierungen zusammen, um Forschung durchzuführen und Bewertungsprogramme zu entwickeln, die wertvolle Informationen liefern, auf die sie zählen können, um Menschen und Programme zu bewerten. ETS entwickelt, administriert und bewertet mehr als 50 Millionen Tests jährlich in über 180 Ländern an mehr als 9.000 Standorten weltweit. Wir entwerfen unsere Bewertungen mit branchenführender Einsicht, strenger Forschung und einem unerschütterlichen Engagement für Qualität, damit wir Bildungs- und Arbeitsplatzgemeinschaften helfen können, fundierte Entscheidungen zu treffen. Um mehr zu erfahren, besuchen Sie ETS.

Leiter der Sprachforschung in Forschung und Entwicklung bei Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).