AI-modellen en platforms

De Toekomst van Spraakbeoordeling – Thought Leaders

mm mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Over de hele wereld neemt het aantal Engelstalige leerlingen toe. Onderwijsinstellingen en werkgevers moeten in staat zijn om de Engelse vaardigheid van taalleerlingen te beoordelen – in het bijzonder hun spreekvaardigheid, aangezien gesproken taal nog steeds een van de meest essentiële taalvaardigheden is. De uitdaging, zowel voor ontwikkelaars van beoordelingsinstrumenten als voor eindgebruikers, is om een manier te vinden om dit te doen die nauwkeurig, snel en financieel haalbaar is. Als onderdeel van deze uitdaging komen er bij het beoordelen van deze beoordelingen hun eigen set factoren kijken, vooral wanneer we de verschillende gebieden (spraak, schrijven, enz.) overwegen waarop iemand wordt getest. Aangezien de vraag naar Engelstalige vaardigheden over de hele wereld alleen maar toeneemt, wat zou de toekomst van spraakbeoordeling moeten zijn om aan deze behoeften te voldoen?

Het antwoord op die vraag wordt deels gevonden in de evolutie van spraakbeoordeling tot nu toe. Het beoordelen van geconstrueerde gesproken antwoorden is historisch gezien gedaan met behulp van menselijke beoordelaars. Dit proces is echter vaak duur en langzaam en heeft extra uitdagingen, waaronder schaalbaarheid en verschillende tekortkomingen van menselijke beoordelaars zelf (bijv. subjectiviteit of vooroordelen van de beoordelaar). Zoals besproken in ons boek Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech, om deze uitdagingen aan te pakken, maken steeds meer beoordelingen gebruik van geautomatiseerde spraakbeoordelingstechnologie als enige beoordelingsbron of in combinatie met menselijke beoordelaars. Voordat geautomatiseerde beoordelingsmotoren worden ingezet, moet hun prestatie echter grondig worden geëvalueerd, met name in relatie tot de betrouwbaarheid, validiteit (meet het systeem wat het zou moeten meten?) en eerlijkheid (d.w.z. het systeem mag geen vooroordelen introduceren met betrekking tot bevolkingssubgroepen zoals geslacht of moedertaal).

Sinds 2006 is de spraakbeoordelingsmotor van ETS, SpeechRater®, operationeel in de TOEFL® Practice Online (TPO)-beoordeling (gebruikt door potentiële testkandidaten om zich voor te bereiden op de TOEFL iBT®-beoordeling), en sinds 2019 wordt SpeechRater ook gebruikt, samen met menselijke beoordelaars, voor het beoordelen van het spreekgedeelte van de TOEFL iBT®-beoordeling. De motor beoordeelt een breed scala aan spreekvaardigheden voor spontane niet-moedertaalsprekers, waaronder uitspraak en vloeiendheid, woordenschat en grammatica, en hogere spreekvaardigheden met betrekking tot coherentie en ideeënvolutie. Deze functies worden berekend met behulp van natuurlijke taalverwerking (NLP) en spraakverwerking algoritmen. Vervolgens wordt een statistisch model toegepast op deze functies om een eindcijfer toe te kennen aan het antwoord van een testkandidaat.

Hoewel dit model is getraind op eerder waargenomen gegevens die zijn beoordeeld door menselijke beoordelaars, wordt het ook beoordeeld door inhoudsexperts om de validiteit te maximaliseren. Als een antwoord niet beoordeelbaar is vanwege audiokwaliteit of andere problemen, kan de motor het vlaggen voor verdere beoordeling om te voorkomen dat een mogelijk onbetrouwbaar of ongeldig cijfer wordt gegenereerd. Menselijke beoordelaars zijn altijd betrokken bij de beoordeling van gesproken antwoorden in de TOEFL iBT-sprekingbeoordeling met hoge inzet.

Terwijl menselijke beoordelaars en SpeechRater momenteel samen worden gebruikt om de antwoorden van testkandidaten te beoordelen in beoordelingen met hoge inzet, spelen beiden een rol in wat de toekomst van het beoordelen van de Engelse taalvaardigheid kan zijn. Menselijke beoordelaars hebben de mogelijkheid om de inhoud en discoursorganisatie van een gesproken antwoord op diepe wijze te begrijpen. In tegenstelling tot geautomatiseerde spraakbeoordelingsmotoren kunnen deze meer precies bepaalde gedetailleerde aspecten van spraak meten, zoals vloeiendheid of uitspraak, perfecte consistentie over tijd vertonen, de totale beoordelingsduur en -kosten verlagen en gemakkelijker schaalbaar zijn om grote testvolumes te ondersteunen. Wanneer menselijke beoordelaars en geautomatiseerde spraakbeoordelingssystemen worden gecombineerd, kan het resulterende systeem profiteren van de sterke punten van elke beoordelingsmethode.

Om geautomatiseerde spraakbeoordelingsmotoren voortdurend te ontwikkelen, moet onderzoek en ontwikkeling zich richten op de volgende aspecten, onder andere:

  • Het opbouwen van automatische spraakherkenningssystemen met hogere nauwkeurigheid: Aangezien de meeste functies van een spraakbeoordelingssysteem direct of indirect afhankelijk zijn van dit onderdeel van het systeem dat de spraak van de testkandidaat omzet in een teksttranscriptie, is zeer nauwkeurige automatische spraakherkenning essentieel voor het verkrijgen van geldige functies;
  • Verkennen van nieuwe manieren om menselijke en geautomatiseerde scores te combineren: Om volledig te profiteren van de respectieve sterke punten van menselijke beoordelaarscores en geautomatiseerde motorscores, moeten meer manieren van combineren van deze bewijzen worden onderzocht;
  • Rekening houden met afwijkingen in antwoorden, zowel technisch als gedragsmatig: Hoge prestatie filters die dergelijke antwoorden kunnen markeren en uitsluiten van geautomatiseerde beoordeling zijn nodig om de validiteit en betrouwbaarheid van de resulterende beoordelingscores te waarborgen;
  • Beoordeling van spontane of conversatie-spraak die het meest voorkomt in het dagelijks leven: Hoewel het beoordelen van dergelijke interactieve spraak een belangrijk doel is, vormen deze items verschillende beoordelingsuitdagingen, waaronder de algehele evaluatie en beoordeling;
  • Verkennen van diepe leer technologieën voor geautomatiseerde spraakbeoordeling: Deze relatief recente paradigma binnen machine learning heeft in de afgelopen jaren aanzienlijke prestatieverbeteringen opgeleverd voor veel kunstmatige intelligentietaken (bijv. automatische spraakherkenning, beeldherkenning), en het is waarschijnlijk dat geautomatiseerde beoordeling ook kan profiteren van het gebruik van deze technologie. Echter, aangezien de meeste van deze systemen als “black-box”-benaderingen kunnen worden beschouwd, is aandacht voor de interpreteerbaarheid van de resulterende score belangrijk om een zeker niveau van transparantie te behouden.

Om een groeiende en veranderende Engelstalige leerlingpopulatie te accommoderen, moeten next-generation spraakbeoordelingssystemen de automatisering en het bereik van wat ze kunnen meten uitbreiden, waardoor consistentie en schaalbaarheid mogelijk worden. Dit betekent niet dat het menselijke element wordt verwijderd, vooral voor beoordelingen met hoge inzet. Menselijke beoordelaars zullen waarschijnlijk nog steeds essentieel zijn voor het vastleggen van bepaalde aspecten van spraak die moeilijk zijn om door geautomatiseerde beoordelingssystemen nauwkeurig te beoordelen, waaronder de gedetailleerde aspecten van gesproken inhoud en discours. Het gebruik van geautomatiseerde spraakbeoordelingssystemen in isolatie voor gevolgbeoordelingen loopt ook het risico om problematische antwoorden van testkandidaten niet te identificeren – bijvoorbeeld antwoorden die van het onderwerp afwijken of geplagieerd zijn, en als gevolg daarvan kan dit leiden tot verminderde validiteit en betrouwbaarheid. Het gebruik van zowel menselijke beoordelaars als geautomatiseerde beoordelingssystemen in combinatie kan de beste manier zijn om spraak te beoordelen in beoordelingen met hoge inzet voor de voorzienbare toekomst, vooral als spontane of conversatie-spraak wordt geëvalueerd.

Geschreven door: Keelan Evanini, Directeur Speech Research, ETS & Klaus Zechner, Managing Senior Research Scientist, Speech, ETS

ETS werkt samen met onderwijsinstellingen, bedrijven en overheden om onderzoek te doen en beoordelingsprogramma’s te ontwikkelen die betekenisvolle informatie bieden die ze kunnen vertrouwen om mensen en programma’s te evalueren. ETS ontwikkelt, beheert en beoordeelt meer dan 50 miljoen tests per jaar in meer dan 180 landen op meer dan 9.000 locaties wereldwijd. We ontwerpen onze beoordelingen met inzicht van de industrie, grondig onderzoek en een onwankelbare toewijding aan kwaliteit, zodat we onderwijs- en arbeidsmarktgemeenschappen kunnen helpen bij het nemen van geïnformeerde beslissingen. Voor meer informatie, bezoek ETS.

Directeur van spraakonderzoek in Onderzoek en Ontwikkeling bij Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).