Modele i platformy AI
Przyszłość oceniania mowy – Liderzy myśli
Na całym świecie liczba osób uczących się języka angielskiego nieustannie rośnie. Instytucje edukacyjne i pracodawcy muszą być w stanie ocenić biegłość językową osób uczących się języka angielskiego, a w szczególności ich umiejętności mówienia, ponieważ mowa pozostaje jedną z najważniejszych umiejętności językowych. Wyzwaniem, zarówno dla twórców testów, jak i użytkowników końcowych, jest znalezienie sposobu na to, aby to zrobić w sposób dokładny, szybki i finansowo uzasadniony. W ramach tego wyzwania, ocenianie tych testów wiąże się z własnym zestawem czynników, zwłaszcza gdy uwzględniamy różne obszary (mowa, pisanie itp.), na których jesteśmy testowani. Zważywszy, że popyt na umiejętności językowe na całym świecie będzie tylko rosło, jak powinna wyglądać przyszłość oceniania mowy, aby spełnić te potrzeby?
Odpowiedź na to pytanie, w części, tkwi w ewolucji oceniania mowy do tej pory. Ocena konstruowanych odpowiedzi ustnych historycznie była wykonywana przez ludzkich oceniających. Proces ten jednak ma tendencję do bycia drogim i wolnym, oraz posiada dodatkowe wyzwania, w tym skalowalność i różne wady samych oceniających (np. subiektywizm lub uprzedzenia oceniających). Jak omawiamy w naszej książce Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech, aby rozwiązać te wyzwania, coraz więcej testów wykorzystuje technologię automatycznego oceniania mowy jako jedyne źródło oceniania lub w połączeniu z ludzkimi oceniającymi. Przed wdrożeniem silników automatycznego oceniania, ich działanie musi zostać gruntownie ocenione, w szczególności w odniesieniu do niezawodności wyników, ważności (czy system mierzy to, co ma mierzyć?) oraz uczciwości (tj. system nie powinien wprowadzać uprzedzeń związanych z podgrupami populacji, takimi jak płeć lub język ojczysty).
Od 2006 roku, własny silnik oceniania mowy ETS, SpeechRater®, został uruchomiony w teście TOEFL® Practice Online (TPO) (wykorzystywanym przez przyszłych kandydatów do przygotowania się do testu TOEFL iBT®), a od 2019 roku SpeechRater jest również wykorzystywany, wraz z ludzkimi oceniającymi, do oceniania części mówienia testu TOEFL iBT®. Silnik ocenia szeroki zakres umiejętności mówienia dla spontanicznej mowy nie-native, w tym wymowę i płynność, zakres słownictwa i gramatykę, oraz wyższe umiejętności mówienia związane z spójnością i przejściem między pomysłami. Te funkcje są obliczane przy użyciu naturalnego przetwarzania języka (NLP) i algorytmów przetwarzania mowy. Następnie stosowany jest model statystyczny do tych funkcji w celu przypisania końcowej oceny odpowiedzi testowego.
Pomimo że ten model jest szkolony na wcześniej obserwowanych danych ocenianych przez ludzkich oceniających, jest on również przeglądany przez ekspertów treści, aby maksymalizować jego ważność. Jeśli odpowiedź jest uznana za nieocenialną z powodu jakości audio lub innych problemów, silnik może oznaczyć ją do dalszej oceny, aby uniknąć generowania potencjalnie niepewnej lub nieważnej oceny. Ludzcy oceniający są zawsze zaangażowani w ocenianie odpowiedzi ustnych w teście TOEFL iBT o wysokim ryzyku.
Ponieważ ludzcy oceniający i SpeechRater są obecnie wykorzystywani razem do oceniania odpowiedzi testowych w teście o wysokim ryzyku, oba odgrywają rolę w tym, jaka może być przyszłość oceniania umiejętności językowych. Ludzcy oceniający mają możliwość zrozumienia treści i organizacji dyskursu odpowiedzi ustnej w głęboki sposób. W przeciwieństwie do tego, automatyczne silniki oceniania mowy mogą dokładniej mierzyć pewne szczegółowe aspekty mowy, takie jak płynność lub wymowa, wykazują idealną spójność w czasie, mogą zmniejszyć ogólny czas i koszt oceniania, oraz są łatwiejsze do skalowania, aby wspierać duże ilości testów. Kiedy ludzcy oceniający i automatyczne systemy oceniania mowy są łączone, wynikowy system może korzystać z zalet każdego podejścia do oceniania.
Aby ciągle ewoluować automatyczne silniki oceniania mowy, badania i rozwój muszą koncentrować się na następujących aspektach, między innymi:
- Budowanie systemów automatycznego rozpoznawania mowy o wyższej dokładności: Ponieważ większość funkcji systemu oceniania mowy zależy bezpośrednio lub pośrednio od tego komponentu systemu, który konwertuje mowę testowego na transkrypcję tekstu, bardzo dokładne automatyczne rozpoznawanie mowy jest niezbędne do uzyskania ważnych funkcji;
- Badanie nowych sposobów łączenia ocen ludzkich i automatycznych: Aby w pełni wykorzystać wzajemne zalety ocen ludzkich i automatycznych, muszą być zbadane więcej sposobów łączenia tych dowodów;
- Uwzględnianie anomalii w odpowiedziach, zarówno technicznych, jak i behawioralnych: Wysoko wydajne filtry, które mogą oznaczyć takie odpowiedzi i wykluczyć je z automatycznego oceniania, są niezbędne, aby zapewnić ważność i niezawodność wyników testów;
- Ocenianie spontanicznej lub konwersacyjnej mowy, która występuje najczęściej w życiu codziennym: Chociaż automatyczne ocenianie takiej interaktywnej mowy jest ważnym celem, te elementy przedstawiają wiele wyzwań oceniania, w tym ogólną ocenę i punktację;
- Badanie głębokich technologii uczenia maszynowego do automatycznego oceniania mowy: Ten stosunkowo nowy paradygmat w uczeniu maszynowym wyprodukował znaczne wzrosty wydajności w wielu zadaniach sztucznej inteligencji w ostatnich latach (np. automatyczne rozpoznawanie mowy, rozpoznawanie obrazów), i dlatego też prawdopodobne jest, że automatyczne ocenianie również może skorzystać z wykorzystania tej technologii. Jednakże, ponieważ większość tych systemów może być uważana za „czarne skrzynki”, uwaga powinna być zwrócona na interpretowalność wynikającej oceny, aby utrzymać pewien poziom przejrzystości.
Aby dostosować się do rosnącej i zmieniającej się populacji uczących się języka angielskiego, systemy oceniania mowy następnej generacji muszą rozszerzyć automatyzację i zakres tego, co są w stanie mierzyć, umożliwiając spójność i skalowalność. Nie oznacza to, że element ludzki zostanie usunięty, zwłaszcza w przypadku testów o wysokim ryzyku. Ludzcy oceniający będą prawdopodobnie nadal niezbędni do przechwytywania pewnych aspektów mowy, które będą trudne do oceniania dokładnie przez systemy automatycznego oceniania przez dłuższy czas, w tym szczegółowe aspekty treści mówionej i dyskursu. Używanie automatycznych systemów oceniania mowy w izolacji do oceniania konsekwencji również niesie ze sobą ryzyko nieidentyfikowania problematycznych odpowiedzi testowych – na przykład odpowiedzi, które są poza tematem lub plagiatem, i w konsekwencji mogą prowadzić do zmniejszenia ważności i niezawodności. Używanie zarówno ludzkich oceniających, jak i automatycznych systemów oceniania w połączeniu może być najlepszym sposobem na ocenianie mowy w testach o wysokim ryzyku przez przewidywalną przyszłość, zwłaszcza jeśli oceniana jest spontaniczna lub konwersacyjna mowa.
Napisane przez: Keelan Evanini, Dyrektor ds. badań mowy, ETS & Klaus Zechner, Starszy naukowiec ds. badań, mowa, ETS
ETS współpracuje z instytucjami edukacyjnymi, firmami i rządami, aby prowadzić badania i rozwijać programy oceniania, które dostarczają istotne informacje, na które można się powołać, aby ocenić ludzi i programy. ETS rozwija, administruje i ocenia ponad 50 milionów testów rocznie w ponad 180 krajach, w ponad 9 000 lokalizacjach na całym świecie. Nasze testy są zaprojektowane z wglądu w branżę, rygorystycznych badań i niekompromisowego zaangażowania w jakość, abyśmy mogli pomóc społecznościom edukacyjnym i zawodowym w podejmowaniu świadomych decyzji. Aby dowiedzieć się więcej, odwiedź ETS.













