AI-mallit ja alustat

Puheen Arvostelun Tulevaisuus – Ajattelijat

mm mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Ympäri maailmaa, englannin kielen opiskelijoiden määrä jatkaa kasvamistaan. Koulutuslaitokset ja työnantajat tarvitsevat kykyä arvioida englannin kielen taito – erityisesti puhumisen taito, sillä puhuttu kieli on edelleen yksi tärkeimmistä kielitaidoista. Haaste, sekä arvioiden kehittäjille että loppukäyttäjille, on löytää tapa tehdä tämä tarkasti, nopeasti ja taloudellisesti kannattavasti. Tämän haasteen osana, näiden arvioiden arvostelu tuo omat tekijänsä, erityisesti kun otetaan huomioon eri alueet (puhe, kirjoittaminen jne.), joista yksilöä testataan. Englannin kielen taitojen kysynnän odotetaan lisäävän maailmanlaajuisesti, miltä pitäisi näyttää puheen arvostelun tulevaisuus voidakseen täyttää nämä tarpeet?

Tähän kysymykseen osittainen vastaus löytyy puheen arvostelun kehityksestä tähän asti. Rakennettujen puhuttujen vastausten arvostelu on perinteisesti tehty käyttäen ihmisten arvostajia. Tämä prosessi on kuitenkin usein kallis ja hidasta, ja siinä on muitakin haasteita, kuten skaalautuvuus ja ihmisten arvostajien omat puutteet (esim. arvostajan subjektiivisuus tai puolueellisuus). Kuten kirjassamme Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech on käyty läpi, haasteiden ratkaisemiseksi yhä useammat arviot käyttävät nyt automaattista puheen arvosteluteknologiaa ainoana arvostelulähteenä tai yhdessä ihmisten arvostajien kanssa. Ennen automaattisten arvostelujärjestelmien käyttöönottoa niiden suorituskykyä on kuitenkin arvioitava perusteellisesti, erityisesti suhteessa arvostelun luotettavuuteen, validiteettiin (mitä järjestelmä mitata?) ja reiluuteen (järjestelmän ei pitäisi sisältää puolueellisuutta tietyille väestöryhmille, kuten sukupuolelle tai äidinkielelle).

Vuodesta 2006 lähtien ETS:n oma puheen arvostelujärjestelmä, SpeechRater®, on ollut käytössä TOEFL® Practice Online (TPO) -arvioinnissa (jota käytetään TOEFL iBT® -arvioinnin valmistautumiseen), ja vuodesta 2019 lähtien SpeechRateria on käytetty myös yhdessä ihmisten arvostajien kanssa TOEFL iBT® -arvioinnin puhumisosan arvostelussa. Järjestelmä arvioi laajaa valikoimaa puhumisen taitoja spontaanille ei-äidinkieliselle puheelle, mukaan lukien ääntäminen ja sujuvuus, sanaston kirjo ja kielioppi, sekä korkeamman tason puhumisen taidot, jotka liittyvät ajatusten yhtenäisyyteen ja etenemiseen. Nämä ominaisuudet lasketaan käyttäen luonnollisen kielen prosessointia (NLP) ja puheen prosessointialgoritmeja. Tilastollinen malli sovelletaan sitten näihin ominaisuuksiin jokaisen testihenkilön vastauksen lopullisen arvostelun määrittämiseksi.

Vaikka tämä malli on koulutettu aikaisemmin havaittuun dataan, joka on arvioitu ihmisten arvostajien toimesta, sitä tarkistetaan myös sisällön asiantuntijoiden toimesta sen validiteetin maksimoimiseksi. Jos vastaus on epäarvosteltavissa äänenlaadun tai muiden ongelmien vuoksi, järjestelmä voi merkitä sen tarkastelua varten, jotta voidaan välttää mahdollisesti epäluotettavan tai virheellisen arvostelun generointi. Ihmisten arvostajat osallistuvat aina puhuttujen vastausten arvosteluun TOEFL iBT -arvioinnissa.

Koska ihmisten arvostajat ja SpeechRater käytetään tällä hetkellä yhdessä testien arvostelussa, molemmat osallistuvat siihen, miltä tulevaisuus voi näyttää, kun on kyse englannin kielen taidon arvostelusta. Ihmisten arvostajat kykenevät ymmärtämään puhutun vastauksen sisällön ja diskurssin järjestelmän syvällisesti. Toisaalta automaattiset puheen arvostelujärjestelmät voivat mitata tarkemmin tiettyjä yksityiskohtia puheesta, kuten sujuvuutta tai ääntämistä, ja ne voivat osoittaa täydellistä johdonmukaisuutta ajan saatossa, vähentää koko arvosteluaikaa ja -kustannuksia, ja ne ovat helpommin skaalautuvia suurten testimäärien tukemiseksi. Kun ihmisten arvostajat ja automaattiset puheen arvostelujärjestelmät yhdistetään, tuloksena oleva järjestelmä voi hyötyä kummankin arvostelumenetelmän vahvuuksista.

Jotta voidaan jatkaa automaattisten puheen arvostelujärjestelmien kehittämistä, tutkimuksessa ja kehityksessä on keskityttävä seuraaviin seikkoihin muun muassa:

  • Rakentamalla automaattisia puheentunnistusjärjestelmiä, joilla on korkeampi tarkkuus: Koska useimmat puheen arvostelujärjestelmän ominaisuudet riippuvat suoraan tai epäsuoraan järjestelmän osasta, joka muuttaa testihenkilön puheen tekstimuotoon, erittäin tarkka automaattinen puheentunnistus on välttämätöntä saadakseen validit ominaisuudet;
  • Uusien tapojen tutkiminen yhdistää ihmisten ja automaattisten arvostelujen: Jotta voidaan hyödyntää täysimääräisesti ihmisten arvostajien ja automaattisten järjestelmien arvostelun vahvuuksia, on tutkittava enemmän tapoja yhdistää nämä todisteet;
  • Vastauksissa olevien poikkeavuuksien huomioon ottaminen, sekä tekniset että käyttäytymiseen liittyvät: Korkean suorituskyvyn suodattimet, jotka voivat merkitä tällaiset vastaukset ja poistaa ne automaattisesta arvostelusta, ovat tarpeen varmistamaan arvostelun validiteetti ja luotettavuus;
  • Spontaani tai keskustelumaisen puheen arvosteleminen, jota tavataan useimmiten päivittäisessä elämässä: Vaikka automaattinen arvostelu tällaisesta vuorovaikutteisesta puheesta on tärkeä tavoite, nämä kohdat esittävät useita arvosteluhaikeita, mukaan lukien koko arvostelun ja arvostelun;
  • Syväoppimisen teknologioiden tutkiminen automaattiseen puheen arvosteluun: Tämä suhteellisen uusi koneoppimisen paradigma on tuottanut merkittäviä suorituskyvyn parannuksia monilla tekoälytehtävillä viime vuosina (esim. automaattinen puheentunnistus, kuvantunnistus), ja siten on todennäköistä, että automaattinen arvostelu hyötyy myös tämän teknologian käytöstä. Kuitenkin, koska useimmat näistä järjestelmistä voidaan pitää ”mustana laatikkomaisina lähestymistapoina”, on tärkeää kiinnittää huomiota tuloksesta saatavan arvostelun tulkitettavuuteen jatkuvan avoimuuden ylläpitämiseksi.

Jotta voidaan mukautua kasvavaan ja muuttuvaan englannin kielen opiskelijaryhmään, seuraavan sukupolven puheen arvostelujärjestelmissä on laajennettava automaatiota ja mitattavien asioiden kirjoa, mahdollistaen johdonmukaisuutta ja skaalautuvuutta. Tämä ei kuitenkaan tarkoita, että ihmisen osuus poistettaisiin, erityisesti korkean panoksen arvioinneissa. Ihmisten arvostajat ovat todennäköisesti edelleen olennaisia tietyissä puheen osissa, jotka ovat haasteellisia arvioida tarkasti automaattisilla arvostelujärjestelmillä, mukaan lukien puhutun sisällön ja diskurssin yksityiskohdat. Automaattisten puheen arvostelujärjestelmien käyttäminen erillään merkittävissä arvioinneissa sisältää myös riskin, ettei havaita ongelmallisia vastauksia testihenkilöiltä – esimerkiksi vastauksia, jotka poikkeavat aiheesta tai ovat kopioitu, ja johtavat siten vähemmän validiin ja luotettavaan arvosteluun. Automaattisten puheen arvostelujärjestelmien ja ihmisten arvostajien yhdistäminen saattaa olla paras tapa arvioida puhetta korkean panoksen arvioinneissa, erityisesti jos spontaania tai keskustelumaisia puheita arvioidaan.

Kirjoittanut: Keelan Evanini, Puheen tutkimuksen johtaja, ETS & Klaus Zechner, Vanhempi tutkija, Puhe, ETS

ETS työskentelee koulutuslaitosten, yritysten ja hallitusten kanssa tutkimuksen ja arviointiohjelmien kehittämiseksi, jotka tarjoavat merkityksellistä tietoa, jota voidaan luottaa arvioimaan ihmisiä ja ohjelmia. ETS kehittää, hallinnoi ja arvioi yli 50 miljoonaa testiä vuodessa yli 180 maassa yli 9 000 paikassa maailmanlaajuisesti. Suunnittelemme arviointejamme teollisuuden johtavalla näkemyksellä, tiukalla tutkimuksella ja ehdottomalla sitoutumisella laatuun, jotta voimme auttaa koulutus- ja työpaikkayhteisöjä tekemään perusteltuja päätöksiä. Lisätietoja saat ETS:n sivuilta.

Puheentutkimuksen johtaja tutkimus- ja kehitysosastolla Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).