โมเดลและแพลตฟอร์ม AI

อนาคตของการประเมินภาษาพูด – ผู้นำความคิด

mm mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ทั่วโลก จำนวนนักเรียนที่เรียนภาษาอังกฤษเพิ่มขึ้นอย่างต่อเนื่อง สถาบันการศึกษาและนายจ้างต้องการประเมินความสามารถภาษาอังกฤษของนักเรียน – โดยเฉพาะความสามารถในการพูด เนื่องจากภาษาพูดยังคงเป็นหนึ่งในทักษะภาษาที่สำคัญที่สุด ความท้าทายสำหรับทั้งผู้พัฒนาและผู้ใช้ประเมินคือการหาวิธีประเมินที่แม่นยำ รวดเร็ว และมีประสิทธิภาพ ในการประเมินนี้ การให้คะแนนมีปัจจัยที่ซับซ้อน โดยเฉพาะอย่างยิ่งเมื่อพิจารณาจากพื้นที่ต่างๆ (ภาษาพูด การเขียน ฯลฯ) ที่กำลังถูกทดสอบ ด้วยความต้องการทักษะภาษาอังกฤษทั่วโลกที่คาดว่าจะเพิ่มขึ้น อนาคตของการประเมินภาษาพูดควรเป็นอย่างไรจึงจะตอบสนองความต้องการเหล่านี้

คำตอบส่วนหนึ่งคือพบในพัฒนาการของการประเมินภาษาพูดจนถึงปัจจุบัน การให้คะแนนคำตอบที่สร้างขึ้นมาจากภาษาพูดมักใช้ผู้ให้คะแนนมนุษย์ กระบวนการนี้มักจะใช้เวลานานและต้องใช้เงินมาก และมีข้อจำกัด เช่น การขยายขนาดและข้อบกพร่องของมนุษย์ (เช่น ความคิดเห็นหรืออคติของผู้ให้คะแนน) ดังที่กล่าวไว้ในหนังสือของเรา Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech เพื่อแก้ไขปัญหานี้ การประเมินจำนวนมากใช้เทคโนโลยีการให้คะแนนภาษาพูดอัตโนมัติเป็นแหล่งให้คะแนนเดียวหรือร่วมกับผู้ให้คะแนนมนุษย์ ก่อนที่จะใช้เครื่องมือให้คะแนนอัตโนมัติ ควรประเมินประสิทธิภาพของเครื่องมือให้คะแนนอย่างละเอียด โดยเฉพาะอย่างยิ่งเกี่ยวกับความน่าเชื่อถือ ความถูกต้อง (เครื่องมือวัดสิ่งที่ควรจะวัดหรือไม่) และความยุติธรรม (เครื่องมือไม่ควรสร้างอคติที่เกี่ยวข้องกับกลุ่มย่อยของประชากร เช่น เพศหรือภาษาแม่)

ตั้งแต่ปี 2006 เครื่องมือให้คะแนนภาษาพูดของ ETS ซึ่งก็คือ SpeechRater ได้ถูกนำมาใช้ใน TOEFL Practice Online (TPO) และตั้งแต่ปี 2019 SpeechRater ยังถูกใช้ร่วมกับผู้ให้คะแนนมนุษย์ในการให้คะแนนส่วนภาษาพูดของ TOEFL iBT เครื่องมือนี้ประเมินความสามารถภาษาพูดที่หลากหลายสำหรับภาษาพูดที่ไม่ใช่ภาษาแม่ รวมถึงการออกเสียงและความคล่องแคล่ว คำศัพท์และไวยากรณ์ และความสามารถภาษาพูดระดับสูงเกี่ยวกับการเชื่อมโยงและการพัฒนาของความคิด คุณสมบัติเหล่านี้ถูกคำนวณโดยใช้การประมวลผลภาษาธรรมชาติ (NLP) และการประมวลผลเสียง โมเดลทางสถิติจะถูกนำมาใช้กับคุณสมบัติเหล่านี้เพื่อกำหนดคะแนนสุดท้ายให้กับการตอบของผู้สอบ

แม้ว่าโมเดลนี้จะถูกฝึกฝนจากข้อมูลที่ผ่านมาที่ให้คะแนนโดยผู้ให้คะแนนมนุษย์ แต่ก็ถูกตรวจสอบโดยผู้เชี่ยวชาญด้านเนื้อหาที่จะเพิ่มความถูกต้อง หากการตอบไม่สามารถให้คะแนนได้เนื่องจากคุณภาพเสียงหรือปัญหาอื่นๆ เครื่องมือสามารถระบุให้ตรวจสอบเพิ่มเติมเพื่อหลีกเลี่ยงการสร้างคะแนนที่ไม่น่าเชื่อถือหรือไม่ถูกต้อง ผู้ให้คะแนนมนุษย์จะเกี่ยวข้องกับการให้คะแนนภาษาพูดใน TOEFL iBT ที่มีความเสี่ยงสูง

เมื่อผู้ให้คะแนนมนุษย์และ SpeechRater ถูกใช้ร่วมกันเพื่อประเมินภาษาพูดที่มีความเสี่ยงสูง ทั้งสองมีบทบาทในอนาคตของการประเมินภาษาอังกฤษ ผู้ให้คะแนนมนุษย์สามารถเข้าใจเนื้อหาและโครงสร้างของภาษาพูดได้อย่างลึกซึ้ง ในทางกลับกัน เครื่องมือให้คะแนนภาษาพูดอัตโนมัติสามารถวัดด้านต่างๆ ของภาษาพูดได้อย่างแม่นยำ เช่น ความคล่องแคล่วหรือการออกเสียง มีความสม่ำเสมออย่างสมบูรณ์ในช่วงเวลา สามารถลดเวลาและต้นทุนในการให้คะแนน และสามารถขยายได้ง่ายกว่าเพื่อรองรับการทดสอบในปริมาณมาก เมื่อรวมผู้ให้คะแนนมนุษย์และเครื่องมือให้คะแนนภาษาพูดอัตโนมัติ ระบบที่ได้จะสามารถใช้ประโยชน์จากจุดแข็งของทั้งสองวิธี

เพื่อให้เครื่องมือให้คะแนนภาษาพูดอัตโนมัติสามารถพัฒนาอย่างต่อเนื่อง การวิจัยและพัฒนาควรเน้นไปที่ด้านต่อไปนี้:

  • การสร้างระบบการรู้จำเสียงพูดอัตโนมัติที่มีความแม่นยำสูง: เนื่องจากคุณสมบัติของระบบการให้คะแนนภาษาพูดส่วนใหญ่ขึ้นอยู่กับส่วนประกอบนี้ของระบบที่แปลงเสียงของผู้สอบเป็นข้อความ การรู้จำเสียงพูดอัตโนมัติที่มีความแม่นยำสูงจึงจำเป็นต่อการได้คุณสมบัติที่ถูกต้อง;
  • การสำรวจวิธีการใหม่ในการรวมคะแนนของมนุษย์และอัตโนมัติ: เพื่อใช้ประโยชน์จากจุดแข็งของทั้งสองวิธีในการให้คะแนน ควรสำรวจวิธีการใหม่ในการรวมหลักฐานนี้;
  • การคำนึงถึงความผิดปกติในการตอบสนอง ทั้งทางเทคนิคและพฤติกรรม: ตัวกรองประสิทธิภาพสูงสามารถระบุการตอบสนองเหล่านี้และยกเว้นพวกมันจากการให้คะแนนอัตโนมัติเพื่อช่วยให้แน่ใจว่าคะแนนการประเมินมีความน่าเชื่อถือและถูกต้อง;
  • การประเมินภาษาพูดแบบสปอนเตเนียสหรือแบบสนทนา ซึ่งเกิดขึ้นบ่อยที่สุดในชีวิตประจำวัน: การให้คะแนนอัตโนมัติของภาษาพูดแบบโต้ตอบนี้เป็นเป้าหมายที่สำคัญ แต่สิ่งเหล่านี้นำเสนอความท้าทายในการให้คะแนนหลายอย่าง รวมถึงการประเมินและให้คะแนนโดยรวม;
  • การสำรวจเทคโนโลยีการเรียนรู้ลึกสำหรับการให้คะแนนภาษาพูดอัตโนมัติ: แนวคิดนี้ในด้านการเรียนรู้ของเครื่องจักรได้ผลลัพธ์ที่สำคัญในหลายงาน AI ในช่วงไม่กี่ปีที่ผ่านมา (เช่น การรู้จำเสียงพูด การรู้จำภาพ) และดังนั้นจึงมีแนวโน้มที่การให้คะแนนอัตโนมัติจะสามารถใช้ประโยชน์จากเทคโนโลยีนี้ได้ อย่างไรก็ตาม เนื่องจากระบบเหล่านี้สามารถถือเป็น “กล่องดำ” ได้ การให้ความสำคัญกับการตีความคะแนนที่ได้รับจึงมีความสำคัญต่อการรักษาความโปร่งใสบางระดับ

เพื่อรองรับประชากรผู้เรียนภาษาอังกฤษที่เติบโตและเปลี่ยนแปลง ระบบการให้คะแนนภาษาพูดรุ่นต่อไปต้องขยายการให้คะแนนอัตโนมัติและขยายช่วงของสิ่งที่สามารถวัดได้ เพื่อให้สามารถใช้ได้และขยายได้ นั่นไม่ได้หมายความว่าองค์ประกอบของมนุษย์จะถูกลบออกไป โดยเฉพาะอย่างยิ่งสำหรับการประเมินที่มีความเสี่ยงสูง ผู้ให้คะแนนมนุษย์ยังคงจำเป็นต่อการวัดด้านต่างๆ ของภาษาพูดที่ยากต่อการประเมินโดยเครื่องมือให้คะแนนอัตโนมัติ การใช้เครื่องมือให้คะแนนภาษาพูดอัตโนมัติเพียงอย่างเดียวสำหรับการประเมินที่มีผลกระทบอาจไม่สามารถระบุการตอบสนองที่มีปัญหาจากผู้สอบ เช่น การตอบที่ไม่เกี่ยวข้องกับหัวข้อหรือการลอกเลียนแบบ และอาจส่งผลให้คะแนนการประเมินมีความน่าเชื่อถือและถูกต้องน้อยลง การใช้ทั้งผู้ให้คะแนนมนุษย์และเครื่องมือให้คะแนนภาษาพูดอัตโนมัติร่วมกันอาจเป็นวิธีที่ดีที่สุดในการให้คะแนนภาษาพูดในระยะเวลาที่จะมาถึง โดยเฉพาะอย่างยิ่งหากภาษาพูดแบบสปอนเตเนียสหรือแบบสนทนาได้รับการประเมิน

เขียนโดย: Keelan Evanini, ผู้อำนวยการด้านการวิจัยภาษาพูด, ETS และ Klaus Zechner, นักวิจัยอาวุโส, ETS

ETS ทำงานร่วมกับสถาบันการศึกษา ธุรกิจ และรัฐบาลเพื่อทำการวิจัยและพัฒนาโปรแกรมการประเมินที่ให้ข้อมูลที่มีความหมายซึ่งสามารถพึ่งพาได้ในการประเมินบุคคลและโปรแกรม ETS พัฒนา จัดการ และให้คะแนนการประเมินมากกว่า 50 ล้านครั้งต่อปีในมากกว่า 180 ประเทศที่มากกว่า 9,000 สถานที่ทั่วโลก เราออกแบบการประเมินของเราโดยใช้ข้อมูลเชิงลึกจากอุตสาหกรรม การวิจัยอย่างเข้มงวด และความมุ่งมั่นอย่างไม่ขัดข้องต่อคุณภาพ เพื่อให้เราสามารถช่วยให้ชุมชนการศึกษาและที่ทำงานตัดสินใจได้อย่างมีข้อมูล หากต้องการเรียนรู้เพิ่มเติม โปรดเยี่ยมชม ETS

ผู้อำนวยการด้านการวิจัยสุนทรพจน์ ในส่วนการวิจัยและพัฒนา ที่ Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).