โมเดลและแพลตฟอร์ม AI
อานาสตาซียา ลูคินา นักวิจัยอาวุโส (NLP/สเปช) ที่ ETS – ซีรีส์สัมภาษณ์

อานาสตาซียา ลูคินา เป็นนักวิจัยที่ Educational Testing Services (ETS) ซึ่งเธอทำงานเกี่ยวกับการให้คะแนนอัตโนมัติของสเปช
ความสนใจในการวิจัยของเธอครอบคลุมหัวข้อต่างๆ มากมาย เธอ曾ทำงานเกี่ยวกับภาษากรีกสมัยใหม่ จังหวะสเปช และการวิเคราะห์Prosody อัตโนมัติ
งานปัจจุบันของเธอเน้นการรวมเครื่องมือและวิธีการจากเทคโนโลยีสเปชและแมชชีนเลิร์นนิงกับข้อมูลเชิงลึกจากการศึกษาการรับรู้และผลิตสเปชเพื่อสร้างแบบจำลองการให้คะแนนอัตโนมัติสำหรับการประเมินสเปชที่ไม่ใช่ภาษาแม่
คุณมีความรักที่ชัดเจนต่อภาษา是什么ที่ทำให้คุณมีความสนใจนี้?
ฉันเติบโตขึ้นมาโดยพูดภาษารัสเซียในเซนต์ปีเตอร์สเบิร์ก รัสเซีย และฉันจำได้ว่าฉันสนใจเมื่อฉันถูกแนะนำให้รู้จักกับภาษาอังกฤษ: สำหรับบางคำ มีรูปแบบที่ทำให้ฉันสามารถ “แปลง” คำรัสเซียเป็นคำอังกฤษได้ และจากนั้นฉันจะพบคำที่ “รูปแบบ” ของฉันล้มเหลวและพยายามหาวิธีที่ดีกว่าและทั่วไป hơn ในเวลานั้น ฉันไม่รู้อะไรเกี่ยวกับภาษาศาสตร์หรือความแตกต่างระหว่างคำที่มีความสัมพันธ์และคำยืม แต่นี่กระตุ้นความอยากรู้อยากเห็นและความต้องการที่จะเรียนรู้ภาษาอื่นๆ ความรักที่จะระบุรูปแบบในการพูดและทดสอบมันบนข้อมูลคือสิ่งที่นำฉันมาถึงสาขาฟอนетิกส์ แมชชีนเลิร์นนิง และงานที่ฉันทำในปัจจุบัน
ก่อนที่คุณจะทำงานในปัจจุบันเกี่ยวกับ NLP คุณ曾ทำงานเป็นนักแปลระหว่างภาษาอังกฤษ-รัสเซียและภาษากรีกสมัยใหม่-รัสเซีย คุณคิดว่างานของคุณในฐานะนักแปลได้ให้ข้อมูลเชิงลึกเพิ่มเติมเกี่ยวกับประเด็นและปัญหาที่เกี่ยวข้องกับ NLP หรือไม่?
อัตลักษณ์หลักของฉันเสมอมาคือนักวิจัย มันจริงที่ฉันเริ่มอาชีพทางวิชาการของฉันในฐานะนักวิชาการภาษากรีกสมัยใหม่ หรือมากกว่านั้น ฟอนетิกส์ของภาษากรีกสมัยใหม่ สำหรับงานดุษฎีนิพนธ์ของฉัน ฉันสำรวจความแตกต่างทางฟอนетิกส์ระหว่างภาษากรีกสมัยใหม่หลายๆ พูดและวิธีที่ความแตกต่างระหว่างภาษาเหล่านี้สามารถเชื่อมโยงกับประวัติศาสตร์ของพื้นที่ได้ ฉันแย้งว่าบางส่วนของความแตกต่างระหว่างภาษาเหล่านี้อาจเกิดขึ้นจากการสัมผัสระหว่างภาษาและภาษาอื่นๆ ที่พูดในพื้นที่ ในขณะที่ฉันไม่ได้ทำงานเกี่ยวกับภาษากรีกสมัยใหม่อีกต่อไป การเปลี่ยนแปลงที่เกิดขึ้นเมื่อภาษาสองภาษาสัมผัสกัน vẫnอยู่ในใจกลางของงานฉัน: แต่คราวนี้ฉันเน้นไปที่สิ่งที่เกิดขึ้นเมื่อบุคคลเรียนรู้ภาษาใหม่และวิธีที่เทคโนโลยีสามารถช่วยให้กระบวนการนี้เกิดขึ้นได้อย่างมีประสิทธิภาพที่สุด
เมื่อพูดถึงภาษาอังกฤษ มีสำเนียงมากมาย คุณออกแบบ NLP ที่สามารถเข้าใจสำเนียงต่างๆ ได้อย่างไร เป็นเรื่องง่ายๆ ที่จะให้อัลกอริทึมการเรียนรู้ลึกด้วยข้อมูลขนาดใหญ่จากสำเนียงแต่ละแบบหรือไม่?
มีหลายวิธีที่ใช้ในการแก้ไขปัญหานี้ในอดีต นอกเหนือจากการสร้างแบบจำลองขนาดใหญ่ที่ครอบคลุมสำเนียงทั้งหมด คุณสามารถระบุสำเนียงและใช้แบบจำลองที่กำหนดเองสำหรับสำเนียงนั้น หรือคุณสามารถลองใช้หลายแบบจำลองพร้อมกันและเลือกแบบจำลองที่ทำงานได้ดีที่สุด สุดท้ายเพื่อให้ได้ผลลัพธ์ที่ดีบนสำเนียงหลากหลาย คุณต้องการข้อมูลการฝึกอบรมและประเมินที่เป็นตัวแทนของสำเนียงที่ระบบอาจพบ
ที่ ETS เราดำเนินการประเมินอย่างครอบคลุมเพื่อให้แน่ใจว่าคะแนนที่ผลิตโดยระบบอัตโนมัติของเราสะท้อนถึงความแตกต่างในทักษะที่แท้จริงที่เราต้องการวัดและไม่ได้รับอิทธิพลจากลักษณะประชากรศาสตร์ของผู้เรียน เช่น เพศ เชื้อชาติ หรือประเทศตั้งถิ่นกำเนิด
เด็กและ/หรือผู้เรียนภาษา มักจะมีปัญหากับการออกเสียงที่สมบูรณ์แบบ คุณแก้ไขปัญหาเรื่องการออกเสียงอย่างไร?
ไม่มีการออกเสียงที่สมบูรณ์แบบ: วิธีที่เราพูดมีความเกี่ยวข้องกับอัตลักษณ์ของเรา และเป้าหมายของเราในฐานะนักพัฒน์และนักวิจัยคือการทำให้แน่ใจว่าระบบของเรามีความยุติธรรมต่อผู้ใช้ทุกคน
ทั้งเด็กและผู้เรียนภาษามีความท้าทายเฉพาะตัวสำหรับระบบสเปช การพูดของเด็กไม่เพียงแต่มีคุณภาพเสียงที่แตกต่างมาก แต่เด็กก็พูดต่างจากผู้ใหญ่ และมีความหลากหลายมากระหว่างเด็ก ในทางกลับกัน การพัฒนาระบบการรับรู้สเปชอัตโนมัติสำหรับเด็กเป็นงานที่แยกจากกันซึ่งต้องการข้อมูลสเปชของเด็กจำนวนมาก
ในทำนองเดียวกัน แม้ว่าจะมีความคล้ายคลึงกันระหว่างผู้เรียนภาษาจากภูมิหลังเดียวกัน ผู้เรียนสามารถแตกต่างกันอย่างมากในการใช้รูปแบบทาง фонетิกส์ คำศัพท์ และไวยากรณ์ ทำให้การรับรู้สเปชมีความท้าทายเป็นพิเศษ เมื่อสร้างระบบการให้คะแนนความสามารถภาษาอังกฤษของเรา เราใช้ข้อมูลจากผู้เรียนภาษาที่มีระดับความสามารถและภาษาแม่ที่หลากหลาย
ในเดือนมกราคม 2018 คุณได้ตีพิมพ์ ‘การใช้คำตอบตัวอย่างสำหรับการฝึกอบรมและการประเมินระบบการให้คะแนนสเปชอัตโนมัติ‘ คุณสามารถอธิบายถึงความก้าวหน้าหลักๆ ที่ควรเข้าใจจากงานวิจัยนี้ได้หรือไม่?
ในงานวิจัยนี้ เราได้สำรวจว่าคุณภาพของข้อมูลการฝึกอบรมและข้อมูลการประเมินส่งผลต่อประสิทธิภาพของระบบการให้คะแนนอัตโนมัติอย่างไร
ระบบการให้คะแนนอัตโนมัติ เช่น ระบบอัตโนมัติอื่นๆ ได้รับการฝึกอบรมจากข้อมูลที่ได้รับการระบุชั้นเรียนโดยมนุษย์ ในกรณีนี้ คือคะแนนที่กำหนดโดยผู้ให้คะแนนของมนุษย์ ผู้ให้คะแนนของมนุษย์ไม่เห็นด้วยเสมอไปในคะแนนที่พวกเขากำหนด มีกลยุทธ์ต่างๆ ที่ใช้ในการประเมินเพื่อให้แน่ใจว่าคะแนนที่รายงานให้กับผู้สอบยังคงมีความน่าเชื่อถือแม้จะมีความไม่เห็นด้วยของมนุษย์
เราสามารถเข้าถึงข้อมูลจำนวนมากที่มีความเห็นไม่เห็นด้วยระหว่างผู้ให้คะแนนของมนุษย์และเปรียบเทียบประสิทธิภาพของระบบภายใต้สภาพแวดล้อมที่แตกต่างกัน สิ่งที่เราพบคือการฝึกอบรมระบบบนข้อมูลที่สมบูรณ์แบบไม่ได้ปรับปรุงประสิทธิภาพของระบบมากกว่าการฝึกอบรมบนข้อมูลที่มีฉลากที่มีเสียงรบกวนมากขึ้น ฉลากที่สมบูรณ์แบบให้ข้อได้เปรียบเฉพาะเมื่อขนาดของชุดข้อมูลการฝึกอบรมมีขนาดเล็กมาก ในทางกลับกัน คุณภาพของฉลากของมนุษย์มีผลกระทบอย่างมากต่อการประเมินระบบ: การประมาณการประสิทธิภาพของคุณสามารถสูงกว่า 30% หากคุณประเมินบนฉลากที่สะอาด
ข้อความที่ต้องจำคือว่าหากคุณมีข้อมูลและทรัพยากรมากพอที่จะล้างฉลากที่เป็นมาตรฐานแล้ว อาจจะฉลาดที่จะล้างฉลากในเซตการประเมินมากกว่าในเซตการฝึกอบรม และการค้นพบครั้งนี้ใช้ไม่เพียงแต่สำหรับการให้คะแนนอัตโนมัติเท่านั้น แต่ยังใช้ได้กับหลายๆ ด้านอื่นๆ ด้วย
คุณสามารถอธิบายงานของคุณที่ ETS ได้หรือไม่?
ฉันทำงานในระบบการให้คะแนนสเปชที่ประมวลผลภาษาพูดในบริบททางการศึกษา ระบบหนึ่งที่ดีคือ SpeechRater ซึ่งใช้เทคโนโลยีการรับรู้สเปชและวิเคราะห์ที่ทันสมัยเพื่อประเมินและให้ข้อเสนอแนะเกี่ยวกับความสามารถในการพูดภาษาอังกฤษ SpeechRater เป็นแอปพลิเคชันที่มีความ trưởng thànhซึ่งได้รับการใช้งานมาเกิน 10 ปี ฉันสร้างแบบจำลองการให้คะแนนสำหรับการใช้งานที่แตกต่างกันและทำงานร่วมกับเพื่อนร่วมงานคนอื่นๆ ที่ ETS เพื่อให้แน่ใจว่าคะแนนที่เราให้ได้รับการรับรองว่ามีความน่าเชื่อถือ ยุติธรรม และถูกต้องสำหรับผู้สอบทุกคน
นอกเหนือจากการดูแลและปรับปรุงระบบการทำงานของเราแล้ว เรายังสร้างระบบใหม่ๆ อีกด้วย หนึ่งในโครงการที่ฉันรู้สึกตื่นเต้นมากคือ RelayReader: แอปพลิเคชันที่ออกแบบมาเพื่อช่วยให้ผู้อ่านเริ่มต้นได้รับประสบการณ์การอ่านอย่างมั่นใจ เมื่ออ่านด้วย RelayReader ผู้ใช้จะสลับฟังและอ่านออกเสียงหนังสือเล่มหนึ่ง การอ่านของพวกเขาถูกส่งไปยังเซิร์ฟเวอร์ของเราเพื่อให้ข้อเสนอแนะ ในแง่ของการประมวลผลสเปช ความท้าทายหลักของแอปพลิเคชันนี้คือวิธีการวัดการเรียนรู้และการให้ข้อเสนอแนะที่เชื่อถือได้และสามารถดำเนินการได้โดยไม่ขัดขวางความเกี่ยวข้องของผู้อ่านกับหนังสือ
สิ่งใดคือส่วนที่คุณชอบที่สุดในการทำงานกับ ETS?
สิ่งที่ดึงดูดฉันให้เข้าร่วม ETS คือการเป็นองค์กรที่ไม่แสวงหากำไรซึ่งมีภารกิจในการพัฒนาคุณภาพของการศึกษาสำหรับทุกคนในโลก ในขณะที่การวิจัยที่นำไปสู่ผลิตภัณฑ์เป็นสิ่งที่ดี ฉันชื่นชมโอกาสที่จะได้ทำงานในโครงการที่มีลักษณะพื้นฐานมากกว่าซึ่งจะช่วยในการพัฒนาผลิตภัณฑ์ในอนาคต ฉันชื่นชมความจริงที่ว่า ETS ให้ความสำคัญกับประเด็นด้านความเป็นส่วนตัวของข้อมูลและความยุติธรรมอย่างจริงจัง และระบบทั้งหมดของเราต้องผ่านการประเมินที่เข้มงวดก่อนที่จะถูกใช้งานจริง
แต่สิ่งที่ทำให้ ETS เป็นสถานที่ที่ดีในการทำงานคือผู้คน เรามีชุมชนนักวิทยาศาสตร์ วิศวกร และนักพัฒนาที่มีภูมิหลังที่หลากหลาย ซึ่งช่วยให้เกิดการทำงานร่วมกันที่น่าสนใจมากมาย
คุณคิดว่า AI จะสามารถผ่านการทดสอบของทัวริงได้หรือไม่?
ตั้งแต่ปี 1950 มีการตีความมากมายเกี่ยวกับวิธีการทดสอบทัวริงในทางปฏิบัติ มีความเห็นพ้องกันว่าการทดสอบทัวริงยังไม่ผ่านในแง่ของปรัชญาที่ว่าไม่มีระบบ AI ที่คิดเหมือนมนุษย์ แต่นี่กลายเป็นหัวข้อที่แคบมากแล้ว ส่วนใหญ่คนไม่สร้างระบบเพื่อให้ผ่านการทดสอบทัวริง – เราต้องการให้พวกมันบรรลุเป้าหมายเฉพาะ
สำหรับงานบางอย่าง เช่น การรับรู้สเปชหรือการเข้าใจภาษาธรรมชาติ การทำงานของมนุษย์อาจถือเป็นมาตรฐานทองคำ แต่ก็มีงานอื่นๆ ที่เราคาดหวังให้ระบบอัตโนมัติทำงานได้ดีกว่ามนุษย์ หรือระบบอัตโนมัติและผู้เชี่ยวชาญของมนุษย์ต้องทำงานร่วมกันเพื่อให้ได้ผลลัพธ์ที่ดีที่สุด ตัวอย่างเช่น ในบริบททางการศึกษา เราไม่ต้องการให้ระบบ AI แทนที่ครู – เราต้องการให้มันช่วยครู ไม่ว่าจะเป็นการระบุรูปแบบในเส้นทางการเรียนรู้ของนักเรียน ช่วยในการให้คะแนน หรือการค้นหาวัสดุการสอนที่ดีที่สุด
คุณมีอะไรที่ต้องการแบ่งปันเกี่ยวกับ ETS หรือ NLP หรือไม่?
หลายคนรู้จัก ETS จากการประเมินและการให้คะแนนอัตโนมัติ แต่เราทำมากกว่านั้นมาก เรามีความสามารถตั้งแต่ไบโอเมตริกส์เสียงไปจนถึงแอปพลิเคชันสนทนาพูด และเรากำลังมองหาวิธีใหม่ๆ ในการรวมเทคโนโลยีเข้ากับการเรียนรู้ ตอนนี้ที่นักเรียนหลายคนเรียนจากบ้าน เราได้เปิดให้ใช้ความสามารถในการวิจัยบางอย่างแก่สาธารณะ
ขอขอบคุณสำหรับการสัมภาษณ์และการให้ข้อมูลเชิงลึกเกี่ยวกับการพัฒนาล่าสุดใน NLP และการรับรู้สเปช ใครที่ต้องการเรียนรู้เพิ่มเติมสามารถเยี่ยมชม Educational Testing Services ได้












