มุมมองของ Anderson
แอปเปิลมีทางออกสำหรับการแปลภาษาที่มีเพศ

แอปเปิลเพิ่งเผยแพร่บทความวิจัยร่วมกับ USC โดยสำรวจวิธีการเรียนรู้ของเครื่องจักรที่ใช้ในการให้ผู้ใช้ระบบปฏิบัติการ iOS18 มีทางเลือกมากขึ้นเกี่ยวกับเพศเมื่อพูดถึงการแปล

ใน iOS18 ผู้ใช้สามารถเลือกคำแนะนำทางเลือกเกี่ยวกับเพศสำหรับคำที่แปลในแอป Translate ของ Apple
แม้ว่าปัญหาที่กล่าวถึงในงานวิจัย (ที่แอปเปิลประกาศ ที่นี่) เกี่ยวข้องกับการถกเถียงในปัจจุบันเกี่ยวกับการกำหนดเพศ แต่ก็เน้นไปที่ปัญหาที่เก่ากว่ามาก ซึ่งก็คือภาษา 84 ใน 229 ภาษาที่รู้จักกันในโลก ใช้ระบบเพศที่อาศัยเพศ

จุดสีแดงบ่งชี้ภาษาที่ใช้ระบบเพศที่อาศัยเพศ
ภาษาอังกฤษนั้น อยู่ในหมวดภาษาที่อาศัยเพศ เนื่องจากมีการกำหนดเพศเป็นเพศชายหรือเพศหญิง
ในทางกลับกัน ภาษาโรมันซ์ (รวมถึง ภาษาสเปน ที่มีผู้พูดมากกว่า ครึ่งพันล้านคน) และภาษาอื่นๆ เช่น รัสเซีย ต้องการความสอดคล้องกันทางเพศในหลายวิธี ซึ่งบังคับให้ระบบการแปลต้องจัดการกับการกำหนดเพศ
งานวิจัยใหม่นี้แสดงให้เห็นโดยการสังเกตการแปลภาษาสเปนของประโยค เลขานุการโกรธกับหัวหน้า:

ตัวอย่างการกำหนดเพศในประโยค ‘เลขานุการโกรธกับหัวหน้า’ เมื่อแปลจากภาษาอังกฤษเป็นภาษาสเปน
การแปลที่ไม่ซับซ้อนไม่เพียงพอสำหรับข้อความที่ยาวกว่า ซึ่งอาจกำหนดเพศที่เริ่มต้น (เขา, เธอ ฯลฯ) และหลังจากนั้นไม่กล่าวถึงเพศอีก แต่การแปลจะต้องจำเพศที่กำหนดไว้ตลอดข้อความ
สิ่งนี้อาจเป็นเรื่องที่ท้าทายสำหรับวิธีการที่ใช้โทเค็น ซึ่งจัดการการแปลในขนาดที่เล็ก และเสี่ยงต่อการเสียเพศที่กำหนดไว้ตลอดระยะเวลาของเนื้อหา
การแปลระบบจะต้องจัดการกับความซับซ้อนของภาษาเฉพาะในเรื่องเพศ เช่นเดียวกับภาษาฮินดีที่มีสรรพนามที่มีเพศ
ประเด็นเกี่ยวกับเพศ
ใน งานวิจัยใหม่ ที่มีชื่อว่า การสร้างทางเลือกเกี่ยวกับเพศในระบบการแปล นักวิจัยจาก Apple และ USC เสนอวิธีการ แบบกึ่ง监督 เพื่อแปลงสิ่งที่ไม่ชัดเจนเกี่ยวกับเพศเป็นรายการที่มีหลายตัวเลือก
ระบบนี้ใช้ในการแปลจากแอป Translate ของ Apple ใน iOS18 โดยสร้างโครงสร้างภาษาโดยใช้แบบจำลองภาษาขนาดใหญ่ (LLM) และการปรับให้เหมาะสมของแบบจำลองการแปลที่มีอยู่แล้ว
ผลลัพธ์ของการแปลจากระบบเหล่านี้ถูกฝึกอบรมเข้าไปในโครงสร้างที่มี โครงสร้างเพศ – กลุ่มของประโยคที่มีรูปแบบต่างๆ ของคำนามที่มีเพศที่แตกต่างกัน
งานวิจัยระบุว่า:
‘การเอนโค้ดที่มีเพศในข้อมูลการฝึกอบรมสามารถส่งผลต่อระบบการประมวลผลภาษา自然 (NLP) และทำให้เกิดการขยายตัวของการเอนโค้ดเหล่านั้น ซึ่งเป็นสาเหตุของข้อผิดพลาด’
‘ระบบการแปลอาจแปล “แพทย์” เป็น “แพทย์ชาย” (médico) แทนที่จะเป็น “แพทย์หญิง” (médica) เมื่อได้รับข้อความ “แพทย์ขอให้พยาบาลช่วยในการทำหัตถการ”‘
‘เพื่อหลีกเลี่ยงการกำหนดเพศที่ไม่ถูกต้อง ระบบการแปลจะต้องแยกความแตกต่างของเพศผ่านบริบท เมื่อไม่สามารถกำหนดเพศที่ถูกต้องได้ การให้ทางเลือกการแปลที่ครอบคลุมทุกตัวเลือกที่ถูกต้องเป็นวิธีการที่สมเหตุสมผล’
วิธีการที่นักวิจัยได้มาเป็นการเปลี่ยนการแปลจากโทเค็นเดียวเป็นรายการที่ควบคุมโดยผู้ใช้
แบบจำลองที่ Apple และ USC พัฒนาขึ้นถูกประเมินบน GATE และ MT-GenEval ทดสอบชุดข้อมูล
ในกรณีที่กำหนดเพศที่ไม่ชัดเจน ระบบจะใช้วิธีการสองวิธี: การปรับให้เหมาะสมของแบบจำลองภาษาที่มีอยู่แล้ว และการใช้แบบจำลองภาษาขนาดใหญ่ (LLM)
การตรวจสอบสองครั้ง
สำหรับกรณีที่มีการกำหนดเพศที่ไม่ชัดเจน ระบบจะใช้วิธีการสองวิธี: การปรับให้เหมาะสมของแบบจำลองภาษาที่มีอยู่แล้ว และการใช้แบบจำลองภาษาขนาดใหญ่ (LLM)
ในกรณีแรก ระบบจะใช้การปรับให้เหมาะสมของแบบจำลองภาษาที่มีอยู่แล้ว โดยใช้ ลัตติซเรสคอริง จากงานวิจัยก่อนหน้าในปี 2020
สำหรับวิธีการ LLM ระบบจะใช้ GPT-3.5-turbo โดยใช้ คอนสทรายน์ บีม ซิรช เป็นตัวกรอง
ข้อมูลและการทดสอบ
ตัวตรวจจับ สิ่งที่ไม่ชัดเจนเกี่ยวกับเพศ ที่ใช้ในโครงการนี้ถูกพัฒนาขึ้นโดยการปรับให้เหมาะสมของ xlm-roberta-large ของ Facebook AI โดยใช้ ทรานส์ฟอร์เมอร์
สำหรับการทดสอบ ระบบจะใช้ M2M 1.2B และ GPT-3.5-turbo
ผลลัพธ์ของการทดสอบแสดงให้เห็นว่าระบบสามารถให้ผลลัพธ์ที่ดีในหลายกรณี แต่ยังมีข้อจำกัดบางประการ
นักวิจัยสรุปว่าผลลัพธ์ที่ได้ไม่ถึงเป้าหมายในการสร้างการแปลที่เป็นกลางทางเพศ แต่เชื่อว่างานวิจัยนี้เป็นเครื่องมือที่มีพลังสำหรับการสำรวจในอนาคตเกี่ยวกับพื้นที่ที่ท้าทายที่สุดของการแปลภาษา
แม้ว่าผลลัพธ์จะไม่สมบูรณ์แบบ แต่นักวิจัยเชื่อว่างานวิจัยนี้เป็นขั้นตอนสำคัญในการพัฒนาการแปลภาษาที่มีประสิทธิภาพและเป็นกลางทางเพศ












