โมเดลและแพลตฟอร์ม AI

Facebook สร้างโมเดลการแปลภาษาเครื่องจักรที่สามารถแปลภาษาได้ 100 ภาษา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Facebook (META ) ได้พัฒนา โมเดลการแปลภาษาเครื่องจักรใหม่ ที่สามารถแปลข้อความระหว่างภาษาใดๆ ในชุดภาษา 100 ภาษา ในขณะที่ระบบการแปลภาษาเครื่องจักรอื่นๆ มีอยู่แล้ว แต่ระบบการแปลภาษาเครื่องจักรส่วนใหญ่ทำงานโดยการแปลข้อความเป็นภาษาอังกฤษก่อน แล้วจึงแปลงข้อความจากภาษาอังกฤษเป็นภาษาอื่นๆ ตามที่ Engadget รายงาน ระบบการแปลภาษาเครื่องจักรของ Facebook ทำงานโดยไม่ต้องใช้ภาษาอังกฤษเป็นคนกลาง และสามารถบรรลุความแม่นยำได้ประมาณ 90%

ข้อมูลการฝึกอบรมของ Facebook สำหรับโมเดลการแปลภาษาเครื่องจักรประกอบด้วยคู่ประโยคประมาณ 7.5 พันล้านคู่ ซึ่งกระจายอยู่ใน 100 ภาษา ข้อมูลนี้ถูกเก็บจากเว็บโดยใช้เครื่องมือ web crawler และภาษาที่มีอยู่ในข้อมูลที่รวบรวมได้ถูกกำหนดโดยใช้โมเดลภาษาที่เรียกว่า FastText เมื่อข้อมูลถูกเก็บแล้ว มันถูกส่งผ่านเครื่องมือที่เรียกว่า LASER 2.0 เพื่อแยกความหมายของตัวอย่างประโยคที่แตกต่างกัน และจับคู่ประโยคในภาษาที่แตกต่างกันตามความหมาย LASER 2.0 ถูกพัฒนาโดย Facebook และใช้การเรียนรู้แบบไม่มีคำสั่งเพื่อสร้างการฝังตัว การฝังตัวของประโยคมีข้อมูลเกี่ยวกับความสัมพันธ์ระหว่างประโยคที่แตกต่างกันตามคุณสมบัติ เช่น ความถี่การใช้งาน และระยะห่างระหว่างประโยค LASER 2.0 สามารถสร้างคู่ประโยคที่มีความหมายที่คล้ายกัน

ข้อมูลการฝึกอบรมไม่ได้ถูกจับคู่เพียงตามความหมายของประโยคเท่านั้น แต่ละภาษายังถูกจัดกลุ่มเข้าด้วยกัน เป้าหมายคือการออกแบบระบบที่ไม่ต้องใช้ภาษาอังกฤษเป็นคนกลาง โดย Angela Fan ของ Facebook ซึ่งเป็นผู้นำโครงการ ได้กล่าวว่าหลายภูมิภาคทั่วโลกพูดภาษา 2 ภาษาที่ไม่ใช่ภาษาอังกฤษ วิศวกรของ Facebook ได้ฝึกอบรมโดยเน้นการจับคู่ภาษาที่มีการแปลกันบ่อย 14 กลุ่มภาษาได้ถูกสร้างขึ้นตามตัวแปร เช่น วัฒนธรรม ความคล้ายคลึงกันทางภาษา และภูมิศาสตร์ ตัวอย่างเช่น หนึ่งในกลุ่มภาษาที่นักวิจัยสร้างขึ้นประกอบด้วยภาษาที่พูดทั่วไปในอินเดีย รวมถึงภาษาอูรดู ทมิฬ ฮินดี และเบงกอล ซึ่งทำเพื่อให้ได้การแปลที่มีคุณภาพสูงสำหรับภาษาที่จับคู่กันบ่อย

วิธีการฝึกอบรมที่เน้นกลุ่มภาษานำไปสู่ผลลัพธ์ที่น่าสนใจ พบว่าโมเดลการแปลภาษาที่ได้จากการฝึกอบรมมีความแม่นยำมากกว่าโมเดลที่มีอยู่แล้วสำหรับคู่ภาษาบางคู่ ตัวอย่างเช่น เมื่อแปลภาษาอังกฤษเป็นภาษาเบลารุส ระบบการแปลภาษาเครื่องจักรสามารถใช้รูปแบบที่ได้เรียนรู้เมื่อแปลภาษารัสเซียเพราะภาษาเบลารุสมีความคล้ายคลึงกันทางภาษากับภาษารัสเซีย ในทำนองเดียวกัน การแปลภาษาสเปนเป็นภาษาโปรตุเกสได้รับการปรับปรุงเนื่องจากภาษาสเปนเป็นภาษาที่พูดทั่วไปเป็นอันดับสองและมีข้อมูลการฝึกอบรมที่สำคัญสำหรับงานนี้

มีภาษาประมาณ 60 ภาษาที่ระบบการแปลภาษาไม่ครอบคลุม และความแม่นยำของโมเดลต้องได้รับการปรับปรุงก่อนที่จะพร้อมใช้งานสำหรับภาษาที่ไม่มีข้อมูลการฝึกอบรมมากนัก ภาษาหลายภาษาในเอเชียตะวันออกเฉียงใต้และแอฟริกายังไม่มีข้อมูลที่เพียงพอในการฝึกอบรมโมเดลที่เชื่อถือได้ ทีมวิจัยจะต้องหาวิธีแก้ปัญหาขาดข้อมูลนี้ ทีมวิจัยยังต้องหาวิธีควบคุมรูปแบบที่อาจเป็นการเหยียดเชื้อชาติ เพศ หรือไม่เหมาะสมที่โมเดลอาจได้เรียนรู้ ในขณะที่ทีมวิจัยได้ใช้ฟิลเตอร์คำหยาบคาย แต่ฟิลเตอร์นี้ทำงานหลักๆ บนข้อมูลภาษาอังกฤษ

ระบบการแปลภาษาเครื่องจักรยังไม่ได้ถูกนำไปใช้บนแพลตฟอร์มโซเชียลมีเดียของ Facebook โมเดลปัจจุบันใช้เพื่อการวิจัยเท่านั้น อย่างไรก็ตาม Facebook กำลังเตรียมการออกแบบโมเดลที่คล้ายกันเพื่อจัดการคำขอการแปลภาษาประมาณ 20 พันล้านคำขอที่เว็บไซต์enerima ทุกวัน

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี