โมเดลและแพลตฟอร์ม AI
โมเดล AI ใหม่ทำงานร่วมกับภาษามนุษย์ที่หลากหลาย
นักวิจัยจากมหาวิทยาลัยวอเตอร์ลูได้พัฒนาโมเดล AI ที่ทำให้คอมพิวเตอร์สามารถประมวลผลภาษามนุษย์ที่หลากหลายได้มากขึ้น ซึ่งเป็นขั้นตอนที่สำคัญในด้านการประมวลผลภาษามนุษย์ เนื่องจากภาษาหลายภาษามักถูกทิ้งไว้ข้างหลังในกระบวนการเขียนโปรแกรม ภาษาแอฟริกันมักไม่ได้รับความสนใจจากนักวิทยาศาสตร์คอมพิวเตอร์ ซึ่งนำไปสู่การประมวลผลภาษามนุษย์ที่จำกัดในภูมิภาค
โมเดลภาษาใหม่นี้ถูกพัฒนาโดยทีมนักวิจัยจากโรงเรียนคอมพิวเตอร์วิทยาศาสตร์ David R. Cheriton ของมหาวิทยาลัยวอเตอร์ลู
การการวิจัยนี้ถูกนำเสนอที่การประชุม Multilingual Representation Learning Workshop ในการประชุม Conference on Empirical Methods in Natural Language Processing ปี 2021
โมเดลนี้มีบทบาทสำคัญในการช่วยให้คอมพิวเตอร์วิเคราะห์ข้อความในภาษาแอฟริกันสำหรับงานที่มีประโยชน์หลายอย่าง และได้รับการเรียกขานว่า AfriBERTa มันใช้เทคนิคการเรียนรู้ลึกเพื่อให้ผลลัพธ์ที่น่าประทับใจสำหรับภาษาที่มีทรัพยากรน้อย
ทำงานร่วมกับภาษาแอฟริกัน 11 ภาษา
AfriBERTa ทำงานร่วมกับภาษาแอฟริกัน 11 ภาษา รวมถึง Amharic, Hausa และ Swahili ซึ่งมีผู้พูดรวมกันมากกว่า 400 ล้านคน โมเดลนี้ได้แสดงผลลัพธ์ที่มีคุณภาพเทียบเท่ากับโมเดลที่ดีที่สุด และทำได้โดยการเรียนรู้จากข้อความเพียง 1 กิกะไบต์ โมเดลที่คล้ายกัน thườngต้องการข้อมูลหลายพันครั้ง
Kelechi Ogueji เป็นนักศึกษาระดับมหาบัณฑิตสาขาวิทยาศาสตร์คอมพิวเตอร์ที่วอเตอร์ลู
“โมเดลภาษาที่ได้รับการฝึกอบรมล่วงหน้าได้เปลี่ยนแปลงวิธีการประมวลผลและวิเคราะห์ข้อมูลข้อความสำหรับงานต่างๆ ตั้งแต่การแปลภาษาไปจนถึงการตอบคำถาม” Ogueji กล่าว “อย่างน่าเสียดาย ภาษาแอฟริกันได้รับความสนใจน้อยจากชุมชนการวิจัย”
“หนึ่งในความท้าทายคือเครือข่ายประสาทเทียมต้องการข้อความและคอมพิวเตอร์จำนวนมากในการสร้าง และไม่เหมือนกับภาษาอังกฤษที่มีข้อความจำนวนมาก ภาษาเกือบ 7,000 ภาษาที่พูดทั่วโลกสามารถถูกอธิบายว่าเป็นภาษาที่มีทรัพยากรน้อย เนื่องจากขาดข้อมูลที่จะให้กับเครือข่ายประสาทเทียม”
เทคนิคการฝึกอบรมล่วงหน้า
โมเดลส่วนใหญ่นี้พึ่งพาเทคนิคการฝึกอบรมล่วงหน้า ซึ่งเกี่ยวข้องกับการนำเสนอข้อความที่มีบางคำที่ถูกซ่อนหรือปิดบังให้กับโมเดล จากนั้นโมเดลจะต้องเดาคำที่ซ่อนอยู่ และทำซ้ำขั้นตอนนี้หลายพันล้านครั้ง สุดท้ายโมเดลจะเรียนรู้ความสัมพันธ์ทางสถิติระหว่างคำ ซึ่งคล้ายกับความรู้ของมนุษย์เกี่ยวกับภาษา
Jimmy Lin เป็นประธานคณะกรรมการคอมพิวเตอร์วิทยาศาสตร์และที่ปรึกษาของ Ogueji
“การฝึกอบรมโมเดลที่มีความแม่นยำเทียบเท่าสำหรับงานที่ต้องการ แต่ใช้ข้อมูลน้อยกว่ามากมีหลายข้อดี” Lin กล่าว “ต้องการข้อมูลน้อยกว่าในการฝึกอบรมโมเดลภาษา หมายความว่าการคำนวณที่ต้องการน้อยกว่า และมีการปล่อยก๊าซคาร์บอนไดออกไซด์ที่ลดลงในการดำเนินการศูนย์ข้อมูลขนาดใหญ่ ชุดข้อมูลที่เล็กกว่ายังทำให้การดูแลข้อมูลเป็นไปได้ ซึ่งเป็นวิธีหนึ่งในการลดความเอนเอียงที่มีอยู่ในโมเดล”
“งานนี้เป็นขั้นตอนที่สำคัญในการนำความสามารถการประมวลผลภาษามนุษย์ไปให้กับคนมากกว่า 1.3 พันล้านคนในภูมิภาคแอฟริกา”
การวิจัยนี้ยังเกี่ยวข้องกับ Yuxin Zhu ที่เพิ่งสำเร็จการศึกษาระดับอุดมศึกษาในสาขาวิทยาศาสตร์คอมพิวเตอร์ที่มหาวิทยาลัย












