โมเดลและแพลตฟอร์ม AI
GLM-130B: โมเดลภาษาเปิดที่ได้รับการฝึกฝนล่วงหน้าแบบสองภาษา

เฟรมเวิร์ก GLM-130B เป็นโมเดลภาษาใหญ่ที่ได้รับการฝึกฝนล่วงหน้าแบบสองภาษา โดยมีพารามิเตอร์มากกว่า 130 พันล้านตัว สามารถสร้างข้อความเอาต์พุตได้ทั้งในภาษาอังกฤษและภาษาจีน โมเดล GLM-130B เป็นความพยายามในการเปิดแหล่งที่มาของโมเดลภาษาที่มีพารามิเตอร์มากกว่า 100 พันล้านตัว และอภิปรายเกี่ยวกับวิธีการฝึกฝนโมเดลภาษาที่มีขนาดใหญ่เช่นนี้
ในบทความนี้ เราจะพูดถึงเฟรมเวิร์ก GLM-130B ซึ่งพยายามคิดค้นวิธีการฝึกฝนโมเดลภาษาที่มีพารามิเตอร์หลายร้อยพันล้านตัวได้อย่างมีประสิทธิภาพ เราจะดูการทำงานและสถาปัตยกรรมของเฟรมเวิร์ก GLM-130B รวมถึงกระบวนการฝึกฝนและการเลือกการออกแบบที่ช่วยเพิ่มประสิทธิภาพและเสถียรภาพ การทดลองเบื้องต้นในการทดสอบการทำงานของเฟรมเวิร์ก GLM-130B บนมาตรฐานภาษาอังกฤษหลายรายการแสดงให้เห็นว่าโมเดล GLM-130B มีประสิทธิภาพเหนือกว่าโมเดล GPT-3 ที่มีอยู่ในปัจจุบัน
การแนะนำเฟรมเวิร์ก GLM-130B
โมเดลภาษาที่มีขนาดใหญ่และมีพารามิเตอร์มากกว่า 100 พันล้านตัว มีผลการปรับปรุงที่น่าสนใจ โดยเฉพาะโมเดล GPT-3 ซึ่งเป็นหนึ่งในโมเดลที่มีประสิทธิภาพสูงสุด อย่างไรก็ตาม การฝึกฝนและการออกแบบของโมเดล GPT-3 ไม่ได้รับการเปิดเผยต่อสาธารณะ ซึ่งทำให้เกิดความท้าทายในการพัฒนาวิธีการฝึกฝนโมเดลภาษาที่มีขนาดใหญ่เช่นนี้
จุดเด่นนี้ทำให้การแบ่งปันการทำงานและการฝึกฝนของโมเดลภาษาที่มีคุณภาพสูงและมีพารามิเตอร์มากกว่า 100 พันล้านตัว มีความสำคัญอย่างยิ่ง และด้วยการคำนึงถึงข้อกังวลด้านจริยธรรม โมเดล GLM-130B เป็นความพยายามในการฝึกฝนโมเดลภาษาที่มีประสิทธิภาพและเปิดแหล่งที่มา โดยมีพารามิเตอร์มากกว่า 100 พันล้านตัว
ระหว่างการพยายามนี้ ทีมพัฒนาของ GLM-130B สังเกตเห็นว่าการฝึกฝนโมเดลภาษาที่มีขนาดใหญ่ thườngมาพร้อมกับความท้าทายด้านวิศวกรรมและเทคนิคหลายอย่าง ในแง่ของเสถียรภาพและประสิทธิภาพในการฝึกฝน
GLM-130B: สถาปัตยกรรม
ความลำเอียงเชิงอุปนัยของโมเดลการเรียนรู้ของเครื่องจักรถูกอธิบายโดยสถาปัตยกรรมของมัน และไม่น่าแปลกใจที่นักพัฒนาจะไม่สามารถสำรวจการออกแบบสถาปัตยกรรมต่างๆ สำหรับโมเดลภาษาที่มีขนาดใหญ่ เนื่องจากข้อจำกัดด้านการคำนวณและความเป็นไปได้
โมเดลภาษาที่มีขนาดใหญ่ เช่น PaLM, GPT และอื่นๆ มีพารามิเตอร์มากกว่า 100 พันล้านตัว และสร้างขึ้นโดยใช้สถาปัตยกรรม GPT-STYLE ทั่วไปสำหรับการสร้างภาษาที่มีลำดับ ในทางกลับกัน โมเดล GLM-130B สำรวจความเป็นไปได้ในการใช้โมเดลภาษาทั่วไป (GLM) ที่ใช้การกรอกช่องว่างแบบอัตโนมัติเป็นเป้าหมายการฝึกฝน
การปรับขนาดชั้น
หนึ่งในความท้าทายที่นักพัฒนาต้องเผชิญเมื่อฝึกโมเดลภาษาที่มีขนาดใหญ่คือความไม่เสถียรในการฝึกฝน และการใช้การปรับขนาดชั้นที่เหมาะสมอาจช่วยในการฝึกโมเดลภาษาได้
FFNs และการเข้ารหัสตำแหน่ง
โครงข่ายประสาทเทียมการขยายและเข้ารหัสตำแหน่งเป็นสองวิธีที่โมเดล GLM-130B ใช้เพื่อนำเสนอประสิทธิภาพการฝึกฝนที่ดีและเสถียร
GLM-130B: เสถียรภาพในการฝึกฝน
เสถียรภาพในการฝึกฝนเป็นปัจจัยสำคัญที่ส่งผลต่อคุณภาพของโมเดลภาษา และเสถียรภาพนี้ได้รับอิทธิพลอย่างมากจากจำนวนโทเค็นที่โมเดลผ่านไป
การฝึกฝนแบบผสม
เพื่อเพิ่มความแม่นยำในการฝึกฝนและลดการใช้หน่วยความจำ โมเดล GLM-130B ใช้การฝึกฝนแบบผสม โดยใช้ FP16 สำหรับการคำนวณไปข้างหน้าและย้อนกลับ และ FP32 สำหรับน้ำหนักหลักและสถานะของตัวเพิ่มประสิทธิภาพ
GLM-130B: ผลลัพธ์และประสิทธิภาพ
ในการประเมินประสิทธิภาพของโมเดล GLM-130B สำหรับงานภาษาอังกฤษ จะใช้การตั้งค่าเดียวกันกับโมเดลภาษาที่มีอยู่ เช่น PaLM และ GPT-3 และเนื่องจากโมเดล GLM-130B เป็นโมเดลสองภาษา จึงได้รับการประเมินบนมาตรฐานภาษาจีนหลายรายการด้วย
การสร้างภาษา
การทดสอบการสร้างภาษาบนโมเดล GLM-130B จะใช้ข้อมูลที่มีชุด LAMBADA และ Pile
ชุดข้อมูล LAMBADA ใช้เพื่อทดสอบความสามารถในการสร้างคำสุดท้ายของโมเดลภาษา และโมเดล GLM-130B สามารถสร้างคำสุดท้ายได้อย่างแม่นยำถึง 80.2% ในการกำหนดค่าแบบสองภาษา
MMLU หรือการทำความเข้าใจภาษาแบบหลายงาน
MMLU เป็นมาตรฐานที่หลากหลายซึ่งประกอบด้วยคำถามตอบหลายตัวเลือกมากกว่า 50 คำถามเกี่ยวกับความฉลาดและความรู้ของมนุษย์
BIG-Bench หรือการประเมินภาษาแบบไม่จำกัด
BIG-Bench เป็นมาตรฐานที่ท้าทายซึ่งทดสอบความสามารถของโมเดลในการใช้ความรู้ การให้เหตุผล และความเข้าใจทั่วไป
CLUE หรือการประเมินภาษาจีน
CLUE เป็นมาตรฐานที่ใช้ในการประเมินความสามารถของโมเดลภาษาจีน
สรุป
ในบทความนี้ เราได้พูดถึงโมเดล GLM-130B ซึ่งเป็นโมเดลภาษาเปิดที่ได้รับการฝึกฝนล่วงหน้าแบบสองภาษา โดยมีเป้าหมายในการส่งเสริมการวิจัยโมเดลภาษาที่มีความหลากหลาย












