โมเดลและแพลตฟอร์ม AI

GLM-130B: โมเดลภาษาเปิดที่ได้รับการฝึกฝนล่วงหน้าแบบสองภาษา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เฟรมเวิร์ก GLM-130B เป็นโมเดลภาษาใหญ่ที่ได้รับการฝึกฝนล่วงหน้าแบบสองภาษา โดยมีพารามิเตอร์มากกว่า 130 พันล้านตัว สามารถสร้างข้อความเอาต์พุตได้ทั้งในภาษาอังกฤษและภาษาจีน โมเดล GLM-130B เป็นความพยายามในการเปิดแหล่งที่มาของโมเดลภาษาที่มีพารามิเตอร์มากกว่า 100 พันล้านตัว และอภิปรายเกี่ยวกับวิธีการฝึกฝนโมเดลภาษาที่มีขนาดใหญ่เช่นนี้

ในบทความนี้ เราจะพูดถึงเฟรมเวิร์ก GLM-130B ซึ่งพยายามคิดค้นวิธีการฝึกฝนโมเดลภาษาที่มีพารามิเตอร์หลายร้อยพันล้านตัวได้อย่างมีประสิทธิภาพ เราจะดูการทำงานและสถาปัตยกรรมของเฟรมเวิร์ก GLM-130B รวมถึงกระบวนการฝึกฝนและการเลือกการออกแบบที่ช่วยเพิ่มประสิทธิภาพและเสถียรภาพ การทดลองเบื้องต้นในการทดสอบการทำงานของเฟรมเวิร์ก GLM-130B บนมาตรฐานภาษาอังกฤษหลายรายการแสดงให้เห็นว่าโมเดล GLM-130B มีประสิทธิภาพเหนือกว่าโมเดล GPT-3 ที่มีอยู่ในปัจจุบัน

การแนะนำเฟรมเวิร์ก GLM-130B

โมเดลภาษาที่มีขนาดใหญ่และมีพารามิเตอร์มากกว่า 100 พันล้านตัว มีผลการปรับปรุงที่น่าสนใจ โดยเฉพาะโมเดล GPT-3 ซึ่งเป็นหนึ่งในโมเดลที่มีประสิทธิภาพสูงสุด อย่างไรก็ตาม การฝึกฝนและการออกแบบของโมเดล GPT-3 ไม่ได้รับการเปิดเผยต่อสาธารณะ ซึ่งทำให้เกิดความท้าทายในการพัฒนาวิธีการฝึกฝนโมเดลภาษาที่มีขนาดใหญ่เช่นนี้

จุดเด่นนี้ทำให้การแบ่งปันการทำงานและการฝึกฝนของโมเดลภาษาที่มีคุณภาพสูงและมีพารามิเตอร์มากกว่า 100 พันล้านตัว มีความสำคัญอย่างยิ่ง และด้วยการคำนึงถึงข้อกังวลด้านจริยธรรม โมเดล GLM-130B เป็นความพยายามในการฝึกฝนโมเดลภาษาที่มีประสิทธิภาพและเปิดแหล่งที่มา โดยมีพารามิเตอร์มากกว่า 100 พันล้านตัว

ระหว่างการพยายามนี้ ทีมพัฒนาของ GLM-130B สังเกตเห็นว่าการฝึกฝนโมเดลภาษาที่มีขนาดใหญ่ thườngมาพร้อมกับความท้าทายด้านวิศวกรรมและเทคนิคหลายอย่าง ในแง่ของเสถียรภาพและประสิทธิภาพในการฝึกฝน

GLM-130B: สถาปัตยกรรม

ความลำเอียงเชิงอุปนัยของโมเดลการเรียนรู้ของเครื่องจักรถูกอธิบายโดยสถาปัตยกรรมของมัน และไม่น่าแปลกใจที่นักพัฒนาจะไม่สามารถสำรวจการออกแบบสถาปัตยกรรมต่างๆ สำหรับโมเดลภาษาที่มีขนาดใหญ่ เนื่องจากข้อจำกัดด้านการคำนวณและความเป็นไปได้

โมเดลภาษาที่มีขนาดใหญ่ เช่น PaLM, GPT และอื่นๆ มีพารามิเตอร์มากกว่า 100 พันล้านตัว และสร้างขึ้นโดยใช้สถาปัตยกรรม GPT-STYLE ทั่วไปสำหรับการสร้างภาษาที่มีลำดับ ในทางกลับกัน โมเดล GLM-130B สำรวจความเป็นไปได้ในการใช้โมเดลภาษาทั่วไป (GLM) ที่ใช้การกรอกช่องว่างแบบอัตโนมัติเป็นเป้าหมายการฝึกฝน

การปรับขนาดชั้น

หนึ่งในความท้าทายที่นักพัฒนาต้องเผชิญเมื่อฝึกโมเดลภาษาที่มีขนาดใหญ่คือความไม่เสถียรในการฝึกฝน และการใช้การปรับขนาดชั้นที่เหมาะสมอาจช่วยในการฝึกโมเดลภาษาได้

FFNs และการเข้ารหัสตำแหน่ง

โครงข่ายประสาทเทียมการขยายและเข้ารหัสตำแหน่งเป็นสองวิธีที่โมเดล GLM-130B ใช้เพื่อนำเสนอประสิทธิภาพการฝึกฝนที่ดีและเสถียร

GLM-130B: เสถียรภาพในการฝึกฝน

เสถียรภาพในการฝึกฝนเป็นปัจจัยสำคัญที่ส่งผลต่อคุณภาพของโมเดลภาษา และเสถียรภาพนี้ได้รับอิทธิพลอย่างมากจากจำนวนโทเค็นที่โมเดลผ่านไป

การฝึกฝนแบบผสม

เพื่อเพิ่มความแม่นยำในการฝึกฝนและลดการใช้หน่วยความจำ โมเดล GLM-130B ใช้การฝึกฝนแบบผสม โดยใช้ FP16 สำหรับการคำนวณไปข้างหน้าและย้อนกลับ และ FP32 สำหรับน้ำหนักหลักและสถานะของตัวเพิ่มประสิทธิภาพ

GLM-130B: ผลลัพธ์และประสิทธิภาพ

ในการประเมินประสิทธิภาพของโมเดล GLM-130B สำหรับงานภาษาอังกฤษ จะใช้การตั้งค่าเดียวกันกับโมเดลภาษาที่มีอยู่ เช่น PaLM และ GPT-3 และเนื่องจากโมเดล GLM-130B เป็นโมเดลสองภาษา จึงได้รับการประเมินบนมาตรฐานภาษาจีนหลายรายการด้วย

การสร้างภาษา

การทดสอบการสร้างภาษาบนโมเดล GLM-130B จะใช้ข้อมูลที่มีชุด LAMBADA และ Pile

ชุดข้อมูล LAMBADA ใช้เพื่อทดสอบความสามารถในการสร้างคำสุดท้ายของโมเดลภาษา และโมเดล GLM-130B สามารถสร้างคำสุดท้ายได้อย่างแม่นยำถึง 80.2% ในการกำหนดค่าแบบสองภาษา

MMLU หรือการทำความเข้าใจภาษาแบบหลายงาน

MMLU เป็นมาตรฐานที่หลากหลายซึ่งประกอบด้วยคำถามตอบหลายตัวเลือกมากกว่า 50 คำถามเกี่ยวกับความฉลาดและความรู้ของมนุษย์

BIG-Bench หรือการประเมินภาษาแบบไม่จำกัด

BIG-Bench เป็นมาตรฐานที่ท้าทายซึ่งทดสอบความสามารถของโมเดลในการใช้ความรู้ การให้เหตุผล และความเข้าใจทั่วไป

CLUE หรือการประเมินภาษาจีน

CLUE เป็นมาตรฐานที่ใช้ในการประเมินความสามารถของโมเดลภาษาจีน

สรุป

ในบทความนี้ เราได้พูดถึงโมเดล GLM-130B ซึ่งเป็นโมเดลภาษาเปิดที่ได้รับการฝึกฝนล่วงหน้าแบบสองภาษา โดยมีเป้าหมายในการส่งเสริมการวิจัยโมเดลภาษาที่มีความหลากหลาย

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล