โมเดลและแพลตฟอร์ม AI
โมเดล LLM ที่ทรงพลังที่สุดแบบโอเพ่นซอร์ส: Meta LLAMA 3.1-405B
Llama 3.1-405B ที่พัฒนาโดย Meta AI เป็นตัวอย่างของความก้าวหน้าในโมเดลภาษาแบบโอเพ่นซอร์ส โดยมีพารามิเตอร์ 405 พันล้าน ทำให้เป็นโมเดลภาษาที่มีขนาดใหญ่ที่สุดที่มีอยู่ในขณะนี้ และสามารถแข่งขันกับโมเดลที่มีลิขสิทธิ์ได้
คุณสมบัติหลัก:
- 405 พันล้านพารามิเตอร์
- ความยาวบริบท 128K โทเค็น
- รองรับหลายภาษา (8 ภาษา)
- แบบจำลองที่ปรับให้เหมาะสม มีให้เลือก
- โอเพ่นซอร์ส พร้อมใบอนุญาตที่อนุญาตให้ใช้ได้
การเปิดตัวโมเดลที่ทรงพลังในโดเมนโอเพ่นซอร์สเป็นการเปลี่ยนแปลงเกมที่ทำให้สามารถเข้าถึงความสามารถ AI ที่ทันสมัยได้ และส่งเสริมนวัตกรรมในอุตสาหกรรม
สถาปัตยกรรมและเทรนโมเดล
กระบวนการเริ่มต้นด้วยการแปลงโทเค็นข้อความเข้าเป็นโทเค็น एमเบดดิ้ง จากนั้นผ่านหลายชั้นของการดูแลตนเองและเครือข่ายฟีดฟอร์เวิร์ด ทำให้โมเดลสามารถจับข้อมูลที่ซับซ้อนและความสัมพันธ์ในข้อความได้ เมื่อใช้กลไกการถอดรหัสแบบอัตโนมัติในการสร้างโทเค็นข้อความเอาต์พุต ทำให้กระบวนการเสร็จสมบูรณ์

-
การดูแลตนเองแบบกลุ่ม (GQA)
Llama 3.1 ใช้การดูแลตนเองแบบกลุ่ม ซึ่งเป็นเทคนิคการปรับให้เหมาะสมที่สำคัญที่ไม่ได้กล่าวถึงในคำตอบก่อนหน้านี้ มาทำความเข้าใจกันอย่างละเอียด:
การดูแลตนเองแบบกลุ่ม (GQA) เป็นรูปแบบหนึ่งของการดูแลตนเองแบบหลายหัวที่มีจุดมุ่งหมายเพื่อลดค่าใช้จ่ายในการคำนวณและใช้หน่วยความจำระหว่างการอนุมาน โดยเฉพาะสำหรับลำดับที่ยาว ในโมเดล Llama 3.1 405B GQA ถูกนำไปใช้ด้วยหัวคีย์-ค่า 8 หัว
นี่คือวิธีการทำงานของ GQA:
- แทนที่จะมีการฉายภาพคีย์และค่าสำหรับหัวการดูแลตนเองแต่ละหัว GQA จะจัดกลุ่มหลายหัวการดูแลตนเองให้ใช้คีย์และค่าหัวเดียวกัน
- การแบ่งกลุ่มนี้ช่วยลดจำนวนพารามิเตอร์ในฉายภาพคีย์และค่า ซึ่งนำไปสู่ขนาดโมเดลที่เล็กกว่าและความเร็วในการอนุมานที่เร็วขึ้น
- การคำนวณการดูแลตนเองสามารถแสดงเป็น:
การดูแลตนเอง(Q, K, V) = softmax(QK^T / sqrt(d_k))Vโดยที่ Q ถูกแบ่งออกเป็น g กลุ่ม และ K และ V มีหัวน้อยกว่า Q
ประโยชน์ของ GQA ใน Llama 3.1 405B รวมถึง:
- การลดขนาดหน่วยความจำ: การมีคีย์และค่าน้อยกว่าหมายถึงการใช้หน่วยความจำน้อยกว่าสำหรับการจัดเก็บพารามิเตอร์ของโมเดล
- การเพิ่มความเร็วในการอนุมาน: ด้วยการคำนวณน้อยกว่าสำหรับการฉายภาพคีย์และค่า ความเร็วในการอนุมานจึงดีขึ้น
- การรักษาความสามารถ: แม้ว่าจะมีการลดจำนวนพารามิเตอร์ GQA ก็สามารถรักษาความสามารถที่เทียบเท่ากับการดูแลตนเองแบบหลายหัวมาตรฐานในหลายงานได้
-
การเทรนแบบสองขั้นตอนสำหรับบริบทที่ขยาย
บทความกล่าวถึงกระบวนการเทรนแบบสองขั้นตอนเพื่อให้ได้หน้าต่างบริบท 128K โทเค็น ซึ่งเป็นประเด็นสำคัญของความสามารถ Llama 3.1 405B:
ขั้นตอนที่ 1: การเทรนเบื้องต้นด้วย 8K โทเค็น
- โมเดลถูกเทรนเบื้องต้นด้วยลำดับที่มีความยาวสูงสุด 8K โทเค็น
- ขั้นตอนนี้ช่วยให้โมเดลเรียนรู้ความเข้าใจและความสามารถในการสร้างภาษาโดยทั่วไป
ขั้นตอนที่ 2: การเทรนต่อเนื่องเพื่อขยายบริบท
- หลังจากการเทรนเบื้องต้น โมเดลจะผ่านการเทรนต่อเนื่องเพื่อเพิ่มความยาวบริบทเป็น 128K โทเค็น
- ขั้นตอนนี้เกี่ยวข้องกับการออกแบบการเทรนที่ซับซ้อนเพื่อช่วยให้โมเดลทั่วไปสำหรับลำดับที่ยาวโดยไม่สูญเสียความสามารถในการจัดการบริบทที่สั้น
-
ความสามารถหลายรูปแบบ
ในขณะที่คำตอบก่อนหน้านี้กล่าวถึงความสามารถหลายรูปแบบ เราสามารถขยายความเข้าใจได้:
แนวทางแบบประกอบ:
- Llama 3.1 405B ใช้เครื่องมือแปลงข้อมูลสำหรับโหมดต่างๆ (เช่น ภาพ, เสียง)
- เครื่องมือเหล่านี้แปลงข้อมูลจากโหมดต่างๆ ให้เป็นพื้นที่การฝังที่ใช้ร่วมกันซึ่งโมเดลภาษาสามารถเข้าใจได้
การผสานกับโมเดลภาษา:
- เอาต์พุตจากเครื่องมือแปลงข้อมูลเหล่านี้ถูกส่งเข้าโมเดลภาษาหลัก
- สิ่งนี้ช่วยให้ Llama 3.1 405B สามารถประมวลผลและเข้าใจข้อมูลจากโหมดต่างๆ ได้พร้อมๆ กัน ทำให้สามารถทำงานที่เกี่ยวข้องกับหลายโหมดได้
กลไกการดูแลตนเองแบบตัดข้าม:
- Llama 3.1 405B มีแนวโน้มที่จะใช้กลไกการดูแลตนเองแบบตัดข้ามเพื่อจัดการกับการผสานระหว่างโหมดต่างๆ
- กลไกเหล่านี้ช่วยให้โมเดลสามารถดูแลข้อมูลที่เกี่ยวข้องจากโหมดต่างๆ ระหว่างการสร้างข้อความหรือทำงานอื่นๆ
ความสามารถหลายรูปแบบของ Llama 3.1 405B เปิดโอกาสให้ใช้งานในหลายๆ ด้าน เช่น:
- การสร้างคำบรรยายภาพและตอบคำถามภาพ
- การถอดเสียงเป็นข้อความพร้อมความเข้าใจบริบท
- งานที่ต้องใช้เหตุผลหลายรูปแบบที่รวมข้อความ, ภาพ และอาจรวมข้อมูลอื่นๆ
รายละเอียดการเทรน
- เทรนด้วยโทเค็นมากกว่า 15 ล้านล้าน
- ใช้คลัสเตอร์ GPU ที่สร้างเองพร้อม 39.3 ล้านชั่วโมง GPU สำหรับโมเดล 405B
- คัดเลือกชุดข้อมูลที่หลากหลายสำหรับการรองรับหลายภาษา
สำหรับเวอร์ชันที่ปรับให้เหมาะสม:
- เทรนเพิ่มเติมบนชุดข้อมูลคำแนะนำที่มีอยู่สาธารณะ
- มีตัวอย่างที่สร้างขึ้นมากกว่า 25 ล้าน ตัวอย่าง
- การเทรนแบบดูแลตนเอง (SFT) และ การเรียนรู้แบบเสริมด้วยข้อเสนอแนะจากมนุษย์ (RLHF)
มาตรฐานการทำงาน
ตารางเปรียบเทียบ Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni และ Claude 3.5 Sonnet โดยใช้มาตรฐานทั่วไป เช่น MMLU และ IFEval สำหรับงานทั่วไป, HumanEval และ GSM8K สำหรับงานโค้ด และ ARC Challenge สำหรับงานเหตุผล มีผลลัพธ์ที่แสดงถึงความสามารถของโมเดลในการเข้าใจและสร้างข้อความเหมือนมนุษย์ การแก้ปัญหาที่ซับซ้อน และการทำงานโค้ด














