โมเดลและแพลตฟอร์ม AI
BlackMamba : การแนะนำ MoE สำหรับ State Space Models
การพัฒนาโมเดลภาษาขนาดใหญ่ (LLMs) ที่สร้างจากโมเดลทรานส์ฟอร์เมอร์แบบ decoder-only มีบทบาทสำคัญในการเปลี่ยนแปลงโดเมนการประมวลผลภาษาธรรมชาติ (NLP) และการขยายไปสู่การประยุกต์ใช้การเรียนรู้ลึกที่หลากหลาย รวมถึง การเรียนรู้แบบเสริมกำลัง, การวิเคราะห์ข้อมูลชุดเวลา, การประมวลผลภาพ และอื่นๆ อย่างไรก็ตาม แม้ว่าโมเดลเหล่านี้จะมีการปรับขนาดและประสิทธิภาพที่แข็งแกร่ง แต่ก็ยังคงเผชิญกับความจำกัดที่สำคัญ แมคานิซึมของการให้ความสนใจในโมเดลทรานส์ฟอร์เมอร์แบบดั้งเดิมต้องใช้ทรัพยากรการคำนวณจำนวนมากทั้งในระหว่างการอนุมานและการฝึกหัด ซึ่งต้องใช้หน่วยความจำที่เพิ่มขึ้นตามความยาวของลำดับและฟลอปส์ที่เพิ่มขึ้นตามกำลังสอง ซึ่งทำให้ความยาวบริบทของโมเดลถูกจำกัด และทำให้การสร้างแบบอัตโนมัติเป็นไปอย่างมีค่าใช้จ่ายเมื่อขนาดของโมเดลเพิ่มขึ้น และขัดขวางไม่ให้โมเดลเรียนรู้จากกระแสข้อมูลที่ต่อเนื่องหรือประมวลผลลำดับที่ไม่มีขอบเขตได้อย่างมีประสิทธิภาพ
ในช่วงไม่กี่ปีที่ผ่านมา State Space Models (SSMs) ได้แสดงให้เห็นถึงความสามารถและประสิทธิภาพที่น่าประทับใจ โดยแข่งขันกับโมเดลทรานส์ฟอร์เมอร์แบบดั้งเดิมในมาตรฐานการสร้างแบบจำลองขนาดใหญ่ และบรรลุความซับซ้อนที่เป็นเชิงเส้นต่อความยาวของลำดับ และความซับซ้อนที่เป็นเชิงเส้นต่อเวลา ในทางกลับกัน Mixture of Expert (MoE) models ก็ได้รับความนิยมเป็นทางเลือกแทนโมเดลทรานส์ฟอร์เมอร์แบบดั้งเดิม เนื่องจากสามารถลดความซับซ้อนในการอนุมานและค่าใช้จ่ายในการฝึกหัดได้อย่างมีนัยสำคัญ แม้ว่าจะต้องแลกมาด้วยขนาดหน่วยความจำที่ใหญ่ขึ้น การรวมโมเดล Mamba และ MoE จะช่วยให้ได้โมเดล BlackMamba ที่มีประสิทธิภาพสูงกว่าโมเดล Mamba และทรานส์ฟอร์เมอร์แบบดั้งเดิม
BlackMamba : การแนะนำ MoE สำหรับ State Space Models
การก้าวหน้าของโมเดลภาษาขนาดใหญ่ (LLMs) โดยเฉพาะโมเดลทรานส์ฟอร์เมอร์แบบดั้งเดิม มีผลกระทบอย่างมีนัยสำคัญต่อโดเมนการประมวลผลภาษาธรรมชาติ (NLP) และการขยายไปสู่การประยุกต์ใช้การเรียนรู้ลึกที่หลากหลาย รวมถึงการเรียนรู้แบบเสริมกำลัง, การวิเคราะห์ข้อมูลชุดเวลา, การประมวลผลภาพ และอื่นๆ อย่างไรก็ตาม แม้ว่าโมเดลเหล่านี้จะมีการปรับขนาดและประสิทธิภาพที่แข็งแกร่ง แต่ก็ยังคงเผชิญกับความจำกัดที่สำคัญ
ความพยายามที่สำคัญได้ถูกทำขึ้นเพื่อเอาชนะข้อจำกัดเหล่านี้ และความสนใจได้ถูกย้ายไปยังการออกแบบทางเลือกทางสถาปัตยกรรม โดย State Space Models และ MoE models เป็นโครงสร้างที่มีแนวโน้มมากที่สุด โครงสร้างของ State Space Models มีความสอดคล้องกับโครงสร้างของ Recurrent Neural Networks และ Convolutional Neural Networks มากกว่าโครงสร้างของการให้ความสนใจ และได้รับแรงบันดาลใจจากระบบพลวัตที่ต่อเนื่องซึ่งแมปฟังก์ชันหนึ่งมิติผ่านพื้นที่ 潜伏ที่ไม่แสดงออก
BlackMamba : สถาปัตยกรรมและวิธีการ
State Space Models
State Space Models เป็นโมเดลลำดับที่มีความซับซ้อนที่เป็นเชิงเส้นต่อความยาวของลำดับเข้า โครงสร้างของ State Space Models มีความสอดคล้องกับ Recurrent Neural Networks และ Convolutional Neural Networks มากกว่าโครงสร้างของการให้ความสนใจ และได้รับแรงบันดาลใจจากระบบพลวัตที่ต่อเนื่องซึ่งแมปฟังก์ชันหนึ่งมิติผ่านพื้นที่ 潜伏ที่ไม่แสดงออก
Mixture of Expert Models
Mixture of Expert (MoE) models เป็นโมเดลที่สามารถแยกความแตกต่างระหว่างค่าใช้จ่ายในการอนุมานและจำนวนพารามิเตอร์ทั้งหมด โดยการกระตุ้นพารามิเตอร์บางส่วนในช่วงการผ่านไปข้างหน้า แทนที่จะใช้ทุกพารามิเตอร์ โมเดลเหล่านี้จะกำหนดโทเค็นให้กับ MLP ที่เหมาะสม โดยทั่วไปแล้ว MLP แต่ละตัวจะถูกออกแบบมาเพื่อประมวลผลประเภทของข้อมูลเข้าเฉพาะ และมีกลไกการกำหนดเส้นทางที่จะกำหนด MLP ที่เหมาะสมที่สุดสำหรับแต่ละโทเค็น
สถาปัตยกรรม
BlackMamba ใช้โมเดลทรานส์ฟอร์เมอร์แบบดั้งเดิมที่มีบล็อก MLP และบล็อกการให้ความสนใจที่สลับกันไปตามกระแสส่วนที่เหลือ โมเดล Mixture of Expert ส่วนใหญ่จะแทนที่บล็อก MLP ด้วยชั้นผู้เชี่ยวชาญที่กำหนดเส้นทาง ในทางกลับกัน BlackMamba ไม่เพียงแต่แทนที่บล็อก MLP ด้วยชั้นผู้เชี่ยวชาญที่กำหนดเส้นทาง แต่ยังแทนที่บล็อกการให้ความสนใจด้วยชั้น State Space Model ของ Mamba ด้วย
การฝึกอบรมและการรวบรวมข้อมูล
BlackMamba ถูกฝึกอบรมบนชุดข้อมูลที่มีโทเค็นมากกว่า 300 พันล้าน และใช้ฟังก์ชันการกระตุ้น SwiGLU สำหรับ MLP ของผู้เชี่ยวชาญ โมเดลนี้ฝึกอบรมด้วยผู้เชี่ยวชาญ 8 คน ซึ่งเป็นจำนวนผู้เชี่ยวชาญที่เหมาะสมที่สุดระหว่างขนาดหน่วยความจำและค่าใช้จ่ายในการอนุมานของโมเดล ชุดข้อมูลที่ใช้ในการฝึกอบรม BlackMamba ประกอบด้วยชุดข้อมูลที่มีอยู่แล้วและเปิดเผยต่อสาธารณะ รวมถึง Starcoder, SlimPajama, Pile และอื่นๆ
BlackMamba : ผลลัพธ์
เพื่อให้แน่ใจว่าการเปรียบเทียบระหว่าง Mamba และ BlackMamba เป็นไปอย่างยุติธรรม ทั้งสองโมเดลถูกฝึกอบรมด้วยพารามิเตอร์การฝึกอบรมที่เหมือนกันบนชุดข้อมูลเดียวกัน BlackMamba สามารถเอาชนะ Mamba และโมเดลทรานส์ฟอร์เมอร์แบบดั้งเดิมทั้งในด้านการฝึกอบรม FLOPs และการอนุมาน
ความคิดสุดท้าย
ในบทความนี้ เราได้พูดถึง BlackMamba ซึ่งเป็นสถาปัตยกรรมใหม่ที่รวม Mamba State Space Model และ MoE models เพื่อนำประโยชน์ของทั้งสองโครงสร้างมาใช้ การทดลองบน BlackMamba ได้แสดงให้เห็นว่าสามารถเอาชนะ Mamba และทรานส์ฟอร์เมอร์แบบดั้งเดิมทั้งในด้านการฝึกอบรม FLOPs และการอนุมาน ประสิทธิภาพที่น่าประทับใจของ BlackMamba แสดงให้เห็นว่าสามารถรวมความสามารถของ Mamba และ MoE ได้อย่างดีเยี่ยม โดยนำการอนุมานที่รวดเร็วและราคาไม่แพงมาจาก MoE และการสร้างที่มีความซับซ้อนที่เป็นเชิงเส้นมาจาก Mamba












