พื้นฐาน AI
โมเดล Mixture-of-Experts คืออะไร? คำอธิบาย Sparse AI
โมเดล mixture-of-experts (MoE) ประกอบด้วยเครือข่ายผู้เชี่ยวชาญหลายตัวที่มีพารามิเตอร์และตัวเราท์เตอร์ที่เลือกชุดย่อยเล็ก ๆ สำหรับแต่ละอินพุตหรือโทเคน เนื่องจากมีเพียงผู้เชี่ยวชาญที่ถูกเลือกเท่านั้นที่ทำงาน โมเดลจึงสามารถเพิ่มความจุพารามิเตอร์รวมได้โดยไม่ต้องเปิดใช้งานทุกพารามิเตอร์ในแต่ละการส่งผ่าน
การเปิดใช้งานแบบกระจายไม่ทำให้การคำนวณหรือหน่วยความจำเป็นฟรี ระบบ MoE ต้องเก็บและเคลื่อนย้ายพารามิเตอร์จำนวนมาก, สมดุลโทเคนระหว่างผู้เชี่ยวชาญ, ประสานอุปกรณ์, และป้องกันความไม่เสถียรของการเราท์ จำนวนพารามิเตอร์ทั้งหมดและจำนวนพารามิเตอร์ที่ทำงานจริงอธิบายต้นทุนที่แตกต่างกัน
ประเด็นสำคัญ
- เราท์เตอร์คำนวณคะแนนของผู้เชี่ยวชาญและส่งโทเคนไปยังผู้เชี่ยวชาญที่อยู่ในอันดับบน‑k
- ข้อจำกัดความจุและเป้าหมายการกระจายโหลดป้องกันไม่ให้ผู้เชี่ยวชาญบางคนรับโทเคนทั้งหมด
- การคำนวณแบบกระจายสามารถเพิ่มความจุต่อการดำเนินการได้ แต่เพิ่มความซับซ้อนของการสื่อสารและหน่วยความจำ
- ประเมินคุณภาพ, การคำนวณที่ทำงาน, ความหน่วง, หน่วยความจำ, พฤติกรรมการเราท์, และโครงสร้างการให้บริการร่วมกัน

ชั้นเราท์เตอร์และผู้เชี่ยวชาญ
ในโมเดล MoE ของ transformer ชั้นฟีดฟอร์เวิร์ดที่เลือกมักจะถูกแทนที่ด้วยเครือข่ายฟีดฟอร์เวิร์ดของผู้เชี่ยวชาญ เราท์เตอร์ให้คะแนนแต่ละโทเคนและส่งไปยังผู้เชี่ยวชาญหนึ่งหรือหลายคน; ผลลัพธ์ของพวกเขาถูกให้ค่าน้ำหนักและส่งกลับไปยังสตรีมเรซิดวลหลัก
การใส่ความสนใจอาจยังคงเป็นแบบหนาแน่น ตัว transformer รอบ ๆ จึงใช้การผสมระหว่างการคำนวณร่วมและการคำนวณตามเงื่อนไขของผู้เชี่ยวชาญ
ความจุและการกระจายโหลด
แต่ละผู้เชี่ยวชาญสามารถประมวลผลโทเคนจำนวนจำกัดในแต่ละแบช หากโทเคนจำนวนมากเลือกผู้เชี่ยวชาญเดียวกัน ระบบบางอย่างจะทำการตัดหรือเปลี่ยนเส้นทางส่วนเกิน การสูญเสียเสริมช่วยกระตุ้นการใช้ที่สมดุล ในขณะที่สัญญาณรบกวนของการเราท์สามารถเพิ่มการสำรวจระหว่างการฝึก
การกระจายการจราจรอย่างเท่าเทียมไม่ได้หมายถึงการเชี่ยวชาญที่มีความหมาย ตรวจสอบการใช้ผู้เชี่ยวชาญตามโดเมน, ตำแหน่ง, และงาน, แต่หลีกเลี่ยงการกำหนดบทบาทที่อ่านออกได้โดยมนุษย์โดยไม่มีหลักฐานเชิงสาเหตุ
ทำไมการให้บริการจึงยาก
แม้จะมีเพียงชุดย่อยเท่านั้นที่ทำงาน แต่พารามิเตอร์ของผู้เชี่ยวชาญทั้งหมดอาจต้องอยู่ในหน่วยความจำของตัวเร่งความเร็ว การขนานของผู้เชี่ยวชาญส่งโทเคนระหว่างอุปกรณ์ ทำให้แบนด์วิธของเครือข่ายและการสื่อสารแบบ all‑to‑all มีความสำคัญ แบชขนาดเล็กอาจทำให้ผู้เชี่ยวชาญไม่ได้ใช้เต็มที่
การควบคุมจำนวนบิต, แคช, การทำแบช, และการเราท์ที่คำนึงถึงโทโพโลจีสามารถช่วยได้ เปรียบเทียบ MoE กับทางเลือกแบบหนาแน่นโดยพิจารณาคุณภาพผลลัพธ์, บริบท, ฮาร์ดแวร์, และเป้าหมายระดับการให้บริการ—not only active FLOPs
สิ่งที่ MoE ทำและไม่ได้ทำให้เกิด
MoE ให้การคำนวณตามเงื่อนไขและความจุ แต่ไม่รับประกันความถูกต้องของข้อมูล, การให้เหตุผลแบบโมดูล, ความสามารถในการอธิบาย, หรือการมีตัวแทนอิสระหลายตัว เครือข่ายผู้เชี่ยวชาญถูกเรียนรู้ร่วมกันและอาจแชร์คุณลักษณะที่กระจาย
MoE ทำหน้าที่เสริม generative-AI หลังการฝึกและการบีบอัด ควรตรวจสอบการเปลี่ยนแปลงของการเราท์, ความหน่วงส่วนท้าย, ความล้มเหลวของผู้เชี่ยวชาญ, หน่วยความจำ, และคุณภาพของโดเมนหลังการปรับใช้
การเราท์, ความจุของผู้เชี่ยวชาญ, และการคำนวณแบบกระจาย
ชั้น mixture-of-experts ประกอบด้วยเครือข่ายผู้เชี่ยวชาญหลายตัวและเราท์เตอร์ที่กำหนดแต่ละโทเคนให้กับชุดย่อยเล็ก ๆ ส่วนใหญ่คือผู้เชี่ยวชาญหนึ่งหรือสองคน โมเดลสามารถเก็บพารามิเตอร์จำนวนมากพร้อมเปิดใช้งานเพียงส่วนเล็ก ๆ ต่อโทเคน การเปิดใช้งานแบบกระจายลดการคำนวณเมื่อเทียบกับโมเดลหนาแน่นที่มีจำนวนพารามิเตอร์รวมเท่ากัน แต่ไม่เทียบกับโมเดลที่เล็กกว่าแต่ละตัว
เราท์เตอร์สร้างคะแนนของผู้เชี่ยวชาญ, ใช้กฎการคัดเลือก, และส่งตัวแทนโทเคนไปยังผู้เชี่ยวชาญแต่ละตัว ผู้เชี่ยวชาญแต่ละคนมีความจุจำกัด หากโทเคนจำนวนมากเลือกผู้เชี่ยวชาญเดียว ระบบต้องตัด, เปลี่ยนเส้นทาง, หรือเติมโทเคน ปัจจัยเช่น capacity factor, การสูญเสียเสริมเพื่อสมดุล, สัญญาณรบกวนของเราท์, และการขนานของผู้เชี่ยวชาญทำให้ต้องแลกเปลี่ยนคุณภาพกับการใช้และการสื่อสาร
ผู้เชี่ยวชาญไม่ได้รับประกันว่าจะสอดคล้องกับแนวคิดหรือโดเมนของมนุษย์ การเชี่ยวชาญเกิดจากการปรับแต่งและอาจกระจาย, ไม่เสถียร, หรือขึ้นกับโทเคน การอ้างอิงความสามารถในการอธิบายควรตรวจสอบการเราท์ในหลายชั้นและบริบทโดยใช้การแทรกแซง ไม่ใช่เพียงการตั้งป้ายจากโทเคนที่ได้คะแนนสูงไม่กี่ตัว
การฝึกและการให้บริการโมเดล MoE แบบกระจาย
การฝึกรวมการขนานของข้อมูล, เทนเซอร์, พายป์ไลน์, และผู้เชี่ยวชาญ โทเคนมักต้องเดินทางระหว่างตัวเร่งความเร็วเพื่อเข้าถึงผู้เชี่ยวชาญที่เลือก ทำให้การสื่อสารแบบ all‑to‑all สามารถลบความประหยัดเชิงคณิตศาสตร์ การวางตำแหน่ง, การจัดรูปแบบแบช, แบนด์วิธของเครือข่าย, การบรรจุโทเคน, และการทำให้การสื่อสารทับซ้อนกับการคำนวณเป็นตัวเลือกสำคัญในการออกแบบระบบ
ความไม่สมดุลของโหลดทำให้ผู้เชี่ยวชาญบางตัวอยู่ในสภาพว่างและอุปกรณ์บางตัวทำงานหนัก การสูญเสียเสริมกระตุ้นการเราท์ที่สมดุลแต่บางครั้งอาจขัดขวางเป้าหมายการเรียนรู้หลัก วิธีใหม่ ๆ อาจปรับอคติหรือไดนามิกของการเราท์ ควรตรวจสอบจำนวนโทเคนต่อผู้เชี่ยวชาญ, โทเคนที่ถูกตัด, เอนโทรปี, เกรเดียนท์, และเวลาอุปกรณ์แทนการพึ่งพาการสูญเสียรวมเท่านั้น
การให้บริการยากเพราะพารามิเตอร์ของผู้เชี่ยวชาญทั้งหมดอาจต้องพร้อมใช้งานแม้ว่าแต่ละโทเคนจะใช้เพียงไม่กี่ตัว ความจุหน่วยความจำ, การเชื่อมต่อ, การทำแบช, พฤติกรรมแคช, และความแปรปรวนของการเราท์ส่งผลต่อความหน่วง การควบคุมจำนวนบิตและการถ่ายโอนผู้เชี่ยวชาญช่วยในบางกรณีแต่ก็อาจเพิ่มการถ่ายโอน ควรทำเบนช์มาร์คโมเดลและโทโพโลจีฮาร์ดแวร์อย่างแม่นยำ
คุณภาพ, การประเมินผล, และการแลกเปลี่ยนในการปรับใช้
ประเมินโมเดล MoE เทียบกับฐานหนาแน่นโดยคำนึงถึงคุณภาพที่เทียบกัน, การคำนวณในการฝึก, การคำนวณในการสรุป, หน่วยความจำ, ความหน่วง, และต้นทุน การเปรียบเทียบตามจำนวนพารามิเตอร์อย่างเดียวอาจทำให้เข้าใจผิด ควรทดสอบบริบทยาว, ภาษา, โดเมน, โทเคนหายาก, และพรอมต์ที่เป็นศัตรู เพราะพฤติกรรมของเราท์อาจเปลี่ยนตามการกระจายและทำให้ความสามารถไม่สม่ำเสมอ
การเราท์นำมาซึ่งโหมดความล้มเหลวเพิ่มเติม: การล่มของผู้เชี่ยวชาญ, การเชี่ยวชาญที่ไม่เสถียร, การตัดโทเคน, การหยุดทำงานที่สัมพันธ์กัน, และความอ่อนไหวต่อการจัดรูปแบบแบช การประเมินแบบกำหนดค่าควบคุมเวลารันและการตั้งค่าการเราท์ การตรวจสอบการทำงานควรรวมการใช้ผู้เชี่ยวชาญและสุขภาพการสื่อสารเพื่อไม่ให้ปัญหาระบบถูกเข้าใจผิดว่าเป็นความแปรปรวนของโมเดลทั่วไป
MoE มีความน่าสนใจเมื่อการขยายความจุรวมเป็นสิ่งสำคัญและโครงสร้างพื้นฐานสามารถรองรับการดำเนินการแบบกระจายแบบสแปร์ส การใช้โมเดลหนาแน่นอาจยังคงง่ายและเร็วกว่าในกรณีแบชเล็ก, อุปกรณ์ขอบ, หรือการเชื่อมต่อที่จำกัด สถาปัตยกรรมนี้เป็นการแลกเปลี่ยนของระบบ ไม่ใช่การทดแทนที่ทั่วถึงสำหรับ transformer แบบหนาแน่น
ตัวอย่างการทำงาน: การประเมินโมเดลภาษา MoE
ทีมวิจัยเปรียบเทียบ MoE transformer กับฐานหนาแน่นโดยใช้โทเคนการฝึกที่เทียบกันและมุมมองทรัพยากรหลายด้าน: พารามิเตอร์ที่ทำงานต่อโทเคน, พารามิเตอร์ทั้งหมด, หน่วยความจำของตัวเร่งความเร็ว, ปริมาณการจราจรของเครือข่าย, เวลาในการฝึก, อัตราการสรุปผล, และความหน่วง ระบบบันทึกความน่าจะเป็นของเราท์, โทเคนต่อผู้เชี่ยวชาญ, ส่วนเกิน, โทเคนที่ถูกตัด, และการสูญเสียเสริมตามชั้น, ภาษา, และโดเมน จำนวนการคำนวณเชิงคณิตศาสตร์ที่ต่ำกว่าไม่ได้ถือว่าเป็นประสิทธิภาพหากการสื่อสารหรือการใช้ทรัพยากรไม่เต็มที่ทำให้ต้นทุนรวมเพิ่มขึ้น
การประเมินคุณภาพครอบคลุมความรู้, การให้เหตุผล, บริบทยาว, โดเมนหายาก, งานหลายภาษา, ความปลอดภัย, และการสอบเทียบ ทีมปรับเปลี่ยนการจัดรูปแบบแบชและการกระจายพรอมต์เพื่อดูว่าการเราท์และผลลัพธ์เปลี่ยนแปลงโดยไม่คาดคิดหรือไม่ การทำลายผู้เชี่ยวชาญเชิงสาเหตุทดสอบข้ออ้างการเชี่ยวชาญ ในขณะเดียวกันความล้มเหลวของผู้เชี่ยวชาญและการเสื่อมสภาพของเครือข่ายเปิดเผยความทนทาน ผลลัพธ์ถูกเปรียบเทียบที่เป้าหมายระดับการให้บริการเดียวกัน เพราะโมเดลที่ทำงานดีเฉพาะในแบชขนาดใหญ่อาจไม่เหมาะกับการใช้งานแบบโต้ตอบ
สำหรับการปรับใช้ ผู้เชี่ยวชาญถูกจัดตำแหน่งเพื่อให้การจราจร all‑to‑all ต่ำที่สุด น้ำหนักจะถูกควบคุมจำนวนบิตหลังจากตรวจสอบความอ่อนไหวต่อผู้เชี่ยวชาญแต่ละคน และการตรวจสอบเวลารันจะตรวจจับความไม่สมดุลหรืออุปกรณ์ที่ไม่พร้อม ความตั้งค่าเกี่ยวกับความจุและการเราท์จะเวอร์ชันพร้อมโมเดล ทีมเลือกใช้ MoE ก็ต่อเมื่อความจุพารามิเตอร์ที่เพิ่มขึ้นทำให้ภารกิจที่ต้องการดีพอที่จะชดเชยความซับซ้อนของหน่วยความจำและระบบกระจาย มิฉะนั้น โมเดลหนาแน่นอาจถูกเลือกเพราะราคาถูกกว่า, ใช้งานง่ายกว่า, และคาดการณ์ได้ง่ายกว่า
รายการตรวจสอบการนำไปใช้เชิงปฏิบัติ
แปลงแนวคิดให้เป็นกระบวนการทำงานที่มีขอบเขตและทดสอบได้: token → router → top‑k → experts → combine → output. กำหนดเจ้าของที่รับผิดชอบ, บันทึกข้อมูลและการพึ่งพา, สร้างฐานเปรียบเทียบง่าย, ตั้งเกณฑ์การยอมรับและหยุด, ทดสอบความล้มเหลวที่เป็นตัวแทน, และกำหนดการตรวจสอบ, การย้อนกลับ, และการรีวิวก่อนขยายขอบเขต บันทึกเวอร์ชันและสมมติฐานเพื่อให้ทีมอื่นสามารถทำซ้ำผลลัพธ์และเข้าใจการเปลี่ยนแปลงได้
ก่อนเปิดใช้งาน ให้ดำเนินการตรวจสอบความพร้อมที่บันทึกไว้กับผู้ที่สร้าง, ดำเนินการ, ปกป้อง, และได้รับผลกระทบจากระบบ ทดสอบกรณีปกติ, เงื่อนไขขอบเขต, ความล้มเหลวของการพึ่งพา, และการใช้ผิดวิธี; เก็บรักษาหลักฐานและความเสี่ยงที่ยังไม่ได้แก้ไข กำหนดว่าใครสามารถอนุมัติการปล่อย, เปลี่ยนเกณฑ์, แทนที่ผลลัพธ์, หรือหยุดการทำงานได้ ทบทวนการตัดสินใจหลังจากได้รับข้อมูลจากโลกจริง เพราะการทดลองที่ประสบความสำเร็จทางเทคนิคไม่ได้รับประกันประสิทธิภาพที่เชื่อถือได้เมื่อขยายขนาด
- CAPACITY: พารามิเตอร์ผู้เชี่ยวชาญที่จัดเก็บจำนวนมาก
- ACTIVE COMPUTE: ชุดย่อยเล็ก ๆ ต่อโทเคน
- SYSTEM COST: หน่วยความจำ, การส่งต่อ, การสมดุล, และความหน่วง
คำถามที่พบบ่อย
ผู้เชี่ยวชาญ MoE เป็นโมเดลแยกต่างหากหรือไม่?
โดยทั่วไปไม่ใช่ พวกมันเป็นเครือข่ายย่อยภายในโมเดลที่ฝึกแล้วหนึ่งเดียว เชื่อมต่อด้วยเราท์เตอร์และชั้นที่ใช้ร่วมกัน การเชี่ยวชาญที่เรียนรู้ได้อาจไม่สอดคล้องกับโดเมนที่คนมักเข้าใจโดยตรง
ทำไม MoE ถึงมีพารามิเตอร์จำนวนมากแต่การคำนวณระดับปานกลาง?
เพราะมีเพียงชุด top‑k เล็ก ๆ ของผู้เชี่ยวชาญที่เปิดใช้งานสำหรับแต่ละโทเคน พารามิเตอร์ของผู้เชี่ยวชาญที่ไม่ได้ใช้งานยังคงใช้พื้นที่จัดเก็บและหน่วยความจำและอาจทำให้เกิดค่าใช้จ่ายในการสื่อสาร












