พื้นฐาน AI

โมเดล Mixture-of-Experts คืออะไร? คำอธิบาย Sparse AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดล mixture-of-experts (MoE) ประกอบด้วยเครือข่ายผู้เชี่ยวชาญหลายตัวที่มีพารามิเตอร์และตัวเราท์เตอร์ที่เลือกชุดย่อยเล็ก ๆ สำหรับแต่ละอินพุตหรือโทเคน เนื่องจากมีเพียงผู้เชี่ยวชาญที่ถูกเลือกเท่านั้นที่ทำงาน โมเดลจึงสามารถเพิ่มความจุพารามิเตอร์รวมได้โดยไม่ต้องเปิดใช้งานทุกพารามิเตอร์ในแต่ละการส่งผ่าน

การเปิดใช้งานแบบกระจายไม่ทำให้การคำนวณหรือหน่วยความจำเป็นฟรี ระบบ MoE ต้องเก็บและเคลื่อนย้ายพารามิเตอร์จำนวนมาก, สมดุลโทเคนระหว่างผู้เชี่ยวชาญ, ประสานอุปกรณ์, และป้องกันความไม่เสถียรของการเราท์ จำนวนพารามิเตอร์ทั้งหมดและจำนวนพารามิเตอร์ที่ทำงานจริงอธิบายต้นทุนที่แตกต่างกัน

ประเด็นสำคัญ

  • เราท์เตอร์คำนวณคะแนนของผู้เชี่ยวชาญและส่งโทเคนไปยังผู้เชี่ยวชาญที่อยู่ในอันดับบน‑k
  • ข้อจำกัดความจุและเป้าหมายการกระจายโหลดป้องกันไม่ให้ผู้เชี่ยวชาญบางคนรับโทเคนทั้งหมด
  • การคำนวณแบบกระจายสามารถเพิ่มความจุต่อการดำเนินการได้ แต่เพิ่มความซับซ้อนของการสื่อสารและหน่วยความจำ
  • ประเมินคุณภาพ, การคำนวณที่ทำงาน, ความหน่วง, หน่วยความจำ, พฤติกรรมการเราท์, และโครงสร้างการให้บริการร่วมกัน
What Is a Mixture-of-Experts Model? Sparse AI Explained workflow diagram
การเปิดใช้งานแบบกระจายเพิ่มความจุพารามิเตอร์พร้อมย้ายต้นทุนไปสู่การเราท์, หน่วยความจำ, และการสื่อสาร

ชั้นเราท์เตอร์และผู้เชี่ยวชาญ

ในโมเดล MoE ของ transformer ชั้นฟีดฟอร์เวิร์ดที่เลือกมักจะถูกแทนที่ด้วยเครือข่ายฟีดฟอร์เวิร์ดของผู้เชี่ยวชาญ เราท์เตอร์ให้คะแนนแต่ละโทเคนและส่งไปยังผู้เชี่ยวชาญหนึ่งหรือหลายคน; ผลลัพธ์ของพวกเขาถูกให้ค่าน้ำหนักและส่งกลับไปยังสตรีมเรซิดวลหลัก

การใส่ความสนใจอาจยังคงเป็นแบบหนาแน่น ตัว transformer รอบ ๆ จึงใช้การผสมระหว่างการคำนวณร่วมและการคำนวณตามเงื่อนไขของผู้เชี่ยวชาญ

ความจุและการกระจายโหลด

แต่ละผู้เชี่ยวชาญสามารถประมวลผลโทเคนจำนวนจำกัดในแต่ละแบช หากโทเคนจำนวนมากเลือกผู้เชี่ยวชาญเดียวกัน ระบบบางอย่างจะทำการตัดหรือเปลี่ยนเส้นทางส่วนเกิน การสูญเสียเสริมช่วยกระตุ้นการใช้ที่สมดุล ในขณะที่สัญญาณรบกวนของการเราท์สามารถเพิ่มการสำรวจระหว่างการฝึก

การกระจายการจราจรอย่างเท่าเทียมไม่ได้หมายถึงการเชี่ยวชาญที่มีความหมาย ตรวจสอบการใช้ผู้เชี่ยวชาญตามโดเมน, ตำแหน่ง, และงาน, แต่หลีกเลี่ยงการกำหนดบทบาทที่อ่านออกได้โดยมนุษย์โดยไม่มีหลักฐานเชิงสาเหตุ

ทำไมการให้บริการจึงยาก

แม้จะมีเพียงชุดย่อยเท่านั้นที่ทำงาน แต่พารามิเตอร์ของผู้เชี่ยวชาญทั้งหมดอาจต้องอยู่ในหน่วยความจำของตัวเร่งความเร็ว การขนานของผู้เชี่ยวชาญส่งโทเคนระหว่างอุปกรณ์ ทำให้แบนด์วิธของเครือข่ายและการสื่อสารแบบ all‑to‑all มีความสำคัญ แบชขนาดเล็กอาจทำให้ผู้เชี่ยวชาญไม่ได้ใช้เต็มที่

การควบคุมจำนวนบิต, แคช, การทำแบช, และการเราท์ที่คำนึงถึงโทโพโลจีสามารถช่วยได้ เปรียบเทียบ MoE กับทางเลือกแบบหนาแน่นโดยพิจารณาคุณภาพผลลัพธ์, บริบท, ฮาร์ดแวร์, และเป้าหมายระดับการให้บริการ—not only active FLOPs

สิ่งที่ MoE ทำและไม่ได้ทำให้เกิด

MoE ให้การคำนวณตามเงื่อนไขและความจุ แต่ไม่รับประกันความถูกต้องของข้อมูล, การให้เหตุผลแบบโมดูล, ความสามารถในการอธิบาย, หรือการมีตัวแทนอิสระหลายตัว เครือข่ายผู้เชี่ยวชาญถูกเรียนรู้ร่วมกันและอาจแชร์คุณลักษณะที่กระจาย

MoE ทำหน้าที่เสริม generative-AI หลังการฝึกและการบีบอัด ควรตรวจสอบการเปลี่ยนแปลงของการเราท์, ความหน่วงส่วนท้าย, ความล้มเหลวของผู้เชี่ยวชาญ, หน่วยความจำ, และคุณภาพของโดเมนหลังการปรับใช้

การเราท์, ความจุของผู้เชี่ยวชาญ, และการคำนวณแบบกระจาย

ชั้น mixture-of-experts ประกอบด้วยเครือข่ายผู้เชี่ยวชาญหลายตัวและเราท์เตอร์ที่กำหนดแต่ละโทเคนให้กับชุดย่อยเล็ก ๆ ส่วนใหญ่คือผู้เชี่ยวชาญหนึ่งหรือสองคน โมเดลสามารถเก็บพารามิเตอร์จำนวนมากพร้อมเปิดใช้งานเพียงส่วนเล็ก ๆ ต่อโทเคน การเปิดใช้งานแบบกระจายลดการคำนวณเมื่อเทียบกับโมเดลหนาแน่นที่มีจำนวนพารามิเตอร์รวมเท่ากัน แต่ไม่เทียบกับโมเดลที่เล็กกว่าแต่ละตัว

เราท์เตอร์สร้างคะแนนของผู้เชี่ยวชาญ, ใช้กฎการคัดเลือก, และส่งตัวแทนโทเคนไปยังผู้เชี่ยวชาญแต่ละตัว ผู้เชี่ยวชาญแต่ละคนมีความจุจำกัด หากโทเคนจำนวนมากเลือกผู้เชี่ยวชาญเดียว ระบบต้องตัด, เปลี่ยนเส้นทาง, หรือเติมโทเคน ปัจจัยเช่น capacity factor, การสูญเสียเสริมเพื่อสมดุล, สัญญาณรบกวนของเราท์, และการขนานของผู้เชี่ยวชาญทำให้ต้องแลกเปลี่ยนคุณภาพกับการใช้และการสื่อสาร

ผู้เชี่ยวชาญไม่ได้รับประกันว่าจะสอดคล้องกับแนวคิดหรือโดเมนของมนุษย์ การเชี่ยวชาญเกิดจากการปรับแต่งและอาจกระจาย, ไม่เสถียร, หรือขึ้นกับโทเคน การอ้างอิงความสามารถในการอธิบายควรตรวจสอบการเราท์ในหลายชั้นและบริบทโดยใช้การแทรกแซง ไม่ใช่เพียงการตั้งป้ายจากโทเคนที่ได้คะแนนสูงไม่กี่ตัว

การฝึกและการให้บริการโมเดล MoE แบบกระจาย

การฝึกรวมการขนานของข้อมูล, เทนเซอร์, พายป์ไลน์, และผู้เชี่ยวชาญ โทเคนมักต้องเดินทางระหว่างตัวเร่งความเร็วเพื่อเข้าถึงผู้เชี่ยวชาญที่เลือก ทำให้การสื่อสารแบบ all‑to‑all สามารถลบความประหยัดเชิงคณิตศาสตร์ การวางตำแหน่ง, การจัดรูปแบบแบช, แบนด์วิธของเครือข่าย, การบรรจุโทเคน, และการทำให้การสื่อสารทับซ้อนกับการคำนวณเป็นตัวเลือกสำคัญในการออกแบบระบบ

ความไม่สมดุลของโหลดทำให้ผู้เชี่ยวชาญบางตัวอยู่ในสภาพว่างและอุปกรณ์บางตัวทำงานหนัก การสูญเสียเสริมกระตุ้นการเราท์ที่สมดุลแต่บางครั้งอาจขัดขวางเป้าหมายการเรียนรู้หลัก วิธีใหม่ ๆ อาจปรับอคติหรือไดนามิกของการเราท์ ควรตรวจสอบจำนวนโทเคนต่อผู้เชี่ยวชาญ, โทเคนที่ถูกตัด, เอนโทรปี, เกรเดียนท์, และเวลาอุปกรณ์แทนการพึ่งพาการสูญเสียรวมเท่านั้น

การให้บริการยากเพราะพารามิเตอร์ของผู้เชี่ยวชาญทั้งหมดอาจต้องพร้อมใช้งานแม้ว่าแต่ละโทเคนจะใช้เพียงไม่กี่ตัว ความจุหน่วยความจำ, การเชื่อมต่อ, การทำแบช, พฤติกรรมแคช, และความแปรปรวนของการเราท์ส่งผลต่อความหน่วง การควบคุมจำนวนบิตและการถ่ายโอนผู้เชี่ยวชาญช่วยในบางกรณีแต่ก็อาจเพิ่มการถ่ายโอน ควรทำเบนช์มาร์คโมเดลและโทโพโลจีฮาร์ดแวร์อย่างแม่นยำ

คุณภาพ, การประเมินผล, และการแลกเปลี่ยนในการปรับใช้

ประเมินโมเดล MoE เทียบกับฐานหนาแน่นโดยคำนึงถึงคุณภาพที่เทียบกัน, การคำนวณในการฝึก, การคำนวณในการสรุป, หน่วยความจำ, ความหน่วง, และต้นทุน การเปรียบเทียบตามจำนวนพารามิเตอร์อย่างเดียวอาจทำให้เข้าใจผิด ควรทดสอบบริบทยาว, ภาษา, โดเมน, โทเคนหายาก, และพรอมต์ที่เป็นศัตรู เพราะพฤติกรรมของเราท์อาจเปลี่ยนตามการกระจายและทำให้ความสามารถไม่สม่ำเสมอ

การเราท์นำมาซึ่งโหมดความล้มเหลวเพิ่มเติม: การล่มของผู้เชี่ยวชาญ, การเชี่ยวชาญที่ไม่เสถียร, การตัดโทเคน, การหยุดทำงานที่สัมพันธ์กัน, และความอ่อนไหวต่อการจัดรูปแบบแบช การประเมินแบบกำหนดค่าควบคุมเวลารันและการตั้งค่าการเราท์ การตรวจสอบการทำงานควรรวมการใช้ผู้เชี่ยวชาญและสุขภาพการสื่อสารเพื่อไม่ให้ปัญหาระบบถูกเข้าใจผิดว่าเป็นความแปรปรวนของโมเดลทั่วไป

MoE มีความน่าสนใจเมื่อการขยายความจุรวมเป็นสิ่งสำคัญและโครงสร้างพื้นฐานสามารถรองรับการดำเนินการแบบกระจายแบบสแปร์ส การใช้โมเดลหนาแน่นอาจยังคงง่ายและเร็วกว่าในกรณีแบชเล็ก, อุปกรณ์ขอบ, หรือการเชื่อมต่อที่จำกัด สถาปัตยกรรมนี้เป็นการแลกเปลี่ยนของระบบ ไม่ใช่การทดแทนที่ทั่วถึงสำหรับ transformer แบบหนาแน่น

ตัวอย่างการทำงาน: การประเมินโมเดลภาษา MoE

ทีมวิจัยเปรียบเทียบ MoE transformer กับฐานหนาแน่นโดยใช้โทเคนการฝึกที่เทียบกันและมุมมองทรัพยากรหลายด้าน: พารามิเตอร์ที่ทำงานต่อโทเคน, พารามิเตอร์ทั้งหมด, หน่วยความจำของตัวเร่งความเร็ว, ปริมาณการจราจรของเครือข่าย, เวลาในการฝึก, อัตราการสรุปผล, และความหน่วง ระบบบันทึกความน่าจะเป็นของเราท์, โทเคนต่อผู้เชี่ยวชาญ, ส่วนเกิน, โทเคนที่ถูกตัด, และการสูญเสียเสริมตามชั้น, ภาษา, และโดเมน จำนวนการคำนวณเชิงคณิตศาสตร์ที่ต่ำกว่าไม่ได้ถือว่าเป็นประสิทธิภาพหากการสื่อสารหรือการใช้ทรัพยากรไม่เต็มที่ทำให้ต้นทุนรวมเพิ่มขึ้น

การประเมินคุณภาพครอบคลุมความรู้, การให้เหตุผล, บริบทยาว, โดเมนหายาก, งานหลายภาษา, ความปลอดภัย, และการสอบเทียบ ทีมปรับเปลี่ยนการจัดรูปแบบแบชและการกระจายพรอมต์เพื่อดูว่าการเราท์และผลลัพธ์เปลี่ยนแปลงโดยไม่คาดคิดหรือไม่ การทำลายผู้เชี่ยวชาญเชิงสาเหตุทดสอบข้ออ้างการเชี่ยวชาญ ในขณะเดียวกันความล้มเหลวของผู้เชี่ยวชาญและการเสื่อมสภาพของเครือข่ายเปิดเผยความทนทาน ผลลัพธ์ถูกเปรียบเทียบที่เป้าหมายระดับการให้บริการเดียวกัน เพราะโมเดลที่ทำงานดีเฉพาะในแบชขนาดใหญ่อาจไม่เหมาะกับการใช้งานแบบโต้ตอบ

สำหรับการปรับใช้ ผู้เชี่ยวชาญถูกจัดตำแหน่งเพื่อให้การจราจร all‑to‑all ต่ำที่สุด น้ำหนักจะถูกควบคุมจำนวนบิตหลังจากตรวจสอบความอ่อนไหวต่อผู้เชี่ยวชาญแต่ละคน และการตรวจสอบเวลารันจะตรวจจับความไม่สมดุลหรืออุปกรณ์ที่ไม่พร้อม ความตั้งค่าเกี่ยวกับความจุและการเราท์จะเวอร์ชันพร้อมโมเดล ทีมเลือกใช้ MoE ก็ต่อเมื่อความจุพารามิเตอร์ที่เพิ่มขึ้นทำให้ภารกิจที่ต้องการดีพอที่จะชดเชยความซับซ้อนของหน่วยความจำและระบบกระจาย มิฉะนั้น โมเดลหนาแน่นอาจถูกเลือกเพราะราคาถูกกว่า, ใช้งานง่ายกว่า, และคาดการณ์ได้ง่ายกว่า

รายการตรวจสอบการนำไปใช้เชิงปฏิบัติ

แปลงแนวคิดให้เป็นกระบวนการทำงานที่มีขอบเขตและทดสอบได้: token → router → top‑k → experts → combine → output. กำหนดเจ้าของที่รับผิดชอบ, บันทึกข้อมูลและการพึ่งพา, สร้างฐานเปรียบเทียบง่าย, ตั้งเกณฑ์การยอมรับและหยุด, ทดสอบความล้มเหลวที่เป็นตัวแทน, และกำหนดการตรวจสอบ, การย้อนกลับ, และการรีวิวก่อนขยายขอบเขต บันทึกเวอร์ชันและสมมติฐานเพื่อให้ทีมอื่นสามารถทำซ้ำผลลัพธ์และเข้าใจการเปลี่ยนแปลงได้

ก่อนเปิดใช้งาน ให้ดำเนินการตรวจสอบความพร้อมที่บันทึกไว้กับผู้ที่สร้าง, ดำเนินการ, ปกป้อง, และได้รับผลกระทบจากระบบ ทดสอบกรณีปกติ, เงื่อนไขขอบเขต, ความล้มเหลวของการพึ่งพา, และการใช้ผิดวิธี; เก็บรักษาหลักฐานและความเสี่ยงที่ยังไม่ได้แก้ไข กำหนดว่าใครสามารถอนุมัติการปล่อย, เปลี่ยนเกณฑ์, แทนที่ผลลัพธ์, หรือหยุดการทำงานได้ ทบทวนการตัดสินใจหลังจากได้รับข้อมูลจากโลกจริง เพราะการทดลองที่ประสบความสำเร็จทางเทคนิคไม่ได้รับประกันประสิทธิภาพที่เชื่อถือได้เมื่อขยายขนาด

  • CAPACITY: พารามิเตอร์ผู้เชี่ยวชาญที่จัดเก็บจำนวนมาก
  • ACTIVE COMPUTE: ชุดย่อยเล็ก ๆ ต่อโทเคน
  • SYSTEM COST: หน่วยความจำ, การส่งต่อ, การสมดุล, และความหน่วง

คำถามที่พบบ่อย

ผู้เชี่ยวชาญ MoE เป็นโมเดลแยกต่างหากหรือไม่?

โดยทั่วไปไม่ใช่ พวกมันเป็นเครือข่ายย่อยภายในโมเดลที่ฝึกแล้วหนึ่งเดียว เชื่อมต่อด้วยเราท์เตอร์และชั้นที่ใช้ร่วมกัน การเชี่ยวชาญที่เรียนรู้ได้อาจไม่สอดคล้องกับโดเมนที่คนมักเข้าใจโดยตรง

ทำไม MoE ถึงมีพารามิเตอร์จำนวนมากแต่การคำนวณระดับปานกลาง?

เพราะมีเพียงชุด top‑k เล็ก ๆ ของผู้เชี่ยวชาญที่เปิดใช้งานสำหรับแต่ละโทเคน พารามิเตอร์ของผู้เชี่ยวชาญที่ไม่ได้ใช้งานยังคงใช้พื้นที่จัดเก็บและหน่วยความจำและอาจทำให้เกิดค่าใช้จ่ายในการสื่อสาร

อ้างอิงหลัก

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด