โมเดลและแพลตฟอร์ม AI
MoE-LLaVA: การรวมผู้เชี่ยวชาญสำหรับโมเดลภาษาและภาพขนาดใหญ่
ความก้าวหน้าล่าสุดในโมเดลภาษาและภาพขนาดใหญ่ (LVLMs) ได้แสดงให้เห็นว่าการปรับขนาดของเฟรมเวิร์กเหล่านี้อย่างมีนัยสำคัญจะเพิ่มประสิทธิภาพในการทำงานที่หลากหลาย ในขณะที่โมเดล MiniGPT, LLaMA และอื่นๆ ได้แสดงให้เห็นถึงความสามารถที่น่าประทับใจโดยการรวมชั้นการฉายภาพแบบมองเห็นและเครื่องเข้ารหัสภาพเข้าไปในโครงสร้างของพวกมัน โดยการนำส่วนประกอบเหล่านี้ไปใช้ LVLMs เพิ่มความสามารถในการรับรู้ภาพของโมเดลภาษาขนาดใหญ่ (LLMs) อีกด้วย
โมเดลอย่าง InternVL ได้ขยายเครื่องเข้ารหัสภาพของตนให้มากกว่า 6 พันล้านพารามิเตอร์ ในขณะที่โมเดลอื่นๆ ได้ขยายส่วนหลังของ LVLMs ให้ถึง 13 พันล้านพารามิเตอร์ โดยบรรลุประสิทธิภาพที่เหนือกว่าในงานที่หลากหลาย IDEFICS ได้ฝึกโมเดล LVLM ที่มีพารามิเตอร์มากกว่า 80 พันล้าน ตัวเลือกการปรับขนาดเหล่านี้ได้เทียบหรือเกินประสิทธิภาพของ LLMs ที่ฝึกฝนล่วงหน้าด้วยพารามิเตอร์มากกว่า 34, 70 หรือแม้แต่ 100 พันล้าน อย่างไรก็ตาม การปรับขนาดมีผลเสีย: ทำให้ต้นทุนการฝึกอบรมและอนุมานเพิ่มขึ้นอย่างมาก เนื่องจากต้องใช้ทุกพารามิเตอร์ในการคำนวณสำหรับทุกโทเค็น ซึ่งนำไปสู่ความต้องการการคำนวณสูงและต้นทุนที่สูงตามมา
บทความนี้พูดถึง MoE-LLaVA ซึ่งเป็นโครงสร้างโมเดลภาษาและภาพขนาดใหญ่ที่มีการกระจายผู้เชี่ยวชาญ (MoE) และใช้กลยุทธ์การฝึกอบรม MoE-Tuning สำหรับ LVLMs MoE-Tuning จัดการกับการเสื่อมสภาพของประสิทธิภาพในกระบวนการเรียนรู้แบบหลายรูปแบบที่มีการกระจายอย่างสร้างสรรค์ โดยให้ผลลัพธ์เป็นโมเดลที่มีพารามิเตอร์จำนวนมากแต่มีต้นทุนการฝึกอบรมและอนุมานที่สอดคล้องกัน โครงสร้างของ MoE-LLaVA ได้รับการออกแบบให้ทำงานเฉพาะผู้เชี่ยวชาญชั้นนำในช่วงการนำไปใช้ ในขณะที่ผู้เชี่ยวชาญที่เหลือจะไม่ทำงาน
เราจะสำรวจเฟรมเวิร์ก MoE-LLaVA โดยตรวจสอบกลไก วิธีการ โครงสร้าง และวิธีการเปรียบเทียบกับเฟรมเวิร์กการสร้างภาพและวิดีโอชั้นนำ
MoE-LLaVA: การปรับขนาดโมเดลภาษาและภาพขนาดใหญ่ด้วยต้นทุนที่เหมาะสม
นอกจากการใช้ชั้นการฉายภาพและเครื่องเข้ารหัสภาพแล้ว โมเดลภาษาและภาพขนาดใหญ่ยังเพิ่มขนาดของโมเดลโดยการเพิ่มจำนวนพารามิเตอร์เพื่อเพิ่มประสิทธิภาพของโมเดล ตัวอย่างที่น่าสนใจของโมเดลภาษาและภาพขนาดใหญ่ที่ใช้วิธีนี้เพื่อเพิ่มประสิทธิภาพคือ MiniGPT-4, InternGPT, InternVL และอื่นๆ ในการนำไปใช้จริง การปรับขนาดโมเดลภาษาขนาดใหญ่หรือโมเดลภาษาและภาพขนาดใหญ่ด้วยข้อมูลการฝึกอบรมที่มีคุณภาพสูงมักจำเป็นต่อการปรับปรุงประสิทธิภาพของโมเดล แม้ว่าการเพิ่มขนาดของโมเดลจะปรับปรุงประสิทธิภาพ แต่ก็เพิ่มต้นทุนการคำนวณในการฝึกอบรมและอนุมาน และเพิ่มความซับซ้อนในการนำไปใช้บนอุปกรณ์ขนานกัน ในขณะเดียวกัน สาเหตุหลักที่ทำให้ต้นทุนการฝึกอบรมและอนุมานสูงขึ้นพร้อมกับความต้องการการคำนวณคือการที่ทุกโทเค็นต้องการการคำนวณกับทุกพารามิเตอร์ในโมเดลที่เรียกว่าโมเดลที่หนาแน่น
ในทางกลับกัน โมเดลผู้เชี่ยวชาญที่กระจายหรือ Mixture of Expert Models ได้แสดงให้เห็นถึงการปรับขนาดเฟรมเวิร์กโดยการประมวลผลข้อมูลโดยใช้พารามิเตอร์ที่ถูกกระจาย ซึ่งเป็นวิธีการที่ได้รับการยอมรับอย่างกว้างขวางในด้านการประมวลผลภาษาธรรมชาติ อย่างไรก็ตาม การใช้ Mixture of Expert เพื่อฝึกโมเดลภาษาและภาพขนาดใหญ่โดยตรงเป็นเรื่องที่ท้าทาย เนื่องจากการแปลง LLMs เป็น LVLMs และการทำให้โมเดลกระจายพร้อมกันจะส่งผลให้ประสิทธิภาพเสื่อมลงอย่างมาก เพื่อนำ Mixture of Models ไปใช้ในการปรับขนาด LLMs และ LVLMs จะต้องเริ่มต้นด้วยการกำหนดค่า LVLM สำหรับการกระจายก่อน เพื่อให้บรรลุเป้าหมายนี้ เฟรมเวิร์ก MoE-LLaVA นำเสนอ MoE-Tuning ซึ่งเป็นกลยุทธ์การฝึกอบรมที่มีสามขั้นตอนและง่ายต่อการนำไปใช้

ตามที่แสดงในภาพด้านบน กระบวนการ MoE-Tuning จะฝึกโมเดล Multilayer Perceptron ที่ปรับโทเค็นภาพให้เข้ากับโมเดลภาษาขนาดใหญ่ในขั้นตอนแรก จากนั้นเฟรมเวิร์กจะฝึกพารามิเตอร์ทั้งหมดของ LLM เพื่อให้ LVLM มีความเข้าใจที่ดีในหลายรูปแบบ ในที่สุด ในขั้นตอนที่สาม เฟรมเวิร์กจะทำซ้ำ Feed Forward Network เป็นน้ำหนักการเริ่มต้นสำหรับผู้เชี่ยวชาญและฝึกเฉพาะชั้นผู้เชี่ยวชาญที่ผสมกันเท่านั้น กระบวนการฝึกอบรมช่วยให้โมเดลที่กระจายเปลี่ยนจาก LVLM ที่เริ่มต้นเป็นโมเดลผู้เชี่ยวชาญที่ผสมกันอย่างค่อยเป็นค่อยไป
หลังจากที่เราได้กล่าวถึงกระบวนการฝึกอบรมแล้ว มาทำความรู้จักกับ MoE-LLaVA กัน ซึ่งเป็นฐานสำหรับโมเดลภาษาและภาพขนาดใหญ่ที่มีผู้เชี่ยวชาญที่ผสมกันและสามารถเรียนรู้ได้ โดยมีโมเดล MoE-LLaVA ที่มีเส้นทางที่กระจายหลายเส้นทาง และเฟรมเวิร์กใช้เส้นทางเหล่านี้เพื่อส่งโทเค็นไปยังผู้เชี่ยวชาญที่แตกต่างกันผ่านผู้เชี่ยวชาญที่สามารถเรียนรู้ได้ โทเค็นเหล่านั้นจะถูกประมวลผลร่วมกันโดยผู้เชี่ยวชาญที่ทำงาน ในขณะที่เส้นทางที่ไม่ทำงานจะถูกปิดเสียง เฟรมเวิร์กจะซ้ำชั้นผู้เชี่ยวชาญที่ผสมกันเพื่อให้ได้เส้นทางที่กระจายไปยัง LVLM ที่ใหญ่และทรงพลังมากขึ้น

ด้วยวิธีการที่นำมาใช้โดยเฟรมเวิร์ก MoE-LLaVA ทำให้สามารถเอาชนะโมเดลที่มีพารามิเตอร์ที่ทำงานได้ใกล้เคียงกัน และเกินกว่าพวกมันอย่างมากในมาตรฐานการหลอกลวงวัตถุของ POPE แม้จะมีพารามิเตอร์เพียง 2.2 พันล้านก็ตาม นอกจากนี้ เฟรมเวิร์ก MoE-LLaVA ที่มีพารามิเตอร์ 2.2 พันล้านสามารถบรรลุประสิทธิภาพที่เทียบเท่ากับเฟรมเวิร์ก InternVL-Chat-19B ที่มีพารามิเตอร์ที่ทำงานได้ถึง 8 เท่า
โมเดลภาษาขนาดใหญ่ที่มีความสามารถในการสร้างและปฏิบัติตามคำแนะนำที่เข้มแข็งได้รับการนำไปใช้กับโมเดลภาษาและภาพขนาดใหญ่แล้ว ตัวอย่างเช่น BLIP ที่เข้ารหัสสัญญาณภาพเป็นลำดับของโทเค็นภาพ โดยใช้ชั้นการฉายภาพหลายชั้นเพื่อปรับภาพให้เข้ากับโมเดลภาษาขนาดใหญ่ ในขณะเดียวกัน งานล่าสุดมุ่งเน้นไปที่การปรับปรุงประสิทธิภาพของโมเดลโดยการนำวิธีการต่างๆ มาใช้ เช่น การขยายชุดข้อมูลการปรับให้เหมาะสมคำแนะนำ, การเพิ่มความละเอียดของภาพ, การเพิ่มประสิทธิภาพกลยุทธ์การฝึกอบรม, การจัดตำแหน่งอินพุต, การเพิ่มประสิทธิภาพเครื่องเข้ารหัสภาพ และอื่นๆ วิธีการเหล่านี้ช่วยให้โมเดลภาษาและภาพขนาดใหญ่มีความเข้าใจภาพที่ทรงพลังโดยการขยายชุดข้อมูลการปรับให้เหมาะสมคำแนะนำและขนาดของโมเดล นอกจากนี้ โมเดลภาษาและภาพขนาดใหญ่บางตัวยังมีความเข้าใจภาพที่ละเอียด เช่น ความเข้าใจในภูมิภาคและพื้นที่หลายแห่งพร้อมกับความสามารถในการยึดภาพพิกเซล ในทางกลับกัน ต้นทุนการคำนวณที่เกี่ยวข้องกับการปรับขนาดข้อมูลภาพที่หนาแน่นและโมเดลมักจะสูงมาก ซึ่งทำให้ยากต่อการนำไปใช้ ในทางกลับกัน เฟรมเวิร์ก MoE-LLaVA มุ่งหวังที่จะทำให้การวิจัยโมเดลภาษาและภาพขนาดใหญ่คุ้มค่ามากขึ้นโดยใช้ความสามารถของโมเดลผู้เชี่ยวชาญที่ผสมกัน
MoE-LLaVA : วิธีการและโครงสร้าง
ที่แก่นกลาง เฟรมเวิร์ก MoE-LLaVA ประกอบด้วยชั้นการฉายภาพ (Multilayer Perceptron), เครื่องเข้ารหัสภาพ, บล็อก MoE, บล็อก LLM ที่ซ้อนกันหลายชั้น และชั้นการฝังคำ

โครงสร้าง
ตารางต่อไปนี้สรุปการกำหนดค่าของเฟรมเวิร์ก MoE-LLaVA

สำหรับภาพ RGB ที่กำหนด เครื่องเข้ารหัสภาพจะประมวลผลภาพเพื่อให้ได้ลำดับของโทเค็นภาพ โดยมีชั้นการฉายภาพที่แมปกับลำดับโทเค็นภาพไปยังภาพอินพุต ในขณะเดียวกัน อินพุตข้อความจะถูกประมวลผลโดยชั้นการฝังคำที่แสดงผลเป็นลำดับโทเค็น MoE-LLaVA เชื่อมโยงข้อความและโทเค็นภาพเข้าด้วยกัน และส่งเข้าไปในโมเดลภาษาขนาดใหญ่ (LLM) อย่างไรก็ตาม เฟรมเวิร์กจะฝึกเฉพาะชั้นการฉายภาพพร้อมกับโมเดลภาษาขนาดใหญ่ที่ประกอบด้วย FFN หรือชั้นการให้ความสนใจแบบหลายหัว สุดท้าย เฟรมเวิร์กจะใช้การเชื่อมต่อส่วนที่เหลือและการปรับมาตรฐานชั้นให้กับแต่ละบล็อก
ต่อไป เฟรมเวิร์ก MoE-LLaVA จะทำซ้ำ FFN หรือชั้นการให้ความสนใจแบบหลายหัวจากขั้นตอนที่สองเพื่อสร้างชุดผู้เชี่ยวชาญเป็นขั้นตอนการเริ่มต้น รูทเตอร์เป็นชั้นเชิงเส้นจะคาดการณ์ความน่าจะเป็นที่แต่ละโทเค็นจะถูกกำหนดให้กับผู้เชี่ยวชาญแต่ละคน แต่ละโทเค็นจะถูกประมวลผลโดยผู้เชี่ยวชาญชั้นนำที่มีความน่าจะเป็นสูงสุด และคำนวณผลรวมถ่วงน้ำหนักตามผลลัพธ์ของความน่าจะเป็นแบบซอฟต์แม็กซ์
MoE-Tuning
MoE-Tuning เป็นกลยุทธ์การฝึกอบรมที่มีสามขั้นตอนและง่ายต่อการนำไปใช้ ซึ่งฝึกโมเดล Multilayer Perceptron ที่ปรับโทเค็นภาพให้เข้ากับโมเดลภาษาขนาดใหญ่ในขั้นตอนแรก จากนั้นเฟรมเวิร์กจะฝึกพารามิเตอร์ทั้งหมดของ LLM เพื่อให้ LVLM มีความเข้าใจที่ดีในหลายรูปแบบ ในที่สุด ในขั้นตอนที่สาม เฟรมเวิร์กจะทำซ้ำ FFN หรือชั้นการให้ความสนใจแบบหลายหัวเป็นน้ำหนักการเริ่มต้นสำหรับผู้เชี่ยวชาญและฝึกเฉพาะชั้นผู้เชี่ยวชาญที่ผสมกันเท่านั้น
ขั้นตอนที่ 1
ในขั้นตอนแรก วัตถุประสงค์หลักคือการปรับโทเค็นภาพให้เข้ากับโมเดลภาษาขนาดใหญ่เพื่อให้ LLM เข้าใจสิ่งที่อยู่ในภาพ MoE-LLaVA ใช้ Multilayer Perceptron เพื่อแมปโทเค็นภาพไปยังโดเมนอินพุตของโมเดลภาษาขนาดใหญ่ และรักษาแพตช์ภาพเป็นโทเค็นข้อความเทียม ในขั้นตอนนี้ MoE-LLaVA ฝึก LLM เพื่ออธิบายภาพและไม่นำชั้น MoE มาใช้กับ LLM ในขั้นตอนนี้
ขั้นตอนที่ 2
ในขั้นตอนที่สอง MoE-LLaVA พยายามเพิ่มความสามารถและความสามารถในการควบคุมของเฟรมเวิร์กโดยการปรับโมเดลด้วยข้อมูลคำแนะนำแบบหลายรูปแบบ MoE-LLaVA บรรลุเป้าหมายนี้โดยการปรับ LLM ให้กลายเป็น LVLM ที่มีความเข้าใจหลายรูปแบบ เฟรมเวิร์กใช้คำแนะนำที่ซับซ้อนมากขึ้น รวมถึงการรู้จำข้อความและการให้เหตุผลเชิงตรรกะของภาพที่ต้องการให้โมเดลมีความสามารถหลายรูปแบบที่เข้มแข็งกว่า ในที่สุด กระบวนการฝึกอบรมสำหรับโมเดลที่หนาแน่นจะถือว่าเสร็จสิ้นในขั้นตอนนี้ อย่างไรก็ตาม MoE-LLaVA เผชิญกับความท้าทายในการแปลง LLM เป็น LVLM พร้อมกับการทำให้ LVLM กระจาย ในการแก้ไขปัญหานี้ เฟรมเวิร์กใช้น้ำหนักจากขั้นตอนนี้เป็นการเริ่มต้นสำหรับขั้นตอนต่อไปเพื่อลดความยากในการเรียนรู้ของโมเดลที่กระจาย
ขั้นตอนที่ 3
ในขั้นตอนที่สาม โมเดลจะทำซ้ำชั้นการให้ความสนใจแบบหลายหัวหลายครั้งเพื่อสร้างผู้เชี่ยวชาญเป็นขั้นตอนการเริ่มต้น จากนั้นเฟรมเวิร์กจะส่งโทเค็นข้อความและภาพไปยังชั้นผู้เชี่ยวชาญที่ผสมกัน โดยที่รูทเตอร์คำนวณน้ำหนักการตรงกันระหว่างผู้เชี่ยวชาญและโทเค็นแต่ละตัว แต่ละโทเค็นจะถูกประมวลผลโดยผู้เชี่ยวชาญชั้นนำที่มีความน่าจะเป็นสูงสุด โดยมีผลลัพธ์ถ่วงน้ำหนักตามน้ำหนักของรูทเตอร์ เมื่อผู้เชี่ยวชาญชั้นนำถูกกระตุ้น โมเดลจะปิดผู้เชี่ยวชาญที่เหลือ ซึ่งให้ MoE-LLaVA มีเส้นทางที่กระจายได้ไม่สิ้นสุด ทำให้โมเดลมีความสามารถหลากหลาย
MoE-LLaVA : ผลลัพธ์และการทดลอง
เฟรมเวิร์ก MoE-LLaVA ใช้ CLIP-Large เป็นเครื่องเข้ารหัสภาพ โดยมี Multilayer Perceptron ที่ประกอบด้วยสองชั้นพร้อมชั้นการกระตุ้น GELU ที่แยกชั้นทั้งสอง โดยค่าเริ่มต้น เฟรมเวิร์กใช้การแทนที่ชั้นการให้ความสนใจแบบหลายหัวด้วยชั้นผู้เชี่ยวชาญที่ผสมกัน โดยชั้นผู้เชี่ยวชาญที่ผสมกันประกอบด้วย 50% ของจำนวนชั้นทั้งหมด ตารางต่อไปนี้แสดงชุดข้อมูลที่ใช้ในการฝึกอบรมและประเมิน MoE-LLaVA

การถามคำถามภาพแบบไม่มีการฝึกอบรม
รูปต่อไปนี้แสดงให้เห็นว่า MoE-LLaVA เป็นโมเดลที่กระจายพร้อมรูทเตอร์แบบซอฟต์ โดยอาศัย LVLM เฟรมเวิร์กได้รับการประเมินใน 5 มาตรฐานการถามคำถามภาพ และตามที่เห็น MoE-LLaVA แสดงให้เห็นถึงความเข้าใจภาพที่น่าประทับใจ และส่งผลลัพธ์ที่เทียบเท่ากับเฟรมเวิร์ก LLaVA 1.5 ในห้ามาตรฐานที่แตกต่างกัน

การประเมินการหลอกลวงวัตถุ
เพื่อประเมินการหลอกลวงวัตถุ เฟรมเวิร์ก MoE-LLaVA ใช้กระบวนการประเมิน POPE ซึ่งเป็นวิธีการแบบการโหวต และผลลัพธ์แสดงอยู่ในตารางต่อไปนี้ ตามที่เห็น MoE-LLaVA ส่งผลลัพธ์ที่แข็งแกร่งที่สุด ซึ่งบ่งชี้ถึงความสามารถของเฟรมเวิร์กในการสร้างวัตถุที่สอดคล้องกับภาพอินพุต นอกจากนี้ ยังควรทราบว่า MoE-LLaVA คงอัตราส่วน “ใช่” ไว้ดี ซึ่งบ่งชี้ถึงความสามารถของโมเดลที่กระจายในการให้ข้อเสนอแนะที่ถูกต้องสำหรับคำถามที่กำหนด

รูปต่อไปนี้แสดงการกระจายการโหลดผู้เชี่ยวชาญ โดยที่เส้นประแสดงถึงการกระจายโทเค็นที่สมดุลระหว่างรูปแบบหรือผู้เชี่ยวชาญ รูปแรกแสดงถึงการทำงานของผู้เชี่ยวชาญ ในขณะที่รูปที่เหลือแสดงถึงประสิทธิภาพของผู้เชี่ยวชาญต่อรูปแบบที่แตกต่างกัน

นอกจากนี้ รูปต่อไปนี้แสดงการกระจายรูปแบบต่างๆ ทั่วผู้เชี่ยวชาญต่างๆ

ความคิดสุดท้าย
ในบทความนี้ เราได้พูดถึง MoE-LLaVA ซึ่งเป็นฐานสำหรับโมเดลภาษาและภาพขนาดใหญ่ที่มีผู้เชี่ยวชาญที่ผสมกันและสามารถเรียนรู้ได้ โดยมีโมเดล MoE-LLaVA ที่มีเส้นทางที่กระจายหลายเส้นทาง และเฟรมเวิร์กใช้เส้นทางเหล่านี้เพื่อส่งโทเค็นไปยังผู้เชี่ยวชาญที่แตกต่างกันผ่านผู้เชี่ยวชาญที่สามารถเรียนรู้ได้ โทเค็นเหล่านั้นจะถูกประมวลผลร่วมกันโดยผู้เชี่ยวชาญที่ทำงาน ในขณะที่เส้นทางที่ไม่ทำงานจะถูกปิดเสียง เฟรมเวิร์กจะซ้ำชั้นผู้เชี่ยวชาญที่ผสมกันเพื่อให้ได้เส้นทางที่กระจายไปยัง LVLM ที่ใหญ่และทรงพลังมากขึ้น กลยุทธ์ MoE-Tuning จัดการกับการเสื่อมสภาพของประสิทธิภาพในกระบวนการเรียนรู้แบบหลายรูปแบบที่มีการกระจายอย่างสร้างสรรค์ โดยให้ผลลัพธ์เป็นโมเดลที่มีพารามิเตอร์จำนวนมากแต่มีต้นทุนการฝึกอบรมและอนุมานที่สอดคล้องกัน โครงสร้างของ MoE-LLaVA ได้รับการออกแบบให้ทำงานเฉพาะผู้เชี่ยวชาญชั้นนำในช่วงการนำไปใช้ ในขณะที่ผู้เชี่ยวชาญที่เหลือจะไม่ทำงาน












