พื้นฐาน AI

การเพิ่มขึ้นของ Mixture-of-Experts: วิธีการที่โมเดล AI ที่มีความหนาแน่นน้อยกำลังกำหนดอนาคตของการเรียนรู้ของเครื่อง

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Mixture-of-Experts (MoE) โมเดลกำลังปฏิวัติวิธีการที่เราขยายขนาด AI โดยการเปิดใช้งานเฉพาะส่วนหนึ่งของโมเดลในเวลาใดเวลาหนึ่ง MoEs เสนอวิธีการใหม่ในการจัดการการแลกเปลี่ยนระหว่างขนาดของโมเดลและประสิทธิภาพการคำนวณ ไม่เหมือนกับโมเดลที่มีความหนาแน่นแบบดั้งเดิมที่ใช้พารามิเตอร์ทั้งหมดสำหรับอินพุตทุกอย่าง MoEs สามารถบรรลุจำนวนพารามิเตอร์ที่มากอย่างมากในขณะที่รักษาค่าใช้จ่ายในการอนุมานและฝึกอบรมให้สามารถจัดการได้ การพัฒนานี้ได้กระตุ้นให้เกิดการวิจัยและพัฒนา ทำให้ได้ผลลัพธ์ที่ดีจากทั้งบริษัทเทคโนโลยีขนาดใหญ่และสตาร์ทอัพ

วิธีการทำงานของ Mixture-of-Experts โมเดล

ที่แก่นกลาง MoE โมเดลประกอบด้วยเครือข่ายย่อยที่เชี่ยวชาญหลายตัวที่เรียกว่า “ผู้เชี่ยวชาญ” ซึ่งได้รับการดูแลโดยกลไกการควบคุมที่ตัดสินใจว่าผู้เชี่ยวชาญคนไหนควรจัดการกับอินพุตแต่ละตัว ตัวอย่างเช่น วลีที่ส่งเข้าไปในโมเดลภาษาอาจใช้ผู้เชี่ยวชาญเพียง 2 ใน 8 คน ซึ่งลดภาระการคำนวณลงอย่างมาก

แนวคิดนี้ถูกนำมาใช้โดย Google’s Switch Transformer และ GLaM โมเดล (GOOGL ) โดยที่ผู้เชี่ยวชาญมาแทนที่ชั้นฟีดฟอร์เวิร์ดแบบดั้งเดิมในทรานส์ฟอร์เมอร์ Switch Transformer ตัวอย่างเช่น ส่งท็อคเค่นไปที่ผู้เชี่ยวชาญเพียงคนเดียวต่อชั้น ในขณะที่ GLaM ใช้การกำหนดเส้นทางแบบท็อป-2 สำหรับการทำงานที่ดีขึ้น การออกแบบเหล่านี้แสดงให้เห็นว่า MoEs สามารถทำงานได้เทียบเท่ากับหรือเหนือกว่าโมเดลที่มีความหนาแน่น เช่น GPT-3 ในขณะที่ใช้พลังงานและคำนวณที่น้อยกว่ามาก

นวัตกรรมหลักอยู่ที่การคำนวณแบบมีเงื่อนไข แทนที่จะเรียกใช้โมเดลทั้งหมด MoEs จะเปิดใช้งานเฉพาะส่วนที่เกี่ยวข้องมากที่สุด ซึ่งหมายความว่าโมเดลที่มีพารามิเตอร์หลายร้อยล้านหรือแม้กระทั่งล้านล้านสามารถทำงานได้ด้วยประสิทธิภาพของโมเดลที่มีขนาดเล็กกว่ามาก นี่ทำให้นักวิจัยสามารถขยายความสามารถได้โดยไม่ต้องเพิ่มการคำนวณในลักษณะเชิงเส้น ซึ่งเป็นเรื่องที่ไม่สามารถทำได้ด้วยวิธีการขยายขนาดแบบดั้งเดิม

การประยุกต์ใช้ MoE ในโลกแห่งความเป็นจริง

MoE โมเดลได้สร้างผลกระทบไปแล้วในหลายโดเมน โมเดล GLaM และ Switch Transformer ของ Google แสดงผลลัพธ์ที่ดีที่สุดในด้านการสร้างแบบจำลองภาษา โดยมีค่าใช้จ่ายในการฝึกอบรมและอนุมานที่ต่ำกว่า โมเดล Z-Code MoE ของ Microsoft (MSFT ) ใช้งานอยู่ในเครื่องมือแปลภาษา โดยจัดการภาษาได้มากกว่า 100 ภาษา ด้วยความแม่นยำและประสิทธิภาพที่ดีกว่าโมเดลเก่าๆ

ในด้านการมองเห็น โมเดล V-MoE ของ Google ได้ปรับปรุงความแม่นยำในการจำแนกประเภทในฐานข้อมูล ImageNet และโมเดล LIMoE ได้แสดงผลลัพธ์ที่ดีในการทำงานแบบหลายรูปแบบที่เกี่ยวข้องกับทั้งภาพและข้อความ ความสามารถของผู้เชี่ยวชาญในการเชี่ยวชาญ—บางคนจัดการข้อความ อื่นๆ จัดการภาพ—เพิ่มความสามารถใหม่ให้กับระบบ AI

ระบบแนะนำและแพลตฟอร์มการเรียนรู้หลายงานได้รับประโยชน์จาก MoEs เช่นกัน ตัวอย่างเช่น ระบบแนะนำวิดีโอของ YouTube ได้ใช้โครงสร้าง MoE เพื่อจัดการวัตถุประสงค์ต่างๆ เช่น เวลาที่ดูและอัตราการคลิกผ่านได้อย่างมีประสิทธิภาพมากขึ้น โดยการกำหนดผู้เชี่ยวชาญที่แตกต่างกันให้กับงานหรือพฤติกรรมผู้ใช้ที่แตกต่างกัน MoEs ช่วยสร้างเครื่องมือจัดเตรียมเนื้อหาที่แข็งแกร่งยิ่งขึ้น

ข้อดีและความท้าทาย

ข้อได้เปรียบหลักของ MoEs คือ ประสิทธิภาพ พวกเขาทำให้สามารถฝึกอบรมและใช้โมเดลขนาดใหญ่ได้โดยมีค่าใช้จ่ายในการคำนวณที่น้อยกว่ามาก ตัวอย่างเช่น โมเดล Mixtral 8×7B ของ Mistral AI มีพารามิเตอร์ทั้งหมด 47B แต่เปิดใช้งานเพียง 12.9B ต่อโทเค็น ทำให้มีค่าใช้จ่ายเทียบเท่ากับโมเดล 13B ในขณะที่แข่งขันกับโมเดล GPT-3.5 ในด้านคุณภาพ

MoEs ยังช่วยให้เกิดการเชี่ยวชาญด้วย เนื่องจากผู้เชี่ยวชาญที่แตกต่างกันสามารถเรียนรู้รูปแบบที่แตกต่างกัน โมเดลโดยรวมจึงดีขึ้นในการจัดการอินพุตที่หลากหลาย นี่เป็นประโยชน์อย่างยิ่งในการทำงานหลายภาษาหลายโดเมนหรือหลายรูปแบบที่โมเดลที่มีความหนาแน่นแบบเดิมอาจทำงานได้ไม่ดี

อย่างไรก็ตาม MoEs มีข้อท้าทายด้านวิศวกรรมด้วย การฝึกอบรมต้องมีการสมดุลอย่างรอบคอบเพื่อให้แน่ใจว่าผู้เชี่ยวชาญทุกคนถูกใช้อย่างมีประสิทธิภาพ ข้อกังวลอีกประการหนึ่งคือภาระหน่วยความจำ—แม้ว่าเพียงเศษเสี้ยวของพารามิเตอร์จะถูกเปิดใช้งานต่อการอนุมาน แต่ทั้งหมดต้องถูกโหลดเข้าไปในหน่วยความจำ การกระจายการคำนวณไปทั่ว GPU หรือ TPU ไม่ใช่เรื่องง่าย และนำไปสู่การพัฒนาฟรेमเวิร์กเช่น DeepSpeed ของ Microsoft และ GShard ของ Google

แม้จะมีข้อท้าทายเหล่านี้ ผลลัพธ์และคุณประโยชน์ด้านต้นทุนก็เพียงพอที่จะทำให้ MoEs ถูกมองว่าเป็นส่วนสำคัญของการออกแบบ AI ขนาดใหญ่ เมื่อมีการพัฒนาอุปกรณ์และโครงสร้างพื้นฐานมากขึ้น ข้อท้าทายเหล่านี้จะถูก克服ไปทีละน้อย

การเปรียบเทียบ MoE กับวิธีการขยายขนาดอื่นๆ

การขยายขนาดแบบดั้งเดิมจะเพิ่มขนาดของโมเดลและค่าใช้จ่ายในการคำนวณในลักษณะเชิงเส้น MoEs ทำลายความเชิงเส้นนี้โดยการเพิ่มพารามิเตอร์ทั้งหมดโดยไม่เพิ่มค่าใช้จ่ายในการคำนวณต่ออินพุต นี่ทำให้สามารถฝึกอบรมโมเดลที่มีพารามิเตอร์หลายล้านล้านได้โดยใช้ฮาร์ดแวร์เดียวกับที่เคยจำกัดไว้ที่หลายสิบล้านพารามิเตอร์

เมื่อเปรียบเทียบกับการรวมโมเดล ซึ่งแนะนำการเชี่ยวชาญ แต่ต้องการการผ่านไปข้างหน้าทั้งหมดหลายครั้ง MoEs มีประสิทธิภาพมากกว่ามาก แทนที่จะ चलาโมเดลหลายตัวพร้อมกัน MoEs จะ चलาเพียงโมเดลเดียว แต่มีประโยชน์จากเส้นทางผู้เชี่ยวชาญหลายเส้นทาง

MoEs ยังเสริมกลยุทธ์ต่างๆ เช่น การขยายขนาดของข้อมูลฝึก (เช่น วิธี Chinchilla) ในขณะที่ Chinchilla เน้นการใช้ข้อมูลมากขึ้นพร้อมกับโมเดลที่เล็กกว่า MoEs ขยายความสามารถของโมเดลโดยรักษาค่าใช้จ่ายในการคำนวณให้เสถียร ทำให้เหมาะสำหรับกรณีที่ค่าใช้จ่ายในการคำนวณเป็นข้อจำกัด

สุดท้าย ในขณะที่เทคนิคบางอย่าง เช่น การตัดทอนและปริมาณการคำนวณ ลดขนาดโมเดลหลังการฝึกอบรม MoEs เพิ่มความสามารถของโมเดลระหว่างการฝึกอบรม พวกเขาไม่ใช่ตัวแทนการบีบอัด แต่เป็นเครื่องมือที่เสริมการเติบโตอย่างมีประสิทธิภาพ

บริษัทที่นำการปฏิวัติ MoE

ยักษ์เทคโนโลยี

Google เป็นผู้บุกเบิกการวิจัย MoE ในปัจจุบัน โมเดล Switch Transformer และ GLaM ของพวกเขาได้ขยายขนาดไปถึง 1.6T และ 1.2T พารามิเตอร์ ตามลำดับ GLaM มีประสิทธิภาพเทียบเท่ากับ GPT-3 ในขณะที่ใช้พลังงานเพียงหนึ่งในสาม Google ยังใช้ MoEs ในการมองเห็น (V-MoE) และงานหลายรูปแบบ (LIMoE) ซึ่งสอดคล้องกับวิสัยทัศน์ Pathways สำหรับโมเดล AI ที่เป็นสากล

Microsoft ได้ รวม MoE เข้ากับการผลิตผ่านโมเดล Z-Code ใน Microsoft Translator พวกเขายังพัฒนา DeepSpeed-MoE ซึ่งทำให้สามารถฝึกอบรมและอนุมานได้อย่างรวดเร็วสำหรับโมเดลที่มีพารามิเตอร์หลายล้านล้าน ส่วนร่วมของพวกเขารวมถึงอัลกอริทึมการกำหนดเส้นทางและไลบรารี Tutel สำหรับการคำนวณ MoE ที่มีประสิทธิภาพ

Meta ได้สำรวจ MoEs ในโมเดลภาษาขนาดใหญ่ และระบบแนะนำ พวกเขามีโมเดล MoE ขนาด 1.1T ที่แสดงให้เห็นว่าสามารถทำงานได้เทียบเท่ากับโมเดลที่มีความหนาแน่นโดยใช้การคำนวณที่น้อยกว่าสี่เท่า โมเดล LLaMA ของพวกเขาเป็นโมเดลที่มีความหนาแน่น แต่การวิจัย MoE ของ Meta ยังคงให้ข้อมูลเชิงลึกแก่ชุมชนอย่างกว้างขวาง

Amazon (AMZN ) สนับสนุน MoEs ผ่านแพลตฟอร์ม SageMaker และความพยายามภายใน พวกเขาช่วยให้สามารถฝึกอบรมโมเดล Mixtral ของ Mistral ได้ และมีข่าวลือว่ากำลังใช้ MoEs ในบริการ เช่น Alexa AI เอกสารของ AWS ส่งเสริม MoEs อย่างแข็งขันสำหรับการฝึกอบรมโมเดลขนาดใหญ่

Huawei และ BAAI ในประเทศจีนก็ได้พัฒนาโมเดล MoE ที่ทำลายสถิติ เช่น PanGu-Σ (1.085T params) ซึ่งแสดงให้เห็นถึงศักยภาพของ MoE ในภาษาและงานหลายรูปแบบ และเน้นย้ำถึงความน่าสนใจทั่วโลก

สตาร์ทอัพและผู้ท้าทาย

Mistral AI เป็นตัวอย่างของ นวัตกรรม MoE ในโอเพ่นซอร์ส โมเดล Mixtral 8×7B และ 8×22B ของพวกเขาได้พิสูจน์แล้วว่า MoEs สามารถทำงานได้ดีกว่าโมเดลที่มีความหนาแน่น เช่น LLaMA-2 70B ในขณะที่ใช้ค่าใช้จ่ายที่น้อยกว่ามาก ด้วยเงินทุนมากกว่า 600 ล้านยูโร Mistral วางเดิมพันใหญ่ในโครงสร้างแบบกระจาย

xAI ซึ่งได้รับการก่อตั้งโดย Elon Musk รายงานว่ากำลังสำรวจ MoEs ในโมเดล Grok ของพวกเขา แม้ว่ารายละเอียดจะจำกัด แต่ MoEs เสนอวิธีการให้สตาร์ทอัพอย่าง xAI สามารถแข่งขันกับผู้เล่นรายใหญ่โดยไม่ต้องใช้การคำนวณขนาดใหญ่

Databricks ผ่านการเข้าซื้อกิจการ MosaicML ได้เปิดตัว DBRX โมเดล MoE ที่เปิดซึ่งออกแบบมาเพื่อประสิทธิภาพ พวกเขายังให้โครงสร้างพื้นฐานและสูตรสำหรับการฝึกอบรม MoE ทำให้การนำไปใช้ง่ายขึ้น

ผู้เล่นอื่นๆ เช่น Hugging Face ได้บูรณาการการสนับสนุน MoE เข้าไปในไลบรารีของพวกเขา ทำให้นักพัฒนาสามารถสร้างบนโมเดลเหล่านี้ได้ง่ายขึ้น แม้ว่าจะไม่ได้สร้าง MoEs เอง แต่แพลตฟอร์มที่ทำให้สามารถใช้งานได้ก็มีความสำคัญต่อระบบนิเวศ

สรุป

Mixture-of-Experts โมเดลไม่ใช่เพียงเทรนด์—พวกเขาเป็นตัวแทนการเปลี่ยนแปลงพื้นฐานใน cáchที่ระบบ AI ถูกสร้างและขยายขนาด โดยการเปิดใช้งานเฉพาะส่วนของเครือข่าย MoEs เสนอพลังของโมเดลขนาดใหญ่โดยไม่มีค่าใช้จ่ายที่ยอมรไม่ได้ เมื่อโครงสร้างพื้นฐานซอฟต์แวร์ตามมาและอัลกอริทึมการกำหนดเส้นทางดีขึ้น MoEs มีแนวโน้มที่จะกลายเป็นสถาปัตยกรรมมาตรฐานสำหรับ AI หลายโดเมนหลายภาษาและหลายรูปแบบ

ไม่ว่าคุณจะเป็นนักวิจัย วิศวกร หรือนักลงทุน MoEs เสนอภาพอนาคตที่ AI มีพลังมากขึ้น มีประสิทธิภาพ และปรับเปลี่ยนได้มากกว่าที่เคยเป็นมา

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด