โมเดลและแพลตฟอร์ม AI

การก่อกบฏของโมเดลขนาดเล็ก: ทำไม AI ขนาดเล็กจึงเอาชนะโมเดลภาษาขนาดใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในช่วงไม่กี่ปีที่ผ่านมา ความก้าวหน้าของปัญญาประดิษฐ์ถูกกำหนดโดยการแข่งขันในการสร้างโมเดลที่ใหญ่ขึ้นเรื่อยๆ แต่ละรุ่นใหม่จะถูกวัดโดยจำนวนพารามิเตอร์ ขนาดของข้อมูลการฝึก และขนาดของโครงสร้างพื้นฐานที่อยู่เบื้องหลัง มันถูกสมมติว่าขนาดที่ใหญ่กว่าจะดีกว่า ในขณะที่ยักษ์ใหญ่ด้านเทคโนโลยียังคงสร้างโมเดลภาษาขนาดใหญ่ขึ้นเรื่อยๆ ที่มีพารามิเตอร์หลายร้อยพันล้าน โมเดล AI ขนาดเล็กที่มักจะมีขนาดเล็กกว่าหลายพันเท่ากำลังแสดงผลที่เทียบเท่าและในบางกรณีเหนือกว่าโมเดลขนาดใหญ่ในงานเฉพาะ นี่เป็นการเปลี่ยนแปลงที่ท้าทายทุกสิ่งที่เราเคยรู้เกี่ยวกับการปรับขนาด AI และเปิดโอกาสใหม่ๆ สำหรับการใช้ AI ที่มีประสิทธิภาพและเป็นประชาธิปไตย

เรื่องราวของเดวิดและโกลิอัทในยุค AI สมัยใหม่

ในช่วงหลายปีที่ผ่านมา อุตสาหกรรม AI ดำเนินงานภายใต้สมมติฐานที่ว่าโมเดลที่ใหญ่กว่าจะให้ผลลัพธ์ที่ดีกว่า ซีรีส์ GPT ของ OpenAI เติบโตจาก 117 ล้านพารามิเตอร์เป็นมากกว่า 175 พันล้านพารามิเตอร์ โมเดล PaLM ของ Google มีถึง 540 พันล้านพารามิเตอร์ บริษัท เทคโนโลยีขนาดใหญ่ลงทุนหลายพันล้านดอลลาร์ในการฝึกโมเดลเหล่านี้และลงทุนเพิ่มเติมเพื่อสร้างโมเดลที่ใหญ่ขึ้น ในสถานการณ์นี้ เมื่อจำนวนพารามิเตอร์กลายเป็นปัจจัยสำคัญในการกำหนดความสามารถของโมเดล และการสร้างความสามารถ AI กลายเป็นการแข่งขันของทรัพยากรการคำนวณและโครงสร้างพื้นฐานที่ใช้ในการลงทุน ปรากฏการณ์ที่น่าสนใจเริ่มเกิดขึ้นในห้องปฏิบัติการวิจัยทั่วโลก

วิศวกรเริ่มค้นพบว่าโมเดลที่มีขนาดเล็กและได้รับการออกแบบอย่างรอบคอบสามารถเทียบหรือเกินผลลัพธ์ของโมเดลขนาดใหญ่ในงานเฉพาะได้ ซีรีส์ Phi ของ Microsoft แสดงให้เห็นว่าโมเดลที่มีพารามิเตอร์ 2.7 พันล้านสามารถแข่งขันกับโมเดลที่มีขนาดใหญ่กว่าสิบเท่าได้ โมเดล LLaMA ของ Meta พิสูจน์ว่าโมเดลที่มีพารามิเตอร์ 7 พันล้านสามารถให้ผลลัพธ์ที่น่าประทับใจได้เมื่อได้รับการฝึกอย่างเหมาะสม การพัฒนานี้แสดงถึงการเปลี่ยนแปลงพื้นฐานในความเข้าใจของเราเกี่ยวกับประสิทธิภาพของ AI

การเปลี่ยนแปลงนี้มีผลกระทบอย่างมีนัยสำคัญต่อวิธีการใช้งาน AI โมเดลขนาดเล็กสามารถทำงานบนฮาร์ดแวร์ของผู้บริโภค จัดการคำขอได้เร็วขึ้น และใช้พลังงานเพียงเศษเสี้ยวของโมเดลขนาดใหญ่ ทำให้ AI เข้าถึงได้สำหรับองค์กรที่ไม่สามารถลงทุนโครงสร้างพื้นฐานการคำนวณขนาดใหญ่ได้ สิ่งที่สำคัญที่สุดคือ โมเดลขนาดเล็กท้าทายแนวโน้มการผูกขาดในการพัฒนา AI โดยที่เฉพาะบริษัทที่มีทรัพยากรมากเท่านั้นที่สามารถแข่งขันได้

การเพิ่มขึ้นของสถาปัตยกรรม AI ที่มีประสิทธิภาพ

การปฏิวัติของโมเดลขนาดเล็กกำลังสร้างขึ้นจากแนวทางวิศวกรรมที่ซับซ้อนซึ่งเพิ่มประสิทธิภาพให้สูงสุดภายในงบพารามิเตอร์ที่จำกัด โมเดลเหล่านี้ใช้เทคนิคขั้นสูง เช่น การกลั่นกรองความรู้ (knowledge distillation) โดยที่โมเดล “นักเรียน” ที่มีขนาดเล็กกว่าเรียนรู้จากโมเดล “ครู” ที่มีขนาดใหญ่กว่า โดยจับความรู้ที่สำคัญและลดความต้องการการคำนวณอย่างมาก

ซีรีส์ Phi-4 ของ Microsoft เป็นตัวอย่างของแนวทางนี้ โมเดล Phi-4 ที่มีพารามิเตอร์ 14 พันล้านสามารถแข่งขันกับโมเดลที่มีขนาดใหญ่กว่าห้าเท่าในด้านการให้เหตุผลทางคณิตศาสตร์และการแก้ปัญหาเชิงตรรกะ ในทำนองเดียวกัน โมเดล Gemma 3 270M ของ Google แสดงให้เห็นว่าโมเดลที่มีขนาดเล็ก 270 ล้านพารามิเตอร์สามารถให้ความสามารถในการปฏิบัติตามคำสั่งที่แข็งแกร่งและเป็นพื้นฐานที่ดีสำหรับการปรับให้เหมาะสม

โมเดล Llama 3.2 1B ของ Meta เป็นอีกหนึ่งความก้าวหน้าในด้านประสิทธิภาพของโมเดลขนาดเล็ก โดยใช้การปรับให้เหมาะสมแบบโครงสร้างและกลั่นกรองความรู้จากโมเดล Llama ที่ใหญ่กว่า ทำให้สามารถรักษาความสามารถในการทำงานที่น่าประทับใจได้ขณะทำงานอย่างมีประสิทธิภาพบนอุปกรณ์ระดับเอดจ์ โมเดลเหล่านี้พิสูจน์ว่าการออกแบบสถาปัตยกรรมและวิธีการฝึกอบรมมีความสำคัญมากกว่าจำนวนพารามิเตอร์สำหรับหลายๆ แอปพลิเคชันในโลกแห่งความเป็นจริง

สถาปัตยกรรมแบบผสมผสานผู้เชี่ยวชาญ (mixture of experts) เป็นความก้าวหน้าที่สำคัญในการออกแบบ AI ที่มีประสิทธิภาพ แทนที่จะใช้ทุกพารามิเตอร์สำหรับทุกงาน โมเดลเหล่านี้จะกระตุ้นเฉพาะส่วนประกอบที่เชี่ยวชาญเฉพาะด้านเท่านั้น พวกมันส่งคำถามต่างๆ ไปยังเครือข่ายย่อยที่เชี่ยวชาญเฉพาะ ทำให้รักษาความสามารถที่กว้างขวางในขณะใช้พารามิเตอร์ที่ใช้งานอยู่น้อยลงในแต่ละครั้ง โมเดล Mixtral 8x7B ของ Mistral AI แสดงให้เห็นถึงแนวทางนี้ โดยมีพารามิเตอร์ทั้งหมด 47 พันล้าน แต่กระตุ้นพารามิเตอร์เพียง 13 พันล้านต่อคำถามเท่านั้น และให้ผลลัพธ์ที่เทียบเท่ากับโมเดลที่มีขนาดใหญ่มากขึ้นในขณะรักษาความเร็วในการอนุมาน

เทคนิคการปรับขนาด (quantization) ก็มีผลกระทบอย่างมากต่อการเพิ่มประสิทธิภาพของโมเดลขนาดเล็ก โดยการแสดงน้ำหนักของโมเดลด้วยบิตที่น้อยลง นักวิจัยสามารถย่อโมเดลได้โดยไม่สูญเสียความแม่นยำ วิธีการปรับขนาดสมัยใหม่สามารถลดขนาดโมเดลได้ถึง 75% โดยมีการสูญเสียผลลัพธ์ที่น้อยที่สุด โมเดล Phi-3-mini ของ Microsoft ได้แสดงให้เห็นถึงประสิทธิผลของแนวทางนี้ เมื่อปรับให้แม่นยำถึง 4 บิต มันรักษาความสามารถที่มากกว่า 95% ของความสามารถเดิมในขณะลดความต้องการหน่วยความจำจาก 7GB เหลือน้อยกว่า 2GB ทำให้เหมาะสำหรับการใช้งานบนอุปกรณ์มือถือ

การเชี่ยวชาญเอาชนะการทำให้ทั่วไป

การปฏิวัติของโมเดลขนาดเล็กเปิดเผยความจริงที่สำคัญเกี่ยวกับการใช้งาน AI ส่วนใหญ่ของแอปพลิเคชันในโลกแห่งความเป็นจริงไม่ต้องการโมเดลที่สามารถเขียนบทกวี แก้ปัญหาคำนวณ หรือพูดคุยเกี่ยวกับ ปรัชญา โมเดลเหล่านี้ต้องการความเชี่ยวชาญเฉพาะด้าน โมเดลช่วยเหลือลูกค้าที่ไม่ต้องการความรู้เกี่ยวกับเชคสเปียร์ เครื่องมือเสริมโค้ดไม่ต้องการความรู้ทางการแพทย์ การรับรู้นี้เปลี่ยนโฟกัสจากการสร้างโมเดลที่เป็นสากลไปสู่การสร้างโมเดลที่เชี่ยวชาญเฉพาะด้าน

การฝึกอบรมเฉพาะโดเมินทำให้โมเดลขนาดเล็กสามารถมุ่งเน้นความสามารถที่จำกัดไปที่ความรู้ที่เกี่ยวข้อง โมเดลที่มีพารามิเตอร์ 3 พันล้านที่ฝึกอบรมเฉพาะบนเอกสารทางกฎหมายสามารถเอาชนะโมเดลที่มีพารามิเตอร์ 70 พันล้านที่เป็นสากลในงานทางกฎหมาย โมเดลที่เชี่ยวชาญจะเรียนรู้รูปแบบที่ลึกกว่าภายในโดเมินของมัน แทนที่จะกระจายความสามารถไปทั่วหัวข้อที่ไม่เกี่ยวข้องกันมากมาย

การทำลายเพดานประสิทธิภาพ

การประเมินล่าสุดเผยให้เห็นถึงข้อได้เปรียบในการแสดงผลของโมเดลขนาดเล็กในโดเมนเฉพาะ โมเดล Olmo 2 1B ของ AI2 เอาชนะโมเดลที่มีขนาดเท่าเดียวกันจากบริษัทเทคโนโลยีขนาดใหญ่ในงานที่เกี่ยวข้องกับการเข้าใจภาษาธรรมชาติ

ช่องว่างในการแสดงผลกลายเป็นเรื่องที่น่าประทับใจมากขึ้นเมื่อตรวจสอบแอปพลิเคชันที่เฉพาะเจาะจง โมเดลขนาดเล็กที่ปรับให้เหมาะสมสำหรับโดเมินเฉพาะมีผลลัพธ์ที่ดีกว่าและเกี่ยวข้องมากกว่าโมเดลที่เป็นสากลขนาดใหญ่ในด้านความแม่นยำและความเกี่ยวข้อง แอปพลิเคชันในด้านสุขภาพ การวิเคราะห์เอกสารทางกฎหมาย และการนำไปใช้ในด้านการบริการลูกค้าแสดงให้เห็นถึงผลลัพธ์ที่น่าประทับใจเมื่อโมเดลขนาดเล็กได้รับการฝึกอบรมบนเซตข้อมูลเฉพาะโดเมิน

ความเร็วและความได้เปรียบด้านประสิทธิภาพ

ประสิทธิภาพไม่ได้หมายถึงความแม่นยำเพียงอย่างเดียว แต่ยังรวมถึงความเร็ว ต้นทุน และผลกระทบต่อสิ่งแวดล้อมด้วย โมเดลขนาดเล็กมีประสิทธิภาพในหลายๆ ด้าน โมเดลขนาดเล็กสามารถตอบสนองได้ภายในไม่กี่มิลลิวินาที ในขณะที่โมเดลขนาดใหญ่ต้องใช้เวลาหลายวินาที ความแตกต่างนี้อาจดูไม่สำคัญ แต่มันกลายเป็นเรื่องสำคัญในแอปพลิเคชันที่ต้องการการโต้ตอบแบบเรียลไทม์หรือการประมวลผลหลายล้านคำขอ

การบริโภคพลังงานเป็นอีกด้านหนึ่งที่สำคัญ โมเดลขนาดใหญ่ต้องการศูนย์ข้อมูลขนาดใหญ่พร้อมระบบทำความเย็นที่ซับซ้อน แต่ละคำขอจะบริโภคพลังงานมาก ในขณะที่โมเดลขนาดเล็กสามารถทำงานบนเซิร์ฟเวอร์มาตรฐานหรือแม้กระทั่งคอมพิวเตอร์ส่วนบุคคล โดยใช้เพียงเศษเสี้ยวของพลังงานที่จำเป็น เมื่อองค์กรต่างๆ ต้องเผชิญกับแรงกดดันในการลดรอยเท้าของคาร์บอน ความได้เปรียบด้านสิ่งแวดล้อมของโมเดลขนาดเล็กกลายเป็นเรื่องสำคัญมากขึ้น

การนำไปใช้งานบนอุปกรณ์ระดับเอดจ์อาจเป็นความสามารถที่เปลี่ยนแปลงเกมของโมเดลขนาดเล็กได้ โมเดลเหล่านี้สามารถทำงานได้โดยตรงบนโทรศัพท์มือถือ คอมพิวเตอร์แล็ปท็อป หรืออุปกรณ์ IoT โดยไม่ต้องการเชื่อมต่ออินเทอร์เน็ต ลองนึกภาพถึงเครื่องมือวินิจฉัยทางการแพทย์ที่ทำงานในพื้นที่ห่างไกลโดยไม่ต้องการอินเทอร์เน็ต หรือเครื่องมือแปลภาษาแบบเรียลไทม์ที่ไม่ต้องการการเชื่อมต่อคลาวด์ โมเดลขนาดเล็กทำให้สถานการณ์เหล่านี้เป็นไปได้ และนำความสามารถ AI ไปสู่อุปกรณ์หลายพันล้านเครื่องทั่วโลก

ข้อสรุป

การเพิ่มขึ้นของโมเดล AI ขนาดเล็กท้าทายความเชื่อที่ว่าโมเดลที่ใหญ่กว่าจะให้ผลลัพธ์ที่ดีกว่าเสมอ โมเดลขนาดเล็กที่มีพารามิเตอร์น้อยกว่ากำลังเทียบหรือเอาชนะโมเดลขนาดใหญ่ในงานเฉพาะโดยใช้เทคนิค เช่น การกลั่นกรองความรู้ การปรับขนาด และการเชี่ยวชาญเฉพาะด้าน การเปลี่ยนแปลงนี้ทำให้ AI มีความเข้าถึงได้มากขึ้น โดยการทำให้สามารถใช้งานได้เร็วขึ้นและใช้พลังงานน้อยลงบนอุปกรณ์ทั่วไป นอกจากนี้ยังลดต้นทุน ลดผลกระทบต่อสิ่งแวดล้อม และปรับปรุงความเป็นส่วนตัวโดยการทำให้สามารถใช้งานได้บนอุปกรณ์ระดับเอดจ์ โดยการเน้นไปที่โมเดลที่มีประสิทธิภาพและเฉพาะด้านแทนระบบสากลขนาดใหญ่ AI กลายเป็นเครื่องมือที่มีประโยชน์มากขึ้นสำหรับทั้งองค์กรและบุคคล

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI