โมเดลและแพลตฟอร์ม AI

จุดจบของยุคการขยายขนาด: ทำไมการก้าวล้ำด้านอัลกอริทึมจึงสำคัญกว่าขนาดโมเดล

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ตลอดทศวรรษที่ผ่านมา ความก้าวหน้าในปัญญาประดิษฐ์ถูกขับเคลื่อนโดยการขยายขนาด ชุดข้อมูลที่ใหญ่ขึ้น พารามิเตอร์ที่มากขึ้น และพลังการคำนวณที่สูงขึ้นกลายเป็นสูตรสู่ความสำเร็จ ทีมต่างแข่งขันสร้างโมเดลที่ใหญ่กว่าโดยวัดความก้าวหน้าเป็นจำนวนพารามิเตอร์เป็นล้านล้านและข้อมูลการฝึกเป็นพีทาไบต์ เราเรียกยุคนี้ว่า ยุคการขยายขนาด มันเป็นแรงผลักดันให้เกิดความก้าวหน้า AI มากมายที่เราเห็นในวันนี้ แต่ขณะนี้เรากำลังเข้าใกล้ขีดจำกัดที่การทำโมเดลให้ใหญ่ขึ้นเพียงอย่างเดียวไม่ใช่วิธีที่มีประสิทธิภาพ ฉลาด หรือยั่งยืนที่สุด ดังนั้นความสนใจจึงเปลี่ยนจากการขยายขนาดดิบไปสู่การก้าวล้ำด้านอัลกอริทึม ในบทความนี้ เราจะตรวจสอบว่าทำไมการขยายขนาดเพียงอย่างเดียวไม่พอและขั้นต่อไปของการพัฒนา AI จะพึ่งพานวัตกรรมด้านอัลกอริทึมอย่างไร

กฎของผลตอบแทนที่ลดลงในการขยายขนาดโมเดล

ยุคการขยายขนาดถูกสร้างบนพื้นฐานเชิงประจักษ์ที่ขายแล้ว นักวิจัย สังเกตเห็นว่าการเพิ่มขนาดของโมเดลและชุดข้อมูลสามารถนำไปสู่การเพิ่มประสิทธิภาพที่คาดการณ์ได้ รูปแบบนี้กลายเป็นที่รู้จักในชื่อ กฎการขยายขนาด กฎเหล่านี้เร็ว ๆ นี้กลายเป็น คู่มือ สำหรับห้องทดลอง AI ชั้นนำ ทำให้การแข่งขันในการสร้างระบบที่ใหญ่ขึ้นเรื่อย ๆ การแข่งขันนั้นทำให้เกิดโมเดลภาษาใหญ่และ โมเดลพื้นฐาน ที่ตอนนี้ขับเคลื่อน AI มากมายของวันนี้ อย่างไรก็ตาม เช่นเดียวกับเส้นโค้งเอ็กซ์โปเนนเชียล ทุกการขยายขนาด AI นี้กำลังเริ่มแบนลงแล้ว ค่าใช้จ่ายในการพัฒนาโมเดลที่ใหญ่ยิ่งขึ้นกำลังเพิ่มอย่างชัดเจน การฝึกระบบระดับแนวหน้าตอนนี้ใช้พลังงานเท่ากับ เมืองเล็ก ทำให้เกิดความกังวลด้านสิ่งแวดล้อมอย่างรุนแรง ค่าใช้จ่ายทางการเงินสูง มาก จนมีเพียงไม่กี่องค์กรเท่านั้นที่สามารถแข่งขันได้ ในขณะเดียวกัน เรากำลังเห็นสัญญาณชัดเจนของ ผลตอบแทนที่ลดลง การเพิ่มจำนวนพารามิเตอร์เป็นสองเท่าไม่ได้ทำให้ความสามารถเพิ่มเป็นสองเท่า การปรับปรุงก็เป็นแบบค่อยเป็นค่อยไป เพียงแค่ขัดเกลาความรู้ที่มีอยู่เดิม ไม่ได้เปิดศักยภาพใหม่ การเพิ่มมูลค่าสำหรับแต่ละดอลลาร์และวัตต์ที่ใช้จึงลดลง กลยุทธ์การขยายขนาดกำลังถึงขีดจำกัดทางเศรษฐกิจและเทคนิค

แนวหน้าที่ใหม่: ประสิทธิภาพด้านอัลกอริทึม

ขีดจำกัดของกฎการขยายขนาดทำให้นักวิจัยหันมามุ่งเน้นที่ประสิทธิภาพด้านอัลกอริทึม แทนที่จะพึ่งพากำลังดิบ พวกเขาเริ่มให้ความสำคัญกับการออกแบบอัลกอริทึมที่ฉลาดกว่าและใช้ทรัพยากรได้อย่างมีประสิทธิภาพ ความก้าวหน้าล่าสุดแสดงให้เห็นถึงพลังของการเปลี่ยนแปลงนี้ ตัวอย่างเช่น สถาปัตยกรรม Transformer ที่ขับเคลื่อนด้วยกลไก attention ได้ครองวงการ AI มาหลายปี แต่ attention มีจุดอ่อน: ความต้องการคอมพิวเตอร์เพิ่มอย่างรวดเร็วตามความยาวของลำดับ State Space Models (SSMs) เช่น Mamba กำลังเป็นทางเลือกที่น่าสนใจแทน Transformer ด้วยการทำให้การให้เหตุผลแบบเลือกสรรมีประสิทธิภาพมากขึ้น SSMs สามารถเทียบเท่าประสิทธิภาพของ Transformer ที่ใหญ่กว่ามากในขณะที่ทำงานเร็วกว่าและใช้หน่วยความจำน้อยกว่ามาก

อีกตัวอย่างหนึ่งของประสิทธิภาพด้านอัลกอริทึมคือการเพิ่มขึ้นของโมเดล Mixture of Experts (MoE) แทนที่จะเปิดใช้งานเครือข่ายขนาดมหาศาลทั้งหมดสำหรับทุกอินพุต ระบบ MoE จะส่งงานไปยังส่วนย่อยของเครือข่ายที่เกี่ยวข้องที่สุด หรือ “ผู้เชี่ยวชาญ” โมเดลอาจมีพารามิเตอร์เป็นพันล้านโดยรวม แต่การคำนวณแต่ละครั้งใช้เพียงส่วนหนึ่งของพารามิเตอร์เท่านั้น เหมือนกับการมีห้องสมุดขนาดใหญ่แต่เปิดเพียงไม่กี่เล่มที่จำเป็นต่อการตอบคำถาม แทนที่จะอ่านทุกเล่มในอาคารทุกครั้ง ผลลัพธ์คือความจุความรู้ของโมเดลยักษ์พร้อมประสิทธิภาพของโมเดลขนาดเล็กมากกว่า

อีกตัวอย่างหนึ่งที่ผสานแนวคิดเหล่านี้เข้าด้วยกันคือ DeepSeek-V3 โมเดล Mixture-of-Experts ที่เสริมด้วย Multi-head Latent Attention (MLA) MLA ปรับปรุง attention แบบดั้งเดิมโดยการบีบอัดสถานะ key‑value ทำให้โมเดลสามารถจัดการลำดับยาวได้อย่างมีประสิทธิภาพ เหมือนกับ SSMs ในขณะที่ยังคงรักษาจุดแข็งของ Transformer ด้วยพารามิเตอร์ทั้งหมด 236 พันล้าน แต่เปิดใช้งานเพียงส่วนหนึ่งต่อภารกิจแต่ละงาน DeepSeek-V3 ให้ประสิทธิภาพระดับสูงในด้านเช่นการเขียนโค้ดและการให้เหตุผล ทั้งนี้ยังเข้าถึงได้ง่ายและใช้ทรัพยากรน้อยกว่ารุ่นขนาดใหญ่ที่เทียบเท่าที่ขยายขนาด

เหล่านี้ไม่ใช่เพียงตัวอย่างแยกส่วนเท่านั้น แต่เป็นการแสดงถึงแนวโน้มที่กว้างขึ้นไปสู่การออกแบบที่ฉลาดและมีประสิทธิภาพมากขึ้น นักวิจัยกำลังมุ่งเน้นวิธีทำให้โมเดลเร็วขึ้น เล็กลง และใช้ข้อมูลน้อยลงโดยไม่สูญเสียประสิทธิภาพ

ทำไมการเปลี่ยนแปลงนี้จึงสำคัญ

การย้ายจากการพึ่งพาการขยายขนาดไปสู่การมุ่งเน้นการก้าวล้ำด้านอัลกอริทึมมีผลกระทบสำคัญต่อวงการ AI ประการแรก ทำให้ AI เข้าถึงได้ง่ายขึ้นสำหรับทุกคน ความสำเร็จไม่จำเป็นต้องอาศัยคอมพิวเตอร์ที่ทรงพลังที่สุดอีกต่อไป กลุ่มนักวิจัยขนาดเล็กสามารถสร้างการออกแบบใหม่ที่เหนือกว่ารุ่นที่สร้างด้วยงบประมาณที่ใหญ่กว่ามาก การเปลี่ยนแปลงนี้ทำให้การนวัตกรรมเปลี่ยนจากการแข่งขันด้านทรัพยากรเป็นการแข่งขันด้านไอเดียและความเชี่ยวชาญ ผลที่ตามมาคือ มหาวิทยาลัย สตาร์ทอัพ และห้องทดลองอิสระสามารถมีบทบาทที่ใหญ่ขึ้น นอกเหนือจากบริษัทเทคโนโลยีใหญ่ ๆ

ประการที่สอง การเปลี่ยนแปลงนี้ช่วยทำให้ AI มีประโยชน์มากขึ้นในสถานการณ์ประจำวัน โมเดลที่มีพารามิเตอร์ 500 พันล้านอาจดูน่าประทับใจในงานวิจัย แต่ขนาดมหาศาลทำให้การใช้งานจริงยากและมีค่าใช้จ่ายสูง ในทางตรงกันข้าม ตัวเลือกที่มีประสิทธิภาพเช่น Mamba หรือโมเดล Mixture of Experts สามารถทำงานบนฮาร์ดแวร์มาตรฐาน รวมถึงอุปกรณ์ที่อยู่บนขอบเครือข่าย ความง่ายในการใช้งานนี้เป็นกุญแจสำคัญในการนำ AI ไปใช้ในแอปพลิเคชันทั่วไป เช่น เครื่องมือวินิจฉัยในด้านสุขภาพหรือฟีเจอร์แปลภาษาแบบทันทีบนสมาร์ทโฟน

ประการที่สาม มันจัดการกับประเด็นความยั่งยืน ความต้องการพลังงานในการสร้างและดำเนินการโมเดล AI ขนาดยักษ์กำลังกลายเป็นความท้าทายสำคัญต่อสิ่งแวดล้อม ด้วยการเน้นประสิทธิภาพ เราสามารถลดการปล่อยคาร์บอนจากงาน AI ได้อย่างชัดเจน

สิ่งที่กำลังมาถึง: ยุคของการออกแบบปัญญาประดิษฐ์

เรากำลังเข้าสู่สิ่งที่อาจเรียกว่ายุคของการออกแบบปัญญาประดิษฐ์ คำถามไม่ได้เป็นว่าเราจะทำโมเดลให้ใหญ่แค่ไหนอีกต่อไป แต่คือเราจะออกแบบโมเดลที่มีสติปัญญาและประสิทธิภาพโดยธรรมชาติเช่นไร

การเปลี่ยนแปลงนี้จะนำมาซึ่งนวัตกรรมในหลายพื้นที่หลักของการวิจัย หนึ่งในพื้นที่ที่เราคาดว่าจะเห็นความก้าวหน้า คือสถาปัตยกรรมโมเดล AI โมเดลใหม่เช่น state space models ที่ได้กล่าวถึงแล้วอาจเปลี่ยนวิธีที่เครือข่ายประสาทประมวลผลข้อมูล ตัวอย่างเช่น สถาปัตยกรรมที่ได้รับแรงบันดาลใจจาก dynamical systems กำลังพิสูจน์ว่ามีประสิทธิภาพมากขึ้นในการทดลอง อีกหนึ่งจุดสนใจจะเป็นวิธีการฝึกที่ช่วยให้โมเดลเรียนรู้ได้อย่างมีประสิทธิภาพด้วยข้อมูลที่น้อยกว่ามาก ตัวอย่างเช่น advances ในการเรียนรู้แบบ few-shot และ zero-shot ทำให้ AI มีประสิทธิภาพการใช้ข้อมูลสูงขึ้น ในขณะที่เทคนิคเช่น activation steering ทำให้พฤติกรรมของโมเดลดีขึ้นโดยไม่ต้องฝึกใหม่ การปรับแต่งหลังการฝึกและการใช้ synthetic data ก็ช่วยลดความต้องการการฝึกอย่างมาก บางครั้งลดลงถึงระดับ 10,000 เท่า

เรายังจะเห็นความสนใจที่เพิ่มขึ้นในโมเดลไฮบริด เช่น AI ประสานประสาท-สัญลักษณ์ AI ประสานประสาท-สัญลักษณ์กำลังกลายเป็น แนวโน้มสำคัญ ในปี 2025 โดยผสานการจดจำรูปแบบของการเรียนรู้เชิงประสาทกับความแข็งแกร่งด้านตรรกะของระบบสัญลักษณ์เพื่อเพิ่มความสามารถในการอธิบายและลดการพึ่งพาข้อมูล ตัวอย่างเช่น AlphaGeometry 2 และ AlphaProof ซึ่งทำให้ Google DeepMind สามารถคว้ารางวัลทองที่ IMO 2025 เป้าหมายคือพัฒนาระบบที่ไม่เพียงทำนายคำต่อไปจากสถิติเท่านั้น แต่ยังเข้าใจและให้เหตุผลเกี่ยวกับโลกในลักษณะคล้ายมนุษย์

สรุปประเด็น

ยุคการขยายขนาดเป็นสิ่งสำคัญและนำพาการเติบโตที่น่าทึ่งให้กับ AI มันขยายขอบเขตของสิ่งที่เป็นไปได้และมอบเทคโนโลยีพื้นฐานที่เราพึ่งพาในวันนี้ แต่เช่นเดียวกับเทคโนโลยีใด ๆ ที่เจริญเติบโต กลยุทธ์เริ่มแรกในที่สุดก็ใช้ศักยภาพจนหมด การบุกเบิกครั้งใหญ่ต่อไปจะไม่มาจากการเพิ่มชั้นในสแต็กเพิ่มเติม แต่จะมาจากการออกแบบสแต็กใหม่ทั้งหมด

อนาคตเป็นของผู้ที่สร้างสรรค์ในด้านอัลกอริทึม สถาปัตยกรรม และวิทยาศาสตร์พื้นฐานของการเรียนรู้ของเครื่อง มันเป็นอนาคตที่ปัญญาจะถูกวัดไม่โดยจำนวนพารามิเตอร์ แต่โดยความงดงามของการออกแบบ การผลักดันให้สร้างอัลกอริทึมที่ฉลาดขึ้นเพิ่งเริ่มต้น การเปลี่ยนผ่านนี้เปิดประตูสู่ AI ที่เข้าถึงได้ง่ายยิ่งขึ้น ยั่งยืนยิ่งขึ้น และเป็นปัญญาที่แท้จริง

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI