โมเดลและแพลตฟอร์ม AI
จุดจบของยุคการขยายขนาด: ทำไมการก้าวล้ำด้านอัลกอริทึมจึงสำคัญกว่าขนาดโมเดล

ตลอดทศวรรษที่ผ่านมา ความก้าวหน้าในปัญญาประดิษฐ์ถูกขับเคลื่อนโดยการขยายขนาด ชุดข้อมูลที่ใหญ่ขึ้น พารามิเตอร์ที่มากขึ้น และพลังการคำนวณที่สูงขึ้นกลายเป็นสูตรสู่ความสำเร็จ ทีมต่างแข่งขันสร้างโมเดลที่ใหญ่กว่าโดยวัดความก้าวหน้าเป็นจำนวนพารามิเตอร์เป็นล้านล้านและข้อมูลการฝึกเป็นพีทาไบต์ เราเรียกยุคนี้ว่า ยุคการขยายขนาด มันเป็นแรงผลักดันให้เกิดความก้าวหน้า AI มากมายที่เราเห็นในวันนี้ แต่ขณะนี้เรากำลังเข้าใกล้ขีดจำกัดที่การทำโมเดลให้ใหญ่ขึ้นเพียงอย่างเดียวไม่ใช่วิธีที่มีประสิทธิภาพ ฉลาด หรือยั่งยืนที่สุด ดังนั้นความสนใจจึงเปลี่ยนจากการขยายขนาดดิบไปสู่การก้าวล้ำด้านอัลกอริทึม ในบทความนี้ เราจะตรวจสอบว่าทำไมการขยายขนาดเพียงอย่างเดียวไม่พอและขั้นต่อไปของการพัฒนา AI จะพึ่งพานวัตกรรมด้านอัลกอริทึมอย่างไร
กฎของผลตอบแทนที่ลดลงในการขยายขนาดโมเดล
ยุคการขยายขนาดถูกสร้างบนพื้นฐานเชิงประจักษ์ที่ขายแล้ว นักวิจัย สังเกตเห็นว่าการเพิ่มขนาดของโมเดลและชุดข้อมูลสามารถนำไปสู่การเพิ่มประสิทธิภาพที่คาดการณ์ได้ รูปแบบนี้กลายเป็นที่รู้จักในชื่อ กฎการขยายขนาด กฎเหล่านี้เร็ว ๆ นี้กลายเป็น คู่มือ สำหรับห้องทดลอง AI ชั้นนำ ทำให้การแข่งขันในการสร้างระบบที่ใหญ่ขึ้นเรื่อย ๆ การแข่งขันนั้นทำให้เกิดโมเดลภาษาใหญ่และ โมเดลพื้นฐาน ที่ตอนนี้ขับเคลื่อน AI มากมายของวันนี้ อย่างไรก็ตาม เช่นเดียวกับเส้นโค้งเอ็กซ์โปเนนเชียล ทุกการขยายขนาด AI นี้กำลังเริ่มแบนลงแล้ว ค่าใช้จ่ายในการพัฒนาโมเดลที่ใหญ่ยิ่งขึ้นกำลังเพิ่มอย่างชัดเจน การฝึกระบบระดับแนวหน้าตอนนี้ใช้พลังงานเท่ากับ เมืองเล็ก ทำให้เกิดความกังวลด้านสิ่งแวดล้อมอย่างรุนแรง ค่าใช้จ่ายทางการเงินสูง มาก จนมีเพียงไม่กี่องค์กรเท่านั้นที่สามารถแข่งขันได้ ในขณะเดียวกัน เรากำลังเห็นสัญญาณชัดเจนของ ผลตอบแทนที่ลดลง การเพิ่มจำนวนพารามิเตอร์เป็นสองเท่าไม่ได้ทำให้ความสามารถเพิ่มเป็นสองเท่า การปรับปรุงก็เป็นแบบค่อยเป็นค่อยไป เพียงแค่ขัดเกลาความรู้ที่มีอยู่เดิม ไม่ได้เปิดศักยภาพใหม่ การเพิ่มมูลค่าสำหรับแต่ละดอลลาร์และวัตต์ที่ใช้จึงลดลง กลยุทธ์การขยายขนาดกำลังถึงขีดจำกัดทางเศรษฐกิจและเทคนิค
แนวหน้าที่ใหม่: ประสิทธิภาพด้านอัลกอริทึม
ขีดจำกัดของกฎการขยายขนาดทำให้นักวิจัยหันมามุ่งเน้นที่ประสิทธิภาพด้านอัลกอริทึม แทนที่จะพึ่งพากำลังดิบ พวกเขาเริ่มให้ความสำคัญกับการออกแบบอัลกอริทึมที่ฉลาดกว่าและใช้ทรัพยากรได้อย่างมีประสิทธิภาพ ความก้าวหน้าล่าสุดแสดงให้เห็นถึงพลังของการเปลี่ยนแปลงนี้ ตัวอย่างเช่น สถาปัตยกรรม Transformer ที่ขับเคลื่อนด้วยกลไก attention ได้ครองวงการ AI มาหลายปี แต่ attention มีจุดอ่อน: ความต้องการคอมพิวเตอร์เพิ่มอย่างรวดเร็วตามความยาวของลำดับ State Space Models (SSMs) เช่น Mamba กำลังเป็นทางเลือกที่น่าสนใจแทน Transformer ด้วยการทำให้การให้เหตุผลแบบเลือกสรรมีประสิทธิภาพมากขึ้น SSMs สามารถเทียบเท่าประสิทธิภาพของ Transformer ที่ใหญ่กว่ามากในขณะที่ทำงานเร็วกว่าและใช้หน่วยความจำน้อยกว่ามาก
อีกตัวอย่างหนึ่งของประสิทธิภาพด้านอัลกอริทึมคือการเพิ่มขึ้นของโมเดล Mixture of Experts (MoE) แทนที่จะเปิดใช้งานเครือข่ายขนาดมหาศาลทั้งหมดสำหรับทุกอินพุต ระบบ MoE จะส่งงานไปยังส่วนย่อยของเครือข่ายที่เกี่ยวข้องที่สุด หรือ “ผู้เชี่ยวชาญ” โมเดลอาจมีพารามิเตอร์เป็นพันล้านโดยรวม แต่การคำนวณแต่ละครั้งใช้เพียงส่วนหนึ่งของพารามิเตอร์เท่านั้น เหมือนกับการมีห้องสมุดขนาดใหญ่แต่เปิดเพียงไม่กี่เล่มที่จำเป็นต่อการตอบคำถาม แทนที่จะอ่านทุกเล่มในอาคารทุกครั้ง ผลลัพธ์คือความจุความรู้ของโมเดลยักษ์พร้อมประสิทธิภาพของโมเดลขนาดเล็กมากกว่า
อีกตัวอย่างหนึ่งที่ผสานแนวคิดเหล่านี้เข้าด้วยกันคือ DeepSeek-V3 โมเดล Mixture-of-Experts ที่เสริมด้วย Multi-head Latent Attention (MLA) MLA ปรับปรุง attention แบบดั้งเดิมโดยการบีบอัดสถานะ key‑value ทำให้โมเดลสามารถจัดการลำดับยาวได้อย่างมีประสิทธิภาพ เหมือนกับ SSMs ในขณะที่ยังคงรักษาจุดแข็งของ Transformer ด้วยพารามิเตอร์ทั้งหมด 236 พันล้าน แต่เปิดใช้งานเพียงส่วนหนึ่งต่อภารกิจแต่ละงาน DeepSeek-V3 ให้ประสิทธิภาพระดับสูงในด้านเช่นการเขียนโค้ดและการให้เหตุผล ทั้งนี้ยังเข้าถึงได้ง่ายและใช้ทรัพยากรน้อยกว่ารุ่นขนาดใหญ่ที่เทียบเท่าที่ขยายขนาด
เหล่านี้ไม่ใช่เพียงตัวอย่างแยกส่วนเท่านั้น แต่เป็นการแสดงถึงแนวโน้มที่กว้างขึ้นไปสู่การออกแบบที่ฉลาดและมีประสิทธิภาพมากขึ้น นักวิจัยกำลังมุ่งเน้นวิธีทำให้โมเดลเร็วขึ้น เล็กลง และใช้ข้อมูลน้อยลงโดยไม่สูญเสียประสิทธิภาพ
ทำไมการเปลี่ยนแปลงนี้จึงสำคัญ
การย้ายจากการพึ่งพาการขยายขนาดไปสู่การมุ่งเน้นการก้าวล้ำด้านอัลกอริทึมมีผลกระทบสำคัญต่อวงการ AI ประการแรก ทำให้ AI เข้าถึงได้ง่ายขึ้นสำหรับทุกคน ความสำเร็จไม่จำเป็นต้องอาศัยคอมพิวเตอร์ที่ทรงพลังที่สุดอีกต่อไป กลุ่มนักวิจัยขนาดเล็กสามารถสร้างการออกแบบใหม่ที่เหนือกว่ารุ่นที่สร้างด้วยงบประมาณที่ใหญ่กว่ามาก การเปลี่ยนแปลงนี้ทำให้การนวัตกรรมเปลี่ยนจากการแข่งขันด้านทรัพยากรเป็นการแข่งขันด้านไอเดียและความเชี่ยวชาญ ผลที่ตามมาคือ มหาวิทยาลัย สตาร์ทอัพ และห้องทดลองอิสระสามารถมีบทบาทที่ใหญ่ขึ้น นอกเหนือจากบริษัทเทคโนโลยีใหญ่ ๆ
ประการที่สอง การเปลี่ยนแปลงนี้ช่วยทำให้ AI มีประโยชน์มากขึ้นในสถานการณ์ประจำวัน โมเดลที่มีพารามิเตอร์ 500 พันล้านอาจดูน่าประทับใจในงานวิจัย แต่ขนาดมหาศาลทำให้การใช้งานจริงยากและมีค่าใช้จ่ายสูง ในทางตรงกันข้าม ตัวเลือกที่มีประสิทธิภาพเช่น Mamba หรือโมเดล Mixture of Experts สามารถทำงานบนฮาร์ดแวร์มาตรฐาน รวมถึงอุปกรณ์ที่อยู่บนขอบเครือข่าย ความง่ายในการใช้งานนี้เป็นกุญแจสำคัญในการนำ AI ไปใช้ในแอปพลิเคชันทั่วไป เช่น เครื่องมือวินิจฉัยในด้านสุขภาพหรือฟีเจอร์แปลภาษาแบบทันทีบนสมาร์ทโฟน
ประการที่สาม มันจัดการกับประเด็นความยั่งยืน ความต้องการพลังงานในการสร้างและดำเนินการโมเดล AI ขนาดยักษ์กำลังกลายเป็นความท้าทายสำคัญต่อสิ่งแวดล้อม ด้วยการเน้นประสิทธิภาพ เราสามารถลดการปล่อยคาร์บอนจากงาน AI ได้อย่างชัดเจน
สิ่งที่กำลังมาถึง: ยุคของการออกแบบปัญญาประดิษฐ์
เรากำลังเข้าสู่สิ่งที่อาจเรียกว่ายุคของการออกแบบปัญญาประดิษฐ์ คำถามไม่ได้เป็นว่าเราจะทำโมเดลให้ใหญ่แค่ไหนอีกต่อไป แต่คือเราจะออกแบบโมเดลที่มีสติปัญญาและประสิทธิภาพโดยธรรมชาติเช่นไร
การเปลี่ยนแปลงนี้จะนำมาซึ่งนวัตกรรมในหลายพื้นที่หลักของการวิจัย หนึ่งในพื้นที่ที่เราคาดว่าจะเห็นความก้าวหน้า คือสถาปัตยกรรมโมเดล AI โมเดลใหม่เช่น state space models ที่ได้กล่าวถึงแล้วอาจเปลี่ยนวิธีที่เครือข่ายประสาทประมวลผลข้อมูล ตัวอย่างเช่น สถาปัตยกรรมที่ได้รับแรงบันดาลใจจาก dynamical systems กำลังพิสูจน์ว่ามีประสิทธิภาพมากขึ้นในการทดลอง อีกหนึ่งจุดสนใจจะเป็นวิธีการฝึกที่ช่วยให้โมเดลเรียนรู้ได้อย่างมีประสิทธิภาพด้วยข้อมูลที่น้อยกว่ามาก ตัวอย่างเช่น advances ในการเรียนรู้แบบ few-shot และ zero-shot ทำให้ AI มีประสิทธิภาพการใช้ข้อมูลสูงขึ้น ในขณะที่เทคนิคเช่น activation steering ทำให้พฤติกรรมของโมเดลดีขึ้นโดยไม่ต้องฝึกใหม่ การปรับแต่งหลังการฝึกและการใช้ synthetic data ก็ช่วยลดความต้องการการฝึกอย่างมาก บางครั้งลดลงถึงระดับ 10,000 เท่า
เรายังจะเห็นความสนใจที่เพิ่มขึ้นในโมเดลไฮบริด เช่น AI ประสานประสาท-สัญลักษณ์ AI ประสานประสาท-สัญลักษณ์กำลังกลายเป็น แนวโน้มสำคัญ ในปี 2025 โดยผสานการจดจำรูปแบบของการเรียนรู้เชิงประสาทกับความแข็งแกร่งด้านตรรกะของระบบสัญลักษณ์เพื่อเพิ่มความสามารถในการอธิบายและลดการพึ่งพาข้อมูล ตัวอย่างเช่น AlphaGeometry 2 และ AlphaProof ซึ่งทำให้ Google DeepMind สามารถคว้ารางวัลทองที่ IMO 2025 เป้าหมายคือพัฒนาระบบที่ไม่เพียงทำนายคำต่อไปจากสถิติเท่านั้น แต่ยังเข้าใจและให้เหตุผลเกี่ยวกับโลกในลักษณะคล้ายมนุษย์
สรุปประเด็น
ยุคการขยายขนาดเป็นสิ่งสำคัญและนำพาการเติบโตที่น่าทึ่งให้กับ AI มันขยายขอบเขตของสิ่งที่เป็นไปได้และมอบเทคโนโลยีพื้นฐานที่เราพึ่งพาในวันนี้ แต่เช่นเดียวกับเทคโนโลยีใด ๆ ที่เจริญเติบโต กลยุทธ์เริ่มแรกในที่สุดก็ใช้ศักยภาพจนหมด การบุกเบิกครั้งใหญ่ต่อไปจะไม่มาจากการเพิ่มชั้นในสแต็กเพิ่มเติม แต่จะมาจากการออกแบบสแต็กใหม่ทั้งหมด
อนาคตเป็นของผู้ที่สร้างสรรค์ในด้านอัลกอริทึม สถาปัตยกรรม และวิทยาศาสตร์พื้นฐานของการเรียนรู้ของเครื่อง มันเป็นอนาคตที่ปัญญาจะถูกวัดไม่โดยจำนวนพารามิเตอร์ แต่โดยความงดงามของการออกแบบ การผลักดันให้สร้างอัลกอริทึมที่ฉลาดขึ้นเพิ่งเริ่มต้น การเปลี่ยนผ่านนี้เปิดประตูสู่ AI ที่เข้าถึงได้ง่ายยิ่งขึ้น ยั่งยืนยิ่งขึ้น และเป็นปัญญาที่แท้จริง












