โมเดลและแพลตฟอร์ม AI
Google ทำให้การฝึกอบรม AI เร็วขึ้น 28% โดยใช้ SLMs ในฐานะครู
การฝึกอบรม โมเดลภาษาขนาดใหญ่ (LLMs) ได้กลายเป็นเรื่องที่อยู่นอกเหนือความสามารถขององค์กรส่วนใหญ่แล้ว ด้วยค่าใช้จ่ายที่สูงถึงหลายล้านและความต้องการการประมวลผลที่จะทำให้ซูเปอร์คอมพิวเตอร์เหงื่อแตก การพัฒนา AI จึงยังคงถูกปิดอยู่เบื้องหลังประตูของยักษ์เทคโนโลยี แต่ Google (GOOGL ) เพิ่งพลิกเรื่องราวนี้ด้วยวิธีการที่ง่ายมากจนทำให้คุณสงสัยว่าทำไมไม่มีใครคิดเรื่องนี้มาก่อน: ใช้โมเดล AI ขนาดเล็กเป็นครู
วิธีการทำงานของ SALT: วิธีการฝึกอบรม AI ใหม่
ในเอกสารวิจัยล่าสุดที่มีชื่อเรื่อง “การช่วยเหลือเล็กๆ น้อยๆ สามารถไปได้ไกล: การฝึกอบรม LLM อย่างมีประสิทธิภาพโดยใช้ Small LMs,” Google Research และ DeepMind ได้แนะนำ SALT (Small model Aided Large model Training) ซึ่งเป็นวิธีการใหม่ที่ท้าทายวิธีการฝึกอบรม LLM แบบดั้งเดิมของเรา
ทำไมการวิจัยนี้จึงมีความสำคัญ? ปัจจุบันการฝึกอบรมโมเดล AI ขนาดใหญ่เหมือนกับการพยายามสอนใครบางคนให้รู้ทุกอย่างเกี่ยวกับเรื่องนั้นในครั้งเดียว – มันไม่มีประสิทธิภาพ มีค่าใช้จ่ายสูง และมักจะถูกจำกัดเฉพาะองค์กรที่มีทรัพยากรการประมวลผลขนาดใหญ่ SALT ใช้เส้นทางที่แตกต่าง โดยแนะนำกระบวนการฝึกอบรมสองขั้นตอนที่เป็นนวัตกรรมและเป็นไปได้
การแบ่งเบาเกี่ยวกับวิธีการทำงานของ SALT:
ขั้นตอนที่ 1: การถ่ายทอดความรู้
- โมเดลภาษาขนาดเล็ก (SLM) ทำหน้าที่เป็นครู โดยแบ่งปันความเข้าใจของมันกับโมเดลขนาดใหญ่
- โมเดลขนาดเล็กมุ่งเน้นในการถ่ายทอด “ความรู้ที่ได้เรียนรู้” ของมันผ่านสิ่งที่นักวิจัยเรียกว่า “soft labels”
- คิดว่ามันเป็นเหมือนผู้ช่วยสอนที่จัดการกับแนวคิดพื้นฐานก่อนที่นักเรียนจะย้ายไปสู่หัวข้อที่ซับซ้อน
- ขั้นตอนนี้มีประสิทธิภาพอย่างมากใน “พื้นที่การเรียนรู้ที่ง่าย” – พื้นที่ที่โมเดลขนาดเล็กมีความมั่นใจในการทำนายที่แข็งแกร่ง
ขั้นตอนที่ 2: การเรียนรู้แบบอิสระ
- โมเดลขนาดใหญ่เปลี่ยนไปสู่การเรียนรู้แบบอิสระ
- มันเน้นไปที่การเรียนรู้รูปแบบที่ซับซ้อนและงานที่ท้าทาย
- นี่คือจุดที่โมเดลพัฒนาความสามารถที่อยู่นอกเหนือสิ่งที่ “ครู” ขนาดเล็กของมันสามารถให้ได้
- การเปลี่ยนแปลงระหว่างขั้นตอนใช้กลยุทธ์ที่ออกแบบมาอย่างรอบคอบ รวมถึงการลดลงแบบเส้นตรงและการลดลงแบบอัตราส่วน
ในคำอธิบายที่ไม่ใช่เทคนิค คุณสามารถจินตนาการได้ว่าโมเดล AI ขนาดเล็กเป็นเหมือนครูที่ช่วยเหลือซึ่งแนะนำโมเดลขนาดใหญ่ในขั้นตอนแรกของการฝึกอบรม ครูคนนี้ให้ข้อมูลเพิ่มเติมพร้อมกับคำตอบของมัน ซึ่งแสดงถึงความมั่นใจของมันในคำตอบแต่ละข้อ ข้อมูลเพิ่มเติมนี้เรียกว่า “soft labels” ช่วยให้โมเดลขนาดใหญ่เรียนรู้ได้เร็วขึ้นและได้ผลลัพธ์ที่ดีขึ้น
- การลดลงแบบเส้นตรง: มันเหมือนกับการลดเสียงของครูอย่างช้าๆ คำแนะนำของครูจะกลายเป็นน้อยลงเมื่อเวลาผ่านไป ทำให้โมเดลขนาดใหญ่เน้นไปที่การเรียนรู้จากข้อมูลดิบเอง
- การลดลงแบบอัตราส่วน: มันเหมือนกับการปรับสมดุลระหว่างคำแนะนำของครูกับงานที่ต้องทำ เมื่อการฝึกอบรมดำเนินไป อิทธิพลของครูจะลดลง และโมเดลขนาดใหญ่จะเน้นไปที่การเรียนรู้จากข้อมูลดิบมากขึ้น
ผลลัพธ์เป็นเรื่องที่น่าประทับใจ เมื่อนักวิจัยของ Google ทดสอบ SALT โดยใช้ SLM ขนาด 1.5 พันล้านพารามิเตอร์ในการฝึกอบรม LLM ขนาด 2.8 พันล้านพารามิเตอร์บนชุดข้อมูล Pile พวกเขาพบว่า:
- การลดลงของเวลาในการฝึกอบรม 28% เมื่อเทียบกับวิธีการแบบดั้งเดิม
- การปรับปรุงประสิทธิภาพที่สำคัญหลังจากการฝึกอบรมแบบละเอียด:
- ความแม่นยำในการแก้ปัญหาทางคณิตศาสตร์เพิ่มขึ้นเป็น 34.87% (เทียบกับ 31.84% ในการเปรียบเทียบ)
- ความแม่นยำในการอ่านข้อมูลถึง 67% (เพิ่มขึ้นจาก 63.7%)
แต่สิ่งที่ทำให้ SALT เป็นนวัตกรรมที่แท้จริงคือกรอบทางทฤษฎีของมัน นักวิจัยพบว่าแม้แต่ “ครู” ที่อ่อนแอก็สามารถปรับปรุงประสิทธิภาพของ “นักเรียน” โดยการบรรลุ “การซื้อขายระหว่างความเอนเอียงและความแปรปรวน” ในคำอธิบายที่ง่ายกว่า โมเดลขนาดเล็กช่วยให้โมเดลขนาดใหญ่เรียนรู้รูปแบบพื้นฐานได้อย่างมีประสิทธิภาพมากขึ้น ซึ่งสร้างรากฐานที่แข็งแกร่งสำหรับการเรียนรู้ขั้นสูง
ทำไม SALT จึงสามารถเปลี่ยนแปลงสนามการฝึกอบรม AI ได้
จำได้หรือไม่ว่าเมื่อการประมวลผลแบบคลาวด์เปลี่ยนแปลงใครที่สามารถเริ่มต้นธุรกิจเทคโนโลยีได้บ้าง? SALT อาจทำเช่นเดียวกันสำหรับการพัฒนา AI
ฉันตาม dõiนวัตกรรมในการฝึกอบรม AI มาหลายปี และการผ่านพ้นไปส่วนใหญ่จะได้รับประโยชน์จากยักษ์เทคโนโลยีเป็นหลัก แต่ SALT ต่างออกไป
นี่คือสิ่งที่อาจหมายถึงอนาคต:
สำหรับองค์กรที่มีทรัพยากรจำกัด:
- คุณอาจไม่ต้องการโครงสร้างพื้นฐานการประมวลผลขนาดใหญ่อีกต่อไปเพื่อพัฒนาโมเดล AI ที่มีประสิทธิภาพ
- ห้องปฏิบัติการวิจัยขนาดเล็กและบริษัทขนาดเล็กอาจทดลองพัฒนาโมเดลแบบกำหนดเอง
- การลดลง 28% ของเวลาในการฝึกอบรมสอดคล้องกับการลดค่าใช้จ่ายในการประมวลผลโดยตรง
- สิ่งสำคัญกว่านั้น คุณอาจเริ่มต้นด้วยทรัพยากรการประมวลผลที่เหมาะสมและยังคงบรรลุผลลัพธ์แบบมืออาชีพ
สำหรับภูมิทัศน์การพัฒนา AI:
- ผู้เล่นใหม่อาจเข้าสู่สนามแข่งขัน นำไปสู่โซลูชัน AI ที่หลากหลายและเฉพาะเจาะจงมากขึ้น
- มหาวิทยาลัยและสถาบันวิจัยสามารถดำเนินการทดลองได้มากขึ้นด้วยทรัพยากรที่มีอยู่
- อุปสรรคในการเข้าสู่การวิจัย AI ลดลงอย่างมาก
- เราอาจเห็นการใช้งานใหม่ๆ ในสาขาที่ไม่สามารถจ่ายค่าพัฒนา AI ได้ก่อนหน้านี้
สิ่งนี้หมายถึงอะไรสำหรับอนาคต
ด้วยการใช้โมเดลขนาดเล็กเป็นครู เราไม่เพียงแต่ทำให้การฝึกอบรม AI มีประสิทธิภาพมากขึ้น แต่ยังเปลี่ยนแปลงพื้นฐานของ谁ที่สามารถเข้าร่วมในการพัฒนา AI ได้ด้วย ผลกระทบไปไกลกว่าการปรับปรุงทางเทคนิคเพียงอย่างเดียว
สิ่งที่ต้องจำไว้:
- การลดเวลาในการฝึกอบรม 28% คือความแตกต่างระหว่างการเริ่มต้นโครงการ AI หรือพิจารณาว่ามันอยู่นอกเหนือความสามารถ
- การปรับปรุงประสิทธิภาพ (34.87% ในการแก้ปัญหาทางคณิตศาสตร์ และ 67% ในการอ่าน) แสดงให้เห็นว่าการเข้าถึงไม่จำเป็นต้องหมายถึงการประนีประนอมกับคุณภาพ
- วิธีการของ SALT พิสูจน์แล้วว่าบางครั้งวิธีแก้ปัญหาที่ดีที่สุดมาจากการคิดใหม่เกี่ยวกับพื้นฐานมากกว่าการเพิ่มพลังการประมวลผลเพียงอย่างเดียว
สิ่งที่ต้องติดตาม:
- ติดตามองค์กรขนาดเล็กที่เริ่มพัฒนาโมเดล AI แบบกำหนดเอง
- ดูสิ่งใหม่ๆ ในสาขาที่ไม่สามารถจ่ายค่าพัฒนา AI ได้ก่อนหน้านี้
- ดูนวัตกรรมในการใช้โมเดลขนาดเล็กสำหรับงานเฉพาะ
จำไว้: คุณค่าที่แท้จริงของ SALT คือในความสามารถที่จะเปลี่ยนแปลงใครที่สามารถสร้างสรรค์นวัตกรรมใน AI ได้ ไม่ว่าคุณจะดำเนินห้องปฏิบัติการวิจัย จัดการทีมเทคโนโลยี หรือเพียงแค่มีความสนใจในการพัฒนา AI นี่คือการผ่านพ้นไปที่สามารถทำให้ความคิดใหญ่ๆ ของคุณเป็นไปได้
อาจจะเริ่มคิดถึงโครงการ AI ที่คุณคิดว่านั้นอยู่นอกเหนือความสามารถของคุณ มันอาจเป็นไปได้มากกว่าที่คุณคิด










