โมเดลและแพลตฟอร์ม AI

ภายใน Microsoft’s Phi-3 Mini: โมเดล AI ที่มีน้ำหนักเบาแต่ประสิทธิภาพสูง

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ไมโครซอฟท์ ได้เปิดตัวโมเดลภาษาแบบเบาที่เรียกว่า Phi-3 Mini ซึ่งเป็นหนึ่งในสามโมเดล AI ที่มีขนาดกะทัดรัดและได้รับการออกแบบมาเพื่อมอบประสิทธิภาพที่ดีที่สุดในขณะที่มีขนาดเล็กพอที่จะทำงานได้อย่างมีประสิทธิภาพบนอุปกรณ์ที่มีทรัพยากรการประมวลผลที่จำกัด ด้วยขนาดเพียง 3.8 พันล้านพารามิเตอร์ Phi-3 Mini มีขนาดเล็กกว่าโมเดล AI ที่มีขนาดใหญ่เช่น GPT-4 แต่ก็สามารถทำงานได้ดีในหลายๆ ด้าน

การพัฒนา Phi-3 Mini เป็น 里程碑ที่สำคัญในการทำให้ความสามารถ AI ที่ทันสมัยสามารถเข้าถึงได้บนอุปกรณ์ที่หลากหลาย มีขนาดเล็กพอที่จะทำงานได้บนสมาร์ทโฟน แท็บเล็ต และอุปกรณ์เอดจ์อื่นๆ โดยไม่ต้องมีการเชื่อมต่ออินเทอร์เน็ต ซึ่งเปิดโอกาสใหม่ๆ สำหรับประสบการณ์ AI ที่มีความฉลาดบนอุปกรณ์ต่างๆ ตั้งแต่ผู้ช่วยเสมือนจริงและ AI การสนทนา ไปจนถึงผู้ช่วยเขียนโค้ดและการทำความเข้าใจภาษา

4-bit quantized phi-3-mini running natively on an iPhone
4-bit quantized phi-3-mini running natively on an iPhone

ภายใน: สถาปัตยกรรมและการฝึกอบรม

Phi-3 Mini เป็นโมเดลทรานส์ฟอร์เมอร์แบบดีเคอเดอร์ที่มีสถาปัตยกรรมที่คล้ายกับโมเดล Llama-2 ที่เปิด源 มี 32 เลเยอร์ 3072 มิติซ่อน และ 32 หัวการดูแล โดยมีความยาวบริบทเริ่มต้น 4,000 โทเคน ไมโครซอฟท์ยังได้แนะนำรุ่นบริบทยาวที่เรียกว่า Phi-3 Mini-128K ซึ่งสามารถขยายความยาวบริบทได้ถึง 128,000 โทเคนโดยใช้เทคนิค เช่น LongRope

สิ่งที่ทำให้ Phi-3 Mini แตกต่างคือวิธีการฝึกอบรม โดยไม่พึ่งพาเพียงความสามารถในการประมวลผลข้อมูลขนาดใหญ่ แต่ไมโครซอฟท์ให้ความสำคัญกับการคัดเลือกข้อมูลฝึกอบรมที่มีคุณภาพสูงและความสามารถในการให้เหตุผล ข้อมูลนี้ประกอบด้วยข้อมูลเว็บที่ถูกกรองอย่างหนักและข้อมูลสังเคราะห์ที่สร้างโดยโมเดลภาษาที่ใหญ่กว่า

กระบวนการฝึกอบรมแบ่งออกเป็นสองขั้นตอน ในขั้นตอนแรก โมเดลจะถูกสอนให้เรียนรู้ความรู้ทั่วไปและความเข้าใจภาษาโดยใช้แหล่งข้อมูลบนเว็บที่หลากหลาย ในขั้นตอนที่สอง โมเดลจะถูกสอนให้เรียนรู้ความสามารถในการให้เหตุผลและความเชี่ยวชาญในด้านเฉพาะโดยใช้ข้อมูลเว็บที่ถูกกรองอย่างหนักและข้อมูลสังเคราะห์

ไมโครซอฟท์เรียกแนวทางนี้ว่า “การฝึกอบรมใน chế độที่เหมาะสม” ซึ่งเป็นการเปลี่ยนแปลงจาก “การฝึกอบรมใน chế度ที่ใหญ่ที่สุด” หรือ “การฝึกอบรมใน chế度ที่มีประสิทธิภาพสูงสุด” ที่ใช้กับโมเดลภาษาที่ใหญ่กว่า เป้าหมายคือการปรับข้อมูลฝึกอบรมให้เหมาะสมกับขนาดของโมเดล โดยให้ความรู้และความสามารถในการให้เหตุผลที่เหมาะสมในขณะที่ยังคงมีความสามารถอื่นๆ

Quality of new Phi-3 models, as measured by performance on the Massive Multitask Language Understanding (MMLU) benchmark
Quality of new Phi-3 models, as measured by performance on the Massive Multitask Language Understanding (MMLU) benchmark

แนวทางนี้ได้ผลลัพธ์ที่น่าประทับใจ โดย Phi-3 Mini สามารถทำงานได้ดีในหลายๆ บンチมาร์ก โดยมีผลลัพธ์ที่ใกล้เคียงหรือเหนือกว่าโมเดลที่ใหญ่กว่า เช่น Mixtral 8x7B และ GPT-3.5

ความปลอดภัยและความแข็งแกร่ง

ไมโครซอฟท์ให้ความสำคัญกับความปลอดภัยและความแข็งแกร่งในการพัฒนา Phi-3 Mini โดยโมเดลได้รับการฝึกอบรมในขั้นตอนหลังโดยใช้เทคนิคการฝึกอบรมแบบดูแล (SFT) และการปรับให้เหมาะสมแบบตรง (DPO)

ขั้นตอน SFT ใช้ข้อมูลที่ถูกกรองอย่างหนักจากหลายๆ ด้าน รวมถึงคณิตศาสตร์ การเขียนโค้ด การให้เหตุผล การสนทนา และความปลอดภัย เพื่อเสริมสร้างความสามารถของโมเดลในด้านเหล่านี้ และให้ความรู้และความสามารถในการให้เหตุผลที่เหมาะสม

ขั้นตอน DPO มุ่งเน้นไปที่การปรับให้โมเดลหลีกเลี่ยงพฤติกรรมที่ไม่พึงประสงค์โดยใช้คำตอบที่ถูกปฏิเสธเป็นตัวอย่างเชิงลบ กระบวนการนี้ครอบคลุมข้อมูลการสนทนา การให้เหตุผล และความพยายามในการสร้าง AI ที่มีความรับผิดชอบ (RAI) เพื่อให้แน่ใจว่า Phi-3 Mini จะปฏิบัติตามหลักการของไมโครซอฟท์ในการสร้าง AI ที่มีความรับผิดชอบและเชื่อถือได้

เพื่อเพิ่มความปลอดภัยของโมเดล Phi-3 Mini ได้รับการทดสอบอย่างเข้มข้นโดยทีมทดสอบอิสระของไมโครซอฟท์ โดยทีมทดสอบได้ตรวจสอบโมเดลอย่างต่อเนื่องเพื่อหาจุดอ่อนและปรับปรุงโมเดลให้ดีขึ้น

การประยุกต์ใช้และการใช้งาน

ด้วยประสิทธิภาพที่น่าประทับใจและมาตรการความปลอดภัยที่แข็งแกร่ง Phi-3 Mini เหมาะสำหรับการใช้งานในหลายๆ ด้าน โดยเฉพาะในสถานการณ์ที่มีการจำกัดทรัพยากรและความต้องการความเร็ว

หนึ่งในโอกาสที่น่าสนใจที่สุดคือการนำไปใช้ในการสร้างผู้ช่วยเสมือนจริงและ AI การสนทนาที่สามารถทำงานได้บนอุปกรณ์มือถือ โดยไม่ต้องมีการเชื่อมต่ออินเทอร์เน็ต และสามารถรักษาความปลอดภัยของข้อมูลส่วนบุคคลได้

ความสามารถในการให้เหตุผลของ Phi-3 Mini ยังทำให้เหมาะสำหรับการช่วยเหลือในการเขียนโค้ดและการแก้ปัญหาทางคณิตศาสตร์ นักพัฒนาและนักเรียนสามารถใช้ประโยชน์จากความสามารถในการเติมโค้ดอัตโนมัติ การตรวจสอบข้อผิดพลาด และการอธิบายโค้ด เพื่อเพิ่มความเร็วและความแม่นยำในการพัฒนาและเรียนรู้

มองไปข้างหน้า: Phi-3 Small และ Phi-3 Medium

ในขณะที่ Phi-3 Mini เป็นความสำเร็จที่น่าประทับใจ แต่ไมโครซอฟท์ยังมีแผนการใหญ่ๆ สำหรับครอบครัว Phi-3 โดยได้预览สองโมเดลที่ใหญ่กว่า คือ Phi-3 Small (7 พันล้านพารามิเตอร์) และ Phi-3 Medium (14 พันล้านพารามิเตอร์) ซึ่งคาดว่าจะขยายขอบเขตของประสิทธิภาพสำหรับโมเดลภาษาที่มีขนาดกะทัดรัด

Phi-3 Small ใช้เทคนิคการ tokenize ที่ทันสมัย (tiktoken) และกลไกการดูแลแบบกลุ่ม (grouped-query attention mechanism) เพื่อปรับปรุงขนาดของโมเดลและรักษาความสามารถในการเรียกค้นบริบทที่ยาว

ข้อจำกัดและทิศทางในอนาคต

尽管 Phi-3 Mini มีประสิทธิภาพที่น่าประทับใจ แต่ก็ยังมีข้อจำกัดเช่นเดียวกับโมเดลภาษาอื่นๆ หนึ่งในข้อจำกัดที่สำคัญที่สุดคือความสามารถในการจัดเก็บความรู้ที่มีข้อมูลเป็นข้อเท็จจริง ซึ่งเห็นได้จากผลลัพธ์ที่ต่ำกว่าในบンチมาร์กบางอย่าง

ไมโครซอฟท์เชื่อว่าข้อจำกัดนี้สามารถบรรเทาได้โดยการเพิ่มความสามารถในการค้นหาข้อมูลโดยใช้เครื่องมือค้นหา ซึ่งจะช่วยให้โมเดลสามารถเรียกค้นและให้เหตุผลกับข้อมูลที่เกี่ยวข้องได้

สรุป

Phi-3 Mini ของไมโครซอฟท์เป็นความสำเร็จที่สำคัญในการทำให้ความสามารถ AI ที่ทันสมัยสามารถเข้าถึงได้บนอุปกรณ์ที่หลากหลาย โดยการนำเสนอประสิทธิภาพที่ดีที่สุดในขนาดที่กะทัดรัด โมเดลนี้เปิดโอกาสใหม่ๆ สำหรับประสบการณ์ AI ที่มีความฉลาดบนอุปกรณ์ต่างๆ

แนวทางใหม่ในการฝึกอบรมของ Phi-3 Mini ซึ่งเน้นไปที่ข้อมูลที่มีคุณภาพสูงและความสามารถในการให้เหตุผล ได้แสดงให้เห็นถึงผลลัพธ์ที่น่าประทับใจ และเป็นหลักฐานว่าขนาดไม่ใช่ทุกอย่าง

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป