โมเดลและแพลตฟอร์ม AI
ภายใน Microsoft’s Phi-3 Mini: โมเดล AI ที่มีน้ำหนักเบาแต่ประสิทธิภาพสูง
ไมโครซอฟท์ ได้เปิดตัวโมเดลภาษาแบบเบาที่เรียกว่า Phi-3 Mini ซึ่งเป็นหนึ่งในสามโมเดล AI ที่มีขนาดกะทัดรัดและได้รับการออกแบบมาเพื่อมอบประสิทธิภาพที่ดีที่สุดในขณะที่มีขนาดเล็กพอที่จะทำงานได้อย่างมีประสิทธิภาพบนอุปกรณ์ที่มีทรัพยากรการประมวลผลที่จำกัด ด้วยขนาดเพียง 3.8 พันล้านพารามิเตอร์ Phi-3 Mini มีขนาดเล็กกว่าโมเดล AI ที่มีขนาดใหญ่เช่น GPT-4 แต่ก็สามารถทำงานได้ดีในหลายๆ ด้าน
การพัฒนา Phi-3 Mini เป็น 里程碑ที่สำคัญในการทำให้ความสามารถ AI ที่ทันสมัยสามารถเข้าถึงได้บนอุปกรณ์ที่หลากหลาย มีขนาดเล็กพอที่จะทำงานได้บนสมาร์ทโฟน แท็บเล็ต และอุปกรณ์เอดจ์อื่นๆ โดยไม่ต้องมีการเชื่อมต่ออินเทอร์เน็ต ซึ่งเปิดโอกาสใหม่ๆ สำหรับประสบการณ์ AI ที่มีความฉลาดบนอุปกรณ์ต่างๆ ตั้งแต่ผู้ช่วยเสมือนจริงและ AI การสนทนา ไปจนถึงผู้ช่วยเขียนโค้ดและการทำความเข้าใจภาษา

- 4-bit quantized phi-3-mini running natively on an iPhone
ภายใน: สถาปัตยกรรมและการฝึกอบรม
Phi-3 Mini เป็นโมเดลทรานส์ฟอร์เมอร์แบบดีเคอเดอร์ที่มีสถาปัตยกรรมที่คล้ายกับโมเดล Llama-2 ที่เปิด源 มี 32 เลเยอร์ 3072 มิติซ่อน และ 32 หัวการดูแล โดยมีความยาวบริบทเริ่มต้น 4,000 โทเคน ไมโครซอฟท์ยังได้แนะนำรุ่นบริบทยาวที่เรียกว่า Phi-3 Mini-128K ซึ่งสามารถขยายความยาวบริบทได้ถึง 128,000 โทเคนโดยใช้เทคนิค เช่น LongRope
สิ่งที่ทำให้ Phi-3 Mini แตกต่างคือวิธีการฝึกอบรม โดยไม่พึ่งพาเพียงความสามารถในการประมวลผลข้อมูลขนาดใหญ่ แต่ไมโครซอฟท์ให้ความสำคัญกับการคัดเลือกข้อมูลฝึกอบรมที่มีคุณภาพสูงและความสามารถในการให้เหตุผล ข้อมูลนี้ประกอบด้วยข้อมูลเว็บที่ถูกกรองอย่างหนักและข้อมูลสังเคราะห์ที่สร้างโดยโมเดลภาษาที่ใหญ่กว่า
กระบวนการฝึกอบรมแบ่งออกเป็นสองขั้นตอน ในขั้นตอนแรก โมเดลจะถูกสอนให้เรียนรู้ความรู้ทั่วไปและความเข้าใจภาษาโดยใช้แหล่งข้อมูลบนเว็บที่หลากหลาย ในขั้นตอนที่สอง โมเดลจะถูกสอนให้เรียนรู้ความสามารถในการให้เหตุผลและความเชี่ยวชาญในด้านเฉพาะโดยใช้ข้อมูลเว็บที่ถูกกรองอย่างหนักและข้อมูลสังเคราะห์
ไมโครซอฟท์เรียกแนวทางนี้ว่า “การฝึกอบรมใน chế độที่เหมาะสม” ซึ่งเป็นการเปลี่ยนแปลงจาก “การฝึกอบรมใน chế度ที่ใหญ่ที่สุด” หรือ “การฝึกอบรมใน chế度ที่มีประสิทธิภาพสูงสุด” ที่ใช้กับโมเดลภาษาที่ใหญ่กว่า เป้าหมายคือการปรับข้อมูลฝึกอบรมให้เหมาะสมกับขนาดของโมเดล โดยให้ความรู้และความสามารถในการให้เหตุผลที่เหมาะสมในขณะที่ยังคงมีความสามารถอื่นๆ

- Quality of new Phi-3 models, as measured by performance on the Massive Multitask Language Understanding (MMLU) benchmark
แนวทางนี้ได้ผลลัพธ์ที่น่าประทับใจ โดย Phi-3 Mini สามารถทำงานได้ดีในหลายๆ บンチมาร์ก โดยมีผลลัพธ์ที่ใกล้เคียงหรือเหนือกว่าโมเดลที่ใหญ่กว่า เช่น Mixtral 8x7B และ GPT-3.5
ความปลอดภัยและความแข็งแกร่ง
ไมโครซอฟท์ให้ความสำคัญกับความปลอดภัยและความแข็งแกร่งในการพัฒนา Phi-3 Mini โดยโมเดลได้รับการฝึกอบรมในขั้นตอนหลังโดยใช้เทคนิคการฝึกอบรมแบบดูแล (SFT) และการปรับให้เหมาะสมแบบตรง (DPO)
ขั้นตอน SFT ใช้ข้อมูลที่ถูกกรองอย่างหนักจากหลายๆ ด้าน รวมถึงคณิตศาสตร์ การเขียนโค้ด การให้เหตุผล การสนทนา และความปลอดภัย เพื่อเสริมสร้างความสามารถของโมเดลในด้านเหล่านี้ และให้ความรู้และความสามารถในการให้เหตุผลที่เหมาะสม
ขั้นตอน DPO มุ่งเน้นไปที่การปรับให้โมเดลหลีกเลี่ยงพฤติกรรมที่ไม่พึงประสงค์โดยใช้คำตอบที่ถูกปฏิเสธเป็นตัวอย่างเชิงลบ กระบวนการนี้ครอบคลุมข้อมูลการสนทนา การให้เหตุผล และความพยายามในการสร้าง AI ที่มีความรับผิดชอบ (RAI) เพื่อให้แน่ใจว่า Phi-3 Mini จะปฏิบัติตามหลักการของไมโครซอฟท์ในการสร้าง AI ที่มีความรับผิดชอบและเชื่อถือได้
เพื่อเพิ่มความปลอดภัยของโมเดล Phi-3 Mini ได้รับการทดสอบอย่างเข้มข้นโดยทีมทดสอบอิสระของไมโครซอฟท์ โดยทีมทดสอบได้ตรวจสอบโมเดลอย่างต่อเนื่องเพื่อหาจุดอ่อนและปรับปรุงโมเดลให้ดีขึ้น
การประยุกต์ใช้และการใช้งาน
ด้วยประสิทธิภาพที่น่าประทับใจและมาตรการความปลอดภัยที่แข็งแกร่ง Phi-3 Mini เหมาะสำหรับการใช้งานในหลายๆ ด้าน โดยเฉพาะในสถานการณ์ที่มีการจำกัดทรัพยากรและความต้องการความเร็ว
หนึ่งในโอกาสที่น่าสนใจที่สุดคือการนำไปใช้ในการสร้างผู้ช่วยเสมือนจริงและ AI การสนทนาที่สามารถทำงานได้บนอุปกรณ์มือถือ โดยไม่ต้องมีการเชื่อมต่ออินเทอร์เน็ต และสามารถรักษาความปลอดภัยของข้อมูลส่วนบุคคลได้
ความสามารถในการให้เหตุผลของ Phi-3 Mini ยังทำให้เหมาะสำหรับการช่วยเหลือในการเขียนโค้ดและการแก้ปัญหาทางคณิตศาสตร์ นักพัฒนาและนักเรียนสามารถใช้ประโยชน์จากความสามารถในการเติมโค้ดอัตโนมัติ การตรวจสอบข้อผิดพลาด และการอธิบายโค้ด เพื่อเพิ่มความเร็วและความแม่นยำในการพัฒนาและเรียนรู้
มองไปข้างหน้า: Phi-3 Small และ Phi-3 Medium
ในขณะที่ Phi-3 Mini เป็นความสำเร็จที่น่าประทับใจ แต่ไมโครซอฟท์ยังมีแผนการใหญ่ๆ สำหรับครอบครัว Phi-3 โดยได้预览สองโมเดลที่ใหญ่กว่า คือ Phi-3 Small (7 พันล้านพารามิเตอร์) และ Phi-3 Medium (14 พันล้านพารามิเตอร์) ซึ่งคาดว่าจะขยายขอบเขตของประสิทธิภาพสำหรับโมเดลภาษาที่มีขนาดกะทัดรัด
Phi-3 Small ใช้เทคนิคการ tokenize ที่ทันสมัย (tiktoken) และกลไกการดูแลแบบกลุ่ม (grouped-query attention mechanism) เพื่อปรับปรุงขนาดของโมเดลและรักษาความสามารถในการเรียกค้นบริบทที่ยาว
ข้อจำกัดและทิศทางในอนาคต
尽管 Phi-3 Mini มีประสิทธิภาพที่น่าประทับใจ แต่ก็ยังมีข้อจำกัดเช่นเดียวกับโมเดลภาษาอื่นๆ หนึ่งในข้อจำกัดที่สำคัญที่สุดคือความสามารถในการจัดเก็บความรู้ที่มีข้อมูลเป็นข้อเท็จจริง ซึ่งเห็นได้จากผลลัพธ์ที่ต่ำกว่าในบンチมาร์กบางอย่าง
ไมโครซอฟท์เชื่อว่าข้อจำกัดนี้สามารถบรรเทาได้โดยการเพิ่มความสามารถในการค้นหาข้อมูลโดยใช้เครื่องมือค้นหา ซึ่งจะช่วยให้โมเดลสามารถเรียกค้นและให้เหตุผลกับข้อมูลที่เกี่ยวข้องได้
สรุป
Phi-3 Mini ของไมโครซอฟท์เป็นความสำเร็จที่สำคัญในการทำให้ความสามารถ AI ที่ทันสมัยสามารถเข้าถึงได้บนอุปกรณ์ที่หลากหลาย โดยการนำเสนอประสิทธิภาพที่ดีที่สุดในขนาดที่กะทัดรัด โมเดลนี้เปิดโอกาสใหม่ๆ สำหรับประสบการณ์ AI ที่มีความฉลาดบนอุปกรณ์ต่างๆ
แนวทางใหม่ในการฝึกอบรมของ Phi-3 Mini ซึ่งเน้นไปที่ข้อมูลที่มีคุณภาพสูงและความสามารถในการให้เหตุผล ได้แสดงให้เห็นถึงผลลัพธ์ที่น่าประทับใจ และเป็นหลักฐานว่าขนาดไม่ใช่ทุกอย่าง












