โมเดลและแพลตฟอร์ม AI
MPT-30B: MosaicML เสริมศักยภาพ GPT-3 ด้วย LLM ใหม่ที่ผลักดันขอบเขตของ NLP
MosaicML เป็นบริษัท generative AI ที่ให้บริการ AI การใช้งานและการปรับขนาด Their ล่าสุด large language model (LLM) MPT-30B กำลังสร้างความฮือฮาในุมชน AI
MosaicML เริ่มเดินทาง LLM ด้วยการเปิดตัว MPT-7B (Mosaic Pretrained Transformer) ในเดือนพฤษภาคม 2023 ซึ่งมีสามรูปแบบ:
- MPT-7B-StoryWriter-65k+ (สำหรับการสร้างเรื่องราวยาว)
- MPT-7B-Instruct (สำหรับการติดตามคำสั่งแบบสั้น)
- MPT-7B-Chat (สำหรับการสร้างบทสนทนา)
โมเดลเหล่านี้ประสบความสำเร็จอย่างมากในุมชน ML เนื่องจากเป็นโอเพ่นซอร์ส มีการใช้งานเชิงพาณิชย์ที่ดี และมีความสามารถในการจัดการหน้าต่างบริบทที่ขยายได้
สิ่งที่สำคัญที่สุดคือโมเดลนี้มีความสามารถเทียบเท่าและในบางกรณีเหนือกว่าโมเดลที่เทียบเท่า (LLaMA-7B, StableLM 7B และอื่นๆ) โดยเมื่อเดือนมิถุนายน MPT-7B ซีรีส์นี้ได้ถูกดาวน์โหลดมากกว่า 3 ล้านครั้ง เมื่อวันที่ 22 มิถุนายน MosaicML ได้เปิดตัว MPT-30B ซึ่งได้เพิ่มมาตรฐานสำหรับโมเดลฟาวนด์เมชั่นโอเพ่นซอร์ส
MPT-30B: LLM ที่ทรงพลังซึ่งเหนือกว่า GPT-3
MPT-30B เป็น LLM ที่เป็นโอเพ่นซอร์สและได้รับอนุญาตเชิงพาณิชย์ ซึ่งมีพลังมากกว่า GPT-3-175B โดยมีพารามิเตอร์เพียง 17% ของ GPT-3 หรือ 30B มันสามารถทำได้ดีกว่า GPT-3 ในหลายงาน ด้านล่างนี้เป็นการเปรียบเทียบระหว่าง MPT-30B และ GPT-3
MPT-30B สร้างขึ้นจากโมเดล MPT-7B ก่อนหน้านี้ มันสามารถฝึกได้อย่างมีประสิทธิภาพเมื่อเทียบกับโมเดลที่มีขนาดใกล้เคียงกัน ตัวอย่างเช่น LLaMA-30B ใช้ FLOPs ประมาณ 1.44 เท่ามากกว่า MPT-30B ในขณะที่ Falcon-40B มี FLOPs สูงกว่า MPT-30B ถึง 1.27 เท่า ด้านล่างนี้เป็นการแสดงให้เห็นถึงความก้าวหน้าของ MPT-30B ในหลายงานเมื่อเทียบกับโมเดลก่อนหน้า
คุณสมบัติพิเศษบางอย่างของ MPT-30B ได้แก่:
หน้าต่างบริบท 8k โทเค็น
หน้าต่างบริบทใน LLM หมายถึงช่วงของโทเค็นที่โมเดลสามารถพิจารณาก่อนที่จะสร้างผลลัพธ์ MPT-30B มีหน้าต่างบริบท 8,000 โทเค็นที่เวลาฝึก มันถูกฝึกครั้งแรกด้วย 1 ล้านโทเค็นโดยใช้ลำดับ 2,000 โทเค็น และจากนั้นเพิ่มอีก 50 พันล้านโทเค็นของลำดับ 8,000 โทเค็น (ประมาณ 6,000 คำ)
การสนับสนุน ALiBi
เพื่ออธิบายคุณสมบัตินี้ ลองพิจารณาคำถาม:
มPT-30B สามารถเข้าใจและทำนายลำดับที่ยาวกว่าที่ฝึกได้อย่างไร?
MPT-30B ใช้เทคนิค Attention with Linear Biases (ALiBi) เพื่อเข้าใจลำดับที่ยาวกว่าและขยายหน้าต่างบริบทเกิน 8,000 โทเค็นระหว่างการปรับแต่งหรือการอนุมาน
แทนที่จะคำนวณการฝังตัวตำแหน่งโดยที่เรามอบเวกเตอร์ให้กับแต่ละคำในลำดับ ALiBi คำนวณคะแนนความสนใจระหว่างโทเค็นคีย์และคิวรี่ เมื่อโทเค็นคีย์และคิวรี่อยู่ใกล้กัน ค่าปรับจะต่ำ แต่สูงกว่าในกรณีอื่นๆ ดังนั้น โครงสร้าง Transformer ที่ซ่อนอยู่สามารถขยายไปยังอินพุตแบบยาวได้
การอนุมานและการฝึกที่มีประสิทธิภาพผ่าน FlashAttention
ความสนใจหรือการมุ่งเน้นไปที่ส่วนสำคัญของลำดับอินพุตเป็นส่วนสำคัญของทรานส์ฟอร์เมอร์ แต่สามารถช้าและต้องใช้หน่วยความจำมาก โดยเฉพาะอย่างยิ่งเมื่อประมวลผลลำดับข้อความที่ยาว
FlashAttention เป็นวิธีการที่นักวิจัยจากมหาวิทยาลัยคอร์เนลล์เสนอเพื่อแก้ไขปัญหานี้สำหรับ MPT-30B โดยใช้เทคนิคที่เรียกว่าไทลิ่ง FlashAttention ลดจำนวนครั้งที่โมเดลต้องอ่านหรือเขียนหน่วยความจำ ทำให้การประมวลผลเร็วขึ้น ดังนั้น โมเดลจึงใช้เทคนิค FlashAttention และไลบรารี FasterTransformer ของ NVIDIA (NVDA ) สำหรับการฝึกและการอนุมานที่มีประสิทธิภาพ
ความง่ายในการฝึกและการใช้งาน
นักพัฒนาสามารถฝึก MPT-30B จากศูนย์หรือใช้เช็คพอยต์ของ MosaicML สำหรับการใช้งานที่รวดเร็วยิ่งขึ้น นอกจากนี้ยังสามารถปรับแต่งสำหรับการใช้งานเฉพาะโดเมนในเซตข้อมูลเฉพาะ
ขนาดของโมเดลถูกเลือกเพื่อให้สามารถใช้งานได้อย่างง่ายดายบน GPU เดียว โดยเฉพาะ 1xA100-80GB ในความแม่นยำ 16 บิต หรือ 1xA100-40GB ในความแม่นยำ 8 บิต ซึ่งหมายความว่าโมเดลนี้ได้รับการออกแบบให้พอดีกับข้อจำกัดหน่วยความจำของ GPU เหล่านี้
ความสามารถในการเขียนโค้ด
MPT-30B มีความสามารถในการเขียนโค้ดที่น่าประทับใจเช่นกัน HumanEval เป็นเซตข้อมูลที่ OpenAI เปิดตัวซึ่งมีปัญหาในการเขียนโค้ด 164 ปัญหา MPT-30B สามารถทำได้ดีกว่าโมเดล LLM ที่สร้างมาเพื่อจุดประสงค์นี้ เช่น StarCoder ซีรีส์
รูปแบบที่ปรับแต่งแล้ว: MPT-30B-Instruct และ MPT-30B-Chat
MPT-30B-Instruct
LLM ส่วนใหญ่ถูกใช้สำหรับการสั่งงาน เช่น การตอบคำถาม การสรุปข้อความ การแปลภาษา และอื่นๆ MPT-30B-Instruct เป็นรูปแบบที่ปรับแต่งแล้วของ MPT-30B ซึ่งได้รับอนุญาตเชิงพาณิชย์ (รักษาใบอนุญาต CC-By-SA-3.0) และปรับแต่งสำหรับการสั่งงาน โดยใช้เซตข้อมูลต่อไปนี้สำหรับการปรับแต่ง:
- FLAN
- P3
- Alpaca
- Dolly-15k
เซตข้อมูล Dolly ได้รับการเพิ่มเติมด้วย เซตข้อมูล Helpful and Harmless ของ Anthropic สำหรับการปรับแต่งการสั่งงาน นอกจากนี้ยังมีการใช้เซตข้อมูลที่หลากหลายสำหรับการเพิ่มเติมข้อมูล ซึ่งรวมถึง:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat เป็นรูปแบบที่ปรับแต่งแล้วของ MPT-30B สำหรับการสร้างบทสนทนา เป็นผลงานวิจัยที่เผยแพร่ภายใต้ใบอนุญาต CC-By-NC-SA-4.0 ซึ่งอนุญาตให้ใช้เพื่อการวิจัยเท่านั้น โมเดลนี้ได้รับการปรับแต่งโดยใช้เซตข้อมูลภาษาต่างๆ รวมถึง:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM ครอบครองส่วนสำคัญของตลาด AI ที่มีมูลค่าหลายพันล้านดอลลาร์ ซึ่งเติบโตอย่างรวดเร็วหลังจากที่ ChatGPT เปลี่ยนแปลงภูมิทัศน์เมื่อปีที่แล้ว MPT ซีรีส์เป็นส่วนสำคัญของการปฏิวัตินี้ ในอนาคตอันใกล้ เราสามารถคาดหวังเห็นโมเดลโอเพ่นซอร์สที่มีประสิทธิภาพและประสิทธิผลมากกว่า MPT ซีรีส์
สำหรับข่าว AI ล่าสุดเยี่ยม unite.ai















