โมเดลและแพลตฟอร์ม AI

MPT-30B: MosaicML เสริมศักยภาพ GPT-3 ด้วย LLM ใหม่ที่ผลักดันขอบเขตของ NLP

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

MosaicML เป็นบริษัท generative AI ที่ให้บริการ AI การใช้งานและการปรับขนาด Their ล่าสุด large language model (LLM) MPT-30B กำลังสร้างความฮือฮาในุมชน AI

MosaicML เริ่มเดินทาง LLM ด้วยการเปิดตัว MPT-7B (Mosaic Pretrained Transformer) ในเดือนพฤษภาคม 2023 ซึ่งมีสามรูปแบบ:

  1. MPT-7B-StoryWriter-65k+ (สำหรับการสร้างเรื่องราวยาว)
  2. MPT-7B-Instruct (สำหรับการติดตามคำสั่งแบบสั้น)
  3. MPT-7B-Chat (สำหรับการสร้างบทสนทนา)

โมเดลเหล่านี้ประสบความสำเร็จอย่างมากในุมชน ML เนื่องจากเป็นโอเพ่นซอร์ส มีการใช้งานเชิงพาณิชย์ที่ดี และมีความสามารถในการจัดการหน้าต่างบริบทที่ขยายได้

สิ่งที่สำคัญที่สุดคือโมเดลนี้มีความสามารถเทียบเท่าและในบางกรณีเหนือกว่าโมเดลที่เทียบเท่า (LLaMA-7B, StableLM 7B และอื่นๆ) โดยเมื่อเดือนมิถุนายน MPT-7B ซีรีส์นี้ได้ถูกดาวน์โหลดมากกว่า 3 ล้านครั้ง เมื่อวันที่ 22 มิถุนายน MosaicML ได้เปิดตัว MPT-30B ซึ่งได้เพิ่มมาตรฐานสำหรับโมเดลฟาวนด์เมชั่นโอเพ่นซอร์ส

MPT-30B: LLM ที่ทรงพลังซึ่งเหนือกว่า GPT-3

MPT-30B เป็น LLM ที่เป็นโอเพ่นซอร์สและได้รับอนุญาตเชิงพาณิชย์ ซึ่งมีพลังมากกว่า GPT-3-175B โดยมีพารามิเตอร์เพียง 17% ของ GPT-3 หรือ 30B มันสามารถทำได้ดีกว่า GPT-3 ในหลายงาน ด้านล่างนี้เป็นการเปรียบเทียบระหว่าง MPT-30B และ GPT-3

MPT-30B สร้างขึ้นจากโมเดล MPT-7B ก่อนหน้านี้ มันสามารถฝึกได้อย่างมีประสิทธิภาพเมื่อเทียบกับโมเดลที่มีขนาดใกล้เคียงกัน ตัวอย่างเช่น LLaMA-30B ใช้ FLOPs ประมาณ 1.44 เท่ามากกว่า MPT-30B ในขณะที่ Falcon-40B มี FLOPs สูงกว่า MPT-30B ถึง 1.27 เท่า ด้านล่างนี้เป็นการแสดงให้เห็นถึงความก้าวหน้าของ MPT-30B ในหลายงานเมื่อเทียบกับโมเดลก่อนหน้า

คุณสมบัติพิเศษบางอย่างของ MPT-30B ได้แก่:

หน้าต่างบริบท 8k โทเค็น

หน้าต่างบริบทใน LLM หมายถึงช่วงของโทเค็นที่โมเดลสามารถพิจารณาก่อนที่จะสร้างผลลัพธ์ MPT-30B มีหน้าต่างบริบท 8,000 โทเค็นที่เวลาฝึก มันถูกฝึกครั้งแรกด้วย 1 ล้านโทเค็นโดยใช้ลำดับ 2,000 โทเค็น และจากนั้นเพิ่มอีก 50 พันล้านโทเค็นของลำดับ 8,000 โทเค็น (ประมาณ 6,000 คำ)

การสนับสนุน ALiBi

เพื่ออธิบายคุณสมบัตินี้ ลองพิจารณาคำถาม:

มPT-30B สามารถเข้าใจและทำนายลำดับที่ยาวกว่าที่ฝึกได้อย่างไร?

MPT-30B ใช้เทคนิค Attention with Linear Biases (ALiBi) เพื่อเข้าใจลำดับที่ยาวกว่าและขยายหน้าต่างบริบทเกิน 8,000 โทเค็นระหว่างการปรับแต่งหรือการอนุมาน

แทนที่จะคำนวณการฝังตัวตำแหน่งโดยที่เรามอบเวกเตอร์ให้กับแต่ละคำในลำดับ ALiBi คำนวณคะแนนความสนใจระหว่างโทเค็นคีย์และคิวรี่ เมื่อโทเค็นคีย์และคิวรี่อยู่ใกล้กัน ค่าปรับจะต่ำ แต่สูงกว่าในกรณีอื่นๆ ดังนั้น โครงสร้าง Transformer ที่ซ่อนอยู่สามารถขยายไปยังอินพุตแบบยาวได้

การอนุมานและการฝึกที่มีประสิทธิภาพผ่าน FlashAttention

ความสนใจหรือการมุ่งเน้นไปที่ส่วนสำคัญของลำดับอินพุตเป็นส่วนสำคัญของทรานส์ฟอร์เมอร์ แต่สามารถช้าและต้องใช้หน่วยความจำมาก โดยเฉพาะอย่างยิ่งเมื่อประมวลผลลำดับข้อความที่ยาว

FlashAttention เป็นวิธีการที่นักวิจัยจากมหาวิทยาลัยคอร์เนลล์เสนอเพื่อแก้ไขปัญหานี้สำหรับ MPT-30B โดยใช้เทคนิคที่เรียกว่าไทลิ่ง FlashAttention ลดจำนวนครั้งที่โมเดลต้องอ่านหรือเขียนหน่วยความจำ ทำให้การประมวลผลเร็วขึ้น ดังนั้น โมเดลจึงใช้เทคนิค FlashAttention และไลบรารี FasterTransformer ของ NVIDIA (NVDA ) สำหรับการฝึกและการอนุมานที่มีประสิทธิภาพ

ความง่ายในการฝึกและการใช้งาน

นักพัฒนาสามารถฝึก MPT-30B จากศูนย์หรือใช้เช็คพอยต์ของ MosaicML สำหรับการใช้งานที่รวดเร็วยิ่งขึ้น นอกจากนี้ยังสามารถปรับแต่งสำหรับการใช้งานเฉพาะโดเมนในเซตข้อมูลเฉพาะ

ขนาดของโมเดลถูกเลือกเพื่อให้สามารถใช้งานได้อย่างง่ายดายบน GPU เดียว โดยเฉพาะ 1xA100-80GB ในความแม่นยำ 16 บิต หรือ 1xA100-40GB ในความแม่นยำ 8 บิต ซึ่งหมายความว่าโมเดลนี้ได้รับการออกแบบให้พอดีกับข้อจำกัดหน่วยความจำของ GPU เหล่านี้

ความสามารถในการเขียนโค้ด

MPT-30B มีความสามารถในการเขียนโค้ดที่น่าประทับใจเช่นกัน HumanEval เป็นเซตข้อมูลที่ OpenAI เปิดตัวซึ่งมีปัญหาในการเขียนโค้ด 164 ปัญหา MPT-30B สามารถทำได้ดีกว่าโมเดล LLM ที่สร้างมาเพื่อจุดประสงค์นี้ เช่น StarCoder ซีรีส์

รูปแบบที่ปรับแต่งแล้ว: MPT-30B-Instruct และ MPT-30B-Chat

MPT-30B-Instruct

LLM ส่วนใหญ่ถูกใช้สำหรับการสั่งงาน เช่น การตอบคำถาม การสรุปข้อความ การแปลภาษา และอื่นๆ MPT-30B-Instruct เป็นรูปแบบที่ปรับแต่งแล้วของ MPT-30B ซึ่งได้รับอนุญาตเชิงพาณิชย์ (รักษาใบอนุญาต CC-By-SA-3.0) และปรับแต่งสำหรับการสั่งงาน โดยใช้เซตข้อมูลต่อไปนี้สำหรับการปรับแต่ง:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

เซตข้อมูล Dolly ได้รับการเพิ่มเติมด้วย เซตข้อมูล Helpful and Harmless ของ Anthropic สำหรับการปรับแต่งการสั่งงาน นอกจากนี้ยังมีการใช้เซตข้อมูลที่หลากหลายสำหรับการเพิ่มเติมข้อมูล ซึ่งรวมถึง:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat เป็นรูปแบบที่ปรับแต่งแล้วของ MPT-30B สำหรับการสร้างบทสนทนา เป็นผลงานวิจัยที่เผยแพร่ภายใต้ใบอนุญาต CC-By-NC-SA-4.0 ซึ่งอนุญาตให้ใช้เพื่อการวิจัยเท่านั้น โมเดลนี้ได้รับการปรับแต่งโดยใช้เซตข้อมูลภาษาต่างๆ รวมถึง:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLM ครอบครองส่วนสำคัญของตลาด AI ที่มีมูลค่าหลายพันล้านดอลลาร์ ซึ่งเติบโตอย่างรวดเร็วหลังจากที่ ChatGPT เปลี่ยนแปลงภูมิทัศน์เมื่อปีที่แล้ว MPT ซีรีส์เป็นส่วนสำคัญของการปฏิวัตินี้ ในอนาคตอันใกล้ เราสามารถคาดหวังเห็นโมเดลโอเพ่นซอร์สที่มีประสิทธิภาพและประสิทธิผลมากกว่า MPT ซีรีส์

สำหรับข่าว AI ล่าสุดเยี่ยม unite.ai

Haziqa เป็นนักวิทยาศาสตร์ข้อมูลที่มีประสบการณ์อย่างกว้างขวางในการเขียนเนื้อหาทางเทคนิคสำหรับบริษัท AI และ SaaS