Model dan platform AI

MPT-30B: MosaicML Mengungguli GPT-3 Dengan LLM Baru Untuk Mendorong Batas NLP

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

MosaicML adalah perusahaan generative AI yang menyediakan solusi penerapan dan skalabilitas AI. Model bahasa besar (LLM) terbarunya, MPT-30B, membuat gelombang di komunitas AI.

Perjalanan LLM MosaicML dimulai dengan peluncuran MPT-7B (Mosaic Pretrained Transformer) pada Mei 2023, yang datang dengan tiga varian:

  1. MPT-7B-StoryWriter-65k+ (untuk generasi cerita panjang)
  2. MPT-7B-Instruct (untuk mengikuti instruksi singkat)
  3. MPT-7B-Chat (untuk generasi dialog)

Model-model ini menyaksikan kesuksesan besar di komunitas ML karena sifatnya yang open-source, kemampuan komersial, dan kemampuan luar biasa untuk menangani jendela konteks yang diperpanjang.

Yang paling penting, model ini setara dan, dalam beberapa kasus, outperformed model lain yang sebanding (LLaMA-7B, StableLM 7B, dll). Pada Juni, seri MPT-7B telah diunduh lebih dari 3 juta kali. Pada 22 Juni, MosaicML merilis MPT-30B, yang meningkatkan batas untuk model dasar open-source.

MPT-30B: LLM Kuat yang Melampaui GPT-3

MPT-30B adalah LLM decoder-based yang open-source dan dilisensikan komersial, yang lebih kuat daripada GPT-3-175B dengan hanya 17% parameter GPT-3, yaitu 30B. Ini outperformed GPT-3 pada beberapa tugas. Berikut adalah perbandingan antara MPT-30B dan GPT-3.

MPT-30B membangun pada model MPT-7B sebelumnya. Ini efisien secara komputasi untuk dilatih dibandingkan dengan model dengan ukuran serupa. Misalnya, LLaMA-30B menggunakan sekitar 1,44 kali lebih banyak FLOPs daripada MPT-30B, sedangkan Falcon-40B memiliki 1,27 kali lebih tinggi FLOPs daripada MPT-30B. Berikut adalah ilustrasi perbaikan MPT-30B pada berbagai tugas daripada pendahulunya.

Beberapa fitur khusus MPT-30B adalah sebagai berikut:

8k Token Jendela Konteks

Jendela konteks dalam LLM merujuk pada rentang token yang dapat dipertimbangkan model sebelum menghasilkan output. MPT-30B memiliki jendela konteks 8000 token pada saat pelatihan. Ini pertama kali dilatih pada 1T token menggunakan urutan 2k token dan kemudian 50B token tambahan dari urutan 8k token (sekitar 6000 kata).

Dukungan ALiBi

Untuk menjelaskan fitur ini, mari kita pertimbangkan pertanyaan:

Bagaimana MPT-30B dapat memahami dan membuat prediksi untuk urutan yang lebih panjang daripada yang dilatih?

MPT-30B menggunakan teknik Attention with Linear Biases (ALiBi) untuk memahami urutan yang lebih panjang dan memperluas jendela konteks di luar 8k token selama fine-tuning atau inferensi.

Bukannya menghitung embedding posisional di mana kita menetapkan vektor ke setiap kata dalam urutan, ALiBi menghitung skor perhatian antara token kunci dan token kueri. Ketika token kunci dan token kueri berdekatan, hukuman rendah tetapi lebih tinggi sebaliknya. Sebagai hasilnya, arsitektur transformer dapat ekstrapolasi ke input panjang.

Kinerja Inferensi & Pelatihan yang Efisien melalui FlashAttention

Perhatian, yaitu fokus pada bagian relevan dari urutan input, adalah komponen kritis dari transformer, tetapi dapat lambat dan intensif memori, terutama saat memproses urutan teks panjang.

FlashAttention adalah pendekatan yang diusulkan oleh peneliti di Cornell University yang menangani masalah ini untuk MPT-30B. Dengan menggunakan teknik yang disebut tiling, FlashAttention mengurangi jumlah kali model perlu membaca dari atau menulis ke memori, mempercepat pemrosesan. Oleh karena itu, model ini menggunakan teknik FlashAttention dan perpustakaan optimasi FasterTransformer dari NVIDIA (NVDA ) untuk kinerja inferensi dan pelatihan yang efisien.

Kemudahan Pelatihan & Penerapan

Pengembang dapat melatih MPT-30B dari awal atau menggunakan titik awal MosaicML untuk penerapan yang lebih cepat. Juga, dapat difinetune untuk kasus penggunaan spesifik domain pada dataset tertentu.

Ukuran model ini dipilih untuk memungkinkan penerapan yang mudah pada satu GPU, khususnya 1xA100-80GB dalam presisi 16-bit atau 1xA100-40GB dalam presisi 8-bit. Ini berarti bahwa model ini dirancang untuk sesuai dengan keterbatasan memori dari GPU ini.

Kemampuan Pemrograman

MPT-30B menyediakan kemampuan pemrograman yang luar biasa. HumanEval adalah dataset yang dirilis oleh OpenAI yang berisi 164 masalah pemrograman yang dibuat dengan tangan. Pada dataset HumanEval, model ini melampaui model LLM yang dirancang khusus, seperti StarCoder series.

Variasi Fine-Tuned: MPT-30B-Instruct & MPT-30B-Chat

MPT-30B-Instruct

LLM utamanya digunakan untuk instruksi seperti menjawab pertanyaan, ringkasan teks, terjemahan bahasa, dll. MPT-30B-Instruct adalah varian MPT-30B yang difinetune khusus untuk tugas mengikuti instruksi. Untuk fine-tuning, dataset berikut digunakan:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Dataset Dolly diperluas dengan dataset Helpful and Harmless dari Anthropic untuk fine-tuning instruksi. Selain itu, berbagai dataset digunakan untuk augmentasi data, yang meliputi:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat adalah varian MPT-30B yang difinetune untuk generasi dialog. Ini adalah artefak penelitian yang dirilis di bawah lisensi CC-By-NC-SA-4.0, yang hanya memungkinkan penggunaan non-komersial. Model ini difinetune menggunakan berbagai dataset bahasa, termasuk:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLM membagi sebagian besar pasar generative AI yang bernilai miliaran dolar, yang telah mengalami pertumbuhan luar biasa dalam waktu singkat setelah ChatGPT merevolusi lanskap tahun lalu. Keluarga MPT adalah bagian integral dari revolusi ini. Di masa depan, kita dapat mengharapkan melihat model open-source yang lebih kuat dan efisien daripada keluarga MPT.

Untuk berita AI terbaru, kunjungi unite.ai.

Haziqa adalah Ilmuwan Data dengan pengalaman luas dalam menulis konten teknis untuk perusahaan AI dan SaaS.