Model dan platform AI
Model LLM Terkuat Sumber Terbuka: Meta LLAMA 3.1-405B
Llama 3.1-405B, dikembangkan oleh Meta AI, merupakan lompatan besar dalam model bahasa sumber terbuka. Dengan 405 miliar parameter, ini adalah model bahasa terbesar yang tersedia secara publik hingga saat ini, mengungguli beberapa model proprietari canggih dalam berbagai benchmark.
Fitur Utama:
- 405 miliar parameter
- 128K panjang konteks token
- Dukungan multibahasa (8 bahasa)
- Versi yang disesuaikan dengan instruksi tersedia
- Sumber terbuka dengan lisensi permissive
Pengeluaran model sekuat ini di domain sumber terbuka adalah permainan yang berubah, mendemokratisasi akses ke kemampuan AI mutakhir dan mendorong inovasi di seluruh industri.
Arsitektur Model dan Pelatihan
Prosesnya dimulai dengan token teks input yang diubah menjadi token embedding. Embedding ini melewati beberapa lapisan self-attention dan jaringan feedforward, memungkinkan model untuk menangkap hubungan dan ketergantungan kompleks dalam teks. Mekanisme dekoding autoregresif kemudian menghasilkan token teks output, menyelesaikan proses.

-
Perhatian Query Terkelompok (GQA)
Llama 3.1 menggunakan Perhatian Query Terkelompok, yang merupakan teknik optimasi penting yang tidak sepenuhnya tercakup dalam respons sebelumnya. Mari kita jelajahi ini lebih lanjut:
Perhatian Query Terkelompok (GQA) adalah varian dari perhatian multi-kepala yang bertujuan untuk mengurangi biaya komputasi dan penggunaan memori selama inferensi, terutama untuk urutan panjang. Dalam model Llama 3.1 405B, GQA diimplementasikan dengan 8 kepala nilai-kunci.
Berikut cara GQA bekerja:
- Alih-alih memiliki proyeksi kunci dan nilai terpisah untuk setiap kepala perhatian, GQA mengelompokkan beberapa kepala query untuk berbagi kunci dan nilai yang sama.
- Pengelompokan ini secara signifikan mengurangi jumlah parameter dalam proyeksi kunci dan nilai, mengarah ke ukuran model yang lebih kecil dan inferensi yang lebih cepat.
- Perhitungan perhatian dapat dinyatakan sebagai:
Perhatian(Q, K, V) = softmax(QK^T / sqrt(d_k))VDi mana Q dikelompokkan menjadi g kelompok, dan K dan V memiliki lebih sedikit kepala daripada Q.
Manfaat GQA dalam Llama 3.1 405B termasuk:
- Jejak memori yang berkurang: Lebih sedikit proyeksi kunci dan nilai berarti lebih sedikit memori yang diperlukan untuk menyimpan parameter model.
- Inferensi yang lebih cepat: Dengan lebih sedikit komputasi yang diperlukan untuk proyeksi kunci dan nilai, kecepatan inferensi ditingkatkan.
- Kinerja yang dipertahankan: Meskipun penurunan parameter, GQA telah terbukti mempertahankan kinerja yang setara dengan perhatian multi-kepala standar dalam banyak tugas.
-
Pelatihan Pra-Dua Tahap untuk Konteks yang Diperluas
Artikel tersebut menyebutkan proses pelatihan pra-dua tahap untuk mencapai jendela konteks 128K token. Ini adalah aspek penting dari kemampuan Llama 3.1 405B:
Tahap 1: Pelatihan Awal pada 8K Token
- Model pertama kali dilatih pada urutan hingga 8K token.
- Tahap ini memungkinkan model untuk mempelajari pemahaman dan kemampuan generasi bahasa umum.
Tahap 2: Pelatihan Lanjutan untuk Perluasan Konteks
- Setelah pelatihan awal, model menjalani pelatihan lanjutan untuk meningkatkan panjang konteks hingga 128K token.
- Tahap ini melibatkan rejimen pelatihan yang dirancang dengan hati-hati untuk membantu model menggeneralisasi ke urutan yang lebih panjang tanpa kehilangan kemampuan untuk menangani konteks yang lebih pendek.
-
Kemampuan Multimodal
Sementara respons sebelumnya menyentuh kemampuan multimodal, kita dapat memperluas bagaimana Llama 3.1 405B mengimplementasikan ini:
Pendekatan Komposisi:
- Llama 3.1 405B menggunakan pengkode yang terpisah untuk modalitas yang berbeda (misalnya, gambar, ucapan).
- Pengkode ini mengubah input dari berbagai modalitas ke dalam ruang embedding yang sama yang dapat dipahami oleh model bahasa.
Integrasi dengan Model Bahasa:
- Keluaran dari pengkode khusus ini kemudian dimasukkan ke dalam model bahasa utama.
- Hal ini memungkinkan Llama 3.1 405B untuk memproses dan memahami data dari berbagai jenis secara bersamaan, memungkinkan untuk melakukan tugas yang melibatkan beberapa modalitas.
Mekanisme Perhatian Silang:
- Untuk menangani integrasi modalitas yang berbeda, Llama 3.1 405B kemungkinan menggunakan mekanisme perhatian silang.
- Mekanisme ini memungkinkan model untuk memperhatikan informasi relevan dari modalitas yang berbeda saat menghasilkan teks atau melakukan tugas lainnya.
Kemampuan multimodal Llama 3.1 405B membuka berbagai kemungkinan aplikasi, seperti:
- Kapion gambar dan jawaban pertanyaan visual
- Transkripsi ucapan-ke-teks dengan pemahaman kontekstual
- Tugas penalaran multimodal yang menggabungkan teks, gambar, dan potensi jenis data lainnya
Detail Pelatihan
- Dilatih pada lebih dari 15 triliun token
- Klaster GPU khusus dengan 39,3M jam GPU untuk model 405B
- Kurasi dataset yang beragam untuk kemampuan multibahasa
Versi yang disesuaikan dengan instruksi menjalani pelatihan tambahan:
- Dituning halus pada dataset instruksi yang tersedia secara publik
- Lebih dari 25M contoh yang dihasilkan secara sintetis
- Pelatihan Halus yang Diawasi (SFT) dan Pembelajaran Penguatan dengan Umpan Balik Manusia (RLHF)
Benchmark Kinerja
Tabel membandingkan Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni, dan Claude 3.5 Sonnet. Benchmark kunci termasuk tugas umum seperti MMLU dan IFEval, tugas kode seperti HumanEval dan GSM8K, dan tugas penalaran seperti ARC Challenge. Setiap skor benchmark mencerminkan kemampuan model dalam memahami dan menghasilkan teks yang mirip dengan manusia, memecahkan masalah kompleks, dan menjalankan kode. Secara khusus, Llama 3.1 405B dan Claude 3.5 Sonnet unggul dalam beberapa benchmark, menunjukkan kemampuan canggih mereka dalam tugas umum dan khusus domain.
Arah Masa Depan
Pengeluaran Llama 3.1-405B kemungkinan akan mempercepat inovasi di beberapa area:
- Teknik penyesuaian yang ditingkatkan untuk domain khusus
- Pengembangan metode inferensi yang lebih efisien
- Peningkatan kompresi model dan penyulingan
Kesimpulan
Llama 3.1-405B mewakili tonggak penting dalam AI sumber terbuka, menawarkan kemampuan yang sebelumnya eksklusif untuk model proprietari.
Ketika kita terus menjelajahi kekuatan model ini, penting untuk mendekatinya dengan tanggung jawab dan pertimbangan etis. Alat dan pengaman yang disediakan bersama model menawarkan kerangka untuk penerapan yang bertanggung jawab, tetapi kewaspadaan dan kolaborasi komunitas yang berkelanjutan akan menjadi kunci untuk memastikan bahwa teknologi kuat ini digunakan untuk kepentingan masyarakat.














