Model dan platform AI
Meningkatkan Kinerja Model Bahasa Besar dengan Prediksi Multi-Token
Model bahasa besar (LLM) seperti GPT, LLaMA, dan lain-lain telah mengambil alih dunia dengan kemampuan luar biasa mereka untuk memahami dan menghasilkan teks seperti manusia. Namun, meskipun kemampuan mereka yang mengesankan, metode standar untuk melatih model ini, yang dikenal sebagai “prediksi token berikutnya,” memiliki beberapa keterbatasan bawaan.
Dalam prediksi token berikutnya, model dilatih untuk memprediksi token berikutnya dalam sebuah urutan yang diberikan sebelumnya. Meskipun pendekatan ini telah terbukti berhasil, itu dapat menyebabkan model yang mengalami kesulitan dengan ketergantungan jangka panjang dan tugas penalaran yang kompleks. Selain itu, kesenjangan antara rejim pelatihan (pengajaran guru) dan proses generasi autoregresif selama inferensi dapat menghasilkan kinerja yang suboptimal.
Sebuah makalah penelitian terbaru oleh Gloeckle et al. (2024) dari Meta AI memperkenalkan sebuah paradigma pelatihan baru yang disebut “prediksi multi-token” yang bertujuan untuk mengatasi keterbatasan ini dan meningkatkan kinerja model bahasa besar. Dalam posting blog ini, kita akan mempelajari konsep inti, detail teknis, dan implikasi potensial dari penelitian ini.
Prediksi Token Tunggal: Pendekatan Konvensional
Sebelum mempelajari detail prediksi multi-token, penting untuk memahami pendekatan konvensional yang telah menjadi kuda tunggangan pelatihan model bahasa besar selama bertahun-tahun – prediksi token tunggal, juga dikenal sebagai prediksi token berikutnya.
Paradigma Prediksi Token Berikutnya
Dalam paradigma prediksi token berikutnya, model bahasa dilatih untuk memprediksi token berikutnya dalam sebuah urutan yang diberikan sebelumnya. Lebih formal, model tersebut diberi tugas untuk memaksimalkan kemungkinan token berikutnya xt+1, yang diberikan token sebelumnya x1, x2, …, xt. Ini biasanya dilakukan dengan meminimalkan kerugian entropi silang:
L = -Σt log P(xt+1 | x1, x2, …, xt)
Tujuan pelatihan sederhana namun kuat ini telah menjadi dasar dari banyak model bahasa besar yang sukses, seperti GPT (Radford et al., 2018), BERT (Devlin et al., 2019), dan varian mereka.
Pengajaran Guru dan Generasi Autoregresif
Prediksi token berikutnya bergantung pada teknik pelatihan yang disebut “pengajaran guru” di mana model diberikan kebenaran tanah untuk setiap token masa depan selama pelatihan. Ini memungkinkan model untuk belajar dari konteks dan urutan target yang benar, memfasilitasi pelatihan yang lebih stabil dan efisien.
Namun, selama inferensi atau generasi, model beroperasi dalam cara autoregresif, memprediksi satu token pada satu waktu berdasarkan token yang dihasilkan sebelumnya. Kesenjangan antara rejim pelatihan (pengajaran guru) dan rejim inferensi (generasi autoregresif) dapat menghasilkan kinerja yang suboptimal, terutama untuk urutan yang lebih panjang atau tugas penalaran yang kompleks.
Keterbatasan Prediksi Token Berikutnya
Meskipun prediksi token berikutnya telah terbukti sangat sukses, itu juga memiliki beberapa keterbatasan bawaan:
- Fokus Jangka Pendek: Dengan hanya memprediksi token berikutnya, model mungkin mengalami kesulitan untuk menangkap ketergantungan jangka panjang dan struktur keseluruhan serta kohesi teks, yang dapat menyebabkan inkonsistensi atau generasi yang tidak kohesif.
- Penguncian Pola Lokal: Model prediksi token berikutnya dapat mengunci pola lokal dalam data pelatihan, membuatnya sulit untuk menggeneralisasi ke skenario atau tugas yang memerlukan penalaran abstrak lebih.
- Kemampuan Penalaran: Untuk tugas yang melibatkan penalaran multi-langkah, pemikiran algoritmik, atau operasi logika kompleks, prediksi token berikutnya mungkin tidak menyediakan bias induktif atau representasi yang cukup untuk mendukung kemampuan tersebut secara efektif.
- Inefisiensi Sampel: Karena sifat lokal dari prediksi token berikutnya, model mungkin memerlukan dataset pelatihan yang lebih besar untuk memperoleh pengetahuan dan kemampuan penalaran yang diperlukan, yang dapat menyebabkan inefisiensi sampel potensial.
Keterbatasan ini telah memotivasi peneliti untuk menjelajahi paradigma pelatihan alternatif, seperti prediksi multi-token, yang bertujuan untuk mengatasi beberapa kelemahan ini dan membuka kemampuan baru untuk model bahasa besar.
Dengan membandingkan pendekatan prediksi token berikutnya yang konvensional dengan teknik prediksi multi-token yang baru, pembaca dapat lebih menghargai motivasi dan manfaat potensial dari yang terakhir, yang memungkinkan penjelajahan lebih dalam tentang penelitian ini.
Apa itu Prediksi Multi-Token?
Gagasan utama di balik prediksi multi-token adalah melatih model bahasa untuk memprediksi beberapa token masa depan secara bersamaan, bukan hanya token berikutnya. Secara khusus, selama pelatihan, model diberi tugas untuk memprediksi n token berikutnya pada setiap posisi dalam corpus pelatihan, menggunakan n kepala output independen yang beroperasi di atas model batang yang dibagikan.
Misalnya, dengan pengaturan prediksi 4-token, model akan dilatih untuk memprediksi 4 token berikutnya sekaligus, yang diberikan konteks sebelumnya. Pendekatan ini mendorong model untuk menangkap ketergantungan jangka panjang dan mengembangkan pemahaman yang lebih baik tentang struktur keseluruhan dan kohesi teks.
Contoh Sederhana
Untuk memahami konsep prediksi multi-token dengan lebih baik, mari kita pertimbangkan contoh sederhana. Misalkan kita memiliki kalimat berikut:
“The quick brown fox jumps over the lazy dog.”
Dalam pendekatan prediksi token berikutnya yang standar, model akan dilatih untuk memprediksi kata berikutnya yang diberikan konteks sebelumnya. Misalnya, yang diberikan konteks “The quick brown fox jumps over the,” model akan diberi tugas untuk memprediksi kata berikutnya, “lazy.”
Dengan prediksi multi-token, namun, model akan dilatih untuk memprediksi beberapa kata masa depan secara bersamaan. Misalnya, jika kita mengatur n=4, model akan dilatih untuk memprediksi 4 kata berikutnya secara bersamaan. Yang diberikan konteks yang sama “The quick brown fox jumps over the,” model akan diberi tugas untuk memprediksi urutan “lazy dog .” (Perhatikan spasi setelah “dog” untuk menunjukkan akhir kalimat).
Dengan melatih model untuk memprediksi beberapa token masa depan secara bersamaan, model didorong untuk menangkap ketergantungan jangka panjang dan mengembangkan pemahaman yang lebih baik tentang struktur keseluruhan dan kohesi teks.
Detail Teknis
Penulis mengusulkan arsitektur sederhana namun efektif untuk mengimplementasikan prediksi multi-token. Model tersebut terdiri dari batang transformer yang dibagikan yang menghasilkan representasi laten dari konteks input, diikuti oleh n lapisan transformer independen (kepala output) yang memprediksi token masa depan yang sesuai.
Selama pelatihan, langkah maju dan mundur diatur dengan hati-hati untuk meminimalkan jejak memori GPU. Batang yang dibagikan menghitung representasi laten, dan kemudian setiap kepala output secara berurutan melakukan langkah maju dan mundur, mengakumulasikan gradien pada tingkat batang. Pendekatan ini menghindari materialisasi semua vektor logit dan gradien mereka secara bersamaan, mengurangi penggunaan memori GPU puncak dari O(nV + d) menjadi O(V + d), di mana V adalah ukuran vokabuler dan d adalah dimensi representasi laten.
Implementasi yang Efisien dalam Memori
Salah satu tantangan dalam melatih prediktor multi-token adalah mengurangi penggunaan memori GPU mereka. Karena ukuran vokabuler (V) biasanya jauh lebih besar daripada dimensi representasi laten (d), vektor logit menjadi bottleneck penggunaan memori GPU.
Untuk mengatasi tantangan ini, penulis mengusulkan implementasi yang efisien dalam memori yang dengan hati-hati menyesuaikan urutan operasi maju dan mundur. Sebagai gantinya untuk materialisasi semua logit dan gradien mereka secara bersamaan, implementasi secara berurutan menghitung langkah maju dan mundur untuk setiap kepala output independen, mengakumulasikan gradien pada tingkat batang.
Pendekatan ini menghindari penyimpanan semua vektor logit dan gradien mereka dalam memori secara bersamaan, mengurangi penggunaan memori GPU puncak dari O(nV + d) menjadi O(V + d), di mana n adalah jumlah token masa depan yang diprediksi.
Kelebihan Prediksi Multi-Token
Makalah penelitian ini menyajikan beberapa kelebihan yang menggembirakan dari menggunakan prediksi multi-token untuk melatih model bahasa besar:
- Efisiensi Sampel yang Ditingkatkan: Dengan mendorong model untuk memprediksi beberapa token masa depan secara bersamaan, prediksi multi-token mengarah pada efisiensi sampel yang lebih baik. Penulis menunjukkan perbaikan kinerja yang signifikan pada tugas pemahaman dan generasi kode, dengan model hingga 13B parameter yang menyelesaikan sekitar 15% lebih banyak masalah rata-rata.
- Inferensi yang Lebih Cepat: Kepala output tambahan yang dilatih dengan prediksi multi-token dapat dimanfaatkan untuk decoding spekulatif mandiri, varian dari decoding spekulatif yang memungkinkan prediksi token paralel. Ini menghasilkan waktu inferensi yang lebih cepat hingga 3x di berbagai ukuran batch, bahkan untuk model yang besar.
- Memfasilitasi Ketergantungan Jangka Panjang: Prediksi multi-token mendorong model untuk menangkap ketergantungan jangka panjang dan pola dalam data, yang sangat bermanfaat untuk tugas yang memerlukan pemahaman dan penalaran atas konteks yang lebih luas.
- Penalaran Algoritmik: Penulis menyajikan eksperimen pada tugas sintetis yang menunjukkan superioritas prediksi multi-token dalam mengembangkan kemampuan penalaran algoritmik, terutama untuk ukuran model yang lebih kecil.
- Kohesi dan Konsistensi: Dengan melatih model untuk memprediksi beberapa token masa depan secara bersamaan, prediksi multi-token mendorong pengembangan representasi yang kohesif dan konsisten. Ini sangat bermanfaat untuk tugas yang memerlukan generasi teks yang lebih panjang dan kohesif, seperti cerita, artikel, atau manual instruksi.
- Generalisasi yang Ditingkatkan: Eksperimen penulis pada tugas sintetis menunjukkan bahwa model prediksi multi-token menunjukkan kemampuan generalisasi yang lebih baik, terutama dalam pengaturan di luar distribusi. Ini mungkin karena kemampuan model untuk menangkap pola dan ketergantungan jangka panjang, yang dapat membantu model untuk menggeneralisasi lebih efektif ke skenario yang tidak terlihat.

Contoh dan Intuisi
Untuk memberikan lebih banyak intuisi tentang mengapa prediksi multi-token bekerja dengan baik, mari kita pertimbangkan beberapa contoh:
- Generasi Kode: Dalam konteks generasi kode, memprediksi beberapa token secara bersamaan dapat membantu model memahami dan menghasilkan struktur kode yang lebih kompleks. Misalnya, ketika menghasilkan definisi fungsi, memprediksi hanya token berikutnya mungkin tidak memberikan konteks yang cukup untuk model untuk menghasilkan tanda tangan fungsi yang benar. Namun, dengan memprediksi beberapa token secara bersamaan, model dapat menangkap ketergantungan antara nama fungsi, parameter, dan jenis pengembalian, menghasilkan generasi kode yang lebih akurat dan kohesif.
- Penalaran Bahasa Alam: Pertimbangkan skenario di mana model bahasa diberi tugas untuk menjawab pertanyaan yang memerlukan penalaran atas beberapa langkah atau potongan informasi. Dengan memprediksi beberapa token secara bersamaan, model dapat menangkap ketergantungan antara komponen proses penalaran, menghasilkan respons yang lebih kohesif dan akurat.
- Generasi Teks Panjang: Ketika menghasilkan teks panjang, seperti cerita, artikel, atau laporan, mempertahankan kohesi dan konsistensi selama periode yang lama dapat menjadi tantangan bagi model bahasa yang dilatih dengan prediksi token berikutnya. Prediksi multi-token mendorong model untuk mengembangkan representasi yang menangkap struktur keseluruhan dan aliran teks, menghasilkan generasi teks panjang yang lebih kohesif.
Keterbatasan dan Arah Masa Depan
Meskipun hasil yang disajikan dalam makalah ini mengesankan, ada beberapa keterbatasan dan pertanyaan terbuka yang memerlukan penyelidikan lebih lanjut:
- Jumlah Token Optimal: Makalah ini menjelajahi nilai-nilai yang berbeda dari n (jumlah token masa depan untuk diprediksi) dan menemukan bahwa n=4 bekerja dengan baik untuk banyak tugas. Namun, nilai optimal dari n mungkin bergantung pada tugas spesifik, dataset, dan ukuran model. Mengembangkan metode yang sistematis untuk menentukan n optimal dapat mengarah pada perbaikan kinerja lebih lanjut.
- Ukuran Vokabuler dan Tokenisasi: Penulis mencatat bahwa ukuran vokabuler optimal dan strategi tokenisasi untuk model prediksi multi-token mungkin berbeda dari yang digunakan untuk model prediksi token berikutnya. Menjelajahi aspek ini dapat mengarah pada trade-off yang lebih baik antara panjang urutan yang dikompresi dan efisiensi komputasi.
- Kerugian Prediksi Tambahan: Penulis menyarankan bahwa pekerjaan mereka dapat memicu minat dalam mengembangkan kerugian prediksi tambahan yang novel untuk model bahasa besar, di luar prediksi token berikutnya yang standar. Menyelidiki kerugian tambahan alternatif dan kombinasi mereka dengan prediksi multi-token adalah arah penelitian yang menarik.
- Pemahaman Teoritis: Meskipun makalah ini menyajikan beberapa intuisi dan bukti empiris untuk efektivitas prediksi multi-token, pemahaman teoritis yang lebih dalam tentang mengapa dan bagaimana pendekatan ini bekerja dengan baik akan sangat berharga.
Kesimpulan
Makalah penelitian “Model Bahasa Besar yang Lebih Baik dan Lebih Cepat melalui Prediksi Multi-Token” oleh Gloeckle et al. memperkenalkan paradigma pelatihan baru yang memiliki potensi untuk secara signifikan meningkatkan kinerja dan kemampuan model bahasa besar. Dengan melatih model untuk memprediksi beberapa token masa depan secara bersamaan, prediksi multi-token mendorong pengembangan ketergantungan jangka panjang, kemampuan penalaran algoritmik, dan efisiensi sampel yang lebih baik.
Implementasi teknis yang diusulkan oleh penulis sederhana namun efektif, membuatnya memungkinkan untuk diterapkan pada pelatihan model bahasa besar skala besar. Selain itu, kemampuan untuk memanfaatkan decoding spekulatif mandiri untuk inferensi yang lebih cepat adalah kelebihan praktis yang signifikan.
Meskipun masih ada pertanyaan terbuka dan area untuk dijelajahi lebih lanjut, penelitian ini merupakan langkah maju yang menarik dalam bidang model bahasa besar. Ketika permintaan akan model bahasa yang lebih mampu dan efisien terus tumbuh, prediksi multi-token dapat menjadi komponen kunci dalam generasi model AI yang akan datang.















