Model dan platform AI

LongWriter: Mengeluarkan 10.000+ Kata Generasi dari Konteks LLM Panjang

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
LONGWRITER: UNLEASHING 10,000+ WORD GENERATION FROM LONG CONTEXT LLMS

Model bahasa besar konteks panjang saat ini dapat memproses input hingga 100.000 token, namun mereka berjuang untuk menghasilkan output melebihi panjang 2.000 kata. Eksperimen terkontrol mengungkapkan bahwa panjang generasi efektif model secara inheren dibatasi oleh contoh yang dilihat selama pelatihan yang diawasi (SFT). Dengan kata lain, keterbatasan output ini berasal dari kelangkaan contoh output panjang dalam dataset SFT yang ada.

Pertumbuhan terbaru dalam model bahasa besar konteks panjang telah mengarah pada pengembangan model dengan kapasitas memori yang jauh lebih besar, yang dapat memproses sejarah yang melebihi 100.000 token. Namun, meskipun kemampuan mereka untuk menangani input yang luas, model bahasa besar konteks panjang saat ini berjuang untuk menghasilkan output yang sama panjangnya.

Untuk mengeksplorasi keterbatasan ini, LongWriter menyelidiki panjang output maksimum model konteks panjang mutakhir dengan beberapa pertanyaan yang memerlukan respons dengan panjang yang bervariasi, seperti “Tulis artikel 10.000 kata tentang sejarah Kekaisaran Romawi.” Hasilnya menunjukkan bahwa semua model secara konsisten gagal menghasilkan output melebihi 2.000 kata. Sementara itu, analisis log interaksi pengguna mengungkapkan bahwa lebih dari 1% prompt pengguna secara eksplisit meminta output melebihi batas ini, menyoroti kebutuhan mendesak dalam penelitian saat ini untuk mengatasi keterbatasan ini.

Untuk mengatasi hal ini, LongWriter memperkenalkan AgentWrite, sebuah pipa agent berbasis yang merancang untuk menggunakan model bahasa besar konteks panjang untuk secara otomatis mengkonstruksi output yang panjang dan koheren. AgentWrite beroperasi dalam dua tahap: Pertama, ia membuat rencana penulisan yang terperinci yang menguraikan struktur dan target kata untuk setiap paragraf berdasarkan input pengguna. Kemudian, mengikuti rencana ini, ia meminta model untuk menghasilkan konten untuk setiap paragraf secara berurutan. LongWriter memvalidasi bahwa AgentWrite dapat menghasilkan output yang berkualitas tinggi dan koheren hingga 20.000 kata.

LongWriter juga mengembangkan LongBench-Write, sebuah benchmark komprehensif untuk mengevaluasi kemampuan generasi ultra-panjang. Model 9B parameter, yang ditingkatkan lebih lanjut melalui DPO, mencapai kinerja terbaik pada benchmark ini, melampaui bahkan model propietary yang lebih besar.

Dalam artikel ini, kita akan membahas kerangka LongWriter, menjelajahi arsitektur, dan membandingkan kinerjanya dengan model bahasa besar konteks panjang mutakhir. Mari kita mulai.

LongWriter: 10.000+ Kata Generasi Kerangka

LongWriter menyelidiki panjang output maksimum model konteks panjang mutakhir dengan beberapa pertanyaan yang memerlukan respons dengan panjang yang bervariasi, seperti “Tulis artikel 10.000 kata tentang sejarah Kekaisaran Romawi.” Berdasarkan temuan, LongWriter mengamati bahwa semua model secara konsisten gagal menghasilkan output melebihi 2.000 kata. Selain itu, analisis log interaksi pengguna mengungkapkan bahwa lebih dari 1% prompt pengguna secara eksplisit meminta output melebihi batas ini, menyoroti kebutuhan mendesak dalam penelitian saat ini untuk mengatasi keterbatasan ini.

LongWriter menemukan bahwa keterbatasan panjang output terutama disebabkan oleh karakteristik dataset SFT. Secara khusus, LongWriter menemukan bahwa panjang generasi maksimum model secara efektif dibatasi oleh batas atas panjang output yang hadir dalam dataset SFT, meskipun model telah terpapar pada urutan yang jauh lebih panjang selama fase pra-pelatihan. Temuan ini menjelaskan keterbatasan generasi 2.000 kata yang umum di seluruh model saat ini, karena dataset SFT yang ada jarang mengandung contoh yang melebihi panjang ini.

LongWriter memperkenalkan AgentWrite, sebuah pipa agent berbasis yang dirancang untuk menggunakan model bahasa besar konteks panjang untuk secara otomatis mengkonstruksi output yang panjang dan koheren. AgentWrite beroperasi dalam dua tahap: Pertama, ia membuat rencana penulisan yang terperinci yang menguraikan struktur dan target kata untuk setiap paragraf berdasarkan input pengguna. Kemudian, mengikuti rencana ini, ia meminta model untuk menghasilkan konten untuk setiap paragraf secara berurutan.

LongWriter memvalidasi bahwa AgentWrite dapat menghasilkan output yang berkualitas tinggi dan koheren hingga 20.000 kata. LongWriter juga mengembangkan LongBench-Write, sebuah benchmark komprehensif untuk mengevaluasi kemampuan generasi ultra-panjang. Model 9B parameter, yang ditingkatkan lebih lanjut melalui DPO, mencapai kinerja terbaik pada benchmark ini, melampaui bahkan model propietary yang lebih besar.

AgentWrite: Konstruksi Data Otomatis

LongWriter merancang AgentWrite, sebuah pipa agent berbasis yang dirancang untuk menggunakan model bahasa besar konteks panjang untuk secara otomatis mengkonstruksi output yang panjang dan koheren. AgentWrite beroperasi dalam dua tahap: Pertama, ia membuat rencana penulisan yang terperinci yang menguraikan struktur dan target kata untuk setiap paragraf berdasarkan input pengguna. Kemudian, mengikuti rencana ini, ia meminta model untuk menghasilkan konten untuk setiap paragraf secara berurutan.

Langkah I: Rencana

LongWriter menggunakan kemampuan perencanaan model bahasa besar konteks panjang untuk menghasilkan rencana penulisan yang terperinci berdasarkan input pengguna. Rencana ini termasuk konten utama dan target kata untuk setiap paragraf.

Langkah II: Tulis

Setelah mendapatkan rencana penulisan dari Langkah I, LongWriter meminta model untuk menghasilkan konten untuk setiap paragraf secara berurutan. Untuk memastikan koherensi output, LongWriter meminta model untuk menghasilkan konten untuk setiap paragraf berdasarkan rencana penulisan dan konten yang telah ditulis sebelumnya.

Validasi

LongWriter memvalidasi metode AgentWrite pada dua dataset penulisan panjang. Hasilnya menunjukkan bahwa AgentWrite dapat menghasilkan output yang berkualitas tinggi dan koheren hingga 20.000 kata.

Pelatihan yang Diawasi

LongWriter melakukan pelatihan pada dua model terbaru, yaitu GLM-4-9B dan Llama-3.1-8B. Kedua model ini adalah model dasar dan mendukung jendela konteks hingga 128k token, membuatnya secara alami cocok untuk pelatihan pada output panjang.

Pelarasan (DPO)

LongWriter melakukan pelarasan langsung pada model LongWriter-9B untuk meningkatkan kualitas output dan kemampuan mengikuti panjang output yang diinginkan. Hasilnya menunjukkan bahwa pelarasan langsung dapat meningkatkan kualitas output dan kemampuan mengikuti panjang output yang diinginkan.

LongWriter: Eksperimen dan Hasil

LongWriter mengevaluasi empat model propietary dan lima model terbuka pada LongBench-Write, serta model LongWriter yang dilatih. Hasilnya menunjukkan bahwa model LongWriter dapat menghasilkan output yang panjang dan berkualitas tinggi, melampaui model propietary yang lebih besar.

Model Sebelumnya Tidak Dapat Memenuhi Persyaratan Panjang Melebihi 2.000 Kata

LongWriter menemukan bahwa model sebelumnya tidak dapat memenuhi persyaratan panjang melebihi 2.000 kata, sedangkan model LongWriter dapat menghasilkan output yang panjang dan berkualitas tinggi.

Pelarasan Langsung Meningkatkan Kualitas Output dan Kemampuan Mengikuti Panjang Output

LongWriter menemukan bahwa pelarasan langsung dapat meningkatkan kualitas output dan kemampuan mengikuti panjang output yang diinginkan.

Batas Panjang Output Model LongWriter Diperpanjang hingga 10k-20k Kata

LongWriter menemukan bahwa batas panjang output model LongWriter diperpanjang hingga 10k-20k kata, namun lebih banyak data dengan output panjang diperlukan untuk mendukung output yang lebih panjang.

Pemikiran Akhir

Dalam pekerjaan ini, kita telah membahas LongWriter, sebuah pipa agent berbasis yang merancang untuk mengkonstruksi output yang panjang dan koheren. LongWriter telah berhasil meningkatkan panjang output model bahasa besar konteks panjang hingga 10.000 kata dengan menggunakan data LongWriter-6k. Studi ablatif pada data pelatihan menunjukkan efektivitas pendekatan ini. Untuk pekerjaan masa depan, LongWriter menyarankan tiga arah: 1. Memperluas kerangka AgentWrite untuk mengkonstruksi data dengan output yang lebih panjang. 2. Mengembangkan kerangka AgentWrite untuk mencapai kualitas output yang lebih tinggi. 3. Output model yang lebih panjang membawa tantangan pada efisiensi inferensi. Beberapa metode telah diajukan untuk meningkatkan efisiensi inferensi. Layak untuk menyelidiki bagaimana metode ini dapat memastikan efisiensi model yang ditingkatkan tanpa mengorbankan kualitas generasi.

Seorang insinyur oleh profesi, seorang penulis oleh hati. Kunal adalah seorang penulis teknis dengan cinta yang mendalam & pemahaman tentang AI dan ML, yang didedikasikan untuk menyederhanakan konsep-konsep kompleks dalam bidang ini melalui dokumentasi yang menarik dan informatif.