Model dan platform AI
MoE-LLaVA: Campuran Pakar untuk Model Bahasa Visi Besar
Penelitian terbaru tentang Model Bahasa Visi Besar (LVLM) telah menunjukkan bahwa peningkatan skala framework ini secara signifikan meningkatkan kinerja di berbagai tugas downstream. LVLM, termasuk MiniGPT, LLaMA, dan lain-lain, telah mencapai kemampuan luar biasa dengan mengintegrasikan lapisan proyeksi visual dan pengkode gambar ke dalam arsitektur mereka. Dengan mengimplementasikan komponen-komponen ini, LVLM meningkatkan kemampuan persepsi visual Model Bahasa Besar (LLM). Kinerja dapat ditingkatkan lebih lanjut dengan meningkatkan ukuran model dan jumlah parameter, serta memperluas skala dataset.
Model seperti InternVL telah memperluas pengkode gambar mereka hingga lebih dari 6 miliar parameter, sedangkan yang lain telah memperluas backend LVLM hingga 13 miliar parameter, mencapai kinerja superior di berbagai tugas. IDEFICS telah melatih LVLM dengan lebih dari 80 miliar parameter. Metode penskalaan ini telah mencapai atau melampaui kinerja LLM yang telah dipratinjau pada lebih dari 34, 70, atau bahkan 100 miliar parameter. Namun, penskalaan memiliki kelemahan: itu secara signifikan meningkatkan biaya pelatihan dan inferensi. Ini karena itu memerlukan semua parameter untuk aktif untuk setiap token dalam perhitungan, menghasilkan kebutuhan komputasi yang tinggi dan, akibatnya, biaya yang lebih tinggi.
Artikel ini membahas MoE-LLaVA, arsitektur LVLM yang berbasis Mixture of Experts (MoE) yang menggunakan strategi pelatihan efektif, MoE-Tuning, untuk LVLM. MoE-Tuning secara inovatif mengatasi degradasi kinerja dalam pembelajaran kepadatan multi-modal, menghasilkan model dengan jumlah parameter yang besar tetapi biaya pelatihan dan inferensi yang konsisten. Arsitektur MoE-LLaVA dirancang untuk mengaktifkan hanya ahli teratas-k selama penerapan, menjaga ahli yang tidak aktif.
Kami akan mengeksplorasi kerangka kerja MoE-LLaVA, memeriksa mekanisme, metode, arsitektur, dan bagaimana itu membandingkan dengan kerangka kerja generasi gambar dan video terkemuka.
MoE-LLaVA: Meningkatkan Model Bahasa Visi Besar dengan Terjangkau
Selain menggunakan lapisan proyeksi visual dan pengkode gambar, Model Bahasa Visi Besar juga meningkatkan ukuran model dengan meningkatkan jumlah parameter untuk meningkatkan kinerja model. Beberapa contoh Model Bahasa Visi Besar yang telah mengikuti pendekatan ini untuk meningkatkan kinerja mereka adalah MiniGPT-4, InternGPT, InternVL, dan lain-lain. Dalam aplikasi dunia nyata, meningkatkan ukuran Model Bahasa Besar atau Model Bahasa Visi Besar dengan data pelatihan berkualitas tinggi sering menjadi kebutuhan untuk meningkatkan kinerja model. Meskipun meningkatkan ukuran model memperbaiki kinerja, itu juga meningkatkan biaya komputasi pelatihan dan penerapan model, serta meningkatkan komplikasi dan efisiensi penerapan model pada perangkat paralel secara bersamaan. Alasan utama di balik biaya pelatihan dan inferensi yang meningkat serta kebutuhan komputasi adalah bahwa setiap token dalam framework memerlukan perhitungan dengan setiap parameter tunggal dalam model yang dikenal sebagai model padat.
Di sisi lain, model Mixture of Expert (MoE) yang langka telah menunjukkan penskalaan framework yang efektif dengan memproses data dengan bantuan parameter yang diaktifkan tetap, pendekatan yang telah secara luas diadopsi dalam bidang Pemrosesan Bahasa Alami. Namun, menggunakan Mixture of Expert untuk melatih Model Bahasa Visi Besar yang langka secara langsung menantang karena mengubah LLM menjadi LVLM dan memadatkan model secara bersamaan menghasilkan degradasi kinerja yang signifikan. Untuk mengimplementasikan Model Mixture ke LLM dan LVLM, penting untuk memulai dengan menginisialisasi LVLM untuk pemadatan. Untuk mencapai ini, kerangka kerja MoE-LLaVA memperkenalkan MoE-Tuning, strategi pelatihan tiga fase yang sederhana namun efektif.

Seperti yang ditunjukkan pada gambar di atas, proses MoE-Tuning pertama kali melatih Multilayer Perceptron (MLP) yang menyesuaikan token visual dengan Model Bahasa Besar dalam tahap pertama. Kerangka kerja kemudian melatih semua parameter LLM untuk memberdayakan Model Bahasa Visi Besar dengan kemampuan pemahaman multi-modal umum. Akhirnya, pada tahap ketiga, kerangka kerja mereplikasi Jaringan Saraf Feed Forward (FFN) sebagai bobot inisialisasi untuk ahli, dan melatih hanya lapisan Mixture of Expert. Secara keseluruhan, proses pelatihan membantu dalam transisi bertahap model yang langka dari inisialisasi LVLM ke model Mixture of Expert yang langka.
Dengan proses pelatihan yang telah diliput, mari kita soroti MoE-LLaVA, baseline untuk Model Bahasa Visi Besar dengan model Mixture of Expert yang mengintegrasikan router yang dapat dipelajari dan model MoE. Pada intinya, model MoE-LLaVA terdiri dari beberapa jalur yang langka, dan kerangka kerja menggunakan jalur-jalur ini untuk mengirimkan setiap token ke ahli yang berbeda melalui router yang dapat dipelajari. Token-token kemudian diproses secara kolektif oleh ahli yang diaktifkan sementara jalur yang tidak aktif tetap diam. Kerangka kerja kemudian menumpuk lapisan encoder Mixture of Expert secara iteratif untuk menyediakan jalur yang langka menuju Model Bahasa Visi Besar yang lebih besar dan lebih kuat.

Berkat pendekatan yang diimplementasikan oleh kerangka kerja MoE-LLaVA, itu dapat mengungguli model dengan jumlah parameter yang diaktifkan yang serupa, dan melampaui mereka dengan perbedaan yang besar pada benchmark POPE object hallucination, meskipun hanya memiliki 2,2 miliar parameter. Selain itu, kerangka kerja MoE-LLaVA dengan 2,2 miliar parameter dapat mencapai kinerja yang setara dengan kerangka kerja InternVL-Chat-19B dengan hampir 8 kali jumlah parameter yang diaktifkan.
Model Bahasa Besar yang kuat dengan kemampuan generalisasi dan pengikut instruksi yang kuat telah diimplementasikan ke Model Bahasa Visi Besar. Model LLM awal seperti BLIP mengkodekan sinyal visual menjadi urutan token visual yang memungkinkan mereka untuk menyesuaikan visi dengan LLM dengan menggunakan beberapa lapisan proyeksi. Pada saat yang sama, karya terbaru fokus pada meningkatkan kinerja model dengan mengimplementasikan metode seperti memperluas dataset instruksi-pelatihan, meningkatkan resolusi gambar, mengoptimalkan strategi pelatihan, menyelaraskan input, meningkatkan pengkode gambar, dan banyak lagi. Pendekatan-pendekatan ini telah membantu memberdayakan Model Bahasa Visi Besar dengan kemampuan pemahaman visual yang kuat dengan memperluas dataset pelatihan visual dan skala model. Selain itu, beberapa Model Bahasa Visi Besar juga memiliki kemampuan pemahaman gambar yang halus seperti pemahaman wilayah dan multi-wilayah serta kemampuan grounding piksel-bijak. Namun, biaya komputasi yang menyertainya dengan penskalaan data visual yang padat dan model sering sangat tinggi yang membuatnya sulit untuk dilakukan. Di sisi lain, kerangka kerja MoE-LLaVA bertujuan untuk membuat penelitian Model Bahasa Visi Besar lebih terjangkau dengan memanfaatkan kemampuan model MoE.
MoE-LLaVA : Metode dan Arsitektur
Pada intinya, kerangka kerja MoE-LLaVA terdiri dari lapisan proyeksi visual (Multilayer Perceptron), pengkode visi, blok MoE, beberapa blok LLM yang ditumpuk, dan lapisan penyematan kata.

Arsitektur
Tabel berikut merangkum konfigurasi rinci kerangka kerja MoE-LLaVA.

Untuk gambar RGB yang diberikan, pengkode visi memproses gambar untuk mendapatkan urutan token visual dengan lapisan proyeksi visual yang memetakan urutan token visual ke gambar input. Input teks diproses oleh lapisan penyematan kata yang kemudian memproyeksikan untuk mendapatkan token urutan. Pada saat yang sama, kerangka kerja MoE-LLaVA menghubungkan token teks dan visual, dan memberi makan mereka ke LLM. Namun, kerangka kerja hanya melatih lapisan proyeksi visual dengan model bahasa besar yang terdiri dari FFN atau Lapisan Perhatian Mandiri, dan menerapkan koneksi residual dan normalisasi lapisan ke setiap blok.
Melanjutkan, kerangka kerja MoE-LLaVA mereplikasi FFN atau Jaringan Saraf Feed Forward dari tahap kedua untuk membentuk ensemble ahli sebagai langkah inisialisasi. Router, yang merupakan lapisan linier, memprediksi probabilitas setiap token yang ditugaskan ke setiap ahli. Setiap token diproses oleh ahli teratas-k dengan probabilitas maksimum, dan menghitung jumlah terbobot berdasarkan hasil softmax dari probabilitas. Setelah ahli teratas-k diaktifkan, model menonaktifkan ahli yang tersisa, pendekatan yang memungkinkan kerangka kerja MoE-LLaVA memiliki jalur yang langka yang tak terhingga, sehingga memberdayakan model dengan kemampuan yang luas.
MoE-Tuning
MoE-Tuning adalah strategi pelatihan tiga fase yang sederhana namun efektif yang pertama kali melatih Multilayer Perceptron yang menyesuaikan token visual dengan Model Bahasa Besar dalam tahap pertama. Kerangka kerja kemudian melatih semua parameter LLM untuk memberdayakan Model Bahasa Visi Besar dengan kemampuan pemahaman multi-modal umum. Akhirnya, pada tahap ketiga, kerangka kerja mereplikasi FFN atau Jaringan Saraf Feed Forward sebagai bobot inisialisasi untuk ahli, dan melatih hanya lapisan Mixture of Expert.
Tahap 1
Pada tahap pertama, tujuan utama adalah menyesuaikan token gambar dengan model bahasa besar yang memungkinkan LLM untuk memahami contoh dalam gambar. Kerangka kerja MoE-LLaVA menggunakan Multilayer Perceptron untuk memproyeksikan token gambar ke domain input model bahasa besar, dan memperlakukan patch gambar sebagai token teks semu. Pada tahap ini, kerangka kerja MoE-LLaVA melatih LLM untuk mendeskripsikan gambar, dan tidak menerapkan lapisan MoE ke LLM selama tahap ini.
Tahap 2
Pada tahap kedua, kerangka kerja MoE-LLaVA mencoba meningkatkan kemampuan dan kontrol kerangka kerja dengan menyesuaikan model dengan data instruksi multi-modal. Kerangka kerja MoE-LLaVA mencapai ini dengan menyesuaikan LLM untuk menjadi Model Bahasa Visi Besar dengan kemampuan pemahaman multi-modal. Kerangka kerja menggunakan instruksi yang lebih kompleks, termasuk tugas pengenalan teks dan penalaran logis gambar yang memerlukan model untuk memiliki kemampuan multi-modal yang lebih kuat. Secara tradisional, proses pelatihan untuk model padat dianggap selesai pada langkah ini. Namun, kerangka kerja MoE-LLaVA menghadapi tantangan dalam mengubah LLM menjadi Model Bahasa Visi Besar secara bersamaan dengan memadatkan Model Bahasa Visi Besar. Untuk mengatasi tantangan ini, kerangka kerja menggunakan bobot dari tahap sebagai inisialisasi untuk tahap berikutnya dalam upaya untuk mengurangi kesulitan pembelajaran model yang langka.
Tahap 3
Pada tahap ketiga, model mereplikasi jaringan saraf feed forward beberapa kali untuk menginisialisasi ahli sebagai prosedur inisialisasi. Kerangka kerja kemudian memberi makan token teks dan gambar ke lapisan Mixture of Expert, diikuti oleh router yang menghitung bobot pertandingan antara ahli dan setiap token. Setiap token kemudian diproses oleh ahli teratas-k dengan output agregat yang dihitung dengan jumlah terbobot berdasarkan bobot router. Setelah ahli teratas-k diaktifkan, model menonaktifkan ahli yang tersisa, pendekatan yang memungkinkan kerangka kerja MoE-LLaVA memiliki jalur yang langka yang tak terhingga, sehingga memberdayakan model dengan kemampuan yang luas.
MoE-LLaVA : Hasil dan Eksperimen
Kerangka kerja MoE-LLaVA mengadopsi CLIP-Large sebagai pengkode visi dengan Multilayer Perceptron yang terdiri dari dua lapisan dengan lapisan aktivasi GELU yang memisahkan keduanya. Secara default, kerangka kerja menggunakan penggantian alternatif dari jaringan saraf feed forward dengan lapisan Mixture of Expert, yang berarti lapisan Mixture of Expert membentuk 50% dari total jumlah lapisan. Tabel berikut berisi dataset yang berbeda beserta ukuran sampel yang digunakan untuk melatih dan mengevaluasi kerangka kerja MoE-LLaVA.

Pertanyaan dan Jawaban Gambar Tanpa Pelatihan
Gambar berikut menunjukkan bahwa MoE-LLaVA adalah model yang langka dengan router yang lembut berdasarkan Model Bahasa Visi Besar. Kerangka kerja dievaluasi pada 5 benchmark pertanyaan dan jawaban gambar, dan seperti yang dapat dilihat, kerangka kerja MoE-LLaVA menunjukkan kemampuan pemahaman gambar yang luar biasa, dan memberikan kinerja yang setara dengan kerangka kerja LLaVA 1.5 pada lima benchmark yang berbeda.

Evaluasi Hallusinasi Objek
Untuk mengevaluasi hallusinasi objek, kerangka kerja MoE-LLaVA mengadopsi pipeline evaluasi POPE, metode pertanyaan berbasis polling, dan hasilnya ditunjukkan pada tabel berikut. Seperti yang dapat dilihat, dari semua kerangka kerja, MoE-LLaVA memberikan hasil terkuat, menunjukkan kemampuan kerangka kerja untuk menghasilkan objek yang konsisten dengan gambar input. Selain itu, perlu diingat bahwa kerangka kerja MoE-LLaVA menyeimbangkan rasio ya dengan baik, menunjukkan kemampuan model yang langka untuk memberikan umpan balik yang akurat untuk pertanyaan yang diberikan.

Gambar berikut berisi distribusi beban ahli, di mana garis-garis yang tidak berkelanjutan mewakili distribusi token yang seimbang di antara modality atau ahli. Gambar pertama menggambarkan beban kerja di dalam ahli, sementara gambar yang tersisa menunjukkan kinerja ahli terhadap modality yang berbeda.

Selanjutnya, gambar berikut menunjukkan distribusi modality di seluruh ahli.

Pemikiran Akhir
Dalam artikel ini, kita telah membahas MoE-LLaVA, baseline untuk Model Bahasa Visi Besar dengan model Mixture of Expert yang mengintegrasikan router yang dapat dipelajari dan model MoE. Pada intinya, model MoE-LLaVA terdiri dari beberapa jalur yang langka, dan kerangka kerja menggunakan jalur-jalur ini untuk mengirimkan setiap token ke ahli yang berbeda melalui router yang dapat dipelajari. Token-token kemudian diproses secara kolektif oleh ahli yang diaktifkan sementara jalur yang tidak aktif tetap diam. Kerangka kerja kemudian menumpuk lapisan encoder Mixture of Expert secara iteratif untuk menyediakan jalur yang langka menuju Model Bahasa Visi Besar yang lebih besar dan lebih kuat. Strategi MoE-Tuning mengatasi masalah degradasi kinerja dalam pembelajaran kepadatan multi-modal secara inovatif, menghasilkan model dengan jumlah parameter yang besar tetapi biaya pelatihan dan inferensi yang konsisten. Arsitektur kerangka kerja MoE-LLaVA dirancang untuk mengaktifkan hanya ahli teratas-k selama penerapan, menjaga ahli yang tidak aktif.












