Modele și platforme AI

EAGLE: Explorarea spațiului de proiectare pentru modele de limbaj mari multimodale cu o combinație de codificatori

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Capacitatea de a interpreta cu acuratețe informații vizuale complexe este un focus crucial pentru modelele de limbaj mari multimodale (MLLM). Lucrările recente arată că percepția vizuală îmbunătățită reduce semnificativ halucinațiile și îmbunătățește performanța la sarcini sensibile la rezoluție, cum ar fi recunoașterea optică a caracterelor și analiza documentelor. Mai multe MLLM recente realizează acest lucru prin utilizarea unei combinații de codificatori de viziune. În ciuda succesului lor, există o lipsă de comparații sistematice și studii de ablație detaliate care abordează aspecte critice, cum ar fi selectarea experților și integrarea mai multor experți în viziune. Acest articol oferă o explorare extinsă a spațiului de proiectare pentru MLLM utilizând o combinație de codificatori de viziune și rezoluții, cadrul Eagle care încearcă să exploreze spațiul de proiectare pentru modele de limbaj mari multimodale cu o combinație de codificatori. Rezultatele relevă mai multe principii subiacente comune diferitelor strategii existente, ducând la o abordare de proiectare eficientă și eficace. Eagle descoperă că simpla concatenare a tokenilor vizuali de la o serie de codificatori de viziune complementari este la fel de eficientă ca și arhitecturile de amestecare mai complexe sau strategii. În plus, Eagle introduce Pre-Align pentru a combina gap-ul dintre codificatori de viziune focalizați pe viziune și tokeni de limbaj, îmbunătățind coerența modelului. Rezultatul este o familie de MLLM, Eagle, care depășește alte modele deschise de top pe principalele benchmark-uri MLLM.

Lucrarea Eagle este legată de arhitectura generală de proiectare a modelelor de limbaj mari multimodale (MLLM). Pe lângă linia de cercetare deschisă menționată anterior, alte familii notabile de MLLM includ, dar nu se limitează la, MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini și Llama 3.1. În funcție de modul în care semnalele vizuale sunt integrate în modelul de limbaj, MLLM pot fi împărțite în general în modele “cross-modal attention” și “prefix-tuning”. Primul injectează informații vizuale în diferite straturi ale LLM utilizând atenție cross-modală, în timp ce al doilea tratează tokenii vizuali ca parte a secvenței de tokeni de limbaj și îi anexează direct cu încorporări de text. Modelul Eagle aparține familiei prefix-tuning, urmând o arhitectură multimodală în stil LLaVA.

Lucrarea Eagle este strâns legată de cercetările axate pe îmbunătățirea proiectării codificatorilor de viziune pentru MLLM. Lucrările timpurii au adoptat în general codificatori de viziune pre-antrenați pe sarcini de aliniere viziune-limbaj, cum ar fi CLIP și EVA-CLIP. Codificatori de viziune mai puternici, cum ar fi SigLIP și InternVL, au fost propuși pentru a îmbunătăți sarcinile de viziune-limbaj cu proiectări mai bune, dimensiuni de model mai mari și rețete de antrenare mai eficiente. Deoarece modelele sunt adesea pre-antrenate pe imagini de joasă rezoluție și pot lipsi capacitatea de a codifica detalii fine, adaptarea la o rezoluție mai mare este adesea efectuată pentru a crește rezoluția de intrare a MLLM. În plus față de adaptarea la o rezoluție mai mare, modele precum LLaVA-NeXT, LLaVA-UHD, Monkey, InternLM-XComposer și InternVL utilizează tehnici de divizare sau divizare adaptivă pentru a gestiona intrările de înaltă rezoluție, unde imaginile sunt împărțite în patch-uri de joasă rezoluție și procesate separat.

EAGLE: Utilizarea unei combinații de codificatori pentru a explora spațiul de proiectare pentru MLLM

Succesul modelelor de limbaj mari (LLM) a generat un interes semnificativ pentru a permite capacitățile lor de percepție vizuală, permițându-le să vadă, să înțeleagă și să raționeze în lumea reală. La baza acestor modele de limbaj mari multimodale (MLLM) se află o proiectare tipică în care imaginile sunt convertite într-o serie de tokeni vizuali de către codificatorii de viziune și anexate cu încorporările de text. CLIP este adesea ales ca codificator de viziune, deoarece reprezentarea sa vizuală este aliniată cu spațiul text prin pre-antrenare pe perechi de imagini-text.

Pentru a aborda aceste întrebări, Eagle investighează sistematic spațiul de proiectare pentru MLLM utilizând o combinație de codificatori de viziune și rezoluții. Explorarea acestui spațiu de proiectare implică următorii pași: 1) Evaluarea diferiților codificatori de viziune și căutarea unei adaptări la o rezoluție mai mare; 2) Realizarea unei comparații “la fel” între strategiile de fuziune a codificatorilor de viziune; 3) Identificarea progresivă a combinației optime de codificatori de viziune multiple; 4) Îmbunătățirea pre-alinierii experților în viziune și a mixării datelor.

Eagle își extinde apoi toate descoperirile și extinde abordarea la mai mulți experți în viziune cu rezoluții și cunoștințe de domeniu diferite. Utilizând aceleași date de pre-antrenare ca LLaVA-1.5, care constă în 595k de perechi de imagini-text, Eagle trece la etapa de finisare supravegheată prin colectarea de date dintr-o serie de sarcini și transformarea lor în conversații multimodale, incluzând LLaVA-1.5, Laion-GPT4V, ShareGPT-4V, DocVQA, synDog-EN, ChartQA, DVQA și AI2D, rezultând în 934k de exemple.

Modelul este pre-antrenat cu perechi de imagini-text pentru o epocă cu o dimensiune a lotului de 256, unde întregul model este înghețat, și doar stratul de proiectare este actualizat. În a doua etapă, modelul este finisat pe datele de finisare supravegheată pentru o epocă cu o dimensiune a lotului de 128. Pentru această explorare, Eagle utilizează Vicuna-7B ca model de limbaj subiacent.

Eagle: Metodologie și Arhitectură

În contrast cu metodele anterioare care se concentrează pe noi paradigme de fuziune sau arhitecturi între codificatori de viziune, obiectivul lui Eagle este de a identifica o proiectare minimalistă pentru a fuziona diferiți codificatori de viziune, sprijinită de ablații detaliate și eliminarea oricăror componente inutile. Eagle pornește prin extinderea codificatorului de bază CLIP la un set de experți în viziune cu arhitecturi, sarcini de pre-antrenare și rezoluții diferite.

În cele din urmă, Eagle combină toate descoperirile și extinde abordarea la mai mulți experți în viziune cu rezoluții și cunoștințe de domeniu diferite. Utilizând aceleași date de pre-antrenare ca LLaVA-1.5, Eagle trece la etapa de finisare supravegheată prin colectarea de date dintr-o serie de sarcini și transformarea lor în conversații multimodale.

Codificator CLIP mai puternic

Eagle începe explorarea cu modelul CLIP, deoarece a devenit alegerea principală pentru multe MLLM. În timp ce modelele CLIP sunt cunoscute pentru a îmbunătăți sarcinile multimodale, limitările lor au fost, de asemenea, bine documentate. De exemplu, multe MLLM existente tind să utilizeze rezoluțiile pre-antrenate CLIP (cum ar fi 224 × 224 sau 336 × 336) ca rezoluții de intrare.

Eagle: Experimente și Rezultate

După ce și-a dezvoltat strategiile, Eagle a stabilit următoarele principii pentru model: (1) integrarea mai multor experți în viziune cu o rețetă de antrenare optimizată; (2) combinarea mai multor experți în viziune prin concatenare directă a canalelor; (3) pre-antrenarea experților în viziune separată prin pre-aliniere. În această secțiune, pentru a demonstra în continuare avantajele modelelor Eagle, se incorporează date de antrenare suplimentare, iar Eagle este comparat cu MLLM actuale de top pe diverse sarcini.

Sarcini de întrebări și răspunsuri vizuale

Eagle compară seria de modele pe trei benchmark-uri de întrebări și răspunsuri vizuale, incluzând GQA, VQAv2 și VizWiz. Eagle-X5 obține performanțe de top pe GQA și VQAv2, subliniind avantajele integrării experților în viziune suplimentari.

Sarcini de recunoaștere optică a caracterelor și înțelegere a graficelor

Pentru a evalua capacitățile de recunoaștere optică a caracterelor, documente și grafice ale lui Eagle, modelul este evaluat pe OCRBench, TextVQA și ChartQA. Eagle depășește semnificativ competitorii pe TextVQA, beneficiind de arhitectura sa de înaltă rezoluție și integrarea diferiților codificatori de viziune.

Evaluarea benchmark-ului multimodal

Eagle este evaluat pe șapte benchmark-uri pentru MLLM pentru a demonstra capacitățile sale din diverse perspective, incluzând MME, MMBench, SEED, MathVista, MMMU, ScienceQA și POPE. Eagle raportează scorul de percepție pentru MME, divizia en_dev pentru MMBench, divizia de imagine a SEED, divizia test-mini a MathVista, divizia val a MMMU, scorul F1 pentru POPE și scorul de imagine pentru ScienceQA.

Gânduri finale

În acest articol, am discutat despre Eagle, o analiză aprofundată a spațiului de proiectare pentru integrarea codificatorilor de viziune în modele de limbaj mari multimodale. În contrast cu lucrările anterioare care se concentrează pe proiectarea de noi paradigme de fuziune, Eagle descoperă că alegerile de proiectare sistematice contează și descoperă o serie de tehnici utile. Pas cu pas, Eagle optimizează rețeta de antrenare a codificatorilor de viziune individuali, identifică o metodă de fuziune extensibilă și eficientă și combină treptat codificatori de viziune cu cunoștințe de domeniu diferite. Rezultatele subliniază importanța critică a considerentelor de bază ale spațiului de proiectare.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.