Modele și platforme AI

LLaVA-UHD: Percepe eficient imagini în orice raport de aspect și rezoluție ridicată

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Progresul recent și avansul Modelelor Lingvistice Mari a experimentat o creștere semnificativă a capacităților de raționament, înțelegere și interacțiune vizual-lingvistică. Cadrele moderne realizează acest lucru prin proiectarea semnalelor vizuale în Modelele Lingvistice Mari pentru a le permite să perceapă lumea în mod vizual, o varietate de scenarii care se bazează pe strategii de codificare vizuală. Cu toate acestea, imaginile din lumea reală nu conțin nu numai o varietate de scenarii, dar variază și semnificativ în ceea ce privește rezoluțiile și raportul de aspect, ceea ce reprezintă o provocare semnificativă pentru Modelele Lingvistice Mari în diferite domenii și sarcini. Pentru a aborda varianța semnificativă pe care o prezintă imaginile din lumea reală, modeleele lingvistice mari percep imagini într-o rezoluție scăzută, de exemplu 224×224, și un raport de aspect fix, de exemplu 1:1. Deși compromisul de a rămâne la o rezoluție scăzută și un raport de aspect fix crește generalizabilitatea Modelelor Lingvistice Mari în aplicații din lumea reală, acesta duce adesea la imagini foarte blurate și la o distorsionare severă a formei. Acest compromis afectează semnificativ capacitățile modelelor multimodale mari sau LMM, în special cele optimizate pentru sarcini fine, cum ar fi recunoașterea caracterelor optice și înțelegerea obiectelor mici. Deoarece rezoluția și raportul de aspect sunt predefinite, modelele pot face doar presupuneri despre imaginile blurate, ceea ce duce la halucinații ale modelului, o situație în care modelul produce răspunsuri textuale care nu sunt bazate pe fapte din imagini.

În acest articol, vom discuta despre LLaVA-UHD, o abordare nouă care ia cadrele LLaVA-1.5 și GPT-4V ca exemple reprezentative și încearcă să expună defectele sistemice din strategia lor de codificare vizuală. Cadruul LLaVA-UHD, un model multimodal, este o încercare de a aborda aceste provocări. Cadruul LLaVA-UHD poate percepe imagini în rezoluție ridicată și în orice raport de aspect. Cadruul LLaVA-UHD se bazează pe trei componente cheie. Primul, o strategie de modularizare a imaginilor care împarte imagini cu rezoluție nativă în felii mai mici, cu dimensiuni variabile, în încercarea de a îmbunătăți eficiența și de a extinde codificarea. Următorul, un modul de compresie care condensează tokenurile de imagine produse de codificatorii vizuali. În final, o schemă spațială care organizează tokenurile de felii pentru Modelele Lingvistice Mari. Experimentele cuprinzătoare indică faptul că cadruul LLaVA-UHD este capabil să depășească Modelele Lingvistice Mari de ultimă generație în 9 benchmark-uri. Mai mult, prin utilizarea a doar 94% din computația de inferență, cadruul LLaVA-UHD este capabil să suporte imagini cu o rezoluție de 6 ori mai mare, de exemplu 672×1088.

LLaVA-UHD: Percepe eficient imagini în orice raport de aspect și rezoluție ridicată

Raționamentul, înțelegerea și interacțiunea vizual-lingvistică au făcut progrese semnificative în ultimul timp, în mare parte datorită impulsului recent pentru Modelele Lingvistice Mari. În cadrele moderne, acest lucru se realizează prin introducerea semnalelor vizuale în Modelele Lingvistice Mari pentru a le permite să interpreteze lumea reală în mod vizual, o varietate de scenarii care se bazează pe strategii de codificare vizuală. Diferența de scenariu reflectă o acoperire îngustă a Modelelor Lingvistice Mari în diferite domenii și sarcini, în timp ce diferența de rezoluție și raport de aspect revelează variațiile mari intraclasses ale imaginilor din lumea reală, care sunt greu de gestionat. În contrast cu scară mică, care reduce variația, modelele după BERT abordează semnificația din rezoluția scăzută (de exemplu, pentru LLaVA-UHD, 224×224) a imaginilor cu un raport de aspect fix, 1:1, pentru a oferi imaginilor din lumea reală. Deși acest compromis este util pentru a asigura generalizabilitatea Modelelor Lingvistice Mari în aplicații din lumea reală, acesta duce adesea la imagini foarte blurate și la o distorsionare severă a formei. Acest compromis afectează semnificativ capacitățile modelelor multimodale mari sau LMM, în special cele optimizate pentru sarcini fine, cum ar fi recunoașterea caracterelor optice și înțelegerea obiectelor mici. Deoarece rezoluția și raportul de aspect sunt predefinite, modelele pot face doar presupuneri despre imaginile blurate, ceea ce duce la halucinații ale modelului, o situație în care modelul produce răspunsuri textuale care nu sunt bazate pe fapte din imagini. De ce nu percep Modelele Lingvistice Mari de referință imagini în rezoluție ridicată și raport de aspect variabil?

Există două motive principale pentru care Modelele Lingvistice Mari de referință nu pot percepe imagini cu rezoluție ridicată și raport de aspect variabil. Primul, deoarece codificatorii vizuali sunt antrenați în rezoluții fixe, acest lucru face dificil pentru model și codificator să gestioneze imagini cu raport de aspect și rezoluție variabilă, afectând semnificativ adaptabilitatea modelului. Al doilea, codificarea directă a imaginilor de înaltă rezoluție utilizând transformatori de viziune este asociată cu costuri de calcul semnificative în funcție de dimensiunea imaginilor. Mai mult, costurile de calcul pot fi semnificativ mai mari pentru Modelele Lingvistice Mari pentru a procesa un număr mare de tokenuri vizuale pentru imagini de înaltă rezoluție, afectând semnificativ eficiența generală a modelului. Pentru a contracara aceste provocări, LLaVA-UHD, un model multimodal care percep imagini de înaltă rezoluție și orice raport de aspect, ia cadrele LLaVA-1.5 și GPT-4V ca exemple reprezentative și încearcă să expună defectele sistemice din strategia lor de codificare vizuală.

Imaginea de mai sus reflectă rezultatele experimentale ale GPT-4V în identificarea numărului de obiecte dintr-o imagine. La nivel fundamental, cadruul LLaVA-UHD are trei componente. Primul, o strategie de modularizare a imaginilor care împarte imagini cu rezoluție nativă în felii mai mici, cu dimensiuni variabile, pentru a extinde codificarea și a îmbunătăți eficiența. În contrast cu Modelele Lingvistice Mari recente care ajustează imagini la câteva rezoluții și rapoarte de aspect fixe, feliile cu dimensiuni variabile generate de LLaVA-UHD permit o adaptabilitate deplină la imaginile cu rezoluție nativă fără a distorsiona formele, a redimensiona sau a umple. Al doilea, modelul condensează tokenurile vizuale printr-un strat de compresie la o lungime modestă, reducând semnificativ calculul pentru Modelele Lingvistice Mari. În final, modelul organizează tokenurile de felii comprimate într-o schemă spațială pentru a informa Modelele Lingvistice Mari despre pozițiile feliilor în imagini.

LLaVA-UHD: Metodologie și Arhitectură

Pe baza învățămintelor din experimentele pilot pentru a studia cadrele existente, inclusiv GPT-4V și LLaVA-1.5, cadruul LLaVA-UHD implementează o arhitectură cu trei componente, așa cum se arată în imaginea de mai jos.

Primul, o strategie de modularizare a imaginilor care împarte imagini cu rezoluție nativă în felii mai mici, cu dimensiuni variabile, pentru a extinde codificarea și a îmbunătăți eficiența. Următorul, un modul de compresie care condensează tokenurile de imagine produse de codificatorii vizuali. În final, o schemă spațială care organizează tokenurile de felii pentru Modelele Lingvistice Mari. Să aruncăm o privire detaliată asupra acestor componente.

Codificare Vizuală Modularizată

O abordare comună pentru a face față imaginilor de înaltă rezoluție cu raport de aspect variabil este de a interpolarea încorporărilor de poziție ale Transformatorului de Viziune sau ViT la forma țintă pentru codificarea directă ca întreg. Cu toate acestea, implementarea acestei abordări este adesea însoțită de costuri de calcul ridicate și de probleme de distribuție care duc la o deteriorare suplimentară a performanței. Pentru a aborda această provocare, cadruul LLaVA-UHD prezintă o strategie de codificare vizuală modularizată care împarte imagini cu rezoluție nativă în felii mai mici, cu dimensiuni variabile, unde forma fiecărei felii este foarte aproape de setarea standard de antrenament a transformatorului de viziune. Datorită utilizării feliilor cu dimensiuni variabile, cadruul LLaVA-UHD este capabil să atingă o adaptabilitate deplină la imaginile cu rezoluție nativă fără a implementa o reconfigurare sau umplere care distorsionează formele. Mai mult, obiectivul principal al strategiei de felii de imagine este de a determina o divizare a imaginilor de înaltă rezoluție cu modificări minime ale rezoluției fiecărei felii. Pentru o imagine cu o anumită rezoluție (w, h) și un transformator de viziune antrenat într-o altă rezoluție, cadruul LLaVA-UHD determină mai întâi numărul ideal de felii necesare pentru a procesa imaginea. Apoi, cadruul factorizează numărul de felii în m coloane și n rânduri. Cadruul definește apoi o funcție de scor pentru a măsura deviația de la setarea standard de antrenament a transformatorului de viziune. Teoretic, strategia de partiționare implementată în arhitectura LLaVA-UHD garantează modificări minore și schimbări modice în ceea ce privește rezoluția standard de antrenament pentru fiecare felie.

Mai mult, majoritatea Modelelor Lingvistice Mari existente implementează o rezoluție statică pentru codificarea feliilor de imagine, o abordare care împiedică adaptabilitatea deplină a modelului la rezoluțiile native, deoarece au acces doar la câteva felii cu forme fixe predefinite. În plus, rezoluția statică a feliilor afectează negativ performanța, eficiența și corectitudinea modelului, deoarece implică inevitabil o reconfigurare sau umplere care distorsionează formele. Pentru a aborda această problemă, cadruul LLaVA-UHD propune să codifice felii de imagine în raport de aspect, așa cum este definit de strategia de partiționare. Mai exact, LLaVA-UHD ajustează imaginea originală proporțional în conformitate cu raportul de aspect, astfel încât numărul de patch-uri să se potrivească în bugetul de antrenament, adică numărul de secvențe de încorporare de poziție în transformatorul de viziune, în mod maxim. Modelul LLaVA-UHD reconfigurează apoi secvența de încorporare de poziție 1D preantrenată a transformatorului de viziune într-un format 2D în conformitate cu setările sale de antrenament.

Strat de Compresie

O problemă comună pe care Modelele Lingvistice Mari o întâmpină la procesarea imaginilor de înaltă rezoluție este că numărul de tokenuri vizuale pe care trebuie să le proceseze este semnificativ mai mare (de exemplu, cadruul LLaVA-1.5 produce aproximativ 3500 de tokenuri vizuale la procesarea unei singure imagini cu rezoluția 672×1008), reprezentând o parte semnificativă a resurselor de calcul și a costurilor. Pentru a aborda această provocare, modelul LLaVA-UHD implementează un strat de resampling perceiver partajat pentru a compresa tokenurile vizuale ale fiecărei felii de imagine. Modelul implementează apoi un set de vectori de interogare prin atenție încrucișată pentru a resamplează ieșirea tokenurilor de imagine de către codificatorii vizuali la un număr mai mic. În comparație cu strategiile de proiecție vizuală bazate pe MLP, abordarea perceiver sample implementată de LLaVA-UHD este capabilă să mențină un număr fix și accesibil de tokenuri vizuale, indiferent de rezoluția imaginii, făcând cadruul LLaVA-UHD mai compatibil cu sarcinile de procesare și înțelegere a imaginilor de înaltă rezoluție. Pentru a ilustra acest lucru, cadruul LLaVA-UDH generează același număr de tokenuri la codificarea unei imagini cu rezoluția 672×1008 ca și cadruul LLaVA-1.5 la codificarea unei imagini cu rezoluția 336×336, aproximativ de 6 ori mai eficient decât concurentul său.

Schemă Spațială pentru Felii de Imagine

Este o practică necesară să informați Modelele Lingvistice Mari despre organizarea spațială a feliilor de imagine, deoarece partiționarea imaginilor este dinamică pentru diferite imagini. Cadruul LLaVA-UHD proiectează și implementează o schemă spațială care utilizează două tokenuri speciale pentru a informa Modelele Lingvistice Mari despre poziția relativă a feliilor de imagine. Sub această schemă spațială, cadruul LLaVA-UHD utilizează „,” pentru a separa reprezentările feliilor într-un rând, iar rândurile diferite sunt separate utilizând „n”.

LLaVA-UDH: Experimente și Rezultate

Cadruul LLaVA-UHD este evaluat împotriva a 9 benchmark-uri populare, inclusiv benchmark-uri generale de întrebări vizuale, benchmark-uri de întrebări vizuale bazate pe caractere optice, benchmark-uri de halucinație și benchmark-uri cuprinzătoare. Mai mult, cadruul LLaVA-UHD este comparat cu linii de bază puternice, inclusiv LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2 și altele.

Performanța cadruului LLaVA-UHD pe 9 benchmark-uri populare este rezumată și comparată cu benchmark-urile populare în tabela de mai jos.

Pe baza performanței de mai sus, se poate concluziona că cadruul LLaVA-UHD este capabil să depășească modelele de bază puternice pe benchmark-uri populare, inclusiv modele de bază puternice antrenate pe o cantitate semnificativ mai mare de date, precum și să depășească Modelele Lingvistice Mari care necesită mai multă putere de calcul, cum ar fi Fuyu-8B, Monkey și altele. În al doilea rând, rezultatele indică, de asemenea, că cadruul LLaVA-UHD obține rezultate semnificativ mai bune decât arhitectura LLaVA-1.5 și, pe de o parte, unde LLaVA-1.5 suportă o rezoluție fixă de 336×336, cadruul LLaVA-UHD suportă imagini cu rezoluția 672×1088 și orice raport de aspect, și același număr de tokenuri vizuale.

Gânduri Finale

În acest articol, am discutat despre LLaVA-UHD, o abordare nouă care ia cadrele LLaVA-1.5 și GPT-4V ca exemple reprezentative și încearcă să expună defectele sistemice din strategia lor de codificare vizuală. Cadruul LLaVA-UHD, un model multimodal, este o încercare de a aborda aceste provocări. Cadruul LLaVA-UHD poate percepe imagini în rezoluție ridicată și în orice raport de aspect. Cadruul LLaVA-UHD se bazează pe trei componente cheie. Primul, o strategie de modularizare a imaginilor care împarte imagini cu rezoluție nativă în felii mai mici, cu dimensiuni variabile, pentru a extinde codificarea și a îmbunătăți eficiența. Următorul, un modul de compresie care condensează tokenurile de imagine produse de codificatorii vizuali. În final, o schemă spațială care organizează tokenurile de felii pentru Modelele Lingvistice Mari. Experimentele cuprinzătoare indică faptul că cadruul LLaVA-UHD este capabil să depășească Modelele Lingvistice Mari de ultimă generație pe 9 benchmark-uri. Mai mult, prin utilizarea a doar 94% din computația de inferență, cadruul LLaVA-UHD este capabil să suporte imagini cu o rezoluție de 6 ori mai mare, de exemplu 672×1088.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.