Modele și platforme AI
Mini-Gemini: Accelerarea Modelelor de Limbaj Vizual Multi-Modale
Progresele înregistrate în domeniul modelelor de limbaj mari au accelerat semnificativ dezvoltarea procesării limbajului natural, sau NLP. Introducerea framework-ului transformer s-a dovedit a fi un moment important, facilitând dezvoltarea unei noi valuri de modele de limbaj, inclusiv OPT și BERT, care prezintă o înțelegere lingvistică profundă. Mai mult, apariția modelului GPT, sau Generative Pre-trained Transformer, a introdus un nou paradigme cu modelare auto-regresivă și a stabilit o metodă robustă pentru predicția și generarea limbajului. Apariția modelelor de limbaj precum GPT-4, ChatGPT, Mixtral, LLaMA și altele a alimentat evoluția rapidă, fiecare model demonstrând performanțe îmbunătățite în sarcinile care implică procesarea complexă a limbajului. Printre metodele existente, ajustarea instrucțiunilor a apărut ca o tehnică cheie pentru rafinarea output-ului modelelor de limbaj mari pre-antrenate, iar integrarea acestor modele cu instrumente specifice pentru sarcini vizuale a subliniat adaptabilitatea și a deschis porți pentru aplicații viitoare. Acestea se extind mult dincolo de procesarea tradițională bazată pe text a LLM-urilor, incluzând interacțiuni multi-modale.
În plus, convergența dintre procesarea limbajului natural și modelele de viziune a dat naștere modelelor de limbaj vizual, sau VLM, care combină modele lingvistice și de viziune pentru a obține o înțelegere și capacitate de raționament cross-modal. Integrarea și apariția modelelor vizuale și lingvistice au jucat un rol crucial în avansarea sarcinilor care necesită atât procesarea limbajului, cât și înțelegerea vizuală. Apariția unor modele revoluționare precum CLIP a mai îmbunătățit legătura dintre sarcinile vizuale și modelele de limbaj, demonstrând fezabilitatea și practicitatea aplicațiilor cross-modale. Cadre mai recente, precum LLaMA și BLIP, folosesc date de instruire personalizate pentru a dezvolta strategii eficiente care demonstrează capacitățile puternice ale modelului. În plus, combinarea modelelor de limbaj mari cu ieșiri de imagine este focusul cercetărilor multi-modale recente, cu metode recente care pot ocoli generarea directă prin utilizarea abordării de recuperare a imaginilor pentru a produce ieșiri de imagini și texte alternate.

Cu toate acestea, și în ciuda progreselor rapide în modelele de limbaj vizual care facilitează raționamentul de bază și dialogul vizual, există încă o lacună semnificativă de performanță între modele avansate precum GPT-4 și modelele de limbaj vizual. Mini-Gemini este o încercare de a reduce această lacună care există între modelele de limbaj vizual și modelele mai avansate, prin exploatarea potențialului VLM-urilor din trei aspecte: generare ghidată de VLM, date de înaltă calitate și tokeni vizuali de înaltă rezoluție. Pentru a îmbunătăți tokenii vizuali, framework-ul Mini-Gemini propune utilizarea unui encoder vizual suplimentar pentru rafinarea de înaltă rezoluție fără creșterea numărului de tokeni vizuali. Framework-ul Mini-Gemini construiește, de asemenea, un set de date de înaltă calitate în încercarea de a promova o înțelegere precisă a imaginilor și generarea bazată pe raționament. În general, framework-ul Mini-Gemini încearcă să exploateze potențialul modelelor de limbaj vizual și să împuternicească cadrele existente cu capacități de raționament, înțelegere și generare de imagini, simultan. Acest articol își propune să acopere framework-ul Mini-Gemini în profunzime și explorăm mecanismul, metodologia, arhitectura framework-ului, împreună cu comparația cu cadrele de ultimă generație.
Mini-Gemini: Accelerarea Modelelor de Limbaj Vizual Multi-Modale
De-a lungul anilor, modelele de limbaj mari au evoluat și acum posedă capacități multi-modale remarcabile, devenind o parte esențială a modelelor de limbaj vizual actuale. Cu toate acestea, există o lacună între performanța multi-modală a modelelor de limbaj mari și modelele de limbaj vizual, cercetările recente căutând modalități de a combina viziunea cu modelele de limbaj mari folosind imagini și videoclipuri. Pentru sarcinile vizuale în sine, rezoluția imaginii este un element crucial pentru a descrie în mod explicit mediul înconjurător cu halucinații vizuale minime. Pentru a reduce această lacună, cercetătorii dezvoltă modele pentru a îmbunătăți înțelegerea vizuală în modelele de limbaj vizual actuale, și două dintre cele mai comune abordări sunt: creșterea rezoluției și creșterea numărului de tokeni vizuali. Deși creșterea numărului de tokeni vizuali cu imagini de rezoluție mai mare îmbunătățește înțelegerea vizuală, îmbunătățirea este adesea însoțită de cerințe computaționale crescute și costuri asociate, în special atunci când se procesează multiple imagini. Mai mult, capacitățile modelelor existente, calitatea datelor existente și aplicabilitatea rămân inadecvate pentru un proces de dezvoltare accelerat, lăsând cercetătorii cu întrebarea, “cum să accelereze dezvoltarea modelelor de limbaj vizual cu costuri acceptabile”?
Framework-ul Mini-Gemini este o încercare de a răspunde la această întrebare, încercând să exploreze potențialul modelelor de limbaj vizual din trei aspecte: generare ghidată de VLM, date de înaltă calitate și tokeni vizuali de înaltă rezoluție. Mai întâi, framework-ul Mini-Gemini implementează o arhitectură ConvNet pentru a genera candidați de înaltă rezoluție în mod eficient, îmbunătățind detaliile vizuale în timp ce menține numărul de tokeni vizuali pentru modelul de limbaj mare. Framework-ul Mini-Gemini combină seturi de date de înaltă calitate disponibile public pentru a îmbunătăți calitatea datelor și integrează aceste îmbunătățiri cu modele generative și de limbaj mare de ultimă generație, în încercarea de a îmbunătăți performanța VLM-urilor și de a îmbunătăți experiența utilizatorului. Strategia multi-fațetată implementată de framework-ul Mini-Gemini îi permite să exploreze capacități ascunse ale modelelor de limbaj vizual și să obțină progrese semnificative, cu constrângeri de resurse evidente.

În general, framework-ul Mini-Gemini utilizează un paradigme “orice la orice” deoarece poate gestiona atât text, cât și imagini ca intrare și ieșire. În special, framework-ul Mini-Gemini introduce o pipeline eficientă pentru îmbunătățirea tokenilor vizuali pentru imagini de intrare și prezintă un sistem de dual-encoder, compus din două encodere: primul encoder este pentru imagini de înaltă rezoluție, în timp ce al doilea encoder este pentru încorporări vizuale de calitate scăzută. În timpul inferenței, encoderele funcționează într-un mecanism de atenție, unde encoderul de calitate scăzută generează interogări vizuale, în timp ce encoderul de înaltă rezoluție oferă chei și valori de referință. Pentru a îmbunătăți calitatea datelor, framework-ul Mini-Gemini colectează și produce mai multe date pe baza resurselor publice, incluzând instrucțiuni orientate spre sarcini, date legate de generare și răspunsuri de înaltă rezoluție, cu cantitatea și calitatea crescută îmbunătățind performanța și capacitățile modelului. Mai mult, framework-ul Mini-Gemini susține generarea concurrentă de text și imagini ca urmare a integrării modelului de limbaj vizual cu modele generative avansate.
Mini-Gemini: Metodologie și Arhitectură
La nivelul său fundamental, framework-ul Mini-Gemini este conceptual simplu și constă din trei componente.
- Framework-ul utilizează encodere vizuale duale pentru a oferi încorporări vizuale de calitate scăzută și candidați de înaltă rezoluție.
- Framework-ul propune implementarea mineritului de informații la nivel de patch între interogări vizuale de calitate scăzută și regiuni de înaltă rezoluție.
- Framework-ul Mini-Gemini utilizează un model de limbaj mare pentru a combina textul cu imaginile atât pentru generare, cât și pentru înțelegere, simultan.
Encodere Vizuale Duale
Framework-ul Mini-Gemini poate procesa atât intrări de text, cât și de imagine, cu opțiunea de a le gestiona individual sau în combinație. Așa cum se demonstrează în imaginea următoare, framework-ul Mini-Gemini începe procesul prin utilizarea interpolării biliniare pentru a genera o imagine de calitate scăzută din imaginea sa corespunzătoare de înaltă rezoluție.

Apoi, framework-ul procesează aceste imagini și le codifică într-o încorporare vizuală multi-grid în două fluxuri de imagine paralele. Mai specific, framework-ul Mini-Gemini menține pipeline-ul tradițional pentru fluxurile de calitate scăzută și utilizează un transformer vizual pre-antrenat CLIP pentru a codifica încorporările vizuale, permițând modelului să păstreze relația pe termen lung între patch-urile vizuale pentru interacțiunile ulterioare în modelele de limbaj mare. Pentru fluxurile de înaltă rezoluție, framework-ul Mini-Gemini adoptă encoderul bazat pe rețele neuronale convoluționale (CNN) pentru procesarea eficientă a imaginilor de înaltă rezoluție.
Minerit de Informații la Nivel de Patch
Cu encoderele vizuale duale generând încorporările de calitate scăzută și caracteristicile de înaltă rezoluție, framework-ul Mini-Gemini propune implementarea mineritului de informații la nivel de patch, cu scopul de a extinde potențialul modelelor de limbaj vizual cu tokeni vizuali îmbunătățiți. Pentru a menține numărul de tokeni vizuali pentru eficiență în modelele de limbaj mare, framework-ul Mini-Gemini ia încorporările vizuale de calitate scăzută ca interogare și își propune să recupereze informații vizuale relevante din candidații caracteristici de înaltă rezoluție, framework-ul luând harta caracteristicilor de înaltă rezoluție ca cheie și valoare.

Așa cum se demonstrează în imaginea de mai sus, formula cuprinde procesul de rafinare și sinteză a informațiilor vizuale, ceea ce duce la generarea de tokeni vizuali avansați pentru procesarea ulterioară a modelului de limbaj mare. Procesul asigură că framework-ul poate limita mineritul pentru fiecare interogare la sub-regiunea sa corespunzătoare în harta caracteristicilor de înaltă rezoluție, cu numărarea pixelilor caracteristici, rezultând o eficiență îmbunătățită. Datorită acestui design, framework-ul Mini-Gemini este capabil să extragă detalii caracteristice de înaltă rezoluție fără a crește numărul de tokeni vizuali și menține un echilibru între fezabilitatea computațională și bogăția detaliilor.
Generare de Text și Imagine
Framework-ul Mini-Gemini concatenează tokenii vizuali și tokenii de text de intrare ca intrare pentru modelele de limbaj mare pentru generarea auto-regresivă. În contrast cu modelele de limbaj vizual tradiționale, framework-ul Mini-Gemini susține atât generarea de text singur, cât și generarea de text și imagine ca intrare și ieșire, adică inferență “orice la orice”, și este rezultatul acestor capacități remarcabile de înțelegere a imaginilor și textului și de raționament, Mini-Gemini fiind capabil să genereze imagini de înaltă calitate. În contrast cu lucrările recente care se concentrează pe gap-ul de domeniu dintre încorporările de text ale modelelor de generare și modelele de limbaj mare, framework-ul Mini-Gemini încearcă să optimizeze gap-ul în domeniul prompturilor de limbaj prin traducerea instrucțiunilor utilizatorului în prompturi de înaltă calitate care produc imagini relevante contextului în modelele de difuzie latentă. Mai mult, pentru o înțelegere mai bună a ajustării instrucțiunilor și a alinierii cross-modale, framework-ul Mini-Gemini colectează mostre din seturi de date de înaltă calitate disponibile public și utilizează framework-ul GPT-4 turbo pentru a construi un set de date de instruire de 13K pentru a susține generarea de imagini.

Mini-Gemini: Experimente și Rezultate
Pentru a evalua performanța sa, framework-ul Mini-Gemini este instantiat cu framework-ul ConvNext-L pre-antrenat pentru encoderul vizual de înaltă rezoluție și cu un transformer vizual pre-antrenat CLIP pentru encoderul vizual de calitate scăzută. Pentru a asigura eficiența antrenamentului, framework-ul Mini-Gemini menține cei doi encodere vizuali fixi și optimizează proiectoarele mineritului de informații la nivel de patch în toate etapele și optimizează modelul de limbaj mare în timpul etapei de ajustare a instrucțiunilor.

Tabelul următor compară performanța framework-ului Mini-Gemini cu modelele de ultimă generație în diferite setări și ia în considerare și modelele private. Așa cum se observă, Mini-Gemini depășește cadrele existente într-o gamă largă de modele de limbaj mare, în mod constant, la rezoluție normală, și demonstrează o performanță superioară atunci când este configurat cu Gemma-2B în categoria modelelor eficiente. Mai mult, atunci când se utilizează modele de limbaj mare mai mari, scalabilitatea framework-ului Mini-Gemini este evidentă.

Pentru a evalua performanța sa la rezoluție înaltă și tokeni vizuali extinși, experimentele sunt efectuate cu o dimensiune de intrare de 672 pentru encoderul vizual de calitate scăzută și 1536 pentru encoderul vizual. Așa cum s-a menționat anterior, scopul principal al encoderului vizual de înaltă rezoluție este de a oferi informații candidate de înaltă rezoluție. Așa cum se observă, framework-ul Mini-Gemini oferă o performanță superioară atunci când este comparat cu cadrele de ultimă generație.

Mai mult, pentru a evalua capacitățile de înțelegere vizuală ale framework-ului Mini-Gemini în setări reale, dezvoltatorii aplică modelul la o varietate de sarcini de raționament și înțelegere, așa cum se demonstrează în imaginea următoare. Așa cum se observă, framework-ul Mini-Gemini este capabil să rezolve o gamă largă de sarcini complexe datorită implementării mineritului de informații la nivel de patch și a datelor de înaltă calitate. Dar ceea ce este și mai impresionant este faptul că framework-ul Mini-Gemini demonstrează o atenție la detalii care se extinde dincolo de simplele capacități de recunoaștere și descrie elemente intricate în mod detaliat.


Figura următoare oferă o evaluare cuprinzătoare a capacităților generative ale framework-ului Mini-Gemini.

Atunci când este comparat cu modele recente precum ChatIllusion și AnyGPT, framework-ul Mini-Gemini demonstrează capacități mai puternice de înțelegere multi-modală, permițându-i să genereze captionuri de imagine la text care se aliniază mai bine cu instrucțiunile de intrare și rezultă în răspunsuri de imagine la text cu o similaritate conceptuală mai puternică. Ceea ce este și mai impresionant este faptul că framework-ul Mini-Gemini demonstrează o profunzime remarcabilă în generarea de conținut de înaltă calitate folosind doar instrucțiuni multi-modale și date de antrenament de text, o capacitate care ilustrează abilitățile robuste de interpretare semantică și aliniere imagine-text ale Mini-Gemini.

Gânduri Finale
În acest articol am discutat despre Mini-Gemini, un framework puternic și eficient pentru modelele de limbaj vizual multi-modale. Scopul principal al framework-ului Mini-Gemini este de a exploata capacitățile latente ale modelelor de limbaj vizual folosind date de înaltă calitate, proiectarea strategică a framework-ului și un scop funcțional extins. Mini-Gemini este o încercare de a reduce lacuna care există între modelele de limbaj vizual și modelele mai avansate, prin exploatarea potențialului VLM-urilor din trei aspecte: generare ghidată de VLM, date de înaltă calitate și tokeni vizuali de înaltă rezoluție. Pentru a îmbunătăți tokenii vizuali, framework-ul Mini-Gemini propune utilizarea unui encoder vizual suplimentar pentru rafinarea de înaltă rezoluție fără creșterea numărului de tokeni vizuali. Framework-ul Mini-Gemini construiește, de asemenea, un set de date de înaltă calitate în încercarea de a promova o înțelegere precisă a imaginilor și generarea bazată pe raționament. În general, framework-ul Mini-Gemini încearcă să exploateze potențialul modelelor de limbaj vizual și să împuternicească cadrele existente cu capacități de raționament, înțelegere și generare de imagini, simultan.












