Modele și platforme AI
MiniGPT-5: Generare Interleaved de Viziune și Limbaj prin Generative Vokens
În ultimii ani, Modelele Lingvistice Mari (LLM) au atras atenția dezvoltatorilor de inteligență artificială din întreaga lume datorită progreselor înregistrate în Procesarea Limbajului Natural (NLP). Aceste modele au stabilit noi standarde în generarea și înțelegerea textului. Cu toate acestea, în ciuda progresului înregistrat în generarea textului, producerea de imagini care se potrivesc coerent cu narativele textuale rămâne o provocare. Pentru a aborda această problemă, dezvoltatorii au introdus o abordare inovatoare de generare a viziunii și limbajului bazată pe “generative vokens”, care încearcă să pună capăt decalajului dintre text și imagine.
Baza MiniGPT-5 este o strategie de antrenare în două etape care se concentrează puternic pe generarea de date multimodale fără descrieri, unde datele de antrenare nu necesită descrieri comprehensive ale imaginilor. Mai mult, pentru a îmbunătăți integritatea modelului, modelul incorporează un sistem de ghidare fără clasificator care îmbunătățește eficacitatea unui voken pentru generarea de imagini. În faza inițială, cadrul MiniGPT-5 a demonstrat o performanță puternică și o îmbunătățire substanțială față de modelul de referință Divter, care este antrenat pe setul de date MMDialog, și a demonstrat constant capacitatea de a furniza ieșiri multimodale comparabile și chiar superioare în evaluările umane efectuate pe setul de date VIST, ceea ce subliniază și mai mult performanța și eficiența sa în diferite benchmark-uri.
MiniGPT5: O Introducere
Cu dezvoltările recente ale cadrului LLM și aplicațiilor bazate pe aceste cadre LLM, integrarea caracteristicilor multimedia este un domeniu care a cunoscut o creștere a popularității sale, deoarece reprezintă o avansare vitală care alimentează o gamă largă de aplicații, de la unelte de creare de conținut de ultimă generație la agenți de dialog multimodal de ultimă oră. Cu cercetarea și dezvoltarea continuă, modelele de limbaj și viziune sunt în punctul în care se lucrează la facilitarea lor pentru a genera atât text, cât și date vizuale în mod fluent. Capacitatea LLM de a genera date multimodale în mod fluent va ajuta la îmbunătățirea interacțiunilor în diferite domenii, inclusiv comerțul electronic, mass-media și realitatea virtuală.

În cele din urmă, scopul este de a permite modelelor să sintetizeze, să recunoască și să răspundă în mod coerent și logic, utilizând atât modalitățile textuale, cât și cele vizuale, jucând un rol crucial în armonizarea fluxului de informații și crearea de narative logice și coerente. Nevoia de a obține o combinație de modalități textuale și vizuale este alimentată în primul rând de nevoia de interacțiuni multimodale mai fluide, integrate și interactive în LLM, și în cele din urmă, de a obține generarea alternativă a limbajului și viziunii. Cu toate acestea, obținerea de interacțiuni multimodale integrate și interactive în LLM este o sarcină complicată, presărată cu numeroase provocări, inclusiv
- Deși LLM actuale sunt extrem de eficiente și capabile în ceea ce privește generarea de text și procesarea perechilor de text și imagine, ele nu oferă o performanță satisfăcătoare în ceea ce privește generarea de imagini.
- Dezvoltarea acestor modele de viziune și limbaj se bazează puternic pe date cu focus pe subiect, ceea ce face dificilă pentru modelele de a alinia textul generat cu imaginile corespunzătoare.
- În cele din urmă, există nevoia de a găsi strategii mai eficiente, deoarece, odată cu creșterea capacităților lor, cerințele de memorie ale LLM cresc și atunci când se efectuează sarcini descendente.
Cadrul MiniGPT-5, o tehnică de generare a limbajului și viziunii intercalate, introduce conceptul de “generative vokens” în încercarea de a aborda provocările menționate mai sus. Cadrul MiniGPT-5 propune o abordare nouă pentru generarea de date multimodale prin combinarea modelelor de limbaj mare cu tehnici de difuzie stabilă, utilizând tokeni vizuali speciali. Metoda de antrenare în două etape propusă de cadrul MiniGPT-5 subliniază importanța unei etape inițiale lipsite de descrieri și pregătește modelul pentru a oferi o performanță eficientă chiar și în scenarii cu date limitate.

Dar ceea ce separă modelul MiniGPT-5 de cadrele existente este faptul că etapele generice ale cadrului MiniGPT-5 nu constau în annotări specifice domeniului. Mai mult, pentru a asigura că textul generat și imaginile corespunzătoare sunt în armonie una cu cealaltă, cadrul MiniGPT-5 utilizează o strategie de pierdere duală care îmbunătățește și mai mult abordarea MiniGPT-5 de utilizare a ghidării fără clasificator și a generativelor vokens. Cadrul MiniGPT-5 optimizează eficiența antrenamentului și abordează constrângerile de memorie datorită strategiei sale de reglare eficientă a parametrilor pentru reglarea modelului.
Pentru a vă oferi o scurtă prezentare, cadrul MiniGPT-5
- Propune o metodă care utilizează encodatori multimodali, o abordare nouă și generică care s-a dovedit a fi mai eficientă decât LLM tradiționale, și utilizează tokeni generativi combinați cu tehnici de difuzie stabilă pentru a genera ieșiri lingvistice și vizuale intercalate.
- Propune o strategie de antrenare în două etape pentru generarea de ieșiri multimodale fără descrieri și includerea ghidării fără clasificator în timpul antrenamentului pentru a refina și mai mult calitatea datelor generate.
Modelul MiniGPT-5 este inspirat puternic de cercetările și lucrările anterioare în domeniile
- Generare de Imagini din Text: Pentru a facilita transformarea descrierilor textuale în reprezentări vizuale corespunzătoare și modele de text la imagine.
- MLLM sau Modele de Limbaj Mare Multimodale: Utilizarea modelelor LLM preantrenate pentru a explora aplicațiile și eficacitatea lor în generarea de date multimodale.
- Generare Multimodală cu Modele de Limbaj Mare: Pentru a îmbunătăți capacitățile unui LLM de a integra fluent limbajul și datele vizuale.
MiniGPT-5: Metodă, Arhitectură și Cadrul
Pentru a facilita modelele de limbaj mare cu capacități de generare multimodală, modelul MiniGPT-5 introduce un cadru care își propune să integreze modele de generare de text și imagine cu modele de limbaj mare preantrenate. Cadrul MiniGPT-5 introduce, de asemenea, “generative vokens”, tokeni vizuali speciali care permit dezvoltatorilor să abordeze discrepanțele care apar în diferite domenii, putând fi antrenat direct pe imagini brute. Pentru a îmbunătăți și mai mult calitatea datelor multimodale generate de LLM, cadrul MiniGPT-5 introduce o strategie de ghidare fără clasificator, combinată cu o metodă de antrenare avansată în două etape. Să aruncăm o privire detaliată asupra cadrului MiniGPT-5.
Etapa de Intrare Multimodală
Dezvoltările recente ale LLM au adus în lumină capacitățile de înțelegere multimodală ale LLM, permițând procesarea imaginilor ca intrare secvențială. Cadrul MiniGPT-5 utilizează tokeni generativi special concepuți pentru a extinde capacitățile LLM de înțelegere multimodală la generarea de date multimodale. Mai mult, cadrul MiniGPT-5 utilizează tehnici de reglare eficientă a parametrilor și de antrenament avansat pentru învățarea ieșirilor multimodale în cadrul LLM.
Encodare Multimodală
Encoderul vizual preantrenat în cadrul MiniGPT-5 transformă fiecare imagine de intrare într-un set de caracteristici, iar fiecare token de text este încorporat ca vector, iar caracteristicile de intrare sunt generate atunci când aceste încorporări sunt concatenate una cu cealaltă.
Adăugarea de Vokens în Modelele de Limbaj Mare
Tradițional, vocabularul modelului de limbaj mare conține doar tokeni textuali, ceea ce a determinat dezvoltatorii care lucrează la cadrul MiniGPT-5 să pună capăt decalajului dintre generativ și LLM tradițional. Cadrul MiniGPT-5 introduce un set de tokeni speciali ca tokeni generativi în vocabularul LLM. Apoi, cadrul utilizează starea de ieșire ascunsă a LLM pentru acești vokeni speciali pentru generarea ulterioară de imagini, iar inserarea imaginilor intercalate este reprezentată de poziția vokenilor.
PEFT sau Reglare Eficientă a Parametrilor
PEFT sau Reglarea Eficientă a Parametrilor este un concept crucial utilizat pentru antrenarea LLM, iar aplicațiile PEFT în setări multimodale sunt încă în mare măsură neexplorate. Cadrul MiniGPT-5 utilizează Reglarea Eficientă a Parametrilor peste encoderul cadrului MiniGPT-4 pentru a antrena modelul să înțeleagă prompturile sau instrucțiunile mai bine și pentru a îmbunătăți, de asemenea, performanța generală a modelului în medii noi sau fără precedent.
Generare de Ieșiri Multimodale
Pentru a alinia modelul generativ cu tokenii generativi în mod precis, cadrul MiniGPT-5 formulează un modul de mapare compact pentru a se potrivi cu dimensiunile și pentru a include pierderi supervizate, incluzând pierderea modelului de difuzie latentă și pierderea spațiului text. Pierderea supervizată a difuziei latente aliniază caracteristicile vizuale corespunzătoare cu tokenii direct, în timp ce pierderea spațiului text ajută modelul să învețe pozițiile corecte ale tokenilor. Deoarece tokenii generativi din cadrul MiniGPT-5 sunt ghidați direct de imagini, cadrul MiniGPT-5 nu necesită ca imaginile să aibă descrieri comprehensive, rezultând o învățare fără descrieri.
Generare de Spațiu Text
Cadrul MiniGPT-5 urmează metoda de modelare a limbajului cauzal pentru a genera atât tokeni, cât și texte în spațiul textului în mod comun, iar în timpul fazei de antrenament, dezvoltatorii atașează tokenii la poziția imaginilor reale și antrenează modelul pentru a prezice tokeni în cadrul generării de text.
Mapare a Caracteristicilor Voken pentru Generarea de Imagini
După generarea spațiului text, cadrul aliniază starea de ieșire ascunsă cu spațiul condițional de caracteristici al modelului de generare a imaginilor din text. Cadrul suportă, de asemenea, un modul de mapare a caracteristicilor care include un model MLP cu două straturi, o secvență de decodificare invățabilă și un model de transformator cu codificator-decodificator pe patru straturi.
Generare de Imagini cu LDM sau Model de Difuzie Latentă
Pentru a genera imaginile necesare în procesul de denoising, cadrul utilizează caracteristicile de mapare ca intrare condițională. Cadrul utilizează, de asemenea, un LDM sau Model de Difuzie Latentă pentru ghidare, deoarece în timpul fazei de antrenament, imaginea reală este convertită mai întâi într-o caracteristică latentă utilizând un VAE preantrenat, după care se obține caracteristica de zgomot latentă prin adăugarea unui zgomot.
Abordarea cuprinzătoare utilizată de cadrul MiniGPT-5 permite dezvoltatorilor să aibă o înțelegere coerentă și să genereze atât elemente vizuale, cât și textuale, utilizând tokeni speciali, valorificând capacitățile modelelor preantrenate și utilizând tehnici de antrenament inovatoare.
MiniGPT-5: Antrenament și Rezultate
Atunci când lucrează la cadrul MiniGPT-5, dezvoltatorii au observat că antrenarea direct pe un set de date de text și imagine intercalate limitat poate rezulta în imagini de calitate scăzută și în decalaj, având în vedere decalajul semnificativ dintre domeniul imaginii și textului. Pentru a aborda această problemă, dezvoltatorii au adoptat două strategii de antrenament distincte,
- Care implică încorporarea tehnicilor de ghidare fără clasificator care îmbunătățesc eficacitatea tokenilor generativi în timpul procesului de difuzie.
- A doua strategie este împărțită în două etape
- O etapă inițială de preantrenament care se concentrează în primul rând pe alinierea caracteristicilor grosiere.
- O etapă de reglare fină care facilitează învățarea caracteristicilor.
CFG sau Ghidare Fără Clasificator
Ideea de a utiliza mai întâi CFG pentru generarea multimodală a apărut ca urmare a unei încercări de a îmbunătăți coerența și logica dintre imaginile și textele generate, iar CFG este introdus în timpul procesului de difuzie text-la-imagine. Această metodă observă că, prin antrenarea atât a generării necondiționate, cât și a celei condiționate, cu abandonarea condiționării, modelul generativ poate obține rezultate condiționate îmbunătățite.
Strategie de Antrenament în Două Etape
Având în vedere decalajul semnificativ observat între generarea de text și imagine și generarea pură de text, cadrul MiniGPT-5 utilizează o strategie în două etape pentru antrenament
- Etapa de aliniere unimodală sau UAS,
- Etapa de învățare multimodală sau MLS.
Inițial, cadrul aliniază caracteristicile de generare a imaginilor cu caracteristicile voken în seturi de date de perechi text-imagine, unde fiecare exemplu de date conține doar un text și o imagine, iar textul este de obicei legenda imaginii. În această etapă, cadrul permite LLM să genereze vokeni utilizând legendele ca intrări LLM.
Odată ce UAS a fost executat cu succes, modelul poate genera imagini pentru descrieri textuale simple, dar se confruntă cu dificultăți la generarea intercalată a limbajului și viziunii, inclusiv perechi de text și imagine, și necesită un raționament complicat pentru generarea de imagini și text. Pentru a aborda această provocare, dezvoltatorii au reglat și mai mult cadrul MiniGPT-5 utilizând parametrii PEFT prin seturi de date intercalate de viziune și limbaj, cum ar fi VIST. În această etapă, cadrul construiește trei sarcini diferite din setul de date
- Generare de text numai: Generează textul relevant dat imaginea următoare.
- Generare de imagine numai: Generează imaginea relevantă dat textul următor.
- Generare multimodală: Generează perechi de text și imagine utilizând contextul dat.
MiniGPT-5: Benchmark-uri și Rezultate
Pentru a evalua performanța sa în generarea multimodală în mod cuprinzător, echipa de dezvoltare a MiniGPT-5 compară performanța sa cu alte modele de referință proeminente, incluzând Divter, GILL și modelul de generare unimodal reglat, iar comparația este demonstrată în tabelul de mai jos.

Cadrul MiniGPT-5 înțelege că ieșirile multimodale pot fi semnificative în context, dar pot diferi de realitatea din lumea reală, ceea ce este motivul principal pentru care cadrul MiniGPT-5 incorporează, de asemenea, intrări umane pentru a evalua și a aprecia performanța modelului. În general, eficacitatea cadrului MiniGPT-5 pentru sarcini multimodale este măsurată din trei perspective.
- Continuitatea limbajului: evaluarea dacă conținutul generat se aliniază cu contextul furnizat în mod fluent.
- Calitatea imaginii: evaluarea clarității și relevanței imaginii generate.
- Cohența multimodală: determinarea dacă ieșirea combinată de text și imagine este în sincronizare cu contextul inițial.
Evaluarea Finală VIST
În prima etapă a experimentelor, cadrul MiniGPT-5 își propune să genereze imaginile corespunzătoare, iar tabelul de mai jos rezumă rezultatele obținute din această configurație.

Așa cum se poate observa, cadrul MiniGPT-5 în toate cele trei setări poate depăși modelul SD2 reglat, subliniind eficacitatea pipeline-ului MiniGPT-5.

Figura de mai sus compară performanța cadrului MiniGPT-5 cu cadrul MiniGPT-4 reglat pe metricile de performanță S-BERT, Rouge-L și Meteor. Rezultatele indică faptul că utilizarea tokenilor generativi nu afectează negativ performanța cadrului atunci când se efectuează sarcini de înțelegere multimodală. Rezultatele demonstrează, de asemenea, că cadrul MiniGPT-5 este capabil să utilizeze prompturi de intrare multimodale orizontale lungi pe o gamă largă de date pentru a genera imagini de înaltă calitate și coerente fără a compromite capacitatea modelului original de înțelegere multimodală.

Tabelul de mai sus compară performanța a trei cadre pe 5.000 de exemple pentru generarea multimodală din perspectivele coerenței multimodale, calității imaginii și continuității limbajului. Așa cum se poate observa, cadrul MiniGPT-5 depășește celelalte două modele de referință în mai mult de 70% din cazuri. Pe de altă parte, tabelul de mai jos demonstrează performanța cadrului MiniGPT-5 pe setul de validare CC3M pentru generarea de imagini simple. Din cauza limitărilor de date, dezvoltatorii au găsit un decalaj în alinierea vokenilor atunci când au fost utilizați cu difuzia stabilă. În ciuda acestei limitări, cadrul MiniGPT-5 depășește cadrul GILL de referință actual în toate metricile.


Concluzii
În acest articol, am discutat despre MiniGPT-5, o tehnică de generare a limbajului și viziunii intercalate care introduce conceptul de “generative vokens” în încercarea de a valorifica capacitățile LLM de a genera date multimodale, aliniind modelul de limbaj mare cu un model de generare de text și imagine preantrenat. Am discutat despre componentele esențiale și arhitectura generală a cadrului MiniGPT-5, împreună cu rezultatele care indică îmbunătățiri substanțiale în ceea ce privește performanța și eficiența în comparație cu modelele de referință actuale și cele mai bune modele. MiniGPT-5 aspiră să stabilească un nou standard în domeniul generării de conținut și date multimodale și își propune să rezolve provocările cu care s-au confruntat modelele anterioare atunci când au încercat să rezolve aceeași problemă.












