Modele și platforme AI

SHOW-O: Un model transformator unic care integrează înțelegerea și generarea multimodală

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Avansurile semnificative în modelele de limbaj mare (LLM) au inspirat dezvoltarea modelelor de limbaj mare multimodal (MLLM). Primele eforturi MLLM, cum ar fi LLaVA, MiniGPT-4 și InstructBLIP, demonstrează capacități remarcabile de înțelegere multimodală. Pentru a integra LLM în domenii multimodale, aceste studii au explorat proiectarea caracteristicilor dintr-un encoder specific modality, cum ar fi CLIP, în spațiul de intrare al LLM, permițând înțelegerea și raționamentul multimodal în cadrul arhitecturii transformer. Deși există diverse opțiuni de proiectare pentru MLLM, cum ar fi encodere de viziune, adaptoare de aliniere a caracteristicilor și seturi de date, antrenarea pentru majoritatea acestor modele respectă paradigmul de generare autoregresiv, care s-a dovedit eficient pentru generarea de text în LLM. În ciuda capacităților lor puternice de înțelegere multimodală, aceste modele se concentrează în principal pe percepția vizuală și lipsesc capacitatea de a genera ieșiri multimodale dincolo de text.

Modelele transformer au demonstrat un mare succes în modelarea autoregresivă în procesarea limbajului natural. Inspirat de astfel de progrese, studii anterioare au aplicat direct același model autoregresiv pentru a învăța dependența pixelilor de imagine pentru generarea de imagini și videoclipuri. De exemplu, VideoPoet utilizează o arhitectură de decoder-only transformer pentru a sintetiza videoclipuri de înaltă calitate din intrări multimodale. Mai recent, LlamaGen a demonstrat că o arhitectură de model de limbaj mare, cum ar fi Llama, poate modela autoregresiv tokeni de imagine, obținând o performanță decentă în generarea de imagini condiționate de clasă.

În acest articol, vom discuta despre Show-O, un model transformator unic care integrează înțelegerea și generarea multimodală. În contrast cu modelele complet autoregresive, Show-O unește modelarea autoregresivă și modelarea difuziei discrete pentru a gestiona adaptiv intrări și ieșiri de diverse și mixte modalități. Modelul unificat susține flexibil o gamă largă de sarcini de viziune-limbaj, incluzând răspunsuri la întrebări vizuale, generarea de imagini din text, completarea și extrapolarea ghidată de text și generarea mixtă de modalități. Pe diverse benchmark-uri, Show-O demonstrează o performanță comparabilă sau superioară cu modelele individuale existente cu un număr echivalent sau mai mare de parametri, subliniind potențialul său ca model de bază de generație următoare.

În acest cadru, modelul este însărcinat cu prezicerea zgomotului Gaussian adăugat la reprezentările latente continue. În contrast, alte modele, cum ar fi D3PM, Mask-predict, ARDM și MaskGIT, utilizează un proces de corupere discret ca alternativă la difuzia Gaussiană. În special, o imagine este reprezentată ca o secvență de tokeni discreți utilizând tokenizatori de imagine, cu fiecare token asociat cu o etichetă categorială. Distribuția tokenilor este transformată într-o distribuție uniformă prin intermediul unui proces de eșantionare stocastică. În timpul antrenării, o parte a acestor tokeni este mascată aleatoriu, iar modelul este antrenat pentru a prezice valorile originale ale tokenilor mascați. În acest lucru, Show-O adoptă modelarea difuziei discrete pentru generarea vizuală.

Show-O demonstrează, de asemenea, potențialul pentru generarea mixtă de modalități, cum ar fi generarea de cadre cheie de videoclipuri cu descrieri de text, arătând promisiune pentru generarea de videoclipuri lungi. Mai mult, cadrul Show-O investighează impactul reprezentărilor de imagine discrete și continue asupra înțelegerii multimodale, oferind perspective pentru proiectarea modelelor unificate viitoare.

Figura următoare prezintă o comparație a caracteristicilor modelului între cadrul Show-O și metodele existente din diverse domenii. Show-O se remarcă ca model unificat care integrează tehnici avansate pentru atât înțelegerea, cât și generarea multimodală.

În rezumat, contribuțiile principale ale acestui articol sunt următoarele:

  • Show-O este un model unificat care integrează înțelegerea și generarea multimodală utilizând un singur transformator.
  • Show-O unește modelarea autoregresivă și modelarea difuziei discrete într-un singur transformator, gestionând atât textul, cât și imaginile în mod eficient.
  • Cadrul Show-O depășește sau egalează modelele individuale de referință cu parametri echivalenți sau mai mari pe diverse benchmark-uri de înțelegere și generare multimodală.
  • Show-O susține aplicații downstream cum ar fi completarea și extrapolarea ghidată de text fără necesitatea de ajustare și demonstrează potențial pentru generarea mixtă de modalități.
  • Show-O explorează impactul diferitelor tipuri de reprezentări, oferind perspective valoroase pentru îmbunătățirea înțelegerii multimodale în modelele unificate.

SHOW-O: Metodologie și Arhitectură

Obiectivul principal din spatele cadrului Show-O este de a dezvolta un model unificat care să integreze modelarea autoregresivă și difuzia pentru înțelegerea și generarea multimodală comună. Dezvoltarea unui astfel de model unificat ridică provocări semnificative, cu problemele centrale care se învârt în jurul: i) definirii spațiului de intrare/ieșire al modelului; ii) unificării diferitelor tipuri de date de intrare din modalități diverse; iii) integrării atât a modelării autoregresive, cât și a difuziei într-un singur transformator; și iv) antrenării eficiente a unui astfel de model unificat.

Show-O abordează aceste provocări cu următoarele soluții:

  • Show-O construiește spațiul de intrare/ieșire prin tokenizarea datelor de text și imagine în tokeni discreți.
  • Show-O introduce o arhitectură implicită și o strategie de promptare unificată pentru a structura datele de intrare și modalitățile.
  • Show-O demonstrează cum să incorporeze atât modelarea autoregresivă, cât și modelarea difuziei într-un singur transformator.
  • Show-O prezintă un pipeline de antrenare în trei etape pentru a antrena eficient modelul unificat.

Tokenizare

Având în vedere că modelul propus Show-O se bazează pe LLM preantrenate, este natural să se efectueze învățarea unificată în spațiul discret. Prin menținerea unui vocabular unificat care include atât tokeni de text discreți, cât și tokeni de imagine, Show-O este însărcinat cu același obiectiv de învățare: prezicerea tokenilor discreți.

Tokenizarea Textului

Show-O se bazează pe un LLM preantrenat, iar același tokenizator este utilizat pentru tokenizarea datelor de text fără modificări.

Tokenizarea Imaginii

Urmand MAGVIT-v2, Show-O antrenează un cuantificator fără lookup utilizând aproximativ 35M de date de imagine. Cuantificatorul menține un cod de dimensiune 8.192 și codifică imagini de rezoluție 256×256 în tokeni discreți 16×16. MAGVIT-v2 a fost ales pentru ușurința de reglare fină, făcându-l potrivit ca tokenizator de videoclipuri cu capacitate de comprimare temporală, un aspect pe care Show-O intenționează să-l exploreze în viitor.

Arhitectură

Show-O moștenește arhitectura modelelor LLM existente fără modificări arhitecturale, cu excepția adăugării unei operațiuni QK-Norm la fiecare strat de atenție. Show-O este initializat cu greutățile unui LLM preantrenat și extinde dimensiunea stratului de încorporare prin incorporarea a 8.192 de noi încorporări invatate pentru tokeni de imagine discreți.

Promptare Unificată

Pentru a efectua învățarea unificată pe înțelegerea și generarea multimodală, Show-O utilizează o strategie de promptare unificată pentru a forma diverse tipuri de date de intrare. Dată o pereche de imagine-text (x, y), aceasta este tokenizată în M tokeni de imagine și N tokeni de text de către tokenizatorii de imagine și text, respectiv.

Mecanism de Atenție Omni

În contrast cu lucrările existente care modelează secvențele doar autoregresiv, Show-O introduce un mecanism de atenție omni, permițându-i să modeleze diverse tipuri de semnale în moduri distincte.

SHOW-O: Experimente și Rezultate

Următoarea tabelă prezintă capacitatea de înțelegere multimodală a lui Show-O pe benchmark-uri publice, cum ar fi sarcinile de captionare de imagini și răspunsuri la întrebări vizuale.

Comparații Calitative

Prezentăm comparații calitative cu modele bazate pe difuzie, cum ar fi SDv1.5, SDXL și modelul autoregresiv LlamaGen, alături de modele unificate cum ar fi LWM și SEED-X, după cum se arată în figura următoare.

Completarea și Extrapolarea Ghidată de Text

Show-O susține în mod natural completarea și extrapolarea ghidată de text fără a necesita ajustări. Următoarea figură ilustrează câteva exemple.

Gânduri Finale

În acest articol, am discutat despre Show-O, un model transformator unic care integrează înțelegerea și generarea multimodală. În contrast cu modelele complet autoregresive, Show-O unește modelarea autoregresivă și modelarea difuziei discrete pentru a gestiona adaptiv intrări și ieșiri de diverse și mixte modalități. Modelul unificat susține flexibil o gamă largă de sarcini de viziune-limbaj, incluzând răspunsuri la întrebări vizuale, generarea de imagini din text, completarea și extrapolarea ghidată de text și generarea mixtă de modalități. Pe diverse benchmark-uri, Show-O demonstrează o performanță comparabilă sau superioară cu modelele individuale existente cu un număr echivalent sau mai mare de parametri, subliniind potențialul său ca model de bază de generație următoare.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.