Modely a platformy AI
MiniGPT-5: Prokládaná generace jazyka a obrazu pomocí generativních voken
Před několika lety získaly velké jazykové modely (LLM) pozornost vývojářů AI po celém světě díky průlomům v oblasti zpracování přirozeného jazyka (NLP). Tyto modely nastavily nové standardy pro generování textu a porozumění textu. Nicméně, navzdory pokroku v generování textu, je stále obtížné generovat obrázky, které jsou v souladu s textovými narativy. Aby se tato výzva řešila, vývojáři představili inovativní přístup k generování jazyka a obrazu založený na “generativních voken”, který mostí mezeru pro harmonizované textové a obrazové výstupy.
Základ MiniGPT-5 je dvoufázová trénovací strategie, která se zaměřuje na generování multimodálních dat bez popisu, kde trénovací data nevyžadují žádné komplexní obrazové popisy. Kromě toho, aby se zvýšila integrita modelu, model zahrnuje systém bez klasifikátoru, který zlepšuje účinnost voken pro generování obrazu. V počáteční fázi prokázal rámec MiniGPT-5 silné výkony a podstatné zlepšení oproti základnímu modelu Divter, který je trénován na datové sadě MMDialog, a neustále prokázal svou schopnost dodávat srovnatelné a dokonce lepší multimodální výstupy v hodnoceních lidských subjektů provedených na datové sadě VIST, což dále zdůrazňuje jeho výkon a efektivitu napříč různými měřítky.
MiniGPT5: Úvod
S nedávnými vývojovými rámci LLM a aplikacemi založenými na těchto rámcích, je integrace multimediálních funkcí oblastí, která zaznamenala vzestup popularity, protože se také prokázala jako životně důležitý pokrok, který pohání širokou škálu aplikací od pokročilých nástrojů pro tvorbu obsahu až po multimodální dialogové agenty. S pokračujícím výzkumem a vývojem jsou jazykové a vizuální modely na úrovni, kde se pracuje na tom, aby mohly generovat jak text, tak vizuální data bezproblémově. Schopnost LLM generovat multimodální data bezproblémově pomůže zlepšit interakce napříč různými doménami, včetně e-commerce, médií a virtuální reality.

Konečným cílem je umožnit modelům syntetizovat, rozpoznávat a reagovat konzistentním a logickým způsobem pomocí obou textových a vizuálních modalit, a tím sehrát klíčovou roli v harmonizaci toku informací a vytváření logických a konzistentních narativů. Potřeba dosáhnout kombinace textových a vizuálních modalit je poháněna především potřebou více fluidních, integrovaných a interaktivních multimodálních interakcí v LLM, a nakonec dosažení střídavé generace jazyka a obrazu. Nicméně, dosažení integrovaných a interaktivních multimodálních interakcí v LLM je komplikovaným úkolem, který je doprovázen mnoha výzvami, včetně
- Ačkoli současné LLM jsou extrémně efektivní a schopné, pokud jde o generování textu a zpracování textových a obrazových párů, nedosahují uspokojivých výsledků, pokud jde o generování obrazů.
- Vývoj těchto vizuálních a jazykových modelů závisí silně na tématu zaměřených datech, což činí obtížným pro modely sladit generovaný text s odpovídajícími obrázky.
- Nakonec, je třeba vyvinout účinnější strategie, protože s rostoucími schopnostmi LLM také rostou požadavky na paměť, zejména při provádění downstream úkolů.
Rámec MiniGPT-5, prokládaná jazyková a vizuální generace algoritmu, představuje koncept “generativních voken” v pokusu řešit výše uvedené výzvy. Rámec MiniGPT-5 navrhuje nový přístup pro multimodální generování dat kombinací velkých jazykových modelů se stabilními difuzními technikami pomocí speciálních vizuálních tokenů. Navrhovaná dvoufázová trénovací metoda používaná rámcem MiniGPT-5 zdůrazňuje důležitost základní fáze bez popisu a přípravě modelu pro efektivní výkon i v scénářích s omezenými daty.

Ale co odlišuje model MiniGPT-5 od současných existujících rámců, je to, že obecné fáze rámce MiniGPT-5 nespočívají v doménově specifických anotacích. Kromě toho, aby se zajistilo, že generovaný text a odpovídající obrázky jsou v souladu s sebou navzájem, rámec MiniGPT-5 nasazuje dvojí ztrátovou strategii, která dále zlepšuje přístup MiniGPT-5 k použití bez klasifikátoru a generativních voken. Rámec MiniGPT-5 optimalizuje trénovací efektivitu a řeší omezení paměti díky parametricky efektivní strategii pro jemné ladění modelu.
Abyste měli rychlý přehled, rámec MiniGPT-5
- Navrhuje metodu, která používá multimodální kodéry, které představují novou a obecnou metodu, která se historicky prokázala jako účinnější než tradiční LLM, a používá generativní tokeny v kombinaci se stabilními difuzními technikami pro generování prokládaných jazykových a vizuálních výstupů.
- Navrhuje dvoufázovou trénovací strategii pro generování popisů multimodálních výstupů a zahrnutí bez klasifikátoru během trénování pro další zlepšení kvality generovaných dat.
Model MiniGPT-5 je silně inspirován předchozími výzkumy a pracemi v oblastech
- Generování obrazu z textu: K usnadnění transformace textových popisů do jejich odpovídajících vizuálních reprezentací a modelů obrazu z textu.
- MLLM nebo multimodální velké jazykové modely: Používání předtrénovaných modelů LLM pro prozkoumání jejich aplikací a účinnosti při generování multimodálních dat.
- Multimodální generování s velkými jazykovými modely: K rozšíření schopností LLM pro bezproblémovou integraci jazykových a vizuálních dat.
MiniGPT-5: Metoda, architektura a rámec
Aby se umožnilo velkým jazykovým modelům generovat multimodální data, model MiniGPT-5 představuje rámec, který cílí na integraci modelů obrazu z textu a předtrénovaných multimodálních velkých jazykových modelů. Rámec MiniGPT-5 dále představuje “generativní vokeny”, speciální vizuální tokeny, které umožňují vývojářům řešit nesrovnalosti, které se objevují napříč různými doménami, tím, že je možné trénovat přímo na surových obrazech. Aby se dále zlepšila kvalita multimodálních dat generovaných LLM, rámec MiniGPT-5 představuje bez klasifikátoru strategii spojenou s pokročilou dvoufázovou trénovací metodou. Podívejme se na detailní pohled na rámec MiniGPT-5.
Multimodální vstupní fáze
Vývoj LLM v nedávné minulosti přinesl do popředí multimodální porozumění schopnosti LLM, umožňující zpracování obrazů jako sekvenční vstup. Rámec MiniGPT-5 využívá speciálně navržených generativních voken pro výstup vizuálních funkcí v pokusu o rozšíření multimodálních porozumění schopností LLM na multimodální generování dat. Kromě toho rámec MiniGPT-5 využívá parametricky efektivní a pokročilé techniky jemného ladění pro multimodální výstupní učení v rámci LLM.
Multimodální kódování
Předtrénovaný vizuální kódér v rámci MiniGPT-5 transformuje každý vstupní obraz do funkce a každý textový token je vložen jako vektor, a vstupní prompt funkce jsou generovány, když jsou tyto vložené funkce spojovány navzájem.
Přidání voken do velkých jazykových modelů
Tradičně, slovník velkých jazykových modelů sestává pouze z textových tokenů, a proto vývojáři pracující na rámci MiniGPT-5 museli mostovat mezeru mezi generativními a tradičními LLM. Rámec MiniGPT-5 představuje sadu speciálních tokenů jako generativní tokeny do slovníku LLM. Rámec poté využívá skrytý výstupní stav LLM pro tyto speciální vokeny pro následnou generaci obrazu, a vložení prokládaných obrazů je reprezentováno pozicí voken.
PEFT nebo parametricky efektivní jemné ladění
PEFT nebo parametricky efektivní jemné ladění je klíčovým konceptem, který se používá pro trénování LLM, a přesto, aplikace PEFT v multimodálních nastaveních je stále málo prozkoumána. Rámec MiniGPT-5 využívá parametricky efektivní jemné ladění nad kódérem rámce MiniGPT-4 pro trénování modelu, aby lépe porozuměl promptům nebo instrukcím, a dále zlepšil celkový výkon modelu v bezprecedentních nebo novém prostředí.
Multimodální generování výstupu
Aby se generativní model sladil s generativními tokeny přesně, rámec MiniGPT-5 formuluje kompaktní mapovací modul pro sladění dimenzí a začlenění dozorovaných ztrát, včetně latentní difuzní modelové ztráty a textové prostory ztráty. Latentní difuzní dozorovaná ztráta sladí příslušné vizuální funkce s tokeny přímo, zatímco textová prostory ztráta pomáhá modelu naučit se správné pozice tokenů. Protože generativní vokeny v rámci MiniGPT-5 jsou přímo řízeny obrázky, rámec MiniGPT-5 nevyžaduje, aby obrázky měly komplexní popis, což vede k bezpopisovému učení.
Generování textového prostoru
Rámec MiniGPT-5 následuje kauzální jazykovou modelovací metodu pro generování obou voken a textů v textovém prostoru společně, a během trénovací fáze, vývojáři připojují vokeny k pozici ground truth obrazů a trénují model, aby předpovídal vokeny v rámci generování textu.
Mapování voken funkcí pro generování obrazu
Po generování textového prostoru, rámec sladí skrytý výstupní stav s textovou podmíněnou funkcí prostoru modelu obrazu z textu. Rámec také podporuje funkcí mapovací modul, který zahrnuje dvojsvrstvý MLP model, učitelný dekodér funkcí sekvence a čtyřvrstvý kódér-dekodér transformátorový model.
Generování obrazu s LDM nebo latentním difuzním modelem
Aby se generovaly požadované obrázky v procesu odšumění, rámec využívá mapovaných funkcí jako podmíněného vstupu. Rámec také využívá LDM nebo latentní difuzní model pro řízení, protože během trénovací fáze, ground truth obraz je nejprve převeden do latentní funkce pomocí předtrénovaného VAE, po kterém vývojáři získají latentní šumovou funkci přidáním некоторého šumu.
Komplexní přístup nasazený rámcem MiniGPT-5 umožňuje vývojářům mít koherentní porozumění a generování obou vizuálních a textových prvků, pomocí speciálních tokenů, využití schopností předtrénovaných modelů a použití inovativních trénovacích technik.
MiniGPT-5: Trénování a výsledky
Při práci na rámci MiniGPT-5, vývojáři pozorovali, že trénování na omezené prokládané textové a obrazové datové sadě přímo může vést k obrazům s nižší kvalitou a nesouladem, danou významnou doménovou změnou mezi obrazem a textem. Aby se tento problém zmírnil, vývojáři přijali dvě odlišné trénovací strategie,
- Zahrnující začlenění bez klasifikátoru technik, které zvyšují účinnost generativních tokenů během difuzního procesu.
- Druhá strategie je dále rozdělena do dvou fází
- Počáteční předtrénovací fáze, která se zaměřuje primárně na sladění hrubých funkcí.
- Fáze jemného ladění, která usnadňuje učení funkcí.
CFG nebo bez klasifikátoru řízení
Nápad využít CFG pro multimodální generování poprvé přišel jako výsledek pokusu o zlepšení konzistence a logiky mezi generovanými obrázky a texty, a CFG je zaveden během textové a obrazové difuzní fáze. Tato metoda pozoruje, že trénováním na obou bezpodmínečném a podmíněném generování s podmíněným dropoutem, může generativní model dosáhnout zlepšených podmíněných výsledků.
Dvoufázová trénovací strategie
Daná významná doménová změna pozorovaná mezi textovou a obrazovou generací a čistou textovou generací, rámec MiniGPT-5 využívá dvoufázovou strategii pro trénování
- Unimodální sladění fáze nebo UAS,
- Multimodální učení fáze nebo MLS.
Počátečně, rámec sladí obrazové generovací funkce s voken funkcí v jednoduché textové a obrazové datové sadě, kde každá datová ukázka obsahuje pouze jeden text a pouze jeden obraz, a text je obvykle obrazový podpis. V této fázi, rámec umožňuje LLM generovat vokeny využíváním podpisů jako LLM vstupů.
Jakmile je UAS úspěšně proveden, model může generovat obrázky pro jednoduché textové popisy, ale má potíže s prokládanou jazykovou a vizuální generací, včetně textových a obrazových párů, a komplikované uvažování je vyžadováno pro obrazovou a textovou generaci. Aby se tento problém vyřešil, vývojáři dále jemně ladili rámec MiniGPT-5 pomocí PEFT parametrů prokládanými vizuálními a jazykovými datovými sadami, jako je VIST. Během této fáze, rámec konstruuje tři odlišné úkoly z datové sady
- Generování textu pouze: Generuje související text, daný další obraz.
- Generování obrazu pouze: Generuje související obraz, daný další text.
- Multimodální generování: Generuje textové a obrazové páry pomocí daného kontextu.
MiniGPT-5: Benchmarky a výsledky
Aby se komplexně vyhodnotila jeho výkony v multimodální generaci, vývojový tým MiniGPT-5 porovnává jeho výkony s jinými prominentními základními modely, včetně Divter, GILL a jemně laděného unimodálního generativního modelu, a porovnání je demonstrováno v tabulce níže.

Rámec MiniGPT-5 chápe, že multimodální výstup může být smysluplný podle kontextu, ale může se lišit od reality, což je primární důvod, proč rámec MiniGPT-5 také zahrnuje lidské vstupy pro hodnocení a posouzení výkonu modelu. Celkově, účinnost rámce MiniGPT-5 pro multimodální úkoly je měřena ze tří perspektiv.
- Jazyková kontinuita: posuzuje, zda generovaný obsah souhlasí s poskytnutým kontextem bezproblémově.
- Kvalita obrazu: posuzuje nebo hodnotí relevanci a jasnost generovaného obrazu.
- Multimodální koherence: určuje, zda kombinovaný textový a obrazový výstup je v souladu s počátečním kontextem.
VIST konečná fáze hodnocení
V první fázi experimentů, rámec MiniGPT-5 cílí na generování odpovídajících obrazů, a tabulka níže shrnuje výsledky získané z tohoto nastavení.

Jak je vidět, rámec MiniGPT-5 ve všech třech nastaveních může překonat jemně laděný SD2 rámec, což zdůrazňuje účinnost rámce MiniGPT-5.

Obrázek výše porovnává výkon rámce MiniGPT-5 s jemně laděným rámcem MiniGPT-4 na S-BERT, Rouge-L a Meteor výkonových metrikách. Výsledky ukazují, že použití generativních voken neovlivňuje negativně výkon rámce při provádění multimodálních porozumění úkolů. Výsledky také prokazují, že rámec MiniGPT-5 je schopen využívat dlouhé horizontální multimodální vstupní prompty napříč širokou škálou dat pro generování vysoce kvalitních a koherentních obrazů bez kompromisů v původních multimodálních porozumění schopnostech.

Tabulka výše porovnává výkon tří rámců na 5 000 vzorcích pro multimodální generování z hlediska multimodální koherence, kvality obrazu a jazykové kontinuity. Jak je vidět, rámec MiniGPT-5 překonává ostatní dva základové modely ve více než 70% případů. Na druhé straně, tabulka níže demonstruje výkon rámce MiniGPT-5 na validační datové sadě CC3M pro generování jednotlivých obrazů. Díky omezením dat, vývojáři nalezli mezeru pro voken sladění, když se používá se stabilní difuzí. Přesto, rámec MiniGPT-5 překonává současný stav základového modelu GILL napříč všemi metrikami.


Závěr
V tomto článku, jsme mluvili o MiniGPT-5, prokládané jazykové a vizuální generace algoritmu technice, která představuje koncept “generativních voken” v pokusu o využití schopností LLM pro generování multimodálních dat sladěním velkého jazykového modelu s modelem obrazu z textu, který je předtrénován. Mluvili jsme o základních komponentách a celkové architektuře rámce MiniGPT-5 spolu s výsledky, které ukazují podstatné zlepšení výkonu a efektivnosti ve srovnání se současnými základními a stavem modelů. Rámec MiniGPT-5 cílí na stanovení nového standardu v multimodálním obsahu a datové generaci doméně a snaží se řešit výzvy, kterým čelily předchozí modely, když se snažily řešit stejný problém.












