Modely a platformy AI
Mini-Gemini: urychlování multimodálních modelů VLM
Vývoj velkých jazykových modelů významně urychlil vývoj zpracování přirozeného jazyka, nebo NLP. Zavedení transformátorového rámce se ukázalo být milníkem, který usnadnil vývoj nové vlny jazykových modelů, včetně OPT a BERT, které vykazují hluboké lingvistické porozumění. Kromě toho zavedení GPT, nebo generativních předtrénovaných transformátorových modelů, představilo nový paradigm s autoregresivním modelem a stanovilo robustní metodu pro jazykovou predikci a generaci. Příchod jazykových modelů, jako je GPT-4, ChatGPT, Mixtral, LLaMA a dalších, dále pohání rychlou evoluci, přičemž každý model vykazuje vylepšené výkony v úkolech, které zahrnují komplexní zpracování jazyka. Mezi stávajícími metodami se instrukční ladění stalo klíčovou technikou pro jemnění výstupu velkých předtrénovaných jazykových modelů a integrace těchto modelů se speciálními nástroji pro vizuální úkoly zdůraznila jejich adaptabilitu a otevřela dveře pro budoucí aplikace. Tyto aplikace sahají daleko za rámec tradičního textového zpracování LLM do multimodálních interakcí.
Dále, konvergence zpracování přirozeného jazyka a modelů počítačového vidění dala vzniknout VLM, nebo modelům jazyka a vidění, které kombinují lingvistické a vizuální modely pro dosažení cross-modální komprese a rozumění. Integrace a vznik vizuálních a lingvistických modelů sehrály zásadní roli při pokroku v úkolech, které vyžadují jak zpracování jazyka, tak vizuální porozumění. Vznik revolučních modelů, jako je CLIP, dále mostem propojil mezery mezi vizuálními úkoly a jazykovými modely, demonstrující proveditelnost a praktičnost cross-modálních aplikací. Novější rámce, jako LLaMA a BLIP, využívají přizpůsobená instrukční data k vytvoření efektivních strategií, které demonstrují silné schopnosti modelu. Kromě toho, kombinace velkých jazykových modelů s obrazovými výstupy je zaměřena na nedávný multimodální výzkum, přičemž nedávné metody jsou schopny obejít přímou generaci pomocí obrazového vyhledávání k produkci obrazových výstupů a prokládaných textů.

S tím, co bylo řečeno, a navzdory rychlému pokroku ve vizuálních jazycových modelech, které usnadňují základní rozumění a vizuální dialog, stále existuje významná mezera ve výkonu mezi pokročilými modely, jako je GPT-4, a vizuálními jazycovými modely. Mini-Gemini je pokus o snížení mezery, která existuje mezi vizuálními jazycovými modely a pokročilejšími modely, zkoumáním potenciálu VLM z tří aspektů: VLM-řízená generace, vysokokvalitní data a vysokorozlišovací vizuální tokeny. Pro zlepšení vizuálních tokenů navrhuje rámec Mini-Gemini použít další vizuální kódovací zařízení pro jemné vysoké rozlišení bez zvýšení počtu vizuálních tokenů. Rámec Mini-Gemini dále vytváří vysokokvalitní datovou sadu v pokusu o podporu přesného porozumění obrazů a generace založené na rozumění. Celkově rámec Mini-Gemini se snaží využít potenciál vizuálních jazycových modelů a cílem je vybavit stávající rámce obrazovým rozuměním, porozuměním a generativními schopnostmi současně. Tento článek se zaměřuje na rámec Mini-Gemini do hloubky a prozkoumává mechanismus, metodologii, architekturu rámce a jeho srovnání se stávajícími rámci.
Mini-Gemini: urychlování multimodálních VLM
V průběhu let se velké jazykové modely vyvinuly a nyní se chlubí pozoruhodnými multimodálními schopnostmi a stávají se nepostradatelnou součástí stávajících vizuálních jazycových modelů. Existuje však mezera mezi multimodálními výkony velkých jazykových modelů a vizuálních jazycových modelů, přičemž nedávný výzkum hledá způsoby, jak kombinovat vidění s velkými jazykovými modely pomocí obrazů a videí. Pro vizuální úkoly samotné je rozlišení obrazu zásadním prvkem, který explicitně popisuje okolní prostředí s minimálními vizuálními halucinacemi. Pro snížení mezery se výzkumníci snaží vyvinout modely, které zlepšují vizuální porozumění ve stávajících vizuálních jazycových modelech, a dvě z nejčastějších přístupů jsou: zvýšení rozlišení a zvýšení počtu vizuálních tokenů. Ačkoli zvýšení počtu vizuálních tokenů s vyšším rozlišením obrazů zlepšuje vizuální porozumění, toto zlepšení je často doprovázeno zvýšenými výpočetními požadavky a souvisejícími náklady, zejména při zpracování více obrazů. Kromě toho schopnosti stávajících modelů, kvalita stávajících dat a použitelnost zůstávají nedostatečné pro urychlený vývojový proces, což zanechává výzkumníky s otázkou, „jak urychlit vývoj vizuálních jazycových modelů s přijatelnými náklady“?
Rámec Mini-Gemini je pokus o odpověď na tuto otázku, neboť se snaží prozkoumat potenciál vizuálních jazycových modelů ze tří aspektů: VLM-řízená generace nebo rozšířené aplikace, vysokokvalitní data a vysokorozlišovací vizuální tokeny. Nejprve rámec Mini-Gemini implementuje architekturu ConvNet pro efektivní generaci vyšších rozlišení, zlepšující vizuální detaily a zachovávající počet vizuálních tokenů pro velký jazykový model. Rámec Mini-Gemini kombinuje veřejně dostupné vysokokvalitní datové sady v pokusu o zlepšení kvality dat a integruje tyto vylepšení se stávajícími generativními a velkými jazykovými modely v pokusu o zlepšení výkonu VLM a zlepšení uživatelské zkušenosti. Vícestranná strategie implementovaná rámcem Mini-Gemini umožňuje mu prozkoumat skryté schopnosti vizuálních jazycových modelů a dosáhnout významných pokroků s evidentními omezeními zdrojů.

Obecně rámec Mini-Gemini využívá libovolný na libovolný paradigm, neboť je schopen zpracovávat jak text, tak obraz jako vstup a výstup. Konkrétně rámec Mini-Gemini představuje efektivní pipeline pro zlepšení vizuálních tokenů pro vstupní obrazy a obsahuje dual-encoderový systém, skládající se z dvojice encoderů: první encoder je pro vysoké rozlišení obrazů, zatímco druhý encoder je pro nízkokvalitní vizuální vložky. Během inferencingu pracují encodery v pozornostním mechanismu, kde nízkorozlišovací encoder generuje vizuální dotazy, zatímco vysokorozlišovací encoder poskytuje klíč a hodnoty pro referenci. Pro zlepšení kvality dat rámec Mini-Gemini shromažďuje a produkuje více dat na základě veřejných zdrojů, včetně úkolově orientovaných instrukcí, generativních dat a vysokorozlišovacích odpovědí, přičemž zvýšené množství a kvalita zlepšují celkový výkon a schopnosti modelu. Kromě toho rámec Mini-Gemini podporuje současnou textovou a obrazovou generaci v důsledku integrace vizuálního jazycového modelu s pokročilými generativními modely.
Mini-Gemini: Metodologie a architektura
V jádru je rámec Mini-Gemini koncepčně jednoduchý a skládá se ze tří komponent.
- Rámec využívá dual-vision encodery pro poskytování nízkorozlišovacích vizuálních vložek a vysokorozlišovacích kandidátů.
- Rámec navrhuje implementaci patch info mining proconduct mining na úrovni patche mezi nízkorozlišovacími vizuálními dotazy a vysokorozlišovacími oblastmi.
- Rámec Mini-Gemini využívá velký jazykový model pro spojení textu s obrazy pro generaci a porozumění současně.
Dual-Vision Encoders
Rámec Mini-Gemini může zpracovávat jak textový, tak obrazový vstup, s možností zpracovávat je jednotlivě nebo v kombinaci. Jak je demonstrováno na následujícím obrázku, rámec Mini-Gemini začíná proces použitím bilineární interpolace pro generování nízkorozlišovacího obrazu z odpovídajícího vysokorozlišovacího obrazu.

Rámec poté zpracovává tyto obrazy a kóduje je do multi-grid vizuálního vložky ve dvou paralelních obrazových tocích. Konkrétněji rámec Mini-Gemini udržuje tradiční pipeline pro nízkorozlišovací toky a využívá CLIP-předtrénovaný vizuální transformátor pro kódování vizuálních vložek, umožňující modelu zachovat dlouhodobé vztahy mezi vizuálními patche pro následné interakce ve velkých jazykových modelech. Pro vysokorozlišovací toky rámec Mini-Gemini采用uje encoder založený na CNN nebo konvolučním neuronovém síti pro adaptivní a efektivní zpracování obrazů s vysokým rozlišením.
Patch Info Mining
S dual-vision encodery generujícími nízkorozlišovací vložky a vysokorozlišovací funkce, rámec Mini-Gemini navrhuje implementaci patch info mining s cílem rozšířit potenciál vizuálních jazycových modelů s vylepšenými vizuálními tokeny. Za účelem zachování počtu vizuálních tokenů pro efektivitu ve velkých jazykových modelech, rámec Mini-Gemini bere nízkorozlišovací vizuální vložky jako dotaz a snaží se získat relevantní vizuální signály z vysokorozlišovacích funkcí, přičemž rámec bere vysokorozlišovací funkci jako klíč a hodnotu.

Jak je demonstrováno na předchozím obrázku, vzorec zahrnuje proces rafinování a syntézy vizuálních signálů, což vede k generaci pokročilých vizuálních tokenů pro následné zpracování velkým jazykovým modelem. Proces zajišťuje, že rámec je schopen omezit mining pro každou otázku na odpovídající sub-oblast v vysokorozlišovacích funkcích s pixel-wise funkcí, výsledkem čehož je zvýšená efektivita. Díky tomuto designu je rámec Mini-Gemini schopen extrahovat detaily vysokorozlišovacích funkcí bez zvýšení počtu vizuálních tokenů a zachovává rovnováhu mezi výpočetní proveditelností a bohatstvím detailů.
Text a obrazová generace
Rámec Mini-Gemini spojuje vizuální tokeny a vstupní textové tokeny jako vstup pro velký jazykový model pro autoregresivní generaci. Na rozdíl od tradičních vizuálních jazycových modelů, rámec Mini-Gemini podporuje text-only i text-obrazovou generaci jako vstup a výstup, tj. libovolný na libovolný inference, a je výsledkem tohoto vynikajícího obrazového a textového porozumění a rozumění schopností, rámec Mini-Gemini je schopen generovat vysoké kvalitní obrazy. Na rozdíl od nedávných prací, které se zaměřují na doménovou mezeru mezi textovými vložkami generativních modelů a velkých jazykových modelů, rámec Mini-Gemini se snaží optimalizovat mezeru v doméně jazykových promptů, překládaje uživatelské instrukce do vysokokvalitních promptů, které produkují kontextově relevantní obrazy v latentních difúzních modelech. Kromě toho, pro lepší porozumění instrukčnímu jemnění a cross-modálnímu zarovnání, rámec Mini-Gemini shromažďuje vzorky z veřejně dostupných vysokokvalitních datových sad a využívá rámec GPT-4 turbo pro další konstrukci 13 000 instrukční datové sady pro podporu obrazové generace.

Mini-Gemini: Experimenty a výsledky
Pro hodnocení jeho výkonu je rámec Mini-Gemini instance s předtrénovaným rámcem ConvNext-L pro vysokorozlišovací vizuální encoder a s CLIP-předtrénovaným vizuálním transformátorem pro nízkorozlišovací vizuální encoder. Pro zajištění tréninkové efektivity, rámec Mini-Gemini udržuje dva vizuální encodery pevné a optimalizuje projektory patch info mining ve všech fázích a optimalizuje velký jazykový model během fáze instrukčního jemnění.

Následující tabulka srovnává výkon rámce Mini-Gemini proti stávajícím modelům napříč různými nastaveními a také zohledňuje soukromé modely. Jak je patrné, rámec Mini-Gemini překonává stávající rámce napříč širokou škálou LLM konzistentně na normálním rozlišení a demonstruje lepší výkon, když je nakonfigurován s Gemma-2B v kategorii efektivních modelů. Kromě toho, když jsou použity větší velké jazykové modely, je zjevná škálovatelnost rámce Mini-Gemini.

Pro hodnocení jeho výkonu na vysokém rozlišení a prodloužených vizuálních tokenech jsou experimenty prováděny s vstupní velikostí 672 pro nízkorozlišovací vizuální encoder a 1536 pro vizuální encoder. Jak je uvedeno dříve, hlavním účelem vysokorozlišovacího vizuálního encodéru je poskytnout vysokorozlišovací kandidátní informace. Jak je patrné, rámec Mini-Gemini dodává lepší výkon, když je srovnán se stávajícími rámci.

Kromě toho, pro hodnocení vizuálního porozumění rámce Mini-Gemini v reálných prostředích, vývojáři aplikují model na řadu rozumění a porozumění úkolů, jak je demonstrováno na následujícím obrázku. Jak je patrné, rámec Mini-Gemini je schopen řešit širokou škálu komplexních úkolů díky implementaci patch info mining a vysokokvalitních dat. Ale co je ještě působivější, je fakt, že rámec Mini-Gemini demonstruje jemný detail, který sahá za hranice pouhého rozpoznávání, a popisuje intrikátní prvky intrikátně.


Následující obrázek poskytuje komplexní hodnocení generativních schopností rámce Mini-Gemini.

Když je srovnán se současnými modely, jako je ChatIllusion a AnyGPT, rámec Mini-Gemini demonstruje silnější multimodální porozumění schopnosti, umožňující mu generovat text-obrazové popisky, které se shodují s vstupními instrukcemi lépe, a výsledkem jsou obraz-textové odpovědi se silnější konceptuální podobností. Co je ještě působivější, je fakt, že rámec Mini-Gemini demonstruje pozoruhodné schopnosti generovat vysokokvalitní obsah pomocí multi-modelových lidských instrukcí pouze s textovým tréninkovým datem, schopnost, která ilustruje robustní sémantické porozumění a obraz-textové zarovnání.

Závěrečné myšlenky
V tomto článku jsme hovořili o Mini-Gemini, silném a streamlinovaném rámci pro multimodální vizuální jazycové modely. Hlavním cílem rámce Mini-Gemini je využít latentní schopnosti vizuálních jazycových modelů pomocí vysokokvalitních dat, strategického designu rámce a rozšířeného funkčního rozsahu. Mini-Gemini je pokus o snížení mezery, která existuje mezi vizuálními jazycovými modely a pokročilejšími modely, zkoumáním potenciálu VLM z tří aspektů: VLM-řízená generace, vysokokvalitní data a vysokorozlišovací vizuální tokeny. Pro zlepšení vizuálních tokenů navrhuje rámec Mini-Gemini použít další vizuální kódovací zařízení pro jemné vysoké rozlišení bez zvýšení počtu vizuálních tokenů. Rámec Mini-Gemini dále vytváří vysokokvalitní datovou sadu v pokusu o podporu přesného porozumění obrazů a generace založené na rozumění. Celkově rámec Mini-Gemini se snaží využít potenciál vizuálních jazycových modelů a cílem je vybavit stávající rámce obrazovým rozuměním, porozuměním a generativními schopnostmi současně.












