Modely a platformy AI
Ferret: Refer a Ground na libovolné granularitě
Přetrvávající výzvou ve výzkumu modelů učení s kombinací jazyka a zraku je umožnit prostorové chápání. Toto chápání je základem pro dvě klíčové schopnosti: referenci a ukotvení. Referenční schopnost umožňuje modelu přesně interpretovat semantiku konkrétních oblastí, zatímco ukotvení zahrnuje lokalizaci těchto oblastí pomocí semantických popisů.
Byl představen model Ferret, Multimodální Velký Jazykový Model (MLLM), který je schopen chápat prostorové reference napříč libovolnou granularitou nebo tvarem v obraze a přesně ukotvovat popisy otevřené slovní zásoby. Model Ferret využívá novou hybridní reprezentaci, která kombinuje kontinuální vizuální rysy a diskrétní souřadnice pro reprezentaci oblastí obrazu. Jeho prostorově-aware vizuální vzorkovač zpracovává různé regionální vstupy, jako jsou volné tvary, ohraničující rámečky a body.
Ferret: Nadřazený výkon v úkolech referencí a ukotvení
Referenční schopnost modelu je schopnost pochopit semantiku konkrétních oblastí, zatímco ukotvení je schopnost lokalizovat tyto oblasti pomocí semantických popisů. Ačkoli se liší ve svých úkolech, obě referenční a ukotvení schopnosti sdílejí stejnou základní koncepci: zarovnání prostorové semantiky a informací. Nicméně, navzdory sdílení stejné koncepce, existující modely se učí referenční a ukotvení schopnosti samostatně. Model Ferret se inspiruje touto mezerou v existujících MLLM rámcích a studuje tři hlavní otázky:
- Jak sjednotit referenční a ukotvení schopnosti v rámci, a jak bude jejich sjednocení prospěšné pro obě?
- Lidé používají různé typy oblastí, jako jsou boxy, body, škrábance, volné tvary pro referenci. Jak reprezentovat tyto různé oblasti?
- Jak udělat ukotvení a referenční instrukce následovat, robustní a otevřené slovní zásoby, které jsou kritické pro jejich praktické a reálné aplikace?
Rámec Ferret je novým referenčním a ukotvením Multimodálním Velkým Jazykovým Modelem, který se snaží zodpovědět tyto otázky. Rámec Ferret si zvolil Multimodální Velký Jazykový Model jako základ díky jeho vynikajícímu globálnímu vidění a jazykovému chápání. Kromě toho, aby sjednotil referenční a ukotvení schopnosti, rámec Ferret reprezentuje souřadnice oblastí v přirozeném jazykovém číselném tvaru.
Rámec Ferret nasazuje výše uvedené metody pro řešení vstupu, který kombinuje volný text s referenčními oblastmi, a je schopen bezproblémově generovat souřadnice pro každý ukotvitelný objekt s generovaným textem pro ukotvení zmíněných objektů ve výstupu. Tímto způsobem je Ferret prvním rámcem, který zpracovává volné vstupní oblasti v Multimodálních Velkých Jazykových Modelech.
Rámec Ferret čerpá inspiraci ze tří existujících AI rámců, včetně Multimodálních Velkých Jazykových Modelů, MLLM pro referenční a ukotvení úkoly a sjednocujícího ukotvení a VL chápání.
Zavedení Velkých Jazykových Modelů, včetně GPT, DALL-E, PaLM, LLaMA a BLOOM, změnilo krajinu ve výzkumu NLP, což vedlo k významnému pokroku v multimodálních jazykových modelech. Ranější multimodální jazykové modely se soustředily primárně na velkou škálu generace obrazu a textu, s některými pozoruhodnými příklady, jako je PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 a PaLI-X.
Ferret: Metodologie a architektura
Hybridní reprezentace oblastí
Bod, box a volné tvary jsou tři dominantní formáty, které jazykový model používá při referenci konkrétních oblastí. Na jedné straně lze bod a box přesně reprezentovat souřadnicemi, mapování volných tvarů je však trochu složitější, protože volné tvary mohou zahrnovat širokou škálu oblastí, včetně masek, polygonů a škrábanců.
Pro kontinuální vizuální rysy, pro danou oblast, rámec Ferret nejprve konstruuje 2D binární masku stejné velikosti jako obraz, a označí hodnotu 1 uvnitř cílové oblasti, zatímco přiřazuje hodnotu 0 mimo oblast. Model pak extrahuje binární masku spolu s extrahovanými obrazovými funkcemi a poté je pošle do prostorově-aware vizuálního vzorkovače.
Architektura
Architektura modelu Ferret se skládá ze tří hlavních komponent
- Obrazový kódovač pro extrakci obrazových vnoření.
- Prostorově-aware vizuální vzorkovač pro extrakci kontinuálních vizuálních rysů.
- Velký Jazykový Model pro společné modelování textu, obrazu a oblastí.
GPT-pomocná vizuální datová generace
Datová instrukční úprava je kriticky důležitá pro Multimodální Velké Jazykové Modely, protože jim pomáhá pochopit lidskou intenci a generovat odpovídající odpovědi. Většina MLLM používá few-shot prompting metodu pro získání vizuální instrukční úpravy, kde model poskytuje textový popis scén v obraze spolu s lidsky anotovanými dialogy jako few-shot demonstrace.
Prostorová negativní těžba
Předchozí výzkum prokázal, že multimodální velké jazykové modely mají vysokou pravděpodobnost halucinace, když reagují na ano/ne otázku. Aby se zabránilo halucinaci modelu Ferret v podobných podmínkách, rámec Ferret používá prostorovou negativní těžební metodu s obrazem podmíněnou kategorií lokalizace a semanticky podmíněnou kategorií lokalizace.
Ferret: Výsledky a experimenty
Pro analýzu jeho výkonu je rámec Ferret vyhodnocen na konvenčních referenčních a ukotveních benchmarkách, poté je vyhodnocen v komplexnějším multimodálním chatovacím úkolu a testuje jeho referenční a ukotvení schopnosti.
Závěrečné myšlenky
V tomto článku jsme diskutovali o modelu Ferret, multimodálním velkém jazykovém modelu, který demonstruje vynikající referenční a ukotvení schopnosti. Rámec Ferret může referovat na obrazové oblasti bez ohledu na jejich tvar a může automaticky ukotvit text předpovězený modelem. Rámec Ferret využívá prostorově-aware vizuální vzorkovač, který zpracovává různé regionální vstupy, včetně volných tvarů, ohraničujících rámečků a bodů.












