Modely a platformy AI

InstructIR: Vysokokvalitní Obnovení Obrázků Podle Lidských Pokynů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Obrázek může sdělit mnoho, ale může být také poškozen různými problémy, jako je rozmazání, mlha, šum a nízký dynamický rozsah. Tyto problémy, běžně označované jako degradace v low-level počítačovém vidění, mohou vzniknout z obtížných environmentálních podmínek, jako je teplo nebo déšť, nebo z omezení samotné kamery. Obnovení obrázků představuje základní výzvu v počítačovém vidění, snažící se obnovit vysokokvalitní, čistý obrázek z poškozeného. Obnovení obrázků je komplexní, protože pro jeden obrázek může existovat více řešení. Některé přístupy se zaměřují na specifické degradace, jako je snížení šumu nebo odstranění rozmazání nebo mlhy.

Zatímco tyto metody mohou vést k dobrým výsledkům pro konkrétní problémy, často mají potíže s generalizací na různé typy degradací. Mnohé rámce využívají generický neuronový síť pro širokou škálu úkolů obnovení obrázků, ale tyto sítě jsou trénovány samostatně. Potřeba různých modelů pro každou degradaci činí tento přístup výpočetně náročným a časově náročným, což vede k soustředění na modely All-In-One pro obnovení. Tyto modely využívají jeden hluboký model pro obnovení obrázků, který řeší různé úrovně a typy degradací, často využívající degradaci-specifické pokyny nebo vektory pro zlepšení výkonu. Ačkoli modely All-In-One obvykle ukazují slibné výsledky, stále čelí výzvám s inverse problémy.

InstructIR představuje průlomový přístup v tomto oboru, jelikož je to první rámec pro obnovení obrázků, který využívá lidské pokyny pro vedení modelu obnovení. Může zpracovat přirozené jazykové pokyny pro obnovení vysokokvalitních obrázků z poškozených, přičemž bere v úvahu různé typy degradací. InstructIR stanoví nový standard výkonu pro širokou škálu úkolů obnovení obrázků, včetně odstranění deště, snížení šumu, odstranění mlhy, odstranění rozmazání a zlepšení obrázků s nízkým osvětlením.

Tento článek si klade za cíl podrobně probrat rámec InstructIR a prozkoumat jeho mechanismus, metodologii, architekturu a srovnání se stávajícími rámci pro generování obrázků a videa. Takže pojďme začít.

InstructIR: Vysokokvalitní Obnovení Obrázků

Obnovení obrázků je základní problém v počítačovém vidění, jelikož se snaží obnovit vysokokvalitní, čistý obrázek z poškozeného. V low-level počítačovém vidění se degradace označují jako nepříjemné účinky pozorované v obrázku, jako je rozmazání, mlha, šum, nízký dynamický rozsah a další. Důvod, proč je obnovení obrázků komplexní, je ten, že pro jeden obrázek může existovat více řešení. Některé rámce se zaměřují na specifické degradace, jako je snížení instance šumu nebo odstranění rozmazání, zatímco jiné se mohou zaměřit více na odstranění mlhy nebo dehazingu.

Nedávné hluboké učící metody prokázaly silnější a konzistentnější výkon ve srovnání s tradičními metodami obnovení obrázků. Tyto modely obnovení obrázků založené na hlubokém učení navrhují použití neuronových sítí založených na Transformerech a Konvolučních Neuronových Sítích. Tyto modely lze trénovat samostatně pro různé úkoly obnovení obrázků a také mají schopnost zachytit lokální a globální interakce funkcí a zlepšit je, což vede k uspokojivému a konzistentnímu výkonu. Ačkoli některé z těchto metod mohou fungovat dostatečně pro specifické typy degradací, obvykle se neextrapolují dobře na různé typy degradací. Kromě toho, zatímco mnoho stávajících rámců využívá stejnou neuronovou síť pro širokou škálu úkolů obnovení obrázků, každá formulace neuronové sítě se trénuje samostatně. Je tedy zřejmé, že využití samostatného neuronového modelu pro každouthinkable degradaci je nerealistické a časově náročné, což je důvod, proč se recentní rámce pro obnovení obrázků soustředily na proxy All-In-One.

Modely All-In-One nebo Multi-degradace nebo Multi-úkol pro obnovení obrázků získávají popularitu v oboru počítačového vidění, jelikož jsou schopny obnovit multiple typy a úrovně degradací v obrázku bez potřeby trénovat modely samostatně pro každou degradaci. Modely All-In-One pro obnovení obrázků využívají jeden hluboký model pro obnovení obrázků, který řeší různé typy a úrovně degradací. Různé modely All-In-One implementují různé přístupy pro vedení modelu pro obnovení poškozeného obrázku, například pomocný model pro klasifikaci degradace nebo multi-dimenzionální vektory nebo pokyny pro zlepšení výkonu. Ačkoli modely All-In-One obvykle ukazují slibné výsledky, stále čelí výzvám s inverse problémy.

S tím, co bylo řečeno, se dostáváme k textově založené manipulaci obrázků, jelikož byla implementována několika rámci v posledních letech pro generování obrázků z textu a textově založené úpravy obrázků. Tyto modely často využívají textové pokyny pro popis akcí nebo obrázků spolu s difuzními modely pro generování odpovídajících obrázků. Hlavní inspirace pro rámec InstructIR je rámec InstructPix2Pix, který umožňuje modelu upravovat obrázek pomocí pokynů uživatele, které instruují model, jaký akci provést, místo textových popisků, popisů nebo titulků vstupního obrázku. V důsledku toho mohou uživatelé použít přirozený psaný text pro instruování modelu, jaký akci provést, bez potřeby poskytovat vzorové obrázky nebo další popisky obrázků.

Na základě těchto základů je rámec InstructIR prvním počítačovým modelem, který využívá lidské pokyny pro obnovení obrázků a řešení inverse problémů. Pro přirozené jazykové pokyny může model InstructIR obnovit vysokokvalitní obrázky z poškozených a také bere v úvahu multiple typy degradací. Rámec InstructIR je schopen dodat špičkový výkon na širokou škálu úkolů obnovení obrázků, včetně odstranění deště, snížení šumu, odstranění mlhy, odstranění rozmazání a zlepšení obrázků s nízkým osvětlením. Na rozdíl od stávajících prací, které dosahují obnovení obrázků pomocí naučených vektorů nebo embedování promptů, rámec InstructIR využívá surové uživatelské pokyny ve formě textu. Rámec InstructIR je schopen generalizovat na obnovení obrázků pomocí lidských pokynů, a jediný model All-In-One implementovaný rámcem InstructIR pokrývá více úkolů obnovení než dříve.

InstructIR: Metoda a Architektura

V jádru rámce InstructIR se skládá z textového encoderu a modelu obrázku. Model využívá rámec NAFNet, efektivní model pro obnovení obrázků, který následuje architekturu U-Net jako model obrázku. Kromě toho model implementuje techniky routování úkolů pro učení multiple úkolů pomocí jednoho modelu. Následující obrázek ilustruje přístup k trénování a evaluaci rámce InstructIR.

Využívaje inspirace z modelu InstructPix2Pix, rámec InstructIR přijímá lidské pokyny jako mechanismus řízení, jelikož není potřeba, aby uživatel poskytoval další informace. Tyto pokyny nabízejí expresivní a jasný způsob interakce, umožňující uživatelům označit přesně lokalizaci a typ degradace v obrázku. Kromě toho, využívání uživatelských pokynů místo pevných degradaci-specifických pokynů zlepšuje použitelnost a aplikace modelu, jelikož může být také použit uživateli, kteří postrádají potřebné odborné znalosti. Aby rámec InstructIR získal schopnost porozumět různým pokynům, model využívá velký jazykový model GPT-4 pro vytváření různých požadavků, s nejasnými a nejednoznačnými pokyny odstraněnými po procesu filtrování.

Textový Encoder

Textový encoder je použit jazykovými modely pro mapování uživatelských pokynů na textové embedování nebo pevnou velikost vektorového reprezentace. Tradičně, textový encoder modelu CLIP je důležitou součástí pro textově založenou generaci obrázků a textově založenou manipulaci obrázků pro kódování uživatelských pokynů, jelikož rámec CLIP vyniká ve vizuálních pokynech. Nicméně, většina času, uživatelské pokyny pro degradaci obsahují málo nebo žádné vizuální obsah, což činí velké encodery CLIP zbytečnými pro tyto úkoly, jelikož by to snížilo efektivitu významně. Aby se tento problém vyřešil, rámec InstructIR volí textový sentence encoder, který je trénován pro kódování vět do smysluplného prostoru embedování. Sentence encodery jsou předtrénovány na milionech příkladů a jsou kompaktní a efektivní ve srovnání s tradičními encodery CLIP, zatímco mají schopnost kódovat semantiku různých uživatelských pokynů.

Textová Vedení

Důležitým aspektem rámce InstructIR je implementace zakódovaného pokynu jako mechanismu řízení pro model obrázku. Na základě toho a inspirovaného v úkolovém routování pro mnoho úkolů, rámec InstructIR navrhuje Instruction Construction Block nebo ICB pro umožnění úkol-specifických transformací uvnitř modelu. Konvenční úkolové routování aplikuje úkol-specifické binární masky na kanálové funkce. Nicméně, jelikož rámec InstructIR nezná degradaci, tato technika se neimplementuje přímo. Kromě toho, pro funkce obrázku a zakódované pokyny, rámec InstructIR aplikuje úkolové routování a produkuje masku pomocí lineární vrstvy aktivované funkcí Sigmoid pro produkci sady vah v závislosti na textových embedováních, čímž získá c-dimenzionální binární masku na kanál. Model dále zlepšuje podmíněné funkce pomocí NAFBlocku a využívá NAFBlock a Instruction Conditioned Block pro podmíněné funkce v obou encoder a decoder blocích.

Ačkoli rámec InstructIR explicitně nekontroluje neuronové filtry, maska umožňuje modelu vybrat kanály, které jsou nejrelevantnější na základě pokynu a informace.

InstructIR: Implementace a Výsledky

Model InstructIR je trénovatelný od konce do konce, a model obrázku nevyžaduje předtrénování. Je pouze textové embedování projekce a klasifikační hlava, které potřebují být trénovány. Textový encoder je inicializován pomocí BGE encoderu, BERT-like encoderu, který je předtrénován na velké množství supervizovaného a nesupervizovaného dat pro obecné účely kódování vět. Rámec InstructIR využívá model NAFNet jako model obrázku, a architektura NAFNet se skládá z 4-úrovňového encoder-decoderu s různým počtem bloků na každé úrovni. Model také přidává 4 střední bloky mezi encoder a decoder pro další zlepšení funkcí. Kromě toho, místo konkatence pro skip spoje, decoder implementuje přidání, a model InstructIR implementuje pouze ICB nebo Instruction Conditioned Block pro úkolové routování pouze v encoder a decoder. Dále, model InstructIR je optimalizován pomocí ztráty mezi obnoveným obrázkem a čistým obrázkem, a cross-entropická ztráta se používá pro intent klasifikační hlavu textového encoderu. Model InstructIR využívá optimalizátor AdamW s velikostí batche 32 a learning rate 5e-4 pro téměř 500 epoch, a také implementuje kosinový annealing learning rate decay. Jelikož model obrázku v rámci InstructIR obsahuje pouze 16 milionů parametrů, a existuje pouze 100 tisíc naučených textových projekčních parametrů, rámec InstructIR může být snadno trénován na standardních GPU, čímž se snižují výpočetní náklady a zvyšuje se použitelnost.

Více Degradací Výsledky

Pro více degradací a multi-úkolové obnovení, rámec InstructIR definuje dvě počáteční nastavení:

  1. 3D pro tři-degradaci modely pro řešení problémů, jako je dehazing, denoising a deraining.
  2. 5D pro pět-degradaci modely pro řešení problémů, jako je image denoising, low light enhancements, dehazing, denoising a deraining.

Výkon 5D modelů je demonstrován v následující tabulce, a srovnává se se stávajícími modely obnovení obrázků a modely All-In-One.

Jak je vidět, rámec InstructIR s jednoduchým modelem obrázku a pouze 16 miliony parametrů může zvládnout pět různých úkolů obnovení obrázků úspěšně díky instrukčnímu vedení, a dodává konkurenční výsledky. Následující tabulka demonstruje výkon rámce na 3D modelech, a výsledky jsou srovnatelné s výsledky výše.

Hlavní výhoda rámce InstructIR je instrukční obnovení obrázků, a následující obrázek demonstruje úžasné schopnosti modelu InstructIR pro pochopení širokého rozsahu instrukcí pro daný úkol. Kromě toho, pro adversní instrukci, model InstructIR provede identitu, která není vynucena.

Závěrečné Myšlenky

Obnovení obrázků je základní problém v počítačovém vidění, jelikož se snaží obnovit vysokokvalitní, čistý obrázek z poškozeného. V low-level počítačovém vidění se degradace označují jako nepříjemné účinky pozorované v obrázku, jako je rozmazání, mlha, šum, nízký dynamický rozsah a další. V tomto článku jsme mluvili o InstructIR, prvním rámci pro obnovení obrázků, který využívá lidské pokyny pro vedení modelu obnovení. Pro přirozené jazykové pokyny může model InstructIR obnovit vysokokvalitní obrázky z poškozených a také bere v úvahu multiple typy degradací. Rámec InstructIR je schopen dodat špičkový výkon na širokou škálu úkolů obnovení obrázků, včetně odstranění deště, snížení šumu, odstranění mlhy, odstranění rozmazání a zlepšení obrázků s nízkým osvětlením.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.