Modele i platformy AI
InstructIR: Wysokiej jakości restauracja obrazu zgodnie z instrukcjami ludzkimi
Obraz może przekazywać wiele informacji, ale może być również zniekształcony przez różne problemy, takie jak rozmycie ruchu, mgła, szum i niski zakres dynamiczny. Te problemy, powszechnie określane jako degradacje w niskopoziomowym widzeniu komputerowym, mogą wynikać z trudnych warunków środowiskowych, takich jak upał lub deszcz, lub z ograniczeń samej kamery. Restauracja obrazu jest podstawowym wyzwaniem w widzeniu komputerowym, które dąży do odzyskania wysokiej jakości, czystego obrazu z obrazu wykazującego takie degradacje. Restauracja obrazu jest skomplikowana, ponieważ może istnieć wiele różnych rozwiązań dla przywrócenia każdego obrazu. Niektóre podejścia koncentrują się na konkretnych degradacjach, takich jak redukcja szumu lub usunięcie rozmycia lub mgły.
Pomimo tego, że te metody mogą dawać dobre wyniki dla konkretnych problemów, często mają trudności z generalizacją na różne typy degradacji. Wiele ram pracuje na ogólnym sieci neuronowym dla szerokiego zakresu zadań restauracji obrazu, ale sieci te są szkolone oddzielnie. Potrzeba posiadania oddzielnego modelu dla każdego typu degradacji sprawia, że podejście to jest kosztowne i czasochłonne, co prowadzi do koncentracji na modelach restauracji All-In-One w ostatnich rozwojach. Te modele wykorzystują jeden, głęboki model restauracji obrazu, który rozwiązuje różne poziomy i typy degradacji, często wykorzystując wektory lub prompty degradacji, aby poprawić wyniki. Chociaż modele All-In-One zwykle pokazują obiecujące wyniki, nadal stają przed wyzwaniami związanymi z problemami odwrotnymi.
InstructIR reprezentuje przełomowe podejście w tej dziedzinie, będąc pierwszą ramą restauracji obrazu zaprojektowaną do kierowania modelem restauracji za pomocą instrukcji ludzkich. Może przetwarzać naturalne prompty językowe, aby odzyskać wysokiej jakości obrazy z zdegradowanych, biorąc pod uwagę różne typy degradacji. InstructIR ustanawia nowy standard wydajności dla szerokiego zakresu zadań restauracji obrazu, w tym deraining, denoising, dehazing, deblurring i poprawy obrazów o niskim poziomie światła.
Ten artykuł ma na celu omówienie ramy InstructIR w szczegółach, a my będziemy badać mechanizm, metodologię, architekturę ramy oraz porównanie z modelem obrazu i wideo. Zatem zacznijmy.
InstructIR: Wysokiej jakości restauracja obrazu
Restauracja obrazu jest podstawowym problemem w widzeniu komputerowym, ponieważ dąży do odzyskania wysokiej jakości, czystego obrazu z obrazu wykazującego degradacje. W niskopoziomowym widzeniu komputerowym, degradacje są terminem używanym do opisania niepożądanych efektów obserwowanych w obrazie, takich jak rozmycie ruchu, mgła, szum, niski zakres dynamiczny i więcej. Powodem, dla którego restauracja obrazu jest skomplikowanym wyzwaniem, jest to, że może istnieć wiele różnych rozwiązań dla przywrócenia każdego obrazu. Niektóre ramy koncentrują się na konkretnych degradacjach, takich jak redukcja szumu lub usunięcie rozmycia, podczas gdy inne mogą koncentrować się bardziej na usunięciu mgły lub dehazing.
Ostatnie metody głębokiego uczenia wykazały silniejsze i bardziej spójne wyniki w porównaniu z tradycyjnymi metodami restauracji obrazu. Te modele restauracji obrazu proponują wykorzystanie sieci neuronowych opartych na transformatorach i sieciach neuronowych z wykorzystaniem splotu. Modele te mogą być szkolone niezależnie dla różnych zadań restauracji obrazu i posiadają zdolność do przechwytywania lokalnych i globalnych interakcji cech, co skutkuje zadowalającymi i spójnymi wynikami. Chociaż niektóre z tych metod mogą działać odpowiednio dla konkretnych typów degradacji, zwykle nie ekstrapolują dobrze na różne typy degradacji. Ponadto, chociaż wiele istniejących ram wykorzystuje ten sam sieć neuronowy dla wielu zadań restauracji obrazu, każda formuła sieci neuronowej jest szkolona oddzielnie. Stąd, jest oczywiste, że zastosowanie oddzielnego modelu neuronowego dla każdej możliwej degradacji jest niewykonalne i czasochłonne, co prowadzi do koncentracji na modelach restauracji All-In-One.
Modele All-In-One lub wielodegradacyjne lub wielozadaniowe modele restauracji obrazu zyskują na popularności w dziedzinie widzenia komputerowego, ponieważ są w stanie przywrócić wiele typów i poziomów degradacji w obrazie bez potrzeby szkolenia modeli niezależnie dla każdej degradacji. Modele All-In-One wykorzystują jeden, głęboki model restauracji obrazu, aby rozwiązać różne typy i poziomy degradacji. Różne modele All-In-One implementują różne podejścia, aby skierować model ślepy do przywrócenia zdegradowanego obrazu, na przykład model pomocniczy do klasyfikacji degradacji lub wektory lub prompty wielowymiarowe, aby poprawić wyniki. Chociaż modele All-In-One zwykle pokazują obiecujące wyniki, nadal stają przed wyzwaniami związanymi z problemami odwrotnymi.
Z tym powiedzeniem, dochodzimy do manipulacji obrazem opartej na tekście, ponieważ została zaimplementowana przez wiele ram w ciągu ostatnich kilku lat dla generacji obrazu z tekstu i zadań edycji obrazu opartej na tekście. Te modele często wykorzystują prompty tekstowe, aby opisać akcje lub obrazy wraz z modelami opartymi na dyfuzji, aby wygenerować odpowiednie obrazy. Główną inspiracją dla ramy InstructIR jest rama InstructPix2Pix, która umożliwia modelowi edycję obrazu za pomocą instrukcji użytkownika, które nakazują modelowi wykonać określoną akcję, zamiast etykiet, opisów lub podpisów wejściowego obrazu. W ten sposób użytkownicy mogą używać naturalnych tekstów, aby nakazać modelowi wykonać określoną akcję bez potrzeby dostarczania przykładowych obrazów lub dodatkowych opisów obrazu.
Budując na tych podstawach, rama InstructIR jest pierwszym modelem widzenia komputerowego, który wykorzystuje instrukcje ludzkie do osiągnięcia restauracji obrazu i rozwiązania problemów odwrotnych. Dla naturalnych prompty językowych, model InstructIR może odzyskać wysokiej jakości obrazy z zdegradowanych i brać pod uwagę wiele typów degradacji. Rama InstructIR jest w stanie dostarczyć wyniki na poziomie stanu sztuki dla szerokiego zakresu zadań restauracji obrazu, w tym deraining, denoising, dehazing, deblurring i poprawy obrazów o niskim poziomie światła. W przeciwieństwie do istniejących prac, które osiągają restaurację obrazu za pomocą nauczonych wektorów lub osadzeń prompty, rama InstructIR wykorzystuje surowe prompty użytkownika w postaci tekstu. Rama InstructIR jest w stanie uogólnić do przywracania obrazów za pomocą instrukcji ludzkich, a pojedynczy model All-In-One zaimplementowany przez InstructIR obejmuje więcej zadań restauracji niż wcześniejsze modele. Poniższy rysunek pokazuje różnorodne próbki restauracji ramy InstructIR.

InstructIR: Metoda i architektura
W swojej istocie, rama InstructIR składa się z kodera tekstu i modelu obrazu. Model wykorzystuje ramę NAFNet, wydajny model restauracji obrazu, który podąża za architekturą U-Net jako model obrazu. Ponadto, model implementuje techniki routingu zadań, aby nauczyć się wielu zadań za pomocą jednego modelu. Poniższy rysunek ilustruje podejście szkolenia i oceny dla ramy InstructIR.

Czerpiąc inspirację z modelu InstructPix2Pix, rama InstructIR przyjmuje instrukcje ludzkie jako mechanizm sterujący, ponieważ nie ma potrzeby dostarczania dodatkowych informacji. Te instrukcje oferują wyrazisty i klarowny sposób interakcji, pozwalający użytkownikom wskazać dokładną lokalizację i typ degradacji w obrazie. Ponadto, wykorzystanie prompty użytkownika zamiast ustalonych prompty degradacji poprawia użyteczność i zastosowanie modelu, ponieważ może być również używany przez użytkowników, którzy nie posiadają wymaganej wiedzy specjalistycznej. Aby wyposażyć ramę InstructIR w możliwość zrozumienia różnorodnych prompty, model wykorzystuje model językowy GPT-4, duży model językowy, aby utworzyć różnorodne żądania, z niejasnymi i niejasnymi prompty usuniętymi po procesie filtrowania.
Koder tekstu
Koder tekstu jest używany przez modele językowe do mapowania prompty użytkownika na osadzenie tekstu lub wektor o stałej długości. Tradycyjnie, koder tekstu modelu CLIP jest ważnym składnikiem dla generacji obrazu z tekstu i modeli manipulacji obrazem opartej na tekście, aby zakodować prompty użytkownika, ponieważ rama CLIP wyróżnia się w prompty wizualne. Jednak większość czasu prompty użytkownika dla cech degradacji zawiera niewiele lub żadnego zawartości wizualnej, co sprawia, że duże kodery CLIP są bezużyteczne dla takich zadań, ponieważ znacznie obniża wydajność. Aby rozwiązać ten problem, rama InstructIR wybiera koder zdaniowy, który jest szkolony, aby zakodować zdania w znaczącej przestrzeni osadzania. Kodery zdaniowe są wstępnie szkolone na milionach przykładów i są kompaktowe i wydajne w porównaniu z tradycyjnymi kodерами CLIP, a jednocześnie mają możliwość zakodowania semantyki różnorodnych prompty użytkownika.
Sterowanie tekstem
Jednym z głównych aspektów ramy InstructIR jest implementacja zakodowanej instrukcji jako mechanizmu sterującego dla modelu obrazu. Budując na tym, a zainspirowany routingiem zadań dla wielu zadań, rama InstructIR proponuje blok konstrukcji instrukcji (ICB), aby umożliwić transformacje specyficzne dla zadania wewnątrz modelu. Konwencjonalny routing zadań stosuje binarne maski specyficzne dla zadania do cech kanałowych. Jednak ponieważ rama InstructIR nie zna degradacji, ta technika nie jest implementowana bezpośrednio. Ponadto, dla cech obrazu i zakodowanych instrukcji, rama InstructIR stosuje routing zadań i produkuje maskę za pomocą warstwy liniowej aktywowanej funkcją sigmoidalną, aby wyprodukować zestaw wag w zależności od osadzeń tekstu, co pozwala uzyskać binarną maskę kanałową. Model dalej poprawia warunkowe cechy za pomocą bloku NAF, a także wykorzystuje blok NAF i blok warunkowy instrukcji, aby warunkować cechy w bloku encodera i dekodera.

Chociaż rama InstructIR nie warunkuje filtrów sieci neuronowej wyraźnie, maska umożliwia modelowi wybranie kanałów najbardziej istotnych na podstawie instrukcji obrazu i informacji.
InstructIR: Implementacja i wyniki
Model InstructIR jest szkolalny od końca do końca, a model obrazu nie wymaga wstępnego szkolenia. Tylko projekcje osadzeń tekstu i głowa klasyfikacyjna wymagają szkolenia. Koder tekstu jest inicjowany za pomocą kodera BGE, kodera podobnego do BERT, który jest wstępnie szkolony na ogromnej ilości danych nadzorowanych i nienadzorowanych do ogólnego zakodowania zdaniowego. Rama InstructIR wykorzystuje model NAFNet jako model obrazu, a architektura NAFNet składa się z 4-poziomowego encodera-dekodera z różną liczbą bloków na każdym poziomie. Model dodaje również 4 bloki środkowe między encodera a dekodera, aby dalej poprawić cechy. Ponadto, zamiast łączenia dla połączeń pominięcia, dekoder implementuje dodawanie, a model InstructIR implementuje tylko blok warunkowy instrukcji (ICB) dla routingu zadań tylko w encodera i dekodera. Przechodząc dalej, model InstructIR jest optymalizowany za pomocą straty między przywróconym obrazem a czystym obrazem odniesienia, a strata krzyżowa jest używana dla głowy klasyfikacyjnej kodera tekstu. Model InstructIR wykorzystuje optymalizator AdamW z rozmiarem partii 32 i szybkością uczenia 5e-4 przez około 500 epok, a także implementuje wygaszanie szybkości uczenia za pomocą funkcji cosinusoidalnej. Ponieważ model obrazu w ramie InstructIR składa się tylko z 16 milionów parametrów, a istnieją tylko 100 tysięcy parametrów projekcji tekstu, rama InstructIR może być łatwo szkolona na standardowych GPU, co redukuje koszty obliczeniowe i zwiększa przydatność.
Wyniki wielu degradacji
Dla wielu degradacji i zadań restauracji, rama InstructIR definiuje dwa początkowe ustawienia:
- 3D dla trzech modeli degradacji, aby rozwiązać problemy, takie jak dehazing, denoising i deraining.
- 5D dla pięciu modeli degradacji, aby rozwiązać problemy, takie jak denoising, poprawa obrazów o niskim poziomie światła, dehazing, denoising i deraining.
Wyniki modeli 5D są pokazane w poniższej tabeli, a porównuje je z modelem restauracji obrazu i modelem All-In-One.

Jak można zobaczyć, rama InstructIR z prostym modelem obrazu i tylko 16 milionami parametrów może obsłużyć pięć różnych zadań restauracji obrazu pomyślnie dzięki instrukcjom opartym na sterowaniu i dostarcza konkurencyjne wyniki. Poniższa tabela pokazuje wyniki ramy na modelach 3D, a wyniki są porównywalne z powyższymi wynikami.

Głównym punktem ramy InstructIR jest restauracja obrazu oparta na instrukcjach, a poniższy rysunek pokazuje niesamowite możliwości modelu InstructIR, aby zrozumieć szeroki zakres instrukcji dla danego zadania. Ponadto, dla instrukcji przeciwnych, model InstructIR wykonuje tożsamość, która nie jest wymuszona.

Końcowe myśli
Restauracja obrazu jest podstawowym problemem w widzeniu komputerowym, ponieważ dąży do odzyskania wysokiej jakości, czystego obrazu z obrazu wykazującego degradacje. W niskopoziomowym widzeniu komputerowym, degradacje są terminem używanym do opisania niepożądanych efektów obserwowanych w obrazie, takich jak rozmycie ruchu, mgła, szum, niski zakres dynamiczny i więcej. W tym artykule, omówiliśmy ramę InstructIR, pierwszą na świecie ramę restauracji obrazu, która dąży do kierowania modelem restauracji obrazu za pomocą instrukcji ludzkich. Dla naturalnych prompty językowych, model InstructIR może odzyskać wysokiej jakości obrazy z zdegradowanych i brać pod uwagę wiele typów degradacji. Rama InstructIR jest w stanie dostarczyć wyniki na poziomie stanu sztuki dla szerokiego zakresu zadań restauracji obrazu, w tym deraining, denoising, dehazing, deblurring i poprawy obrazów o niskim poziomie światła.












