Modele și platforme AI
InstructIR: Restaurarea imaginilor de înaltă calitate după instrucțiunile umane
O imagine poate transmite mult, dar poate fi și afectată de diverse probleme, cum ar fi blurul de mișcare, ceața, zgomotul și intervalul dinamic redus. Aceste probleme, cunoscute sub numele de degradări în viziunea computerizată de nivel scăzut, pot apărea din cauza condițiilor de mediu dificile, cum ar fi căldura sau ploaia, sau din cauza limitărilor camerei în sine. Restaurarea imaginilor reprezintă o provocare de bază în viziunea computerizată, care urmărește să recupereze o imagine de înaltă calitate și curată dintr-una care prezintă astfel de degradări. Restaurarea imaginilor este complexă, deoarece pot exista multiple soluții pentru restaurarea oricărei imagini. Unele abordări se concentrează pe degradări specifice, cum ar fi reducerea zgomotului sau înlăturarea blurului sau a ceții.
În timp ce aceste metode pot oferi rezultate bune pentru anumite probleme, ele adesea nu se generalizează bine pentru diferite tipuri de degradări. Multe cadre utilizează o rețea neurală generică pentru o gamă largă de sarcini de restaurare a imaginilor, dar aceste rețele sunt antrenate separat. Nevoia de modele diferite pentru fiecare tip de degradare face ca această abordare să fie computațional scumpă și consumatoare de timp, ceea ce a condus la concentrarea asupra modelelor de restaurare All-In-One în dezvoltările recente. Aceste modele utilizează un model de restaurare orb singur pentru a aborda diferite niveluri și tipuri de degradare a imaginilor, adesea folosind prompturi sau vectori de ghidare specifice degradării pentru a îmbunătăți performanța. Deși modelele All-In-One oferă de obicei rezultate promițătoare, ele încă se confruntă cu provocări legate de problemele inverse.
InstructIR reprezintă o abordare revoluționară în domeniu, fiind primul cadru de restaurare a imaginilor proiectat pentru a ghida modelul de restaurare prin instrucțiuni scrise de om. Acesta poate procesa prompturi de limbaj natural pentru a recupera imagini de înaltă calitate din cele degradate, luând în considerare diverse tipuri de degradări. InstructIR stabilește un nou standard de performanță pentru o gamă largă de sarcini de restaurare a imaginilor, incluzând îndepărtarea ploii, reducerea zgomotului, îndepărtarea ceții, îndepărtarea blurului și îmbunătățirea imaginilor cu lumină slabă.
Acest articol își propune să acopere cadrul InstructIR în profunzime și explorăm mecanismul, metodologia, arhitectura cadrului, împreună cu comparația cu cadrele de stat de imagine și video de generație. Deci, să începem.
InstructIR: Restaurarea imaginilor de înaltă calitate
Restaurarea imaginilor este o problemă fundamentală în viziunea computerizată, deoarece urmărește să recupereze o imagine curată și de înaltă calitate dintr-una care prezintă degradări. În viziunea computerizată de nivel scăzut, degradările sunt un termen utilizat pentru a reprezenta efectele neplăcute observate într-o imagine, cum ar fi blurul de mișcare, ceața, zgomotul, intervalul dinamic redus și altele. Motivul pentru care restaurarea imaginilor este o provocare inversă complexă este că pot exista multiple soluții pentru restaurarea oricărei imagini. Unele cadre se concentrează pe degradări specifice, cum ar fi reducerea zgomotului sau îndepărtarea blurului, în timp ce altele se pot concentra mai mult pe îndepărtarea ceții sau îndepărtarea blurului.
Metodele recente de învățare profundă au arătat o performanță mai puternică și mai consistentă în comparație cu metodele tradiționale de restaurare a imaginilor. Aceste modele de restaurare a imaginilor propun să utilizeze rețele neuronale bazate pe transformatori și rețele neuronale convolutive. Aceste modele pot fi antrenate independent pentru diverse sarcini de restaurare a imaginilor și posedă capacitatea de a capta interacțiuni de caracteristici locale și globale, și de a le îmbunătăți, rezultând o performanță satisfăcătoare și consistentă. Deși unele dintre aceste metode pot funcționa adecvat pentru anumite tipuri de degradări, ele nu se generalizează bine pentru diferite tipuri de degradări. Mai mult, în timp ce multe cadre existente utilizează aceeași rețea neurală pentru o multitudine de sarcini de restaurare a imaginilor, fiecare formulare a rețelei neuronale este antrenată separat. Prin urmare, este evident că utilizarea unui model neural separat pentru fiecare degradare imaginabilă este impracticabilă și consumatoare de timp, ceea ce a condus la concentrarea asupra modelelor de restaurare All-In-One.
Modelele All-In-One sau multi-degradări sau multi-sarcini de restaurare a imaginilor câștigă popularitate în domeniul viziunii computerizate, deoarece sunt capabile să restaureze multiple tipuri și niveluri de degradări ale imaginilor fără a necesita antrenarea modelelor independent pentru fiecare degradare. Modelele All-In-One de restaurare a imaginilor utilizează un model de restaurare orb adânc pentru a aborda diferite tipuri și niveluri de degradare a imaginilor, adesea folosind prompturi sau vectori de ghidare specifici degradării pentru a îmbunătăți performanța. Deși modelele All-In-One oferă de obicei rezultate promițătoare, ele încă se confruntă cu provocări legate de problemele inverse.
Cu toate acestea, ne-am concentrat asupra manipulării imaginilor bazate pe text, deoarece a fost implementată de mai multe cadre în ultimii ani pentru generarea de imagini din text și sarcinile de editare a imaginilor bazate pe text. Aceste modele adesea utilizează prompturi de text pentru a descrie acțiuni sau imagini, împreună cu modele de difuzie pentru a genera imagini corespunzătoare. Inspirat de cadrul InstructPix2Pix, care permite modelului să editeze imaginea utilizând instrucțiuni scrise de om, care instruiesc modelul asupra acțiunii de efectuat, în loc de etichete de text, descrieri sau subtitrări ale imaginii de intrare. Prin urmare, utilizatorii pot utiliza texte scrise natural pentru a instrui modelul asupra acțiunii de efectuat, fără a necesita imagini de exemplu sau descrieri suplimentare de imagine.
Pe baza acestor principii, cadrul InstructIR este primul model de viziune computerizată care utilizează instrucțiuni scrise de om pentru a atinge restaurarea imaginilor și a rezolva problemele inverse. Pentru prompturi de limbaj natural, modelul InstructIR poate recupera imagini de înaltă calitate din cele degradate și ia în considerare multiple tipuri de degradări. Cadrul InstructIR este capabil să ofere o performanță de stat de artă pentru o gamă largă de sarcini de restaurare a imaginilor, incluzând îndepărtarea ploii, reducerea zgomotului, îndepărtarea ceții, îndepărtarea blurului și îmbunătățirea imaginilor cu lumină slabă. În contrast cu lucrările existente care ating restaurarea imaginilor utilizând vectori de ghidare învățați sau încorporări de prompturi, cadrul InstructIR utilizează prompturi brute de utilizator în formă de text. Cadrul InstructIR este capabil să se generalizeze la restaurarea imaginilor utilizând instrucțiuni scrise de om, iar modelul unic All-In-One implementat de InstructIR acoperă mai multe sarcini de restaurare decât modelele anterioare. Următoarea figură demonstrează mostre diverse de restaurare ale cadrului InstructIR.

InstructIR: Metodă și Arhitectură
La bază, cadrul InstructIR constă dintr-un codificator de text și un model de imagine. Modelul utilizează cadrul NAFNet, un model eficient de restaurare a imaginilor care urmează o arhitectură U-Net, ca model de imagine. Mai mult, modelul implementează tehnici de rutare a sarcinilor pentru a învăța multiple sarcini utilizând un singur model. Următoarea figură ilustrează abordarea de antrenare și evaluare pentru cadrul InstructIR.

Inspirat de modelul InstructPix2Pix, cadrul InstructIR adoptă instrucțiuni scrise de om ca mecanism de control, deoarece nu există nevoia ca utilizatorul să furnizeze informații suplimentare. Aceste instrucțiuni oferă o modalitate expresivă și clară de interacțiune, permițând utilizatorilor să indice locația exactă și tipul de degradare din imagine. Mai mult, utilizarea prompturilor de utilizator în loc de prompturi specifice degradării îmbunătățește utilizabilitatea și aplicațiile modelului, deoarece acesta poate fi utilizat și de utilizatori care nu posedă expertiza necesară. Pentru a dota cadrul InstructIR cu capacitatea de a înțelege prompturi diverse, modelul utilizează GPT-4, un model de limbaj mare pentru a crea solicitări diverse, cu prompturi ambigue și neclare eliminate după un proces de filtrare.
Codificator de Text
Un codificator de text este utilizat de modelele de limbaj pentru a mapa prompturile de utilizator la o reprezentare de text încorporat sau un vector de dimensiune fixă. În mod tradițional, codificatorul de text al unui model CLIP este o componentă vitală pentru generarea de imagini din text și modelele de manipulare a imaginilor bazate pe text pentru a codifica prompturi de utilizator, deoarece cadrul CLIP excelează în prompturi vizuale. Cu toate acestea, majoritatea timpului, prompturile de utilizator pentru caracteristicile de degradare conțin puțin sau deloc conținut vizual, ceea ce face ca codificatorii mari CLIP să fie ineficienți pentru astfel de sarcini, deoarece ar împiedica semnificativ eficiența. Pentru a aborda această problemă, cadrul InstructIR optează pentru un codificator de propoziții bazat pe text, care este antrenat pentru a codifica propoziții într-un spațiu de încorporare semnificativ. Codificatorii de propoziții sunt preantrenați pe milioane de exemple și, cu toate acestea, sunt compacte și eficiente în comparație cu codificatorii de text CLIP tradiționali, având capacitatea de a codifica semanticile prompturilor de utilizator diverse.
Ghidare de Text
Un aspect major al cadrului InstructIR este implementarea instrucțiunii codificate ca mecanism de control pentru modelul de imagine. Pe baza acestuia și inspirat de rutarea sarcinilor pentru învățarea multi-sarcinilor, cadrul InstructIR propune un bloc de construcție a instrucțiunii (ICB) pentru a permite transformări specifice sarcinii în interiorul modelului. Rutarea convențională a sarcinilor aplică mască binară specifică sarcinii la caracteristicile canalului. Cu toate acestea, deoarece cadrul InstructIR nu cunoaște degradarea, această tehnică nu este implementată direct. Mai mult, pentru caracteristicile de imagine și instrucțiunile codificate, cadrul InstructIR aplică rutarea sarcinilor și produce masca utilizând o funcție de activare liniară utilizând funcția sigmoid pentru a produce un set de greutăți dependente de încorporările de text, obținând astfel o mască binară per canal de dimensiune c. Modelul mai îmbunătățește caracteristicile condiționate utilizând un bloc NAF și utilizează blocul NAF și blocul condiționat de instrucțiune pentru a condiționa caracteristicile atât în blocul decodificator, cât și în blocul decodificator.

Deși cadrul InstructIR nu condiționează filtrele neuronale în mod explicit, masca permite modelului să selecteze canalele cele mai relevante pe baza instrucțiunii și informației de imagine.
InstructIR: Implementare și Rezultate
Modelul InstructIR este antrenabil de la capăt la coadă, iar modelul de imagine nu necesită preantrenare. Doar proiecțiile de încorporare a textului și capul de clasificare necesită antrenare. Codificatorul de text este inițializat utilizând un codificator BGE, un codificator similar cu BERT, care este preantrenat pe o cantitate masivă de date supervizate și nesupervizate pentru încorporarea propozițiilor generice. Cadrul InstructIR utilizează modelul NAFNet ca model de imagine, iar arhitectura modelului NAFNet constă dintr-un decodificator cu 4 niveluri, cu un număr variabil de blocuri la fiecare nivel. Modelul adaugă, de asemenea, 4 blocuri intermediare între decodificator și decodificator pentru a îmbunătăți caracteristicile. Mai mult, în loc de a concatena pentru conexiunile de salt, decodificatorul implementează adăugarea, iar modelul InstructIR implementează doar blocul condiționat de instrucțiune (ICB) pentru rutarea sarcinilor doar în decodificator și decodificator. În continuare, modelul InstructIR este optimizat utilizând pierderea dintre imaginea restaurată și imaginea curată de referință, iar pierderea entropiei cruzime este utilizată pentru capul de clasificare a intenției codificatorului de text. Modelul InstructIR utilizează optimizatorul AdamW cu o dimensiune a lotului de 32 și o rată de învățare de 5e-4 pentru aproximativ 500 de epoci, și implementează, de asemenea, decăderea ratei de învățare cosinusoidală. Deoarece modelul de imagine din cadrul InstructIR conține doar 16 milioane de parametri, iar există doar 100.000 de parametri de proiecție de text învățați, cadrul InstructIR poate fi antrenat ușor pe GPU-uri standard, reducând astfel costurile computaționale și creșterea aplicabilității.
Rezultate pentru Multiple Degradări
Pentru multiple degradări și restaurări multi-sarcini, cadrul InstructIR definește două configurații inițiale:
- 3D pentru modele cu trei degradări pentru a aborda probleme de degradare, cum ar fi îndepărtarea ceții, reducerea zgomotului și îndepărtarea ploii.
- 5D pentru modele cu cinci degradări pentru a aborda probleme de degradare, cum ar fi îndepărtarea zgomotului, îmbunătățirea imaginilor cu lumină slabă, îndepărtarea ceții, reducerea zgomotului și îndepărtarea ploii.
Performanța modelelor 5D este demonstrată în următoarea tabelă și o compară cu modelele de stat de imagine și restaurare All-In-One.

Așa cum se poate observa, cadrul InstructIR, cu un model de imagine simplu și doar 16 milioane de parametri, poate gestiona cu succes cinci sarcini de restaurare a imaginilor diferite, datorită ghidării bazate pe instrucțiuni, și oferă rezultate competitive. Următoarea tabelă demonstrează performanța cadrului pe modele 3D, iar rezultatele sunt comparabile cu cele de mai sus.

Punctul forte al cadrului InstructIR este restaurarea imaginilor bazată pe instrucțiuni, iar următoarea figură demonstrează capacitățile incredibile ale modelului InstructIR de a înțelege o gamă largă de instrucțiuni pentru o sarcină dată. De asemenea, pentru o instrucțiune adversă, modelul InstructIR efectuează o identitate care nu este forțată.

Gânduri Finale
Restaurarea imaginilor este o problemă fundamentală în viziunea computerizată, deoarece urmărește să recupereze o imagine curată și de înaltă calitate dintr-una care prezintă degradări. În viziunea computerizată de nivel scăzut, degradările sunt un termen utilizat pentru a reprezenta efectele neplăcute observate într-o imagine, cum ar fi blurul de mișcare, ceața, zgomotul, intervalul dinamic redus și altele. În acest articol, am discutat despre InstructIR, primul cadru de restaurare a imaginilor care urmărește să ghideze modelul de restaurare a imaginilor utilizând instrucțiuni scrise de om. Pentru prompturi de limbaj natural, modelul InstructIR poate recupera imagini de înaltă calitate din cele degradate și ia în considerare multiple tipuri de degradări. Cadrul InstructIR este capabil să ofere o performanță de stat de artă pentru o gamă largă de sarcini de restaurare a imaginilor, incluzând îndepărtarea ploii, reducerea zgomotului, îndepărtarea ceții, îndepărtarea blurului și îmbunătățirea imaginilor cu lumină slabă.












