AI-modeller och plattformar

InstructIR: Högkvalitativ Bildåterställning med Mänskliga Instruktioner

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En bild kan förmedla mycket, men den kan också vara fördärvad av olika problem som rörelseoskärpa, dis, brus och låg dynamisk omfång. Dessa problem, som vanligtvis kallas degraderingar i lågnivådatorseende, kan uppstå på grund av svåra miljöförhållanden som värme eller regn eller på grund av kamerans begränsningar. Bildåterställning är en central utmaning inom datorseende, som strävar efter att återställa en högkvalitativ och ren bild från en som visar sådana degraderingar. Bildåterställning är komplext eftersom det kan finnas flera lösningar för att återställa en given bild. Vissa metoder fokuserar på specifika degraderingar, såsom att reducera brus eller ta bort oskärpa eller dis.

Medan dessa metoder kan ge bra resultat för specifika problem, har de ofta svårt att generalisera över olika typer av degraderingar. Många ramverk använder en generisk neural nätverksmodell för en mängd olika bildåterställningsuppgifter, men dessa nätverk tränas var för sig. Behovet av olika modeller för varje typ av degradering gör detta tillvägagångssätt beräkningsmässigt dyrt och tidskrävande, vilket har lett till en fokus på allt-i-ett-återställningsmodeller i senare utveckling. Dessa modeller använder en enda, djup blind återställningsmodell som hanterar olika nivåer och typer av degraderingar, ofta med hjälp av degraderingsspecifika instruktioner eller vägledningsvektorer för att förbättra prestandan. Även om allt-i-ett-modellerna vanligtvis visar lovande resultat, står de fortfarande inför utmaningar med inversa problem.

InstructIR representerar ett banbrytande tillvägagångssätt inom området, som är det första ramverket för bildåterställning som är utformat för att vägleda återställningsmodellen med hjälp av mänskliga instruktioner. Det kan bearbeta naturligt språkliga instruktioner för att återställa högkvalitativa bilder från fördärvade, med hänsyn till olika typer av degraderingar. InstructIR sätter en ny standard för prestanda inom en bred spektrum av bildåterställningsuppgifter, inklusive avregnning, brusreducering, disreducering, oskärpekorrektion och förbättring av lågupplysta bilder.

Denna artikel syftar till att täcka InstructIR-ramverket i detalj, och vi undersöker mekanismen, metodiken, arkitekturen i ramverket samt dess jämförelse med state-of-the-art-bild- och videogenereringsramverk. Så låt oss komma igång.

InstructIR: Högkvalitativ Bildåterställning

Bildåterställning är ett grundläggande problem inom datorseende, eftersom det syftar till att återställa en högkvalitativ och ren bild från en bild som visar degraderingar. I lågnivådatorseende är degraderingar ett begrepp som används för att representera oönskade effekter som observeras inom en bild, såsom rörelseoskärpa, dis, brus, låg dynamisk omfång och mer. Anledningen till att bildåterställning är en komplex invers utmaning är att det kan finnas flera olika lösningar för att återställa en given bild. Vissa ramverk fokuserar på specifika degraderingar, såsom att reducera brus eller ta bort oskärpa eller dis.

Senaste djupinlärningsmetoder har visat starkare och mer konsekvent prestanda jämfört med traditionella bildåterställningsmetoder. Dessa djupinlärningsbaserade bildåterställningsmodeller föreslår att man använder neurala nätverk baserade på transformer och konvolutionsneurala nätverk. Dessa modeller kan tränas oberoende för olika bildåterställningsuppgifter och de har också förmågan att fånga lokala och globala funktionssamspel och förbättra dem, vilket resulterar i tillfredsställande och konsekvent prestanda. Även om vissa av dessa metoder kan fungera tillräckligt bra för specifika typer av degraderingar, generaliserar de vanligtvis inte väl till olika typer av degraderingar. Dessutom, medan många existerande ramverk använder samma neurala nätverksmodell för en mängd olika bildåterställningsuppgifter, tränas varje neural nätverksformulering separat. Det är därför uppenbart att användningen av en separat neural modell för varje tänkbar degradering är omöjlig och tidskrävande, vilket har lett till en fokus på allt-i-ett-återställningsproxier.

Allt-i-ett- eller multidegraderings- eller multuppgiftsbildåterställningsmodeller blir allt mer populära inom datorseende, eftersom de kan återställa flera typer och nivåer av degraderingar i en bild utan behov av att träna modellerna oberoende för varje degradering. Allt-i-ett-bildåterställningsmodeller använder en enda, djup blind bildåterställningsmodell för att hantera olika typer och nivåer av bilddegradering. Olika allt-i-ett-modeller implementerar olika tillvägagångssätt för att vägleda den blinda modellen för att återställa den fördärvade bilden, till exempel en hjälpmodell för att klassificera degraderingen eller flerdimensionella vägledningsvektorer eller instruktioner för att hjälpa modellen att återställa olika typer av degraderingar inom en bild.

Med det sagt kommer vi till textbaserad bildmanipulation, eftersom det har implementerats av flera ramverk under de senaste åren för text-till-bild-generering och textbaserad bildredigering. Dessa modeller använder ofta textinstruktioner för att beskriva åtgärder eller bilder, tillsammans med diffusionsbaserade modeller för att generera motsvarande bilder. Den huvudsakliga inspirationen för InstructIR-ramverket är InstructPix2Pix-ramverket, som möjliggör för modellen att redigera bilden med hjälp av användarinstruktioner som instruerar modellen om vilken åtgärd som ska utföras, snarare än textetiketter, beskrivningar eller rubriker för ingångsbilden. Som ett resultat kan användare använda naturligt skrivna texter för att instruera modellen om vilken åtgärd som ska utföras utan att behöva tillhandahålla exempelbilder eller ytterligare bildbeskrivningar.

Byggande på dessa grunder är InstructIR-ramverket världens första datorseende-modell som använder mänskliga instruktioner för att uppnå bildåterställning och lösa inversa problem. För naturligt språkliga instruktioner kan InstructIR-modellen återställa högkvalitativa bilder från fördärvade och ta hänsyn till flera typer av degraderingar. InstructIR-ramverket kan leverera toppmodellprestanda på en bred spektrum av bildåterställningsuppgifter, inklusive avregnning, brusreducering, disreducering, oskärpekorrektion och förbättring av lågupplysta bilder. I kontrast till existerande arbeten som uppnår bildåterställning med hjälp av inlärda vägledningsvektorer eller promptinbäddningar, använder InstructIR-ramverket råa användarinstruktioner i textform. InstructIR-ramverket kan generalisera till att återställa bilder med hjälp av mänskliga instruktioner, och den enda allt-i-ett-modell som implementeras av InstructIR täcker fler återställningsuppgifter än tidigare modeller. Följande figur visar de olika återställningsexemplen för InstructIR-ramverket.

InstructIR : Metod och Arkitektur

Till sin kärna består InstructIR-ramverket av en textkodare och en bildmodell. Modellen använder NAFNet-ramverket, en effektiv bildåterställningsmodell som följer en U-Net-arkitektur som bildmodell. Dessutom implementerar modellen uppgiftsroutningstekniker för att lära sig flera uppgifter med en enda modell framgångsrikt. Följande figur illustrerar tränings- och utvärderingsmetoden för InstructIR-ramverket.

Med inspiration från InstructPix2Pix-modellen, antar InstructIR-ramverket mänskliga instruktioner som kontrollmekanism, eftersom det inte finns något behov för användaren att tillhandahålla ytterligare information. Dessa instruktioner erbjuder ett uttrycksfullt och tydligt sätt att interagera, vilket tillåter användare att peka ut den exakta platsen och typen av degradering i bilden. Dessutom, med användning av användarinstruktioner istället för fasta degraderingsspecifika instruktioner, förbättras modellens användbarhet och tillämpningar, eftersom den också kan användas av användare som saknar den erforderliga domänkompetensen. För att utrusta InstructIR-ramverket med förmågan att förstå olika instruktioner, använder modellen GPT-4, en stor språkmodell för att skapa olika förfrågningar, med oklara och otydliga instruktioner borttagna efter en filterprocess.

Textkodare

En textkodare används av språkmodeller för att mappa användarinstruktioner till en textinbäddning eller en fast storleksvektorrepresentation. Traditionellt är textkodaren i en CLIP-modell en viktig komponent för textbaserad bildgenerering och textbaserad bildmanipulation, eftersom CLIP-ramverket excellerar i visuella instruktioner. Emellertid, de flesta gånger, innehåller användarinstruktioner för degraderingar lite eller inget visuellt innehåll, vilket gör de stora CLIP-kodarna värdelösa för sådana uppgifter, eftersom det skulle hindra effektiviteten avsevärt. För att hantera detta problem, väljer InstructIR-ramverket en textbaserad meningkodare som är tränad för att koda meningar i ett meningsfullt inbäddningsspace. Meningkodare är förtränade på miljontals exempel och är kompakta och effektiva i jämförelse med traditionella CLIP-baserade textkodare, med förmågan att koda semantiken i olika användarinstruktioner.

Textvägledning

En viktig aspekt av InstructIR-ramverket är implementeringen av den kodade instruktionen som en kontrollmekanism för bildmodellen. Byggande på detta, och inspirerad av uppgiftsroutning för flera uppgifter, föreslår InstructIR-ramverket en instruktionskonstruktionsblock eller ICB för att möjliggöra uppgiftsspecifika transformationer inom modellen. Traditionell uppgiftsroutning tillämpar uppgiftsspecifika binära masker på kanal funktioner. Emellertid, eftersom InstructIR-ramverket inte känner till degraderingen, implementeras inte denna teknik direkt. Dessutom, för bildfunktioner och de kodade instruktionerna, tillämpar InstructIR-ramverket uppgiftsroutning och producerar masken med hjälp av en linjär-lager aktiverad med Sigmoid-funktionen för att producera en uppsättning vikter beroende på textinbäddningarna, vilket resulterar i en c-dimensionell per kanal binär mask. Modellen förbättrar dessutom de villkorsstyrda funktionerna med hjälp av en NAFBlock, och använder NAFBlock och instruktionsvillkorsblock för att villkorsstyra funktionerna i både encoder-blocket och decoder-blocket.

Även om InstructIR-ramverket inte villkorsstyr neurala nätverksfilter explicit, möjliggör masken för modellen att välja de kanaler som är mest relevanta baserat på bildinstruktionen och informationen.

InstructIR: Implementering och Resultat

InstructIR-modellen är slut-till-slut-tränbar, och bildmodellen behöver inte förtränas. Det är endast textinbäddningsprojektioner och klassificeringshuvud som behöver tränas. Textkodaren initieras med en BGE-kodare, en BERT-liknande kodare som är förtränad på en stor mängd övervakad och oövervakad data för generell meningkodning. InstructIR-ramverket använder NAFNet-modellen som bildmodell, och arkitekturen i NAFNet består av en 4-nivåencoder-decoder med varierande antal block på varje nivå. Modellen lägger också till 4 mitterblock mellan encoder och decoder för att ytterligare förbättra funktionerna. Dessutom, istället för att konkatenera för hopanslutningar, implementerar decoder addition, och InstructIR-modellen implementerar endast ICB eller instruktionsvillkorsblock för uppgiftsroutning endast i encoder och decoder. InstructIR-modellen optimeras med förlusten mellan den återställda bilden och den grundläggande rena bilden, och tvärsentropiförlusten används för avsiktsklassificeringshuvudet för textkodaren. InstructIR-modellen använder AdamW-optimisatorn med en batchstorlek på 32 och en inlärningshastighet på 5e-4 för nästan 500 epoker, och implementerar också cosinus-avklingande inlärningshastighetsminskning. Eftersom bildmodellen i InstructIR-ramverket endast består av 16 miljoner parametrar, och det finns endast 100 000 inlärda textprojektionsparametrar, kan InstructIR-ramverket enkelt tränas på standard-GPU:er, vilket minskar beräkningskostnaderna och ökar tillämpbarheten.

Flera Degraderingar Resultat

För flera degraderingar och multuppgiftsåterställning, definierar InstructIR-ramverket två initiala konfigurationer:

  1. 3D för tre-degraderingsmodeller för att hantera degraderingsproblem som disreducering, brusreducering och avregnning.
  2. 5D för fem-degraderingsmodeller för att hantera degraderingsproblem som bildbrusreducering, lågupplyst förbättring, disreducering, brusreducering och avregnning.

Prestandan för 5D-modellerna visas i följande tabell, och jämförs med state-of-the-art-bildåterställnings- och allt-i-ett-modeller.

Som det kan observeras, kan InstructIR-ramverket med en enkel bildmodell och endast 16 miljoner parametrar hantera fem olika bildåterställningsuppgifter framgångsrikt tack vare instruktionsbaserad vägledning, och levererar konkurrenskraftiga resultat. Följande tabell visar prestandan för ramverket på 3D-modeller, och resultaten är jämförbara med ovanstående resultat.

Den viktigaste aspekten av InstructIR-ramverket är instruktionsbaserad bildåterställning, och följande figur visar den otroliga förmågan hos InstructIR-modellen att förstå en bred variation av instruktioner för en given uppgift. Dessutom, för en antagonistisk instruktion, utför InstructIR-modellen en identitet som inte är tvingad.

Slutliga Tankar

Bildåterställning är ett grundläggande problem inom datorseende, eftersom det syftar till att återställa en högkvalitativ och ren bild från en bild som visar degraderingar. I lågnivådatorseende är degraderingar ett begrepp som används för att representera oönskade effekter som observeras inom en bild, såsom rörelseoskärpa, dis, brus, låg dynamisk omfång och mer. I denna artikel har vi talat om InstructIR, världens första bildåterställningsramverk som syftar till att vägleda bildåterställningsmodellen med hjälp av mänskliga instruktioner. För naturligt språkliga instruktioner kan InstructIR-modellen återställa högkvalitativa bilder från fördärvade och ta hänsyn till flera typer av degraderingar. InstructIR-ramverket kan leverera toppmodellprestanda på en bred spektrum av bildåterställningsuppgifter, inklusive avregnning, brusreducering, disreducering, oskärpekorrektion och förbättring av lågupplysta bilder.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.