AI-modeller og platforme

InstructIR: Højkvalitetsbillede-restaurering efter menneskelige instruktioner

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et billede kan fortælle meget, men det kan også være ødelagt af forskellige problemer som bevægelsesuskarphed, dis, støj og lav dynamisk rækkevidde. Disse problemer, der normalt kaldes degraderinger i lavniveu-computervision, kan opstå på grund af vanskelige miljøbetingelser som varme eller regn eller på grund af kameraets begrænsninger. Billede-restaurering er en kerneudfordring i computervision, der stræber efter at genskabe et højkvalitetsbillede fra et billede, der viser sådanne degraderinger. Billede-restaurering er kompleks, fordi der kan være flere løsninger for at restaurere ethvert givet billede. Nogle metoder fokuserer på bestemte degraderinger, såsom reduktion af støj eller fjernelse af uskarphed eller dis.

Disse metoder kan give gode resultater for bestemte problemer, men de har ofte svært ved at generalisere over forskellige typer degraderinger. Mange rammer anvender en generisk neural netværk til en bred vifte af billede-restaurering-opgaver, men disse netværk er hver trænet separat. Behovet for separate modeller til hver type degradering gør denne tilgang beregningsmæssigt dyrekøbt og tidskrævende, hvilket har ført til en fokus på All-In-One-restaureringsmodeller i nyere udviklinger. Disse modeller anvender en enkelt, dyb blind billede-restaureringsmodel, der kan tackle flere niveauer og typer af billede-degradering, ofte med hjælp af degraderingsspecifikke prompts eller vejledningsvektorer for at forbedre resultaterne. Selvom All-In-One-modellerne typisk viser lovende resultater, står de stadig over for udfordringer med inverse problemer.

InstructIR repræsenterer en banebrydende tilgang i feltet, da det er den første billede-restaureringsramme, der er designet til at guide restaureringsmodellen gennem menneskeskrevne instruktioner. Den kan behandle naturlige sprogprompter for at genskabe højkvalitetsbilleder fra degraderede billeder, med hensyn til forskellige degraderingstyper. InstructIR sætter en ny standard for præstationer på et bredt spektrum af billede-restaurering-opgaver, herunder deraining, støjdæmpning, disfjernelse, uskarphedsfjernelse og forbedring af lavlys-billeder.

Dette artikel sigter mod at dække InstructIR-rammen i dybden, og vi udforsker mekanismen, metoden, arkitekturen i rammen samt sammenligningen med statens kunst og video-genereringsrammer. Så lad os komme i gang.

InstructIR: Højkvalitetsbillede-restaurering

Billede-restaurering er en fundamental problem i computervision, da det sigter mod at genskabe et højkvalitetsrent billede fra et billede, der viser degraderinger. I lavniveu-computervision er degraderinger en term, der bruges til at repræsentere ubehagelige effekter, der observeres i et billede, såsom bevægelsesuskarphed, dis, støj, lav dynamisk rækkevidde og mere. Årsagen til, at billede-restaurering er en kompleks invers udfordring, er, at der kan være flere forskellige løsninger for at restaurere ethvert billede. Nogle rammer fokuserer på bestemte degraderinger, såsom reduktion af instans-støj eller støjdæmpning af billedet, mens andre måske fokuserer mere på fjernelse af uskarphed eller uskarphedsfjernelse eller disfjernelse.

Seneste dybe læringsmetoder har vist stærkere og mere konsekvent præstation i forhold til traditionelle billede-restaureringsmetoder. Disse dybe læring-billede-restaureringsmodeller foreslår at anvende neurale netværk baseret på Transformers og convolutionelle neurale netværk. Disse modeller kan trænes uafhængigt til forskellige billede-restaurering-opgaver, og de har også evnen til at fange lokale og globale funktionssammenhænge og forbedre dem, hvilket resulterer i tilfredsstillende og konsekvent præstation. Selvom nogle af disse metoder kan fungere tilfredsstillende for bestemte typer degraderinger, kan de typisk ikke generalisere godt til forskellige typer degraderinger. Derudover, mens mange eksisterende rammer anvender det samme neurale netværk til en bred vifte af billede-restaurering-opgaver, er hver neurale netværksformulering trænet separat. Derfor er det åbenlyst, at anvendelsen af en separat neural model til hver tænkelig degradering er uigennemførlig og tidskrævende, hvilket har ført til en fokus på All-In-One-restaureringsproxier.

All-In-One eller multi-degradering eller multi-opgave billede-restaureringsmodeller vinder popularitet i computervisionsfeltet, da de kan restaurere multiple typer og niveauer af degraderinger i et billede uden behov for at træne modellerne uafhængigt til hver degradering. All-In-One-billede-restaureringsmodeller anvender en enkelt, dyb blind billede-restaureringsmodel til at tackle forskellige typer og niveauer af billede-degradering. Forskellige All-In-One-modeller implementerer forskellige tilgange til at guide den blinde model til at restaurere det degraderede billede, f.eks. en hjælpe-model til at klassificere degraderingen eller multi-dimensionelle vejledningsvektorer eller prompts til at hjælpe modellen med at restaurere forskellige typer degraderinger i et billede.

Med det sagde, kommer vi til tekst-baseret billede-manipulation, da det er blevet implementeret af flere rammer i de seneste år til tekst-til-billede-generering og tekst-baseret billede-redigering-opgaver. Disse modeller anvender ofte tekst-prompts til at beskrive handlinger eller billeder samt diffusions-baserede modeller til at generere de tilsvarende billeder. Den primære inspiration for InstructIR-rammen er InstructPix2Pix-rammen, der giver mulighed for at redigere billedet ved hjælp af brugerinstruktioner, der instruerer modellen om, hvilken handling der skal udføres, i stedet for tekst-etiketter, beskrivelser eller undertekster til input-billedet. Som resultat kan brugere anvende naturlige skrevne tekster til at instruere modellen om, hvilken handling der skal udføres, uden behov for at give eksempel-billeder eller yderligere billed-beskrivelser.

Bygget på disse grundlag, er InstructIR-rammen den første computer-vision-model, der anvender menneskeskrevne instruktioner til at opnå billede-restaurering og løse inverse problemer. For naturlige sprogprompter kan InstructIR-modellen genskabe højkvalitetsbilleder fra deres degraderede modstykke og tager også hensyn til multiple degraderingstyper. InstructIR-rammen kan levere statens kunst-præstationer på en bred vifte af billede-restaurering-opgaver, herunder billede-deraining, støjdæmpning, disfjernelse, uskarphedsfjernelse og forbedring af lavlys-billeder. I modsætning til eksisterende værker, der opnår billede-restaurering ved hjælp af lært vejledningsvektorer eller prompt-embedding, anvender InstructIR-rammen rå bruger-prompts i tekstform. InstructIR-rammen kan generalisere til at restaurere billeder ved hjælp af menneskeskrevne instruktioner, og den enkelte All-In-One-model, der er implementeret af InstructIR, dækker flere restaureringsopgaver end tidligere modeller.

InstructIR: Metode og Arkitektur

I sin kerne består InstructIR-rammen af en tekst-encoder og en billede-model. Modellen anvender NAFNet-rammen, en effektiv billede-restaureringsmodel, der følger en U-Net-arkitektur som billede-modellen. Derudover implementerer modellen opgave-routings-teknikker til at lære multiple opgaver ved hjælp af en enkelt model. Den følgende figur illustrerer trænings- og evalueringstilgangen for InstructIR-rammen.

Inspireret af InstructPix2Pix-modellen, adopterer InstructIR-rammen menneskeskrevne instruktioner som kontrollmekanisme, da der ikke er behov for brugeren at give yderligere information. Disse instruktioner giver en udtryksfuld og klar måde at interagere på, der giver brugerne mulighed for at pege på det præcise sted og type af degradering i billedet. Derudover giver anvendelsen af bruger-prompts i stedet for faste degraderingsspecifikke prompts en forbedret brugervenlighed og anvendelighed af modellen, da den også kan anvendes af brugere, der mangler den nødvendige domæne-ekspertise. For at udstyre InstructIR-rammen med evnen til at forstå forskellige prompts, anvender modellen GPT-4, en stor sprogmodel til at skabe forskellige anmodninger, med tvetydige og uklare prompts fjernet efter en filtreringsproces.

Tekst-Encoder

En tekst-encoder anvendes af sprogmodeller til at kortlægge bruger-prompts til en tekst-embedding eller en fast størrelse-vektor-repræsentation. Traditionelt er tekst-encoderen i en CLIP-model en vital komponent for tekst-baseret billede-generering og tekst-baseret billede-manipulation-modeller til at encode bruger-prompts, da CLIP-rammen excellerer i visuelle prompts. Men de fleste gange har bruger-prompts for degradering kun lidt eller intet visuelt indhold, hvilket gør de store CLIP-encodere ubrugelige til sådanne opgaver, da det vil hæmme effektiviteten betydeligt. For at tackle dette problem, vælger InstructIR-rammen en tekst-baseret sætning-encoder, der er trænet til at encode sætninger i et meningsfuldt embedding-rum. Sætning-encodere er forudtrænet på millioner af eksempler og er alligevel kompakte og effektive i forhold til traditionelle CLIP-baserede tekst-encodere, mens de har evnen til at encode semantikken af forskellige bruger-prompts.

Tekst-Vejledning

En vigtig aspekt af InstructIR-rammen er implementeringen af den encodede instruktion som en kontrollmekanisme for billede-modellen. Bygget på dette og inspireret af opgave-routings til mange opgave-læring, foreslår InstructIR-rammen en Instruction Construction Block eller ICB til at aktivere opgave-specifikke transformationer inden for modellen. Konventionel opgave-routings anvender opgave-specifikke binære masker til kanal-funktioner. Men da InstructIR-rammen ikke kender degraderingen, implementeres denne teknik ikke direkte. Derudover anvender InstructIR-rammen opgave-routings for billede-funktioner og de encodede instruktioner og producerer masken ved hjælp af en lineær-lag aktiveret med Sigmoid-funktionen til at producere en sæt af vægte afhængigt af tekst-embedding, hvilket giver en c-dimensionel kanal-binær maske. Modellen forbedrer herefter de betingede funktioner ved hjælp af en NAFBlock, og anvender NAFBlock og Instruction Conditioned Block til at betinge funktionerne både i encoder-blokken og decoder-blokken.

Selvom InstructIR-rammen ikke betinger neurale netværks-filtre explicit, giver masken modellen mulighed for at vælge de kanaler, der er mest relevante på basis af billed-instruktion og information.

InstructIR: Implementering og Resultater

InstructIR-modellen er end-to-end-trænbar, og billede-modellen kræver ikke forudtræning. Det er kun tekst-embedding-projektioner og klassificeringshoved, der skal trænes. Tekst-encoderen initialiseres ved hjælp af en BGE-encoder, en BERT-lignende encoder, der er forudtrænet på en masse superviseret og usuperviseret data til generisk sætning-encoding. InstructIR-rammen anvender NAFNet-modellen som billede-model, og arkitekturen af NAFNet består af en 4-niveau-encoder-decoder med varierende antal blokke på hvert niveau. Modellen tilføjer også 4 mellem-blokke mellem encoder og decoder for at yderligere forbedre funktionerne. Derudover implementerer InstructIR-modellen kun ICB eller Instruction Conditioned Block til opgave-routings kun i encoder og decoder. Herefter optimeres InstructIR-modellen ved hjælp af tab-mellem det restaurerede billede og det grund-sandhed-rene billede, og cross-entropy-tab anvendes til intent-klassificeringshoved for tekst-encoderen. InstructIR-modellen anvender AdamW-optimeren med en batch-størrelse på 32 og en læringsrate på 5e-4 i næsten 500 epocher og implementerer også cosine-annealing-læringsrate-forfald. Da billede-modellen i InstructIR-rammen kun består af 16 millioner parametre, og der kun er 100.000 lært tekst-projektionsparametre, kan InstructIR-rammen let trænes på standard-GPU’er, hvilket reducerer beregningsomkostningerne og øger anvendeligheden.

Flere Degradering Resultater

For flere degraderinger og multi-opgave-restaureringer definerer InstructIR-rammen to initialiserings-sæt:

  1. 3D for tre-degraderings-modeller til at tackle degraderings-problemer som disfjernelse, støjdæmpning og deraining.
  2. 5D for fem-degraderings-modeller til at tackle degraderings-problemer som billede-støjdæmpning, lav-lys-forbedring, disfjernelse, støjdæmpning og deraining.

Præstationen af 5D-modellerne demonstreres i den følgende tabel og sammenlignes med statens kunst-billede-restaurerings- og All-In-One-modeller.

Som det kan ses, kan InstructIR-rammen med en simpel billede-model og kun 16 millioner parametre håndtere fem forskellige billede-restaurering-opgaver succesfuldt takket være instruktions-baseret vejledning og leverer konkurrencedygtige resultater. Den følgende tabel demonstrerer præstationen af rammen på 3D-modeller, og resultaterne er sammenlignelige med ovenstående resultater.

Hoved-højdepunktet af InstructIR-rammen er instruktions-baseret billede-restaurering, og den følgende figur demonstrerer den utrolige evne af InstructIR-modellen til at forstå en bred vifte af instruktioner for en given opgave. Derudover udfører InstructIR-modellen en identitet, der ikke er tvunget, for en modstridende instruktion.

Endelige Tanker

Billede-restaurering er en fundamental problem i computervision, da det sigter mod at genskabe et højkvalitetsrent billede fra et billede, der viser degraderinger. I lavniveu-computervision er degraderinger en term, der bruges til at repræsentere ubehagelige effekter, der observeres i et billede, såsom bevægelsesuskarphed, dis, støj, lav dynamisk rækkevidde og mere. I denne artikel har vi talt om InstructIR, verdens første billede-restaurerings-ramme, der sigter mod at guide billede-restaurerings-modellen ved hjælp af menneskeskrevne instruktioner. For naturlige sprogprompter kan InstructIR-modellen genskabe højkvalitetsbilleder fra deres degraderede modstykke og tager også hensyn til multiple degraderingstyper. InstructIR-rammen kan levere statens kunst-præstationer på en bred vifte af billede-restaurering-opgaver, herunder billede-deraining, støjdæmpning, disfjernelse, uskarphedsfjernelse og forbedring af lavlys-billeder.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.