AI-modeller og plattformer

InstructIR: Høykvalitets bilde restaurering etter menneskelige instruksjoner

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et bilde kan formidle mye, men det kan også være ødelagt av forskjellige problemer som bevegelsesuskarpa, tåke, støy og lav dynamisk rekkevidde. Disse problemene, som vanligvis kalles degraderinger i lavnivå datavisjon, kan oppstå på grunn av vanskelige miljøforhold som varme eller regn, eller på grunn av begrensninger i kameraet selv. Bilde restaurering er en kjernutfordring i datavisjon, som streber etter å gjenopprette et høykvalitetsbilde fra et bilde som viser slike degraderinger. Bilde restaurering er kompleks fordi det kan finnes flere løsninger for å gjenopprette et gitt bilde. Noen metoder tar sikte på spesifikke degraderinger, som å redusere støy eller fjerne uskarpa eller tåke.

Mens disse metodene kan gi gode resultater for bestemte problemer, har de ofte vanskelig for å generalisere over forskjellige typer degraderinger. Mange rammer bruker en generisk neural nettverk for en rekke bilde restaurering oppgaver, men disse nettverkene er hver trenet separat. Behovet for separate modeller for hver type degradering gjør denne tilnærmingen komputasjonelt kostbar og tidskrevende, noe som har ført til en fokus på All-In-One restaureringsmodeller i nyere utviklinger. Disse modellene bruker en enkelt, dyp blind restaureringsmodell som håndterer forskjellige nivåer og typer av bilde degraderinger, ofte med degraderingsspesifikke promter eller veiledningsvektorer for å forbedre ytelsen. Selv om All-In-One-modellene vanligvis viser lovende resultater, møter de fortsatt utfordringer med inverse problemer.

InstructIR representerer en banebrytende tilnærming i feltet, som er den første bilde restaureringsramme som er designet for å guide restaureringsmodellen gjennom menneskeskrevne instruksjoner. Den kan prosessere naturlige språkpromter for å gjenopprette høykvalitetsbilder fra degraderte bilder, og tar hensyn til forskjellige degraderingstyper. InstructIR setter en ny standard for ytelse for en rekke bilde restaurering oppgaver, inkludert deraining, støyreduksjon, tåkefjerning, uskarpa fjerning og forbedring av lavt lys bilder.

Dette artikkel har som mål å dekke InstructIR-rammen i dybden, og vi utforsker mekanismen, metoden, arkitekturen til rammen samt sammenligningen med state of the art bilde og video genereringsrammer. La oss begynne.

InstructIR: Høykvalitets bilde restaurering

Bilde restaurering er en grunnleggende problem i datavisjon siden det har som mål å gjenopprette et høykvalitetsrent bilde fra et bilde som viser degraderinger. I lavnivå datavisjon er degraderinger en term som brukes for å representere ubehagelige effekter som observeres i et bilde, som bevegelsesuskarpa, tåke, støy, lav dynamisk rekkevidde og mer. Årsaken til at bilde restaurering er en kompleks invers utfordring er fordi det kan finnes flere løsninger for å gjenopprette et gitt bilde. Noen rammer fokuserer på spesifikke degraderinger, som å redusere støy eller fjerne uskarpa, mens andre kan fokusere mer på å fjerne tåke eller forbedre lavt lys bilder.

Nyere dyplæringmetoder har vist sterkere og mer konsistent ytelse sammenlignet med tradisjonelle bilde restaureringsmetoder. Disse dyplæring bild restaureringsmodellene foreslår å bruke neurale nettverk basert på Transformers og Convolutional Neural Networks. Disse modellene kan trenes uavhengig for forskjellige bilde restaurering oppgaver, og de har også evnen til å fange lokale og globale funksjonsinteraksjoner og forbedre dem, noe som resulterer i tilfredsstillende og konsistent ytelse. Selv om noen av disse metodene kan fungere tilfredsstillende for bestemte typer degraderinger, gjør de vanligvis ikke det for forskjellige typer degraderinger. Videre, mens mange eksisterende rammer bruker samme neurale nettverk for en rekke bilde restaurering oppgaver, trenes hver neurale nettverksformulering separat. Derfor er det åpenbart at å bruke en separat neuralt modell for hver tenkelig degradering er upraktisk og tidskrevende, noe som har ført til en fokus på All-In-One restaureringsproxier.

All-In-One eller Multi-degradering eller Multi-oppdrag bilde restaureringsmodeller er i økende popularitet i datavisjonsfeltet siden de kan restaurere flere typer og nivåer av degraderinger i et bilde uten å trenes uavhengig for hver degradering. All-In-One bilde restaureringsmodeller bruker en enkelt dyp blind bilde restaureringsmodell for å håndtere forskjellige typer og nivåer av bilde degraderinger. Forskjellige All-In-One-modeller implementerer forskjellige tilnærminger for å guide den blinde modellen til å restaurere det degraderte bildet, for eksempel en hjelpe modell for å klassifisere degraderingen eller multi-dimensjonale veiledningsvektorer eller promter for å forbedre ytelsen.

Med dette sagt, kommer vi til tekstbasert bilde manipulering siden det har blitt implementert av flere rammer i de siste årene for tekst-til-bilde generering og tekstbasert bilde redigering oppgaver. Disse modellene bruker ofte tekstpromter for å beskrive handlinger eller bilder sammen med difusjonsbaserte modeller for å generere de tilsvarende bildene. Hovedinspirasjonen for InstructIR-rammen er InstructPix2Pix-rammen som muliggjør modellen å redigere bildet ved å bruke brukerinstruksjoner som instruerer modellen om hva handling å utføre i stedet for tekstetiketter, beskrivelser eller undertekster av innputtbildet.

Bygget på disse grunnleggende prinsippene, er InstructIR-rammen den første datavisjonsmodellen som bruker menneskeskrevne instruksjoner for å nå bilde restaurering og løse inverse problemer. For naturlige språkpromter kan InstructIR-modellen gjenopprette høykvalitetsbilder fra degraderte bilder og tar hensyn til flere degraderingstyper. InstructIR-rammen kan levere state of the art-ytelse på en rekke bilde restaurering oppgaver, inkludert bilde deraining, støyreduksjon, tåkefjerning, uskarpa fjerning og lavt lys forbedring.

InstructIR: Metode og arkitektur

I sin kerne består InstructIR-rammen av en tekst encoder og en bilde modell. Modellen bruker NAFNet-rammen, en effektiv bilde restaureringsmodell som følger en U-Net arkitektur som bilde modellen. Videre implementerer modellen oppgave-rutings teknikk for å lære flere oppgaver med en enkelt modell suksessfullt.

Inspirert av InstructPix2Pix-modellen, adopterer InstructIR-rammen menneskeskrevne instruksjoner som kontrollmekanismen siden det ikke er nødvendig for brukeren å gi ekstra informasjon. Disse instruksjonene tilbyr en uttrykksfull og klar måte å interagere på, som tillater brukerne å peke på den eksakte lokasjonen og typen av degradering i bildet.

Tekst Encoder

En tekst encoder brukes av språkmodeller for å kartlegge brukerpromter til en tekst-embedding eller en fast størrelse vektorrepresentasjon. Tradisjonelt er tekst encoderen til en CLIP-modell en viktig komponent for tekstbasert bilde generering og tekstbasert bilde manipulering modeller for å kode brukerpromter siden CLIP-rammen excellerer i visuelle promter.

Tekst Veiledning

En viktig del av InstructIR-rammen er implementeringen av den kodete instruksjonen som en kontrollmekanismen for bilde modellen. Bygget på dette, og inspirert av oppgave-rutings for mange oppgaver, foreslår InstructIR-rammen en Instruksjons Konstruksjons Blokk eller ICB for å muliggjøre oppgave-spesifikke transformasjoner innenfor modellen.

Selv om InstructIR-rammen ikke konditionerer neurale nettverksfilter eksplisitt, muliggjør masken at modellen kan velge kanalene som er mest relevante basert på bilde instruksjon og informasjon.

InstructIR: Implementering og resultater

InstructIR-modellen er end-to-end trenbar, og bilde modellen trenger ikke for-trening. Det er bare tekst-embedding-projeksjonene og klassifiseringshodet som trenger å trenes. Tekst encoderen initialiseres ved å bruke en BGE-encoder, en BERT-lignende encoder som er for-trent på en stor mengde overvåket og uovervåket data for generisk setning encoding.

Flere degraderinger resultater

For flere degraderinger og multi-oppdrag restaurering, definerer InstructIR-rammen to innledende oppsett:

  1. 3D for tre-degraderingsmodeller for å håndtere degraderingsproblemer som tåkefjerning, støyreduksjon og deraining.
  2. 5D for fem degraderingsmodeller for å håndtere degraderingsproblemer som bilde støyreduksjon, lavt lys forbedring, tåkefjerning, støyreduksjon og deraining.

Ytelsen til 5D-modellene demonstreres i følgende tabell, og sammenlignes med state of the art bilde restaurerings- og All-In-One-modeller.

Som det kan observeres, kan InstructIR-rammen med en enkel bilde modell og bare 16 millioner parametre håndtere fem forskjellige bilde restaurering oppgaver suksessfullt takket være instruksjonsbasert veiledning, og leverer konkurrerende resultater.

Hovedhøydepunktet til InstructIR-rammen er instruksjonsbasert bilde restaurering, og følgende figur demonstrerer de fantastiske evnene til InstructIR-modellen til å forstå en rekke instruksjoner for en gitt oppgave.

Slutt tanker

Bilde restaurering er en grunnleggende problem i datavisjon siden det har som mål å gjenopprette et høykvalitetsrent bilde fra et bilde som viser degraderinger. I lavnivå datavisjon er degraderinger en term som brukes for å representere ubehagelige effekter som observeres i et bilde, som bevegelsesuskarpa, tåke, støy, lav dynamisk rekkevidde og mer. I denne artikkelen har vi talt om InstructIR, verdens første bilde restaureringsramme som har som mål å guide bilde restaureringsmodellen ved å bruke menneskeskrevne instruksjoner.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.