AI-mallit ja alustat
InstructIR: Korkealaatuinen kuvanpalautus Ihmisen Ohjeiden Mukaan
Kuva voi kertoa paljon, mutta se voi myös olla vaurioitunut monin tavoin, kuten liiketurvallisuus, sumu, melu ja matala dynaaminen alue. Nämä ongelmat, jotka yleensä kutsutaan degradaatioiksi alhaisessa tason tietokoneen näkemisessä, voivat johtua vaikeista ympäristöolosuhteista, kuten lämpö tai sade, tai itse kameran rajoituksista. Kuvan palautus on ydin haaste tietokoneen näkemisessä, joka pyrkii palauttamaan korkealaatuisen, puhdistetun kuvan vaurioituneesta kuvasta. Kuvan palautus on monimutkainen, koska siinä voi olla useita ratkaisuja yhden kuvan palauttamiseen. Jotkut lähestymistavat kohdistuvat tiettyihin degradaatioihin, kuten melun vähentämiseen tai sumun poistamiseen.
Vaikka nämä menetelmät voivat antaa hyviä tuloksia tiettyihin ongelmiin, ne usein kamppailevat yleistettäessä erilaisiin degradaatioihin. Monet kehykset käyttävät yleistä neuroverkkoa laajalle valikoimalle kuvan palautustehtäviä, mutta nämä verkkomallit koulutetaan erikseen. Erilaisten degradaatioiden eri mallien tarve tekee tästä lähestymistavasta laskennallisesti kalliin ja aikaa vievän, mikä johtaa kaiken kattavaan palautusmalliin viimeaikaisissa kehityksissä. Nämä mallit käyttävät yhtä syvää sokeaa kuvan palautusmallia useiden tasojen ja tyypien kuvan vaurioitumisen käsittelyyn, usein käyttäen degradaatiospesifisiä ohjeita tai ohjausvektoreita suorituskyvyn parantamiseksi. Vaikka kaiken kattavat mallit näyttävät lupaavia tuloksia, ne kohtaavat edelleen haasteita käänteisissä ongelmissa.
InstructIR edustaa uraauurtavaa lähestymistapaa alalla, ollen ensimmäinen kuvan palautus kehykset, joka on suunniteltu ohjaamaan palautusmallia ihmisten kirjoittamien ohjeiden avulla. Se voi prosessoida luonnollisen kielen ohjeita palauttaakseen korkealaatuisia kuvia vaurioituneista, ottaen huomioon erilaiset degradaatiotyypit. InstructIR asettaa uuden suorituskyvyn standardin laajalle valikoimalle kuvan palautustehtäville, mukaan lukien sadekuivatus, melun vähentäminen, sumun poistaminen, tarkennus ja matalan valon parantaminen.
Tämä artikkeli pyrkii kattamaan InstructIR-kehykset syvällisesti, ja tutkimme mekanismia, menetelmää, arkkitehtuuria ja vertaamme sitä valmiiden kuvan ja videon luomiskehyksiin. Aloita siis.
InstructIR: Korkealaatuinen kuvanpalautus
Kuvan palautus on perusongelma tietokoneen näkemisessä, koska se pyrkii palauttamaan korkealaatuisen, puhdistetun kuvan vaurioituneesta kuvasta. Alhaisessa tason tietokoneen näkemisessä degradaatiot ovat termi, jota käytetään kuvaamiseen epämiellyttäviä vaikutuksia kuvassa, kuten liiketurvallisuutta, sumua, melua, matalaa dynaamista aluetta ja muita. Kuvan palautus on monimutkainen käänteinen haaste, koska siinä voi olla useita erilaisia ratkaisuja yhden kuvan palauttamiseen. Jotkut kehykset kohdistuvat tiettyihin degradaatioihin, kuten melun vähentämiseen tai sumun poistamiseen.
Viimeaikaiset syvät oppimismenetelmät ovat osoittaneet vahvempaa ja johdonmukaisempaa suorituskykyä verrattuna perinteisiin kuvan palautusmenetelmiin. Nämä syvät oppimismallit ehdottavat neuroverkkojen käyttämistä muunnoksien ja konvoluutio-neuroverkkojen perusteella. Nämä mallit voidaan kouluttaa erikseen erilaisiin kuvan palautustehtäviin, ja ne kykenevät myös havaitsemaan paikalliset ja globaalit ominaisuusvuorovaikutukset ja parantamaan niitä, mikä johtaa tyydyttävään ja johdonmukaiseen suorituskykyyn. Vaikka jotkut näistä menetelmistä voivat toimia riittävästi tiettyihin degradaatioihin, ne eivät yleensä yleisty erilaisiin degradaatioihin. Lisäksi, vaikka monet olemassa olevat kehykset käyttävät samaa neuroverkkoa moniin kuvan palautustehtäviin, jokainen neuroverkkomalli koulutetaan erikseen. On siis selvää, että eri degradaatioiden eri mallien käyttäminen on käytännössä mahdotonta ja aikaa vievää, mikä johtaa kaiken kattavaan palautusmalliin viimeaikaisissa kehityksissä.
Kaiken kattavat tai monen degradaation tai monitehtävän kuvan palautusmallit ovat suosittuja tietokoneen näkemisen alalla, koska ne kykenevät palauttamaan useita tasoja ja tyyppejä kuvan vaurioitumista ilman tarvetta kouluttaa malleja erikseen kullekin degradaatiolle. Kaiken kattavat kuvan palautusmallit käyttävät yhtä syvää sokeaa kuvan palautusmallia useiden tasojen ja tyypien kuvan vaurioitumisen käsittelyyn. Eri kaiken kattavat mallit toteuttavat erilaisia lähestymistapoja ohjata sokeaa mallia palauttamaan vaurioituneen kuvan, esimerkiksi apumallin degradaation luokitteluun tai moniulotteisia ohjausvektoreita tai ohjeita avustamaan mallin palauttamaan erilaisia degradaatioita kuvassa.
Tästä lähtien tullaan tekstipohjaiseen kuvan manipulaatioon, koska se on toteutettu useissa kehyksissä viime vuosina teksti-kuvaksi luomis- ja tekstipohjaisiin kuvan muokkaustehtäviin. Nämä mallit käyttävät usein teksti-ohjeita kuvailemaan toimintoja tai kuvia yhdessä diffuusiopohjaisilla malleilla luodakseen vastaavat kuvat. InstructIR-kehyksen pääinspiraatio on InstructPix2Pix-kehykset, joka mahdollistaa mallin muokkaamisen käyttäjän ohjeiden mukaan, jotka kertovat mallille, mitä toimintoa suorittaa, eikä teksti-merkintöjä, kuvauksia tai kuvatekstejä. Tämän seurauksena käyttäjät voivat käyttää luonnollista kirjoitettua tekstiä ohjeistamaan mallia ilman tarvetta antaa esimerkkikuvia tai kuvauksia.
Rakentamalla näistä perusteista, InstructIR-kehykset ovat ensimmäinen tietokoneen näkemisen malli, joka käyttää ihmisten kirjoittamia ohjeita kuvan palauttamiseen ja ratkaisemiseen käänteisiin ongelmiin. Luonnollisten kielen ohjeiden avulla InstructIR-malli voi palauttaa korkealaatuisia kuvia vaurioituneista vastineistaan ja ottaa huomioon useita degradaatiotyyppejä. InstructIR-kehykset kykenevät antamaan valmiiden kuvan palautustehtävien laajan valikoiman, mukaan lukien sadekuivatus, melun vähentäminen, sumun poistaminen, tarkennus ja matalan valon parantaminen. Toisin kuin olemassa olevat työt, jotka saavuttavat kuvan palautuksen käyttäen opittuja ohjausvektoreita tai ohjeiden upotusta, InstructIR-kehykset käyttävät raakaa käyttäjän antamaa tekstiä. InstructIR-kehykset kykenevät yleistämään kuvan palauttamiseen käyttäen ihmisten kirjoittamia ohjeita, ja yksittäinen kaiken kattava malli, jota InstructIR toteuttaa, kattaa enemmän palautustehtäviä kuin aiemmat mallit. Seuraava kuva osoittaa InstructIR-kehyksen monipuoliset palautusnäytteet.

InstructIR: Menetelmä ja Arkkitehtuuri
InstructIR-kehyksen ydin koostuu tekstienkooderista ja kuvamallista. Malli käyttää NAFNet-kehykset, tehokasta kuvan palautusmallia, joka noudattaa U-Net-arkkitehtuuria kuvamallina. Lisäksi malli toteuttaa tehtävän reititysmenetelmiä oppiakseen useita tehtäviä yhdessä mallissa onnistuneesti. Seuraava kuva havainnollistaa koulutus- ja arviointilähestymistapaa InstructIR-kehykseen.

Inspiroiden InstructPix2Pix-mallista, InstructIR-kehykset omaksuvat ihmisten kirjoittamat ohjeet ohjausmekanismina, koska käyttäjän ei tarvitse antaa lisätietoja. Nämä ohjeet tarjoavat ilmaisevan ja selkeän tavan vuorovaikuttaa, jotta käyttäjät voivat osoittaa tarkan sijainnin ja degradaation tyypin kuvassa. Lisäksi käyttäjän ohjeiden käyttäminen degradaatiospesifisten ohjeiden sijaan parantaa mallin käytettävyyttä ja soveltamista, koska sitä voidaan käyttää myös käyttäjien, jotka eivät ole asiantuntijoita. Voidakseen varustaa InstructIR-kehykset kyvyn ymmärtää monia ohjeita, malli käyttää GPT-4:ää, suurta kielen mallia luomaan monia pyynnöitä, ja epäselvät ja monitulkintaiset ohjeet poistetaan suodattimen jälkeen.
Tekstienkooderi
Tekstienkooderi on kielen mallien avainkomponentti, joka kartoittaa käyttäjän ohjeet tekstiupotukseen tai kiinteän kokoisen vektoriesitykseen. Perinteisesti tekstienkooderi CLIP-mallissa on tärkeä osa tekstipohjaisessa kuvan luomis- ja tekstipohjaisissa kuvan manipulaatiomalleissa ohjeiden koodaamiseen, koska CLIP-kehykset ovat visuaalisten ohjeiden parissa. Useimmiten kuitenkin käyttäjien ohjeet degradaatioille sisältävät vähän tai ei ollenkaan visuaalista sisältöä, joten suuret CLIP-kooderit ovat hyödyttömiä näissä tehtävissä, koska se haittaa tehokkuutta merkittävästi. Ratkaisemaan tämän ongelman, InstructIR-kehykset valitsevat tekstipohjaisen lauseen kooderin, joka on koulutettu koodaamaan lauseita merkitykselliseen upotusavaruuteen. Lauseenkooderit on koulutettu miljoonilla esimerkeillä, ja ne ovat kompakteja ja tehokkaita verrattuna perinteisiin CLIP-pohjaisiin tekstikoodereihin, ja ne kykenevät koodaamaan monien käyttäjien ohjeiden semantiikkaa.
Tekstiohjaus
InstructIR-kehyksen tärkeä osa on koodatun ohjeen toteutus kuvamallin ohjausmekanismina. Rakentamalla tästä, ja inspiroiden tehtävän reitityksestä monien tehtävien oppimisessa, InstructIR-kehykset ehdottavat Ohjeiden Rakennuslohkoa (ICB) mahdollistaakseen tehtävän mukaisia muodonmuutoksia mallissa. Perinteinen tehtävän reititys soveltaa tehtävän mukaisia binäärimaskeja kanavien ominaisuuksiin. InstructIR-kehykset eivät kuitenkaan tiedä degradaatiota, joten tämä tekniikka ei toteuteta suoraan. Lisäksi kuvan ominaisuuksille ja koodatuille ohjeille InstructIR-kehykset soveltavat tehtävän reititystä ja tuottavat maskin lineaarisella kerroksella, joka on aktivoitu sigmoid-funktiolla tuottamaan joukon painoja riippuen tekstiupotuksesta, ja saadaan siten c-uloitteinen binäärimaski kullekin kanavalle. Malli parantaa edelleen ehdollistetut ominaisuudet NAFBlockilla, ja käyttää NAFBlockia ja Ohjeiden Ehdollistamislohkoa ehdollistamaan ominaisuudet sekä koodaus- että dekoodauslohkossa.

Vaikka InstructIR-kehykset eivät ehdollista neuroverkon suodattimia eksplisiittisesti, maski mahdollistaa mallille valita kanavat, jotka ovat merkityksellisimpiä kuvan ohjeiden ja tietojen perusteella.
InstructIR: Toteutus ja Tulokset
InstructIR-malli on päästä päähän koulutettavissa, ja kuvamalli ei vaadi esikoulutusta. Vain tekstiupotusprojektiot ja luokittelupää on koulutettava. Tekstienkooderi on alustettu BGE-kooderilla, joka on koulutettu laajalla määrällä valvottua ja valvomatonta dataa yleispätevän lauseen koodaamiseen. InstructIR-kehykset käyttävät NAFNet-mallia kuvamallina, ja NAFNetin arkkitehtuuri koostuu 4-tason koodaus-dekoodauslohkosta, jossa on erilainen määrä lohkoja kussakin tasossa. Malli lisää myös 4 keskivaiheen lohkoa koodaus- ja dekoodauslohkon välille parantamaan ominaisuuksia. Lisäksi, sen sijaan, että dekoodauslohko toteuttaa liittämisen, se toteuttaa lisäämisen, ja InstructIR-malli toteuttaa vain Ohjeiden Ehdollistamislohkon tehtävän reititykseen sekä koodaus- ja dekoodauslohkossa. InstructIR-malli on optimoitu menetetyssä kuvassa ja palautetussa kuvassa, ja cross-entropia-häviö käytetään tekstienkooderin tarkoituksenmukaisen luokittelupään. InstructIR-malli käyttää AdamW-optimointia, jossa on 32:n kokoinen erä ja 5e-4:n oppimissuhde, ja se toteuttaa kosinin aaltoilevan oppimissuhteen pienenemisen. Koska kuvamalli InstructIR-kehyksessä koostuu vain 16 miljoonasta parametrasta, ja on vain 100 000 opittua tekstiupotusparametria, InstructIR-kehykset voidaan helposti kouluttaa standardi GPU:illa, mikä vähentää laskennallisia kustannuksia ja lisää soveltamista.
Monien Degradaatioiden Tulokset
Monien degradaatioiden ja monitehtävien palauttamiseen InstructIR-kehykset määrittelevät kaksi alkutilannetta:
- 3D kolmen degradaation malleille, jotka käsittelevät degradaatio-ongelmia, kuten sumun poistamista, melun vähentämistä ja sadekuivatusta.
- 5D viiden degradaation malleille, jotka käsittelevät degradaatio-ongelmia, kuten kuvan melun vähentämistä, matalan valon parantamista, sumun poistamista, melun vähentämistä ja sadekuivatusta.
5D-mallien suorituskyky on esitetty seuraavassa taulukossa, ja se verrataan valmiiden kuvan palautus- ja kaiken kattavien malleihin.

Kuten voidaan havaita, InstructIR-kehykset yksinkertaisella kuvamallilla ja vain 16 miljoonalla parametrilla voivat käsitellä viittä eri kuvan palautustehtävää menestyksekkäästi ohjeiden perusteella, ja ne antavat kilpailukykyisiä tuloksia. Seuraava taulukko osoittaa kehyksen suorituskyvyn 3D-malleissa, ja tulokset ovat verrattavissa edellisiin tuloksiin.

InstructIR-kehyksen pääkorostus on ohjeiden perusteella tapahtuva kuvan palautus, ja seuraava kuva osoittaa InstructIR-mallin uskomattomat kyvyt ymmärtää laaja valikoima ohjeita annetulle tehtävälle. Lisäksi, vastakkaisen ohjeen kohdalla InstructIR-malli suorittaa identiteetin, jota ei ole pakotettu.

Lopputajat
Kuvan palautus on perusongelma tietokoneen näkemisessä, koska se pyrkii palauttamaan korkealaatuisen, puhdistetun kuvan vaurioituneesta kuvasta. Alhaisessa tason tietokoneen näkemisessä degradaatiot ovat termi, jota käytetään kuvaamiseen epämiellyttäviä vaikutuksia kuvassa, kuten liiketurvallisuutta, sumua, melua, matalaa dynaamista aluetta ja muita. Tässä artikkelissa olemme puhuneet InstructIR-kehyksestä, maailman ensimmäisestä kuvan palautuskehyksestä, joka pyrkii ohjaamaan kuvan palautusmallia ihmisten kirjoittamien ohjeiden avulla. Luonnollisten kielen ohjeiden avulla InstructIR-malli voi palauttaa korkealaatuisia kuvia vaurioituneista vastineistaan ja ottaa huomioon useita degradaatiotyyppejä. InstructIR-kehykset kykenevät antamaan valmiiden kuvan palautustehtävien laajan valikoiman, mukaan lukien sadekuivatus, melun vähentäminen, sumun poistaminen, tarkennus ja matalan valon parantaminen.












