Andersonin kulma

JPEG-artefaktien ratkaiseminen tietokoneen nÃĪÃķn aineistoissa

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa

Marylandin yliopiston ja Facebook AI:n uusi tutkimus on osoittanut, ettÃĪ syvÃĪoppimisjÃĪrjestelmille, jotka kÃĪyttÃĪvÃĪt aineistossaan voimakkaasti pakattuja JPEG-kuvia, on “merkittÃĪvÃĪ suorituskykyrajoitus” ja tarjoaa uusia menetelmiÃĪ nÃĪiden vaikutusten lieventÃĪmiseksi.

Tutkimusraportti, jonka otsikkona on JPEG-pakkausvirheiden analyysi ja lieventÃĪminen syvÃĪoppimisessa, vÃĪittÃĪÃĪ olevan “merkittÃĪvÃĪsti kattavampi” kuin aiemmat tutkimukset kuvatietokoneen aineistojen virheiden vaikutuksista. Tutkimus osoittaa, ettÃĪ â€œ[raskas] tai kohtalainen JPEG-pakkaus aiheuttaa merkittÃĪvÃĪn suorituskykyrajoituksen standardimittareilla”, ja ettÃĪ neurverkot eivÃĪt ehkÃĪ ole yhtÃĪ kestÃĪviÃĪ tÃĪllaisille hÃĪiriÃķille kuin aiempi tutkimus olettanut.

Koira kuvasta 2018 MobileNetV2 -aineistosta. Laadussa 10 (vasemmalla), luokittelu jÃĪrjestelmÃĪ epÃĪonnistuu tunnistamaan oikean rodun 'Pembroke Welsh Corgi', sen sijaan arvaten 'Norwich terrierin' (jÃĪrjestelmÃĪ tietÃĪÃĪ jo, ettÃĪ kyseessÃĪ on koira, mutta ei rotua); toisella vasemmalla, valmiin JPEG-artefaktikorjauksen kautta muokattu kuva epÃĪonnistuu jÃĪlleen tunnistamaan oikean rodun; toisella oikealla, kohdennettu artefaktikorjaus palauttaa oikean luokittelun; ja oikealla, alkuperÃĪinen kuva, joka on oikein luokiteltu. LÃĪhde: https://arxiv.org/pdf/2011.08932.pdf

Koira kuvasta 2018 MobileNetV2 -aineistosta. Laadussa 10 (vasemmalla), luokittelu jÃĪrjestelmÃĪ epÃĪonnistuu tunnistamaan oikean rodun ‘Pembroke Welsh Corgi’, sen sijaan arvaten ‘Norwich terrierin’ (jÃĪrjestelmÃĪ tietÃĪÃĪ jo, ettÃĪ kyseessÃĪ on koira, mutta ei rotua); toisella vasemmalla, valmiin JPEG-artefaktikorjauksen kautta muokattu kuva epÃĪonnistuu jÃĪlleen tunnistamaan oikean rodun; toisella oikealla, kohdennettu artefaktikorjaus palauttaa oikean luokittelun; ja oikealla, alkuperÃĪinen kuva, joka on oikein luokiteltu. LÃĪhde: https://arxiv.org/pdf/2011.08932.pdf LÃĪhde: https://arxiv.org/pdf/2011.08932.pdf

Pakkausartefaktit ‘datana’

ÄÃĪritetty JPEG-pakkaus on todennÃĪkÃķisesti luova nÃĪkyviÃĪ tai puolivisiÃĪ reunoja 8×8 -lohkojen ympÃĪrillÃĪ, joista JPEG koostuu pikseliruudukossa. Kun nÃĪmÃĪ lohko- tai ‘sÃĪrÃķ’-artefaktit ilmestyvÃĪt, ne ovat todennÃĪkÃķisesti vÃĪÃĪrin tulkitseva machine learning -jÃĪrjestelmiÃĪ maailman todellisiksi osiksi, ellei kompensaatiota tehdÃĪ tÃĪstÃĪ.

YlÃĪpuolella, tietokoneen nÃĪkÃķllinen machine learning -jÃĪrjestelmÃĪ poistaa 'puhtaan' gradientin kuvasta. Alapuolella, 'lohko'-artefaktit matalalaatuisessa kuvassa peittÃĪvÃĪt kohteen piirteitÃĪ ja voivat lopulta 'tarttua' piirteisiin, jotka on johdettu kuvasta, erityisesti tapauksissa, joissa korkealaatuiset ja matalalaatuiset kuvat esiintyvÃĪt aineistossa, kuten verkkokokoelmissa, joille on sovellettu vain yleistÃĪ tietojen puhdistusta. LÃĪhde: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

YlÃĪpuolella, tietokoneen nÃĪkÃķllinen machine learning -jÃĪrjestelmÃĪ poistaa ‘puhtaan’ gradientin kuvasta. Alapuolella, ‘lohko’-artefaktit matalalaatuisessa kuvassa peittÃĪvÃĪt kohteen piirteitÃĪ ja voivat lopulta ‘tarttua’ piirteisiin, jotka on johdettu kuvasta, erityisesti tapauksissa, joissa korkealaatuiset ja matalalaatuiset kuvat esiintyvÃĪt aineistossa, kuten verkkokokoelmissa, joille on sovellettu vain yleistÃĪ tietojen puhdistusta. LÃĪhde: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

Kuten yllÃĪ olevasta kuvasta nÃĪkyy, tÃĪllaiset artefaktit voivat vaikuttaa kuvaluokitteluun, jolla on vaikutuksia myÃķs tekstintunnistusalgoritmeihin, jotka voivat epÃĪonnistua oikean merkin tunnistamisessa artefaktien vaikuttamana.

KuvasynteesikoulutusjÃĪrjestelmissÃĪ (kuten deepfake-ohjelmisto tai GAN-pohjaisissa kuvien luomisjÃĪrjestelmissÃĪ) “vastuuton” matalalaatuinen ja voimakkaasti pakattu kuva aineistossa voi joko laskea medianlaatua tai olla peitetty ja korvattu suuremmalla mÃĪÃĪrÃĪllÃĪ korkealaatuisia piirteitÃĪ, jotka on poimittu paremmista kuvista. Kummassakin tapauksessa parempaa dataa on toivottavaa – tai ainakin yhdenmukaisempaa dataa.

JPEG – YleensÃĪ â€˜riittÃĪvÃĪ’

JPEG-pakkaus on menetetty pakkaus, jota voidaan soveltaa eri kuvaformaatteihin, vaikka se sovelletaan pÃĪÃĪasiassa JFIF-kuvaformaattiin. Vaikka JPEG (.jpg) -formaatti on nimetty pakkausmenetelmÃĪnsÃĪ mukaan eikÃĪ JFIF-kuvaformaatin mukaan, on koko jÃĪrjestelmÃĪ perustunut JPEG-pakkaukseen.

Koko machine learning -arkkitehtuuri on kehittynyt viime vuosina, ja se sisÃĪltÃĪÃĪ JPEG-tyyppisten artefaktien lieventÃĪmistÃĪ osana tekoÃĪlyohjattuja skaalauksen/palauttamisen ohjelmia, ja tekoÃĪlypohjainen pakkausartefaktien poisto on nykyÃĪÃĪn osa useita kaupallisia tuotteita, kuten Topaz-kuvan/video- ohjelmistoa ja neuraalisten ominaisuuksien viimeaikaisissa Adobe Photoshop -versioissa.

koska JPEG-skeema, jota nykyÃĪÃĪn yleisesti kÃĪytetÃĪÃĪn, on ollut kÃĪytÃķssÃĪ vuodesta 1986, ja se oli kÃĪytÃĪnnÃķssÃĪ lukittu 1990-luvun alussa, ei ole mahdollista lisÃĪtÃĪ metatietoa kuvaan, joka ilmoittaisi, minkÃĪlaatuista JPEG-kuvaa on tallennettu (1-100) – ainakaan ilman muutoksia yli 30 vuoden ajan kehittyneisiin kuluttaja-, ammatti- ja akateemisiin ohjelmistoihin, joissa tÃĪllaista metatietoa ei ollut odotettu.

Sen seurauksena on tavallista mukauttaa machine learning -koulutusohjelmia arvioidun tai tunnetun JPEG-kuvaformaatin laatuun, kuten tutkijat ovat tehneÃĪt uudessa tutkimuksessa (ks. alla). Metatiedon “laatu”-kohdan puuttuessa on nykyÃĪÃĪn vÃĪlttÃĪmÃĪtÃķntÃĪ joko tietÃĪÃĪ, miten kuva on pakattu (ts. pakattu hÃĪviÃķttÃķmÃĪstÃĪ lÃĪhdeaineistosta), tai arvioida laatua havaintojen kautta tai manuaalisella luokittelulla.

Taloudellinen kompromissi

JPEG ei ole ainoa menetetty pakkausmenetelmÃĪ, joka voi vaikuttaa machine learning -aineistojen laatuun; PDF-tiedostojen pakkausasetukset voivat myÃķs hylÃĪtÃĪ tietoa ja asettaa erittÃĪin matalat laatusetelit tallennustilaa varten.

TÃĪmÃĪ voidaan havaita nÃĪyttelemÃĪllÃĪ eri PDF-tiedostoja archive.orgissa, joista jotkut on pakattu niin voimakkaasti, ettÃĪ ne ovat merkittÃĪvÃĪ haaste kuvan- tai tekstintunnistusjÃĪrjestelmille. Monissa tapauksissa, kuten tekijÃĪnoikeuksien alaisissa kirjoissa, tÃĪllainen voimakas pakkaus on sovellettu halvan DRM:n (Digital Rights Management) muodossa, samalla tavoin kuin tekijÃĪnoikeuksien haltijat voivat valita alentaa YouTube-videoiden resoluutiota, joilla heillÃĪ on tekijÃĪnoikeudet, jÃĪttÃĪen “lohkoiset” videot mainosnÃĪyttÃķiksi, jotka rohkaisevat “tÃĪysresoluutio”-ostoksia, sen sijaan, ettÃĪ ne poistettaisiin.

Monissa muissa tapauksissa resoluutio tai kuvanlaatu on alhainen yksinkertaisesti, koska data on hyvin vanhaa ja perÃĪisin ajalta, jolloin paikallinen ja verkkotallennus oli kalliimpaa, ja jolloin rajoitetut verkkonopeudet suosivat erittÃĪin optimoituja ja siirrettÃĪviÃĪ kuvia korkealaatuisen toistoon nÃĪhden.

On vÃĪitetty, ettÃĪ JPEG, vaikka se ei ole paras ratkaisu nyt, on “jumittunut” poistumattomaksi perusrakenteeksi, joka on kÃĪytÃĪnnÃķssÃĪ sekoittunut internetin perustaan.

PerintÃķtaakka

Vaikka myÃķhemmÃĪt innovaatiot, kuten JPEG 2000, PNG ja (viimeisimmÃĪksi).webp-formaatti, tarjoavat paremman laatun, vanhojen, hyvin suosittujen machine learning -aineistojen uudelleenmallinnus aiheuttaisi vÃĪittÃĪmÃĪn mukaan “resetoi” jatkuvuuden ja historian vuosittaisissa tietokoneen nÃĪÃķn haasteissa akateemisessa yhteisÃķssÃĪ â€“ este, joka koskisi myÃķs PNG-aineistojen uudelleentallentamista korkeampaa laatua varten. TÃĪmÃĪ voisi katsotaan jonkinlaiseksi tekniseksi velaksi.

Vaikka vanhat palvelinohjattavat kuvankÃĪsittelykirjastot, kuten ImageMagick, tukevat parempia formaatteja, mukaan lukien.webp, kuvanmuokkausvaatimukset usein esiintyvÃĪt perintejÃĪrjestelmissÃĪ, jotka eivÃĪt ole mukautettu mihinkÃĪÃĪn muuhun kuin JPG- tai PNG-formaattiin (joka tarjoaa hÃĪviÃķttÃķmÃĪn pakkaamisen, mutta latenssin ja tallennustilakustannuksien kustannuksella). Jopa WordPress, joka on CMS, joka pyÃķrittÃĪÃĪ lÃĪhes 40% kaikista verkkosivustoista, lisÃĪsi.webp-tuen vain kolme kuukautta sitten.

PNG oli myÃķhÃĪinen (vÃĪittÃĪmÃĪn mukaan liian myÃķhÃĪinen) osallistuja kuviformaattiin vuonna 1990-luvun lopulla vastauksena Unisysin ja CompuServen vuonna 1995 tekemÃĪÃĪn ilmoitukseen, jonka mukaan rojaltit maksetaan LZW-pakkausformaatin kÃĪytÃķstÃĪ GIF-tiedostoissa, jotka olivat yleisiÃĪ logoissa ja tasavÃĪrisissÃĪ elementeissÃĪ, vaikka formaatin uudelleensynty vuonna 2010 keskittyi sen kykyyn tarjota matalan kaistan ja nopean animaation.

Vaikka JPEG-pakkaus on puutteellinen, se on nopea, tila-tehokas ja syvÃĪltÃĪ juurtunut jÃĪrjestelmiin – eikÃĪ sitÃĪ todennÃĪkÃķisesti poisteta kokonaan machine learning -nÃĪkymistÃĪ lÃĪhitulevaisuudessa.

Parasta AI/JPEG-aselepoa

Machine learning -yhteisÃķ on jo sopeutunut JPEG-pakkausvirheiden ominaisuuksiin: vuonna 2011 Euroopan radiologinen seura (ESR) julkaisi tutkimuksen “Irreversiblen kuvapakkaamisen kÃĪytettÃĪvyydestÃĪ radiologisessa kuvantamisessa”, jossa annettiin ohjeita “hyvÃĪksyttÃĪvÃĪlle” menetykselle; kun vanha MNIST -tekstintunnistusaineisto (jonka kuvadata oli alun perin toimitettu uudessa binÃĪÃĪrimuodossa) siirrettiin “normaaliin” kuvaformaattiin, JPEG valittiin, eikÃĪ PNG; ja aiempi (2020) yhteistyÃķ uuden tutkimuksen tekijÃķiden kanssa tarjosi uuden arkkitehtuurin machine learning -jÃĪrjestelmien kalibroimiseksi JPEG-kuvanlaadun puutteista ilman, ettÃĪ malleja olisi koulutettava kussakin JPEG-laatusÃĪÃĪdessÃĪ â€“ ominaisuus, jota kÃĪytetÃĪÃĪn uudessa tutkimuksessa.

Todellakin tutkimus JPEG-laadun hyÃķdyllisyydestÃĪ on suhteellisen vireÃĪ ala machine learning -tutkimuksessa. Yksi (ei liittyvÃĪ) vuoden 2016 projekti Marylandin yliopiston automaatioalan tutkimuskeskuksesta keskittyy DCT-alueeseen (jossa JPEG-artefaktit esiintyvÃĪt matalassa laadussa), jossa syvÃĪt piirteet voidaan poimia; toinen projekti vuodelta 2019 keskittyy JPEG-datan lukemiseen bittitasolla ilman aikaa vievÃĪÃĪ pakkaamista (ts. avaa ne jossakin automaattisessa tyÃķvirrassa); ja tutkimus Ranskasta vuodelta 2019 hyÃķdyntÃĪÃĪ aktiivisesti JPEG-pakkausta esineen tunnistamisessa.

Testaus ja johtopÃĪÃĪtÃķkset

Palataksesi uusimpaan tutkimukseen Marylandin yliopistosta ja Facebookista, tutkijat pyrkivÃĪt testaamaan JPEG-ymmÃĪrrettÃĪvyyttÃĪ ja hyÃķdyllisyyttÃĪ kuvissa, jotka on pakattu 10-90 (jonka alapuolella kuva on mahdoton hÃĪiriÃķ, ja jonka ylÃĪpuolella se on vastaava kuin hÃĪviÃķtÃķn pakkaus). KÃĪytetyt kuvat pakattiin ennen jokaista arvoa kohdalla olevassa laatusarjassa, mikÃĪ edellytti vÃĪhintÃĪÃĪn kahdeksan koulutussessiota.

Mallit koulutettiin stokastisella gradientilla neljÃĪllÃĪ menetelmÃĪllÃĪ: perus, jossa ei lisÃĪtty mitÃĪÃĪn lisÃĪkorjausta; valvottu hienosÃĪÃĪtÃķ, jossa koulutusaineistolla on etuoikeus esikoulutetuista painoista ja merkityistÃĪ tiedoista (vaikka tutkijat myÃķntÃĪvÃĪt, ettÃĪ tÃĪmÃĪ on vaikea toistaa kuluttajatasolla); artefaktikorjaus, jossa parannusta tehdÃĪÃĪn pakattuihin kuviin ennen koulutusta; ja tehtÃĪvÃĪn kohdennettu artefaktikorjaus, jossa artefaktikorjausverkko on hienosÃĪÃĪdetty palautettujen virheiden perusteella.

Koulutus tapahtui laajalla valikoimalla soveltuvia aineistoja, mukaan lukien useita ResNet-, FastRCNN-, MobileNetV2-, MaskRCNN– ja Kerasin InceptionV3-versioita.

Esimerkki hÃĪviÃķistÃĪ tehtÃĪvÃĪn kohdennetun artefaktikorjauksen jÃĪlkeen on visualisoitu alla (alemmat arvot ovat parempia).

On mahdotonta perehtyÃĪ syvemmÃĪlle tutkimuksen tuloksiin, koska tutkijoiden lÃķydÃķkset on jaettu tavoitteeseen arvioida JPEG-artefakteja ja kehittÃĪÃĪ uusia menetelmiÃĪ niiden lieventÃĪmiseksi; koulutus toistettiin laatu kohtaan useiden aineistojen yli; ja tehtÃĪviin kuului useita tavoitteita, kuten esineen havaitseminen, segmentointi ja luokittelu. Tutkimus asettaa itsensÃĪ laajaksi viiteksi, joka kÃĪsittelee useita ongelmia.

Kuitenkin tutkimusraportti johtaa laajasti siihen, ettÃĪ â€œJPEG-pakkaus aiheuttaa jyrkkÃĪn rangaistuksen yleensÃĪ raskaiden ja kohtalaiden pakkausasetusten osalta”. Se myÃķs vÃĪittÃĪÃĪ, ettÃĪ sen uudet tunnisteettomat lieventÃĪmisstrategiat saavuttavat parempia tuloksia muihin samankaltaisiin lÃĪhestymistapoihin nÃĪhden; ettÃĪ monimutkaisissa tehtÃĪvissÃĪ tutkijoiden valvottu menetelmÃĪ myÃķs ylittÃĪÃĪ vertaisensa, vaikka sillÃĪ ei ole pÃĪÃĪsyÃĪ perusmerkkien tunnisteisiin; ja ettÃĪ nÃĪmÃĪ uudet metodit sallivat mallien uudelleenkÃĪytÃķn, koska saadut painot ovat siirrettÃĪvissÃĪ tehtÃĪvien vÃĪlillÃĪ.

Luokittelu tehtÃĪvissÃĪ tutkimusraportti toteaa nimenomaisesti, ettÃĪ â€œJPEG heikentÃĪÃĪ gradientin laatua ja aiheuttaa sijaintivirheitÃĪ”.

Tutkijat toivovat, ettÃĪ he voivat laajentaa tulevia tutkimuksia kÃĪsittÃĪmÃĪÃĪn muita pakkausmenetelmiÃĪ, kuten melko laiminlyÃķtyÃĪ JPEG 2000:aa, sekÃĪ WebP-, HEIF– ja BPG-formaatteja. He ehdottavat myÃķs, ettÃĪ heidÃĪn metodologiaansa voidaan soveltaa vastaavaan video-pakkausalgoritmien tutkimukseen.

Koska tehtÃĪvÃĪn kohdennettu artefaktikorjausmenetelmÃĪ on osoittautunut niin menestyksekkÃĪÃĪksi tutkimuksessa, tutkijat ilmoittavat aikovansa julkaista tutkimuksessa koulutetut painot, odottaen, ettÃĪ â€œ[monet] sovellukset hyÃķtyvÃĪt kÃĪyttÃĪmÃĪllÃĪ TTAC-painoja ilman muutoksia.”

 

Huom. Artikkelin lÃĪhdekuva on perÃĪisin thispersondoesnotexist.comista

Kirjailija tekoÃĪlystÃĪ, alan erikoismies ihmisen kuvien synteesistÃĪ. Entinen tutkimussisÃĪllÃķn johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttÃĪ: [email protected]