Andersonin kulma

Sosiaalisen median yli pakkausten palauttaminen koneoppimisella

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Main image source: DALL-E 2

Uusi tutkimus Kiinasta tarjoaa tehokkaan ja uudenlaisen menetelmän yksityishenkilöiden lataamien videoiden yksityiskohtien ja resoluution palauttamiseksi. Nämä videot on pakattu automaattisesti alustoilla, kuten WeChat ja YouTube, jotta voidaan säästää kaistanleveyttä ja tallennustilaa.

Uuden menetelmän vertailu aiempiin lähestymistapoihin sen kyvyn suhteen palauttaa yksityiskohtia, jotka menetettiin sosiaalisen median alustojen automaattisen optimoinnin aikana. Lähde: https://arxiv.org/pdf/2208.08597.pdf

Uuden menetelmän vertailu aiempiin lähestymistapoihin sen kyvyn suhteen palauttaa yksityiskohtia, jotka menetettiin sosiaalisen median alustojen automaattisen optimoinnin aikana. Lähde: https://arxiv.org/pdf/2208.08597.pdf

Toisin kuin aiemmat menetelmät, jotka voivat skaalata ja näyttecyclata videoita yleisen koulutusaineiston perusteella, uusi lähestymistapa johdattaa heikentymisominaisuuskartan (DFM) kullekin pakatun videon kehykselle – käytännössä yleiskatsaus kehyskohtaa, jotka ovat vahingoittuneet eniten pakkaamisen seurauksena.

Uuden tutkimuksen ablaatiotutkimuksista: toisesta oikeasta, puhtaan DFM:n viitearvo; kolmas oikeasta, vahinkoarvio ilman DFM:n käyttöä. Vasemmalla, paljon tarkempi vahinkokartta DFM:n avulla.

Uuden tutkimuksen ablaatiotutkimuksista: toisesta oikeasta, puhtaan DFM:n viitearvo; kolmas oikeasta, vahinkoarvio ilman DFM:n käyttöä. Vasemmalla, paljon tarkempi vahinkokartta DFM:n avulla.

Palautusprosessi, joka hyödyntää konvoluutioneuraaliverkkoja (CNN) ja muita teknologioita, ohjataan ja kohdistetaan DFM:n tiedon perusteella, mikä mahdollistaa uuden menetelmän ylittää aiempien lähestymistapojen suorituskyky ja tarkkuus.

Tutkijat hankkivat korkealaatuisen videon lataamalla sen neljälle suosituimmalle jakelu-alustalle, lataamalla pakatun tuloksen ja kehittämällä tietokoneen näköpipelin, joka voi abstraktisesti oppia pakkausartefakteja ja yksityiskohtien menetystä, jotta se voidaan soveltaa useille alustoille ja palauttaa videot lähes alkuperäiseen laatuun perustuen täysin erilaisiin tietoihin.

Esimerkkejä tutkijoiden uudesta UVSSM-aineistosta.

Esimerkkejä tutkijoiden uudesta UVSSM-aineistosta.

Tutkimuksessa käytetty aineisto on koottu korkealaatuiseksi / matalalaatuiseksi tietokannaksi nimeltä Sosiaalisen median käyttäjien jakamat videot (UVSSM), ja se on tehty ladattavaksi (salasana: rsqw) Baidu-palvelussa, jotta se voisi hyödyttää myöhempää tutkimusta, joka pyrkii kehittämään uusia menetelmiä pakkausvideojen palauttamiseen.

Vertailu kahden vastaavan HQ/LQ-otoksen välillä ladattavasta UVSSM-aineistosta (katso yllä olevat linkit lähdetiedostoihin). Koska tämä esimerkki voi olla altis useille pakkauskierroksille (kuva-sovellus, CMS, CDN jne.), viitataan alkuperäisiin lähdetietoihin tarkemman vertailun vuoksi.

Vertailu kahden vastaavan HQ/LQ-otoksen välillä ladattavasta UVSSM-aineistosta (katso yllä olevat linkit lähdetiedostoihin). Koska tämä esimerkki voi olla altis useille pakkauskierroksille (kuva-sovellus, CMS, CDN jne.), viitataan alkuperäisiin lähdetietoihin tarkemman vertailun vuoksi.

Järjestelmän koodi, jota kutsutaan Video-restauraatio sopeutuvan heikentymisensäilyttämisen kautta (VOTES), on myös julkaistu GitHubissa, vaikka sen toteutus edellyttää useita riippuvuuksia.

Tutkimus on nimeltään Sosiaalisen median käyttäjien jakamien videoiden palauttaminen, ja se on tehty kolmen Shenzhenin yliopiston tutkijan ja yhden Hongkongin polyteknillisen yliopiston sähkö- ja tietotekniikan osaston tutkijan toimesta.

Artefakteista Faktoihin

Videon laadun palauttaminen ilman yleisten, joskus liiallista yksityiskohtien “hallusinaatiota”, jonka ohjelmat kuten Gigapixel (ja useimmat muut avoimen lähdekoodin paketteja samanlaisella alueella) tarjoavat, voi olla vaikutuksia tietokoneen näkötekniikan tutkimussektoriin.

Tutkimus videoon perustuvista CV-teknologioista usein riippuu kuvamateriaalista, jota hankitaan alustoilta kuten YouTube ja Twitter, joilla käytettävät pakkausmenetelmät ja koodekit ovat tiukasti suojattuja, eivätkä ne voida helposti päätellä artefaktien perusteella tai muista visuaalisista osoittimista, ja ne voivat muuttua aika ajoin.

Useimmat hankkeet, jotka hyödyntävät verkosta löytyvää videomateriaalia, eivät tutki pakkausta, ja joutuvat tekemään sovitteluita alustojen tarjoaman pakatun videon laadun vuoksi, koska heillä ei ole pääsyä alkuperäisiin korkealaatuisiin versioihin, jotka käyttäjät lataavat.

Siksi kyky palauttaa uskollisesti korkeampaa laatua ja resoluutiota tällaisiin videoihin ilman sivullisia vaikutuksia tietokoneen näkötekniikan tietokannoista voisi auttaa välttämään usein tarvittavat kiertoreitit ja sovittelut, joita CV-hankkeiden on tehtävä pakkausvideo-lähteiden vuoksi.

Alustojen, kuten YouTuben, tapaan julkaista suuria muutoksia siinä, miten ne pakkaavat käyttäjien videoita (kuten VP9), kukaan ei paljasta koko prosessia tai tarkkoja koodekkeja ja asetuksia, joita käytetään pakkaamaan käyttäjien lataamia korkealaatuisia tiedostoja.

Saavuttaminen parannettua lähtölaatua käyttäjien lataamista tiedostoista on siten muodostunut jonkinlaiseksi druidiseksi taiteeksi viimeisen kymmenen vuoden aikana, jolloin erilaiset (pääosin vahvistamattomat) ‘kierrekäytännöt’ ovat tulleet ja menneet muodista.

Menetelmä

Aiemmat lähestymistavat syvän oppimisen perusteella videon palauttamiseen ovat sisältäneet yleisen piirteiden extraktion, joko yksittäisen kehyksen palauttamiseen tai monikehyksisen arkkitehtuurin, joka hyödyntää optista virtausta (ts. ottaa huomioon myös edelliset ja myöhemmät kehykset palautettaessa nykyistä kehykstä).

Nämä lähestymistavat ovat joutuneet kamppailemaan “mustan laatikon” vaikutuksen kanssa – tosiasian, ettei niitä voida tarkastella pakkausvaikutuksia ydinTeknologioissa, koska ei ole varmuutta siitä, mitkä ydinTeknologiat ovat tai miten ne on määritetty kullekin käyttäjän lataamalle videolle.

VOTES hakee sen sijaan olennaiset piirteet suoraan alkuperäisestä ja pakatusta videosta ja määrittää muodonmuutoksia, jotka yleistyvät useiden alustojen standardeihin.

Yksinkertaistettu konseptuaalinen arkkitehtuuri VOTES:lle.

Yksinkertaistettu konseptuaalinen arkkitehtuuri VOTES:lle.

VOTES käyttää erityisesti kehitettyä heikentymisen havaitsemismoduulia (DSM, katso yllä oleva kuva) poistamaan piirteitä konvoluutionlohkoissa. Useat kehykset siirretään sitten piirteiden extraktio- ja kohdistusmoduuliin (FEAM), ja ne siirretään sitten heikentymisen modulaatiomoduuliin (DMM). Lopulta, rekonstruktio-moduuli tuottaa palautetun videon.

Data ja Kokeet

Uudessa tutkimuksessa tutkijat ovat keskittyneet pyrkimykseensä palauttaa video, jota on ladattu ja uudelleen ladattu WeChat-alustalle, mutta he halusivat varmistaa, että tuloksena oleva algoritmi voidaan sovittaa muihin alustoille.

Tuli ilmi, että kun he olivat saaneet tehokkaan palautusmallin WeChat-videolle, sopeuttaminen Bilibiliin, Twitteriin ja YouTubeeen kesti vain 90 sekuntia yhdelle epochille kullekin mukautetulle mallille kullekin alustalle (koneella, jossa oli 4 NVIDIA Tesla P40 -gpu:ta, joissa oli yhteensä 96 Gt muistia).

Onnistuneen WeChat-mallin sopeuttaminen muihin videojakopalstoihin osoittautui melko helppoksi. Tässä nähdään VOTES saavuttamassa lähes välittömästi saman suorituskyvyn eri alustoilla, käyttäen tutkijoiden omaa UVSSM-aineistoa ja REDS-aineistoa (ks. alla).

Onnistuneen WeChat-mallin sopeuttaminen muihin videojakopalstoihin osoittautui melko helppoksi. Tässä nähdään VOTES saavuttamassa lähes välittömästi saman suorituskyvyn eri alustoilla, käyttäen tutkijoiden omaa UVSSM-aineistoa ja REDS-aineistoa (ks. alla).

Tutkijat keräsivät 264 videota, jotka kestivät 5-30 sekuntia, ja joilla oli 30 fps kehysnopeus, jotka oli peräisin joko suoraan matkapuhelimien kameroista tai internetistä. Videot olivat joko 1920 x 1080 tai 1280 x 270 resoluutiota.

Sisältö (ks. edellinen kuva) käsitti kaupunkinäkymiä, maisemia, ihmisiä, eläimiä ja muita aiheita, ja ne ovat käytettävissä julkisessa tietokannassa Creative Commons Attribution -lisenssin kautta, joka sallii uudelleenjulkaisun.

Tutkijat latoivat 214 videota WeChatiin viidellä eri matkapuhelinmerkillä ja saivat WeChatin oletusvideon resoluution 960×540 (ellei alkuperäinen video ole jo pienempi kuin nämä mitat), jotka ovat yksi “rankkasimmista” muunnoksista suosituilla alustoilla.

Ylävasemmalla, alkuperäinen HQ-kehys kolmella suurennoksella; yläoikealla, sama kehys alustan heikentämästä pakatusta videosta; alavasemmalla, laskettu heikentymä pakatusta kehyksestä; ja alaoikealla, tuloksena oleva

Ylävasemmalla, alkuperäinen HQ-kehys kolmella suurennoksella; yläoikealla, sama kehys alustan heikentämästä pakatusta videosta; alavasemmalla, laskettu heikentymä pakatusta kehyksestä; ja alaoikealla, tuloksena oleva “työalue” VOTES:lle, johon se voi kohdistaa huomionsa. Selvästi matalalaatuisen kuvan koko on puolet HQ-kuvan koosta, mutta se on muunnettu tässä vertailun selkeyden vuoksi.

Myöhemmissä vertailuissa muiden alustojen muunnosohjelmien kanssa tutkijat latoivat 50 videota, jotka eivät olleet mukana alkuperäisessä 214 videossa, Bilibiliin, YouTubeeen ja Twitteriin. Videoiden alkuperäinen resoluutio oli 1280×270, ja ladataan versiot olivat 640×360.

Tämä kasvattaa UVSSM-aineiston yhteensä 364 paria alkuperäisiä (HQ) ja jaettuja (LQ) videoita, joista 214 on WeChatiin ja 50 kullekin Bilibiliin, YouTubeeen ja Twitteriin.

Kokeissa 10 satunnaista videota valittiin testijoukoksi, neljä vahvistusjoukoksi ja 200 jäävätki perus koulutusjoukoksi. Kokeet suoritettiin viisi kertaa K-fold cross validation menetelmällä, ja tulokset keskiarvoitiin näiden instanssien yli.

Videon palauttamiskokeissa VOTES verrattiin Spatio-Temporal Deformable Fusioniin (STDF). Resoluution parantamisessa se testattiin Enhanced Deformable konvoluutioita (EDVR) vastaan, RSDN:ää, Video Super-resolution with Temporal Group Attention (VSR_TGA), ja BasicVSR:ää. Google:n yksivaiheinen menetelmä COMISR oli myös mukana, vaikka se ei sovi muiden aiempien töiden arkkitehtuurityyppiin.

Menetelmät testattiin sekä UVSS- että REDS -aineistoa vastaan, ja VOTES saavutti korkeimmat pisteet:

Tutkijat väittävät, että laadulliset tulokset osoittavat myös VOTES:n ylemmän tasoa aiempiin järjestelmiin nähden:

Videon kehykset REDS:stä, jotka on palautettu kilpailevien lähestymistapojen avulla. Vain osoittamiseksi resoluutio - katso alkuperäinen lähdeaineisto tarkemmasta vertailusta.

Videon kehykset REDS:stä, jotka on palautettu kilpailevien lähestymistapojen avulla. Vain osoittamiseksi resoluutio – katso alkuperäinen lähdeaineisto tarkemmasta vertailusta.

 

Julkaistu ensimmäisen kerran 19. elokuuta 2022.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai