Unghiul lui Anderson
Restaurarea videourilor cu compresie excesivă de pe rețelele de socializare cu ajutorul învățării automate

O nouă cercetare efectuată în China oferă o metodă eficientă și inovatoare pentru restaurarea detaliilor și a rezoluției videourilor încărcate de utilizatori, care sunt comprimate automat pe platforme precum WeChat și YouTube, pentru a economisi lățimea de bandă și spațiul de stocare.

Compararea noii metode cu abordările anterioare, în ceea ce privește capacitatea de a reface cu acuratețe detaliile eliminate în timpul optimizării automate a platformelor de socializare. Sursă: https://arxiv.org/pdf/2208.08597.pdf
În contrast cu metodele anterioare care pot mări și reeşantiona videourile pe baza unor date de antrenament generice, noua abordare derivă o hartă de caracteristici de degradare (DFM) pentru fiecare cadru al videoului comprimat – în esență, o imagine de ansamblu a regiunilor cele mai deteriorate sau deteriorate din cadru, care au rezultat din compresie.

Din studiile de ablație ale noului articol: al doilea din dreapta, adevărul pentru o hartă de caracteristici de degradare ‘pură’ (DFM); al treilea din dreapta, o estimare a deteriorării fără utilizarea DFM. Stânga, o hartă mult mai precisă a deteriorării cu DFM.
Procesul de restaurare, care utilizează rețele neuronale convolutive (CNN), printre alte tehnologii, este condus și concentrat de informațiile din DFM, permițând noii metode să depășească performanța și acuratețea abordărilor anterioare.
Adevărul pentru proces a fost obținut de către cercetători prin încărcarea unor videouri de înaltă calitate pe patru platforme de partajare populare, descărcarea rezultatelor comprimate și dezvoltarea unui flux de lucru de viziune computerizată capabil să învețe în mod abstract artefactele de compresie și pierderea de detalii, astfel încât să poată fi aplicat pe mai multe platforme pentru a restaura videourile la o calitate aproape originală, pe baza unor date complet diferite.
Materialul utilizat în cercetare a fost compilat într-o bază de date HQ/LQ intitulată “Videouri ale utilizatorilor partajate pe rețelele de socializare” (UVSSM) și a fost făcută disponibilă pentru descărcare (parolă: rsqw) la Baidu, pentru beneficiul ulterioarelor proiecte de cercetare care își propun să dezvolte noi metode pentru restaurarea videourilor comprimate de platforme.

O comparație între două mostre echivalente HQ/LQ din baza de date UVSSM descărcabilă (vezi linkurile de mai sus pentru URL-urile sursă). Deoarece chiar și acest exemplu poate fi supus unor rotunjiri multiple de compresie (aplicație de imagine, CMS, CDN etc.), vă rugăm să consultați datele sursă originale pentru o comparație mai precisă.
Codul pentru sistem, cunoscut sub numele de “Restaurarea videourilor prin detectarea adaptivă a degradării” (VOTES), a fost de asemenea lansat pe GitHub, deși implementarea sa implică o serie de dependențe bazate pe extragere.
Articolul, intitulat “Restaurarea videourilor partajate de utilizatori pe rețelele de socializare”, provine de la trei cercetători de la Universitatea Shenzhen și unul de la Departamentul de Inginerie Electronică și Informatică de la Universitatea Politehnică din Hong Kong.
De la artefacte la fapte
Capacitatea de a restaura calitatea videourilor extrase din web fără “halucinația” generică, uneori excesivă, de detalii oferită de programe precum Gigapixel (și de majoritatea pachetelor open source de același tip) ar putea avea implicații pentru sectorul cercetării viziunii computerizate.
Cercetarea în domeniul tehnologiilor video bazate pe viziunea computerizată se bazează adesea pe imagini obținute de pe platforme precum YouTube și Twitter, unde metodele de compresie și codec-urile utilizate sunt strict protejate, nu pot fi ușor deduse pe baza unor indicatori vizuali sau a altor indicii și pot fi modificate periodic.
Majoritatea proiectelor care utilizează videouri găsite pe web nu sunt axate pe cercetarea compresiei și trebuie să facă compromisuri pentru calitatea disponibilă a videourilor comprimate oferite de platforme, deoarece nu au acces la versiunile originale de înaltă calitate încărcate de utilizatori.
Prin urmare, capacitatea de a restaura cu fidelitate o calitate și o rezoluție mai mare pentru astfel de videouri, fără a introduce influențe descendente din seturi de date de viziune computerizată nelegate, ar putea ajuta la evitarea frecventelor soluții și compromisuri pe care proiectele de viziune computerizată trebuie să le facă în prezent pentru sursele de video degradate.
Deși platforme precum YouTube vor face uneori anunțuri importante despre modul în care comprimă videourile utilizatorilor (cum ar fi VP9), niciuna dintre ele nu dezvăluie în mod explicit întregul proces sau codec-urile și setările exacte utilizate pentru a reduce dimensiunile fișierelor de înaltă calitate încărcate de utilizatori.
Obținerea unei calități de ieșire îmbunătățite din încărcările utilizatorilor a devenit astfel o adevărată “artă” în ultimii zece ani, cu diverse “soluții” (în mare parte neconfirmate) care intră și ies din modă.
Metoda
Abordările anterioare de restaurare a videourilor bazate pe învățarea automată au implicat extragerea caracteristicilor generice, fie ca o abordare pentru restaurarea unui singur cadru, fie într-o arhitectură multi-cadru care utilizează fluxul optic (adică care ține cont de cadrele adiacente și ulterioare la restaurarea unui cadru curent).
Toate aceste abordări au trebuit să facă față “efectului cutiei negre” – faptul că nu pot examina efectele compresiei în tehnologiile de bază, deoarece nu este sigur nici ce sunt tehnologiile de bază, nici cum au fost configurate pentru un anumit video încărcat de utilizator.
VOTES, în schimb, își propune să extragă caracteristici semnificative direct din videoul original și comprimat și să determine modele de transformare care vor generaliza la standardele mai multor platforme.
VOTES utilizează un modul de detectare a degradării special dezvoltat (DSM, vezi imaginea de mai sus) pentru a extrage caracteristici în blocuri convolutive. Mai multe cadre sunt apoi trecute printr-un modul de extragere și aliniere a caracteristicilor (FEAM), care sunt apoi transmise unui modul de modulare a degradării (DMM). În final, modulul de reconstrucție produce videoul restaurat.
Date și experimente
În noua lucrare, cercetătorii și-au concentrat eforturile pentru a restaura videourile încărcate și reîncărcate de pe platforma WeChat, dar au fost preocupați să se asigure că algoritmul rezultat poate fi adaptat și pentru alte platforme.
S-a dovedit că, odată ce au obținut un model eficient de restaurare pentru videourile WeChat, adaptarea acestuia pentru Bilibili, Twitter și YouTube a durat doar 90 de secunde pentru o singură epocă pentru fiecare model personalizat pentru fiecare platformă (pe o mașină care rulează 4 NVIDIA Tesla P40 GPU cu un total de 96 GB de VRAM).

Adaptarea modelului de succes WeChat pentru alte platforme de partajare a videourilor s-a dovedit a fi relativ ușoară. Aici vedem VOTES obținând paritatea de performanță aproape instantaneu pe diverse platforme, utilizând baza de date UVSSM a autorilor și baza de date REDS (vezi mai jos).
Pentru a popula baza de date UVSSM, cercetătorii au adunat 264 de videouri cu durate cuprinse între 5-30 de secunde, fiecare cu o rată de cadre de 30fps, sursă direct din camere de telefon mobil sau de pe internet. Videourile au fost fie 1920 x 1080, fie 1280 x 270 de pixeli.
Conținutul (vezi imaginea anterioară) a inclus vederi ale orașelor, peisaje, oameni și animale, printre alte subiecte, și pot fi utilizate în baza de date publică prin licență Creative Commons Attribution, permițând reutilizarea.
Autorii au încărcat 214 videouri pe WeChat utilizând cinci mărci diferite de telefoane mobile, obținând rezoluția implicită a videourilor WeChat de 960×540 (cu excepția cazului în care videoul sursă are dimensiuni mai mici decât acestea), printre cele mai “aspre” conversii pe platforme populare.

Sus-stânga, cadrul original de înaltă calitate cu trei secțiuni mărite; sus-dreapta, același cadru dintr-o versiune comprimată de platformă a aceluiași videou; jos-stânga, degradarea calculată a cadrului comprimat; și jos-dreapta, zona de ‘lucru’ rezultată pentru VOTES pentru a-și concentra atenția.
Pentru comparațiile ulterioare cu rutinele de conversie ale altor platforme, cercetătorii au încărcat 50 de videouri (care nu făceau parte din cele 214 originale) pe Bilibili, YouTube și Twitter. Rezoluția originală a videourilor a fost de 1280×270, iar versiunile descărcate au avut o rezoluție de 640×360.
Acest lucru aduce baza de date UVSSM la un total de 364 de perechi de videouri originale (de înaltă calitate) și partajate (de calitate scăzută), cu 214 pe WeChat și câte 50 pe Bilibili, YouTube și Twitter.
Pentru experimente, 10 videouri au fost selectate aleatoriu ca set de testare, patru ca set de validare și restul de 200 ca set de antrenare de bază. Experimentele au fost efectuate de cinci ori cu validarea cruză K-fold, iar rezultatele au fost mediate pe aceste instanțe.
În testele pentru restaurarea videourilor, VOTES a fost comparat cu Spatio-Temporal Deformable Fusion (STDF). Pentru îmbunătățirea rezoluției, a fost testat împotriva Enhanced Deformable convolutions (EDVR), RSDN, Video Super-resolution with Temporal Group Attention (VSR_TGA) și BasicVSR. Metoda cu o singură etapă a Google, COMISR, a fost de asemenea inclusă, deși nu se potrivește tipului de arhitectură al lucrărilor anterioare.
Metodele au fost testate împotriva atât a bazei de date UVSS, cât și a bazei de date REDS, VOTES obținând cele mai mari scoruri:
Autorii susțin că rezultatele calitative indică de asemenea superioritatea VOTES față de sistemele anterioare:

Cadrul videourilor din REDS restaurate de abordări concurente. Rezoluție indicativă numai – vezi articolul pentru rezoluția definitivă.
Publicat pentru prima dată pe 19 august 2022.















