Unghiul lui Anderson

Remedierea apelurilor video blurate în timp real, folosind doar CPU

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Partially AI-generated image. Overlaid in front, a before and after comparison of CPU-only facial improvement for the paper FSFVE: Few Shot Compressed Face Video Enhancement; behind, a generic illustration from GPT-2 expressing the idea of an AI model 'up-rezzing' a poor video chat avatar.

O nouă metodă creează un model de inteligență artificială al feței dvs. în câteva secunde, pentru a remedia apelurile video blurate în timp real – funcționând integral pe un laptop de bază CPU, fără a necesita hardware puternic sau procesare în cloud.

 

Deși utilizatorii din țările sub-resursate sunt mai afectați de imagini de calitate scăzută la apelurile video, acesta este adesea un “problema lumii dezvoltate” – de exemplu, dacă unul dintre participanții la o discuție utilizează un punct de acces Wi-Fi supraîncărcat sau dacă un alt proces sau persoană din gospodăria participantului domină lățimea de bandă disponibilă; sau chiar dacă acea persoană vizitează o țară cu o conectivitate slabă.

Deoarece problema este comună, o anumită atenție a fost acordată acesteia în literatura de specialitate, cu soluții propuse prin deblocare, denoising, super-rezoluție și alte metode. Sistemul VQFR din 2022 restaurează imagini faciale degradate prin înlocuirea caracteristicilor de imagine de calitate scăzută cu reprezentări de calitate superioară extrase dintr-un codbook învățat; GFP-GAN din 2021 utilizează priori faciale generative pentru a îmbunătăți imaginile de calitate scăzută; și RTFVE: Îmbunătățirea video-ului facial în timp real utilizează imagini de referință de calitate superioară pentru a efectua restaurarea feței:

Faceți clic pentru a juca, dacă este necesar.De la proiectul de îmbunătățire a feței din 2025, îmbunătățirea feței accelerate de GPU. Sursă

Din punctul de vedere al utilizatorului sub-resursat, majoritatea acestor soluții nu sunt viabile, deoarece încarcă munca pe un GPU care poate să nu fie disponibil în configurația utilizatorului. Cu toate acestea, utilizarea CPU-ului (mult mai puțin capabil) pentru sarcini de vedere computațională este, de obicei, un proces offline, ceea ce înseamnă că ar trebui să așteptați ca CPU-ul să termine procesarea înainte ca ieșirea să fie disponibilă.

Acest lucru este inacceptabil pentru scenariul apelului video, care este foarte solicitant din punct de vedere al resurselor, dar adesea și lipsit de resurse: orice sistem de îmbunătățire facială realmente democratic ar trebui să ruleze pe CPU la o rată minimă de 24 cadre pe secundă, la o rezoluție rezonabilă; și acesta este un lucru dificil de cerut.

Înfruntarea

Acest scenariu solicitant este îndeplinit de o nouă ofertă de cercetare din Statele Unite, care, după cum afirmă autorii, este capabilă să antreneze un model în mai puțin de 100 de secunde din cadre rare ale feței utilizatorului, cu modelul final care rulează ca un strat intermediar între utilizator și conferință, prin straturi oficiale API în aplicații de videoconferință, cum ar fi Zoom:

Faceți clic pentru a juca, dacă este necesar.De la pagina proiectului FSFVE, îmbunătățiri de exemplu pentru fețele din scenariul webcam, utilizând un model ușor (3,5 MB) antrenat în mai puțin de două minute.Sursă

Articolul afirmă:

‘Modelul FSFVE poate fi antrenat fie imediat înainte de un apel video, fie la începutul apelului. Sunt necesare doar câteva imagini de calitate superioară ale subiectului; de exemplu, 5 până la 30 de imagini, făcându-l să învețe puțin.

‘Imediat înainte de apel sau la începutul apelului, pot fi obținute câteva secunde de video de calitate superioară a utilizatorului; de exemplu, 3 secunde, oferind 324=72 cadre, presupunând o rată de cadre de 24 cadre pe secundă (FPS).

Una dintre caracteristicile notabile ale noului sistem este flexibilitatea sa în ceea ce privește cine “plătește” pentru procesarea modelului; dacă utilizatorul însuși, dintr-un anumit motiv, nu poate furniza puterea CPU pentru antrenare, aceasta poate fi transferată corespondentului, prin trimiterea unui număr mic de cadre de calitate superioară, cu modelul astfel antrenat “la distanță” pentru utilizatorul lipsit de resurse.

Alternativ, antrenamentul poate fi transferat sistematic pe un server pentru antrenament. Autorii observă:

‘Serverul poate fi utilizat pentru cazurile în care dispozitivele de trimitere și de recepție sunt prea lente pentru antrenament (sau chiar dacă nu, pentru a le scuti de sarcină).

‘În orice caz, dimensiunea modelului este relativ mică (aproximativ 3,5 MB), la fel ca și câteva cadre de calitate superioară, și odată ce antrenamentul este complet, modelul poate rula în timp real pe un laptop obișnuit.’

În testele efectuate, modelele antrenate împotriva modelelor de referință și a lucrărilor anterioare (inclusiv RTFVE, care reprezintă baza noii lucrări), FSFVE a depășit constant videoul comprimat neîmbunătățit, un ResNet optimizat pentru CPU pentru inferență în timp real și modelul RTFVE-0 modificat, în timp ce rulează în timp real pe un CPU.

Noul articol se intitulează FSFVE: Îmbunătățirea video-ului facial comprimat cu puține cadre și vine complet cu o demo și un repo GitHub.

Metodă

FSFVE a fost antrenat pe setul de date deschis FaceForensics++*, care constă în 363 de videoclipuri 1080p cu actori care vorbesc, din care autorii au extras categoria “vorbind împotriva unui perete”, ca fiind cea mai apropiată de un apel video obișnuit:

Faceți clic pentru a juca, dacă este necesar.Exemple din setul de date FaceForensics++. Sursă 

Această submulțime se ridică la 27 de videoclipuri de aproximativ 972 de cadre fiecare – în mare parte vederi frontale, dar, în mod necesar, și câteva vederi laterale.

Pentru a genera videoclipuri de calitate scăzută, concepute pentru a simula probleme de conectare la apeluri video, autorii au comprimat setul de date utilizând codurile video H264 și H265. Nivelurile de compresie au fost setate la o CRF care cuprinde 36, 40 și 44 (considerând că zero este fără pierderi și 51 este extrem de blocat).

Fiecare cadru a fost decupat la o regiune de 256 × 256 în jurul feței, utilizând detectorul de fețe BlazeFace, după care punctele faciale au fost utilizate pentru a alinia fața prin localizarea ochilor și aplicarea unei transformări afine (care rotește, mărește și deplasează fața într-o poziție consistentă), astfel încât ochii să rămână la nivel și în aproximativ aceeași poziție în toate cadrele.

Acest lucru a fost realizat cu biblioteca de recunoaștere a feței:

Un exemplu de extragere a liniamentelor faciale dintr-o imagine cu biblioteca de recunoaștere a feței Python. Sursă - https://github.com/ageitgey/face_recognition

Un exemplu de extragere a liniamentelor faciale dintr-o imagine cu biblioteca de recunoaștere a feței Python. Sursă

Deoarece modelul este conceput pentru a învăța din doar câteva cadre dintr-un singur apel video, cadrele de antrenament au trebuit să capteze cât mai multă variație facială posibilă. Prin urmare, clusteringul k-means a fost utilizat în loc de metode de selecție mai simple (de exemplu, eșantionare aleatoare sau intervale fixe).

Fiecare cadru decupat și aliniat a fost trecut prin encoderul de fețe RTFVE menționat anterior pentru a genera o reprezentare numerică, după care clusteringul k-means a grupat cadrele asemănătoare în 30 de cluster. Acest proces de clustering a fost repetat de cinci ori pentru a obține cel mai bun grup, iar cadru cel mai apropiat de centrul fiecărui cluster a fost selectat pentru antrenament. Acest proces a produs un set divers de 30 de imagini pentru fiecare videoclip.

Antrenament și teste

Modelele au fost antrenate timp de 100 de epoci, ceea ce este destul de puțin, având în vedere numărul foarte mic de imagini implicate. Cu toate acestea, după cum observă autorii, un model supraantrenat este de fapt dezirabil în acest scenariu, chiar dacă nu poate capta toate evenimentele posibile, cum ar fi expresii faciale neobișnuite, poziții sau ascunderea/obfuscarea caracteristicilor faciale. Prioritățile, în schimb, sunt o flexibilitate moderată în generalizare și viteza de antrenament.

Optimizatorul RAdam a fost utilizat la o rată de învățare de 10-4.

Pentru testele inițiale, sistemul a fost comparat cu videoul comprimat original; un ResNet ușor configurat pentru inferență CPU în timp real; și RTFVE – singurul alt sistem de îmbunătățire facială în timp real pe CPU cunoscut.

Pentru a asigura o comparație corectă, RTFVE a fost modificat pentru a înlătura dependența sa de imagini de referință de calitate superioară în timpul inferenței, păstrând în același timp o viteză și un număr de parametri similare, producând o variantă numită RTFVE-0. Modelele ResNet și RTFVE-0 au fost antrenate utilizând funcția de pierdere L1. Pentru a asigura o comparație corectă, toate modelele au utilizat același optimizer RAdam și setări de antrenament, cu o instanță a modelului antrenat separat pentru fiecare videoclip.

Pentru a accelera antrenamentul, a fost introdusă o pierdere focală personalizată în domeniul frecvenței (care pune accentul pe cele mai vizibile detalii ale imaginii în timpul antrenamentului), pentru a da o greutate mai mare componentelor DCT de joasă frecvență (informațiile de imagine după conversia în valori de frecvență), care au cea mai mare influență asupra calității percepute a imaginii.

Greutatea a fost derivată din matricea de cuantificare a luminanței JPEG, ceea ce face ca modelul să prioritizeze structurile de imagine cel mai vizibil importante în timpul antrenamentului.

Teste cantitative

Atât acuratețea tehnică de reconstrucție (distorșiune), cât și calitatea vizuală percepută au fost măsurate pentru testele efectuate. Distorșiunea a fost măsurată prin Raportul de semnal la zgomot de vârf (PSNR) și Indexul de similaritate structurală (SSIM); și calitatea perceptuală prin Similaritatea perceptuală a patch-urilor de imagine învățate (LPIPS):

Performanța FSFVE împotriva videoului comprimat original, a unui ResNet optimizat pentru CPU și a modelului RTFVE-0 modificat, la trei niveluri de compresie, cu PSNR și SSIM mai mari, indicând o calitate de reconstrucție mai bună, și LPIPS mai mic, indicând o calitate perceptuală mai bună.

Performanța FSFVE împotriva videoului comprimat original, a unui ResNet optimizat pentru CPU și a modelului RTFVE-0 modificat, la trei niveluri de compresie, cu PSNR și SSIM mai mari, indicând o calitate de reconstrucție mai bună, și LPIPS mai mic, indicând o calitate perceptuală mai bună.

FSFVE a depășit constant atât videoul comprimat original, cât și modelele de îmbunătățire a feței pe CPU, la toate nivelurile de compresie.

La videoclipurile H.264, PSNR a crescut cu 1,11 dB, 1,37 dB și 1,51 dB față de baza de referință la valorile CRF de 36, 40 și 44, cu îmbunătățiri corespunzătoare ale SSIM și scoruri LPIPS mai mici la cele două niveluri de compresie mai mari (indicând o calitate perceptuală mai bună).

Rezultate similare au fost înregistrate și la videoclipurile H.265, ceea ce sugerează că abordarea rămâne eficientă pentru ambele coduri video majore. Așa cum se arată mai jos, îmbunătățirea a devenit mai pronunțată pe măsură ce compresia a crescut, indicând faptul că metoda a funcționat în special în condiții de bandă largă scăzută, pe care a fost concepută să le abordeze:

PSNR la creșterea bitrate-ului pentru videoul original H.264 și ieșirea îmbunătățită. Diferența în creștere la debitele mai mici arată că FSFVE oferă cele mai mari câștiguri de calitate în condiții de compresie puternică și de bandă largă constrânsă.

PSNR la creșterea bitrate-ului pentru videoul original H.264 și ieșirea îmbunătățită. Diferența în creștere la debitele mai mici arată că FSFVE oferă cele mai mari câștiguri de calitate în condiții de compresie puternică și de bandă largă constrânsă.

ResNet-ul optimizat pentru CPU și RTFVE-0 au oferit doar îmbunătățiri modeste față de baza de referință comprimată, în timp ce FSFVE a depășit ambele cu mai mult de 1,1 dB, menținând în același timp o performanță în timp real de 30,24 cadre pe secundă, în ciuda faptului că conține aproximativ un milion de parametri.

După cum se arată mai jos, performanța a crescut constant pe măsură ce au fost furnizate mai multe cadre de antrenament. Chiar și cu doar cinci imagini de antrenament, FSFVE a îmbunătățit PSNR cu mai mult de 0,75 dB față de baza de referință comprimată, în timp ce zece cadre de antrenament au fost suficiente pentru a depăși o îmbunătățire de 1 dB – indicând faptul că abordarea a rămas eficientă cu cantități foarte limitate de date de antrenament:

Efectul dimensiunii setului de antrenament asupra PSNR pentru cadre de videoclip H.264 nevăzute la CRF 44. Chiar și cinci imagini de antrenament au îmbunătățit calitatea față de baza de referință comprimată, performanța crescând constant pe măsură ce au fost disponibile mai multe cadre.

Efectul dimensiunii setului de antrenament asupra PSNR pentru cadre de videoclip H.264 nevăzute la CRF 44. Chiar și cinci imagini de antrenament au îmbunătățit calitatea față de baza de referință comprimată, performanța crescând constant pe măsură ce au fost disponibile mai multe cadre.

Teste calitative

În rezultatele de mai jos, pentru faza calitativă a testelor, vedem cadre de videoclip H.264 puternic comprimate la CRF 44, împreună cu ieșirea corespunzătoare FSFVE:

Comparație între cadre de videoclip H.264 puternic comprimate la CRF 44 și ieșirea corespunzătoare FSFVE. Rezultatele îmbunătățite, după cum afirmă articolul, reduc artefactele de compresie, restaurează structura facială și produc o piele mai netedă și naturală, păstrând identitatea și expresia subiectului.

Comparație între cadre de videoclip H.264 puternic comprimate la CRF 44 și ieșirea corespunzătoare FSFVE. Rezultatele îmbunătățite, după cum afirmă articolul, reduc artefactele de compresie, restaurează structura facială și produc o piele mai netedă și naturală, păstrând identitatea și expresia subiectului. Vă rugăm să consultați PDF-ul original și videoclipurile pentru exemple mai bune.

Autorii susțin că imaginile comprimate prezintă artefacte evidente în jurul ochilor, nasului și gurii, împreună cu o piele cu textură neobișnuită și distorsionarea caracteristicilor faciale, în timp ce rezultatele îmbunătățite reduc în mod semnificativ aceste defecte:

‘În primul exemplu, ochii par neclari, cu negrul machiajului care se amestecă cu culoarea ochilor. Sunt semne clare de aliasing cu buzele. Sprâncenele lipsesc definiția și pielea pare distorsionată. În al doilea exemplu, pielea este puternic texturată, cu artefacte de tip “sclipici”.

‘Există artefacte de blocare sub gură care alterează forma bărbiei. De asemenea, există linii verticale.

‘Modelul nostru poate remedia aceste artefacte, generând o ieșire plăcută din punct de vedere vizual, cu o piele mai clară și restaurând unele dintre detaliile fine care au fost pierdute în timpul compresiei.

‘În mod important, ieșirea îmbunătățită rămâne fidelă identității din videoclip.’

Concluzie

Pare inevitabil că aceste eforturi continue din industrie și academia pentru a îmbunătăți calitatea datelor de apeluri video cu semnal scăzut vor ajunge în cele din urmă în conflict cu eforturile opuse de a identifica secvențele video deepfake în apelurile video.

Deoarece, după cum menționează noul articol, sistemele interstițiale, cum ar fi FSFVE, pot fi aplicate în mod legitim fluxurilor de apeluri video prin API-uri oficiale, este posibil ca conținutul neîmbunătățit să rămână disponibil pentru a fi utilizat de măsurile anti-deepfake, pe măsură ce acestea apar și devin mai importante.

 

* Menționat în noul articol ca setul de date “DeepFakeDetector”, deși nu pare să fie cunoscut sub acest nume, chiar și în cadrul articolului FaceForensics++ la care autorii fac trimitere în acest sens.

Publicat pentru prima dată marți, 14 iulie 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai