Kąt Andersona
Naprawianie rozmytych połączeń wideo w czasie rzeczywistym przy użyciu tylko procesora CPU

Nowa metoda tworzy model AI Twojej twarzy w kilka sekund, aby naprawić rozmyte połączenia wideo w czasie rzeczywistym – działając całkowicie na podstawie podstawowego laptopa CPU, bez potrzeby potężnego sprzętu lub przetwarzania w chmurze.
Chociaż użytkownicy w krajach o ograniczonych zasobach są najbardziej dotknięci przez niską jakość obrazu wideo, jest to często problem “pierwszego świata” – na przykład, jeśli jeden z uczestników rozmowy używa przeciążonego hotspotu Wi-Fi lub innego procesu lub osoby w gospodarstwie domowym, które dominują dostępną przepustowość; lub nawet jeśli osoba ta odwiedza kraj o słabej łączności.
Ponieważ problem jest powszechny, pewna ilość uwagi została poświęcona mu w literaturze naukowej, z proponowanymi rozwiązaniami za pośrednictwem deblocking, denoising, super-resolution i innych metod. System VQFR z 2022 roku przywraca zdegradowane obrazy twarzy, zastępując niskiej jakości cechy obrazu wyższej jakości reprezentacjami pobranymi z nauczonej książki; GFP-GAN z 2021 roku wykorzystuje generatywne priory twarzy, aby poprawić obrazy o niskiej jakości; i RTFVE: Realtime Face Video Enhancement wykorzystuje wysokiej jakości obrazy referencyjne do przywrócenia twarzy:
Kliknij, aby odtworzyć, jeśli jest to konieczne. Projekt ulepszenia twarzy z 2025 roku, poprawa twarzy przy użyciu GPU. Źródło
Od strony użytkownika o ograniczonych zasobach, większość tych rozwiązań nie jest wykonalna, ponieważ przenoszą pracę na GPU, które może nie być dostępne w konfiguracji użytkownika. Jednakże, korzystanie z (o wiele mniej wydajnego) CPU do zadań związanych z widzeniem komputera jest zwykle procesem offline, co oznacza, że należy czekać, aż CPU skończy przetwarzanie, zanim dane wyjściowe będą dostępne.
To jest nie do przyjęcia w scenariuszu wideorozmowy, który jest żarłoczny zasobów, ale często również głodny zasobów: każdy naprawdę demokratyczny system poprawy twarzy musiałby działać na CPU z prędkością co najmniej 24 klatek na sekundę przy rozdzielczości; i to jest wiele do zrobienia.
Facing Up
Ten wymagający scenariusz jest spełniony przez nową ofertę badawczą ze Stanów Zjednoczonych, która, jak twierdzą autorzy, jest w stanie trenować model w czasie krótszym niż 100 sekund od ramki widoku twarzy, z końcowym modelem, który działa jako warstwa pośrednia między użytkownikiem a konferencją, za pośrednictwem oficjalnych API w aplikacjach wideokonferencyjnych, takich jak Zoom:
Kliknij, aby odtworzyć, jeśli jest to konieczne. Przykładowe ulepszenia twarzy w scenariuszu kamery internetowej, przy użyciu lekkiego modelu (3,5 MB) wytrenowanego w czasie krótszym niż dwie minuty. Źródło
W artykule napisano:
‘Model FSFVE może być wytrenowany albo tuż przed wideorozmową, albo na początku rozmowy. Wymagane są tylko kilka wysokiej jakości obrazów przedmiotu; np. 5 do 30 obrazów, co stanowi niewielką ilość danych do nauki. Tuż przed rozmową lub na początku rozmowy można uzyskać kilka sekund wysokiej jakości wideo użytkownika; na przykład 3 sekundy, co daje 3∗24=72 klatki przy założeniu częstotliwości klatek 24 klatki na sekundę (FPS).
‘To wysokiej jakości wideo może być szybko ponownie zakodowane do niskiej jakości wideo na podstawie ustawień wideorozmowy, a następnie z niskiej i wysokiej jakości klatek model jest trenowany.’
Jedną z charakterystycznych cech nowego systemu jest jego elastyczność w odniesieniu do tego, kto “płaci” za przetwarzanie modelu; jeśli użytkownik sam nie może zapewnić mocy obliczeniowej do trenowania, może to być przeniesione na korespondenta, poprzez wysłanie niewielkiej ilości wysokiej jakości klatek, z modelem wytrenowanym “zdalnie” do użytkownika o ograniczonych zasobach.
Alternatywnie, trenowanie może być systematycznie przeniesione na serwer do trenowania. Autorzy zauważają:
‘Serwer może być użyty w przypadkach, w których urządzenia wysyłające i odbierające są zbyt wolne do trenowania (lub nawet jeśli nie, aby ulżyć im w tym zadaniu).
‘W każdym przypadku rozmiar modelu jest względnie mały (około 3,5 MB), a także kilka wysokiej jakości klatek, a po zakończeniu trenowania model może działać w czasie rzeczywistym na typowym laptopie CPU.’
W testach, z modelami wytrenowanymi w odniesieniu do podstawowych i poprzednich prac (w tym RTFVE, które stanowi podstawę nowej pracy), FSFVE konsekwentnie przewyższał nieulepszony kompresowany wideo, CPU-optymalizowany ResNet i zmodyfikowany model RTFVE-0, nadal działając w czasie rzeczywistym na CPU.
Nowy artykuł nowy artykuł nosi tytuł FSFVE: Few Shot Compressed Face Video Enhancement, i jest dostępny wraz z demo i repozytorium GitHub.
Metoda
FSFVE został wytrenowany na otwartym zbiorze danych FaceForensics++*, który składa się z 363 filmów wideo 1080p z aktorami, z których autorzy wyodrębnili kategorię “talking against a wall”, jako najbliższą stylowi typowej wideorozmowy:
Kliknij, aby odtworzyć, jeśli jest to konieczne. Przykłady z zestawu danych FaceForensics++. Źródło
Ten podzbiór składa się z 27 filmów wideo o długości około 972 klatki każdy – głównie widoki frontalne, ale również niektóre widoki boczne.
Aby wygenerować niskiej jakości wideo, które symulują problemy z połączeniami wideo, autorzy skompresowali zbiór danych przy użyciu kodera wideo H264 i H265. Poziomy kompresji zostały ustawione na zakres CRF obejmujący 36, 40 i 44 (biorąc pod uwagę, że zero to straty, a 51 to bardzo blokuje).
Każda klatka została obcięta do obszaru 256 × 256 wokół twarzy przy użyciu detektora twarzy BlazeFace, po czym punkty twarzy zostały użyte do wyrównania twarzy przez umieszczenie oczu i zastosowanie przekształcenia afinicznego (które obraca, skaluje i przesuwa twarz w spójną pozycję), tak aby oczy pozostały na poziomie i w przybliżeniu tej samej pozycji we wszystkich klatkach.
To zostało wykonane przy użyciu biblioteki Face Recognition:

Przykład wyodrębniania cech twarzy z obrazu przy użyciu biblioteki Face Recognition Python. Źródło
Ponieważ model jest zaprojektowany do nauki tylko z kilku klatek z jednej wideorozmowy, klatki treningowe musiały uchwycić jak najwięcej zmienności twarzy. Dlatego też klastering k-średnich został użyty zamiast prostszych metod selekcji (tj. losowego próbkowania lub próbek o stałych interwałach).
Każda obcięta i wyrównana klatka została przekazana przez wspomniany wcześniej kodujący twarz RTFVE w celu wygenerowania reprezentacji numerycznej, po czym klastering k-średnich pogrupował podobne klatki w 30 klastrów. Proces klasteringu został powtórzony pięć razy, aby uzyskać najlepsze grupowanie, a klatka najbliższa centrum klastra została wybrana do trenowania. Ten proces wygenerował zróżnicowany zestaw 30 obrazów dla każdego filmu wideo.
Trenowanie i testy
Modele zostały wytrenowane przez 100 epok, co jest dość niskie, biorąc pod uwagę bardzo małą ilość obrazów. Jednak, jak zauważają autorzy, przeuczenie modelu jest w tym scenariuszu pożądane, nawet jeśli nie może uchwycić wszystkich możliwych zdarzeń, takich jak niezwykłe wyrażenia twarzy, pozy lub ukrywanie/zaślepienie cech twarzy. Priorytetami są umiarkowana elastyczność w generalizacji i szybkość trenowania.
Optymalizator RAdam został użyty z współczynnikiem uczenia 10-4.
W początkowych testach system został porównany z oryginalnym skompresowanym wideo; lekkim ResNet skonfigurowanym do inferencji w czasie rzeczywistym na CPU; oraz wspomnianym wcześniej RTFVE – jedynym innym systemem poprawy twarzy w czasie rzeczywistym na CPU.
Aby zapewnić uczciwe porównanie, RTFVE został zmodyfikowany, aby usunąć jego zależność od wysokiej jakości obrazów referencyjnych podczas inferencji, zachowując przy tym podobną szybkość i liczbę parametrów, co dało wariant o nazwie RTFVE-0. Modele ResNet i RTFVE-0 zostały wytrenowane przy użyciu funkcji straty L1. Aby zapewnić uczciwe porównanie, wszystkie modele używały tego samego optymalizatora RAdam i ustawień trenowania, z oddzielną instancją modelu wytrenowaną z 30 klatek dla każdego filmu wideo.
Aby przyspieszyć trenowanie, wprowadzono niestandardową stratę fokalną w dziedzinie częstotliwości (kładąc nacisk na najbardziej istotne wizualnie szczegóły obrazu podczas trenowania), aby nadać większy ciężar niskim składowym DCT (informacji o obrazie po przekształceniu w wartości częstotliwości), które mają największy wpływ na postrzeganą jakość obrazu.
Waga została pochodną macierzy kwantyzacji luminancji JPEG, powodując, że model przykładał wagę do najbardziej istotnych struktur wizualnych podczas trenowania.
Testy ilościowe
Zmierzone zostały zarówno techniczna dokładność odtworzenia (zniekształcenie), jak i postrzegana jakość wizualna. Zniekształcenie zostało zmierzone za pomocą współczynnika sygnału do szumu (PSNR) i wskaźnika podobieństwa strukturalnego (SSIM); a postrzegana jakość przez współczynnik podobieństwa patchów obrazu (LPIPS):

Wyniki FSFVE w porównaniu z oryginalnym skompresowanym wideo, CPU-optymalizowanym ResNet i zmodyfikowanym RTFVE-0 w różnych poziomach kompresji wideo H.264 i H.265, z wyższymi wartościami PSNR i SSIM wskazującymi lepszą jakość odtworzenia, i niższymi wartościami LPIPS wskazującymi lepszą postrzeganą jakość.
FSFVE konsekwentnie przewyższał zarówno oryginalne skompresowane wideo, jak i inne modele poprawy twarzy na CPU, we wszystkich poziomach kompresji.
Przy wideo H.264, PSNR zwiększył się o 1,11 dB, 1,37 dB i 1,51 dB w stosunku do podstawy przy wartościach CRF 36, 40 i 44, z odpowiednimi poprawami w SSIM i niższymi wynikami LPIPS w dwóch wyższych poziomach kompresji (co wskazuje na lepszą postrzeganą jakość).
Podobne zyski zostały odnotowane przy wideo H.265, co sugeruje, że podejście pozostaje skuteczne w obu głównych kodach wideo. Jak widać poniżej, poprawa stała się bardziej wyraźna wraz ze wzrostem kompresji, co wskazuje, że metoda działała szczególnie dobrze w warunkach niskiej przepustowości, której została zaprojektowana:

PSNR wraz ze wzrostem bitrate dla oryginalnego wideo H.264 i ulepszonego wyjścia. Rozszerzająca się luka przy niższych bitrate wskazuje, że FSFVE dostarcza największe zyski jakości w warunkach najbardziej skompresowanych i ograniczonych przez przepustowość.
Model CPU-optymalizowany ResNet i RTFVE-0 zapewniły tylko umiarkowane poprawy w stosunku do skompresowanego podstawowego wideo, podczas gdy FSFVE przewyższył oba o ponad 1,1 dB, utrzymując przy tym wydajność w czasie rzeczywistym na poziomie 30,24 klatek na sekundę, pomimo posiadania około miliona parametrów.
Jak widać poniżej, wyniki poprawiły się stopniowo wraz ze wzrostem liczby klatek treningowych. Nawet przy tylko pięciu obrazach treningowych FSFVE poprawił PSNR o ponad 0,75 dB w stosunku do skompresowanego podstawowego wideo, podczas gdy dziesięć klatek treningowych było wystarczających, aby przekroczyć poprawę o 1 dB – co wskazuje, że podejście pozostawało skuteczne nawet przy bardzo ograniczonych danych treningowych:

Wpływ rozmiaru zestawu treningowego na PSNR dla niewidocznych klatek wideo H.264 przy CRF 44. Nawet pięć obrazów treningowych poprawiło jakość w stosunku do skompresowanego podstawowego wideo, przy czym wyniki poprawiały się stopniowo wraz ze wzrostem liczby klatek.
Testy jakościowe
W wynikach poniżej, w fazie jakościowej testów, widzimy silnie skompresowane klatki wideo H.264 przy CRF 44 z odpowiadającym im wyjściem FSFVE:

Porównanie silnie skompresowanych klatek wideo H.264 przy CRF 44 z odpowiadającym im wyjściem FSFVE. Ulepszone wyniki, jak twierdzi artykuł, redukują artefakty kompresji, przywracają strukturę twarzy i produkują gładką, bardziej naturalną skórę, zachowując tożsamość i wyraz twarzy. Proszę odnieść się do oryginalnego pliku PDF i wideo dla lepszych przykładów.
Autorzy twierdzą, że skompresowane obrazy wykazują wyraźne artefakty wokół oczu, nosa i ust, wraz z nienaturalnie teksturą skórą i zniekształceniami w cechach twarzy, podczas gdy ulepszone wyniki znacznie redukują te wady:
‘W pierwszym przykładzie oczy wydają się niejasne, a czarna farba do rzęs łączy się z kolorem oczu. Są wyraźne oznaki aliasingu z ustami. Brwi nie mają wyraźnych krawędzi, a skóra wydaje się zniekształcona. W drugim przykładzie skóra jest silnie teksturą z artefaktami punktowymi.
‘Są artefakty blokowania poniżej ust, które zmieniają kształt brody. Pojawiają się również linie pionowe.
‘Nasz model jest w stanie naprawić te artefakty, generując wizualnie przyjemne wyjście z jaśniejszą skórą i przywracając niektóre z drobnych szczegółów, które zostały utracone w kompresji.
‘Co ważne, ulepszone wyjście pozostaje wiernym odwzorowaniem tożsamości w wideo.’
Wnioski
Wygląda na to, że te ciągłe wysiłki w przemyśle i akademii w celu poprawy jakości danych wideorozmów o niskim sygnale w końcu zderzą się z przeciwnymi wysiłkami w celu wykrywania fałszywych filmów wideo w wideorozmowach.
Ponieważ, jak zauważa nowy artykuł, systemy pośrednie, takie jak FSFVE, mogą być legalnie stosowane do strumieni wideo rozmów za pośrednictwem oficjalnych API, możliwe, że nieprzetworzone treści pozostaną dostępne do użycia przez środki przeciwko głębokim fałszerstwom, gdy staną się one bardziej istotne.
* Określony w nowym artykule jako zestaw danych ‘DeepFakeDetector’, chociaż nie wydaje się, aby był znany pod tą nazwą, nawet w artykule FaceForensics++ do którego autorzy odnoszą się w tym kontekście.
Pierwotnie opublikowany we wtorek, 14 lipca 2026












