Andersonův úhel

Oprava rozmazaných videohovorů v reálném čase pomocí pouze CPU

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Partially AI-generated image. Overlaid in front, a before and after comparison of CPU-only facial improvement for the paper FSFVE: Few Shot Compressed Face Video Enhancement; behind, a generic illustration from GPT-2 expressing the idea of an AI model 'up-rezzing' a poor video chat avatar.

Nová metoda vytváří model vaší tváře za sekundy, aby opravila rozmazané videohovory v reálném čase – běží zcela na základním laptopu CPU, bez potřeby výkonného hardwaru nebo cloudového zpracování.

 

Přestože uživatelé v zemích s omezenými zdroji jsou nejvíce postiženi nízkou kvalitou obrazu videohovorů, je to často také “první světový” problém – například, pokud jeden z účastníků hovoru používá přetížený Wi-Fi hotspot, nebo pokud jiný proces nebo osoba v domácnosti účastníka dominuje dostupnou šířkou pásma; nebo dokonce, pokud osoba navštíví zemi s nízkou konektivitou.

Pokud je problém běžný, byla věnována určitá pozornost tomuto problému v literatuře, s navrhovanými řešeními prostřednictvím deblocking, denoising, super-resolution a dalších metod. Systém VQFR z roku 2022 obnovuje poškozené obličeje nahrazováním nízkokvalitních obrazových funkcí vyššími kvalitativními reprezentacemi získanými z naučené knihovny; v roce 2021 GFP-GAN využívá generativní obličejové priority ke zlepšení obrazů s nízkou kvalitou; a RTFVE: Realtime Face Video Enhancement používá vysoké kvalitní referenční obrázky k obnovení obličeje:

Kliknutím se spustí, pokud je necessário. Z projektu RTFVE pro zlepšení obličeje z roku 2025, GPU-urychlené zlepšení obličeje. Zdroj

Z pohledu uživatele s omezenými zdroji nejsou většina těchto řešení proveditelná, protože offloadují práci na GPU, které nemusí být k dispozici v nastavení uživatele. Nicméně, použití (mnohem méně schopného) CPU pro úkoly počítačového vidění je obvykle offline proces, což znamená, že byste museli čekat, až CPU dokončí zpracování, než by byl výstup k dispozici.

To je nepřijatelné pro scénář videohovoru, který je náročný na zdroje, ale často také trpí nedostatkem zdrojů: skutečně demokratický systém pro zlepšení obličeje by musel běžet na CPU minimálně 24fps při rozumném rozlišení; a to je mnoho, co se žádá.

Vyřešení

Tento náročný scénář je splněn novým výzkumným příspěvkem z USA, který je podle autorů schopen trénovat model za méně než 100 sekund z řídkých snímků obličeje diváka, s konečným modelem, který běží jako mezivrstva mezi uživatelem a konferencí, prostřednictvím oficiálních API vrstev v aplikacích pro videohovory, jako je Zoom:

Kliknutím se spustí, pokud je nutné. Z projektové stránky FSFVE, ukázky zlepšení obličeje ve scénáři webové kamery, pomocí lehkého (3,5 MB) modelu trénovaného za méně než dvě minuty. Zdroj

Článek uvádí:

‘Model FSFVE lze trénovat buď krátce před videohovorem, nebo na začátku hovoru. Jsou vyžadovány pouze několik vysoce kvalitních obrázků subjektu; například 5 až 30 obrázků, což je málo-shot učení. Krátce před hovorem nebo na začátku hovoru lze získat několik sekund vysoce kvalitního videa uživatele; například 3 sekundy, poskytující 324=72 snímky při frame rate 24 snímků za sekundu (FPS).

‘Toto vysoce kvalitní video lze rychle zakódovat do nízkokvalitního videa na základě nastavení pro videohovor, a poté s nízkokvalitními a vysoce kvalitními snímky je model trénován.’

Jednou z pozoruhodných funkcí nového systému je jeho flexibilita v ohledu na to, kdo “platí” za zpracování modelu; pokud divák sám nemůže poskytnout CPU pro trénování, lze jej offloadovat na korespondenta, prostřednictvím odeslání několika vysoce kvalitních snímků, s modelem tak trénovaným “vzdáleně” pro uživatele s omezenými zdroji.

Alternativně lze trénování offloadovat systematicky na server pro trénování. Autoři pozorují:

‘Server lze použít pro případy, kdy jsou odesílající a přijímající zařízení příliš pomalá pro trénování (nebo i když ne, aby je zbavily úkolu).

‘V každém případě je velikost modelu relativně malá (asi 3,5 MB), stejně jako několik vysoce kvalitních snímků, a jednou, co je trénování dokončeno, může model běžet v reálném čase na typickém laptopu CPU.’

V testech, s modely trénovanými proti benchmarkům a předchozím pracím (včetně výše zmíněného RTFVE, který tvoří základ nové práce), FSFVE konzistentně překonal nezlepšené komprimované video, CPU-optimovaný ResNet a modifikovaný model RTFVE-0, zatímco stále běžel v reálném čase na CPU.

Nový článek je nazvaný FSFVE: Few Shot Compressed Face Video Enhancement a je doplněn demo a GitHub repozitářem.

Metoda

FSFVE byl trénován na otevřeném FaceForensics++ datasetu*, který se skládá z 363 videí 1080p herců, kteří mluví, z nichž autoři extrahovali kategorii “mluvící proti zdi”, jako nejbližší k typickému videohovoru:

Kliknutím se spustí, pokud je nutné. Příklady z FaceForensics++ datasetu. Zdroj 

Tato podmnožina se skládá z 27 videí o délce kolem 972 snímků každý – většinou frontální pohledy, ale nutně i některé boční pohledy.

Pro generování nízkokvalitních videí, navržených pro simulaci problémů s videohovory, autoři komprimovali dataset pomocí kodeků H264 a H265. Úrovně komprese byly nastaveny na CRF rozsah sahající 36, 40 a 44 (pokud je nula bezztrátová a 51 je extrémně bloková).

Každý snímek byl oříznut na 256 × 256 oblast kolem obličeje pomocí BlazeFace face detektoru, po kterém byly obličejové klíčové body použity k zarovnání obličeje umístěním očí a aplikací afinní transformace (která otáčí, měří a posouvá obličej do konzistentní polohy), aby zůstaly oči v rovině a přibližně ve stejné pozici ve všech snímcích.

To bylo provedeno pomocí Face Recognition knihovny:

Příklad extrakce obličejových lineamentů z obrázku pomocí Face Recognition Python knihovny. Zdroj - https://github.com/ageitgey/face_recognition

Příklad extrakce obličejových lineamentů z obrázku pomocí Face Recognition Python knihovny. Zdroj

Pokud je model navržen tak, aby se učil z pouhých několika snímků z jednoho videohovoru, jsou trénovací snímky potřebné k zachycení co největší variace obličeje. Proto byla použita k-means clustering místo jednodušších výběrových metod (tj. náhodného výběru nebo pevných intervalů).

Každý oříznutý a zarovnaný snímek byl prošel výše zmíněným RTFVE face encoderem, aby se generoval numerický údaj, po kterém k-means clustering seskupoval podobné snímky do 30 clusterů. Tento proces clusterování byl opakován pětkrát, aby se získal nejlepší seskupení, a snímek nejbližší ke každému clusteru byl vybrán pro trénování. Tento proces vyprodukoval rozmanitou sadu 30 snímků pro každé video.

Trénování a testy

Modely byly trénovány po dobu 100 epoch, což je poměrně málo, vzhledem k velmi malému počtu obrázků zapojených. Nicméně, jak autoři pozorují, přepřetrénovaný model je ve skutečnosti přijatelný v tomto scénáři, i když nemůže zachytit všechny možné události, jako jsou neobvyklé obličejové výrazy, pózy nebo skrytí/zašifrování obličejových funkcí. Prioritami jsou naopak mírná flexibilita v generalizaci a rychlost trénování.

RAdam optimalizátor byl použit při learning rate 10-4.

Pro počáteční testy byl systém srovnán s původním komprimovaným videem; lehkým ResNetem nakonfigurovaným pro reálný čas CPU inference; a výše zmíněným RTFVE – jediným jiným reálným časovým CPU systémem pro zlepšení obličeje.

Pro zajištění spravedlivého srovnání byl RTFVE modifikován, aby odstranil svou závislost na vysoce kvalitních referenčních obrazech během inference, zatímco zachoval podobnou rychlost a počet parametrů, což vedlo k variantě nazvané RTFVE-0. ResNet a RTFVE-0 modely byly trénovány pomocí L1 loss funkce. Pro zajištění spravedlivého srovnání byly všechny modely použity se stejným RAdam optimalizátorem a trénovacími nastaveními, s oddělenou instancí-specifickou modelovou trénovanou z 30 snímků pro každé video.

Pro urychlení trénování byl zaveden vlastní frekvenční doménový focal loss (který zdůrazňuje nejvíce vizuálně důležité obrazové detaily během trénování), aby se dala větší váha nízkofrekvenčním DCT komponentám (obrazové informace po konverzi do frekvenčních hodnot), které mají největší vliv na vnímanou obrazovou kvalitu.

Váhování bylo odvozeno z JPEG luminance quantization matrix, což způsobilo, že model prioritizoval nejvíce vizuálně důležité obrazové struktury během trénování.

Kvantitativní testy

Byly měřeny jak technická rekonstrukční přesnost (distorce), tak vnímaná vizuální kvalita. Distorce byla měřena pomocí Peak Signal-to-Noise Ratio (PSNR) a Structural Similarity Index (SSIM); a vnímaná kvalita pomocí Learned Perceptual Image Patch Similarity (LPIPS):

Výkon FSFVE proti původnímu komprimovanému videu, CPU-optimovanému ResNetu a modifikovanému RTFVE-0 přes H.264 a H.265 video na třech úrovních komprese, s vyšším PSNR a SSIM indikující lepší rekonstrukční kvalitu, a nižší LPIPS indikující lepší vnímanou kvalitu.

Výkon FSFVE proti původnímu komprimovanému videu, CPU-optimovanému ResNetu a modifikovanému RTFVE-0 přes H.264 a H.265 video na třech úrovních komprese, s vyšším PSNR a SSIM indikující lepší rekonstrukční kvalitu, a nižší LPIPS indikující lepší vnímanou kvalitu.

FSFVE konzistentně překonal obě původní komprimované video, jakož i soutěžící CPU-založené vylepšovací modely, napříč všemi úrovněmi komprese.

S H.264 videem se PSNR zvýšil o 1,11 dB, 1,37 dB a 1,51 dB nad benchmarkem při CRF hodnotách 36, 40 a 44, s odpovídajícími zlepšeními v SSIM a nižšími LPIPS skóre při dvou vyšších úrovních komprese (indikující lepší vnímanou kvalitu).

Podobné zisky byly zaznamenány s H.265, což naznačuje, že přístup zůstává efektivní napříč oběma hlavními video kodeky. Jak je ukázáno níže, zlepšení se stalo více výrazným, jak se komprese zvýšila, což indikuje, že metoda fungovala besonders dobře za podmínek s nízkou šířkou pásma, pro které byla navržena:

PSNR jako bitrate se zvyšuje pro původní H.264 video a vylepšený výstup. Rozšiřující se mezera při nižších bitratech ukazuje, že FSFVE dodává největší kvalitativní zisky za podmínek s nízkou šířkou pásma.

PSNR jako bitrate se zvyšuje pro původní H.264 video a vylepšený výstup. Rozšiřující se mezera při nižších bitratech ukazuje, že FSFVE dodává největší kvalitativní zisky za podmínek s nízkou šířkou pásma.

CPU-optimovaný ResNet a RTFVE-0 poskytly pouze skromná zlepšení nad komprimovaným benchmarkem, zatímco FSFVE překonal oba o více než 1,1 dB, zatímco udržoval reálný časový výkon při 30,24 FPS, navzdory tomu, že obsahuje kolem jednoho milionu parametrů.

Jak je ukázáno níže, výkon se zlepšoval postupně, jak se zvyšoval počet trénovacích snímků. I s pouhými pěti trénovacími snímky FSFVE zlepšil PSNR o více než 0,75 dB nad komprimovaným benchmarkem, zatímco deset trénovacích snímků bylo dostatečné k překročení zlepšení o 1 dB – což indikuje, že přístup zůstává efektivní i s velmi omezenými trénovacími daty:

Vliv velikosti trénovací sady na PSNR pro neviditelné H.264 video snímky při CRF 44. I pět trénovacích snímků zlepšilo kvalitu nad komprimovaným benchmarkem, s výkonem se zvyšujícím, jak bylo k dispozici více snímků.

Vliv velikosti trénovací sady na PSNR pro neviditelné H.264 video snímky při CRF 44. I pět trénovacích snímků zlepšilo kvalitu nad komprimovaným benchmarkem, s výkonem se zvyšujícím, jak bylo k dispozici více snímků.

Kvalitativní testy

V následujících výsledcích, pro kvalitativní fázi testování, vidíme silně komprimované H.264 video snímky při CRF 44 s odpovídajícím FSFVE výstupem:

Srovnání silně komprimovaných H.264 video snímků při CRF 44 s odpovídajícím FSFVE výstupem. Vylepšené výsledky, podle článku, snižují kompresní artefakty, obnovují obličejovou strukturu a produkují hladčí, přirozenější kůži, zatímco zachovávají identitu a výraz subjektu. Prosím, odkážete se na zdroj PDF a původní videa pro lepší příklady.

Srovnání silně komprimovaných H.264 video snímků při CRF 44 s odpovídajícím FSFVE výstupem. Vylepšené výsledky, podle článku, snižují kompresní artefakty, obnovují obličejovou strukturu a produkují hladší, přirozenější kůži, zatímco zachovávají identitu a výraz subjektu. Prosím, odkážete se na zdroj PDF a původní videa pro lepší příklady.

Autoři uvádějí:

‘V prvním příkladu jsou oči nejasné s černou barvou oční linky, která se mísí s barvou očí. Jsou zde zřejmé známky aliasingu s rty. Obočí postrádá definici a kůže vypadá zkreslená. Ve druhém příkladu je kůže silně texturována se skvrnami.

‘Jsou zde blokovací artefakty pod ústy, které mění tvar brady. Jsou zde také viditelné vertikální linie.

‘Náš model je schopen odstranit tyto artefakty a vygenerovat vizuálně příjemný výstup s jasnější kůží a obnovit některé jemné detaily, které byly ztraceny během komprese.

‘Důležité je, že vylepšený výstup zůstává věrný identitě ve videu.’

Závěr

Zdá se, že tyto pokračující úsilí v průmyslu a akademii o zvýšení kvality nízkokvalitních videohovorových dat budou nakonec narazit na opačné úsilí o identifikaci deepfake videa v videohovorech.

Pokud, jak uvádí nový článek, mezivrstvé systémy, jako je FSFVE, lze legitimně aplikovat na videohovorové proudy prostřednictvím oficiálních API, je možné, že neupravený obsah zůstane k dispozici pro použití protideepfake opatřeními, jakmile se objeví – a stávají se důležitějšími.

 

* Referred to in the new paper as the ‘DeepFakeDetector’ dataset, though it does not appear to be known by this name, even inside the FaceForensics++ paper that the authors link to in this regard.

První zveřejnění úterý, 14. července 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai