Погляд Anderson
Виправлення розмитих відеодзвінків в реальному часі за допомогою лише CPU

Новий метод створює модель AI вашого обличчя за кілька секунд, щоб виправити розмиті відеодзвінки в реальному часі – працюючи повністю на базовому ноутбучному процесорі, без потреби в потужному апаратному забезпеченні або обробці в хмарі.
Хоча користувачі в країнах з обмеженими ресурсами найбільше постраждали від низької якості відеозв’язку, це часто проблема “першого світу” – наприклад, якщо один з учасників розмови використовує перевантажену точку доступу Wi-Fi або інший процес або особа в домогосподарстві учасника домінує над доступною смугою пропускання; або навіть якщо ця особа відвідує країну з поганою зв’язністю.
Оскільки проблема поширена, певна кількість уваги була приділена їй у науковій літературі, з запропонованими рішеннями через деблокування, денойзинг, супер-розрішення та інші методи. Система VQFR з 2022 року відновлює погіршені обличчя, заміняючи низькоякісні особливості зображення на вищої якості представлення, отримані з навченої кодової книги; GFP-GAN 2021 року використовує генеративні обличчя передові для покращення низькоякісних зображень; і RTFVE: Реальне покращення відео обличчя використовує високоякісні зображення для відновлення обличчя:
Натисніть, щоб відтворити, якщо необхідно. З проекту покращення обличчя RTFVE 2025 року, покращення обличчя за допомогою GPU. Джерело
З точки зору користувача з обмеженими ресурсами, більшість цих рішень не є життєздатними, оскільки вони передають роботу на GPU, який може не бути доступний у цьому користувача. Однак використання (значно менш здатного) CPU для завдань комп’ютерного бачення зазвичай є офлайн-процесом, тобто користувачеві потрібно чекати, поки CPU закінчить обробку, перш ніж вивід буде доступний.
Це є неприйнятним для сценарію відеозв’язку, який є ресурсоємним, але часто також ресурсозбідненим: будь-яка справедлива система покращення обличчя повинна працювати на CPU щонайменше з частотою 24 кадрів в секунду при прийнятній роздільній здатності; і це багато чого просити.
Виправлення обличчя
Цей вимогливий сценарій задовольняється новим науковим пропозиціям з США, яке, як стверджують автори, здатне тренувати модель менш ніж за 100 секунд з розріджених кадрів обличчя глядача, а потім працювати як проміжний шар між користувачем і конференцією через офіційні API-шари в застосунках відеоконференцій, таких як Zoom:
Натисніть, щоб відтворити, якщо необхідно. З сторінки проекту FSFVE, зразки покращення обличчя в сценарії веб-камери, використовуючи легку (3,5 МБ) модель, треновану менш ніж за дві хвилини. Джерело
У статті зазначається:
‘Модель FSFVE може бути тренована або просто перед відеодзвінком, або на початку дзвінка. Потрібні лише кілька високоякісних зображень об’єкта; наприклад, 5-30 зображень, що робить це навчання з декількома зразками. Прямо перед дзвінком або на початку дзвінка можна отримати кілька секунд високоякісного відео користувача; наприклад, 3 секунди, що дає 3∗24=72 кадри при частоті 24 кадрів в секунду (FPS).
‘Це високоякісне відео можна швидко перекодувати в низькоякісне відео на основі налаштувань для відеодзвінка, а потім з низькоякісними та високоякісними кадрами модель тренується.’
Однією з помітних особливостей нової системи є її гнучкість щодо того, хто “платить” за обробку моделі; якщо сам глядач по якійсь причині не може забезпечити потужність CPU для тренування, це можна передати кореспонденту, надсилаючи невелику кількість високоякісних кадрів, а модель тренується “віддалено” для користувача з обмеженими ресурсами.
Альтернативно, тренування можна систематично передати на сервер для тренування. Автори відзначають:
‘Сервер можна використовувати в тих випадках, коли пристрої відправлення та прийому занадто повільні для тренування (або навіть якщо ні, щоб звільнити їх від завдання).
‘В будь-якому випадку розмір моделі відносно малий (близько 3,5 МБ), як і кілька високоякісних кадрів, і після завершення тренування модель може працювати в реальному часі на типовому ноутбучному CPU.’
У тестах, з моделями, тренованими проти базових ліній та попередніх робіт (включаючи зазначений вище RTFVE, який є основою для нової роботи), FSFVE постійно перевершував незмінене стиснуте відео, оптимізовану для CPU легку ResNet і модифіковану модель RTFVE-0, при цьому все ще працюючи в реальному часі на CPU.
Нова стаття називається FSFVE: Покращення стисненого відео обличчя з декількома зразками, і супроводжується демо і репозиторій GitHub.
Метод
FSFVE був тренований на відкритій колекції FaceForensics++*, яка складається з 363 відео 1080p акторів, що говорять, з яких автори витягли категорію говоріння проти стіни, як найближчу до типового відеодзвінка:
Натисніть, щоб відтворити, якщо необхідно. Приклади з колекції FaceForensics++. Джерело
Ця підмножина складається з 27 відео довжиною близько 972 кадрів кожне – в основному фронтальні види, але, необхідні, деякі бічні види також.
Для генерації низькоякісних відео, призначених для симуляції проблем з’єднання відеодзвінка, автори стиснули колекцію даних за допомогою відеокодеків H264 і H265. Рівні стиснення встановлювалися в діапазоні CRF від 36 до 44 (вважаючи, що нуль – без втрат, а 51 – дуже блоковий).
Кожен кадр обрізався до регіону 256 × 256 навколо обличчя за допомогою детектора обличчя BlazeFace, після чого ключові точки обличчя використовувалися для вирівнювання обличчя шляхом визначення очей та застосування афінного перетворення (яке обертає, масштабує та зміщує обличчя в постійне положення), так що очі залишаються на одному рівні та в приблизно одному положенні на всіх кадрах.
Це було здійснено за допомогою бібліотеки розпізнавання обличчя:

Приклад витягування ліній обличчя з зображення за допомогою бібліотеки розпізнавання обличчя Python. Джерело
Оскільки модель призначена для навчання лише з декількох кадрів одного відеодзвінка, кадри тренування повинні були захопити якомога більше варіацій обличчя. Тому було використано кластеризацію k-means замість простіших методів відбору (наприклад, випадковий вибір або фіксовані інтервали).
Кожен обрізаний і вирівняний кадр передавався через зазначений вище кодувальник обличчя RTFVE для генерації числового представлення, після чого кластеризація k-means згрупувала подібні кадри в 30 кластерів. Процес кластеризації повторювався п’ять разів, щоб отримати найкращу групу, а кадр, найближчий до центру кластера, був вибраний для тренування. Цей процес дав розмаїтний набір з 30 зображень для кожного відео.
Тренування та тести
Моделі тренувалися протягом 100 епох, що досить мало, враховуючи дуже малу кількість зображень, задіяних у процесі. Однак, як відзначають автори, перетренована модель насправді бажана в цьому сценарії, навіть якщо вона не може захопити всі можливі події, такі як незвичайні вирази обличчя, пози чи приховування/затьмарення особливостей обличчя. Пріоритети полягають у помірній гнучкості в генералізації та швидкості тренування.
Було використано оптимізатор RAdam з швидкістю навчання 10-4.
Для початкових тестів система порівнювалася з оригінальним стисненим відео; легкою ResNet, оптимізованою для реального часу на CPU; і зазначеним вище RTFVE – єдиною іншою системою покращення обличчя в реальному часі на CPU.
Для забезпечення справедливого порівняння RTFVE був модифікований для видалення залежності від високоякісних зображень під час висновку, зберігаючи при цьому подібну швидкість і кількість параметрів, що дало варіант під назвою RTFVE-0. Моделі ResNet і RTFVE-0 тренувалися за допомогою функції втрат L1. Для забезпечення справедливого порівняння всі моделі використовували один і той же оптимізатор RAdam та налаштування тренування, з окремим екземпляром моделі, тренованої з 30 кадрів для кожного відео.
Для прискорення тренування було введено спеціальну частотно-доменну фокусуючу втрату (яка надає більший ваговий коефіцієнт найбільш візуально важливим деталям зображення під час тренування), щоб надати більший ваговий коефіцієнт низькочастотним компонентам DCT (інформація зображення після перетворення у частотні значення), які мають найбільший вплив на сприйману якість зображення.
Ваговий коефіцієнт був отриманий з матриці квантування яскравості JPEG, що змусило модель пріоритезувати найбільш візуально важливі структури зображення під час тренування.
Кількісні тести
Були виміряні як технічна точність відтворення (спотворення), так і сприйману візуальну якість. Спотворення вимірювалося за допомогою пікової частоти сигналу до шуму (PSNR) і індексу подібності структур (SSIM); а сприймана якість – за допомогою вченої перцептивної подібності патчів зображення (LPIPS):
Виконання FSFVE проти оригінального стисненого відео, оптимізованої для CPU ResNet і модифікованої RTFVE-0 через відео H.264 і H.265 на трьох рівнях стиснення, з вищим PSNR і SSIM, що вказує на кращу якість відтворення, і нижчою LPIPS, що вказує на кращу перцептивну якість.
FSFVE постійно перевершував як оригінальне стиснене відео, так і інші моделі покращення обличчя на CPU, на всіх рівнях стиснення.
З відео H.264 PSNR збільшувався на 1,11 дБ, 1,37 дБ і 1,51 дБ над базовим рівнем при значеннях CRF 36, 40 і 44, з відповідними покращеннями в SSIM і нижчими оцінками LPIPS на двох вищих рівнях стиснення (що вказує на кращу сприйману якість зображення).
Аналогічні результати були отримані з відео H.265, що свідчить про те, що підхід залишається ефективним і з обома основними відеокодеками. Як показано нижче, покращення стало більш вираженим при збільшенні рівня стиснення, що вказує на те, що метод працював особливо добре в умовах низької смуги пропускання, з яких він був розроблений:

PSNR при збільшенні бітрейту для оригінального відео H.264 і покращеного виводу. Розширення розриву при нижчих бітрейтах показує, що FSFVE забезпечує найбільші здобутки якості під найжорсткішими умовами стиснення.
Оптимізована для CPU ResNet і RTFVE-0 забезпечили лише скромні покращення над стисненим базовим рівнем, тоді як FSFVE перевершив обидва більш ніж на 1,1 дБ, зберігаючи при цьому реальне виконання в 30,24 кадрах в секунду, незважаючи на наявність лише близько одного мільйона параметрів.
Як показано нижче, виконання покращувалося поступово при збільшенні кількості кадрів тренування. Навіть з лише п’ятьма кадрами тренування FSFVE покращив PSNR на понад 0,75 дБ над стисненим базовим рівнем, тоді як десять кадрів тренування були достатніми, щоб перевершити покращення на 1 дБ – що вказує на те, що підхід залишається ефективним навіть з дуже обмеженою кількістю тренувальних даних:

Вплив розміру набору тренування на PSNR для невидимих кадрів відео H.264 при CRF 44. Навіть п’ять кадрів тренування покращили якість над стисненим базовим рівнем, з поступовим збільшенням виконання при наявності більшої кількості кадрів.
Якість тестів
У результаті якості тестування ми бачимо сильно стиснуті кадри відео H.264 на рівні стиснення 44 з відповідним виводом FSFVE:

Порівняння сильно стиснутих кадрів відео H.264 на рівні стиснення 44 з відповідним виводом FSFVE. Покращений вивід, як стверджує стаття, зменшує артефакти стиснення, відновлює структуру обличчя і створює більш гладку, природню шкіру, зберігаючи при цьому ідентичність і вираз обличчя суб’єкта. Будь ласка, зверніться до джерела PDF і оригінальних відео для кращих прикладів.
Автори стверджують, що стиснуті зображення демонструють помітні артефакти навколо очей, носа і рота, разом з нерівною текстурою шкіри і спотвореннями особливостей обличчя, тоді як покращений вивід суттєво зменшує ці дефекти:
‘У першому прикладі очі виглядають нечітко, з чорним кольором олівців для очей, що зливається з кольором очей. Є явні ознаки аліасингу з губами. Брови не мають чіткого визначення, а шкіра виглядає спотвореною. У другому прикладі шкіра дуже текстурна з артефактами.
‘Є блокові артефакти під ротом, які змінюють форму підборіддя. Там також є вертикальні лінії.
‘Наша модель能够 виправити ці артефакти, генеруючи візуально привабливий вивід з чистішою шкірою і відновленням деяких тонких деталей, які були втрачені під час стиснення.
‘Важливо, що покращений вивід залишається вірним ідентичності у відео.’
Висновок
Здається, що ці триваючі зусилля в галузі та академії з підвищення якості відеодзвінків з низьким сигналом в кінцевому підсумі зіштнуться з протилежними зусиллями з виявленням фальшивих відеодзвінків.
Оскільки, як зазначено в новій статті, проміжні системи, такі як FSFVE, можуть бути законно застосовані до потоків відеозв’язку через офіційні API, можливо, що неопрацьований вміст залишиться доступним для використання анти-DeepFake заходами, оскільки вони з’являються – і становляться все більш важливими.
* Відноситься до нової статті як набір даних ‘DeepFakeDetector’, хоча він не здається відомим під цією назвою, навіть всередині статті FaceForensics++, на яку посилаються автори в цьому відношенні.
Перша публікація – вівторок, 14 липня 2026












