Погляд Anderson

Виправлення розмитих відеодзвінків в реальному часі за допомогою лише CPU

mm
Додайте Unite.AI до бажаних джерел у Google
Partially AI-generated image. Overlaid in front, a before and after comparison of CPU-only facial improvement for the paper FSFVE: Few Shot Compressed Face Video Enhancement; behind, a generic illustration from GPT-2 expressing the idea of an AI model 'up-rezzing' a poor video chat avatar.

Новий метод створює модель AI вашого обличчя за кілька секунд, щоб виправити розмиті відеодзвінки в реальному часі – працюючи повністю на базовому ноутбучному процесорі, без потреби в потужному апаратному забезпеченні або обробці в хмарі.

 

Хоча користувачі в країнах з обмеженими ресурсами найбільше постраждали від низької якості відеозв’язку, це часто проблема “першого світу” – наприклад, якщо один з учасників розмови використовує перевантажену точку доступу Wi-Fi або інший процес або особа в домогосподарстві учасника домінує над доступною смугою пропускання; або навіть якщо ця особа відвідує країну з поганою зв’язністю.

Оскільки проблема поширена, певна кількість уваги була приділена їй у науковій літературі, з запропонованими рішеннями через деблокування, денойзинг, супер-розрішення та інші методи. Система VQFR з 2022 року відновлює погіршені обличчя, заміняючи низькоякісні особливості зображення на вищої якості представлення, отримані з навченої кодової книги; GFP-GAN 2021 року використовує генеративні обличчя передові для покращення низькоякісних зображень; і RTFVE: Реальне покращення відео обличчя використовує високоякісні зображення для відновлення обличчя:

Натисніть, щоб відтворити, якщо необхідно. З проекту покращення обличчя RTFVE 2025 року, покращення обличчя за допомогою GPU. Джерело

З точки зору користувача з обмеженими ресурсами, більшість цих рішень не є життєздатними, оскільки вони передають роботу на GPU, який може не бути доступний у цьому користувача. Однак використання (значно менш здатного) CPU для завдань комп’ютерного бачення зазвичай є офлайн-процесом, тобто користувачеві потрібно чекати, поки CPU закінчить обробку, перш ніж вивід буде доступний.

Це є неприйнятним для сценарію відеозв’язку, який є ресурсоємним, але часто також ресурсозбідненим: будь-яка справедлива система покращення обличчя повинна працювати на CPU щонайменше з частотою 24 кадрів в секунду при прийнятній роздільній здатності; і це багато чого просити.

Виправлення обличчя

Цей вимогливий сценарій задовольняється новим науковим пропозиціям з США, яке, як стверджують автори, здатне тренувати модель менш ніж за 100 секунд з розріджених кадрів обличчя глядача, а потім працювати як проміжний шар між користувачем і конференцією через офіційні API-шари в застосунках відеоконференцій, таких як Zoom:

Натисніть, щоб відтворити, якщо необхідно. З сторінки проекту FSFVE, зразки покращення обличчя в сценарії веб-камери, використовуючи легку (3,5 МБ) модель, треновану менш ніж за дві хвилини. Джерело

У статті зазначається:

‘Модель FSFVE може бути тренована або просто перед відеодзвінком, або на початку дзвінка. Потрібні лише кілька високоякісних зображень об’єкта; наприклад, 5-30 зображень, що робить це навчання з декількома зразками. Прямо перед дзвінком або на початку дзвінка можна отримати кілька секунд високоякісного відео користувача; наприклад, 3 секунди, що дає 324=72 кадри при частоті 24 кадрів в секунду (FPS).

‘Це високоякісне відео можна швидко перекодувати в низькоякісне відео на основі налаштувань для відеодзвінка, а потім з низькоякісними та високоякісними кадрами модель тренується.’

Однією з помітних особливостей нової системи є її гнучкість щодо того, хто “платить” за обробку моделі; якщо сам глядач по якійсь причині не може забезпечити потужність CPU для тренування, це можна передати кореспонденту, надсилаючи невелику кількість високоякісних кадрів, а модель тренується “віддалено” для користувача з обмеженими ресурсами.

Альтернативно, тренування можна систематично передати на сервер для тренування. Автори відзначають:

‘Сервер можна використовувати в тих випадках, коли пристрої відправлення та прийому занадто повільні для тренування (або навіть якщо ні, щоб звільнити їх від завдання).

‘В будь-якому випадку розмір моделі відносно малий (близько 3,5 МБ), як і кілька високоякісних кадрів, і після завершення тренування модель може працювати в реальному часі на типовому ноутбучному CPU.’

У тестах, з моделями, тренованими проти базових ліній та попередніх робіт (включаючи зазначений вище RTFVE, який є основою для нової роботи), FSFVE постійно перевершував незмінене стиснуте відео, оптимізовану для CPU легку ResNet і модифіковану модель RTFVE-0, при цьому все ще працюючи в реальному часі на CPU.

Нова стаття називається FSFVE: Покращення стисненого відео обличчя з декількома зразками, і супроводжується демо і репозиторій GitHub.

Метод

FSFVE був тренований на відкритій колекції FaceForensics++*, яка складається з 363 відео 1080p акторів, що говорять, з яких автори витягли категорію говоріння проти стіни, як найближчу до типового відеодзвінка:

Натисніть, щоб відтворити, якщо необхідно. Приклади з колекції FaceForensics++. Джерело

Ця підмножина складається з 27 відео довжиною близько 972 кадрів кожне – в основному фронтальні види, але, необхідні, деякі бічні види також.

Для генерації низькоякісних відео, призначених для симуляції проблем з’єднання відеодзвінка, автори стиснули колекцію даних за допомогою відеокодеків H264 і H265. Рівні стиснення встановлювалися в діапазоні CRF від 36 до 44 (вважаючи, що нуль – без втрат, а 51 – дуже блоковий).

Кожен кадр обрізався до регіону 256 × 256 навколо обличчя за допомогою детектора обличчя BlazeFace, після чого ключові точки обличчя використовувалися для вирівнювання обличчя шляхом визначення очей та застосування афінного перетворення (яке обертає, масштабує та зміщує обличчя в постійне положення), так що очі залишаються на одному рівні та в приблизно одному положенні на всіх кадрах.

Це було здійснено за допомогою бібліотеки розпізнавання обличчя:

Приклад витягування ліній обличчя з зображення за допомогою бібліотеки розпізнавання обличчя Python. Джерело - https://github.com/ageitgey/face_recognition

Приклад витягування ліній обличчя з зображення за допомогою бібліотеки розпізнавання обличчя Python. Джерело

Оскільки модель призначена для навчання лише з декількох кадрів одного відеодзвінка, кадри тренування повинні були захопити якомога більше варіацій обличчя. Тому було використано кластеризацію k-means замість простіших методів відбору (наприклад, випадковий вибір або фіксовані інтервали).

Кожен обрізаний і вирівняний кадр передавався через зазначений вище кодувальник обличчя RTFVE для генерації числового представлення, після чого кластеризація k-means згрупувала подібні кадри в 30 кластерів. Процес кластеризації повторювався п’ять разів, щоб отримати найкращу групу, а кадр, найближчий до центру кластера, був вибраний для тренування. Цей процес дав розмаїтний набір з 30 зображень для кожного відео.

Тренування та тести

Моделі тренувалися протягом 100 епох, що досить мало, враховуючи дуже малу кількість зображень, задіяних у процесі. Однак, як відзначають автори, перетренована модель насправді бажана в цьому сценарії, навіть якщо вона не може захопити всі можливі події, такі як незвичайні вирази обличчя, пози чи приховування/затьмарення особливостей обличчя. Пріоритети полягають у помірній гнучкості в генералізації та швидкості тренування.

Було використано оптимізатор RAdam з швидкістю навчання 10-4.

Для початкових тестів система порівнювалася з оригінальним стисненим відео; легкою ResNet, оптимізованою для реального часу на CPU; і зазначеним вище RTFVE – єдиною іншою системою покращення обличчя в реальному часі на CPU.

Для забезпечення справедливого порівняння RTFVE був модифікований для видалення залежності від високоякісних зображень під час висновку, зберігаючи при цьому подібну швидкість і кількість параметрів, що дало варіант під назвою RTFVE-0. Моделі ResNet і RTFVE-0 тренувалися за допомогою функції втрат L1. Для забезпечення справедливого порівняння всі моделі використовували один і той же оптимізатор RAdam та налаштування тренування, з окремим екземпляром моделі, тренованої з 30 кадрів для кожного відео.

Для прискорення тренування було введено спеціальну частотно-доменну фокусуючу втрату (яка надає більший ваговий коефіцієнт найбільш візуально важливим деталям зображення під час тренування), щоб надати більший ваговий коефіцієнт низькочастотним компонентам DCT (інформація зображення після перетворення у частотні значення), які мають найбільший вплив на сприйману якість зображення.

Ваговий коефіцієнт був отриманий з матриці квантування яскравості JPEG, що змусило модель пріоритезувати найбільш візуально важливі структури зображення під час тренування.

Кількісні тести

Були виміряні як технічна точність відтворення (спотворення), так і сприйману візуальну якість. Спотворення вимірювалося за допомогою пікової частоти сигналу до шуму (PSNR) і індексу подібності структур (SSIM); а сприймана якість – за допомогою вченої перцептивної подібності патчів зображення (LPIPS):

Виконання FSFVE проти оригінального стисненого відео, оптимізованої для CPU ResNet і модифікованої RTFVE-0 через відео H.264 і H.265 на трьох рівнях стиснення, з вищим PSNR і SSIM, що вказує на кращу якість відтворення, і нижчою LPIPS, що вказує на кращу перцептивну якість.

Виконання FSFVE проти оригінального стисненого відео, оптимізованої для CPU ResNet і модифікованої RTFVE-0 через відео H.264 і H.265 на трьох рівнях стиснення, з вищим PSNR і SSIM, що вказує на кращу якість відтворення, і нижчою LPIPS, що вказує на кращу перцептивну якість.

FSFVE постійно перевершував як оригінальне стиснене відео, так і інші моделі покращення обличчя на CPU, на всіх рівнях стиснення.

З відео H.264 PSNR збільшувався на 1,11 дБ, 1,37 дБ і 1,51 дБ над базовим рівнем при значеннях CRF 36, 40 і 44, з відповідними покращеннями в SSIM і нижчими оцінками LPIPS на двох вищих рівнях стиснення (що вказує на кращу сприйману якість зображення).

Аналогічні результати були отримані з відео H.265, що свідчить про те, що підхід залишається ефективним і з обома основними відеокодеками. Як показано нижче, покращення стало більш вираженим при збільшенні рівня стиснення, що вказує на те, що метод працював особливо добре в умовах низької смуги пропускання, з яких він був розроблений:

PSNR при збільшенні бітрейту для оригінального відео H.264 і покращеного виводу. Розширення розриву при нижчих бітрейтах показує, що FSFVE забезпечує найбільші здобутки якості під найжорсткішими умовами стиснення.

PSNR при збільшенні бітрейту для оригінального відео H.264 і покращеного виводу. Розширення розриву при нижчих бітрейтах показує, що FSFVE забезпечує найбільші здобутки якості під найжорсткішими умовами стиснення.

Оптимізована для CPU ResNet і RTFVE-0 забезпечили лише скромні покращення над стисненим базовим рівнем, тоді як FSFVE перевершив обидва більш ніж на 1,1 дБ, зберігаючи при цьому реальне виконання в 30,24 кадрах в секунду, незважаючи на наявність лише близько одного мільйона параметрів.

Як показано нижче, виконання покращувалося поступово при збільшенні кількості кадрів тренування. Навіть з лише п’ятьма кадрами тренування FSFVE покращив PSNR на понад 0,75 дБ над стисненим базовим рівнем, тоді як десять кадрів тренування були достатніми, щоб перевершити покращення на 1 дБ – що вказує на те, що підхід залишається ефективним навіть з дуже обмеженою кількістю тренувальних даних:

Вплив розміру набору тренування на PSNR для невидимих кадрів відео H.264 при CRF 44. Навіть п'ять кадрів тренування покращили якість над стисненим базовим рівнем, з поступовим збільшенням виконання при наявності більшої кількості кадрів.

Вплив розміру набору тренування на PSNR для невидимих кадрів відео H.264 при CRF 44. Навіть п’ять кадрів тренування покращили якість над стисненим базовим рівнем, з поступовим збільшенням виконання при наявності більшої кількості кадрів.

Якість тестів

У результаті якості тестування ми бачимо сильно стиснуті кадри відео H.264 на рівні стиснення 44 з відповідним виводом FSFVE:

Порівняння сильно стиснутих кадрів відео H.264 на рівні стиснення 44 з відповідним виводом FSFVE. Покращений вивід, як стверджує стаття, зменшує артефакти стиснення, відновлює структуру обличчя і створює більш гладку, природню шкіру, зберігаючи при цьому ідентичність і вираз обличчя суб'єкта. Будь ласка, зверніться до джерела PDF і оригінальних відео для кращих прикладів.

Порівняння сильно стиснутих кадрів відео H.264 на рівні стиснення 44 з відповідним виводом FSFVE. Покращений вивід, як стверджує стаття, зменшує артефакти стиснення, відновлює структуру обличчя і створює більш гладку, природню шкіру, зберігаючи при цьому ідентичність і вираз обличчя суб’єкта. Будь ласка, зверніться до джерела PDF і оригінальних відео для кращих прикладів.

Автори стверджують, що стиснуті зображення демонструють помітні артефакти навколо очей, носа і рота, разом з нерівною текстурою шкіри і спотвореннями особливостей обличчя, тоді як покращений вивід суттєво зменшує ці дефекти:

‘У першому прикладі очі виглядають нечітко, з чорним кольором олівців для очей, що зливається з кольором очей. Є явні ознаки аліасингу з губами. Брови не мають чіткого визначення, а шкіра виглядає спотвореною. У другому прикладі шкіра дуже текстурна з артефактами.

‘Є блокові артефакти під ротом, які змінюють форму підборіддя. Там також є вертикальні лінії.

‘Наша модель能够 виправити ці артефакти, генеруючи візуально привабливий вивід з чистішою шкірою і відновленням деяких тонких деталей, які були втрачені під час стиснення.

‘Важливо, що покращений вивід залишається вірним ідентичності у відео.’

Висновок

Здається, що ці триваючі зусилля в галузі та академії з підвищення якості відеодзвінків з низьким сигналом в кінцевому підсумі зіштнуться з протилежними зусиллями з виявленням фальшивих відеодзвінків.

Оскільки, як зазначено в новій статті, проміжні системи, такі як FSFVE, можуть бути законно застосовані до потоків відеозв’язку через офіційні API, можливо, що неопрацьований вміст залишиться доступним для використання анти-DeepFake заходами, оскільки вони з’являються – і становляться все більш важливими.

 

* Відноситься до нової статті як набір даних ‘DeepFakeDetector’, хоча він не здається відомим під цією назвою, навіть всередині статті FaceForensics++, на яку посилаються автори в цьому відношенні.

Перша публікація – вівторок, 14 липня 2026

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai