Взгляд Anderson
Исправление размытых видеозвонков в реальном времени с помощью только CPU

Новый метод создает модель ИИ вашего лица за несколько секунд, чтобы исправить размытые видеозвонки в реальном времени — работает полностью на базовом ноутбукном CPU, без необходимости в мощном оборудовании или облачной обработке.
Хотя пользователи в странах с ограниченными ресурсами более всего пострадали от низкокачественных изображений видеочата, это часто является проблемой “первого мира” — например, если один из участников чата использует перегруженную точку доступа Wi-Fi или другой процесс или человек в доме участника доминирует в доступной полосе пропускания; или даже если этот человек посещает страну с плохой связью.
Поскольку проблема распространена, определенное внимание было уделено ей в научной литературе, с предложенными решениями через деблокирование, денойзинг, супер-разрешение и другие методы. Система VQFR 2022 года восстанавливает ухудшенные изображения лица, заменяя низкокачественные изображения на более высококачественные представления, полученные из обученной кодовой книги; в 2021 году GFP-GAN использует генеративные приоритеты лица для улучшения изображений низкого качества; и RTFVE: Реальное улучшение видео лица использует высококачественные эталонные изображения для восстановления лица:
Нажмите, чтобы воспроизвести, если необходимо. Из проекта улучшения лица RTFVE 2025 года, ускорение GPU улучшения лица. Источник
С точки зрения пользователя с ограниченными ресурсами, большинство этих решений не являются жизнеспособными, поскольку они передают работу на GPU, который может не быть доступен в настройке пользователя. Однако использование (гораздо менее мощного) CPU для задач компьютерного зрения обычно является офлайн-процессом, то есть пользователю необходимо ждать, пока CPU закончит обработку, прежде чем вывод будет доступен.
Это неприемлемо для сценария видеочата, который является требовательным к ресурсам, но также часто ресурсо-ограниченным: любой действительно демократичный системой улучшения лица потребуется работать на CPU с минимальной частотой 24 кадра в секунду при разумном разрешении; и это многое требует.
Прямолинейное решение
Это требовательный сценарий удовлетворяется новым исследовательским предложением из США, которое, по утверждениям авторов, способно обучить модель менее чем за 100 секунд из скудных кадров лица зрителя, с окончательной моделью, работающей как промежуточный слой между пользователем и конференцией, через официальные API-слои в приложениях видеоконференций, таких как Zoom:
Нажмите, чтобы воспроизвести, если необходимо. Из страницы проекта FSFVE, образцы улучшений качеств видео веб-камеры, используя легковесную (3,5 МБ) модель, обученную менее чем за две минуты. Источник
В статье говорится:
‘Модель FSFVE может быть обучена либо прямо перед видеозвонком, либо в начале звонка. Требуется только несколько высококачественных изображений объекта; например, 5-30 изображений, что делает его обучение с небольшим количеством примеров. Прямо перед звонком или в начале звонка можно получить несколько секунд высококачественного видео пользователя; например, 3 секунды, что дает 3∗24=72 кадра, предполагая частоту кадров 24 кадра в секунду (FPS).
‘Это высококачественное видео можно быстро перекодировать в низкокачественное видео на основе настроек видеозвонка, и затем с низкокачественными и высококачественными кадрами модель обучается.’
Одной из заметных особенностей новой системы является ее гибкость в отношении того, кто “платит” за обработку модели; если сам зритель по какой-то причине не может предоставить мощность CPU для обучения, это можно передать корреспонденту, отправив небольшое количество высококачественных кадров, с тем, что модель обучается “удаленно” для пользователя с ограниченными ресурсами.
Альтернативно, обучение можно систематически передать на сервер для обучения. Авторы отмечают:
‘Сервер можно использовать для случаев, когда устройства отправки и приема слишком медленные для обучения (или даже если нет, чтобы облегчить им эту задачу).
‘В любом случае, размер модели относительно небольшой (около 3,5 МБ), как и несколько высококачественных кадров, и после завершения обучения модель может работать в реальном времени на типичном ноутбукном CPU.’
В тестах, с моделями, обученными на базовых значениях и предыдущих работах (включая упомянутый выше RTFVE, который является основой для новой работы), FSFVE последовательно превосходил неулучшенное сжатое видео, CPU-оптимизированный ResNet и модифицированную модель RTFVE-0, при этом работая в реальном времени на CPU.
Новая статья озаглавлена FSFVE: Улучшение сжатого видео лица с небольшим количеством примеров, и поставляется с демо и репозиторием GitHub.
Метод
FSFVE был обучен на открытом наборе данных FaceForensics++*, который состоит из 363 видеороликов 1080p актеров, разговаривающих, из которых авторы извлекли категорию говорение против стены, как наиболее близкую к типичному видеозвонку:
Нажмите, чтобы воспроизвести, если необходимо. Примеры из набора данных FaceForensics++. Источник
Этот подмножество состоит из 27 видеороликов, каждый из которых содержит около 972 кадров — в основном фронтальные виды, но также некоторые боковые виды.
Чтобы сгенерировать видеоролики низкого качества, предназначенные для имитации проблем с подключением видеозвонка, авторы сжали набор данных, используя кодеки видео H264 и H265. Уровни сжатия были установлены в диапазоне CRF 36, 40 и 44 (учитывая, что ноль — это безпотерянное сжатие, а 51 — чрезвычайно блочное).
Каждый кадр был обрезан до области 256 × 256 пикселей вокруг лица, используя детектор лица BlazeFace, после чего ключевые точки лица использовались для выравнивания лица, определяя глаза и применяя аффинное преобразование (которое поворачивает, масштабирует и сдвигает лицо в согласованное положение), так что глаза остаются на уровне, и примерно в одном и том же положении во всех кадрах.
Это было выполнено с помощью библиотеки распознавания лиц:
Пример извлечения линейных элементов лица из изображения с помощью библиотеки распознавания лиц Python. Источник
Поскольку модель предназначена для обучения только на нескольких кадрах из одного видеозвонка, кадры обучения необходимо захватить как можно больше вариаций лица. Поэтому кластеризация k-means была использована вместо более простых методов отбора (т.е. случайной выборки или фиксированных интервалов).
Каждый обрезанный и выровненный кадр был передан через упомянутый выше кодировщик лица RTFVE, чтобы сгенерировать числовое представление, после чего кластеризация k-means сгруппировала подобные кадры в 30 кластеров. Этот процесс кластеризации был повторен пять раз, чтобы получить лучшую группировку, и кадр, ближайший к центру каждого кластера, был выбран для обучения. Этот процесс произвел разнообразный набор из 30 изображений для каждого видеоролика.
Обучение и тесты
Модели были обучены в течение 100 эпох, что является довольно низким, учитывая очень небольшое количество изображений, участвующих в процессе. Однако, как отмечают авторы, переобученная модель на самом деле желательна в этом сценарии, даже если она не может захватить все возможные события, такие как необычные выражения лица, позы или сокрытие/замаскировка черт лица. Приоритеты вместо этого заключаются в умеренной гибкости в обобщении и скорости обучения.
Оптимизатор RAdam был использован с скоростью обучения 10-4.
Для начальных тестов система была сравнена с исходным сжатым видео; легковесным ResNet, настроенным для реального времени CPU-инференса; и упомянутым выше RTFVE — единственной другой системой реального времени CPU-улучшения лица.
Чтобы обеспечить справедливое сравнение, RTFVE был изменен, чтобы исключить его зависимость от высококачественных эталонных изображений во время инференса, сохраняя при этом аналогичную скорость и количество параметров, в результате чего получилась модифицированная модель RTFVE-0. Модели ResNet и RTFVE-0 были обучены с использованием функции потерь L1. Чтобы обеспечить справедливое сравнение, все модели использовали один и тот же оптимизатор RAdam и настройки обучения, с отдельным экземпляром модели, обученной из 30 кадров для каждого видеоролика.
Чтобы ускорить обучение, был введен пользовательский частотно-доменный фокусный损 (подчеркивающий наиболее важные визуальные детали во время обучения), чтобы придать больший вес низкочастотным компонентам DCT (информации об изображении после преобразования в частотные значения), которые имеют наибольшее влияние на воспринимаемое качество изображения.
Вес был получен из матрицы квантования яркости JPEG, что заставило модель отдавать приоритет наиболее важным визуальным структурам во время обучения.
Количественные тесты
Были измерены как техническая точность восстановления (искажение), так и воспринимаемое визуальное качество. Искажение было измерено с помощью пиковой сигнал-шумовой отношения (PSNR) и индекса структурированного подобия (SSIM); и воспринимаемое качество — с помощью изучаемого перцептивного подобия патчей изображения (LPIPS):
Производительность FSFVE против исходного сжатого видео, CPU-оптимизированного ResNet и модифицированного RTFVE-0 по видео H.264 и H.265 на трех уровнях сжатия, с более высокими значениями PSNR и SSIM, указывающими на лучшее качество восстановления, и более низкими значениями LPIPS, указывающими на лучшее воспринимаемое качество.
FSFVE последовательно превосходил как исходное сжатое видео, так и конкурирующие модели улучшения CPU, на всех уровнях сжатия.
С видео H.264 PSNR увеличился на 1,11 дБ, 1,37 дБ и 1,51 дБ над базовым значением при значениях CRF 36, 40 и 44, с соответствующими улучшениями в SSIM и более низкими значениями LPIPS на двух более высоких уровнях сжатия (указывающими на лучшее воспринимаемое качество).
Аналогичные результаты были получены с видео H.265, что указывает на то, что подход остается эффективным для обоих основных видеокодеков. Как показано ниже, улучшение стало более выраженным при увеличении сжатия, что указывает на то, что метод работает особенно хорошо в условиях низкой полосы пропускания, для которых он был разработан:

PSNR при увеличении битрейта для исходного видео H.264 и улучшенного вывода. Расширяющийся разрыв при более низких битрейтах показывает, что FSFVE обеспечивает наибольшие улучшения качества при самых сжатых и ограниченных по полосе пропускания условиях.
Модели CPU-оптимизированного ResNet и RTFVE-0 обеспечили только скромные улучшения над сжатым базовым значением, тогда как FSFVE превосходил обе модели более чем на 1,1 дБ, сохраняя при этом производительность в реальном времени на уровне 30,24 кадра в секунду, несмотря на содержание всего около миллиона параметров.
Как показано ниже, производительность улучшалась стабильно с увеличением количества кадров обучения. Даже с пятью кадрами обучения FSFVE улучшил PSNR более чем на 0,75 дБ над сжатым базовым значением, тогда как десять кадров обучения были достаточны, чтобы превысить улучшение на 1 дБ — что указывает на то, что подход остается эффективным даже с очень ограниченным количеством данных для обучения:

Влияние размера набора обучения на PSNR для не виденных кадров видео H.264 при уровне сжатия CRF 44. Даже пять кадров обучения улучшили качество над сжатым базовым значением, с производительностью, увеличивающейся стабильно с увеличением количества кадров.
Качественные тесты
В результатах ниже, для качественной фазы тестирования, мы видим сильно сжатые кадры видео H.264 на уровне сжатия CRF 44 с соответствующим выводом FSFVE:

Сравнение сильно сжатых кадров видео H.264 на уровне сжатия CRF 44 с соответствующим выводом FSFVE. Улучшенные результаты, по утверждению статьи, уменьшают артефакты сжатия, восстанавливают структуру лица и производят более гладкую, естественную кожу, сохраняя при этом идентичность и выражение лица. Пожалуйста, обратитесь к исходному PDF и оригинальным видеороликам для лучших примеров.
Авторы утверждают, что сжатые изображения демонстрируют заметные артефакты вокруг глаз, носа и рта, а также неестественно текстурированную кожу и искажения черт лица, тогда как улучшенные результаты существенно уменьшают эти дефекты:
‘В первом примере глаза выглядят нечетко, с черной краской для глаз, сливаясь с цветом глаз. Есть явные признаки алиасинга с губами. Брови лишены определения, а кожа выглядит искаженной. Во втором примере кожа сильно текстурирована с артефактами шума.
‘Есть блоковые артефакты под ртом, изменяющие форму подбородка. Также есть видимые вертикальные линии.
‘Наша модель может исправить эти артефакты, генерируя визуально привлекательный вывод с более четкой кожей и восстанавливая некоторые из тонких деталей, которые были потеряны при сжатии.
‘Важно, что улучшенный вывод остается верным идентичности в видео.’
Заключение
Похоже, что эти продолжающиеся усилия в промышленности и академии по улучшению качества видеоданных видеочата в конечном итоге столкнутся с противоположными усилиями по обнаружению поддельных видеозвонков.
Поскольку, как отмечается в новой статье, промежуточные системы, такие как FSFVE, могут быть законно применены к потокам видеочата через официальные API, возможно, что необработанный контент останется доступным для использования против поддельных мер, поскольку они появляются — и становятся более важными.
* Упоминается в новой статье как набор данных ‘DeepFakeDetector’, хотя он не кажется известным под этим именем, даже внутри статьи FaceForensics++, на которую ссылаются авторы в этом отношении.
Опубликовано впервые во вторник, 14 июля 2026 года












