Ángulo de Anderson
Corregir videollamadas borrosas en tiempo real utilizando solo CPU

Un nuevo método crea un modelo de inteligencia artificial de su rostro en segundos, para corregir videollamadas borrosas en tiempo real, ejecutándose enteramente en una CPU básica de portátil, sin necesidad de hardware potente o procesamiento en la nube.
Aunque los usuarios en países con recursos limitados son los más afectados por imágenes de videollamadas de baja calidad, es frecuentemente un problema del “mundo desarrollado” también – por ejemplo, si uno de los participantes en una charla está utilizando un punto de acceso Wi-Fi sobrecargado, o algún otro proceso o persona en el hogar del participante está dominando la banda ancha disponible; o incluso si esa persona está visitando un país con mala conectividad.
Desde que el problema es común, se ha dedicado cierta atención a él en la literatura de investigación, con soluciones propuestas a través de la desbloqueo, desenoising, super-resolución y otros métodos. El sistema VQFR de 2022 restaura imágenes faciales degradadas reemplazando características de imagen de baja calidad con representaciones de mayor calidad extraídas de un código de aprendizaje; el GFP-GAN de 2021 aprovecha los priores faciales generativos para mejorar las imágenes de baja calidad; y RTFVE: Realtime Face Video Enhancement utiliza imágenes de referencia de alta calidad para realizar la restauración de la cara:
Click para reproducir, si es necesario. Del proyecto de mejora de cara de 2025, mejora de caras con aceleración por GPU. Fuente
Desde el punto de vista del usuario con recursos limitados, la mayoría de estas soluciones no son viables, ya que descargan el trabajo a una GPU que puede no estar disponible en la configuración del usuario. Sin embargo, utilizar la CPU (mucho menos capaz) para tareas de visión por computadora es normalmente un proceso fuera de línea, lo que significa que uno tendría que esperar a que la CPU termine de procesar antes de que la salida estuviera disponible.
Esto es inaceptable para el escenario de videollamadas, que es voraz en recursos pero también, a menudo, escaso de recursos: cualquier sistema de mejora facial verdaderamente democrático necesitaría ejecutarse en la CPU con un mínimo de 24 fps a una resolución razonable; y esto es mucho pedir.
Enfrentándolo
Este escenario exigente es abordado por una nueva oferta de investigación de EE. UU., que es capaz, según afirman los autores, de entrenar un modelo en menos de 100 segundos a partir de cuadros esparsos del rostro del espectador, con el modelo final ejecutándose como una capa intermedia entre el usuario y la conferencia, a través de capas de API oficiales en aplicaciones de videoconferencia como Zoom:
Click para reproducir, si es necesario. Del proyecto de FSFVE, mejoras de muestra a caras en escenarios de cámara web, utilizando un modelo ligero (3,5 MB) entrenado en menos de dos minutos. Fuente
El documento establece:
‘El modelo FSFVE se puede entrenar ya sea justo antes de una videollamada o al comienzo de la llamada. Solo se requieren algunas imágenes de alta calidad del sujeto; por ejemplo, 5 a 30 imágenes, lo que lo convierte en un aprendizaje de pocos disparos. Justo antes de la llamada o al comienzo de la llamada, se pueden obtener algunos segundos de video de alta calidad del usuario; por ejemplo, 3 segundos, lo que proporciona 3∗24=72 cuadros, asumiendo una tasa de cuadros de 24 cuadros por segundo (fps).
‘Este video de alta calidad se puede codificar rápidamente a un video de baja calidad según los ajustes de la videollamada, y luego, con los cuadros de alta y baja calidad, se entrena el modelo.’
Una característica notable del nuevo sistema es su flexibilidad en cuanto a quién “paga” por el procesamiento del modelo; si el espectador mismo, por alguna razón, no puede proporcionar la potencia de CPU para el entrenamiento, esto se puede descargar al corresponsal, enviando un pequeño número de cuadros de alta calidad, con el modelo entrenado así “remotamente” al usuario con recursos limitados.
Alternativamente, el entrenamiento se puede descargar sistemáticamente a un servidor para el entrenamiento. Los autores observan:
‘El servidor se puede utilizar para casos en los que los dispositivos de envío y recepción sean demasiado lentos para el entrenamiento (o incluso si no lo son, para aliviarlos de la tarea).
‘En cualquier caso, el tamaño del modelo es relativamente pequeño (alrededor de 3,5 MB) al igual que algunos cuadros de alta calidad, y una vez que se completa el entrenamiento, el modelo puede ejecutarse en tiempo real en una CPU de portátil típica.’
En las pruebas, con modelos entrenados contra líneas de base y trabajos anteriores (incluido el mencionado RTFVE, que forma la base del nuevo trabajo), FSFVE superó consistentemente el video comprimido sin mejorar, una ResNet optimizada para CPU configurada para inferencia en tiempo real; y el modelo RTFVE-0 modificado, mientras aún se ejecutaba en tiempo real en una CPU.
El nuevo documento se titula FSFVE: Few Shot Compressed Face Video Enhancement, y viene completo con una demo y un repositorio de GitHub.
Método
FSFVE se entrenó en el conjunto de datos abierto FaceForensics++*, que consiste en 363 videos de 1080p de actores hablando, de los cuales los autores extrajeron la categoría hablando contra una pared, como la más cercana en estilo a una videollamada típica:
Click para reproducir, si es necesario. Ejemplos del conjunto de datos FaceForensics++. Fuente
Este subconjunto se compone de 27 videos de alrededor de 972 cuadros cada uno – principalmente vistas frontales, pero, necesariamente, algunas vistas laterales también.
Para generar videos de baja calidad diseñados para simular problemas de conexión de videollamadas, los autores comprimieron el conjunto de datos utilizando los códigos de video H264 y H265. Los niveles de compresión se establecieron en un rango de CRF que abarca 36, 40 y 44 (considerando que cero es sin pérdida y 51 es extremadamente bloqueado).
Cada cuadro se recortó a una región de 256 × 256 alrededor de la cara utilizando el detector de caras BlazeFace, después de lo cual se utilizaron puntos faciales para alinear la cara ubicando los ojos y aplicando una transformación afín (que gira, escala y desplaza la cara a una posición consistente), de modo que los ojos permanezcan nivelados y en aproximadamente la misma posición en todos los cuadros.
Esto se llevó a cabo con la biblioteca de reconocimiento de caras:

Un ejemplo de extracción de lineamientos faciales de una imagen con la biblioteca de reconocimiento de caras de Python. Fuente
Debido a que el modelo está diseñado para aprender de solo un puñado de cuadros de una sola videollamada, los cuadros de entrenamiento necesitaban capturar tanta variación facial como fuera posible. Por lo tanto, se utilizó clustering k-means en lugar de métodos de selección más simples (es decir, muestreo aleatorio o intervalos fijos).
Cada cuadro recortado y alineado se pasó a través del codificador de caras RTFVE mencionado anteriormente para generar una representación numérica, después de lo cual el clustering k-means agrupó cuadros similares en 30 clusters. Este proceso de clustering se repitió cinco veces para obtener el mejor agrupamiento, y se seleccionó el cuadro más cercano al centro de cada cluster para el entrenamiento. Este proceso produjo un conjunto diverso de 30 imágenes para cada video.
Entrenamiento y pruebas
Los modelos se entrenaron durante 100 épocas, lo que es bastante bajo, considerando el número muy pequeño de imágenes involucradas. Sin embargo, como observan los autores, un modelo sobreajustado es en realidad deseable en este escenario, incluso si no puede capturar todas las posibles eventualidades, como expresiones faciales poco comunes, poses o la ocultación de características faciales. Las prioridades, en cambio, son una flexibilidad moderada en generalización y velocidad de entrenamiento.
El optimizador RAdam se utilizó a una tasa de aprendizaje de 10-4.
Para las pruebas iniciales, el sistema se comparó con el video comprimido original; una ResNet ligera configurada para inferencia de CPU en tiempo real; y el mencionado RTFVE – el único otro sistema de mejora facial de CPU en tiempo real conocido.
Para garantizar una comparación justa, RTFVE se modificó para eliminar su dependencia de imágenes de referencia de alta calidad durante la inferencia, mientras se preservaba una velocidad y recuento de parámetros similares, produciendo una variante llamada RTFVE-0. Los modelos ResNet y RTFVE-0 se entrenaron utilizando la función de pérdida L1. Para garantizar una comparación justa, todos los modelos utilizaron el mismo optimizador RAdam y la misma configuración de entrenamiento, con una instancia de modelo entrenada por separado para cada video.
Para acelerar el entrenamiento, se introdujo una pérdida focal personalizada en el dominio de frecuencia (que enfatiza los detalles de la imagen más visualmente importantes durante el entrenamiento) para dar mayor peso a los componentes de DCT de baja frecuencia (la información de la imagen después de la conversión en valores de frecuencia), que tienen la mayor influencia en la calidad de la imagen percibida.
El peso se derivó de la matriz de cuantificación de luminancia JPEG, lo que hace que el modelo priorice las estructuras de la imagen más visualmente importantes durante el entrenamiento.
Pruebas cuantitativas
Tanto la precisión técnica de reconstrucción (distorsión) como la calidad visual percibida se midieron para las pruebas. La distorsión se midió mediante Relación de señal a ruido pico (PSNR) y Índice de similitud estructural (SSIM); y la calidad perceptual por Similitud de parches de imagen aprendida (LPIPS):

Rendimiento de FSFVE frente al video comprimido original, una ResNet optimizada para CPU y el modelo RTFVE-0 modificado a través de video H.264 y H.265 en tres niveles de compresión, con PSNR y SSIM más altos que indican una mejor calidad de reconstrucción, y LPIPS más bajos que indican una mejor calidad perceptual.
FSFVE superó consistentemente tanto el video comprimido original como los modelos de mejora de CPU competidores, en todos los niveles de compresión.
Con video H.264, PSNR aumentó en 1,11 dB, 1,37 dB y 1,51 dB sobre la línea de base en valores de CRF de 36, 40 y 44, con mejoras correspondientes en SSIM y puntuaciones LPIPS más bajas en los dos niveles de compresión más altos (indicando una mejor calidad de imagen percibida).
Se registraron ganancias similares con video H.265, lo que sugiere que el enfoque sigue siendo efectivo en ambos códigos de video principales. Como se muestra a continuación, la mejora se volvió más pronunciada a medida que aumentaba la compresión, lo que indica que el método se desempeñó particularmente bien en las condiciones de baja banda ancha para las que se diseñó:

PSNR a medida que aumenta la tasa de bits para el video H.264 original y la salida mejorada. La brecha en expansión en tasas de bits más bajas muestra que FSFVE entrega sus mayores ganancias de calidad en las condiciones más comprimidas y limitadas por la banda ancha.
La ResNet optimizada para CPU y RTFVE-0 proporcionaron solo mejoras modestas sobre la línea de base comprimida, mientras que FSFVE superó a ambos en más de 1,1 dB, mientras mantenía un rendimiento en tiempo real a 30,24 fps, a pesar de contener alrededor de un millón de parámetros.
Como se muestra a continuación, el rendimiento mejoró constantemente a medida que se proporcionaban más cuadros de entrenamiento. Incluso con solo cinco imágenes de entrenamiento, FSFVE mejoró PSNR en más de 0,75 dB sobre la línea de base comprimida, mientras que diez cuadros de entrenamiento fueron suficientes para exceder una mejora de 1 dB – lo que indica que el enfoque siguió siendo efectivo con una cantidad muy limitada de datos de entrenamiento:

Efecto del tamaño del conjunto de entrenamiento en PSNR para cuadros de video H.264 no vistos en CRF 44. Incluso cinco imágenes de entrenamiento mejoraron la calidad sobre la línea de base comprimida, con un rendimiento que aumenta constantemente a medida que se disponen de más cuadros.
Pruebas cualitativas
En los resultados a continuación, para la fase cualitativa de las pruebas, vemos cuadros de video H.264 comprimidos pesadamente en CRF 44 con la salida correspondiente de FSFVE:

Comparación de cuadros de video H.264 comprimidos pesadamente en CRF 44 con la salida correspondiente de FSFVE. Los resultados mejorados, según afirma el documento, reducen los artefactos de compresión, restauran la estructura facial y producen una piel más suave y natural, mientras preservan la identidad y la expresión del sujeto. Consulte el PDF de fuente y los videos originales para mejores ejemplos.
Los autores mantienen que las imágenes comprimidas exhiben artefactos prominentes alrededor de los ojos, la nariz y la boca, junto con una piel con textura no natural y distorsiones en las características faciales, mientras que los resultados mejorados reducen sustancialmente estos defectos:
‘En el primer ejemplo, los ojos parecen poco claros con el negro del maquillaje de ojos mezclado con el color de los ojos. Hay signos claros de aliasing con los labios. Las cejas carecen de definición y la piel parece distorsionada. En el segundo ejemplo, la piel está muy texturizada con artefactos de speckle.
‘Hay artefactos de bloqueo debajo de la boca que alteran la forma de la barbilla. También parecen haber líneas verticales.
‘Nuestro modelo puede remediar estos artefactos y generar una salida visualmente agradable con una piel más clara y restaurar algunos de los detalles finos que se perdieron en la compresión.
‘Es importante que la salida mejorada siga siendo fiel a la identidad en el video.’
Conclusión
Parece inevitable que estos esfuerzos continuos en la industria y la academia para mejorar la calidad de los datos de videollamadas de baja señal, eventualmente chocarán contra los esfuerzos opuestos para identificar imágenes de deepfake en videollamadas.
Desde que, como señala el nuevo documento, los sistemas intermedios como FSFVE se pueden aplicar legítimamente a flujos de video de chat a través de API oficiales, es posible que el contenido no procesado siga estando disponible para su uso por medidas anti-deepfake, a medida que surgen y se vuelven más importantes. * Referred to in the new paper as the ‘DeepFakeDetector’ dataset, though it does not appear to be known by this name, even inside the FaceForensics++ paper that the authors link to in this regard. First published Tuesday, 14 de julio de 2026












