Anderson 视角
使用仅CPU实时修复模糊视频通话

一种新方法可以在几秒钟内创建一个AI模型来修复模糊的视频通话,运行在基本的笔记本电脑CPU上,无需强大的硬件或云处理。
虽然来自资源匮乏国家的用户最容易受到低质量视频聊天图像的影响,但这也经常是一个“第一世界”的问题——例如,如果聊天中的一个参与者使用的是过度使用的Wi-Fi热点,或者参与者家中的其他过程或人员占用了可用的带宽;或者即使该人员访问的是一个网络连接不良的国家。
由于这个问题很常见,一些研究文献已经关注它,提出了通过去块、去噪、超分辨率和其他方法来解决它的方案。2022年的VQFR系统通过用从学习的代码簿中提取的更高质量的图像特征来替换低质量的图像特征来恢复退化的面部图像;2021年的GFP-GAN利用生成的面部先验来提高低质量图像的质量;以及RTFVE:实时面部视频增强使用高质量的参考图像来执行面部恢复:
点击播放,如有必要。来自2025年RTFVE面部增强项目的GPU加速面部改进。 来源
从资源匮乏的用户的角度来看,大多数这些解决方案都不可行,因为它们将工作卸载到可能在用户的设置中不可用的GPU上。然而,使用(远不那么强大的)CPU进行计算机视觉任务通常是一个离线过程,这意味着需要等待CPU完成处理后输出才会可用。
这对于视频聊天场景来说是不可接受的,视频聊天场景既耗费资源又常常资源匮乏:任何真正民主的面部改进系统都需要在CPU上以至少24fps的速度运行在合理的分辨率下;这要求很高。
面对现实
这个苛刻的场景是由一项来自美国的新研究成果所满足的,据作者称,这项成果能够在不到100秒的时间内从观众的面部的稀疏帧中训练一个模型,然后最终模型可以通过视频会议应用程序(如Zoom)的官方API层作为中间层运行在用户和会议之间:
点击播放,如有必要。来自FSFVE项目页面的样本改进,使用在不到两分钟内训练的轻量级(3.5MB)模型。来源
该论文指出:
‘FSFVE模型可以在视频通话之前或通话开始时训练。只需要几张高质量的图像;例如,5到30张图像,这就是少数样本学习。就在通话之前或通话开始时,可以获得几秒钟的高质量视频;例如,3秒钟,假设帧率为24帧/秒(FPS),提供3*24=72帧。
‘可以快速将此高质量视频重新编码为低质量视频,基于视频通话的设置,然后使用低质量和高质量帧来训练模型。’
该新系统的一个显著特点是其在谁“支付”模型处理方面的灵活性;如果观众自己由于某种原因无法提供CPU能力来训练模型,则可以将其卸载到对方,通过发送少量高质量帧,模型可以在资源匮乏的用户处“远程”训练。
或者,训练可以系统地卸载到服务器。作者观察到:
‘服务器可以用于发送和接收设备太慢以进行训练的场景(或者,即使它们不慢,也可以将任务卸载到服务器上)。’
‘在任何情况下,模型的大小相对较小(约3.5 MB),高质量帧也很小,一旦训练完成,模型就可以在典型的笔记本电脑CPU上实时运行。’
在测试中,使用基准和先前的工作(包括上述RTFVE,它是新工作的基础)训练的模型,FSFVE始终优于未增强的压缩视频、CPU优化的ResNet和RTFVE-0,同时仍然在CPU上实时运行。
新论文的标题为FSFVE:少数压缩面部视频增强,并附有演示和GitHub仓库。
方法
FSFVE是在开源的FaceForensics++数据集上训练的,该数据集由363个1080p视频组成,讲述的是演员在说话,作者从中提取了“对着墙说话”的类别,因为它最接近典型的视频通话风格:
点击播放,如有必要。FaceForensics++数据集的示例。 来源
该子集包含27个视频,每个视频大约有972帧,主要是正面视图,但也有一些侧面视图。
为了生成模拟视频通话连接问题的低质量视频,作者使用H264和H265视频编解码器压缩数据集。压缩级别设置为CRF范围,跨越36、40和44(考虑到0是无损的,51是极其块状的)。
每个帧被裁剪到面部周围的256×256区域,使用BlazeFace面部检测器,然后使用面部关键点对齐面部,通过定位眼睛并应用仿射变换(旋转、缩放和移动面部到一致的位置),以便眼睛保持水平,并在所有帧中大致保持相同的位置。
这是在使用面部识别库时完成的:
使用面部识别Python库从图像中提取面部线条的示例。 来源
由于该模型旨在从单个视频通话的少数帧中学习,因此训练帧需要捕获尽可能多的面部变化。因此,使用了k-means聚类而不是更简单的选择方法(即随机采样或固定间隔)。
每个裁剪和对齐的帧都通过上述RTFVE面部编码器传递,以生成一个数字表示,然后k-means聚类将类似的帧分组到30个簇中。该聚类过程重复五次以获得最佳分组,并选择每个簇中心最近的帧进行训练。该过程为每个视频生成了一个多样化的30张图像。
训练和测试
模型训练了100个epoch,这相对较低,考虑到所涉及的图像数量很少。然而,正如作者观察到的那样,在这种情况下,过拟合的模型实际上是理想的,即使它不能捕获所有可能的情况,例如不常见的面部表情、姿势或面部特征的隐藏/遮挡。优先考虑的是适度的灵活性和训练速度。
使用了RAdam优化器,学习率为10-4。
对于初始测试,系统与原始压缩视频、轻量级ResNet和上述RTFVE(唯一其他实时CPU面部增强系统)进行了比较。
为了确保公平的比较,RTFVE被修改为在推理期间删除其对高质量参考图像的依赖,同时保持类似的速度和参数数量,生成一个称为RTFVE-0的变体。ResNet和RTFVE-0模型使用L1损失函数进行训练。为了确保公平的比较,所有模型使用相同的RAdam优化器和训练设置,并为每个视频训练了一个单独的实例特定模型,从30帧开始。
为了加快训练速度,引入了一个自定义的频域焦点损失(在训练期间强调最视觉重要的图像细节),以给予低频DCT分量(图像信息在转换为频率值后)更大的权重,这些分量对感知图像质量有最大的影响。
权重是从JPEG亮度量化矩阵中得出的,导致模型在训练期间优先考虑最视觉重要的图像结构。
定量测试
测试中既测量了技术重建准确度(失真),又测量了感知视觉质量。失真通过峰值信噪比(PSNR)和结构相似性指数(SSIM)进行测量;感知质量通过学习感知图像补丁相似性(LPIPS)进行测量:
FSFVE与原始压缩视频、CPU优化的ResNet和修改的RTFVE-0在H.264和H.265视频的三个压缩级别上的性能,较高的PSNR和SSIM表示更好的重建质量,较低的LPIPS表示更好的感知质量。
FSFVE在每个压缩级别上始终优于原始压缩视频以及其他基于CPU的增强模型。
对于H.264视频,PSNR在CRF值为36、40和44时分别提高了1.11dB、1.37dB和1.51dB,SSIM和LPIPS也相应提高,表明感知图像质量更好。
在H.265中也记录了类似的收益,表明该方法在两个主要视频编解码器中都有效。如下所示,改进随着压缩的增加而变得更加明显,表明该方法在设计要解决的低带宽条件下表现特别好:
随着比特率增加,原始H.264视频和增强输出的PSNR。比特率较低时的差距扩大,表明FSFVE在最严重压缩和带宽受限的条件下实现了最大质量增益。
CPU优化的ResNet和RTFVE-0仅提供了对压缩基线的微小改进,而FSFVE则超过了它们1.1dB以上,同时保持了30.24帧/秒的实时性能,尽管它仅包含约一百万个参数。
如下所示,随着更多训练帧的提供,性能会稳步提高。即使只有五个训练图像,FSFVE也会将PSNR提高超过0.75dB以上,超过压缩基线,而十个训练帧足以超过1dB的改进,表明该方法即使使用非常有限的训练数据也仍然有效:
CRF 44下H.264视频帧的训练集大小对PSNR的影响。即使只有五个训练图像,也会提高质量超过压缩基线,并且随着更多帧的可用性,性能会不断提高。
定性测试
在定性测试阶段的结果中,我们看到CRF 44的重度压缩H.264视频帧,以及相应的FSFVE输出:
CRF 44下重度压缩的H.264视频帧与相应的FSFVE输出的比较。论文断言,增强的结果减少了压缩伪影,恢复了面部结构,并产生了更平滑、更自然的皮肤,同时保持了主体的身份和表情。请参阅源PDF和原始视频以获取更好的示例。
作者认为,压缩图像在眼睛、鼻子和嘴巴周围表现出明显的伪影,皮肤质地不自然,面部特征也存在失真,而增强的结果则大大减少了这些缺陷:
‘在第一个例子中,眼睛看起来不清楚,眼妆的黑色与眼睛的颜色融合在一起。嘴唇有明显的_aliasing_。眉毛缺乏定义,皮肤看起来变形。在第二个例子中,皮肤质地粗糙,有斑点伪影。’
‘嘴巴下方有阻塞伪影,改变了下巴的形状。还有垂直线。’
‘我们的模型能够纠正这些伪影,生成视觉上令人愉悦的输出,皮肤更清晰,并恢复了一些在压缩中丢失的细节。’
‘重要的是,增强的输出保持了视频中的身份。’
结论
似乎这些在行业和学术界持续进行的努力,以提高低信号视频聊天数据的质量,最终将与识别视频通话中的深度伪造视频的相反努力相冲突。
由于新论文指出,像FSFVE这样的中间系统可以通过视频会议应用程序(如Zoom)的官方API层合法地应用于聊天视频流,因此非处理内容可能仍然可用于反深度伪造措施,如它们出现和变得更加重要一样。
* 在新论文中被称为“DeepFakeDetector”数据集,尽管它似乎在作者在此方面链接的FaceForensics++论文中并不以此名称为人所知。
首次发布于2026年7月14日,星期二












