Anderson의 관점

실시간으로 블러리한 비디오 통화를 고치는 방법 – CPU만 사용

mm
Unite.AI를 Google의 선호 소스에 추가
Partially AI-generated image. Overlaid in front, a before and after comparison of CPU-only facial improvement for the paper FSFVE: Few Shot Compressed Face Video Enhancement; behind, a generic illustration from GPT-2 expressing the idea of an AI model 'up-rezzing' a poor video chat avatar.

새로운 방법은 몇 초 안에 사용자의 얼굴을 AI 모델로 생성하여 실시간으로 블러리한 비디오 통화를 고칠 수 있으며, 강력한 하드웨어나 클라우드 처리가 필요하지 않습니다.

 

저자원국에서 사용하는 사용자들이 블러리한 비디오 채팅 이미지에 가장 많이 영향을 받지만, 이는 또한 ‘제1세계’ 문제이기도 합니다. 예를 들어, 채팅에 참여하는 한 사람이 과부하된 Wi-Fi 핫스팟을 사용하거나, 다른 프로세스나 사람이 사용자의 가용 대역폭을 지배하는 경우, 또는 그 사람이 연결성이 불량한 국가를 방문하는 경우입니다.

이 문제는 일반적이므로 연구 문헌에서 이에 대한 많은 관심을 기울였으며, deblocking, denoising, super-resolution 등의 방법을 통해 해결책이 제시되었습니다. 2022年的 VQFR 시스템은 저품질 이미지 특징을 학습된 코드북에서 더 높은 품질의 표현으로 대체하여 저하된 얼굴 이미지를 복원합니다. 2021年的 GFP-GAN은 저품질 이미지를 개선하기 위해 생성된 얼굴 사전 지식을 활용합니다. RTFVE: 실시간 얼굴 비디오 향상은 고품질 참조 이미지를 사용하여 얼굴 복원을 수행합니다.

재생을 위해 클릭하세요.2025 RTFVE 얼굴 향상 프로젝트에서 GPU 가속을 사용한 얼굴 개선. 소스

저자원국에서 사용하는 사용자들의 관점에서 볼 때, 이러한 대부분의 해결책은 사용할 수 없습니다. 왜냐하면 이러한 해결책은 사용자의 설정에서 사용할 수 없는 GPU에 작업을 오프로드하기 때문입니다. 그러나 컴퓨터 비전 작업을 위해 CPU를 사용하는 것은 일반적으로 오프라인 프로세스입니다. 즉, 사용자는 출력이 사용 가능해지기 전에 CPU가 처리를 완료하기를 기다려야 합니다.

이것은 비디오 채팅 시나리오에서 받아들일 수 없습니다. 비디오 채팅은 자원 集중적이지만 자원 부족한 경우가 많습니다.真正로 민주적인 얼굴 개선 시스템은 최소 24fps의 속도로 합리적인 해상도에서 CPU에서 실행되어야 합니다. 이는 많은 것을 요구하는 것입니다.

대면

이 요구 사항은 미국의 새로운 연구에서 충족되며, 저자들은 이 시스템이 사용자의 얼굴을 몇 초 안에 학습하여 모델을 생성할 수 있다고 주장합니다. 최종 모델은 사용자와 회의 사이에서 공식 API 레이어를 통해 인터페이스로 실행됩니다.

재생을 위해 클릭하세요.FSFVE 프로젝트 페이지에서 샘플 개선된 웹캠 시나리오 얼굴, 3.5MB 모델, 2분 안에 학습. 소스

이 논문은 다음과 같이 말합니다:

‘FSFVE 모델은 비디오 통화 직전 또는 통화 시작 시 학습될 수 있습니다. 주체의 몇 개의 고품질 이미지가 필요합니다. 예를 들어, 5~30개의 이미지가 필요하며, 이는 few-shot 학습입니다. 통화 직전 또는 통화 시작 시, 사용자의 고품질 비디오를 몇 초간 얻을 수 있습니다. 예를 들어, 3초로, 3*24=72개의 프레임이 생성됩니다.

‘이 고품질 비디오는 비디오 통화 설정에 따라 저품질 비디오로 빠르게 재인코딩할 수 있으며, 이후 저품질 프레임과 고품질 프레임을 사용하여 모델을 학습할 수 있습니다.’

새로운 시스템의 주목할 점은 모델의 처리를 누가 ‘지불’하는지에 대한 유연성입니다. 사용자가 CPU 파워를 제공할 수 없는 경우, 모델의 학습을 상대방에게 오프로드할 수 있습니다. 모델은 ‘원격’으로 학습되며, 자원 부족한 사용자에게 제공됩니다.

또한, 모델의 학습을 서버에 시스템적으로 오프로드할 수 있습니다. 저자들은 다음과 같이 말합니다:

‘서버는 학습에 너무 느린 보내고 받는 장치를 위해 사용할 수 있습니다.

‘어떤 경우에든, 모델의 크기는 상대적으로 작습니다(약 3.5MB). 고품질 프레임도 작으며, 학습이 완료되면 모델은 일반적인 랩톱 CPU에서 실시간으로 실행될 수 있습니다.’

테스트에서, 모델은 기초선과 이전 연구(위에서 언급한 RTFVE를 포함하여 새로운 연구의 기초가 된 것)와 비교하여 일관되게 압축되지 않은 비디오, CPU 최적화된 ResNet, 수정된 RTFVE-0 모델을 능가했습니다. 또한, 모델은 실시간으로 CPU에서 실행되었습니다.

새로운 논문FSFVE: Few Shot Compressed Face Video Enhancement라는 제목을 가지고 있으며, 데모GitHub 리포지토리를 포함합니다.

방법

FSFVE는 공개된 FaceForensics++ 데이터셋에서 학습되었습니다. 이 데이터셋은 363개의 1080p 비디오로 구성되어 있으며, 배우들이 말하는 장면을 담고 있습니다. 저자들은 이 데이터셋에서 ‘벽을 향해 말하는’ 카테고리를 추출하여 일반적인 비디오 통화와 가장 유사한 스타일로 선택했습니다.

재생을 위해 클릭하세요.FaceForensics++ 데이터셋의 예시. 소스

이 하위 집합은 각 972프레임으로 구성된 27개의 비디오로 구성되어 있습니다. 대부분 전면 보기이지만, 일부 측면 보기도 포함되어 있습니다.

저품질 비디오를 생성하여 비디오 통화 연결 문제를 시뮬레이션하기 위해, 저자들은 H264와 H265 비디오 코덱을 사용하여 데이터셋을 압축했습니다. 압축 수준은 CRF 범위에서 36, 40, 44로 설정되었습니다.

각 프레임은 BlazeFace 얼굴 감지기를 사용하여 얼굴周囲의 256×256 영역으로 자르며, 이후 얼굴 키포인트를 사용하여 얼굴을 정렬했습니다. 이는 눈을 찾고, 아핀 변환을 적용하여 얼굴을 일관된 위치로 회전, 크기 조정 및 이동시킵니다.

이 작업은 Face Recognition 라이브러리를 사용하여 수행되었습니다.

이미지에서 얼굴 특징을 추출하는 Face Recognition Python 라이브러리 예시.

이미지에서 얼굴 특징을 추출하는 Face Recognition Python 라이브러리 예시. 소스

모델은 단 몇 프레임으로부터 얼굴의 가능한 모든 변화를 학습해야 하므로, 모델을 학습하기 위해 필요한 프레임은 가능한 한 많은 얼굴 변화를 포함해야 합니다. 따라서 k-평균 클러스터링을 사용하여 더 단순한 선택 방법(예: 랜덤 샘플링 또는 고정 간격 샘플링)을 대체했습니다.

각 자르고 정렬된 프레임은 RTFVE 얼굴 인코더를 통해 숫자로 표현되며, k-평균 클러스터링을 사용하여 유사한 프레임을 30개의 클러스터로 그룹화합니다. 이 클러스터링 프로세스는 5번 반복되어 최상의 그룹을 얻으며, 각 클러스터 중심에 가장 가까운 프레임을 선택하여 학습합니다. 이 프로세스는 각 비디오에 대해 30개의 다양한 이미지를 생성합니다.

학습 및 테스트

모델은 100개의 에포크 동안 학습되었습니다. 이는 매우 적은 수의 이미지로 학습하는 경우에는 상대적으로 낮은 수치입니다. 그러나 저자들은 과적합된 모델이 실제로 이 시나리오에서 원하는 모델임을 관찰합니다. 모델은 모든 가능성을 포착할 수는 없지만, 얼굴의 표현, 姿勢, 또는 얼굴 특징의 가리거나 은닉과 같은 비정상적인 경우를 다루는 데 중점을 둡니다. 대신, 모델은 중간 정도의 유연성과 속도를 갖습니다.

모델은 RAdam 최적화를 사용하여 10-4의 학습률로 학습되었습니다.

초기 테스트에서는 시스템이 원본 압축 비디오, CPU 최적화된 ResNet, 및 이전에 언급된 RTFVE와 비교되었습니다.

공정한 비교를 위해, RTFVE는 추론 중에 고품질 참조 이미지에 대한 의존성을 제거하여 속도와 매개변수 수를 비슷하게 유지하는 변형된 버전인 RTFVE-0을 생성했습니다. ResNet과 RTFVE-0 모델은 L1 손실 함수를 사용하여 학습되었습니다. 공정한 비교를 위해, 모든 모델은 동일한 RAdam 최적화와 학습 설정을 사용하며, 각 비디오에 대해 별도의 인스턴스별 모델이 30개의 프레임으로부터 학습되었습니다.

학습을 가속하기 위해, 저자들은 주파수 도메인에 중점을 둔 맞춤형 손실 함수를 도입하여 모델이 가장 시각적으로 중요한 이미지 세부 사항에 중점을 둘 수 있도록 했습니다.

이 가중치는 JPEG 루미넌스 양자화 행렬에서 파생되었습니다. 모델은 학습 중에 가장 시각적으로 중요한 이미지 구조에 중점을 둡니다.

양적 테스트

테스트에서는 기술적 재구성 정확도와 인식된 시각적 품질이 측정되었습니다. 왜곡은 피크 신호 대 노이즈 비율구조적 유사성 지수를 사용하여 측정되었습니다. 인식된 품질은 학습된 인식 패치 유사성을 사용하여 측정되었습니다.

H.264 및 H.265 비디오의 세 가지 압축 수준에서 원본 압축 비디오, CPU 최적화된 ResNet, 및 수정된 RTFVE-0와의 FSFVE 성능 비교. 더 높은 PSNR 및 SSIM은 더 나은 재구성 품질을 나타내며, 더 낮은 LPIPS는 더 나은 인식된 품질을 나타냅니다.

H.264 및 H.265 비디오의 세 가지 압축 수준에서 원본 압축 비디오, CPU 최적화된 ResNet, 및 수정된 RTFVE-0와의 FSFVE 성능 비교. 더 높은 PSNR 및 SSIM은 더 나은 재구성 품질을 나타내며, 더 낮은 LPIPS는 더 나은 인식된 품질을 나타냅니다.

FSFVE는 모든 압축 수준에서 원본 압축 비디오와 경쟁하는 CPU 기반 향상 모델을 능가했습니다.

H.264 비디오에서, PSNR은 CRF 값 36, 40, 44에서 각각 1.11dB, 1.37dB, 1.51dB으로 증가했습니다. 또한 SSIM과 LPIPS 점수가 개선되었습니다.

유사한 이득은 H.265에서 기록되었습니다. 이는 접근 방식이 주요 비디오 코덱 모두에서 효과적임을 나타냅니다.

비트레이트가 증가함에 따라 원본 H.264 비디오 및 향상된 출력의 PSNR. 더 낮은 비트레이트에서 갭이 넓어지는 것은 FSFVE가 가장 많이 압축된, 대역폭 제한된 조건에서 가장 큰 품질 이득을 제공한다는 것을 보여줍니다.

비트레이트가 증가함에 따라 원본 H.264 비디오 및 향상된 출력의 PSNR. 더 낮은 비트레이트에서 갭이 넓어지는 것은 FSFVE가 가장 많이 압축된, 대역폭 제한된 조건에서 가장 큰 품질 이득을 제공한다는 것을 보여줍니다.

CPU 최적화된 ResNet과 RTFVE-0은 원본 압축 비디오에 비해 약간의 개선을 제공했지만, FSFVE는 1.1dB 이상의 차이를 보이며 실시간 성능을 유지했습니다.

다음과 같이, 더 많은 학습 프레임이 제공될수록 성능이 개선되었습니다. 5개의 학습 이미지만으로도 FSFVE는 원본 압축 비디오에 비해 0.75dB 이상의 PSNR 개선을 제공했습니다.

CRF 44에서 보이지 않는 H.264 비디오 프레임에 대한 학습 집합 크기의 영향. 5개의 학습 이미지만으로도 원본 압축 비디오보다 품질이 개선되며, 더 많은 프레임이 제공될수록 성능이 개선됩니다.

CRF 44에서 보이지 않는 H.264 비디오 프레임에 대한 학습 집합 크기의 영향. 5개의 학습 이미지만으로도 원본 압축 비디오보다 품질이 개선되며, 더 많은 프레임이 제공될수록 성능이 개선됩니다.

질적 테스트

다음 결과는 질적 테스트의 일부입니다. 크게 압축된 H.264 비디오 프레임(CRF 44)과 해당하는 FSFVE 출력을 비교합니다.

CRF 44에서 크게 압축된 H.264 비디오 프레임과 해당하는 FSFVE 출력의 비교. 향상된 결과는 압축 아티팩트를 줄이고, 얼굴 구조를 복원하며, 더 자연스럽고 매끄러운 피부를 생성하며, 주체의 정체성과 표현을 유지합니다.

CRF 44에서 크게 압축된 H.264 비디오 프레임과 해당하는 FSFVE 출력의 비교. 향상된 결과는 압축 아티팩트를 줄이고, 얼굴 구조를 복원하며, 더 자연스럽고 매끄러운 피부를 생성하며, 주체의 정체성과 표현을 유지합니다. 원본 비디오와 PDF를 참조하시기 바랍니다.

저자들은 압축된 이미지가 눈, 코, 입 주변에 뚜렷한 아티팩트를 나타내며, 피부가 비정상적으로 질감이 있고, 얼굴 특징이 왜곡되어 있음을 유지합니다. 반면, 향상된 결과는 이러한 결함을 크게 줄입니다.

‘첫 번째 예에서는 눈이 불분명하고, 눈 화장이 눈 색상과 혼동됩니다. 입 주변에 앨리어싱이 나타납니다.眉毛는 정의가 없습니다. 피부는 왜곡되어 있습니다.

‘두 번째 예에서는 피부가 매우 질감이 있고, 스펙클 아티팩트가 있습니다. 입 아래에는 블록킹 아티팩트가 있습니다. 또한 수직선이 나타납니다.

‘우리의 모델은 이러한 아티팩트를 개선하여 시각적으로 즐거운 출력을 생성하며, 일부 손실된 세부 사항을 복원합니다.

‘중요한 것은, 향상된 출력이 비디오의 정체성을 유지한다는 것입니다.’

결론

산업과 학계에서 저품질 비디오 채팅 데이터의 품질을 향상시키는 지속적인 노력은 결국 비디오 채팅에서 깊은 가짜 영상을 감지하려는 노력과 충돌할 것입니다.

새로운 논문은 다음과 같이 말합니다. 중간 시스템인 FSFVE와 같은 시스템은 공식 API를 통해 비디오 채팅 스트림에 적용될 수 있으므로, 처리되지 않은 콘텐츠는 깊은 가짜를 감지하는 대책으로 사용될 수 있습니다.

 

* 새로운 논문에서 ‘DeepFakeDetector’ 데이터셋으로 언급되지만, 이 이름으로 알려지지 않았으며, 저자들이 이와 관련하여 연결된 FaceForensics++ 논문에서도 알려지지 않았습니다.

2026년 7월 14일 처음 게시되었습니다

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai