Anderson의 관점

AI 기반 비디오 편집의 길

mm
Unite.AI를 Google의 선호 소스에 추가
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

비디오/이미지 합성 연구 분야는 정기적으로 비디오 편집 아키텍처를 출력하며, 지난 9개월 동안 이러한 출시는 더욱 빈번해졌습니다. 그러나 대부분의 출시는 상태에 대한 미세한 개선만을 나타내며, 핵심적인 도전은 상당합니다.

그러나 중국과 일본의 새로운 협력은 접근 방식에 대한 더 가까운 검토를 필요로 하는 몇 가지 예를 생성했습니다.

아래의 비디오 클립(논문의 관련 프로젝트 사이트에서, 경고: 브라우저를 과부화시킬 수 있음)에서 우리는 시스템이 현재 구성에서 딥페이크 기능이 없지만 비디오 마스크(하단 왼쪽)를 기반으로 젊은 여자의 정체성을 훌륭하게 변경하는 것을 볼 수 있습니다.

재생을 클릭하세요. 하단 왼쪽에 시각화된 의미론적 분할 마스크를 기반으로 원본(상단 왼쪽) 여자가 현저히 다른 정체성으로 변환됩니다. 출처: https://yxbian23.github.io/project/video-painter/ (작성 시점에 이 자동 재생 및 비디오가 많은 사이트는 브라우저를 충돌시키는 경향이 있었습니다). 더 나은 해상도 및 세부 사항을 위해 소스 비디오 또는 https://www.youtube.com/watch?v=HYzNfsD3A0s의 프로젝트 개요 비디오를 참조하십시오.

이러한 종류의 마스크 기반 편집은 정적 잠재 확산 모델에서 잘 정립되어 있으며, ControlNet과 같은 도구를 사용하여 수행할 수 있습니다. 그러나 비디오에서 배경 일관성을 유지하는 것은 훨씬 더 어려운 도전이며, 마스킹된 영역이 모델에 창의적인 유연성을 제공하더라도 그렇습니다.

재생을 클릭하세요. 새로운 VideoPainter 방법을 사용한 종의 변경. 더 나은 해상도 및 세부 사항을 위해 소스 비디오 또는 https://www.youtube.com/watch?v=HYzNfsD3A0s의 프로젝트 개요 비디오를 참조하십시오.

이 연구의 저자들은 자신의 방법을 Tencent의 BrushNet 아키텍처와 ControlNet과 관련하여 고려하며, 두 아키텍처 모두 전경과 배경 생성을 분리할 수 있는 이중 분기 아키텍처를 다룹니다.

그러나 Diffusion Transformers(DiT) 접근 방식을 직접 적용하는 것은 특정 도전을 제기합니다.

‘[직접] 적용[BrushNet 및 ControlNet의 아키텍처] 비디오 DiT는 여러 도전을 제기합니다: [첫째, 주어진] 비디오 DiT의 강력한 생성 기반과 큰 모델 크기, 전체/반 기관 Video DiT 백본을 컨텍스트 인코더로 복제하는 것은 불필요하고 계산적으로 금지될 것입니다.

‘[둘째, BrushNet의 순수한 합성 제어 분기와 달리] DiT의 마스킹된 영역 토큰에는 전역 주의로 인해 배경 정보가 내재되어 있어 DiT 백본에서 마스킹된 및 마스킹되지 않은 영역을 구별하는 것이 복잡해집니다.

‘[마지막으로,] ControlNet은 모든 계층에 대한 기능 주입이 부족하여 인페인팅 작업을 위한 밀도 배경 제어가 어려워집니다.’

따라서 연구자들은 VideoPainter라는 이중 분기 프레임워크를 제안합니다.

VideoPainter는 사전 훈련된 DiT를 가벼운 컨텍스트 인코더와 함께 향상된 비디오 인페인팅 프레임워크를 제공합니다. 이 인코더는 백본의 매개변수 중仅 6%만을 차지하며, 저자들은 이 접근 방식이 전통적인 방법보다 더 효율적이라고 주장합니다.

모델은 세 가지 주요 혁신을 제안합니다: 효율적인 배경 지침을 위한 간소화된 2층 컨텍스트 인코더; 마스킹된 토큰과 마스킹되지 않은 토큰을 분리하는 마스크 선택적 특징 통합 시스템; 및 장기 비디오 시퀀스에서 정체성 일관성을 유지하기 위한 인페인팅 영역 ID 재샘플링 기술입니다.

VideoPainter는 사전 훈련된 DiT와 컨텍스트 인코더를 동결하고 ID 어댑터를 도입하여 인페인팅 영역 토큰이 이전 클립에서 지속되도록 하여 깜빡거림과 일관성이 없는 것을 줄입니다.

이 프레임워크는 또한 플러그 앤 플레이 호환성을 위해 설계되어 기존 비디오 생성 및 편집 워크플로에 쉽게 통합할 수 있습니다.

이 연구를 지원하기 위해 저자들은 CogVideo-5B-I2V를 생성 엔진으로 사용하여 현재까지 가장 큰 비디오 인페인팅 데이터 세트인 VPData를 구축했습니다. 이 데이터 세트에는 390,000개 이상의 클립이 포함되어 있으며 총 비디오 기간은 886시간 이상입니다. 또한 관련 벤치마크 프레임워크인 VPBench를 개발했습니다.

재생을 클릭하세요. 프로젝트 웹사이트의 예시에서 VPData 컬렉션과 VPBench 테스트 스위트의 세분화 기능을 볼 수 있습니다. 더 나은 해상도 및 세부 사항을 위해 소스 비디오 또는 https://www.youtube.com/watch?v=HYzNfsD3A0s의 프로젝트 개요 비디오를 참조하십시오.

이 새로운 연구는 VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control라는 제목으로, 텐센트 ARC 랩, 홍콩 중국 대학, 도쿄 대학, 마카오 대학의 7명의 저자에 의해 수행되었습니다.

저자들은 프로젝트 사이트 외에도 더 접근하기 쉬운 YouTube 개요 및 Hugging Face 페이지를 공개했습니다.

방법

VPData의 데이터 수집 파이프라인은 수집, 주석, 분할, 선택 및 캡션으로 구성됩니다.

데이터セット 구축 파이프라인에 대한 스키마.

데이터セット 구축 파이프라인에 대한 스키마. 출처: https://arxiv.org/pdf/2503.05639

이 컴파일에 사용된 소스 컬렉션은 Videvo와 Pexels에서 가져왔으며, 초기에 약 450,000개의 비디오를 얻었습니다.

여러 라이브러리와 방법이 전처리 단계를 구성했습니다. Recognize Anything 프레임워크는 개방형 비디오 태깅을 위해 사용되어 주요 개체를 식별하는 데 사용되었습니다. Grounding Dino는 식별된 개체를 둘러싼 바운딩 박스의 감지를 위해 사용되었습니다. Segment Anything Model 2(SAM 2) 프레임워크는 이러한 거친 선택을 높은 품질의 마스크 세분화로 정제하기 위해 사용되었습니다.

장면 전환을 관리하고 비디오 인페인팅에서 일관성을 보장하기 위해 VideoPainter는 PySceneDetect를 사용하여 자연적인 중단점에서 클립을 식별하고 분할합니다. 클립은 10초 간격으로 나누어졌으며, 6초 미만의 클립은 삭제되었습니다.

데이터 선택을 위해 세 가지 필터링 기준이 적용되었습니다: 미적 품질, 동작 강도, 콘텐츠 안전성.

기존 비디오 세분화 데이터 세트의 주요 제한은 세부 텍스트 주석의 부족입니다.

비교 가능한 컬렉션에서 비디오 캡셔닝의 부족을 강조합니다.

비교 가능한 컬렉션에서 비디오 캡셔닝의 부족을 강조합니다.

따라서 VideoPainter 데이터 큐레이션 프로세스는 다양한 선도적인 비전-언어 모델을 통합하여 키프레임 기반 캡션과 마스킹된 영역의詳細한 설명을 생성합니다.

VideoPainter는 사전 훈련된 DiT를 사용자 지정 가벼운 컨텍스트 인코더와 함께 향상시킵니다. 이 인코더는 배경과 전경 생성을 분리하여, 상위 오른쪽에 표시된 스키마에서 볼 수 있습니다.

VideoPainter에 대한 개념적 스키마.

VideoPainter에 대한 개념적 스키마.

이 인코더는 노이즈 laten, 다운샘플링된 마스크 및 마스킹된 비디오 laten을 VAE를 통해 처리하여, 배경 토큰만을 사전 훈련된 DiT에 통합합니다.

노이즈 laten은 생성 컨텍스트를 제공하며, 마스킹된 비디오 laten은 DiT의 기존 분포와 일치하도록 설계되어 호환성을 향상시킵니다.

VideoPainter는 DiT의 첫 두 계층만을 추출하여, 이러한 특징을 구조화된 방식으로 동결된 DiT에 다시 통합합니다.

추가적으로, 토큰 선택적 메커니즘은 배경 관련 특징만을 재통합하여, 마스킹된 및 마스킹되지 않은 영역 사이의 혼동을 방지합니다.

저자들은 이 접근 방식이 배경 보존의 높은 신뢰성을 유지하면서 전경 인페인팅 효율성을 향상시킨다고 주장합니다.

저자들은 또한 VideoPainter가 다양한 스타일화 방법을 지원한다고 언급합니다.

데이터 및 테스트

VideoPainter는 CogVideo-5B-I2V 모델과 함께 훈련되었습니다. VPData는 480x720px 해상도와 1×10^-5의 학습률로 사용되었습니다.

ID Resample Adapter는 2,000 스텝으로, 컨텍스트 인코더는 80,000 스텝으로 AdamW 최적화를 사용하여 훈련되었습니다. 훈련은 64개의 NVIDIA V100 GPU를 사용하여 두 단계로 수행되었습니다.

벤치마크를 위해 Davis는 무작위 마스크에 대해, 저자들의 VPBench는 세분화 마스크에 대해 사용되었습니다.

VPBench 데이터 세트는 객체, 동물, 인간, 풍경 및 다양한 작업을 특징으로 하며, 추가, 제거, 변경 및 교환의 네 가지 작업을 다룹니다. 이 컬렉션에는 45개의 6초 비디오와 평균 30초의 9개의 비디오가 포함되어 있습니다.

8개의 지표가 프로세스에 사용되었습니다. 마스킹된 영역 보존을 위해 피크 신호 대 노이즈 비율(PSNR), 학습된 지각적 유사성 지표(LPIPS), 구조적 유사성 지수(SSIM), 평균 절대 오차(MAE)가 사용되었습니다.

텍스트 정렬을 위해 CLIP 유사성이 사용되었습니다.

비디오의 일반적인 품질을 평가하기 위해 Fréchet Video Distance(FVD)가 사용되었습니다.

비디오 인페인팅을 위한 양적 비교를 위해 VideoPainter는 ProPainter, COCOCO 및 Cog-Inp(CogVideoX)와 비교되었습니다.

저자들은 VideoPainter가 마스킹된 영역 보존, 텍스트 정렬 및 비디오 품질에서 최적의 성능을 달성한다고 주장합니다.

정적인 질적 결과에 대해 저자들은 다음과 같이 말합니다.

‘VPBench의 세분화 기반에서 ProPainter와 COCOCO는 대부분의 지표에서 최악의 성능을 나타냅니다. 이는 마스キング된 개체를 완전히 인페인팅할 수 없으며, 단일 백본 아키텍처가 배경 보존과 전경 생성을 균형 있게 처리하는 데 어려움을 겪기 때문입니다.

‘Davis의 무작위 마스크 벤치마크에서 ProPainter는 부분 배경 정보를 활용하여 성능을 개선합니다. 그러나 VideoPainter는 이중 분기 아키텍처를 통해 배경 보존과 전경 생성을 효과적으로 분리하여, 표준 및 긴 길이의 세분화 및 무작위 마스크에서 최적의 성능을 달성합니다.’

저자들은 또한 VideoPainter의 캡션을 강화하고 개선된 결과를 얻는 능력을 테스트했습니다.

30명의 사용자가 50개의 무작위로 선택된 생성물을 평가하도록 요청받은 사용자 연구도 수행되었습니다.

저자들은 VideoPainter가 모든 평가 기준에서 기존 기준을凌駕한다고 주장합니다.

결론

VideoPainter는 문헌에 가치 있는 추가입니다. 그러나 최근의 많은 솔루션과 마찬가지로, 상당한 컴퓨팅 요구를 가지고 있습니다. 또한 프로젝트 사이트에서 선택된 많은 예제는 최고의 예제에서 매우 멀리 떨어져 있습니다. 따라서 이 프레임워크를 향후의 참가자와 더广い 범위의 이전 접근 방식과 비교하는 것이 흥미로울 것입니다.

* ‘비디오 편집’이라는 용어는 전통적인 의미인 ‘다양한 클립을 시퀀스로 조합하는 것’이 아니라, 기계 학습 기술을 사용하여 기존 비디오 클립의 내부 콘텐츠를 직접 변경하거나 수정하는 것을 의미합니다.

처음 게시됨: 2025년 3월 10일. 2026년 7월 25일 비디오를 교체하기 위해 업데이트되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai