Anderson의 관점
AI를 사용하여 비디오에서 객체와 사람 제거

아이들이 사진에 남아 있지 않습니다. AI가 모든 것을 처리하기 때문입니다.
이미지와 비디오에서 사람과 객체를 제거하는 것은 VFX 중심의 AI 문헌에서 인기 있는 연구 분야로, 이 도전에 대한 전용 데이터셋과 프레임워크가 점점 더 많아지고 있습니다. 중국 푸단 대학의 빅데이터 연구소에서 개발한最新의 연구는 EffectErase라는 ‘효과 인식’ 비디오 객체 제거 시스템으로, 저자들은 이 시스템이 테스트에서 현재 상태를 크게 개선한다고 주장합니다.
프로젝트 웹사이트의 자료에서 조립된 EffectErase 방법의 예시입니다. 링크를 제공하지만, 소스 사이트에는 많은 고해상도 비디오와 비최적화된 자동 재생 비디오가 포함되어 있으므로 웹 브라우저의 안정성을 영향을 줄 수 있습니다. 동영상은 더 쉽게 참조할 수 있으며 이 기사의 끝에 포함되어 있습니다. 소스
새로운 연구에는 거의 350개의 원래 실제 장면과 합성 장면(공개 저장소를 사용하여)을 포함하는 반신종 데이터셋의 생성 및 큐레이션이 포함되었습니다. 이 데이터셋은 EffectErase 애플리케이션의 기반이며, 이는 오픈 소스 Blender 3D 프레임워크를 사용하여 구축된 워크플로우에서 캡처되거나 재사용되었습니다.
하이브리드 비디오 객체 제거(VOR) 데이터셋은 EffectErase 애플리케이션 자체를 구성하며, 또한 두 개의 새로운 관련 벤치마크인 VOR Eval과 VOR Wild를 정의합니다. 각각은 그라운드 트루스가 있는 샘플과 없는 샘플에 대해 사용됩니다.
연구자들은 또한 프로젝트 사이트가 있지만, 여러 고해상도 비디오로 과부화되어 로딩이 어려울 수 있으므로, 위에 첨부된 동영상에서 제가 큐레이션한 예시를 참조하십시오.

비교 가능한 이전 데이터셋과 새로운 데이터셋의 양적 비교. 소스
연구자들은 자신의 접근 방식이 정량적 지표와 질적 결과 모두에서 최첨단 성능을 발휘한다고 주장합니다.
그들은 이전 연구가 객체의 부수적 효과를 제거하는 데 항상 성공하지 못했으며, 그들의 데이터셋이 이러한 결함을 수정하기 위해 신중하게 생성되었다고 주장합니다.

이전 접근 방식이 객체 제거를 위해 객체를 넘어선 부수적 효과를 고려하지 못하는 예시.
푸단 대학의 컴퓨터 과학 및 인공 지능 대학의 4명의 연구자로부터 새로운 논문은 EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing라는 제목을 가지고 있습니다.
방법
하이브리드 VOR 데이터셋은 비디오에서 사람이나 객체를 제거하는 시도를 위한 모든 시나리오를 포함하도록 설계되었습니다.

VOR 데이터셋의 짝지어진 프레임은 객체 제거가 객체 자체를 넘어선 부수적 효과까지 고려해야 함을 보여줍니다.
연구자들은 5가지 대표적인 ‘간섭’ 유형을 정의했습니다. 오염, 그림자, 조명, 반사, 변형입니다.

VOR 데이터셋의 구축 파이프라인.
실제 데이터의 경우, 연구자들은 다양한 환경, 시간, 날씨 조건에서 ‘있음’과 ‘없음’ 장면을 녹화하기 위해 고정 카메라를 사용했습니다.
합성 데이터의 경우, 여러 시점에서 렌더링되었으며, 복잡한 카메라 움직임을 특징으로 하는 다중 객체 시나리오가 생성되었습니다.
운동 다양성을 증가시키기 위해, 연구자들은 카메라로 녹화된 쌍에 Ken Burns 효과를 적용했습니다.
규모와 다양성을 확장하기 위해, 연구자들은 합성 객체와 다중 카메라 설정을 결합했습니다. 마스크는 주요 프레임에 수동 포인트 프롬프트를 배치하여 생성되었습니다.
최종 컬렉션은 145시간의 비디오와 60,000개의 실제 및 합성된 쌍으로 구성되며, 366개의 객체 클래스와 443개의 장면을 다룹니다.
EffectErase 네트워크는 VAE를 통해 입력을 받으며, 잠재적 잡음 처리는 Wan2.1에서 처리합니다. 이 백본 위에서 EffectErase는 제거-삽입 공동 학습, 작업 인식 지역 가이드, 효과 일관성 손실을 수행합니다.

EffectErase 프레임워크의 스키마.
데이터 및 테스트
연구자들은 다양한 inpainting, 비디오 inpainting, 객체 제거 방법과 비교했습니다.
Wan2.1은 LoRA를 사용하여 VOR 데이터셋에서 미세 조정되었습니다.
테스트에는 ROSE-Benchmark, VOR-Eval, VOR-Wild가 포함되었습니다.
평가 지표로는 PSNR, SSIM, LPIPS, FVD가 사용되었습니다.
또한, 연구자들은 QScore를 개발하여 객체 제거 비디오 출력의 품질을 평가했습니다.

ROSE 및 VOR 벤치마크의 양적 비교.
결론
이 연구는 비디오에서 객체와 사람을 제거하는 데 효과적인 접근 방식을 제공합니다.
이 연구는 EffectErase라는 새로운 시스템을 제시하며, 이는 객체 제거와 삽입을 위한 공동 학습을 수행합니다.
이 시스템은 다양한 테스트에서 뛰어난 성능을 보여주었습니다.
연구자들은 이 시스템이 비디오에서 객체와 사람을 제거하는 데 유용할 수 있다고 주장합니다.
* -growing IP-provenance issue로 인해 모든 소스가 인용되기를 바랍니다. 그러나 새로운 연구에서 3D 모델의 소스를 찾을 수 없었습니다.
† VAE에 대한 일반적인 설명 텍스트입니다.
†† 미세 조정과 LoRA는 서로 다른 프로세스이며 서로 다른 요구를 가집니다.
2026년 3월 21일 처음 게시되었습니다.












