Anderson의 관점

AI를 사용하여 비디오에서 객체와 사람 제거

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

AI가 개입한다면, 영상 속 아이는 그 자리에 계속 남아 있지 않는다.

이미지와 영상에서 사람이나 물체를 지우는 기술은 VFX 중심 AI 연구의 주요 분야로 자리 잡았고, 이를 위한 데이터셋과 프레임워크도 빠르게 늘고 있다. 중국 Fudan University의 Institute of Big Data가 공개한 최신 연구는 EffectErase라는 ‘효과 인식형’ 영상 객체 제거 시스템이다. 연구진은 시험에서 기존 최고 수준을 뚜렷하게 넘어섰다고 주장한다.

위 영상은 프로젝트 웹사이트의 사례를 편집한 것이다. 원 사이트에는 최적화되지 않은 고해상도 자동 재생 영상이 많아 브라우저에 부담을 줄 수 있으므로, 기사 끝의 YouTube 영상이 더 편리하고 완전한 참고 자료다.

연구에는 실제 및 합성 장면 약 350개를 새로 촬영하거나 선별하는 작업이 포함됐다. 공개 저장소의 자료도 활용했고, 전용 장비로 촬영한 영상과 오픈소스 Blender 3D 기반 워크플로로 만든 자료를 함께 구성했다.

이 혼합형 Video Object Removal(VOR) 데이터셋은 Wan2.1 영상 생성 시스템 위에 구축된 EffectErase의 토대다. 연구진은 정답 배경이 있는 표본용 VOR-Eval과 정답 배경이 없는 실제 인터넷 영상용 VOR-Wild라는 두 벤치마크도 정의했다.

새 VOR 데이터셋과 기존 유사 데이터셋의 규모 비교

새 VOR 데이터셋과 기존 유사 데이터셋의 규모 비교. 출처

연구진은 정량 지표뿐 아니라 사람이 평가한 정성 결과에서도 최고 수준의 성능을 얻었다고 말한다. 기존 방법은 물체 자체는 지우더라도 그림자, 반사, 조명 변화 같은 부수 효과를 남기는 경우가 많았고, 새 데이터셋은 이 결함을 직접 다루도록 설계됐다.

기존 방식이 제거 대상의 그림자와 반사 같은 간접 흔적을 없애지 못한 사례

기존 방식이 제거 대상 그 자체를 넘어 반사와 그림자 같은 간접 흔적을 처리하지 못한 사례.

논문 제목은 EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing이며, Fudan University College of Computer Science and Artificial Intelligence 연구자 네 명이 작성했다.

방법

혼합형 VOR 데이터셋은 영상에서 사람이나 물체를 지울 때 생길 수 있는 여러 상황을 폭넓게 담도록 설계됐다.

VOR 데이터셋의 짝 프레임은 객체뿐 아니라 가림 그림자 조명 반사 변형도 함께 제거해야 함을 보여준다

VOR 데이터셋의 짝 프레임. 객체 제거는 보이는 대상만 지우는 데 그치지 않고, 가림·그림자·조명 변화·반사·물리적 변형처럼 객체가 유발한 효과까지 없애야 한다. 각 사례는 객체가 있는 입력과 제거 뒤의 깨끗한 배경을 나란히 보여준다.

저자들이 정의한 대표적 간섭은 다섯 가지다. 유리나 연기에 의한 가림, 그림자, 제거 대상이 빛의 경로를 만들거나 바꿀 때 생기는 조명 변화, 반사, 그리고 사람이 소파 쿠션에 남긴 눌림처럼 대상이 사라진 뒤에도 남을 수 있는 물리적 변형이다.

Blender 합성 장면과 실제 촬영을 결합한 VOR 데이터셋 구축 파이프라인

VOR 데이터셋 구축 파이프라인. 선별한 3D 환경·객체·카메라 경로로 합성 장면을 만들고 다양한 실제 장면을 촬영한 뒤 Ken Burns 움직임을 더했다. SAM2 분할과 수동 보정으로 서로 정렬된 전경·배경·마스크 영상 삼중항을 생성했다.

실제 자료는 고정 카메라로 다양한 환경, 시간대, 날씨에서 대상이 있는 장면과 없는 장면을 짝지어 촬영했다. 합성 자료는 여러 시점과 다중 객체 장면을 렌더링하고 현실 영상에서 나타날 법한 복잡한 카메라 움직임을 넣었다. 연구진은 이 과정이 유사한 ROSE 데이터셋보다 더 정교하고 노동집약적이라고 설명한다.

움직임의 다양성을 높이기 위해 촬영한 영상 쌍에 Ken Burns 효과를 적용했다. 14개의 미리 정한 규칙에 따라 패닝, 줌, 가벼운 손떨림을 더하고 각 쌍에서 다섯 가지 움직임 패턴을 표본화하되, 크롭 영역은 원본 프레임 안에 유지했다.

합성 객체와 여러 카메라 설정을 조합해 규모와 다양성을 더 늘렸다. 핵심 프레임에 수동 포인트 프롬프트를 지정하고 Segment Anything 2(SAM2)로 분할을 전파한 뒤 결과를 정리·보정해 검증된 전경, 배경, 마스크 삼중항을 만들었다. 최종 데이터는 실제 및 합성 짝 영상 6만 개, 총 145시간이며 443개 장면의 366개 객체 클래스를 포함한다.

EffectErase 구조

EffectErase는 입력 영상을 Variational Auto-Encoder(VAE)로 잠재 공간에 인코딩하고 Wan2.1이 잠재 노이즈 제거를 담당한다. 그 위에서 제거와 삽입을 같은 영역에 대해 함께 학습하는 Removal-Insertion Joint Learning, 객체 및 작업 토큰과 교차 어텐션을 사용하는 Task-Aware Region Guidance(TARG), 두 작업의 효과 영역을 맞추는 Effect Consistency Loss를 결합한다.

EffectErase 프레임워크 구조

EffectErase 구조. 학습 중 짝 영상은 공통 잠재 공간으로 인코딩되고 노이즈와 결합된 뒤 작업 인식 교차 어텐션이 안내하는 확산 트랜스포머를 통과한다. 효과 일관성 손실은 제거와 삽입 분기가 같은 영역에 집중하도록 맞춘다.

제거와 삽입은 공유 확산 백본에서 함께 학습되므로 두 작업이 동일한 영향 영역과 구조적 단서를 보게 된다. 객체가 있는 영상, 배경만 있는 영상, 마스크를 먼저 잠재 공간에 넣고 확산 학습용 노이즈를 추가한다. 가벼운 어댑터가 노이즈 특징과 제거 또는 삽입 조건을 융합해 두 작업이 감독 신호를 공유하면서도 각각 제어될 수 있게 한다.

TARG는 언어 토큰과 CLIP으로 추출한 전경 객체의 시각 특징을 결합해 작업별 신호를 만든다. 일반적인 객체 토큰을 실제 이미지 내용에서 얻은 임베딩으로 바꾸고 이를 교차 어텐션으로 백본에 주입해, 객체와 그 시각적 효과가 시간과 공간에서 어떻게 움직이는지 추적하면서 제거와 삽입을 전환할 수 있게 한다.

Effect Consistency Loss는 두 작업이 같은 객체와 부수 효과를 다루므로 제거 분기와 삽입 분기가 동일한 변화 영역에 집중하도록 강제한다. 두 분기의 어텐션 맵을 부드러운 영역 맵으로 합치고, 객체 영상과 배경 영상의 차이 맵에 맞춘다. 이 추가 손실은 조명과 그림자처럼 미세한 변화도 보존하고 삽입 학습이 제거를 돕게 한다.

데이터와 시험

연구진은 OmniPaint, ObjectClear, VACE, DiffuEraser, ProPainter, ROSE, MiniMax-Remover 등 이미지 인페인팅, 영상 인페인팅, 객체 제거 방법과 비교했다.

Wan2.1은 VOR 데이터셋에서 LoRA로 미세 조정됐다. 해상도는 832×480픽셀이며, Wan이 안정적으로 처리할 수 있는 사실상 한계인 연속 81프레임을 무작위 표본화했다. 학습은 VRAM 80GB H100 GPU 8대에서 배치 크기 8로 12만9천 회 진행됐고 LoRA 랭크는 256이었다.

외부 자료로는 합성 ROSE-Benchmark를 사용했고, 나머지는 VOR 데이터셋의 시험 분할인 VOR-Eval과 인터넷에서 수집한 동적 객체 실제 영상 195개로 구성된 VOR-Wild였다.

평가 지표는 PSNR, SSIM, LPIPS, FVD였다. VOR-Wild에서 생성한 영상 195개는 자원봉사자 20명이 평가한 사용자 연구도 수행했다. 연구진은 Qwen-VL 멀티모달 모델을 활용해 제거 뒤 남은 잔상이나 그림자·조명 효과의 미제거 여부를 평가하는 QScore도 새로 만들었다.

ROSE 및 VOR 벤치마크의 정량 비교

ROSE 및 VOR 벤치마크의 정량 비교. 최고와 두 번째 결과는 각각 굵은 글씨와 밑줄로 표시됐다.

저자들은 프레임별 2D 이미지 인페인팅은 시간적 모델링이 없어 영상 일관성을 유지하기 어렵고, 최근 영상 인페인팅도 객체의 부수 효과를 명시적으로 모델링하지 않아 부자연스러운 결과를 낸다고 지적한다. 기존 영상 객체 제거법도 객체와 부수 효과의 시공간 상관관계를 충분히 다루지 못해 흔적과 인공물이 남는다.

EffectErase는 모든 데이터셋과 지표에서 최고 수준의 결과를 냈다. 특히 영상 품질 지표 FVD에서 가장 좋은 점수를 얻어 시간적 부드러움과 일관성을 보였고, QScore와 사용자 평가에서도 가장 높은 성과를 냈다.

가림 그림자 조명 반사 변형 사례에서 VOR-Eval 정성 비교

가림, 그림자, 조명, 반사, 변형 사례에서 VOR-Eval 정성 비교. 인페인팅은 마스크 밖의 효과를 지우기 어렵고 기존 제거 모델은 흔적을 남기는 경우가 많다. EffectErase는 대상과 그 부수 효과를 더 깨끗하게 제거했다.


머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai