Anderson의 관점

AI 배경 제거를 위한 비용 없는 인간 주석 없이 개선

mm
Unite.AI를 Google의 선호 소스에 추가
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

새로운 연구에 따르면 AI는 비디오에서 사람을 깨끗이 잘라낼 수 있으며, 이는 품질과 안정성을 개선할 수 있습니다.

 

대부분의 사람들이 비디오 채팅 플랫폼에서 간단한 배경 변경/가리기 필터를 통해 배경에서 ‘떨어져’ 있는 경험을 해보았을 것입니다. 이러한 시스템의 한계를 알아차렸을 것입니다. 이러한 시스템은 비디오 회의에서 가장 자주 발생하는 경우에 대해 훈련되며, 예상치 못한 경우나 예측 가능한 객체(예: 손가락)에도 강건하지 않습니다.

AI 훈련된 전경 추출 시스템이 원본 주체의 너무 많은 부분을 자르는 일반적인 예입니다. 출처 - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

AI 훈련된 전경 추출 시스템이 원본 주체의 너무 많은 부분을 자르는 일반적인 예입니다.. 출처

가장 쉬운 해결책은 비전 언어 모델(VLM)이 이러한 작업에 특화되지 않은 경우에 점점 더 인기를 얻고 있는 기존 모델을 데이터에 맞게 조정하는 것입니다. 이러한 데이터는 시스템에서 만날 수 있는 데이터일 수 있습니다.

2020년 논문 '실시간 고해상도 배경 매칭'에서 제시된 두 가지 고용량의 세세하게 주석이 달린 데이터셋

2020년 논문 ‘실시간 고해상도 배경 매칭’에서 제시된 두 가지 고용량의 세세하게 주석이 달린 데이터셋. 출처

그러나 이러한 데이터는 비용이 들고 시간이 걸리는 인간의 주석이 필요합니다. 또한 이는 특정한 도구를 만들어내며, 비용이 많이 들고, 한 가지 작업에만 사용할 수 있습니다.

특정한 모델을 개발하는 것은 현재 다양한 도메인에서 효과적인 추론에 도달하는 가장 빠른 길입니다. 지금까지 제시된 대부분의 무감독 학습 솔루션은 문제를 해결하는 것보다 문제를 회피하는 것에 더 중점을 두었습니다.

배경 제거!

최근에는 Segment Anything(SAM) 계열을 사용하여 자동화된 세세한 추출을 제공하는 데 관심이 증가했습니다. SAM은 주석을 지원하기 위해 개발되었으며, 표준적인 시각적 효과 파이프라인에서 받아들여지는 선명한 윤곽선을 제공하지 않습니다.

재생을 위해 클릭하세요. 주석을 위한 이상적인 도구이지만, 시각적 효과를 위한 것은 아닙니다.출처 

최근 중국의 연구에서는 SAM 모델을 사용하여 더 정교한 추출 과정을 얻는 방법을 제안했습니다. 이는 SAM과 같은 기본 추적기와 마팅 헤드를 갖춘 지역 제안 브리지를 결합하여 엣지 세부 정보를 반복적으로 개선하고, 헤어와 같은 도전적인 엣지를 해결할 수 있습니다.

재생을 위해 클릭하세요. 새로운 방법의 정교함을 보여주는 보조 비디오입니다.출처 

중요한 것은 이 새로운 복합 시스템이 비디오가 아닌 이미지로만 훈련되고, 추가적인 인간 주석이 필요하지 않다는 것입니다.

새로운 방법으로 얻은 세세한 이미지 및 비디오 매칭의 예시

새로운 방법으로 얻은 세세한 이미지 및 비디오 매칭의 예시. 출처

작성자는 세 가지 실험 모델을 생성하여 이 작업에서 새로운 최적의 성능을 달성했으며, 기본 모델의 더 높은 일반화 능력을 유지하면서도 더 많은 능력을 가진 모델을 생성했습니다.

작성자는 다음과 같이 말합니다:

‘포괄적인 실험은 SAM2Matting이 이미지 및 비디오 매칭에서 최적의 성능을 달성한다는 것을 보여줍니다.

‘광범위한 실세계 결과는 또한 빠른 동작, 복잡한 배경 및 대상 부착(예: 자전거를 타는 사람)과 같은 시나리오에서 강한 일반화를 보여줍니다.

‘또한 우리의 매칭 구성 요소는 경량이고 효율적이며, SAM2.1-Tiny 버전이 200프레임 1080p 비디오에서 5GB 미만의 GPU 메모리를 사용하여 40프레임으로 실행할 수 있습니다.

새로운 논문SAM2Matting: 일반화된 이미지 및 비디오 매칭으로 제목이 붙여졌으며, 푸단 대학과 상하이 금융경제 대학의 네 명의 저자에 의해 작성되었습니다. 이 연구에는 GitHub 리포지토리가 있으며, 체크포인트, 추론 코드 및 상호작용 데모가 포함되어 있으며, 훈련 코드의 출시가 약속되어 있습니다. 또한 프로젝트 사이트가 있습니다.

방법

작성자의 방법은 추적과 세부 정보 추출을 분리하여 비디오 객체 분할(VOS) 추적기를 사용하여 각 프레임에 시간적으로 일관된 粗한 마스크를 생성합니다. 그리고 전용 매칭 파이프라인을 통해 경계를 세부화합니다.

파이프라인 개요

파이프라인 개요

지역 관심 영역(ROI) 탐지기는 세부 정보 또는 반투명성이 있는 영역을 식별하여 이를 트리맵으로 변환하여 세부화에 대한 지침을 제공합니다. 이후 점진적인 다중 스케일 예측기가 최종 높은 해상도의 매트를 생성하기 위해 중간 결과를 粗한 스케일에서 세부 스케일로 전달합니다.

従来의 매칭 시스템은 일반적으로 단순한 형태학적 연산 또는 마스크를 직접 재사용하여 관심 영역을 파악합니다. 이러한 접근법은 세부 정보를 놓치거나, 세부화가 필요한 영역을 포함하지 않을 수 있습니다.

표준 마스크 기반 처리와 근거 真実 트리맵의 비교

표준 마스크 기반 처리와 근거 真実 트리맵의 비교

복리

반대로, 제안된 ROI 탐지기는 이 단계를 픽셀 단위의 분류 작업으로 간주하여 VOS 마스크, 현재 프레임 및 다중 스케일 이미지 특징을 통합하여 매칭에 중요한 영역을 더 정밀하게 분리합니다.

새로운 접근법에서 예측된 ROI는 먼저 마스크를 사용하여 알려진 영역을 할당하고 ROI를 모호한 것으로 표시하여 이후 처리에서 경계를 명확하게 할 수 있습니다.

세부화는 점진적인 알파 예측기를 통해 처리되며, 이는 매칭을 단계적으로 처리하여 粗한 스케일에서 세부 스케일로 중간 결과를 전달합니다. 각 단계에서는 이미지, 트리맵 및 이전 추정치를 사용하여 구조를 점진적으로 선명하게 하고 세부 정보를 회복합니다.

최종 단계에서最高 해상도 출력은 완성된 매트를 생성하기 위해 업샘플링됩니다. 이는 초기에 광범위한 형태를 설정하고 이후의 패스에서 헤어 및 투명성과 같은 세부 요소를 해결합니다.

훈련 중에 작성자는 VOS 추적기를 동결하고 매칭 구성 요소만을 높은 품질의 이미지 데이터에 대해 훈련했습니다. 이는 세부 정보를 세부화하는 동안 추적 일관성을 저하시키지 않습니다. 각 프레임에 대해 감독이 적용되었으며, 관심 영역은 근거 真実 알파 매트에서 파생되어 학습을 안내했습니다. ROI 탐지기는 경계 분류를 정확하게 하기 위해設計된 손실 함수와 함께 훈련되었습니다.

알파 추정에 대해서는 다중 스케일에서 손실이 적용되어 세부 정보를 점진적으로 개선하고, 추가적인 제약이 원래 마스크와 일치하도록 예측된 매트를 유지하도록 설계되었습니다.

데이터 및 테스트

8개의 이미지 매칭 데이터셋이 초기 테스트에 사용되었습니다: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; 및 RefMatte; 및 세 가지 ‘Sam2Matting’ 접근 방식의 변형이 VOS 추적기로 개발되었습니다. 각각 SAM2.1-Tiny; SAM2.1-Base+; 및 개념 중심 SAM3를 사용합니다.

추적기 구성 요소는 동결되었으며, 매칭 구성 요소만 최적화되었습니다. 모든 버전은 5개의 에포크 동안 4개의 NVIDIA A6000 GPU에서 훈련되었습니다. 각 GPU에는 48GB의 VRAM 할당이 있었습니다. 배치 크기는 32로 설정되었습니다. AdamW 옵티마이저가 사용되었습니다. 사용된 메트릭은 Mean Absolute Difference(MAD); Mean Squared Error(MSE); Gradient(Grad); Connectivity(Conn); 및 dtSSD(비디오 매칭만 해당)였습니다.

양적 테스트

작성자는 이미지 매칭에 대한 새로운 시스템의 양적 테스트를 시작했습니다. 사용된 벤치마크는 P3M-500-NP; AM-2K(‘GFM’ in results); MAM(‘Matte Anything’, in results); E2E-HIM; Lightweight; 및 PPM-100(‘MODNet’, in results)였습니다:

이미지 매칭 벤치마크에 대한 양적 결과

이미지 매칭 벤치마크에 대한 양적 결과

이 결과에 대해 논문은 다음과 같이 말합니다:

‘위의 표에서 볼 수 있듯이, SAM2Matting의 모든 변형은 다른 메트릭에서 이전의 기준을 일관되게 능가합니다. 예를 들어, SAM2.1-Tiny 버전은 P3M-500-NP에서 MAM보다 11.48 낮은 MAD를 달성합니다.’

작성자는 결과가 접근 방식의 핵심 개념 설계로 인해 우수한 결과를 달성한다고 주장합니다.

비디오 매칭의 경우, SAM2Matting은 V-HIM60VideoMatte에서 제로샷 설정으로 평가되었습니다. 비디오 훈련 시스템 MatAnyone2, MatAnyone, MaGGIe, FTP-VM, 및 RVM와 비교하여 일관된 이익이 보고되었습니다.

모든 벤치마크에서, 세 가지 변형은 MAD, MSE, Grad, Conn, 및 dtSSD에서 더 낮은 오류를 기록합니다. SAM3은 가장 강력한 결과를 달성하며, 가장 낮은 dtSSD 값은 더 안정적인 프레임 간 일관성을 나타냅니다.

비디오 매칭 벤치마크에 대한 양적 결과

비디오 매칭 벤치마크에 대한 양적 결과

작성자는 이러한 결과가 분리된 설계에서 비롯된 것으로, VOS 추적기가 시간적 구조를 유지하고 매칭 모듈이 경계 세부 정보에 집중하여 이미지 훈련 모델이 완전한 감독 비디오 접근 방식을 능가할 수 있음을 보여준다고 주장합니다.

질적 테스트

인간 매칭에 대한 질적 테스트에서, 작성자는 Sam2Matting이 경쟁적인 기준선을 능가한다고发现했습니다:

인간 및 실세계 비디오 매칭에 대한 질적 비교

인간 및 실세계 비디오 매칭에 대한 질적 비교

다음과 같이 보여주듯이, 기존의 비디오 매칭 시스템은 도메인 특정 및 인간 중심 데이터셋에서 훈련되었습니다. 이러한 시스템은 빠르게 움직이는 대상, 반투명한 물체 및 빠르게 떨어지는 물과 같은 실세계 시퀀스에서 일반화하는 데 어려움을 겪었습니다.

실세계 시퀀스에 대한 질적 비교

실세계 시퀀스에 대한 질적 비교

반대로, SAM2Matting은 이러한 도전적인 시나리오에서 안정적인 추적을 유지하고 세부 정보를 더 신뢰성 있게 추출할 수 있었습니다.

마지막으로, 다음 그림에서 보여주듯이, SAM2Matting은 자전거를 타는 사람이나 스키를 잡고 있는 사람과 같은 부착된 객체를 효과적으로 처리할 수 있었으며, 근처의 배경 분산을 억제하여 클린한 실루엣을 유지했습니다.

부착된 객체 및 배경 분산이 있는 시퀀스에 대한 질적 비교

부착된 객체 및 배경 분산이 있는 시퀀스에 대한 질적 비교

결론

새로운 논문에서 설명된 성과는 추출이 여전히 해결되지 않은 가장 오래된 컴퓨터 비전 작업 중 하나이며, 일반화된 접근 방식에 저항한다는 것을 보여줍니다. 많은 비전 기반 모델과 마찬가지로, 문제는 추출 알고리즘이 도메인 지식에 의존하는 것보다 쉽게 보지 못한 객체에 적응하는 것입니다. 이 작업은 모델의 일반화의 가장자리를 긴장시키는 작업 중 하나입니다.

새로운 연구는 이러한 의존성에서 앞으로 나아간 것입니다. 그러나 이 작업이 우리의 일상 생활에 깊이埋め込여 있는 것을 고려할 때, 아직도 많은 길이 남아 있습니다.

 

최초로 게시된 날: 2026년 7월 13일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai