Anderson의 관점
장면을 이해하는 이미지 매칭

2003년 DVD 출시를 위한 추가 다큐멘터리에서 비주얼 이펙트 전설 리처드 에들런드는 1930년대 후반부터 1980년대 후반까지 시각적 이펙트 작업을 지배했던 광화학 매트 추출의 ‘서모 레슬링’을 회상했다. 에들런드는 이 프로세스의 맞춤법과 실수를 비교하여 ‘서모 레슬링’이라고 불렀다. 디지털 블루/그린 스크린 기술이 1990년대 초에 převzal 때.
전경 요소를 배경에서 추출하여 다른 배경에 합성할 수 있도록 전경 객체(예: 사람 또는 우주선 모델)를 배경에서 분리하는 것은 원래 전경 객체를 균일한 파란색 또는 녹색 배경에 대한 필름으로 촬영하여 수행되었다.

ILM이 ‘제다이의 귀환’을 위한 VFX 샷을 위해 수행한 노동 집약적인 광화학 추출 프로세스. 출처: https://www.youtube.com/watch?v=qwMLOjqPmbQ
결과 영사에서 배경색은 이후 화학적으로 분리되어 광학 프린터에서 전경 객체(또는 사람)를 투명한 필름 셀에 있는 ‘부유’ 객체로 재인쇄하는 데 사용되었다.
이 프로세스는 색상 분리 오버레이(CSO)로 알려졌지만, 이 용어는 나중에 1970년대와 1980년대의 저예산 텔레비전 출력에서 사용된 粗略한 ‘크로마키’ 비디오 이펙트와 더 관련이 있었다. 이것은 화학적이 아닌 아날로그 방식으로 수행되었다.

1970년 영국 아동 프로그램 ‘블루 피터’에서 색상 분리 오버레이를 보여주는 예시. 출처: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx
어떤 경우에든, 영화 또는 비디오 요소의 경우, 추출된 영상을 다른 영사에 삽입할 수 있었다.
그러나 디즈니의 훨씬 더 비싼 고유의 소디움蒸기 프로세스는 더 나은 정의와 선명한 매트를 제공했지만, 광화학 추출은 여전히 힘들고 신뢰할 수 없었다.

디즈니의 고유한 소디움 蒸기 추출 프로세스는 노란색 스펙트럼 근처의 배경이 필요했다. 여기서 앵글라 랜스베리는 ‘브룸스틱과 브룸스틱’의 VFX가 포함된 시퀀스 제작 중에 와이어에 매달려 있다. 출처
디지털 매칭을 넘어서
1990년대에 디지털 혁명은 화학을 없애고 그린 스크린의 필요성을 없애지 않았다. 이제 그린 스크린(또는 어떤 색상)을 제거하는 것은 단지 픽셀 편집 소프트웨어인 포토샵에서 해당 색상의 픽셀을 검색하여 수행할 수 있었고, 비디오 합성 소프트웨어는 자동으로 색상 배경을 제거할 수 있었다. 거의 즉시, 60년간의 광학 인쇄 산업은 역사 속으로 사라졌다.
지난 10년 동안 GPU 가속 컴퓨터 비전 연구는 매트 추출을 세 번째 시대로 이끌고 있으며, 연구자들은 그린 스크린 없이 고품질 매트를 추출할 수 있는 시스템을 개발하는 데 도전하고 있다. Arxiv에서만 기계 학습 기반 전경 추출에 대한 혁신에 관한 논문은 매주 특징이다.
우리를 그림에 넣다
이 학술 및 산업의 관심은 이미 소비자 공간에 영향을 미쳤는데, Zoom과 Skype 필터와 같은 조잡하지만 작동하는 구현은 우리에게 익숙하다. 이 필터는 비디오 회의 호출에서 우리의 거실 배경을 열대 섬과 같은 것으로 바꿀 수 있다.
그러나 여전히 최고의 매트는 그린 스크린이 필요하다. Zoom은 지난 수요일에 그랬다.

왼쪽, 그린 스크린 앞에 있는 남자, Zoom의 가상 배경 기능을 통해 잘 추출된 머리카락. 오른쪽, 일반적인 가정 환경 앞에 있는 여자, 알고리즘을 통해 덜 정확하게 추출된 머리카락, 더 높은 컴퓨팅 요구 사항. 출처: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image
Zoom 지원 플랫폼의 추가 게시물은 비그린 스크린 추출도 캡처 장치에서 더 많은 컴퓨팅 파워를 필요로 한다고 경고한다.
잘라내기의 필요성
‘야생’ 매트 추출 시스템(즉, 그린 스크린 없이 사람을 분리하는)의 품질, 이동성 및 자원 경제성의 개선은 비디오 회의 필터뿐만 아니라 더 많은 분야와 추구에 관련이 있다.
데이터셋 개발을 위해 개선된 얼굴, 전체 머리 및 전체 신체 인식은 전경 요소를 컴퓨터 비전 모델에 훈련시키지 않도록 하는 가능성을 제공하며, 더 정확한 분리는 의미론적 분할 기술을 크게 개선할 수 있다.
또한 더 나은 추출 알고리즘은 비싼 수동 로토스โค핑의 필요성을 줄일 수 있다.
실제로 다중 모달(일반적으로 텍스트/이미지) 방법론의 승리는 이미 이미지 처리에 영향을 미치고 있다. 최근의 예는 텍스트/이미지 훈련을 사용하여 비디오를 생성하는 텍스트2라이브 아키텍처이다.
장면 인식 AI 매칭
AI 기반 자동 매칭에 대한 많은 연구는 경계 인식과 이미지 또는 비디오 프레임 내의 픽셀 기반 그룹화의 평가에 중점을 두었다. 그러나 중국의 새로운 연구는 텍스트 기반 설명(컴퓨터 비전 연구 분야에서 지난 3-4년 동안 인기를 얻은 다중 모달 접근 방식)을 활용하여 매트의 선명도와 품질을 개선하는 추출 파이프라인을 제공한다.
추출 연구 하위 분야에 제기된 도전은 최소한의 수동 주석과 인간 개입(즉, 전혀 없음)이 필요한 워크플로우를 생성하는 것이다. 비용 영향 외에도 새로운 논문의 연구자들은 아웃소싱 크라우드 워커에 의해 수행된 주석과 수동 분할은 다양한 문화에서 이미지에 다른 방식으로 레이블을 지정하거나 분할할 수 있으므로 일관성 없는 알고리즘으로 이어진다고 관찰한다.
예를 들어, ‘전경 객체’를 정의하는 주관적인 해석이다.

새로운 논문에서: 이전 방법 LFM과 MODNet(‘GT’는 이상적인 결과를 나타내며, 수동 또는 비알고리즘 방식으로 얻을 수 있음)은 전경 콘텐츠에 대해 서로 다른 접근 방식을 가지고 있으며, 새로운 SPG-IM 방법은 장면 컨텍스트를 통해 ‘근처 콘텐츠’를 더 효과적으로 정의한다.
이 문제를 해결하기 위해 연구자들은 두 단계 파이프라인인 상황 인식 가이드 이미지 매칭(Situational Perception Guided Image Matting, SPG-IM)을 개발했다. 두 단계 인코더/디코더 아키텍처는 상황 인식 증류(Situational Perception Distillation, SPD)와 상황 인식 가이드 매칭(Situational Perception Guided Matting, SPGM)으로 구성된다.
첫째, SPD는 시각적-텍스처 변환을 사전 훈련시키고, 관련된 이미지에 적합한 캡션을 생성한다. 그 다음에 전경 마스크 예측은 새로운 주의 예측 기술에 연결되어 가능해진다.
그런 다음 SPGM은 원시 RGB 이미지 입력과 첫 번째 모듈에서 얻은 생성된 마스크를 기반으로 추정된 알파 매트를 출력한다.
목표는 상황 인식 가이드이며, 시스템은 이미지의 구성 요소를 이해할 수 있어 예를 들어 복잡한 머리카락을 배경에서 추출하는 과제의 알려진 특성을 프레임할 수 있다.

아래 예시에서 SPG-IM은 파라쥬트의 코드가 내재된 것을 이해하지만 MODNet은 이러한 세부 사항을 유지하고 정의하지 못한다. 또한 위의 예시에서 MODNet은 놀이터 장비의 전체 구조를 임의로 잃어버린다.
새로운 논문은 상황 인식 가이드 이미지 매칭(Situational Perception Guided Image Matting)으로 제목이 붙여졌으며, OPPO 연구소, PicUp.ai, Xmotors의 연구자들이 저술했다.
지능형 자동 매트
SPG-IM은 또한 지역 세부 사항과 전역 컨텍스트를 별도로 처리할 수 있는 적응적 초점 변환(Adaptive Focal Transformation, AFT) 정제 네트워크를 제공한다. 이는 ‘지능형 매트’를 가능하게 한다.
논문은 다음과 같이 말한다:
‘우리는 시각적-텍스처 작업(예: 이미지 캡션)에서 시각적 표현이 더 의미론적으로 포괄적인 신호(즉, 객체 간 및 객체와 환경 간)를 생성하여 전역 정보와 지역 세부 사항을 모두 다룰 수 있다고 믿는다. 또한, 이미지 매칭의 픽셀 주석과 비교하여 텍스트 레이블을 대량으로 매우 낮은 비용으로 수집할 수 있다.’
SPD 아키텍처의 분기는 미시간 대학교의 VirTex와 함께 사전 훈련되며, 이는 시각적-텍스처 디코더로 학습된 시각적 표현을 제공한다.

VirTex는 이미지-캡션 쌍을 통해 컨브넷과 트랜스포머를 공동으로 훈련시키고, 얻은 통찰력을 객체 감지와 같은 다운스트림 비전 작업으로 전달한다. 출처: https://arxiv.org/pdf/2006.06666.pdf
다른 테스트와 절단 연구 중에서, 연구자들은 SPG-IM을 상태 오프 더 아트 트리맵 기반 방법인 Deep Image Matting, IndexNet, Context-Aware Image Matting, Guided Contextual Attention, FBA, Semantic Image Mapping과 비교했다.
다른 이전 프레임워크에는 트리맵 없는 접근 방식인 LFM, HAttMatting, MODNet이 포함되었다. 공정한 비교를 위해 테스트 방법은 서로 다른 방법론에 따라 수정되었다. 코드가 사용할 수 없는 경우, 논문의 기술은 설명된 아키텍처에서 재현되었다.
새로운 논문은 다음과 같이 말한다:
‘우리의 SPG-IM은 모든 경쟁하는 트리맵 없는 방법(LFM, HAttMatting, MODNet)을 큰 차이로 능가한다. 또한, 우리의 모델은 공공 데이터셋(즉, Composition-1K, Distinction-646, Human-2K) 및 우리의 Multi-Object-1K 벤치마크에서 모든 네 가지 지표에 대해 상태 오프 더 아트 트리맵 기반 및 마스크 가이드 방법을 능가한다.’
그리고 계속한다:
‘그린 스크린의 지침 없이도 우리의 방법이 세부 사항(예: 머리카락 끝, 투명한 텍스처, 경계)을 잘 보존하는 것이 명백히 관찰될 수 있다. 또한, 다른 경쟁하는 트리맵 없는 모델과 비교하여 우리의 SPG-IM은 더 나은 전역 의미적 완전성을 유지할 수 있다.’
처음 게시됨: 2022년 4월 24일.

















