Anderson의 관점

비디오에서 객체 제거를 더 효율적으로 수행하는 머신 러닝

mm
Unite.AI를 Google의 선호 소스에 추가

중국에서 발표된 새로운 연구는 비디오 인페인팅 시스템에 대한 최첨단 결과와 효율성의驚異的な 향상을 보고하고 있습니다. 이 시스템은 영리하게 객체를 제거할 수 있습니다.

행글라이더의 하네스가 새로워진 절차에 의해 칠해졌습니다. 더 나은 해상도와 더 많은 예제를 보려면 이 기사의 하단에 첨부된 소스 비디오를 참조하십시오. 출처: https://www.youtube.com/watch?v=N--qC3T2wc4

행글라이더의 하네스가 새로워진 절차에 의해 칠해졌습니다. 더 나은 해상도와 더 많은 예제를 보려면 소스 비디오를 참조하십시오. 출처: https://www.youtube.com/watch?v=N–qC3T2wc4

이 기술은 End-to-End 프레임워크를 위한 Flow-Guided 비디오 인페인팅 (E2FGVI)이라고 불리며, 또한 워터마크와 다양한 종류의 오쿠루션을 비디오 콘텐츠에서 제거할 수 있습니다.

E2FGVI는 오쿠루션 뒤에 있는 콘텐츠에 대한 예측을 계산하여 심지어 주목할 만한 워터마크도 제거할 수 있습니다. 출처: https://github.com/MCG-NKU/E2FGVI

E2FGVI는 오쿠루션 뒤에 있는 콘텐츠에 대한 예측을 계산하여 심지어 주목할 만한 워터마크도 제거할 수 있습니다. 출처: https://github.com/MCG-NKU/E2FGVI

(더 많은 예제를 더 나은 해상도로 보려면 비디오를 참조하십시오)

발표된 논문에 포함된 모델은 432px x 240px 비디오(공통적으로 낮은 입력 크기, 사용 가능한 GPU 공간 대신 최적의 배치 크기와 기타 요인에 의해 제한됨)에 대해 훈련되었지만, 저자들은 이후에 임의의 해상도를 처리할 수 있는 E2FGVI-HQ를 출시했습니다.

현재 버전의 코드는 GitHub에서 사용할 수 있으며, HQ 버전은 지난 일요일에 출시되어 Google DriveBaidu Disk에서 다운로드할 수 있습니다.

아이만 사진에 남습니다.

아이만 사진에 남습니다.

E2FGVI는 432×240 비디오를 0.12초당 프레임으로 Titan XP GPU(12GB VRAM)에서 처리할 수 있으며, 저자들은 이 시스템이 이전의 최첨단 방법보다 15배 빠르다고 보고합니다.

테니스 선수가 예상치 못한 출장을 합니다.

테니스 선수가 예상치 못한 출장을 합니다.

이 새로운 방법은 표준적인 데이터셋에서 테스트되었으며, 질적 및 양적 평가에서 라이벌들을 능가했습니다.

이전 접근 방식에 대한 테스트.

이전 접근 방식에 대한 테스트. 출처: https://arxiv.org/pdf/2204.02663.pdf

논문End-to-End 프레임워크를 위한 Flow-Guided 비디오 인페인팅이라고 제목이 붙여져 있으며, 남경대학교의 4명의 연구자와 함께 Hisilicon Technologies의 연구자와의 공동 연구입니다.

이 그림에서 무엇이 빠져 있나요

고품질의 비디오 인페인팅은 시각적 효과에 대한 명백한 응용 외에도 새로운 AI 기반 이미지 합성 및 이미지 변경 기술의 핵심적인 특징이 될 것입니다.

이것은 특히 바디-변경 패션 애플리케이션과 다른 프레임워크에서 이미지와 비디오의 장면을 ‘슬림’으로 만들거나 변경하려고 하는 경우에 해당합니다. 이러한 경우, 합성에 의해 노출되는 추가 배경을 설득력 있게 ‘채워 넣는’ 것이 필요합니다.

최근의 논문에서 바디 '재구성' 알고리즘이 주제를 다시 크기 조정할 때 새로 노출된 배경을 인페인팅하는任务를 맡았습니다. 여기서 부족한 부분은 이전에 더 풍만한 몸매를 가진 사람(실제, 왼쪽 이미지 참조)이 차지했던 빨간 윤곽으로 표시됩니다. 출처 자료: https://arxiv.org/pdf/2203.10496.pdf

최근의 논문에서 바디 ‘재구성’ 알고리즘이 주제를 다시 크기 조정할 때 새로 노출된 배경을 인페인팅하는任务를 맡았습니다. 여기서 부족한 부분은 이전에 더 풍만한 몸매를 가진 사람(실제, 왼쪽 이미지 참조)이 차지했던 빨간 윤곽으로 표시됩니다. 출처 자료: https://arxiv.org/pdf/2203.10496.pdf

일관된 광학 흐름

광학 흐름(OF)은 비디오 객체 제거의 개발에서 핵심 기술이 되었습니다. 광학 흐름은 일회성 맵을 제공하며, 종종 컴퓨터 비전 이니셔티브에서 속도를 측정하는 데 사용됩니다. 또한 광학 흐름은 시간적으로 일관된 인페인팅을 가능하게 하며, 작업의 총합을 단일 패스로 고려할 수 있습니다.

현재까지의 비디오 인페인팅 방법은 3단계 프로세스에 중점을 두었습니다. 흐름 완성은 비디오를 이산적이고 탐색 가능한 엔티티로 매핑하는 과정입니다. 픽셀 전파은 비디오의 구멍을 양방향으로 전파하여 픽셀을 채우는 과정입니다. 콘텐츠 환상은 추정된 ‘누락된’ 콘텐츠를 발명하여 비디오에 삽입하는 과정입니다.

E2FGVI의 중심적인 혁신은 이러한 3단계를 엔드투엔드 시스템으로 결합하여 수동 작업의 필요성을 제거하는 것입니다.

이 논문은 이전 프로세스에서 수동 개입의 필요성이 GPU를 사용하지 않도록 만들었으며, 시간이 많이 걸린다고 지적합니다. 논문에서*:

‘DFVI를 예로 들어, 432 × 240 크기의 비디오를 완성하는 데 약 4분이 걸리며, 이는 대부분의 실제 응용 프로그램에서 받아들여질 수 없습니다. 또한, 위에서 언급한 단점 외에도, 콘텐츠 환상 단계에서 사전 훈련된 이미지 인페인팅 네트워크만을 사용하는 것은 시간적 이웃 간의 콘텐츠 관계를 무시하여 비디오에서 일관되지 않은 생성 콘텐츠를 생성하게 됩니다.’

E2FGVI는 3단계를 결합하여 2단계인 픽셀 전파를 특징 전파로 대체할 수 있습니다. 이전 작업의 더 세분화된 프로세스에서 특징은 그렇게 광범위하게 사용할 수 없습니다. 이유는 각 단계가 상대적으로 폐쇄적이며, 워크플ロー는 반자동입니다.

또한, 연구자들은 콘텐츠 환상 단계를 위한 시간적 초점 변환기를 고안했습니다. 이는 현재 프레임의 픽셀의 직접적인 이웃뿐만 아니라, 멀리 떨어진 이웃도 고려하며, 비디오 전체의 일관된 효과에 영향을 미칩니다.

E2FGVI의 아키텍처.

E2FGVI의 아키텍처.

새로운 특징 기반의 중앙 섹션은 더 많은 특징 수준의 프로세스와 학습 가능한 샘플링 오프셋을 활용할 수 있으며, 프로젝트의 새로운 초점 변환기는 저자에 따르면 초점 창의 크기를 2D에서 3D로 확장합니다.

테스트 및 데이터

E2FGVI를 테스트하기 위해, 연구자들은 두 개의 인기 있는 비디오 객체 분할 데이터셋에 대해 시스템을 평가했습니다. YouTube-VOSDAVIS입니다. YouTube-VOS는 3741개의 훈련 비디오 클립, 474개의 검증 클립, 508개의 테스트 클립을 특징으로 합니다. DAVIS는 60개의 훈련 비디오 클립과 90개의 테스트 클립을 특징으로 합니다.

E2FGVI는 YouTube-VOS에서 훈련되었으며 두 데이터셋 모두에서 평가되었습니다. 훈련 중에 객체 마스크(위의 이미지에서 녹색 영역 및 동반되는 YouTube 비디오)가 비디오 완성을 시뮬레이션하기 위해 생성되었습니다.

메트릭으로, 연구자들은 피크 신호 대 노이즈 비율(PSNR), 구조적 유사성(SSIM), 비디오 기반 Fréchet 인셉션 거리(VFID), 및 플로우 와핑 오류를 채택했습니다. 후자는 영향을 받은 비디오의 시간적 안정성을 측정하기 위해 사용됩니다.

시스템이 테스트된 이전 아키텍처는 VINet, DFVI, LGTSM, CAP, FGVC, STTN, 및 FuseFormer입니다.

논문의 양적 결과 섹션에서. 위쪽과 아래쪽 화살표는 더 높은 또는 더 낮은 숫자가 더 좋음을 나타냅니다. E2FGVI는 전반적으로 최고의 점수를 달성했습니다. 방법은 FuseFormer에 따라 평가되며, DFVI, VINet 및 FGVC는 엔드투엔드 시스템이 아니므로 FLOPs를 추정할 수 없습니다.

논문의 양적 결과 섹션에서. 위쪽과 아래쪽 화살표는 더 높은 또는 더 낮은 숫자가 더 좋음을 나타냅니다. E2FGVI는 전반적으로 최고의 점수를 달성했습니다. 방법은 FuseFormer에 따라 평가되며, DFVI, VINet 및 FGVC는 엔드투엔드 시스템이 아니므로 FLOPs를 추정할 수 없습니다.

모든 경쟁 시스템에서 최고의 점수를 달성한 것 외에도, 연구자들은 5개의 대표적인 방법으로 변환된 비디오를 개별적으로 20명의志願者에게 보여주고 시각적 품질에 따라 평가하도록 요청하는 질적 사용자 연구를 수행했습니다.

수직 축은 시각적 품질에 따라 E2FGVI 출력을 선호하는 참가자의 백분율을 나타냅니다.

수직 축은 시각적 품질에 따라 E2FGVI 출력을 선호하는 참가자의 백분율을 나타냅니다.

저자들은尽管 모든 참가자가 그들의 방법을 선호했지만, 하나의 결과인 FGVC는 양적 결과와 일치하지 않으며, 이는 E2FGVI가 ‘더 시각적으로 즐거운 결과’를 생성할 수 있음을 나타낼 수 있다고 제안합니다.

효율성 측면에서, 저자들은 그들의 시스템이 부동소수점 연산을 크게 줄이고, 단일 Titan GPU에서 DAVIS 데이터셋의 추론 시간을 줄였다고 주장합니다. 또한, 결과는 E2FGVI가 플로우 기반 방법보다 15배 빠르다고 나타냅니다.

그들은 다음과 같이 말합니다:

‘[E2FGVI]는 모든 방법 중에서 가장 낮은 FLOPs를 가지고 있습니다. 이는 제안된 방법이 비디오 인페인팅에 대해 매우 효율적임을 나타냅니다.’

*저자의 인라인 인용을 하이퍼링크로 변환했습니다.

 

最初에 2022년 5월 19일에 게시되었습니다.

2025년 10월 28일 화요일에 수정되었습니다. 결함이 있는 비디오 임베드를 제거하고 기사 본문에 대한 임베디드 비디오에 대한 참조를 수정하기 위해.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]