Anderson의 관점
일관된 AI 비디오 콘텐츠 편집을 위한 텍스트 가이드 입력

전문 VFX 커뮤니티는 이미지 및 비디오 합성의 새로운 혁신에 매료되면서도 때때로 위협을 느끼고 있습니다. 그러나 대부분의 AI 기반 비디오 편집 프로젝트는 시간적 연속성이 부족하여 이러한 노력은 많은 경우에 ‘사이키델릭’ 영역으로 귀속됩니다. 이는 텍스처와 구조가 반짝이고 빠르게 변경되는 것을 특징으로 하며, 일관되지 않은 효과와 전통적인 CGI 기반 접근 방식이 회상되는 기술을 다루는 것과 같은 粗한 기술이 포함됩니다.
비디오에서 특정한 것을 변경하려는 경우, 깊은 가짜 영역에 속하지 않는 경우(즉, 사람의 기존 영상을 새로운 정체성으로 대체하는 경우), 대부분의 현재 솔루션은 생산품질의 시각적 효과에 필요한 정밀도에 대한 제한이 있습니다.
하나의 예외는 와이즈만 과학 연구소의 학자들로부터 오는 것입니다. 2021년에 3명의 연구자들은 어도비와 협력하여 비디오를 분해하고 내부 매핑을 합성 출력에superimpose하는 새로운 방법을 발표했습니다. 이는 알파 채널과 시간적으로 일관된 출력을 갖춘 층화된 신경 지도를 생성했습니다.

2021년 논문에서: 소스 클립에서 도로의 완전한 통행을 추정하는 것은 전통적으로 광범위한 rotoscoping과 매치 이동이 필요한 방식으로 신경 네트워크를 통해 편집됩니다. 배경과 전경 요소가 별도의 네트워크에서 처리되므로 마스크는真正로 ‘자동’입니다. 출처: https://layered-neural-atlases.github.io/
이것은 옵티컬 플로우와 같은 VFX 파이프라인에서 다루는 영역에 속하지만, 전통적인 CGI 워크플로우에서 직접적인 등가물이不存在합니다. 이는 본질적으로 ‘시간적 텍스처 맵’으로서, 전통적인 소프트웨어 방법을 통해 생성되고 편집될 수 있습니다.
위의 삽화에서 두 번째 이미지는 도로 표면의 배경을 전체 비디오 실행 시간에 걸쳐 나타냅니다. 이 기본 이미지를 변경하면(위의 삽화에서 왼쪽에서 세 번째 이미지) 배경에 일관된 변경이 발생합니다.
‘펼친’ 아틀라스의 이미지는 개별적으로 해석된 프레임만을 나타냅니다. 타겟 비디오 프레임의 일관된 변경은 원래 프레임으로 매핑되며, 필요한 오클루전과 다른 필수적인 장면 효과(예: 그림자 또는 반사)를 유지합니다.
코어 아키텍처는 다층 퍼셉트론(MLP)을 사용하여 펼친 아틀라스, 알파 채널 및 매핑을 나타내며, 모두 2D 공간에서 최적화되고 완전히 최적화됩니다. 이는 NeRF 스타일의 3D 기하학 점, 깊이 맵 및 유사한 CGI 스타일의 장치에 대한 이전 지식의 필요성을 제거합니다.
개별 객체의 참조 아틀라스도 신뢰할 수 있게 변경할 수 있습니다.

2021 프레임워크에서 이동하는 객체에 대한 일관된 변경. 출처: https://www.youtube.com/watch?v=aQhakPFC4oQ
본질적으로 2021 시스템은 기하학적 정렬, 매치 이동, 매핑, 재 텍스처화 및 로토스코핑을离散한 신경 과정으로 결합합니다.
Text2Live
2021년 논문의 3명의 원래 연구자와 NVIDIA 연구가 새로운 기술에 기여했습니다. 이 기술은 층화된 아틀라스의 강점과 텍스트 가이드 CLIP 기술의力を 결합합니다.
새로운 아키텍처는 Text2Live라고 불리며, 사용자가 텍스트 프롬프트에 따라 실제 비디오 콘텐츠를 편집할 수 있도록 합니다.


전경 편집의 두 가지 예시. 더 높은 해상도와 정의를 위해 원본 비디오를 https://text2live.github.io/sm/pages/video_results_atlases.html에서 확인하십시오.
Text2Live는 사전 학습된 생성기를 사용하지 않고, 내부 데이터베이스를 사용하여 의미적이고 지역적인 편집을 제공합니다.

Text2Live에서 배경 및 전경(객체) 변환. 출처: https://text2live.github.io/sm/pages/video_results_atlases.html
이 기술은 사용자 제공 마스크(예: 로토스코핑 또는 그린 스크린 워크플로우)가 필요하지 않습니다. 대신, 2021년 텔 아비브 대학의 컴퓨터 과학 학교와 페이스북 AI 연구소(FAIR)에서 수행한 연구를 기반으로 하는 부트스트래핑 기술을 통해 관련성 맵을 추정합니다.

트랜스포머 기반의 제네릭 어텐션 모델을 통해 생성된 출력 맵.
새로운 논문은 Text2LIVE: 텍스트 기반 층화된 이미지 및 비디오 편집이라고 불립니다. 원래 2021년 팀은 와이즈만의 오메르 바르 탈과 NVIDIA 연구의 요니 카스텐이 합류했습니다.
아키텍처
Text2Live는 단일 입력 이미지와 타겟 텍스트 프롬프트에 대한 생성기를 포함합니다. 4억 개의 텍스트/이미지 쌍으로 사전 학습된 CLIP 모델은 사용자 입력 변환을 해석할 수 있는 관련 시각적 자료를 제공합니다.

생성기는 입력 이미지(프레임)를 받아서 타겟 RGBA 레이어를 출력하며, 이는 색상 및 불투명도 정보를 포함합니다. 이 레이어는 추가로 보강된 원래 영사에 합성됩니다.
Text2Live는 타겟 비디오 또는 이미지와 관련된 내부 이미지에 대해 학습함으로써, 입력 이미지를 GAN의 잠재 공간으로 되돌리거나 확산 모델을 사용할 필요가 없습니다. 이는 현재 생산품질 비디오 편집 요구 사항에 충분히 정확하지 않습니다.

Text2Live의 프롬프트 기반 변환 편집의 예시.
이전 접근 방식은 프레임 기반 접근 방식이었습니다. 이러한 기술은 일관된 시간적 외관의 변경을 생성할 수 없습니다. 층화된 아틀라스는 단일 공간에서 변경 사항을 다룰 수 있으므로, 변경 사항은 비디오가 진행됨에 따라 유지될 수 있습니다.

Text2Live는 ‘rusty jeep’라는 텍스트 프롬프트를 해석하고, 이를 비디오의 아틀라스에 한 번 적용합니다.
Text2Live는 AI 기반 합성에서 중요한 발전을 나타내며, 텍스트-이미지 공간에서 많은 주목을 받은 OpenAI의 DALL-E 2 프레임워크와는 다릅니다.
Text2Live는 사용자가 아틀라스를 추출하여 고급 픽셀 기반 환경에서 편집한 후, 3D 추정이나 후방 CGI 기반 접근 방식에 의존하지 않는 올바른 방향으로 다시 입력할 수 있습니다.
또한, Text2Live는 자동으로 마스킹과 합성을 달성하는 최초의 비교 가능한 프레임워크라고 주장합니다.
최초로 2022년 4월 7일에 게시되었습니다.














