Anderson의 관점

마이크로소프트, GODIVA라는 텍스트-비디오 기계 학습 프레임워크 제안

mm
Unite.AI를 Google의 선호 소스에 추가

마이크로소프트 연구소 아시아와 듀크 대학교의 협력으로 생성적 적대적 신경망(Generative Adversarial Networks, GANs)을 사용하지 않고 텍스트 프롬프트에서 비디오를 생성할 수 있는 기계 학습 시스템이 개발되었습니다.

이 프로젝트는 GODIVA(Generating Open-DomaIn Videos from nAtural Descriptions)라고 불리며, OpenAI의 DALL-E 이미지 합성 시스템에서 사용된 일부 접근 방식을 기반으로 합니다. GODIVA는 VQ-VAE(VQ-VAE) 모델을 사용하여 텍스트-이미지 생성을 수행합니다.

GODIVA의 초기 결과: 두 개의 프롬프트에서 생성된 비디오의 프레임

GODIVA의 초기 결과: 두 개의 프롬프트에서 생성된 비디오의 프레임

GODIVA는 VQ-VAE 모델을 사용하여 텍스트-이미지 생성을 수행합니다. VQ-VAE 모델은 Google의 DeepMind 프로젝트에서 2018년에 처음 소개되었습니다.

VQ-VAE 모델의 아키텍처

VQ-VAE 모델의 아키텍처

VQ-VAE 모델은 여러 프로젝트에서 예측 비디오 생성에 사용되었습니다. GODIVA는 VQ-VAE 모델을 사용하여 텍스트-비디오 생성을 수행합니다.

VQ-VAE의 예측 결과

VQ-VAE의 예측 결과

GODIVA는 텍스트-비디오 생성을 위한 첫 번째純粋한 구현입니다. GODIVA는 VQ-VAE 모델을 사용하여 텍스트-이미지 생성을 수행합니다.

텍스트-비디오의 시드 포인트

GODIVA는 텍스트-비디오 생성을 위한 시드 포인트를 생성합니다. 시드 포인트는 초기 프레임을 생성하는 데 사용됩니다.

GODIVA의 워크플로우

GODIVA의 워크플로우

GODIVA는 Howto100M 데이터셋을 사용하여 사전 훈련되었습니다. Howto100M 데이터셋은 136만 개의 캡션된 비디오 클립으로 구성되어 있습니다.

연속 비디오 합성의 프레임 평가

GODIVA는 연속 비디오 합성을 위한 프레임 평가를 수행합니다. GODIVA는 IRC-GAN과 같은 방법을 사용하여 프레임을 평가합니다.

GODIVA의 예제

GODIVA의 예제

비디오 품질 및 프롬프트 충실도 평가

GODIVA는 비디오 품질 및 프롬프트 충실도 평가를 수행합니다. GODIVA는 CLIP 시밀러티와 Relative Matching(RM) 메트릭을 사용하여 평가를 수행합니다.

CLIP 프레임워크는 이미지와 텍스트를 매칭하는 데 사용됩니다. GODIVA는 CLIP 프레임워크를 사용하여 비디오 품질을 평가합니다.

GODIVA는 TFGAN과 T2V와 같은 이전 프레임워크와 비교되었습니다. GODIVA는 더 나은 성능을 보여주었습니다.

T2V, TFGAN, GODIVA 비교

GODIVA는 128x128px 출력을 생성할 수 있습니다. GODIVA는 더 나은 성능을 보여주었습니다.

GODIVA의 128x128px 출력

GODIVA는 비디오 품질 및 프롬프트 충실도 평가에서 높은 점수를 받았습니다. GODIVA는 더 나은 성능을 보여주었습니다.

연구자들은 GODIVA의 개발이 비디오 기반 CLIP 메트릭의 개발을 필요로 한다고 말합니다. GODIVA의 개발은 비디오 생성 분야에서 중요한 발전입니다.

연구자들은 GODIVA의 개발이 더 긴 비디오 생성을 가능하게 할 것이라고 말합니다. GODIVA의 개발은 비디오 생성 분야에서 중요한 발전입니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai