Anderson의 관점
마이크로소프트, GODIVA라는 텍스트-비디오 기계 학습 프레임워크 제안

마이크로소프트 연구소 아시아와 듀크 대학교의 협력으로 생성적 적대적 신경망(Generative Adversarial Networks, GANs)을 사용하지 않고 텍스트 프롬프트에서 비디오를 생성할 수 있는 기계 학습 시스템이 개발되었습니다.
이 프로젝트는 GODIVA(Generating Open-DomaIn Videos from nAtural Descriptions)라고 불리며, OpenAI의 DALL-E 이미지 합성 시스템에서 사용된 일부 접근 방식을 기반으로 합니다. GODIVA는 VQ-VAE(VQ-VAE) 모델을 사용하여 텍스트-이미지 생성을 수행합니다.
GODIVA는 VQ-VAE 모델을 사용하여 텍스트-이미지 생성을 수행합니다. VQ-VAE 모델은 Google의 DeepMind 프로젝트에서 2018년에 처음 소개되었습니다.
VQ-VAE 모델은 여러 프로젝트에서 예측 비디오 생성에 사용되었습니다. GODIVA는 VQ-VAE 모델을 사용하여 텍스트-비디오 생성을 수행합니다.

VQ-VAE의 예측 결과
GODIVA는 텍스트-비디오 생성을 위한 첫 번째純粋한 구현입니다. GODIVA는 VQ-VAE 모델을 사용하여 텍스트-이미지 생성을 수행합니다.
텍스트-비디오의 시드 포인트
GODIVA는 텍스트-비디오 생성을 위한 시드 포인트를 생성합니다. 시드 포인트는 초기 프레임을 생성하는 데 사용됩니다.

GODIVA의 워크플로우
GODIVA는 Howto100M 데이터셋을 사용하여 사전 훈련되었습니다. Howto100M 데이터셋은 136만 개의 캡션된 비디오 클립으로 구성되어 있습니다.
연속 비디오 합성의 프레임 평가
GODIVA는 연속 비디오 합성을 위한 프레임 평가를 수행합니다. GODIVA는 IRC-GAN과 같은 방법을 사용하여 프레임을 평가합니다.
비디오 품질 및 프롬프트 충실도 평가
GODIVA는 비디오 품질 및 프롬프트 충실도 평가를 수행합니다. GODIVA는 CLIP 시밀러티와 Relative Matching(RM) 메트릭을 사용하여 평가를 수행합니다.
CLIP 프레임워크는 이미지와 텍스트를 매칭하는 데 사용됩니다. GODIVA는 CLIP 프레임워크를 사용하여 비디오 품질을 평가합니다.
GODIVA는 TFGAN과 T2V와 같은 이전 프레임워크와 비교되었습니다. GODIVA는 더 나은 성능을 보여주었습니다.
GODIVA는 128x128px 출력을 생성할 수 있습니다. GODIVA는 더 나은 성능을 보여주었습니다.
GODIVA는 비디오 품질 및 프롬프트 충실도 평가에서 높은 점수를 받았습니다. GODIVA는 더 나은 성능을 보여주었습니다.
연구자들은 GODIVA의 개발이 비디오 기반 CLIP 메트릭의 개발을 필요로 한다고 말합니다. GODIVA의 개발은 비디오 생성 분야에서 중요한 발전입니다.
연구자들은 GODIVA의 개발이 더 긴 비디오 생성을 가능하게 할 것이라고 말합니다. GODIVA의 개발은 비디오 생성 분야에서 중요한 발전입니다.

















