Погляд Anderson

Microsoft пропонує GODIVA, текст-відео-фреймворк машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Колаборація між Microsoft Research Asia та Університетом Дюка створила систему машинного навчання, здатну генерувати відео лише з текстового запиту, без використання Генеративних Адверсарних Мереж (GAN).

Проект називається GODIVA (Генерація Відкритих Доменів Відео з Натуральних Описів), і будується на деяких підходах, використаних у системі синтезу зображень OpenAI DALL-E, оголошеної раніше цього року.

Ранні результати GODIVA, з кадрами відео, створених з двох запитів. Верхні два приклади були створені з запиту 'Грати в гольф на траві', а нижній третій з запиту 'Грається бейсбол'.

Ранні результати GODIVA, з кадрами відео, створених з двох запитів. Верхні два приклади були створені з запиту ‘Грати в гольф на траві’, а нижній третій з запиту ‘Грається бейсбол’. Джерело: https://arxiv.org/pdf/2104.14806.pdf

GODIVA використовує модель Vector Quantised-Variational AutoEncoder (VQ-VAE) першої введеної дослідниками проекту DeepMind від Google у 2018 році, і також єсуттєвою складовою трансформаційних можливостей DALL-E.

Архітектура моделі VQ-VAE, з простором вкладення праворуч та кодуванням/декодуванням, що ділять простір для зменшення втрат під час реконструкції.

Архітектура моделі VQ-VAE, з простором вкладення праворуч та кодуванням/декодуванням, що ділять простір для зменшення втрат під час реконструкції. Джерело: https://arxiv.org/pdf/1711.00937.pdf

VQ-VAE була використана в кількох проектах для генерації передбачуваного відео, де користувач надає початкову кількість кадрів і запитує систему генерувати додаткові кадри:

Раніша робота: VQ-VAE виводить кадри з дуже обмеженого джерельного матеріалу.

Раніша робота: VQ-VAE виводить кадри з дуже обмеженого джерельного матеріалу. Джерело: Додаткові матеріали на https://openreview.net/forum?id=bBDlTR5eDIX

Однак, автори нової статті стверджують, що GODIVA представляє перший чистий текст-відео (T2V) реалізацію, яка використовує VQ-VAE, а не більш непередбачувані результати, отримані попередніми проектами з GAN.

Точкові запуски в текст-відео

Хоча подання коротке щодо деталей щодо критеріїв, за якими створюються початкові кадри, GODIVA, здається, викликає початкові зображення з ніде, перш ніж продовжити їх у низькорозрішенні відеокадри.

Колонкова репрезентація трирівневої системи розподіленої уваги, яка живить GODIVA для текст-образових завдань. Авторегресія передбачається чотирма факторами: вхідний текст, відносне позиціонування з попереднім кадром (подібно до NVIDIA's SPADE та інших методів, які будуються на або розвиваються далі підходів Оптичного Потоку), ті ж рядки на тій же кадрі, і ті ж колонки на тій же колонці.

Колонкова репрезентація трирівневої системи розподіленої уваги, яка живить GODIVA для текст-образових завдань. Авторегресія передбачається чотирма факторами: вхідний текст, відносне позиціонування з попереднім кадром (подібно до NVIDIA’s SPADE та інших методів, які будуються на або розвиваються далі підходів Оптичного Потоку), ті ж рядки на тій же кадрі, і ті ж колонки на тій же колонці.

Фактично, походження починається з міток у використовуваних даних: GODIVA була попередньо навчена на наборі даних Howto100M, який складається з 136 мільйонів підписаних відеокліпів, отриманих з YouTube за 15 років, і містить 23 000 позначених дій. Тим не менш, кожна можлива дія присутня у дуже великій кількості кліпів, що збільшується з узагальненням (тобто ‘Тварини та звірі’ мають 3,5 мільйона кліпів, тоді як ‘собаки’ мають 762 000 кліпів), і тому все ще є великий вибір можливих початкових точок.

Модель була оцінена на наборі даних Microsoft MSR Video to Text (MSR-VTT). Як подальші тести архітектури, GODIVA була навчена з нуля на наборі даних Moving Mnist і подвійному наборі даних Moving Mnist, обидва отримані з оригінальної бази даних MNIST, спільної роботи між Microsoft, Google та Інститутом математичних наук при Нью-Йоркському університеті.

Оцінка кадрів у безперервній відеосинтезі

У відповідності з роботою Пекінського університету IRC-GAN, GODIVA додає чотири додаткові колонкові перевірки до оригінального методу MNIST, який оцінював попередні та наступні кадри рухом вгору>вниз, а потім зліва>праворуч. IRC-GAN і GODIVA також розглядають кадри рухом уваги зліва>праворуч, праворуч>зліва, вгору>вниз і вниз>вгору.

Додаткові згенеровані кадри з GODIVA.

Додаткові згенеровані кадри з GODIVA.

Оцінка якості відео та вірності запиту

Для розуміння того, як добре вдалася генерація зображення, дослідники використали два метрики: один на основі подібності CLIP, і новий метрик Відносного Супроводу (RM).

Фреймворк OpenAI CLIP здатний виконувати нуль-шотове збігання зображень з текстом, а також забезпечувати синтез зображень шляхом зворотного застосування цієї моделі. Дослідники розділили оцінку CLIP на розраховану схожість між текстовим запитом і справжнім відео, щоб отримати оцінку RM. У окремому раунді оцінки вихід був оцінений 200 людьми, і результати порівняні з програмними оцінками.

Нарешті, GODIVA була протестована проти двох попередніх фреймворків, TFGAN і співробітництва Дюка/NEC 2017 року, T2V.

T2V-vs-TFGAN-vs-GODIVA

TFGAN може генерувати 128 квадратних пікселів у порівнянні з 64×64 виходом, який обмежує GODIVA і T2V у вищезазначених прикладах, але дослідники відзначають, що GODIVA генерує більш сміливі та впевнені рухи, і буде генерувати зміни сцени без будь-якої конкретної підказки, і не уникає генерації крупних планів.

У пізніших запусках GODIVA також генерує 128x128px вихід, з змінами у точці зору:

godiva_baseball_128px

У власному метриці RM, GODIVA здатна досягти оцінок, близьких до 100%, щодо автентичності (якості відео) і вірності (як близько згенерований вміст відповідає вхідному запиту).

Дослідники погоджуються, однак, що розвиток відео-орієнтованих метрик CLIP буде бажаним доповненням до цієї області синтезу зображень, оскільки це забезпечить рівну основу для оцінки якості результатів без звернення до надмірної адаптації та відсутності узагальнення, які все частіше критикувалися щодо ‘стандартних’ завдань комп’ютерного зору за останні десять років.

Вони також відзначають, що генерація довших відео буде логістичним考虑уванням при подальшому розвитку системи, оскільки вже 10 кадрів 64x64px виходу вимагають 2560 візуальних токенів, розширення конвеєра, яке швидше за все стане дорогим і нездійсненним.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai