Взгляд Anderson

Почему видео ИИ иногда получается в обратном порядке

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Если 2022 год был годом, когда генеративный ИИ захватил воображение более широкой общественности, то 2025 год – это год, когда новое поколение генеративных видео-фреймворков из Китая, кажется, готов сделать то же самое.

Видео Hunyuan от Tencent произвело большое впечатление на сообщество хоббиистов ИИ с его открытым выпуском полноценной видео-диффузионной модели, которую пользователи могут настроить в соответствии со своими потребностями.

Вслед за ним идет более недавний Wan 2.1 от Alibaba, один из самых мощных решений для создания видео из изображений с открытым исходным кодом в этот период – теперь поддерживающий настройку через Wan LoRAs.

Помимо недавно выпущенной основной модели SkyReels, на момент написания мы также ждем выпуска всестороннего VACE видео-редактора и редактора от Alibaba:

Нажмите, чтобы воспроизвести. Предстоящий выпуск всестороннего видео-редактора и редактора VACE от Alibaba вызвал волнение в сообществе пользователей. Источник: https://ali-vilab.github.io/VACE-Page/

Внезапное воздействие

Сама сцена исследований генеративного видео ИИ не менее взрывоопасна; мы еще не достигли второй половины марта, и вчерашние подачи в раздел компьютерного зрения Arxiv (хаб для исследований генеративного ИИ) составили почти 350 записей – цифра, обычно связанная с высшим сезоном конференций.

Два года с момента выпуска Stable Diffusion летом 2022 года (и последующего развития Dreambooth и LoRA-методов настройки) были отмечены отсутствием дальнейших крупных разработок, пока в последние несколько недель новые выпуски и инновации не пошли таким бешеным темпом, что почти невозможно быть в курсе всего, не говоря уже о том, чтобы все это охватить.

Видео-диффузионные модели, такие как Hunyuan и Wan 2.1, наконец решили, после лет неудачных попыток со стороны сотен исследовательских инициатив, проблему временной согласованности в отношении генерации людей, и в значительной степени также окружающей среды и объектов.

Можно с уверенностью сказать, что студии визуальных эффектов в настоящее время применяют сотрудников и ресурсы для адаптации новых китайских видеомоделей для решения таких задач, как замена лиц, несмотря на текущее отсутствие ControlNet-стиля вспомогательных механизмов для этих систем.

Должно быть так облегченно, что одно такое значительное препятствие потенциально было преодолено, хотя и не по ожидаемым каналам.

Из оставшихся проблем эта, однако, не является незначительной:

Нажмите, чтобы воспроизвести. На основе подсказки ‘Маленький камень катится вниз по крутому, скалистому склону, вытесняя почву и небольшие камни’, Wan 2.1, который достиг самых высоких баллов в новой статье, совершает одну простую ошибку. Источник: https://videophy2.github.io/

В гору назад

Все системы текст-в-видео и изображение-в-видео, в настоящее время доступные, включая коммерческие закрытые модели, имеют тенденцию производить физические ошибки, такие как та, что показана выше, где видео показывает камень, катящийся в гору, на основе подсказки ‘Маленький камень катится вниз по крутому, скалистому склону, вытесняя почву и небольшие камни‘.

Одна из теорий, почему это происходит, недавно предложенная в академическом сотрудничестве между Alibaba и ОАЭ, заключается в том, что модели обучаются всегда на отдельных изображениях, в некотором смысле, даже когда они обучаются на видео (которые записываются в последовательности отдельных кадров для целей обучения); и они могут не обязательно учиться правильному временному порядку ‘до’ и ‘после’ изображений.

Однако наиболее вероятное решение заключается в том, что модели, о которых идет речь, использовали аугментацию данных, которая включает в себя подвергание исходного обучающего клипа модели как вперед, так и назад, эффективно удваивая обучающие данные.

Долгое время было известно, что это не должно делаться произвольно, потому что некоторые движения работают в обратном порядке, но многие нет. Исследование 2019 года из Университета Бристоля в Великобритании попыталось разработать метод, который мог бы различать эквивариантные, инвариантные и необратимые исходные видеоклипы данных, которые сосуществуют в одном наборе данных (см. изображение ниже), с идеей, что неподходящие исходные клипы могут быть отфильтрованы из процедур аугментации данных.

Примеры трех типов движений, только один из которых свободно обратим, сохраняя при этом правдоподобную физическую динамику. Источник: https://arxiv.org/abs/1909.09422

Примеры трех типов движений, только один из которых свободно обратим, сохраняя при этом правдоподобную физическую динамику. Источник: https://arxiv.org/abs/1909.09422

Авторы этой работы четко сформулировали проблему:

‘Мы обнаружили, что реализм обратных видео предается артефактами обратного хода, аспектами сцены, которые были бы невозможны в природном мире. Некоторые артефакты тонкие, в то время как другие легко заметить, как обратное действие ‘броска’, где брошенный объект внезапно поднимается с пола.

‘Мы наблюдаем два типа артефактов обратного хода, физические, которые демонстрируют нарушения законов природы, и маловероятные, которые изображают возможный, но маловероятный сценарий. Эти артефакты не исключительны, и многие обратные действия страдают от обоих типов артефактов, как, например, при разворачивании листа бумаги.

‘Примеры физических артефактов включают: обратную гравитацию (например, ‘падение чего-либо’), спонтанные импульсы объектов (например, ‘вращение ручки’) и необратимые изменения состояния (например, ‘горение свечи’). Пример маловероятного артефакта: взять тарелку из шкафа, высушить ее и положить на сушилку.

‘Этот тип повторного использования данных очень распространен во время обучения, и может быть полезен – например, для того, чтобы модель не училась только одному виду изображения или объекта, который можно перевернуть или повернуть без потери своей центральной связности и логики.

‘Это работает только для объектов, которые действительно симметричны, конечно; и обучение физике на ‘обратном’ видео работает только в том случае, если обратная версия имеет столько же смысла, как и прямая версия.’

Временные обратные

У нас нет доказательств того, что системы, такие как Hunyuan Video и Wan 2.1, разрешали произвольно ‘обратные’ клипы быть подвергнутыми модели во время обучения (ни одна из групп исследователей не была конкретной относительно процедур аугментации данных).

Однако единственная разумная альтернативная возможность, в свете таких многочисленных сообщений (и моего собственного практического опыта), казалось бы, заключается в том, что гипермасштабные наборы данных, которые обеспечивают эти модели, могут содержать клипы, которые фактически содержат движения, происходящие в обратном порядке.

Камень в примере видео, встроенном выше, был сгенерирован с помощью Wan 2.1 и фигурирует в новом исследовании, которое изучает, насколько хорошо видео-диффузионные модели справляются с физикой.

В тестах для этого проекта Wan 2.1 достигла балла только 22% в отношении своей способности последовательно соблюдать физические законы.

Однако это лучший балл среди всех протестированных систем, что указывает на то, что мы можем найти наш следующий препятствие для видео ИИ:

Баллы, полученные ведущими открытыми и закрытыми системами, с оценкой вывода фреймворков человеческими аннотаторами. Источник: https://arxiv.org/pdf/2503.06800

Баллы, полученные ведущими открытыми и закрытыми системами, с оценкой вывода фреймворков человеческими аннотаторами. Источник: https://arxiv.org/pdf/2503.06800

Авторы этой новой работы разработали систему оценки, теперь во второй итерации, под названием VideoPhy, с кодом доступным на GitHub.

Хотя объем работы выходит за рамки того, что мы можем здесь полностью осветить, давайте посмотрим на общий методологию и потенциал для установления метрики, которая могла бы помочь изменить направление будущих сессий обучения моделей, чтобы избежать этих странных случаев обратного хода.

Исследование, проведенное шестью исследователями из UCLA и Google Research, называется VideoPhy-2: Амбициозная оценка физического смысла в видео-генерации. Тесно связанный сайт проекта также доступен, а также код и наборы данных на GitHub, и просмотрщик набора данных на Hugging Face.

Нажмите, чтобы воспроизвести. Здесь фетированная модель OpenAI Sora не понимает взаимодействия между греблями и отражениями и не может обеспечить логический физический поток ни для человека в лодке, ни для того, как лодка взаимодействует с ней.

Метод

Авторы описывают последнюю версию своей работы, VideoPhy-2, как ‘амбициозную оценку физического смысла для реальных действий’. Коллекция включает 197 действий в различных физических активностях, таких как хула-хуп, гимнастика и теннис, а также взаимодействия с объектами, такими как сгибание объекта до разрыва.

Большая языковая модель (LLM) используется для генерации 3840 подсказок из этих базовых действий, и подсказки затем используются для синтеза видео через различные фреймворки, которые проходят испытания.

На протяжении всего процесса авторы разработали список ‘кандидатских’ физических правил и законов, которые видео, сгенерированные ИИ, должны удовлетворять, используя модели видения-языка для оценки.

Авторы заявляют:

‘Например, в видео спортсмена, играющего в теннис, физическое правило будет заключаться в том, что теннисный мяч должен следовать параболической траектории под гравитацией. Для эталонных суждений мы просим человеческих аннотаторов оценить каждое видео на основе общей семантической согласованности и физического смысла, и отметить его соответствие различным физическим правилам.’

Выше: Текстовая подсказка генерируется из действия с помощью LLM и используется для создания видео с помощью генератора текст-в-видео. Модель видения-языка подписывает видео, определяя возможные физические правила, действующие в данном случае. Ниже: Человеческие аннотаторы оценивают реализм видео, подтверждают нарушения правил, добавляют отсутствующие правила и проверяют, соответствует ли видео исходной подсказке.

Выше: Текстовая подсказка генерируется из действия с помощью LLM и используется для создания видео с помощью генератора текст-в-видео. Модель видения-языка подписывает видео, определяя возможные физические правила, действующие в данном случае. Ниже: Человеческие аннотаторы оценивают реализм видео, подтверждают нарушения правил, добавляют отсутствующие правила и проверяют, соответствует ли видео исходной подсказке.

Первоначально исследователи курировали набор действий для оценки физического смысла в видео, сгенерированных ИИ. Они начали с более чем 600 действий, полученных из Kinetics, UCF-101 и SSv2 наборов данных, сосредоточившись на активностях, включающих спорт, взаимодействия с объектами и реальную физику.

Две независимые группы STEM-обученных студентов-аннотаторов (с минимальной квалификацией бакалавра) рассмотрели и отфильтровали список, выбирая действия, которые проверяют принципы, такие как гравитация, импульс и упругость, удаляя задачи с низкой подвижностью, такие как печатание, ласка кошки или жевание.

После дальнейшей доработки с помощью Gemini-2.0-Flash-Exp для исключения дубликатов окончательный набор данных включал 197 действий, с 54, включающими взаимодействия с объектами и 143, сосредоточенными на физических и спортивных активностях:

Примеры из отфильтрованных действий.

Примеры из отфильтрованных действий.

На втором этапе исследователи использовали Gemini-2.0-Flash-Exp для генерации 20 подсказок для каждого действия в наборе данных, в результате чего получилось в общей сложности 3 940 подсказок. Процесс генерации сосредоточился на видимых физических взаимодействиях, которые могли быть четко представлены в сгенерированном видео. Это исключило невидимые элементы, такие как эмоции, сенсорные детали и абстрактный язык, но включило разнообразных персонажей и объектов.

Например, вместо простой подсказки, такой как ‘Архер выпускает стрелу’, модель была направлена на создание более подробной версии, такой как ‘Архер натягивает тетиву лука до полной натяжения, затем выпускает стрелу, которая летит прямо и попадает в мишень на бумажной цели’.

Поскольку современные видеомодели могут интерпретировать более длинные описания, исследователи进一步 доработали подписи с помощью Mistral-NeMo-12B-Instruct апсамплера подсказок, чтобы добавить визуальные детали без изменения исходного смысла.

Примеры подсказок из VideoPhy-2, категоризированные по физическим активностям или взаимодействиям с объектами. Каждая подсказка сопоставлена с соответствующим действием и соответствующим физическим принципом, который она проверяет.

Примеры подсказок из VideoPhy-2, категоризированные по физическим активностям или взаимодействиям с объектами. Каждая подсказка сопоставлена с соответствующим действием и соответствующим физическим принципом, который она проверяет.

На третьем этапе физические правила не были получены из текстовых подсказок, а из сгенерированных видео, поскольку генеративные модели могут испытывать трудности с соблюдением условных текстовых подсказок.

Видео были сначала созданы с помощью подсказок VideoPhy-2, затем ‘апсамплированы’ с помощью Gemini-2.0-Flash-Exp, чтобы извлечь ключевые детали. Модель предложила три ожидаемых физических правила для каждого видео, которые человеческие аннотаторы рассмотрели и расширили, определяя дополнительные потенциальные нарушения.

Примеры из апсамплированных подписей.

Примеры из апсамплированных подписей.

Далее, чтобы определить наиболее сложные действия, исследователи сгенерировали видео с помощью CogVideoX-5B с подсказками из набора данных VideoPhy-2. Они затем выбрали 60 действий из 197, где модель последовательно не смогла следовать как подсказкам, так и базовому физическому смыслу.

Эти действия включали физически насыщенные взаимодействия, такие как передача импульса при метании диска, изменения состояния, такие как сгибание объекта до разрыва, задачи балансирования, такие как ходьба по тросу, и сложные движения, включая сальто, прыжки с шестом и бросание пиццы, среди прочих. Всего было выбрано 1 200 подсказок, чтобы увеличить сложность поднабора.

Результирующий набор данных состоял из 3 940 подписей – 5,72 раза больше, чем в предыдущей версии VideoPhy. Средняя длина исходных подписей составляет 16 токенов, в то время как апсамплированные подписи достигают 138 токенов – 1,88 раза и 16,2 раза длиннее, соответственно.

Набор данных также включает 102 000 человеческих аннотаций, охватывающих семантическую согласованность, физический смысл и нарушения правил в нескольких моделях генерации видео.

Оценка

Исследователи затем определили четкие критерии для оценки видео. Основной целью было оценить, насколько хорошо каждое видео соответствовало входной подсказке и следовало базовым физическим принципам.

Вместо того, чтобы просто ранжировать видео по предпочтению, они использовали обратную связь на основе рейтинга, чтобы захватить конкретные успехи и неудачи. Человеческие аннотаторы оценивали видео по пятибалльной шкале, что позволяло проводить более подробные суждения, в то время как оценка также проверяла, соответствуют ли видео различным физическим правилам и законам.

Для человеческой оценки была выбрана группа из 12 аннотаторов из испытаний на Amazon Mechanical Turk (AMT), и они предоставили рейтинги после получения подробных инструкций на расстоянии. Для справедливости семантическая согласованность и физический смысл оценивались отдельно (в исходном исследовании VideoPhy они оценивались совместно).

Аннотаторы сначала оценивали, насколько хорошо видео соответствовало входным подсказкам, затем отдельно оценивали физическую правдоподобность, оценивая нарушения правил и общий реализм по пятибалльной шкале. Только исходные подсказки были показаны, чтобы сохранить справедливое сравнение между моделями.

Интерфейс, представленный аннотаторам AMT.

Интерфейс, представленный аннотаторам AMT.

Хотя человеческая оценка остается эталонной, она дорогая и имеет ряд ограничений. Поэтому автоматическая оценка необходима для более быстрой и масштабируемой оценки моделей.

Авторы статьи протестировали несколько моделей видео-языка, включая Gemini-2.0-Flash-Exp и VideoScore, на их способность оценить видео по семантической точности и ‘физическому смыслу’.

Модели снова оценивали каждое видео по пятибалльной шкале, в то время как отдельная задача классификации определяла, следуют ли физические правила, нарушаются или неясны.

Эксперименты показали, что существующие модели видео-языка испытывали трудности в совпадении с человеческими суждениями, в основном из-за слабого физического рассуждения и сложности подсказок. Чтобы улучшить автоматическую оценку, исследователи разработали VideoPhy-2-Autoeval, модель с 7 миллиардами параметров, предназначенную для предоставления более точных прогнозов в трех категориях: семантическая согласованность; физический смысл; и соблюдение правил, дообученная на VideoCon-Physics с помощью 50 000 человеческих аннотаций*.

Данные и тесты

С этими инструментами на месте авторы протестировали ряд генеративных систем видео, как через локальные установки, так и через коммерческие API: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; и Luma Ray.

Модели были снабжены апсамплированными подписями, где это было возможно, за исключением того, что Hunyuan Video и VideoCrafter2 работают под ограничением 77-токенов CLIP и не могут принимать подсказки длиной более определенного предела.

Сгенерированные видео были ограничены менее чем 6 секундами, поскольку более короткий вывод легче оценить.

Данные, управляющие процессом, были из набора данных VideoPhy-2, который был разделен на эталонный и обучающий набор. 590 видео было сгенерировано для каждой модели, за исключением Sora и Ray2; из-за стоимости (для этих моделей было сгенерировано меньшее количество видео).

(Пожалуйста, обратитесь к исходной статье для дальнейших подробностей оценки, которые тщательно описаны там)

Первоначальная оценка касалась физических активностей/спорта (PA) и взаимодействий с объектами (OI), и протестировала как общий набор данных, так и вышеупомянутый ‘сложный’ поднабор:

Результаты из первого раунда.

Результаты из первого раунда.

Здесь авторы комментируют:

‘Даже лучшая модель, Wan2.1-14B, достигает только 32,6% и 21,9% на полном и сложном разделах нашего набора данных соответственно. Ее относительно сильная производительность по сравнению с другими моделями можно отнести к разнообразию ее многомодального обучающего набора данных, а также к прочной фильтрации движения, которая сохраняет высококачественные видео в широком диапазоне действий.

‘Кроме того, мы наблюдаем, что закрытые модели, такие как Ray2, работают хуже, чем открытые модели, такие как Wan2.1-14B и CogVideoX-5B. Это говорит о том, что закрытые модели не обязательно превосходят открытые модели в захвате физического смысла.

‘Заметно, что Cosmos-Diffusion-7B достигает второго лучшего балла на сложном разделе, даже превосходя гораздо более крупную модель HunyuanVideo-13B. Это может быть связано с высоким представлением человеческих действий в ее обучающих данных, а также с синтетически отрендеренными симуляциями.’

Результаты показали, что видеомодели испытывали больше трудностей с физическими активностями, такими как спорт, чем с более простыми взаимодействиями с объектами. Это говорит о том, что улучшение ИИ-генерируемого видео в этой области потребует лучших наборов данных – особенно высококачественных кадров спорта, таких как теннис, метание диска, бейсбол и крикет.

Исследование также изучило, коррелирует ли физическая правдоподобность модели с другими метриками качества видео, такими как эстетика и плавность движения. Результаты показали, что нет сильной корреляции, что означает, что модель не может улучшить свою производительность на VideoPhy-2, просто генерируя визуально привлекательные или плавные движения – ей нужен более глубокий смысл физического смысла.

Хотя статья предоставляет многочисленные качественные примеры, немногие из статических примеров, представленных в PDF, кажется, связаны с обширными видео-примерами, которые авторы предоставляют на сайте проекта. Поэтому мы посмотрим на небольшую выборку статических примеров, а затем некоторые из фактических проектных видео.

Верхний ряд показывает видео, сгенерированные Wan2.1. (а) В Ray2 джет-ски слева отстает, прежде чем двигаться назад. (б) В Hunyuan-13B молоток деформируется в середине взмаха, и сломанная деревянная доска появляется неожиданно. (в) В Cosmos-7B копье выталкивает песок, прежде чем соприкоснуться с землей.

Верхний ряд показывает видео, сгенерированные Wan2.1. (а) В Ray2 джет-ски слева отстает, прежде чем двигаться назад. (б) В Hunyuan-13B молоток деформируется в середине взмаха, и сломанная деревянная доска появляется неожиданно. (в) В Cosmos-7B копье выталкивает песок, прежде чем соприкоснуться с землей.

Относительно вышеупомянутого качественного теста авторы комментируют:

‘[Мы] наблюдаем нарушения физического смысла, такие как джет-ски, движущиеся неестественно в обратном направлении, и деформация твердого молотка, нарушающая принципы упругости. Однако даже Wan страдает от отсутствия физического смысла, как показано в [клипе, встроенном в начало этой статьи].

‘В этом случае мы подчеркиваем, что камень начинает катиться и ускоряться в гору, нарушающий закон гравитации.’

Дальнейшие примеры с сайта проекта:

Нажмите, чтобы воспроизвести. Здесь подпись была ‘Человек энергично скручивает мокрое полотенце, вода брызгает наружу в видимой дуге’ – но получившийся источник воды больше похож на шланг, чем на полотенце.

Нажмите, чтобы воспроизвести. Здесь подпись была ‘Химик наливает прозрачную жидкость из колбы в пробирку, тщательно избегая проливов’, но мы можем видеть, что объем воды, добавляемой в колбу, не соответствует количеству, выходящему из кувшина.

Как я упоминал в начале, объем материала, связанного с этим проектом, намного превышает то, что можно здесь осветить. Поэтому, пожалуйста, обратитесь к исходной статье, сайту проекта и связанным сайтам, упомянутым ранее, для получения исчерпывающего описания процедур авторов и значительно большего количества тестовых примеров и подробностей процедуры.

 

* Что касается происхождения аннотаций, статья только указывает ‘приобретено для этих задач’ – кажется, что это многое, чтобы быть сгенерированным 12 работниками AMT.

Опубликовано впервые в четверг, 13 марта 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai