Взгляд Anderson
Переосмысление обучения видео ИИ с помощью пользовательских данных

Тип контента, который пользователи могут создать с помощью генеративной модели, такой как Flux или Hunyuan Video, может не всегда быть легко доступен, даже если запрос на контент достаточно общий, и можно предположить, что генератор сможет его обработать.
Одним из примеров, описанных в новой статье, является то, что модель OpenAI Sora имеет некоторые трудности с правильным отображением светляка, используя запрос ‘Светляк светится на листе травы в спокойную летнюю ночь’:

Модель OpenAI Sora имеет немного искаженное понимание анатомии светляка. Источник: https://arxiv.org/pdf/2503.01739
Поскольку я редко принимаю исследовательские заявления за чистую монету, я протестировал тот же запрос на Sora сегодня и получил немного лучший результат. Однако Sora все еще не смогла правильно отобразить свет – вместо того, чтобы осветить кончик хвоста светляка, где происходит биолюминесценция, она разместила свет возле ног насекомого:

Мой собственный тест запроса исследователей в Sora показывает, что Sora не понимает, откуда берется свет светляка.
Иронично, что генеративный диффузионный движок Adobe Firefly, обученный на защищенных авторским правом фотографиях и видео компании, смог добиться только 1 из 3 успешных результатов в этом отношении, когда я попытался использовать тот же запрос в функции генеративного ИИ Photoshop:

Только последний из трех сгенерированных запросов исследователей производит свет в Adobe Firefly (март 2025), хотя свет расположен в правильной части анатомии насекомого.
Этот пример был выделен исследователями в новой статье, чтобы проиллюстрировать, что распределение, акцент и покрытие в наборах данных, используемых для обучения популярных фундаментальных моделей, могут не соответствовать потребностям пользователей, даже если пользователь не просит ничего особенно сложного – тема, которая поднимает проблемы, связанные с адаптацией гипермасштабных наборов данных к их наиболее эффективным и производительным результатам в качестве генеративных моделей.
Авторы заявляют:
‘[Sora] не может уловить концепцию светляка, в то время как успешно генерирует траву и летнюю ночь. С точки зрения данных, мы делаем вывод, что это в основном потому, что [Sora] не была обучена на темах, связанных со светляками, в то время как она была обучена на траве и ночи. Кроме того, если [Sora] видела видео, показанное выше, она поймет, как должен выглядеть светляк.’
Они вводят новый отобранный набор данных и предлагают, что их методология может быть усовершенствована в будущей работе для создания коллекций данных, которые лучше соответствуют ожиданиям пользователей, чем многие существующие модели.
Данные для людей
По сути, их предложение представляет собой подход к курированию данных, который находится где-то между индивидуальными данными для модели типа LoRA (и этот подход слишком специфичен для общего использования); и широкими и относительно безразличными большими коллекциями (такими как набор данных LAION, который питает Stable Diffusion), которые не специально выровнены с какой-либо конечной сценой использования.
Новый подход, как методология, так и новый набор данных, названный Users’ FOcus in text-to-video, или VideoUFO. Набор данных VideoUFO состоит из 1,9 миллиона видеоклипов, охватывающих 1291 тему, ориентированную на пользователя. Темы сами были разработаны из существующего набора видеоданных и прошли через различные языковые модели и методы обработки естественного языка:

Примеры дистиллированных тем, представленных в новой статье.
Набор данных VideoUFO содержит большое количество новых видео, собранных из YouTube – ‘новых’ в том смысле, что видео в вопросе не представлены в видео-наборах, которые в настоящее время популярны в литературе, и, следовательно, во многих подмножествах, которые были отобраны из них (и многие видео были фактически загружены после создания старых наборов данных, упомянутых в статье).
Фактически, авторы утверждают, что существует только 0,29% совпадения с существующими видео-наборами – впечатляющее доказательство новизны.
Одной из причин этого может быть то, что авторы принимали только видео с YouTube с лицензией Creative Commons, которая была бы менее вероятной для того, чтобы помешать пользователям в будущем: возможно, что эта категория видео была менее приоритетной в предыдущих обходах YouTube и других высокообъемных платформ.
Во-вторых, видео были запрошены на основе предварительно оцененных потребностей пользователей (см. изображение выше), а не безразлично собраны. Эти два фактора в сочетании могли привести к такой новой коллекции. Кроме того, исследователи проверили идентификаторы YouTube видео, которые могли позже быть разделены и переосмыслены для коллекции VideoUFO, против тех, которые представлены в существующих коллекциях, что подтверждает утверждение.
Хотя не все в новой статье так же убедительно, это интересное чтение, которое подчеркивает степень, в которой мы все еще довольно зависим от неравномерных распределений в наборах данных, в плане препятствий, с которыми часто сталкивается исследовательская сцена в курировании наборов данных.
Новая работа названа VideoUFO: Набор данных миллионного масштаба для генерации текста в видео, и приходит от двух исследователей,分别 из Университета технологий Сиднея в Австралии и Университета Чжэцзяна в Китае.

Выбранные примеры из окончательного полученного набора данных.
‘Личный шопер’ для данных ИИ
Тема и концепции, представленные в общей сумме интернет-изображений и видео, не обязательно отражают то, что может потребовать от генеративной системы средний конечный пользователь; даже когда контент и спрос действительно совпадают (как в случае с порнографией, которая обильно доступна в Интернете и очень интересна многим пользователям генеративного ИИ), это может не соответствовать намерениям и стандартам разработчиков для новой генеративной системы.
Помимо большого количества нецензурного контента, загружаемого ежедневно, непропорционально большое количество доступного материала, скорее всего, будет来自 рекламодателей и тех, кто пытается манипулировать SEO. Коммерческие интересы такого рода делают распределение тем далеко не беспристрастным; хуже того, разработка систем фильтрации на основе ИИ, которые могут справиться с этой проблемой, является сложной задачей, поскольку алгоритмы и модели, разработанные из значимых гипермасштабных данных, могут сами отражать тенденции и приоритеты исходных данных.
Поэтому авторы новой работы подходят к проблеме, обратив предложение, определяя, что пользователи, скорее всего, захотят, и получая видео, которые соответствуют этим потребностям.
На поверхности этот подход кажется столь же вероятным, чтобы спровоцировать семантическую гонку на дно, как и достичь сбалансированной, нейтральной позиции. Калибровка курирования данных вокруг спроса пользователей рискует усилить предпочтения наименьшего общего знаменателя, в то время как маргинализирует нишевых пользователей, поскольку интересы большинства неизбежно будут иметь больший вес.
Однако давайте посмотрим, как статья решает эту проблему.
Дистиллирование концепций с дискрецией
Исследователи использовали набор данных VidProM 2024 года в качестве источника для анализа тем, который позже информировал веб-скрейпинг проекта.
Этот набор данных был выбран, как заявляют авторы, потому что он является единственным публично доступным набором данных с более чем 1 миллионом элементов, ‘написанных реальными пользователями’ – и должно быть заявлено, что этот набор данных был сам отобран двумя авторами новой статьи.
Статья объясняет*:
‘Сначала мы встраиваем все 1,67 миллиона запросов из VidProM в 384-мерные векторы с помощью SentenceTransformers. Затем мы кластеризуем эти векторы с помощью K-means. Обратите внимание, что здесь мы предварительно устанавливаем количество кластеров на относительно большое значение, т.е. 2000, и объединяем подобные кластеры на следующем шаге.
‘Наконец, для каждого кластера мы просим GPT-4o, чтобы заключить тему [одно или два слова].’
Авторы указывают, что определенные концепции являются различными, но заметно соседними, такими как церковь и собор. Слишком детальный критерий для случаев такого рода приведет к концептуальным вложениям (например, для каждого типа породы собак), вместо термина собака; в то время как слишком широкий критерий может объединить чрезмерное количество подконцепций в одну переполненную концепцию; поэтому статья отмечает необходимый баланс для оценки таких случаев.
Единственные и множественные формы были объединены, и глаголы были восстановлены до их базовой (инфинитивной) формы. Чрезмерно широкие термины – такие как анимация, сцена, фильм и движение – были удалены.
Таким образом, было получено 1291 тема (с полным списком, доступным в дополнительном разделе исходной статьи).
Выборочный веб-скрейпинг
Далее исследователи использовали официальный API YouTube, чтобы искать видео на основе критериев, дистиллированных из набора данных 2024 года, стремясь получить 500 видео для каждой темы. Помимо необходимой лицензии Creative Commons, каждое видео должно было иметь разрешение 720p или выше и быть короче четырех минут.
Таким образом, было собрано 586 490 видео из YouTube.
Авторы сравнили идентификатор YouTube загруженных видео с несколькими популярными наборами данных: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; и WebVid-10M.
Они обнаружили, что только 1675 идентификаторов (вышеупомянутые 0,29%) видеоклипов VideoUFO представлены в этих старых коллекциях, и должно быть признано, что хотя список сравнения не является исчерпывающим, он включает все крупнейшие и наиболее влиятельные игроки на рынке генеративных видео.
Разделы и оценка
Полученные видео были затем разделены на несколько клипов в соответствии с методологией, изложенной в статье Panda-70M, упомянутой выше. Границы кадров были оценены, сборки были сшиты, а объединенные видео были разделены на отдельные клипы, с краткими и подробными подписями.

Каждая запись данных в наборе данных VideoUFO содержит клип, идентификатор, начало и конец времени, а также краткую и подробную подпись.
Краткие подписи были обработаны методом Panda-70M, а подробные видео-подписи – Qwen2-VL-7B, в соответствии с руководящими принципами, установленными Open-Sora-Plan. В случаях, когда клипы не смогли воплотить предназначенную целевую концепцию, подробные подписи для каждого такого клипа были поданы в GPT-4o mini, чтобы определить, является ли это действительно подходящей темой. Хотя авторы предпочли бы оценку с помощью GPT-4o, это было бы слишком дорого для миллионов видеоклипов.
Оценка качества видео была проведена с помощью шести методов из проекта VBench.
Сравнения
Авторы повторили процесс извлечения тем для вышеупомянутых предыдущих наборов данных. Для этого было необходимо семантически сопоставить полученные категории VideoUFO с неизбежно разными категориями в других коллекциях; должно быть признано, что такие процессы предоставляют только приблизительно эквивалентные категории, и поэтому это может быть слишком субъективным процессом, чтобы гарантировать эмпирические сравнения.
Тем не менее, в изображении ниже мы видим результаты, которые исследователи получили с помощью этого метода:

Сравнение фундаментальных атрибутов, полученных в VideoUFO и предыдущих наборах данных.
Исследователи признают, что их анализ опирался на существующие подписи и описания, предоставленные в каждом наборе данных. Они признают, что повторная подпись старых наборов данных с помощью того же метода, что и VideoUFO, могла бы предоставить более прямое сравнение. Однако, учитывая огромный объем данных, их вывод о том, что этот подход будет чрезмерно дорогим, кажется оправданным.
Генерация
Авторы разработали эталон для оценки производительности моделей текст-в-видео на ориентированных на пользователя концепциях, названный BenchUFO. Это включало выбор 791 существительных из 1291 дистиллированной пользовательской темы в VideoUFO. Для каждой выбранной темы были случайным образом выбраны 10 текстовых запросов из VidProM.
Каждый запрос был передан в модель текст-в-видео, а вышеупомянутый подписчик Qwen2-VL-7B был использован для оценки сгенерированных результатов. С помощью сгенерированных видео было рассчитано косинусное сходство как для входного запроса, так и для вывода (выведенного) описания в каждом случае.

Схема процесса BenchUFO.
Оцененные генеративные модели были: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; и Pyramidal.
Помимо VideoUFO, MVDiT-VidGen и MVDit-OpenVid были использованы в качестве альтернативных наборов данных для обучения.
Результаты учитывают 10-50 худших и лучших тем по архитектурам и наборам данных.

Результаты производительности публичных моделей T2V по сравнению с обученными моделями авторов на BenchUFO.
Здесь авторы комментируют:
‘Текущие модели текст-в-видео не последовательно хорошо работают на всех ориентированных на пользователя темах. В частности, существует разница в баллах от 0,233 до 0,314 между лучшими 10 и худшими 10 темами. Эти модели могут не эффективно понимать темы, такие как “гигантский кальмар”, “клетка животного”, “Ван Гог” и “древний египетский”, из-за недостаточной подготовки на таких видео.’
‘Текущие модели текст-в-видео показывают определенный уровень последовательности в своих лучших темах. Мы обнаружили, что большинство моделей текст-в-видео хорошо работают на видео, связанных с животными, таких как “чайка”, “панда”, “дельфин”, “верблюд” и “сова”. Мы делаем вывод, что это частично связано с предвзятостью в сторону животных в текущих видео-наборах данных.’
Вывод
VideoUFO – это выдающееся предложение, если только с точки зрения свежих данных. Если нет ошибок в оценке и исключении идентификаторов YouTube, и если набор данных содержит так много нового материала для исследовательской сцены, это редкое и потенциально ценное предложение.
Недостатком является то, что необходимо дать доверие основной методологии; если вы не верите, что спрос пользователей должен информировать формулы веб-скрейпинга, вы будете покупать набор данных, который имеет свои собственные наборы проблемных предвзятостей.
Дальнейшее, полезность дистиллированных тем зависит как от надежности метода дистилляции, использованного (который обычно ограничен бюджетными ограничениями), так и от методов формирования для набора данных 2024 года, который обеспечивает исходный материал.
Тем не менее, VideoUFO, безусловно, заслуживает дальнейшего исследования – и оно доступно на Hugging Face.
* Моя замена цитат авторов на гиперссылки.
Опубликовано впервые в среду, 5 марта 2025 года












