Погляд Anderson

Перегляд відео-тренування штучного інтелекту з користувацькими даними

mm
Додайте Unite.AI до бажаних джерел у Google
Examples from the paper ' VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation'

Вид контенту, який користувачі можуть створити за допомогою генеративної моделі, chẳng hạn як Flux або Hunyuan Video, не завжди легко доступний, навіть якщо запит на контент досить загальний, і можна подумати, що генератор зможе впоратися з цим.

Одним із прикладів, про який йдеться в новій статті, є те, що модель OpenAI Sora має певні труднощі з відтворенням анатомічно правильної світлячка, використовуючи запит ‘Світлячок світиться на листі трави в сереному літньому вечорі’:

Модель OpenAI Sora має трохи неправильне розуміння анатомії світлячка. Джерело: https://arxiv.org/pdf/2503.01739

Модель OpenAI Sora має трохи неправильне розуміння анатомії світлячка. Джерело: https://arxiv.org/pdf/2503.01739

Відтак я рідко приймаю заяви дослідників без перевірки, і сьогодні я перевірив той же запит на Sora, і отримав трохи кращий результат. Однак Sora все ще не зміг правильно відтворити світло – замість того, щоб освітлювати кінчик хвоста світлячка, де відбувається біолюмінесценція, він помістив світло біля ніг комахи:

Мій власний тест запиту дослідників у Sora показує, що Sora не розуміє, звідки береться світло світлячка.

Мій власний тест запиту дослідників у Sora показує, що Sora не розуміє, звідки береться світло світлячка.

Іронічно, генеративний дифузійний двигун Adobe Firefly, навчений на захищених авторським правом фотографіях і відео компанії, зміг лише у 1 із 3 випадків правильно відтворити світло, коли я спробував той же запит у функції генерації AI Photoshop:

Тільки останнє з трьох запропонованих поколінь запиту дослідників у Adobe Firefly (березень 2025 року) показує світло, хоча воно знаходиться в правильній частині анатомії комахи.

Тільки останнє з трьох запропонованих поколінь запиту дослідників у Adobe Firefly (березень 2025 року) показує світло, хоча воно знаходиться в правильній частині анатомії комахи.

Цей приклад був підкреслений дослідниками нової статті, щоб показати, що розподіл, акцент і покриття у навчальних наборах даних, які використовуються для інформування популярних моделей, можуть не відповідати потребам користувачів, навіть якщо користувач не просить нічого особливого – тема, яка піднімає питання про адаптацію гіпермасштабних навчальних наборів даних до їх найбільш ефективних і продуктивних результатів як генеративних моделей.

Автори заявляють:

‘[Sora] не може впоратися з концепцією світлячка, який світиться, хоча успішно генерує траву і літню ніч’

‘З точки зору даних, ми робимо висновок, що це головним чином тому, що [Sora] не була навчена на темах, пов’язаних зі світлячками, тоді як вона була навчена на траві і ночі. Крім того, якщо [Sora] бачила відео, показане вище, вона зрозуміє, як повинен виглядати світлячок, який світиться.’

Вони вводять новий кураторський набір даних і пропонують, що їхній метод може бути вдосконалений у майбутній роботі для створення наборів даних, які краще відповідають очікуванням користувачів, ніж багато існуючих моделей.

Дані для людей

По суті, їхнє пропонування полягає в підході до кураторства даних, який знаходиться між індивідуальними даними для моделі типу LoRA (і цей підхід занадто специфічний для загального використання); і широкими та відносно недискримінативними великомасштабними колекціями (такими як набір даних LAION, який живить Stable Diffusion), які не специфічно орієнтовані на будь-який кінцевий сценарій.

Новий підхід, як методологія, так і новий набір даних, названий Users’ FOcus in text-to-video, або VideoUFO. Набір даних VideoUFO складається з 1,9 мільйона відеокліпів, що охоплюють 1291 тему, орієнтовану на користувачів. Самі теми були розвинені з існуючого відеонабору даних і проаналізовані за допомогою різних мовних моделей і методів обробки природної мови:

Зразки витягнутих тем, представлені в новій статті.

Зразки витягнутих тем, представлені в новій статті.

Набір даних VideoUFO містить велику кількість нових відео, взятих з YouTube – “нових” у сенсі, що відео, представлені в цьому наборі даних, не входять до інших популярних відеонаборів даних, і тому не входять до багатьох піднаборів, створених з них (і багато з цих відео були завантажені після створення старіших наборів даних, про які йдеться в статті).

Фактично, автори стверджують, що існує лише 0,29% перекриття з існуючими відеонаборами даних – це вражаюче свідчення новизни.

Одна з причин цього може полягати в тому, що автори приймали лише відео з YouTube, які мали ліцензію Creative Commons, яка була б менш схильна ускладнювати подальшу роботу користувачів.

Друга причина полягає в тому, що відео були запропоновані на основі попередньо оцінених потреб користувачів (див. зображення вище), і не були взяті бездумно. Ці два фактори разом можуть привести до такої нової колекції.

Крім того, дослідники перевірили ідентифікатори YouTube завантажених відео проти ідентифікаторів, представлених в інших колекціях, що підтверджує їхнє твердження.

Хоча не все в новій статті є настільки переконливим, це цікаве читання, яке підкреслює ступінь, до якого ми все ще залежимо від нерівномірних розподілів у наборах даних, щодо перешкод, з якими часто стикається дослідницька сфера при кураторстві даних.

Нова робота називається VideoUFO: Набір даних у мільйон масштабу для генерації відео з тексту, і походять від двох дослідників з Університету технологій Сіднея в Австралії та Університету Чжецзян в Китаї.

Вибрані приклади з отриманого набору даних.

Вибрані приклади з отриманого набору даних.

‘Персональний шопер’ для даних штучного інтелекту

Тема і концепції, представлені в загальній сумі інтернет-образів і відео, не обов’язково відображають те, що звичайний кінцевий користувач може запитати у генеративної системи; навіть коли контент і попит співпадають (наприклад, з порнографією, яка доступна на інтернеті і цікає багатьох користувачів генеративного інтелекту), це може не відповідати намірам і стандартам розробників нової генеративної системи.

Окрім великої кількості несумісного контенту, який завантажується щодня, нерівномірна кількість доступного матеріалу, ймовірно, буде походити від рекламодавців і тих, хто спробує маніпулювати SEO. Комерційні інтереси цього типу роблять розподіл тем далеко не безстороннім; гірше того, складно розробити системи фільтрації на основі штучного інтелекту, які можуть впоратися з цією проблемою, оскільки алгоритми і моделі, розроблені з великомасштабних даних, можуть самі відображати тенденції і пріоритети джерельних даних.

Отже, автори нової роботи підходять до проблеми з іншого боку, визначаючи, чого хочуть користувачі, і отримуючи відео, які відповідають цим потребам.

На поверхні цей підхід здається таким же ймовірним, щоб спровокувати семантичну гонку до дна, як і досягти балансированої, нейтральної позиції, як у Вікіпедії. Калібрування кураторства даних навколо попиту користувачів ризикує посиленням упереджень найнижчого спільного знаменника, тоді як маргіналізовані користувачі будуть відштовхнуті, оскільки інтереси більшості будуть мати більшу вагу.

Відділення концепцій з дискрецією

Дослідники використали набір даних VidProM 2024 року як джерело для тематичного аналізу, який пізніше інформував проєкт щодо веб-скрейпінгу.

Цей набір даних був обраний, як зазначили автори, оскільки це єдиний публічно доступний набір даних розміром понад 1 мільйон, “написаний реальними користувачами” – і варто зазначити, що цей набір даних був сам кураторований двома авторами нової статті.

Стаття пояснює*:

‘Спочатку ми вкладаємо всі 1,67 мільйона запитів з VidProM у 384-мірні вектори за допомогою SentenceTransformers. Потім ми кластеризуємо ці вектори за допомогою K-means. Зазначимо, що тут ми встановлюємо кількість кластерів великим значенням, тобто 2000, і об’єднуємо схожі кластери на наступному етапі.

‘Нарешті, для кожного кластеру ми просимо GPT-4o, щоб зробити висновок про тему [одне чи два слова].’

Автори зазначають, що певні концепції є відмінними, але помітно сусідніми, наприклад церква і собор. Занадто детальний критерій для таких випадків призведе до вкладень концепцій (наприклад, терміну “собака” замість окремих порід); тоді як занадто широкий критерій може об’єднати надто багато підконцепцій в одну переповнену концепцію; тому стаття зазначає необхідність балансированої оцінки таких випадків.

Одні та множинні форми були об’єднані, а дієслова відновлені до їхньої базової (інфінітивної) форми. Занадто широкі терміни, такі як анімація, сцена, фільм і рух, були видалені.

Таким чином було отримано 1291 тем, список яких доступний у додатковій частині джерельної статті.

Вибірковий веб-скрейпінг

Далі дослідники використали офіційний API YouTube для пошуку відео за критеріями, витягнутими з набору даних 2024 року, намагаючись отримати 500 відео для кожної теми. Окрім необхідної ліцензії Creative Commons, кожне відео мало мати роздільну здатність 720p або вище і тривалість менше чотирьох хвилин.

Цим чином було отримано 586 490 відео з YouTube.

Автори порівняли ідентифікатори YouTube завантажених відео з кількома популярними наборами даних: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; і WebVid-10M.

Вони виявили, що лише 1675 ідентифікаторів відео з набору даних VideoUFO були представлені в цих старіших колекціях, і можна погодитися, що хоча список порівняння не є вичерпним, він включає всі найбільші і найбільш впливові гравці у сфері генерації відео.

Розподіл і оцінка

Отримані відео були потім розділені на кілька кліпів згідно з методологією, викладеною в статті Panda-70M, згаданій вище. Було оцінено межі кадрів, зшито збірки і розділено сконкатеновані відео на окремі кліпи, з наданими короткими і детальними підписами.

Кожен запис у наборі даних VideoUFO містить кліп, ідентифікатор, час початку і закінчення, а також короткий і детальний опис.

Кожен запис у наборі даних VideoUFO містить кліп, ідентифікатор, час початку і закінчення, а також короткий і детальний опис.

Короткі описи були оброблені методом Panda-70M, а детальні відеоописи – за допомогою Qwen2-VL-7B, згідно з керівними принципами, встановленими у Open-Sora-Plan. У випадках, коли кліпи не відповідали запланованій концепції, детальні описи кожного такого кліпу були введені в GPT-4o mini, щоб визначити, чи відповідає він темі. Хоча автори бажали б оцінити за допомогою GPT-4o, це було б надто дорого для мільйонів відеокліпів.

Оцінка якості відео була проведена за допомогою шести методів з проєкту VBench.

Порівняння

Автори повторили процес витягнення тем з попередніх наборів даних. Для цього було необхідно семантично зіставити витягнуті категорії VideoUFO з категоріями інших колекцій; варто зазначити, що такий процес забезпечує лише приблизно еквівалентні категорії, і тому він може бути надто суб’єктивним, щоб забезпечити емпіричні порівняння.

Відтак, у зображенні нижче показані результати, які отримали дослідники цим методом:

Порівняння фундаментальних атрибутів, отриманих у VideoUFO і попередніх наборах даних.

Порівняння фундаментальних атрибутів, отриманих у VideoUFO і попередніх наборах даних.

Дослідники визнають, що їхній аналіз залежить від існуючих описів і підписів, представлених у кожному наборі даних. Вони зазначають, що повторне підписування старіших наборів даних тим же методом, що і VideoUFO, могло б забезпечити більш прямое порівняння. Однак, враховуючи величезну кількість даних, їхнє висновок, що такий підхід був би надто дорогим, видається обґрунтованим.

Генерація

Автори розробили бенчмарк для оцінки продуктивності моделей генерації відео з тексту щодо орієнтованих на користувачів концепцій, названий BenchUFO. Це включало вибір 791 іменника з 1291 витягнутих тем у VideoUFO. Для кожної вибраної теми було випадково вибрано 10 текстових запитів з VidProM.

Кожен запит був переданий до моделі генерації відео з тексту, а потім використовувався описувач Qwen2-VL-7B для оцінки отриманих результатів. Після того, як усі згенеровані відео були описані, використовувався SentenceTransformers для розрахунку косинусної подібності між вхідним запитом і виведеним описом у кожному випадку.

Схема процесу BenchUFO.

Схема процесу BenchUFO.

Оцінювані генеративні моделі були: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; і Pyramidal.

Окрім VideoUFO, MVDiT-VidGen і MVDit-OpenVid були альтернативними навчальними наборами даних.

Результати розглядають 10-50 найгірших і найкращих тем через архітектури і набори даних.

Результати продуктивності публічних моделей генерації відео з тексту порівняно з навченими моделями авторів на BenchUFO.

Результати продуктивності публічних моделей генерації відео з тексту порівняно з навченими моделями авторів на BenchUFO.

Автори коментують:

‘Поточні моделі генерації відео з тексту не показують стабільно високих результатів у всіх орієнтованих на користувачів темах. Зокрема, існує різниця у оцінці, що варіюється від 0,233 до 0,314 між 10 найкращими і 10 найгіршими темами. Ці моделі можуть не ефективно розуміти теми, такі як “гігантський кальмар”, “клітинна тварина”, “Ван Гог” і “давньоєгипетський”, через недостатнє навчання на таких відео.’

‘Поточні моделі генерації відео з тексту показують певний рівень стабільності у своїх найкращих темах. Ми виявили, що більшість моделей генерації відео з тексту добре працюють з відео на тваринні теми, такі як “чайка”, “панда”, “дельфін”, “верблюд” і “сова”. Ми робимо висновок, що це частково пояснюється упередженням щодо тварин у поточних відеонаборах даних.’

Висновок

VideoUFO – видатна пропозиція, якщо тільки з точки зору нових даних. Якщо немає помилки у оцінці і видаленні ідентифікаторів YouTube, і якщо набір даних містить так багато матеріалу, який новий для дослідницької сфери, це рідкісна і потенційно цінна пропозиція.

Недолік полягає в тому, що потрібно довіряти основній методології; якщо ви не вважаєте, що запит користувачів повинен інформувати формули веб-скрейпінгу, ви будете купувати набір даних, який має свої власні набори проблемних упереджень.

Крім того, корисність витягнутих тем залежить як від надійності методу витягнення, який використовувався (що загалом ускладнюється бюджетними обмеженнями), так і від методів формулювання для набору даних 2024 року, який забезпечує джерельний матеріал.

Відтак VideoUFO безумовно заслуговує на подальше дослідження – і воно доступне на Hugging Face.

* Моя заміна цитат авторів на гіперпосилання.

Опубліковано вперше у середу, 5 березня 2025 року.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai