Погляд Anderson
Перегляд відео-тренування штучного інтелекту з користувацькими даними

Вид контенту, який користувачі можуть створити за допомогою генеративної моделі, chẳng hạn як Flux або Hunyuan Video, не завжди легко доступний, навіть якщо запит на контент досить загальний, і можна подумати, що генератор зможе впоратися з цим.
Одним із прикладів, про який йдеться в новій статті, є те, що модель OpenAI Sora має певні труднощі з відтворенням анатомічно правильної світлячка, використовуючи запит ‘Світлячок світиться на листі трави в сереному літньому вечорі’:

Модель OpenAI Sora має трохи неправильне розуміння анатомії світлячка. Джерело: https://arxiv.org/pdf/2503.01739
Відтак я рідко приймаю заяви дослідників без перевірки, і сьогодні я перевірив той же запит на Sora, і отримав трохи кращий результат. Однак Sora все ще не зміг правильно відтворити світло – замість того, щоб освітлювати кінчик хвоста світлячка, де відбувається біолюмінесценція, він помістив світло біля ніг комахи:

Мій власний тест запиту дослідників у Sora показує, що Sora не розуміє, звідки береться світло світлячка.
Іронічно, генеративний дифузійний двигун Adobe Firefly, навчений на захищених авторським правом фотографіях і відео компанії, зміг лише у 1 із 3 випадків правильно відтворити світло, коли я спробував той же запит у функції генерації AI Photoshop:

Тільки останнє з трьох запропонованих поколінь запиту дослідників у Adobe Firefly (березень 2025 року) показує світло, хоча воно знаходиться в правильній частині анатомії комахи.
Цей приклад був підкреслений дослідниками нової статті, щоб показати, що розподіл, акцент і покриття у навчальних наборах даних, які використовуються для інформування популярних моделей, можуть не відповідати потребам користувачів, навіть якщо користувач не просить нічого особливого – тема, яка піднімає питання про адаптацію гіпермасштабних навчальних наборів даних до їх найбільш ефективних і продуктивних результатів як генеративних моделей.
Автори заявляють:
‘[Sora] не може впоратися з концепцією світлячка, який світиться, хоча успішно генерує траву і літню ніч’
‘З точки зору даних, ми робимо висновок, що це головним чином тому, що [Sora] не була навчена на темах, пов’язаних зі світлячками, тоді як вона була навчена на траві і ночі. Крім того, якщо [Sora] бачила відео, показане вище, вона зрозуміє, як повинен виглядати світлячок, який світиться.’
Вони вводять новий кураторський набір даних і пропонують, що їхній метод може бути вдосконалений у майбутній роботі для створення наборів даних, які краще відповідають очікуванням користувачів, ніж багато існуючих моделей.
Дані для людей
По суті, їхнє пропонування полягає в підході до кураторства даних, який знаходиться між індивідуальними даними для моделі типу LoRA (і цей підхід занадто специфічний для загального використання); і широкими та відносно недискримінативними великомасштабними колекціями (такими як набір даних LAION, який живить Stable Diffusion), які не специфічно орієнтовані на будь-який кінцевий сценарій.
Новий підхід, як методологія, так і новий набір даних, названий Users’ FOcus in text-to-video, або VideoUFO. Набір даних VideoUFO складається з 1,9 мільйона відеокліпів, що охоплюють 1291 тему, орієнтовану на користувачів. Самі теми були розвинені з існуючого відеонабору даних і проаналізовані за допомогою різних мовних моделей і методів обробки природної мови:

Зразки витягнутих тем, представлені в новій статті.
Набір даних VideoUFO містить велику кількість нових відео, взятих з YouTube – “нових” у сенсі, що відео, представлені в цьому наборі даних, не входять до інших популярних відеонаборів даних, і тому не входять до багатьох піднаборів, створених з них (і багато з цих відео були завантажені після створення старіших наборів даних, про які йдеться в статті).
Фактично, автори стверджують, що існує лише 0,29% перекриття з існуючими відеонаборами даних – це вражаюче свідчення новизни.
Одна з причин цього може полягати в тому, що автори приймали лише відео з YouTube, які мали ліцензію Creative Commons, яка була б менш схильна ускладнювати подальшу роботу користувачів.
Друга причина полягає в тому, що відео були запропоновані на основі попередньо оцінених потреб користувачів (див. зображення вище), і не були взяті бездумно. Ці два фактори разом можуть привести до такої нової колекції.
Крім того, дослідники перевірили ідентифікатори YouTube завантажених відео проти ідентифікаторів, представлених в інших колекціях, що підтверджує їхнє твердження.
Хоча не все в новій статті є настільки переконливим, це цікаве читання, яке підкреслює ступінь, до якого ми все ще залежимо від нерівномірних розподілів у наборах даних, щодо перешкод, з якими часто стикається дослідницька сфера при кураторстві даних.
Нова робота називається VideoUFO: Набір даних у мільйон масштабу для генерації відео з тексту, і походять від двох дослідників з Університету технологій Сіднея в Австралії та Університету Чжецзян в Китаї.

Вибрані приклади з отриманого набору даних.
‘Персональний шопер’ для даних штучного інтелекту
Тема і концепції, представлені в загальній сумі інтернет-образів і відео, не обов’язково відображають те, що звичайний кінцевий користувач може запитати у генеративної системи; навіть коли контент і попит співпадають (наприклад, з порнографією, яка доступна на інтернеті і цікає багатьох користувачів генеративного інтелекту), це може не відповідати намірам і стандартам розробників нової генеративної системи.
Окрім великої кількості несумісного контенту, який завантажується щодня, нерівномірна кількість доступного матеріалу, ймовірно, буде походити від рекламодавців і тих, хто спробує маніпулювати SEO. Комерційні інтереси цього типу роблять розподіл тем далеко не безстороннім; гірше того, складно розробити системи фільтрації на основі штучного інтелекту, які можуть впоратися з цією проблемою, оскільки алгоритми і моделі, розроблені з великомасштабних даних, можуть самі відображати тенденції і пріоритети джерельних даних.
Отже, автори нової роботи підходять до проблеми з іншого боку, визначаючи, чого хочуть користувачі, і отримуючи відео, які відповідають цим потребам.
На поверхні цей підхід здається таким же ймовірним, щоб спровокувати семантичну гонку до дна, як і досягти балансированої, нейтральної позиції, як у Вікіпедії. Калібрування кураторства даних навколо попиту користувачів ризикує посиленням упереджень найнижчого спільного знаменника, тоді як маргіналізовані користувачі будуть відштовхнуті, оскільки інтереси більшості будуть мати більшу вагу.
Відділення концепцій з дискрецією
Дослідники використали набір даних VidProM 2024 року як джерело для тематичного аналізу, який пізніше інформував проєкт щодо веб-скрейпінгу.
Цей набір даних був обраний, як зазначили автори, оскільки це єдиний публічно доступний набір даних розміром понад 1 мільйон, “написаний реальними користувачами” – і варто зазначити, що цей набір даних був сам кураторований двома авторами нової статті.
Стаття пояснює*:
‘Спочатку ми вкладаємо всі 1,67 мільйона запитів з VidProM у 384-мірні вектори за допомогою SentenceTransformers. Потім ми кластеризуємо ці вектори за допомогою K-means. Зазначимо, що тут ми встановлюємо кількість кластерів великим значенням, тобто 2000, і об’єднуємо схожі кластери на наступному етапі.
‘Нарешті, для кожного кластеру ми просимо GPT-4o, щоб зробити висновок про тему [одне чи два слова].’
Автори зазначають, що певні концепції є відмінними, але помітно сусідніми, наприклад церква і собор. Занадто детальний критерій для таких випадків призведе до вкладень концепцій (наприклад, терміну “собака” замість окремих порід); тоді як занадто широкий критерій може об’єднати надто багато підконцепцій в одну переповнену концепцію; тому стаття зазначає необхідність балансированої оцінки таких випадків.
Одні та множинні форми були об’єднані, а дієслова відновлені до їхньої базової (інфінітивної) форми. Занадто широкі терміни, такі як анімація, сцена, фільм і рух, були видалені.
Таким чином було отримано 1291 тем, список яких доступний у додатковій частині джерельної статті.
Вибірковий веб-скрейпінг
Далі дослідники використали офіційний API YouTube для пошуку відео за критеріями, витягнутими з набору даних 2024 року, намагаючись отримати 500 відео для кожної теми. Окрім необхідної ліцензії Creative Commons, кожне відео мало мати роздільну здатність 720p або вище і тривалість менше чотирьох хвилин.
Цим чином було отримано 586 490 відео з YouTube.
Автори порівняли ідентифікатори YouTube завантажених відео з кількома популярними наборами даних: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; і WebVid-10M.
Вони виявили, що лише 1675 ідентифікаторів відео з набору даних VideoUFO були представлені в цих старіших колекціях, і можна погодитися, що хоча список порівняння не є вичерпним, він включає всі найбільші і найбільш впливові гравці у сфері генерації відео.
Розподіл і оцінка
Отримані відео були потім розділені на кілька кліпів згідно з методологією, викладеною в статті Panda-70M, згаданій вище. Було оцінено межі кадрів, зшито збірки і розділено сконкатеновані відео на окремі кліпи, з наданими короткими і детальними підписами.

Кожен запис у наборі даних VideoUFO містить кліп, ідентифікатор, час початку і закінчення, а також короткий і детальний опис.
Короткі описи були оброблені методом Panda-70M, а детальні відеоописи – за допомогою Qwen2-VL-7B, згідно з керівними принципами, встановленими у Open-Sora-Plan. У випадках, коли кліпи не відповідали запланованій концепції, детальні описи кожного такого кліпу були введені в GPT-4o mini, щоб визначити, чи відповідає він темі. Хоча автори бажали б оцінити за допомогою GPT-4o, це було б надто дорого для мільйонів відеокліпів.
Оцінка якості відео була проведена за допомогою шести методів з проєкту VBench.
Порівняння
Автори повторили процес витягнення тем з попередніх наборів даних. Для цього було необхідно семантично зіставити витягнуті категорії VideoUFO з категоріями інших колекцій; варто зазначити, що такий процес забезпечує лише приблизно еквівалентні категорії, і тому він може бути надто суб’єктивним, щоб забезпечити емпіричні порівняння.
Відтак, у зображенні нижче показані результати, які отримали дослідники цим методом:

Порівняння фундаментальних атрибутів, отриманих у VideoUFO і попередніх наборах даних.
Дослідники визнають, що їхній аналіз залежить від існуючих описів і підписів, представлених у кожному наборі даних. Вони зазначають, що повторне підписування старіших наборів даних тим же методом, що і VideoUFO, могло б забезпечити більш прямое порівняння. Однак, враховуючи величезну кількість даних, їхнє висновок, що такий підхід був би надто дорогим, видається обґрунтованим.
Генерація
Автори розробили бенчмарк для оцінки продуктивності моделей генерації відео з тексту щодо орієнтованих на користувачів концепцій, названий BenchUFO. Це включало вибір 791 іменника з 1291 витягнутих тем у VideoUFO. Для кожної вибраної теми було випадково вибрано 10 текстових запитів з VidProM.
Кожен запит був переданий до моделі генерації відео з тексту, а потім використовувався описувач Qwen2-VL-7B для оцінки отриманих результатів. Після того, як усі згенеровані відео були описані, використовувався SentenceTransformers для розрахунку косинусної подібності між вхідним запитом і виведеним описом у кожному випадку.

Схема процесу BenchUFO.
Оцінювані генеративні моделі були: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; і Pyramidal.
Окрім VideoUFO, MVDiT-VidGen і MVDit-OpenVid були альтернативними навчальними наборами даних.
Результати розглядають 10-50 найгірших і найкращих тем через архітектури і набори даних.

Результати продуктивності публічних моделей генерації відео з тексту порівняно з навченими моделями авторів на BenchUFO.
Автори коментують:
‘Поточні моделі генерації відео з тексту не показують стабільно високих результатів у всіх орієнтованих на користувачів темах. Зокрема, існує різниця у оцінці, що варіюється від 0,233 до 0,314 між 10 найкращими і 10 найгіршими темами. Ці моделі можуть не ефективно розуміти теми, такі як “гігантський кальмар”, “клітинна тварина”, “Ван Гог” і “давньоєгипетський”, через недостатнє навчання на таких відео.’
‘Поточні моделі генерації відео з тексту показують певний рівень стабільності у своїх найкращих темах. Ми виявили, що більшість моделей генерації відео з тексту добре працюють з відео на тваринні теми, такі як “чайка”, “панда”, “дельфін”, “верблюд” і “сова”. Ми робимо висновок, що це частково пояснюється упередженням щодо тварин у поточних відеонаборах даних.’
Висновок
VideoUFO – видатна пропозиція, якщо тільки з точки зору нових даних. Якщо немає помилки у оцінці і видаленні ідентифікаторів YouTube, і якщо набір даних містить так багато матеріалу, який новий для дослідницької сфери, це рідкісна і потенційно цінна пропозиція.
Недолік полягає в тому, що потрібно довіряти основній методології; якщо ви не вважаєте, що запит користувачів повинен інформувати формули веб-скрейпінгу, ви будете купувати набір даних, який має свої власні набори проблемних упереджень.
Крім того, корисність витягнутих тем залежить як від надійності методу витягнення, який використовувався (що загалом ускладнюється бюджетними обмеженнями), так і від методів формулювання для набору даних 2024 року, який забезпечує джерельний матеріал.
Відтак VideoUFO безумовно заслуговує на подальше дослідження – і воно доступне на Hugging Face.
* Моя заміна цитат авторів на гіперпосилання.
Опубліковано вперше у середу, 5 березня 2025 року.












