Andersonův úhel

Přemýšlení o školení videa AI s uživatelsky zaměřenými daty

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Examples from the paper ' VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation'

Typ obsahu, který uživatelé mohou chtít vytvořit pomocí generativního modelu, jako je Flux nebo Hunyuan Video, nemusí být vždy snadno dostupný, i když požadavek na obsah je poměrně obecný a lze předpokládat, že generátor by s ním mohl zvládnout.

Jedním z příkladů, který je uveden v nové studii, je to, že model OpenAI Sora má potíže s vykreslením anatomicky správného světlušky pomocí podnětu ‘Světluška svítí na listu trávy v klidné letní noci’:

Model OpenAI Sora má trochu problém s pochopením anatomie světlušky. Zdroj: https://arxiv.org/pdf/2503.01739

Model OpenAI Sora má trochu problém s pochopením anatomie světlušky. Zdroj: https://arxiv.org/pdf/2503.01739

Jelikož jsem zřídka bere výzkumné nároky za bernou minci, otestoval jsem stejný podnět na Sora dnes a dostal jsem mírně lepší výsledek. Nicméně, Sora stále nedokázal vykreslit světlo správně – místo toho, aby osvětlil špičku světlušky, kde dochází k bioluminiscenci, umístil světlo poblíž nohou hmyzu:

Můj vlastní test výzkumníků v Sora produkuje výsledek, který ukazuje, že Sora nerozumí, odkud pochází světlo světlušky.

Můj vlastní test výzkumníků v Sora produkuje výsledek, který ukazuje, že Sora nerozumí, odkud pochází světlo světlušky.

Ironicky, generativní difuzní motor Adobe Firefly, který byl vyškolován na copyright-zajištěných fotografiích a videích společnosti, dokázal vykreslit světlušku pouze ve 33% případů, když jsem zkusil stejný podnět v generativním AI funkce Photoshopu:

Pouze poslední ze tří navrhovaných generací výzkumníků produkuje světlo v Adobe Firefly (březen 2025), i když je světlo umístěno ve správné části anatomie hmyzu.

Pouze poslední ze tří navrhovaných generací výzkumníků produkuje světlo v Adobe Firefly (březen 2025), i když je světlo umístěno ve správné části anatomie hmyzu.

Tento příklad byl uveden výzkumníky, aby ilustroval, že distribuce, důraz a pokrytí ve školicích sadách, které informují populární modely, nemusí být v souladu s potřebami uživatelů, i když uživatelé nežádají o nic zvlášť náročného – téma, které se týká výzev spojených s adaptací hyperscale školicích dat na jejich nejefektivnější a nejvýkonnější výsledky jako generativní modely.

Autoři uvádějí:

‘[Sora] nedokáže zachytit koncept svítící světlušky, zatímco úspěšně generuje trávu a letní noc. Z datového hlediska se domníváme, že je to hlavně proto, že [Sora] nebyla školená na tématech souvisejících se světluškami, zatímco byla školená na trávu a noc. Kromě toho, pokud [Sora] viděla video uvedené výše, pochopí, jak by měla vypadat svítící světluška.’

Zavádějí nově kurátorskou datovou sadu a navrhují, že jejich metodika by mohla být v budoucnu upravena pro vytvoření datových sad, které by lépe odpovídaly očekáváním uživatelů než mnohé stávající modely.

Data pro lidi

Jejich návrh předpokládá přístup k kurátorství dat, který se nachází někde mezi vlastními daty pro model typu LoRA (a tento přístup je příliš specifický pro obecné použití) a širokými a relativně nekontrolovanými velkými sbírkami (jako je sada LAION, která pohání Stable Diffusion), které nejsou specificky zaměřeny na žádný konkrétní scénář použití.

Nový přístup, jak jako metodika, tak jako nová datová sada, je (docela zdlouhavě) nazvaný Users’ FOcus in text-to-video, nebo VideoUFO. Datová sada VideoUFO se skládá z 1,9 milionu videoklipů, které pokrývají 1291 uživatelsky zaměřených témat. Témata sama byla vyvinuta z existující video datové sady a prošla různými jazykovými modely a technikami zpracování přirozeného jazyka:

Ukázky destilovaných témat uvedených v nové studii.

Ukázky destilovaných témat uvedených v nové studii.

Datová sada VideoUFO obsahuje velké množství nových videí z YouTube – ‘nových’ ve smyslu, že videa v otázce nejsou součástí video datových sad, které jsou aktuálně populární v literatuře, a tudíž nejsou součástí mnoha podmnožin, které byly z nich kurátorsky vybrány (a mnoho z videí bylo skutečně nahráno po vytvoření starších datových sad, o kterých se studie zmiňuje).

Skutečně, autoři tvrdí, že je zde pouze 0,29% překrytí s existujícími video datovými sadami – působivá demonstrace novosti.

Jedním z důvodů může být, že autoři přijali pouze videa z YouTube s Creative Commons licencí, které by byly méně pravděpodobně omezující pro uživatele dále na cestě: je možné, že tato kategorie videí nebyla prioritizována v předchozích procházkách YouTube a dalších velkých platforem.

Zadruhé, videa byla vyžádána na základě předpokládané uživatelské potřeby (viz obrázek výše), a ne byly vybrány náhodně. Tyto dva faktory v kombinaci by mohly vést k takové novátorské sbírce. Kromě toho, výzkumníci zkontrolovali YouTube ID přispívajících videí (tj. videí, která by mohla být později rozdělena a重新 imaginována pro sbírku VideoUFO) proti těm, které jsou uvedeny v existujících sbírkách, což dodává důvěryhodnost tvrzení.

Přestože není všechno v nové studii zcela přesvědčivé, je to zajímavé čtení, které zdůrazňuje rozsah, v jakém jsme stále poměrně na milosti nerovnoměrných distribucí v datech, pokud jde o překážky, se kterými se výzkumná scéna často setkává při kurátorství dat.

Nová práce je nazvaná VideoUFO: Miliónová uživatelsky zaměřená datová sada pro generování textu na video a pochází od dvou výzkumníků, z University of Technology Sydney v Austrálii a Zhejiang University v Číně.

Vybrané příklady ze získané datové sady.

Vybrané příklady ze získané datové sady.

‘Osobní nákupčí’ pro data AI

Témata a koncepty uvedené v celkovém součtu internetových obrázků a videí nemusí nutně odrážet, co by průměrný uživatel mohl požadovat od generativního systému; i když obsah a poptávka se shodují (jako v případě pornografie, která je hojně dostupná na internetu a velmi zajímavá pro mnoho uživatelů gen AI), nemusí to být v souladu s úmyslem a standardy vývojářů pro nový generativní systém.

Kromě velkého množství NSFW materiálu, který je nahrán denně, je pravděpodobně značná část dostupného materiálu kommerčně zaměřená a snaží se manipulovat SEO. Tento komerční zájem vede k nerovnoměrné distribuci témat; horší je, že je obtížné vyvinout AI-založené filtrační systémy, které by mohly zvládnout problém, protože algoritmy a modely vyvinuté z významných hyperscale dat mohou samy o sobě odrážet tendence a priority zdrojových dat.

Proto autoři nové práce přistoupili k problému opačně, určením toho, co uživatelé pravděpodobně chtějí, a získáním videí, která odpovídají těmto potřebám.

Na povrchu se tento přístup zdá stejně pravděpodobný, že spustí semantickou soutěž na dno, jako aby dosáhl vyvážené, wikipedické neutrality. Kalibrace kurátorství dat kolem uživatelské poptávky riskuje amplifikaci preferencí nejnižšího společného jmenovatele, zatímco okrajové uživatele marginalizuje, protože většinové zájmy budou nevyhnutelně mít větší váhu.

Nicméně, pojďme se podívat, jak studie řeší výzvu.

Destilace konceptů s diskrétností

Výzkumníci použili datovou sadu VidProM z roku 2024 jako zdroj pro analýzu témat, která by později informovala projektův web-scraping.

Tato datová sada byla vybrána, autoři uvádějí, protože je to jediná veřejně dostupná datová sada o velikosti 1m+, která byla ‘napsána skutečnými uživateli’ – a mělo by se uvést, že tato datová sada byla sama kurátorsky vybrána dvěma autory nové studie.

Studie vysvětluje*:

‘Nejprve, vkládáme všechny 1,67 milionu podnětů z VidProM do 384-rozměrných vektorů pomocí SentenceTransformers Další, shlukujeme tyto vektory pomocí K-means. Poznámka, že zde nastavujeme počet shluků na relativně velkou hodnotu, tj. 2 000, a slučujeme podobné shluky v dalším kroku.

‘Nakonec, pro každý shluk, žádáme GPT-4o, aby uzavřel téma [jedno nebo dvě slova].’

Autoři poukazují na to, že určité koncepty jsou odlišné, ale pozoruhodně blízké, jako church a cathedral. Příliš jemná kritéria pro případy tohoto druhu by vedla k pojmům (například) pro každý typ psa, místo pojmu dog; zatímco příliš široká kritéria by mohla shromáždit příliš mnoho sub-konceptů do jednoho přeplněného konceptu; proto studie zdůrazňuje nutnost vyvážení při hodnocení takových případů.

Jednotné a množné tvary byly sloučeny, a slovesa byla obnovena do své základní (infinitivní) formy. Příliš široké termíny – jako animation, scene, film a movement – byly odstraněny.

Tímto způsobem byly získány 1 291 témat (s kompletním seznamem dostupným v doplňkové části zdrojové studie).

Výběr web-scrapingu

Další, výzkumníci použili oficiální YouTube API k vyhledání videí na základě kritérií destilovaných z datové sady z roku 2024, s cílem získat 500 videí pro každé téma. Kromě požadované Creative Commons licence musel každý videoklip mít rozlišení 720p nebo vyšší a být kratší než čtyři minuty.

Tímto způsobem bylo z YouTube získáno 586 490 videoklipů.

Autoři porovnali YouTube ID stažených videoklipů s několika populárními datovými sadami: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; a WebVid-10M.

Nalezli, že pouze 1 675 ID (uvedených 0,29%) videoklipů VideoUFO se objevilo v těchto starších sbírkách, a musí se uznat, že zatímco seznam porovnání datových sad není vyčerpávající, zahrnuje všechny největší a nejvlivnější hráče ve scéně generativních videí.

Rozdělení a hodnocení

Získaná videa byla poté rozdělena do několika klipů, podle metodiky uvedené v papíru Panda-70M výše. Byl odhadnut hranice záběrů, sestaveny sekvence a spojené videa byly rozděleny do jednotlivých klipů, s krátkými a podrobnými popisky.

Každá položka dat v datové sadě VideoUFO obsahuje klip, ID, začátek a konec času a krátkou a podrobnou popisku.

Každá položka dat v datové sadě VideoUFO obsahuje klip, ID, začátek a konec času a krátkou a podrobnou popisku.

Krátké popisky byly zpracovány metodou Panda-70M, a podrobné video popisky metodou Qwen2-VL-7B, podle pokynů stanovených Open-Sora-Plan. V případech, kdy klipy neobsahovaly zamýšlený koncept, byly podrobné popisky pro každý takový klip zpracovány GPT-4o mini, aby se zjistilo, zda skutečně patří k tématu. Ačkoli autoři by raději provedli hodnocení pomocí GPT-4o, bylo by to příliš drahé pro miliony videoklipů.

Hodnocení kvality videa bylo provedeno pomocí šesti metod z projektu VBench.

Porovnání

Autoři opakovali proces extrakce témat na uvedených předchozích datových sadách. K tomu bylo nutné semanticky sladit odvozené kategorie VideoUFO s nevyhnutelně odlišnými kategoriemi v ostatních sbírkách; musí se uznat, že takové procesy poskytují pouze aproximované ekvivalentní kategorie, a proto může být příliš subjektivní, aby poskytovaly empirické porovnání.

Přesto, v obrázku níže vidíme výsledky, které výzkumníci získali touto metodou:

Porovnání základních atributů získaných napříč VideoUFO a předchozími datovými sadami.

Porovnání základních atributů získaných napříč VideoUFO a předchozími datovými sadami.

Výzkumníci uznávají, že jejich analýza závisela na existujících popiscích a popisech poskytnutých v každé datové sadě. Přiznávají, že opětovné popsání starších datových sad pomocí stejné metody jako VideoUFO by mohlo poskytnout přímější porovnání. Nicméně, vzhledem k obrovskému množství datových bodů, jejich závěr, že by to bylo prohibitivně drahé, se zdá být oprávněný.

Generování

Autoři vyvinuli benchmark pro hodnocení výkonu modelů textu na video na uživatelsky zaměřených konceptech, nazvaný BenchUFO. To zahrnovalo výběr 791 podstatných jmen z 1 291 destilovaných uživatelsky zaměřených témat ve VideoUFO. Pro každé vybrané téma byly náhodně vybrány deset textových podnětů z VidProM.

Každý podnět byl zpracován modelem textu na video, s uvedenou metodou Qwen2-VL-7B pro hodnocení generovaných výsledků. S generovanými videi takto popsány, byla metodou SentenceTransformers vypočtena kosinová podobnost pro vstupní podnět a výstupní (odvozený) popis v každém případě.

Schéma procesu BenchUFO.

Schéma procesu BenchUFO.

Hodnocené generativní modely byly: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; a Pyramidal.

Kromě VideoUFO byly MVDiT-VidGen a MVDit-OpenVid alternativními trénovacími datovými sadami.

Výsledky zahrnují 10. až 50. nejhorších a nejlepších témat napříč architekturami a datovými sadami.

Výsledky výkonu veřejných modelů T2V ve srovnání s modelem autorů na BenchUFO.

Výsledky výkonu veřejných modelů T2V ve srovnání s modelem autorů na BenchUFO.

Zde autoři komentují:

‘Aktuální modely textu na video nedosahují konzistentně dobrých výsledků napříč všemi uživatelsky zaměřenými tématy. Konkrétně, existuje rozdíl ve skóre v rozmezí 0,233 až 0,314 mezi nejlepšími 10 a nejhoršími 10 tématy. Tyto modely nemusí efektivně pochopit témata, jako je “obří chobotnice”, “buněčná struktura”, “Van Gogh” a “starověký egyptský”, kvůli nedostatečnému tréninku na takových videích.’

‘Aktuální modely textu na video ukazují určitý stupeň konzistence ve svých nejlepších témat. Zjistili jsme, že většina modelů textu na video vyniká v generování videí na témata související se zvířaty, jako je “racek”, “panda”, “delfín”, “velbloud” a “sova”. Domníváme se, že je to částečně způsobeno zkreslením směrem k zvířatům ve stávajících video datech.’

Závěr

VideoUFO je vynikající nabídka, alespoň z hlediska čerstvých dat. Pokud neexistuje chyba v hodnocení a eliminaci YouTube ID, a pokud datová sada obsahuje tolik nového materiálu pro výzkumnou scénu, je to vzácná a potenciálně cenná nabídka.

Nevýhodou je, že je třeba dát credenci základní metodice; pokud nevěříte, že by uživatelská poptávka měla informovat formule pro web-scraping, budete kupovat datovou sadu, která přichází se svými vlastními sadami problematických zkreslení.

Dále, užitečnost destilovaných témat závisí na spolehlivosti metody destilace (která je obecně omezena rozpočtovými omezeními), a také na metodikách formulace pro datovou sadu z roku 2024, která poskytuje zdrojový materiál.

Rovněž, VideoUFO jistě zaslouží další prozkoumání – a je dostupné na Hugging Face.

 

* Moje náhrada citací autorů za odkazy.

Poprvé zveřejněno ve středu 5. března 2025

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai