Kąt Andersona

Przerozważanie szkolenia AI wideo z danymi ukierunkowanymi na użytkownika

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Examples from the paper ' VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation'

Rodzaj treści, który użytkownicy mogą chcieć utworzyć przy użyciu modelu generatywnego, takiego jak Flux lub Hunyuan Video, może nie być zawsze łatwo dostępny, nawet jeśli żądanie treści jest dość ogólne, i można by przypuszczać, że generator mógłby sobie z tym poradzić.

Jednym z przykładów, ilustrowanym w nowym artykule, który będziemy analizować w tym artykule, jest to, że coraz bardziej zacieniony model OpenAI Sora ma trudności z wyrenderowaniem anatomicznie poprawnego świetlika, używając podpowiedzi ‘Świetlik świeci na liściu trawy na spokojną letnią noc’:

Model OpenAI Sora ma nieco zaburzoną percepcję anatomii świetlika. Źródło: https://arxiv.org/pdf/2503.01739

Model OpenAI Sora ma nieco zaburzoną percepcję anatomii świetlika. Źródło: https://arxiv.org/pdf/2503.01739

Ponieważ rzadko przyjmuję twierdzenia badawcze bez zastrzeżeń, przetestowałem tę samą podpowiedź w modelu Sora dzisiaj i uzyskałem nieco lepszy wynik. Jednak model Sora nadal nie był w stanie wyrenderować świecenia poprawnie – zamiast oświetlenia końcówki ogona świetlika, gdzie występuje bioluminescencja, umieścił świecenie w pobliżu stóp owada:

Mój własny test podpowiedzi badaczy w modelu Sora daje wynik, który pokazuje, że model Sora nie rozumie, skąd pochodzi światło świetlika.

Mój własny test podpowiedzi badaczy w modelu Sora daje wynik, który pokazuje, że model Sora nie rozumie, skąd pochodzi światło świetlika.

Ironicznie, generatywny silnik dyfuzyjny Adobe Firefly, wytrenowany na chronionych prawem autorskim zdjęciach i filmach, osiągnął tylko 1 na 3 współczynnik powodzenia w tym zakresie, gdy próbowałem tej samej podpowiedzi w funkcji generatywnej AI programu Photoshop:

Tylko ostatnia z trzech proponowanych generacji podpowiedzi badaczy daje wynik ze świeceniem w ogóle w modelu Adobe Firefly (marzec 2025), choć przynajmniej świecenie jest umieszczone w odpowiedniej części anatomii owada.

Tylko ostatnia z trzech proponowanych generacji podpowiedzi badaczy daje wynik ze świeceniem w ogóle w modelu Adobe Firefly (marzec 2025), choć przynajmniej świecenie jest umieszczone w odpowiedniej części anatomii owada.

Ten przykład został podkreślony przez autorów nowego artykułu, aby zilustrować, że dystrybucja, nacisk i zakres w zbiorach danych wykorzystywanych do informowania popularnych modeli podstawowych może nie być zgodna z potrzebami użytkownika, nawet jeśli użytkownik nie prosi o niczego szczególnie wymagającego – temat, który porusza wyzwania związane z adaptacją hiperskali danych szkoleniowych do ich najbardziej efektywnych i wydajnych wyników jako modeli generatywnych.

Autorzy stwierdzają:

‘[Model Sora] nie potrafi uchwycić pojęcia świecącego świetlika, podczas gdy z powodzeniem generuje trawę i letnią noc: z perspektywy danych inferujemy, że jest to głównie spowodowane tym, że [model Sora] nie został wytrenowany na tematach związanych ze świetlikami, podczas gdy został wytrenowany na trawie i nocy. Ponadto, gdyby [model Sora] zobaczył film pokazany w [powyższym obrazie], zrozumiałby, jak powinien wyglądać świecący świetlik.’

Wprowadzają nowy, starannie wyselekcjonowany zbiór danych i sugerują, że ich metoda mogłaby zostać udoskonalona w przyszłej pracy, aby stworzyć zbiory danych, które lepiej odpowiadają oczekiwaniom użytkowników niż wiele istniejących modeli.

Dane dla ludzi

Istotą ich propozycji jest podejście do kuracji danych, które mieści się gdzieś pomiędzy danymi niestandardowymi dla modelu typu LoRA (i to podejście jest zbyt szczegółowe dla ogólnego użycia); a szerokimi i względnie nieselektywnymi zbiorami o dużej objętości (takimi jak zbiór danych LAION, który napędza stabilną dyfuzyjną), które nie są specjalnie dopasowane do żadnego scenariusza końcowego.

Nowe podejście, zarówno jako metoda, jak i nowy zbiór danych, nosi nazwę Users’ FOcus in text-to-video, lub VideoUFO. Zbiór danych VideoUFO składa się z 1,9 miliona klipów wideo, obejmujących 1291 tematów ukierunkowanych na użytkownika. Tematy te zostały starannie opracowane z istniejącego zbioru danych wideo i przetworzone za pomocą różnych modeli językowych i technik przetwarzania języka naturalnego:

Przykłady wydestylowanych tematów przedstawionych w nowym artykule.

Przykłady wydestylowanych tematów przedstawionych w nowym artykule.

Zbiór danych VideoUFO zawiera dużą liczbę nowych filmów wideo pobranych z YouTube – „nowych” w tym sensie, że filmy te nie są zawarte w popularnych zbiorach danych wideo, a wiele z nich zostało opublikowanych po utworzeniu starszych zbiorów danych.

W rzeczywistości autorzy twierdzą, że istnieje tylko 0,29% nakładki z istniejącymi zbiorami danych wideo – imponująca demonstracja nowości.

Jednym z powodów może być to, że autorzy akceptowali tylko filmy wideo z YouTube z licencją Creative Commons, która miałaby mniejsze szanse na utrudnienia dla użytkowników w przyszłości; możliwe, że ta kategoria filmów była mniej priorytetowa w poprzednich przeglądach YouTube i innych platform o dużej objętości.

Ponadto filmy wideo były wybrane na podstawie wcześniej oszacowanego zapotrzebowania użytkowników (patrz powyższy obraz), a nie pobierane w sposób nieselektywny. Dwa te czynniki w połączeniu mogłyby prowadzić do tak nowej kolekcji.

Autorzy sprawdzili również identyfikatory YouTube przypisane do filmów wideo, które mogłyby później zostać podzielone i zreinterpretowane dla kolekcji VideoUFO, porównując je z tymi, które pojawiły się w istniejących zbiorach danych, co potwierdza twierdzenie o nowości.

Chociaż nie wszystko w nowym artykule jest tak przekonywujące, jest to interesująca lektura, która podkreśla stopień, w jakim nadal mamy do czynienia z nierównymi dystrybucjami w zbiorach danych, w odniesieniu do przeszkód, z którymi często spotyka się scena badawcza w kuracji zbiorów danych.

Nowa praca nosi tytuł VideoUFO: Zbiór danych o skali miliona ukierunkowany na użytkownika do generacji wideo z tekstu i pochodzi od dwóch badaczy, odpowiednio z Uniwersytetu Technologicznego w Sydney w Australii i Uniwersytetu Zhejiang w Chinach.

Wybrane przykłady z ostatecznie uzyskanego zbioru danych.

Wybrane przykłady z ostatecznie uzyskanego zbioru danych.

‘Osobisty sklepik’ dla danych AI

Tematy i pojęcia przedstawione w ogólnej sumie internetowych obrazów i filmów wideo niekoniecznie odzwierciedlają to, co przeciętny użytkownik końcowy może ostatecznie poprosić o wygenerowanie z systemu generatywnego; nawet wtedy, gdy zawartość i popyt rzeczywiście się pokrywają (jak w przypadku pornografii, która jest obficie dostępna w internecie i bardzo interesuje wielu użytkowników AI), może to nie być zgodne z intencjami i standardami twórców nowego systemu generatywnego.

Ponadto duża ilość codziennie uploadowanych materiałów NSFW oraz nieproporcjonalnie duża ilość dostępnego materiału pochodzi od reklamodawców i osób próbujących manipulować SEO. Komercyjne interesy tego rodzaju sprawiają, że dystrybucja tematów jest daleka od bezstronnej; co gorsza, trudno opracować systemy filtrowania oparte na AI, które mogą radzić sobie z tym problemem, ponieważ algorytmy i modele opracowane z danych o znaczeniu hiperskali mogą same w sobie odzwierciedlać tendencje i priorytety danych źródłowych.

Dlatego autorzy nowej pracy podejmują problem, odwracając propozycję, poprzez określenie, czego użytkownicy prawdopodobnie chcieliby, i pobieranie filmów wideo, które są zgodne z tymi potrzebami.

Na powierzchni to podejście wydaje się równie prawdopodobne do spowodowania wyścigu semantycznego w dół, jak do osiągnięcia zrównoważonej, neutralnej pozycji w stylu Wikipedii. Kalibracja kuracji danych wokół zapotrzebowania użytkowników ryzykuje wzmocnienie preferencji najniższego wspólnego mianownika, marginalizując użytkowników niszowych, ponieważ interesy większości będą nieuchronnie miały większą wagę.

Jednakże, zacznijmy analizę.

Destylowanie pojęć z dyskrecją

Badacze wykorzystali zbiór danych VidProM z 2024 roku jako źródło do analizy tematów, które później poinformowały o przeszukiwaniu sieci.

Wybrali ten zbiór danych, jak twierdzą autorzy, ponieważ jest to jedyny publicznie dostępny zbiór danych o objętości ponad 1 miliona, „napisany przez prawdziwych użytkowników” – i należy powiedzieć, że ten zbiór danych został samodzielnie opracowany przez dwóch autorów nowego artykułu.

Artykuł wyjaśnia*:

‘Po pierwsze, wszczepiamy wszystkie 1,67 miliona podpowiedzi z VidProM w 384-wymiarowe wektory przy użyciu SentenceTransformers Następnie grupujemy te wektory przy użyciu K-means. Zauważ, że tutaj ustawiamy liczbę klastrów na stosunkowo dużą wartość, tj. 2000, i łączymy podobne klastry w następnym kroku.

‘W końcu, dla każdego klastra, prosimy GPT-4o, aby podsumować temat [jedno lub dwa słowa].’

Autorzy zwracają uwagę, że pewne pojęcia są odrębne, ale znacznie sąsiednie, takie jak kościół i katedra. Za szczegółowe kryterium w przypadkach tego rodzaju mogłoby to doprowadzić do osadzeń pojęć (np. dla każdego rodzaju rasy psa), zamiast słowa pies; natomiast za szerokie kryterium mogłoby to spowodować, że nadmierna liczba podpojęć zostanie scaliłowana w jeden przepełniony pojęć; dlatego artykuł zauważa konieczność balansowania w takich przypadkach.

Formy singularne i pluralne zostały połączone, a czasowniki przywrócone do ich postaci podstawowej (bezokresowej). Zbyt szerokie terminy – takie jak animacja, scena, film i ruch – zostały usunięte.

W ten sposób uzyskano 1291 tematów (pełna lista dostępna w dodatkowej sekcji artykułu źródłowego).

Wybrane przeszukiwanie sieci

Następnie badacze wykorzystali oficjalne API YouTube, aby wyszukać filmy wideo na podstawie kryteriów destylowanych z zbioru danych z 2024 roku, starając się uzyskać 500 filmów wideo dla każdego tematu. Oprócz wymaganego prawa autorskiego, każdy film wideo musiał mieć rozdzielczość co najmniej 720p i trwać krócej niż 4 minuty.

W ten sposób pobrano 586 490 filmów wideo z YouTube.

Autorzy porównali identyfikatory YouTube pobranych filmów wideo z licznymi popularnymi zbiorami danych: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; i WebVid-10M.

Stwierdzili, że tylko 1675 identyfikatorów (wspomniany wcześniej 0,29%) klipów wideo VideoUFO pojawiło się w tych starszych kolekcjach, i trzeba przyznać, że chociaż lista porównywanych zbiorów danych nie jest wyczerpująca, obejmuje wszystkich największych i najbardziej wpływowych graczy w scenie generatywnych filmów wideo.

Podziały i ocena

Pobrane filmy wideo zostały następnie podzielone na wiele klipów, zgodnie z metodologią opisaną w cytowanym powyżej artykule Panda-70M. Granice klatek zostały oszacowane, montaż zszyty, a połączone filmy wideo podzielone na pojedyncze klipy, z krótkimi i szczegółowymi podpisami dostarczonymi.

Każdy wpis w zbiorze danych VideoUFO zawiera klip, identyfikator, czasy rozpoczęcia i zakończenia oraz krótki i szczegółowy podpis.

Każdy wpis w zbiorze danych VideoUFO zawiera klip, identyfikator, czasy rozpoczęcia i zakończenia oraz krótki i szczegółowy podpis.

Krótkie podpisy zostały opracowane przy użyciu metody Panda-70M, a szczegółowe podpisy filmów wideo przy użyciu Qwen2-VL-7B, zgodnie z wytycznymi ustalonymi przez Open-Sora-Plan. W przypadkach, w których klipy nie odnosiły się do zamierzonego pojęcia, szczegółowe podpisy dla każdego takiego klipu zostały wprowadzone do GPT-4o mini, aby ustalić, czy jest to prawidłowe dopasowanie do tematu. Chociaż autorzy woleliby ocenę za pomocą GPT-4o, byłoby to zbyt drogie dla milionów klipów wideo.

Ocena jakości wideo została przeprowadzona przy użyciu sześciu metod z projektu VBench.

Porównania

Autorzy powtórzyli proces ekstrakcji tematów w poprzednich zbiorach danych. W tym celu konieczne było semantyczne dopasowanie pochodzących kategorii VideoUFO do nieunikalnych kategorii w innych kolekcjach; trzeba przyznać, że takie procesy dostarczają tylko przybliżone ekwiwalentne kategorie, i dlatego może to być zbyt subiektywny proces, aby zagwarantować empiryczne porównania.

Niemniej jednak, poniżej widzimy wyniki, które badacze uzyskali tą metodą:

Porównanie podstawowych atrybutów wywnioskowanych w całym VideoUFO i poprzednich zbiorach danych.

Porównanie podstawowych atrybutów wywnioskowanych w całym VideoUFO i poprzednich zbiorach danych.

Badacze przyznają, że ich analiza opierała się na istniejących podpisach i opisach dostarczonych w każdym zbiorze danych. Przyznają, że ponowne podpisywanie starszych zbiorów danych przy użyciu tej samej metody co VideoUFO mogłoby zapewnić bardziej bezpośrednie porównanie. Jednak biorąc pod uwagę ogromną liczbę punktów danych, ich wniosek, że takie podejście byłoby zbyt drogie, wydaje się uzasadniony.

Generacja

Autorzy opracowali benchmark do oceny wydajności modeli tekst-tekst na pojęcia ukierunkowane na użytkownika, zatytułowany BenchUFO. Obejmowało to wybranie 791 rzeczowników spośród 1291 destylowanych tematów użytkowników w VideoUFO. Dla każdego wybranego tematu losowo wybrano dziesięć podpowiedzi tekstowych z VidProM.

Każda podpowiedź została przekazana do modelu tekst-tekst, a wspomniany powyżej Qwen2-VL-7B został wykorzystany do oceny wygenerowanych wyników. Po podpisaniu wszystkich wygenerowanych filmów wideo SentenceTransformers został wykorzystany do obliczenia podobieństwa kosinusowego dla podpowiedzi wejściowych i opisu wyjściowego (wnioskowanego) w każdym przypadku.

Schemat procesu BenchUFO.

Schemat procesu BenchUFO.

Oceniane modele generatywne to: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; i Pyramidal.

Ponadto MVDiT-VidGen i MVDit-OpenVid były alternatywnymi zbiorami danych szkoleniowych.

Wyniki obejmują 10. i 50. najgorzej i najlepiej wykonujące się tematy w architekturach i zbiorach danych.

Wyniki wydajności publicznych modeli T2V w porównaniu z modelem wytrenowanym przez autorów w BenchUFO.

Wyniki wydajności publicznych modeli T2V w porównaniu z modelem wytrenowanym przez autorów w BenchUFO.

Autorzy komentują:

‘Obecne modele tekst-tekst nie wykonują się konsekwentnie dobrze we wszystkich tematach ukierunkowanych na użytkownika. Konkretnie, istnieje różnica w punktacji od 0,233 do 0,314 między najlepszymi 10 a najgorszymi 10 tematami. Modele te mogą nie rozumieć tematów takich jak “olbrzymi kałamarnica”, “komórka zwierzęca”, “Van Gogh” i “starożytny egipski” z powodu niewystarczającego szkolenia na takich filmach wideo.’

‘Obecne modele tekst-tekst wykazują pewien stopień konsekwencji w najlepiej wykonujących się tematach. Odkrywamy, że większość modeli tekst-tekst dobrze radzi sobie z generowaniem filmów wideo na tematy związane z zwierzętami, takimi jak “mewa”, “panda”, “delfin”, “wielbłąd” i “sowa”. Wnioskujemy, że jest to częściowo spowodowane tendencją do zwierząt w obecnych zbiorach danych wideo.’

Wnioski

VideoUFO to wybitna oferta, jeśli tylko z punktu widzenia nowych danych. Jeśli nie było błędu w ocenie i eliminowaniu identyfikatorów YouTube, i jeśli zbiór danych zawiera tak wiele nowych materiałów, które są nowe dla sceny badawczej, jest to rzadka i potencjalnie cenna propozycja.

Minus to fakt, że trzeba dać wiarę podstawowej metodzie; jeśli nie wierzysz, że zapotrzebowanie użytkowników powinno informować formuły przeszukiwania sieci, kupujesz zbiór danych, który przychodzi ze swoimi własnymi zestawami niepokojących uprzedzeń.

Dalej, użyteczność destylowanych tematów zależy zarówno od niezawodności metody destylacji (która jest ogólnie utrudniona przez ograniczenia budżetowe), jak i od metod formułowania dla zbioru danych z 2024 roku, który dostarcza materiał źródłowy.

Mimo to VideoUFO z pewnością zasługuje na dalsze zbadanie – i jest dostępne w Hugging Face.

 

* Moja substytucja cytatów autorów za linki.

Po raz pierwszy opublikowane w środę, 5 marca 2025

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai