Anderson’un Açısı
Video AI Eğitimini Kullanıcı Odaklı Verilerle Yeniden Düşünmek

Kullanıcıların Flux veya Hunyuan Video gibi bir generatif model kullanarak oluşturmak isteyebileceği içerik türleri, her zaman kolayca erişilebilir olmayabilir, hatta içerik isteği oldukça genel olsa bile.
Örneğin, yeni bir makalede ele alınan bir örnek, giderek daha fazla geride kalan OpenAI Sora modelinin, ‘A firefly is glowing on a grass’s leaf on a serene summer night’ promtını kullanarak anatomik olarak doğru bir ateşböceği oluşturmakta zorlandığını gösterir:

OpenAI’nin Sora’sı ateşböceği anatomisi hakkında biraz tuhaf bir anlayışa sahiptir. Kaynak: https://arxiv.org/pdf/2503.01739
Ben, araştırmacıların iddialarını genellikle yüzeyden almıyorum, bu nedenle bugün Sora’da aynı promt’u test ettim ve biraz daha iyi bir sonuç aldım. Ancak Sora, masih ateşböceğinin kuyruğunun ucunda biyolüminesansın meydana geldiği yeri aydınlatmak yerine, ışığı böceğin ayakları yakınlarında yanlış yerleştirdi:

Araştırmacıların promt’unu Sora’da test etmem, Sora’nın ateşböceğinin ışığının nereden geldiğini anlamadığını gösteren bir sonuç üretir.
İronik olarak, Adobe Firefly generatif difüzyon motoru, şirketin telif hakkı güvenceli stok fotoğrafları ve videolarına dayalı olarak eğitilmiş olmasına rağmen, aynı promt’u Photoshop’un generatif AI özelliğinde denediğimde sadece 1’de 3 başarı oranı elde etti:

Adobe Firefly’de (Mart 2025) araştırmacıların promt’unun üç proposed jenerasyonundan sadece sonuncusu bir parlamayı üretir, ancak en azından parlama böceğin anatomisinin doğru kısmında bulunur.
Bu örnek, yeni makalede vurgulandı ve popüler temel modelleri bilgilendiren eğitim setlerinin dağılımı, vurgusu ve kapsamı, kullanıcıların ihtiyaçlarıyla uyumlu olmayabileceğini göstermek için kullanıldı.
Araştırmacılar şöyle diyor:
‘[Sora] bir ateşböceğinin parlamasını yakalamakta başarısız olurken, çim ve yaz [gecesi] gibi konuları başarılı bir şekilde oluşturur. Veri açısından, bunun nedeninin [Sora]’nın ateşböceği ile ilgili konularda eğitilmemiş olması, ancak çim ve gece gibi konularda eğitilmiş olması olduğunu düşünüyoruz. Ayrıca, [Sora] yukarıdaki resimde gösterilen videoyu görmüş olsaydı, bir parlayan ateşböceğinin nasıl görünmesi gerektiği hakkında anlayacaktı.’
Onlar, yeni bir veri seti oluşturdular ve metodolojilerinin gelecekteki çalışmalarda kullanıcı beklentilerine daha iyi uyumlu veri koleksiyonları oluşturmak için geliştirilebileceğini öne sürdüler.
Kullanıcılar için Veri
Temel olarak, önerileri bir veri toplama yaklaşımını öneriyor, bu yaklaşım bir LoRA gibi bir model türü için özel veri (ve bu yaklaşım genel kullanım için çok spesifiktir) ve geniş ve nispeten seçilmeyen yüksek hacimli koleksiyonlar (örneğin, LAION veri seti) arasında bir yerde duruyor.
Yeni yaklaşım, hem metodoloji hem de yeni bir veri seti olarak (oldukça karmaşık bir şekilde) Kullanıcıların FOkus text-to-video veya VideoUFO olarak adlandırıldı. VideoUFO veri seti, 1.9 milyon video klip ve 1291 kullanıcı odaklı konudan oluşuyor. Konular, mevcut bir video veri setinden geliştirildi ve çeşitli dil modelleri ve Doğal Dil İşleme (NLP) teknikleri kullanılarak işlendi:

Yeni makalede sunulan konuların örnekleri.
VideoUFO veri seti, YouTube’dan yeni video klipleri içeriyor – “yeni” olarak, bu videoların mevcut video veri setlerinde yer almadığı ve bu veri setlerinin alt kümelerinde yer almadığı anlamına geliyor (ve birçok video, eski veri setlerinin oluşturulmasından sonra yüklenmiştir).
Aslında, yazarlar, mevcut video veri setleriyle yalnızca %0,29’luk bir örtüşme olduğunu iddia ediyorlar – bu, yeni bir koleksiyon için etkileyici bir gösterge.
Bunun bir nedeni, yazarların yalnızca Creative Commons lisansı olan YouTube videolarını kabul etmeleridir – bu, kullanıcıların ileride daha fazla engellenmesini önleyebilir; ayrıca, bu tür videoların önceki YouTube ve diğer yüksek hacimli platformların taramalarında öncelikli olarak ele alınmamış olması mümkündür.
İkincisi, videolar, önceden tahmin edilen kullanıcı ihtiyacına göre (yukarıdaki resme bakınız) ve seçilmeyen bir şekilde değil, istendi. Bu iki faktör, böyle bir yeni koleksiyonun oluşmasına yol açabilir. Ayrıca, araştırmacılar, katkılı videoların YouTube ID’lerini mevcut koleksiyonlardaki ID’lerle karşılaştırdılar, bu da iddialarını destekledi.
Yeni makaledeki her şey oldukça ikna edici olmasa da, bu, veri seti oluşturma sahnesinin karşılaştığı engellerin kapsamını vurgulayan ilginç bir okumadır.
Yeni çalışma, VideoUFO: Bir Milyon Ölçeğinde Kullanıcı Odaklı Text-to-Video Jenerasyonu için Veri Seti olarak adlandırıldı ve Avustralya’daki Sydney Teknoloji Üniversitesi’nden ve Çin’deki Zhejiang Üniversitesi’nden iki araştırmacı tarafından gerçekleştirildi.

Elde edilen son veri setinden örnekler.
AI Verileri için Kişisel Alışverişçi
İnternet görüntüleri ve videolarındaki konular ve kavramlar, bir generatif sistemden talep edecek olan ortalama son kullanıcıyı yansıtmayabilir; incluso içerik ve talep çakıştığında (örneğin, pornografi, internet üzerinde bolca mevcut ve çok ilgi gören bir konu), bu, geliştiricilerin yeni bir generatif sistem için standartları ve niyetiyle uyumlu olmayabilir.
Yüksek hacimli NSFW materyalin günlük olarak yüklenmesinin yanı sıra, ağda mevcut materyalin büyük bir kısmı, reklamlar ve SEO’yu manipüle etmeye çalışanlar tarafından oluşturulmuştur. Bu tür ticari çıkarlar, konu materyalinin dağılımını tarafsız olmaktan uzaklaştırır; daha da kötüsü, bu sorunu çözebilecek AI tabanlı filtreleme sistemlerini geliştirmek zordur, çünkü anlamlı hyperscale verilerden geliştirilen algoritmalar ve modeller, kendileri kaynak verilerin eğilimlerini ve önceliklerini yansıtabilir.
Bu nedenle, yeni çalışmanın yazarları, problemi tersine çevirerek, kullanıcıların ne istediğini belirlemeye ve bu ihtiyaçlarla uyumlu videoları elde etmeye çalıştılar.
Yüzeyde, bu yaklaşım, en düşük ortak paydayı tercih eden bir anlamsal yarışa yol açabileceği gibi, dengeli ve tarafsız bir sonuç da elde edilebilir.
Kavramları Dikkatli Bir Şekilde Damıtmak
Araştırmacılar, 2024 VidProM veri setini, daha sonra projelerinin web taraması için konu analizi kaynağı olarak kullandılar.
Bu veri seti, yazarlara göre, “gerçek kullanıcılar tarafından yazılmış” 1m+ kamu veri seti olduğu için seçildi – ve bu veri setinin kendisi, yeni makalenin yazarları tarafından derlenmiştir.
Makale şöyle diyor:
‘Öncelikle, VidProM’den 1.67 milyon promt’ı 384 boyutlu vektörler olarak SentenceTransformers kullanarak gömüyoruz. Sonra, bu vektörleri K-ortalamalarla kümeleyeceğiz. Not edin, burada küme sayısını nispeten büyük bir değere, yani 2.000’e ayarlıyoruz ve bir sonraki adımda benzer kümeleştirmeleri birleştiriyoruz.
‘Son olarak, her küme için GPT-4o‘ya bir konu [bir veya iki kelime] çıkarmasını istiyoruz.’
Araştırmacılar, bazı kavramların ayrı ancak belirgin bir şekilde yakın olduğunu, örneğin kilise ve katedral gibi, belirtiyorlar. Bu tür durumlarda, çok ince bir kriter, her köpek ırkı için kavram gömme örneklerine yol açabilir, köpek kelimesi yerine; çok geniş bir kriter ise, birçok alt kavramı tek bir kalabalık kavram altında toplayabilir; bu nedenle makale, bu tür durumlarda değerlendirme için gerekli dengeyi vurguluyor.
Tekil ve çoğul formlar birleştirildi, fiiller temel (sözlük) formlarına geri döndü. Çok geniş terimler, örneğin animasyon, sahte, film ve hareket kaldırıldı.
Böylece 1.291 konu elde edildi (tam liste, kaynak makalenin ek bölümünde mevcuttur).
Seçici Web Taraması
Araştırmacılar, daha sonra 2024 veri setinden elde edilen kriterlere göre videoları aramak için resmi YouTube API’sini kullandılar. Her konu için 500 video elde etmeyi amaçladılar. Gerekli Creative Commons lisansı dışında, her videonun 720p veya daha yüksek bir çözünürlüğe sahip olması ve dört dakikadan kısa olması gerekiyordu.
Bu şekilde, YouTube’dan 586.490 video taraması yapıldı.
Araştırmacılar, indirilen videoların YouTube ID’sini bir dizi popüler veri setiyle karşılaştırdı: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; ve WebVid-10M.
Onlar, VideoUFO kliplerinin yalnızca %0,29’unun (1.675 ID) bu eski koleksiyonlarda yer aldığını buldular ve listedeki karşılaştırma veri setlerinin, jeneratif video sahnesindeki en büyük ve en etkili oyuncuları içerdiğini kabul etmek gerekir.
Ayrıştırmalar ve Değerlendirme
Elde edilen videolar daha sonra, yukarıda belirtilen Panda-70M makalesindeki metodolojiye göre birden fazla kliplere bölündü. Şot sınırları tahmin edildi, montajlar dikildi ve birleştirilen videolar tek kliplere ayrıldı, kısa ve ayrıntılı altyazılar sağlandı.

VideoUFO veri setindeki her bir veri girişi, bir klip, bir ID, başlangıç ve bitiş zamanları ve kısa ve ayrıntılı bir altyazı içerir.
Kısa altyazılar, Panda-70M yöntemiyle işlenirken, ayrıntılı video altyazıları Qwen2-VL-7B ile işlendi ve Open-Sora-Plan tarafından kurulan kılavuzlar doğrultusunda işlendi. Kliplerin hedef kavramı erfolgreich bir şekilde temsil etmediği durumlarda, her bir böyle bir klipin ayrıntılı altyazıları GPT-4o mini‘ye beslendi, konuyla uyumlu olup olmadığı belirlenmek için.
Video kalitesi değerlendirmesi, VBench projesinin altı yöntemiyle gerçekleştirildi.
Karşılaştırmalar
Araştırmacılar, VideoUFO’da türetilen konuların çıkarılma işlemini önceki veri setlerinde yinelediler. Bunun için, VideoUFO’dan türetilen kategorileri, diğer koleksiyonlardaki kategorilerle anlamsal olarak eşleştirmek gerekliydi; bu, yalnızca yaklaşık eşdeğer kategoriler sağlayabilir ve bu nedenle, empirik karşılaştırmalar için çok subjektif bir süreç olabilir.
Her şeye rağmen, aşağıdaki resimde, araştırmacıların bu yöntem kullanarak elde ettiği sonuçları görebiliriz:

VideoUFO ve önceki veri setleri arasında türetilen temel özniteliklerin karşılaştırılması.
Araştırmacılar, analizlerinin mevcut altyazılar ve açıklamalara dayandığını kabul ediyorlar. Eski veri setlerini VideoUFO ile aynı yöntem kullanarak yeniden altyazılamasının daha doğrudan bir karşılaştırma sunabileceğini kabul ediyorlar, ancak bu yaklaşımın prohibitive olarak pahalı olacağını düşünüyorlar.
Jenerasyon
Araştırmacılar, kullanıcı odaklı kavramlar上的 text-to-video modellerinin performansını değerlendirmek için bir benchmark geliştirdiler, BenchUFO olarak adlandırıldı. Bu, VideoUFO’daki 1.291 kavramdan 791 isim seçerek gerçekleştirildi. Her seçilen konu için, VidProM’den on adet metin promt’u rastgele seçildi.
Her promt, bir text-to-video modeline geçirildi ve üretilen sonuçlar, Qwen2-VL-7B altyazılayıcı kullanılarak değerlendirildi. Tüm üretilen videolar böylelikle altyazılandıktan sonra, SentenceTransformers kullanılarak, her bir durumda girdi promt’u ve çıktı (türetildiği) açıklama için kosin benzerliği hesaplandı.

BenchUFO işleminin şeması.
Değerlendirilen jeneratif modeller şunlardı: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; ve Pyramidal.
Bu modellerin yanı sıra, MVDiT-VidGen ve MVDit-OpenVid alternatif eğitim veri setleri olarak kullanıldı.
Sonuçlar, VideoUFO’daki 10. en kötü ve en iyi performans gösteren konuları, mimariler ve veri setleri açısından dikkate aldı.

Kamuya açık T2V modellerinin BenchUFO’da eğitilen modellerle karşılaştırıldığı sonuçlar.
Araştırmacılar şöyle diyor:
‘Mevcut text-to-video modelleri, tüm kullanıcı odaklı konularda tutarlı bir şekilde iyi performans göstermiyor. Özellikle, en iyi 10 ve en kötü 10 konular arasında 0.233 ila 0.314 arasında bir puan farkı var. Bu modeller, “dev giant squid”, “animal cell”, “Van Gogh” ve “antik Mısır” gibi konuları anlamakta yetersiz kalabilir, çünkü bu videolarda yeterli eğitim almamışlardır.’
‘Mevcut text-to-video modelleri, en iyi performans gösteren konularda belirli bir tutarlılık gösteriyor. Çoğu text-to-video modelinin, “martı”, “panda”, “yüzen”, “deve” ve “baykuş” gibi hayvanlarla ilgili konularda video oluşturmakta başarılı olduğunu keşfettik. Bunun, mevcut video veri setlerinde hayvanlara yönelik bir önyargı nedeniyle olduğunu düşünüyoruz.’
Sonuç
VideoUFO, yalnızca taze veri açısından önemli bir sunum. Eğer YouTube ID’lerinin değerlendirilmesinde ve ortadan kaldırılmasında bir hata yoksa ve veri seti, araştırma sahnesine yeni materyaller sunuyorsa, bu, nadir ve potansiyel olarak değerli bir öneri.
Dezavantajı, temel metodolojiye inanmak zorunda olmanızdır; eğer kullanıcı talebinin web taraması formüllerini bilgilendirmesi gerektiğine inanmıyorsanız, kendi önyargılarıyla gelen bir veri setine yatırım yapmış olursunuz.
Daha da önemlisi, damıtılmış konuların faydası, kullanılan damıtma metodunun güvenilirliğine ve 2024 veri setinin kaynak materyalini sağlayan formülasyon metodlarına bağlı.
Dediğimiz gibi, VideoUFO daha fazla araştırma hak ediyor – ve Hugging Face’de bulunabilir.
* Araştırmacıların alıntılarını hyperlinklerle değiştirdim.
Çarşamba, 5 Mart 2025’te ilk kez yayımlandı.












