Anderson’un Açısı

Yapay Zeka Kullanarak Bir Blokbaştır Film Tahmin Etme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o and Adobe Firefly

Film ve televizyon endüstrileri genellikle yaratıcı ve açık uçlu olarak görülse de, uzun süredir riskten kaçınmaya eğilimlidir. Yüksek üretim maliyetleri (ABD projeleri için en azından daha ucuz yabancı lokasyonların avantajını kaybetme olasılığı) ve parçalanmış bir üretim manzarası, bağımsız şirketlerin önemli bir kaybı absorbe etmesini zorlaştırır.

Bu nedenle, endüstri son on yılda, makine öğreniminin proposed film ve televizyon projelerine karşı izleyici tepkisinde eğilimler veya kalıplar tespit edebileceği konusunda artan bir ilgi göstermiştir.

Ana veri kaynakları, Nielsen sistemi (ölçek sunar, ancak kökleri TV ve reklamcılıkta yatmaktadır) ve örnek tabanlı yöntemler olarak kalır, bunlar da ölçek için seçilen demografiyi takas eder. Bu son kategori, ayrıca ücretsiz film ön izlemelerinden alınan puan kartı geri bildirimi de içerir – ancak bu noktada, bir üretimin bütçesinin çoğu zaten harcanmıştır.

‘Büyük Hit’ Teorisi/Teorileri

İlk olarak, ML sistemleri, geleneksel analiz yöntemlerini kullanarak doğrusal regresyon, K-En Yakın Komşular, Stokastik Gradient İnişi, Karar Ağacı ve Ormanlar ve Yapay Sinir Ağları, genellikle pre-AI istatistiksel analiz tarzında çeşitli kombinasyonlarda, gibi 2019 Üniversitesi Merkez Florida girişimi başarılı TV şovlarını tahmin etmek oyuncular ve yazarlar (diğer faktörler arasında) kombinasyonlarına dayanarak:

A 2018 study rated the performance of episodes based on combinations of characters and/or writer (most episodes were written by more than one person). Source: https://arxiv.org/pdf/1910.12589

A 2018 study rated the performance of episodes based on combinations of characters and/or writer (most episodes were written by more than one person). Source: https://arxiv.org/pdf/1910.12589

En ilgili ilgili çalışma, en azından vahşi doğada dağıtılan (ancak sık sık eleştirilen) öneri sistemleri alanındadır:

A typical video recommendation pipeline. Videos in the catalog are indexed using features that may be manually annotated or automatically extracted. Recommendations are generated in two stages by first selecting candidate videos and then ranking them according to a user profile inferred from viewing preferences. Source: https://www.frontiersin.org/journals/big-data/articles/10.3389/fdata.2023.1281614/full

A typical video recommendation pipeline. Videos in the catalog are indexed using features that may be manually annotated or automatically extracted. Recommendations are generated in two stages by first selecting candidate videos and then ranking them according to a user profile inferred from viewing preferences. Source: https://www.frontiersin.org/journals/big-data/articles/10.3389/fdata.2023.1281614/full

Ancak, bu tür yaklaşımlar zaten başarılı olan projeleri analiz eder. Yeni şovlar veya filmler için, en uygun temel gerçekliğin ne olacağı açık değildir – en azından kamu tadında değişiklikler, veri kaynaklarının iyileştirmeleri ve genişletmeleri ile birlikte, genellikle decades tutarlı veri mevcut değildir.

Bu, soğuk başlangıç problemi bir örneğidir, öneri sistemleri herhangi bir önceki etkileşim verisi olmadan adayları değerlendirmelidir. Bu gibi durumlarda, geleneksel işbirliği filtreleme bozulur, çünkü kullanıcı davranışındaki (görme, puanlama veya paylaşma gibi) kalıplara dayanarak tahminler oluşturur. Sorun, çoğu yeni film veya şov için henüz yeterli izleyici geri bildirimi olmadığıdır.

Comcast Tahmin Ediyor

Comcast Technology AI’den yeni bir makale, George Washington Üniversitesi ile birlikte, bu problema bir çözüm öneriyor ve yayımlanmamış filmler hakkında yerleştirilmiş metadata ile bir dil modelini uyandırıyor.

Girdiler oyuncu kadrosu, tür, özet, içerik derecesi, duygu ve ödüller içerir ve model, olası gelecek hitlerin sıralanmış bir listesini döndürür.

Yazarlar, modelin çıktısını, mevcut olmayan etkileşim verisi olduğunda, already iyi bilinen başlıklara yönelik erken yanlılığı önlemek umuduyla, izleyici ilgisinin bir yerine koyuyor.

Çok kısa (üç sayfa) makale, Yayımlanmadan Önce Film Hitlerini LLM’lerle Tahmin Etme adlı, Comcast Technology AI’den altı araştırmacı ve GWU’dan biri tarafından yazılmıştır ve şunları belirtir:

‘Sonuçlarımız, LLM’lerin, film meta verilerini kullanarak, temel değerleri önemli ölçüde aşabileceğini gösteriyor. Bu yaklaşım, günlük ve haftalık olarak yayımlanan büyük miktarda yeni içeriğin otomatik puanlamasını sağlayan çoklu kullanım durumları için bir yardımcı sistem olarak hizmet edebilir.

‘Düzenleyici ekipler veya algoritmaların yeterli etkileşim verisi biriktirmeden önce erken bakışlar sağlayarak, LLM’ler içerik inceleme sürecini hızlandırabilir.

‘LLM’lerin verimliliğindeki sürekli iyileştirmelerle birlikte ve öneri ajanlarının yükselişi ile, bu çalışmanın çıkarımları, çeşitli alanlara uyarlanabilir ve değerli olacaktır.’

Eğer bu yaklaşım güçlü çıkarsa, endüstrinin, yayınlanmadan önce vaat edilen içeriği saptamak için ölçeklenebilir bir yol sunarak, geriye dönük metriklere ve ağır tanıtılan başlıklara olan bağımlılığını azaltabilir. Böylece, düzenleyici ekipleri, kullanıcı davranışını sinyal olarak beklemek yerine, meta veri sürücülü erken izleyici ilgisinin tahminlerini alabilirler.

Yöntem ve Veri

Yazarlar, dört aşamalı bir iş akışı ortaya koyuyor: yayımlanmamış film meta verisinden özel bir veri setinin oluşturulması; karşılaştırma için bir temel modelin kurulması; doğal dil mantığı ve gömme tabanlı tahmin kullanarak uygun LLM’lerin değerlendirilmesi; ve Meta’nın Llama 3.1 ve 3.3 dil modellerini kullanarak generatif modda çıktı optimizasyonu.

Yazarlar, herhangi bir kamu veri setinin hipotezlerini doğrudan test etmelerine olanak tanımadığını çünkü çoğu mevcut koleksiyonun LLM’lerden önce geldiğini ve ayrıntılı meta verilere sahip olmadığını belirtiyorlar, bu nedenle Comcast eğlence platformundan bir referans veri seti oluşturdular, bu platform on milyonlarca kullanıcıya doğrudan ve üçüncü taraf arayüzler aracılığıyla hizmet vermektedir.

Veri seti, yeni yayımlanan filmleri ve daha sonra popüler olup olmadığını izler, popülerlik kullanıcı etkileşimleri aracılığıyla tanımlanır.

Koleksiyon, filmlere odaklanır ve yazarlar şunları belirtir:

‘Filmlere odaklandık çünkü TV dizileri kadar dış bilgiden etkilenmezler, bu da deneylerin güvenilirliğini artırır.’

Etiketler, farklı zaman pencereleri ve liste boyutları boyunca bir başlığın popüler olmasını aldığı süreyi analiz ederek atanmıştır. LLM, tür, özet, puan, çıkış, oyuncu kadrosu, ekip, duygu, ödüller ve karakter türleri gibi meta veri alanlarıyla uyandırıldı.

Karşılaştırma için yazarlar, iki temel değer kullanmıştır: rasgele bir sıralama ve bir Popüler Gömme (PE) modeli (bunu yakında ele alacağız).

Proje, büyük dil modellerini birincil sıralama yöntemi olarak kullandı, öngörülen popülerlik puanlarıyla birlikte sıralanmış film listeleri üreterek ve bu çıktılar, modelin tahminlerini yapılandırılmış meta veri kullanarak yönlendirmek için tasarlanmış.prompt mühendisliği stratejileri tarafından şekillendirildi.

İttirme stratejisi, modeli, yalnızca yapılandırılmış meta verilere dayanarak, hangi gelecek filmlerin en olası popüler olacağını belirlemekle görevli bir “düzenleyici asistan” olarak çerçeveledi ve sonra da, yeni öğeler eklemeksizin, bir dizi başlığın yeniden sıralanmasını istedi ve JSON formatında çıktı verdi.

Her cevap, sıralanmış bir liste, atanmış popülerlik puanları, sıralamalar için gerekçeler ve önceki örneklerin sonuçlarını etkileyen referanslar içeriyordu. Bu çoklu meta veri seviyeleri, modelin bağlamını ve gelecekteki izleyici eğilimlerini öngörme yeteneğini iyileştirmek için tasarlandı.

Testler

Deney, iki ana aşamaya sahiptir: ilk olarak, yazarlar, rasgele bir sıralama yaklaşımından daha iyi performans gösteren bir model varyantını belirlemek için birkaç model varyantını test etmiştir.

İkincisi, büyük dil modellerini üretken modda test ettiler, çıktılarını daha güçlü bir temel değerle karşılaştırarak, rastgele bir sıralama değil, daha güçlü bir sistemle karşılaştırdılar, görevin zorluğunu artırdılar.

Bu, modellerin, zaten bazı popüler filmleri tahmin etme yeteneği gösteren bir sistemle yarışmak zorunda olduğu anlamına geliyordu. Sonuç olarak, yazarlar, değerlendirme, gerçek dünya koşullarını daha iyi yansıttığını, düzenleyici ekiplerin ve öneri sistemlerinin genellikle bir model ve şansa değil, farklı öngörme yeteneklerine sahip sistemler arasında seçim yaptığını iddia ediyorlar.

Bilgisizliğin Avantajı

Bu kurulumda bir kilit kısıtlama, modellerin bilgi kesme tarihi ile filmlerin gerçek yayın tarihleri arasındaki zaman aralığıydı. Dil modelleri, filmler yayımlanmadan altı ila on iki ay önce sonlanan verilerle eğitildiğinden, yayın sonrası bilgilere erişimi yoktu, bu da tahminlerin tamamen meta verilere dayandığını garantiledi.

Temel Değerlendirme

Temel oluşturmak için yazarlar, üç gömme modeli kullanarak film meta verilerinin anlamsal temsilini oluşturdular: BERT V4; Linq-Embed-Mistral 7B; ve Llama 3.3 70B, deneysel ortamın kısıtlamalarını karşılamak için 8-bit doğruluğa quantized.

Linq-Embed-Mistral, MTEB (Massive Text Embedding Benchmark) liderlik tablosunda ilk sırada yer aldığı için dahil edildi.

Her model, aday filmlerinin vektör gömmelerini üretti, bunlar daha sonra her film yayımından önce gelen en popüler yüz başlığın ortalama gömmesine karşı karşılaştırıldı.

Popülerlik, bu gömmeler arasındaki kosin benzerliği kullanılarak çıkarıldı, daha yüksek benzerlik puanları daha yüksek öngörülen çekiciliği gösterdi. Her modelin sıralama doğruluğu, rastgele bir sıralama temel değerine karşı performansını ölçerek değerlendirildi.

erformance improvement of Popular Embedding models compared to a random baseline. Each model was tested using four metadata configurations: V1 includes only genre; V2 includes only synopsis; V3 combines genre, synopsis, content rating, character types, mood, and release era; V4 adds cast, crew, and awards to the V3 configuration. Results show how richer metadata inputs affect ranking accuracy.. Source: https://arxiv.org/pdf/2505.02693

Performance improvement of Popular Embedding models compared to a random baseline. Each model was tested using four metadata configurations: V1 includes only genre; V2 includes only synopsis; V3 combines genre, synopsis, content rating, character types, mood, and release era; V4 adds cast, crew, and awards to the V3 configuration. Results show how richer metadata inputs affect ranking accuracy. Source: https://arxiv.org/pdf/2505.02693

Sonuçlar (yukarıda gösterilen), BERT V4 ve Linq-Embed-Mistral 7B’nin en güçlü gelişmeleri sunduğunu, ilk üç en popüler başlığı belirlemede, ancak her ikisinin de tek en popüler öğeyi tahmin etmede biraz geride kaldığını gösteriyor.

BERT, sınırlamalarına rağmen, verimliliği ve genel kazançları nedeniyle karşılaştırma için temel model olarak seçildi.

LLM Değerlendirme

Araştırmacılar, iki sıralama yaklaşımını kullanarak performansı değerlendirdiler: çift yönlü ve listeye bağlı. Çift yönlü sıralama, modelin bir öğeyi diğerine göre doğru bir şekilde sıralayıp sıralamadığını değerlendirir; ve listeye bağlı sıralama, adayların tüm sıralı listesinin gerçek popülerlik sırasına uygunluğunu dikkate alır.

Bu kombinasyon, yalnızca bireysel film çiftlerinin doğru bir şekilde sıralanıp sıralanmadığını (yerel doğruluk) değil, aynı zamanda tüm aday listesinin gerçek popülerlik sırasını ne kadar iyi yansıttığını (küresel doğruluk) değerlendirmeyi mümkün kıldı.

Tam, quantized olmayan modeller, performans kaybını önlemek için kullanıldı, böylece LLM tabanlı tahminler ve gömme tabanlı temel değerler arasında tutarlı ve tekrarlanabilir bir karşılaştırma sağlandı.

Metrikler

Dil modellerinin film popülerliğini ne kadar etkili bir şekilde öngördüğünü değerlendirmek için, hem sıralama tabanlı hem de sınıflandırma tabanlı metrikler kullanıldı, özellikle en popüler üç başlığı belirleme üzerinde dikkat çekildi.

Dört metrik uygulandı: Doğruluk@1 en popüler öğenin ilk pozisyonda ne sıklıkla göründüğünü ölçtü; Ters Sıralama predicted listesindeki en üst öğenin sıralamasını yakaladı, pozisyonunun tersini alarak; Normalleştirilmiş İndirgenmiş Toplamsal Kazanç (NDCG@k) tüm sıralamanın gerçek popülerlikle ne kadar iyi uyduğunu değerlendirdi, daha yüksek puanlar daha iyi hizalamayı gösterdi; ve Recall@3, gerçekten popüler başlıkların modelin ilk üç tahmini arasında ne kadar sıklıkla göründüğünü ölçtü.

Çoğu kullanıcı etkileşimi sıralı menülerin üst kısmında gerçekleştiğinden, değerlendirme, pratik kullanım durumlarını yansıtmak için k değerlerine odaklandı.

Performance improvement of large language models over BERT V4, measured as percentage gains across ranking metrics. Results were averaged over ten runs per model-prompt combination, with the top two values highlighted. Reported figures reflect the average percentage improvement across all metrics.

Performance improvement of large language models over BERT V4, measured as percentage gains across ranking metrics. Results were averaged over ten runs per model-prompt combination, with the top two values highlighted. Reported figures reflect the average percentage improvement across all metrics.

Llama modeli 3.1 (8B), 3.1 (405B) ve 3.3 (70B)’in performansı, BERT V4 temel değerine göre metric iyileştirmeleri ölçülerek değerlendirildi. Her model, öngörülen kaliteyi incelemek için, minimalden bilgi zenginine kadar çeşitli promtler kullanılarak test edildi.

Yazarlar şunları belirtir:

‘En iyi performans, Llama 3.1 (405B) ile en bilgilendirici promt kullanılarak elde edilir, bunu Llama 3.3 (70B) izler. Gözlemlenen eğilime dayanarak, daha karmaşık ve uzun bir promt (MD V4) kullanıldığında, daha karmaşık bir dil modeli genellikle çeşitli metriklerde daha iyi performansa yol açar. Ancak, eklenen bilginin türüne duyarlıdır.’

Performans, ödüller dahil olduğunda promtın bir parçası olarak daha iyi hale geldi – bu durumda, her filmin ilk beş faturalanan oyuncusunun aldığı büyük ödüllerin sayısı. Bu daha zengin meta veri, en ayrıntılı promt yapılandırmasının bir parçasıydı ve daha basit bir sürü, oyuncu tanıma dahil değildi, daha büyük modellerde, Llama 3.1 (405B) ve 3.3 (70B)’de, bu ek sinyalini prestij ve izleyici aşinalığı olarak daha güçlü öngörme doğruluğu gösterdi.

Öte yandan, en küçük model, Llama 3.1 (8B), promtlar biraz daha ayrıntılı hale geldiğinde, türden özetlere ilerlerken performansı iyileştirdi, ancak daha fazla alan eklendiğinde, modelin karmaşık promtları etkili bir şekilde entegre edememesi nedeniyle, daha zayıf bir genelleme gösterdi.

Promtlar yalnızca türe sınırlı olduğunda, tüm modeller temel değerden daha kötü performans gösterdi, bu da sınırlı meta verilerin anlamlı tahminler için yeterli olmadığını gösterdi.

SONUÇ

LLM’ler, üretilen AI için poster çocuğu haline geldi, bu da onları diğer yöntemlerin daha iyi bir uyum sağlayabileceği alanlarda çalıştırılmalarına neden olabilir. Yine de, farklı endüstrilerde neler yapabileceklerini tentang çok şey bilmeyiz, bu nedenle onlara bir şans verilmesi mantıklıdır.

Özellikle bu durumda, hisse senedi piyasaları ve hava tahmini gibi, tarihi veriler gelecekteki tahminlerin temelini oluşturmak için sınırlı bir şekilde kullanılabilir. Filmler ve TV şovları için, teslimat yöntemi artık hedefe yönelik bir hedef, 1978-2011 arasındaki döneme kıyasla, kablo, uydu ve taşınabilir medya (VHS, DVD vb.) bir dizi geçici veya gelişen tarihi bozulmaları temsil ediyordu.

Ne de bir tahmin yöntemi, diğer üretimler başarısı veya başarısızlığının önerilen bir mülke etkileyebileceği ölçüde hesaba katamaz – ve bu, trendi sürmek isteyen film ve TV endüstrisinde sık sık böyle olur.

Her şeye rağmen, dikkatli bir şekilde kullanıldığında, LLM’ler soğuk başlangıç aşamasında öneri sistemlerini güçlendirmeye yardımcı olabilir, çeşitli öngörme yöntemleri boyunca faydalı destek sunabilir.

 

İlk olarak Salı, 6 Mayıs 2025’te yayımlanmıştır

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai