Взгляд Anderson
Использование ИИ для предсказания блокбастера

Хотя кино- и телевизионная индустрия часто рассматривается как творческая и открытая, она долгое время была осторожной. Высокие производственные затраты (которые могут скоро потерять компенсирующее преимущество более дешевых зарубежных мест, по крайней мере для американских проектов) и фрагментированный производственный ландшафт делают трудным для независимых компаний поглотить значительный убыток.
Поэтому за последнее десятилетие индустрия проявляет все больший интерес к тому, могут ли машины обучения обнаружить тенденции или закономерности в том, как аудитория реагирует на предложенные кино- и телевизионные проекты.
Основными источниками данных остаются система Нильсена (которая предлагает масштаб, хотя ее корни лежат в телевидении и рекламе) и методы, основанные на выборке, такие как фокус-группы, которые обменивают масштаб на отобранную демографию. К этой категории также относятся отзывы о бесплатных предварительных просмотрах фильмов – однако, к тому времени, когда большая часть производственного бюджета уже потрачена.
Теория “Большого Хита”
Изначально системы машинного обучения использовали традиционные методы анализа, такие как линейная регрессия, K-Ближайших Соседей, Стохастический Спуск, Дерево Решений и Леса, и Нейронные Сети, обычно в различных комбинациях, более похожих на до-ИИ статистический анализ, такой как инициатива 2019 года Университета Центральной Флориды предсказать успешные телешоу на основе комбинаций актеров и писателей (среди других факторов):

Исследование 2018 года оценило производительность эпизодов на основе комбинаций персонажей и/или писателей (большинство эпизодов было написано более чем одним человеком). Источник: https://arxiv.org/pdf/1910.12589
Самая актуальная связанная работа, по крайней мере, та, которая развернута в дикой природе (хотя часто критикуется), находится в области систем рекомендаций:

Типичный видео-рекомендационный конвейер. Видео в каталоге индексируются с помощью функций, которые могут быть вручную аннотированы или автоматически извлечены. Рекомендации генерируются в два этапа: сначала выбираются кандидатные видео, а затем они ранжируются по профилю пользователя, выведенному из предпочтений просмотра. Источник: https://www.frontiersin.org/journals/big-data/articles/10.3389/fdata.2023.1281614/full
Однако эти подходы анализируют проекты, которые уже успешны. В случае новых фильмов или шоу неясно, какой вид основы будет наиболее актуальным – не в последнюю очередь потому, что изменения в общественном вкусе, в сочетании с улучшениями и дополнениями источников данных, означают, что десятилетия последовательных данных обычно недоступны.
Это пример проблемы холодного старта, где системы рекомендаций должны оценивать кандидатов без каких-либо предварительных данных об взаимодействии. В таких случаях традиционная коллаборативная фильтрация разрушается, поскольку она полагается на закономерности в поведении пользователей (такие как просмотр, оценка или обмен) для генерации прогнозов. Проблема заключается в том, что в случае большинства новых фильмов или шоу еще нет достаточного обратной связи аудитории, чтобы поддержать эти методы.
Прогнозы Comcast
Новая статья от Comcast Technology AI, в сотрудничестве с Университетом Джорджа Вашингтона, предлагает решение этой проблемы, побуждая языковую модель к структурированным метаданным о не выпущенных фильмах.
Входные данные включают актерский состав, жанр, синопсис, рейтинг контента, настроение и награды, а модель возвращает ранжированный список вероятных будущих хитов.
Авторы используют вывод модели в качестве замены интереса аудитории, когда нет доступных данных об взаимодействии, надеясь избежать ранней предвзятости в пользу названий, которые уже хорошо известны.
Очень короткая (три страницы) статья, озаглавленная Предсказание фильмов-хитов до их выпуска с помощью ИИ, исходит от шести исследователей Comcast Technology AI и одного из GWU, и гласит:
‘Наши результаты показывают, что ИИ, при использовании метаданных фильмов, могут значительно превзойти базовые показатели. Этот подход может служить вспомогательной системой для нескольких случаев использования, позволяя автоматически оценивать большие объемы новой информации, выпускаемой ежедневно и еженедельно.’
‘Предоставляя ранние идеи до того, как редакционные команды или алгоритмы накопили достаточные данные об взаимодействии, ИИ может оптимизировать процесс рассмотрения контента. ‘
‘С постоянными улучшениями эффективности ИИ и ростом агентов рекомендаций идеи, полученные в этой работе, ценны и адаптируемы к широкому кругу областей.’
Если этот подход окажется прочным, он может уменьшить зависимость индустрии от ретроспективных метрик и сильно продвигаемых названий, введя масштабируемый способ выделить перспективный контент до выпуска. Таким образом, вместо того, чтобы ждать поведения пользователей, чтобы сигнализировать о спросе, редакционные команды могли бы получить ранние, основанные на метаданных, прогнозы интереса аудитории, потенциально перераспределяя внимание по более широкому кругу новых релизов.
Метод и данные
Авторы очерчивают четырехэтапный рабочий процесс: создание специального набора данных из не выпущенных метаданных фильмов; установление базовой модели для сравнения; оценка подходящих ИИ с помощью как естественного языкового рассуждения, так и прогнозирования на основе вложений; и оптимизация выводов с помощью инженерии подсказок в генеративном режиме, используя ИИ Llama 3.1 и 3.3.
Поскольку, как заявляют авторы, ни один из публично доступных наборов данных не предлагал прямого способа проверить их гипотезу (поскольку большинство существующих коллекций предшествуют ИИ и не имеют подробных метаданных), они построили эталонный набор данных из платформы развлечений Comcast, которая обслуживает десятки миллионов пользователей через прямые и сторонние интерфейсы.
Набор данных отслеживает недавно выпущенные фильмы и то, стали ли они популярными, с определением популярности через взаимодействие пользователей.
Авторы заявляют:
‘Мы сосредоточились на фильмах, потому что они менее подвержены внешним знаниям, чем телесериалы, что улучшает надежность экспериментов.’
Метаданные, такие как жанр, синопсис, рейтинг, эра, актерский состав, экипаж, настроение, награды и типы персонажей, были использованы для подсказки ИИ.
Для сравнения авторы использовали две базовые модели: случайный порядок и модель Popular Embedding (PE).
Проект использовал большие языковые модели в качестве основного метода ранжирования, генерируя упорядоченные списки фильмов с прогнозируемыми баллами популярности и сопровождающими обоснованиями – и эти выводы были сформированы стратегиями инженерии подсказок, предназначенными для руководства прогнозами модели с помощью структурированных метаданных.
Стратегия подсказки представляла модель как “редакционного помощника”, назначенного для выявления предстоящих фильмов, которые, вероятно, станут популярными, только на основе структурированных метаданных, и затем порученного для переупорядочения фиксированного списка названий без введения новых элементов, и для возврата вывода в формате JSON.
Каждый ответ состоял из ранжированного списка, присвоенных баллов популярности, обоснований для ранжирования и ссылок на любые предыдущие примеры, которые повлияли на результат. Эти несколько уровней метаданных были предназначены для улучшения контекстного понимания модели и ее способности предвидеть будущие тенденции аудитории.
Тесты
Эксперимент включал два основных этапа: изначально авторы протестировали несколько вариантов модели для установления базовой модели, включающей выявление версии, которая работает лучше, чем случайный порядок.
Во-вторых, они протестировали большие языковые модели в генеративном режиме, сравнивая их вывод с более сильной базовой моделью, а не с случайным ранжированием, повышая уровень сложности задачи.
Это означало, что модели должны были работать лучше, чем система, которая уже показала некоторую способность предсказывать, какие фильмы станут популярными. Таким образом, авторы утверждают, что оценка лучше отражает реальные условия, где редакционные команды и системы рекомендаций редко выбирают между моделью и случайностью, а между конкурирующими системами с различными уровнями прогностической способности.
Преимущество невежества
Ключевым ограничением в этом расположении было временное расстояние между знанием модели и фактическими датами выпуска фильмов. Поскольку языковые модели были обучены на данных, которые завершились за шесть-двенадцать месяцев до выпуска фильмов, у них не было доступа к пост-релизной информации, гарантируя, что прогнозы были основаны исключительно на метаданных, а не на каком-либо выученном ответе аудитории.
Базовая оценка
Для создания базовой модели авторы сгенерировали семантические представления метаданных фильмов, используя три модели вложения: BERT V4; Linq-Embed-Mistral 7B; и Llama 3.3 70B, квантованный до 8-битной точности, чтобы удовлетворить ограничениям экспериментальной среды.
Linq-Embed-Mistral был выбран для включения из-за его верхней позиции на MTEB (Massive Text Embedding Benchmark) лидерборде.
Каждая модель произвела векторные вложения кандидатных фильмов, которые затем сравнивались со средним вложением из ста самых популярных названий из недель, предшествующих выпуску каждого фильма.
Популярность была выведена с помощью косинусной подобия между этими вложениями, с более высокими баллами подобия, указывающими на более высокий прогнозируемый интерес. Точность ранжирования каждой модели оценивалась путем измерения производительности против базовой модели случайного порядка.

Улучшение производительности моделей Popular Embedding по сравнению с базовой моделью случайного порядка. Каждая модель была протестирована с помощью четырех конфигураций метаданных: V1 включает только жанр; V2 включает только синопсис; V3 объединяет жанр, синопсис, рейтинг контента, типы персонажей, настроение и эру выпуска; V4 добавляет актерский состав, экипаж и награды к конфигурации V3. Результаты показывают, как более богатые входные метаданные влияют на точность ранжирования. Источник: https://arxiv.org/pdf/2505.02693
Результаты (показанные выше) демонстрируют, что BERT V4 и Linq-Embed-Mistral 7B обеспечили наиболее сильные улучшения в выявлении трех самых популярных названий, хотя обе модели немного не дотянули до прогнозирования единого наиболее популярного элемента.
BERT был в конечном итоге выбран в качестве базовой модели для сравнения с ИИ, поскольку его эффективность и общая производительность превосходили его ограничения.
Оценка ИИ
Исследователи оценили производительность, используя два подхода ранжирования: парное и списковое. Парное ранжирование оценивает, правильно ли модель относительно одного элемента к другому; списковое ранжирование учитывает точность всего упорядоченного списка кандидатов.
Эта комбинация позволила оценить не только то, правильно ли модель ранжирует отдельные пары фильмов (локальная точность), но и то, насколько хорошо весь список кандидатов отражает истинный порядок популярности (глобальная точность).
Полные, не квантованные модели были использованы для предотвращения потери производительности, обеспечивая последовательное и воспроизводимое сравнение между прогнозами ИИ и моделями вложения.
Метрики
Для оценки того, насколько хорошо языковые модели предсказывали популярность фильмов, были использованы метрики ранжирования и классификации, с особым вниманием к выявлению трех самых популярных названий.
Были применены четыре метрики: Точность@1 измеряла, как часто самый популярный элемент появлялся в первом положении; Обратный ранг захватывал, насколько высоко ранжировался самый популярный элемент в прогнозируемом списке, взяв обратную величину его позиции; Нормализованная дискретная кумулятивная выгода (NDCG@k) оценивала, насколько хорошо все ранжирование соответствовало фактической популярности, с более высокими баллами, указывающими на лучшее соответствие; и Recall@3 измеряла долю действительно популярных названий, которые появлялись в топ-3 прогнозов модели.
Поскольку большинство взаимодействий пользователей происходит возле верха ранжированных меню, оценка была сосредоточена на более низких значениях k, чтобы отразить практические случаи использования.

Улучшение производительности больших языковых моделей над BERT V4, измеренное в процентах прироста по метрикам ранжирования. Результаты были усреднены за десять запусков на каждую комбинацию модели и подсказки, с двумя верхними значениями, выделенными. Отчетные цифры отражают средний процентный прирост по всем метрикам.
Производительность моделей Llama 3.1 (8B), 3.1 (405B) и 3.3 (70B) была оценена путем измерения улучшений метрик относительно ранее установленной базовой модели BERT V4. Каждая модель была протестирована с помощью серии подсказок, от минимальных до информативных, для изучения влияния детализации входных данных на качество прогнозов.
Авторы заявляют:
‘Лучшая производительность достигается при использовании Llama 3.1 (405B) с наиболее информативной подсказкой, за которой следует Llama 3.3 (70B). На основе наблюдаемой тенденции, когда используется сложная и длинная подсказка (MD V4), более сложная языковая модель обычно приводит к улучшению производительности по различным метрикам. Однако она чувствительна к типу добавляемой информации.’
Производительность улучшилась, когда были включены награды актеров в качестве части подсказки – в данном случае количество основных наград, полученных пятью наиболее известными актерами в каждом фильме. Эти более богатые метаданные были частью наиболее подробной конфигурации подсказки, превосходящей более простую версию, исключающую признание актеров. Преимущество было наиболее очевидным в более крупных моделях, Llama 3.1 (405B) и 3.3 (70B), обе из которых показали более сильную прогностическую точность при наличии этого дополнительного сигнала престижа и знакомства аудитории.
Напротив, самая маленькая модель, Llama 3.1 (8B), показала улучшение производительности, когда подсказки стали немного более подробными, переходя от жанра к синопсису, но производительность снижалась, когда добавлялись больше полей, указывая на то, что модель не имела способности интегрировать сложные подсказки эффективно, что приводило к более слабой обобщаемости.
Когда подсказки были ограничены только жанром, все модели показали худшую производительность по сравнению с базовой моделью, демонстрируя, что ограниченные метаданные были недостаточны для поддержки осмысленных прогнозов.
Вывод
ИИ стали флагманом генеративного ИИ, что может объяснить, почему они используются в областях, где другие методы могли бы быть более подходящими. Тем не менее, все еще многое не известно о том, что они могут сделать в разных отраслях, поэтому имеет смысл дать им шанс.
В данном случае, как и на фондовых рынках и прогнозировании погоды, существует только ограниченный масштаб, в котором исторические данные могут служить основой для будущих прогнозов. В случае фильмов и телешоу даже способ доставки сейчас движущейся целью, в отличие от периода с 1978 по 2011 год, когда кабельное, спутниковое и портативное вещание (VHS, DVD и т. д.) представляли собой ряд переходных или эволюционирующих исторических нарушений.
Ни один метод прогнозирования не может учесть степень, в которой успех или неудача других произведений может повлиять на жизнеспособность предложенного проекта – и все же это часто бывает в кино- и телевизионной индустрии, которая любит ездить на тренде.
Тем не менее, когда используются вдумчиво, ИИ могут помочь укрепить системы рекомендаций во фазе холодного старта, предлагая полезную поддержку в ряде прогностических методов. Первая публикация – вторник, 6 мая 2025 года.












