Andersonの視点
AIを使用してブロックバスター映画を予測する

映画やテレビ業界は、創造的でオープンな業界であると見なされることが多いですが、実際にはリスクを避ける傾向があります。高額な制作費用(アメリカのプロジェクトの場合、海外のロケーションのコストが安くなったことで、オフセットされる利点を失う可能性がある)と、断片化された制作環境により、独立した会社が大きな損失を吸収することが難しくなります。
したがって、過去10年間で、業界は、機械学習が提案された映画やテレビプロジェクトに対する聴衆の反応の傾向やパターンを検出できるかどうかについて、ますます関心を持つようになってきました。
主なデータソースは、ニールセンシステム(スケールを提供するが、テレビと広告に根ざしている)と、フォーカスグループや無料映画プレビューからのスコアカードフィードバックなどのサンプルベースの方法です。後者には、手作業で注釈を付けたり自動で抽出されたりしたフィーチャーを使用して、カタログ内のビデオをインデックス化する、典型的なビデオレコメンデーションパイプラインも含まれます。
「大ヒット」理論
初期のMLシステムは、線形回帰、K-Nearest Neighbors、Stochastic Gradient Descent、Decision Tree、ランダムフォレスト、ニューラルネットワークなどの従来の分析方法を利用していました。これらのアプローチは、すでに成功しているプロジェクトを分析するものでした。
しかし、これらのアプローチでは、まだ成功していない新しい映画やテレビ番組の場合、どのような基準が最も適切であるかは明らかではありません。一般的なデータセットでは、デカルトのconsistentデータは通常利用できないためです。
これは、コールドスタート問題の例です。レコメンデーションシステムは、事前にインタラクションデータがない状態で候補を評価する必要があります。この場合、伝統的なコラボレーティブフィルタリングは機能しません。コラボレーティブフィルタリングは、ユーザーの行動(視聴、評価、共有など)におけるパターンに基づいて予測を生成するためです。
コムキャストの予測
コムキャスト・テクノロジーAIとジョージ・ワシントン大学の新しい論文では、未公開映画のメタデータを言語モデルに提示することで、この問題を解決することを提案しています。
入力には、キャスト、ジャンル、シノプシス、コンテンツレーティング、ムード、賞などが含まれます。モデルは、将来のヒットとなる可能性のあるランク付けされたリストを返します。
著者らは、モデルの出力を、利用可能なエンゲージメントデータがない場合の聴衆の関心の代理として使用します。既に知名度のあるタイトルへの早期バイアスを避けることを目指しています。
方法とデータ
著者らは、専用のデータセットの構築、ベースラインモデルの確立、適切なLLMの評価、出力の最適化という4つのステージを持つワークフローを概説しています。
データセットは、コムキャストのエンターテインメントプラットフォームから構築され、数千万のユーザーを対象としています。新しく公開された映画を追跡し、後にどれが人気を博したかを記録しています。
コレクションは、テレビシリーズではなく映画に焦点を当てています。著者らは、映画はテレビシリーズよりも外部の知識の影響を受けにくいため、実験の信頼性が向上することを述べています。
テスト
実験は、2つのステージで行われました。最初に、著者らは、ランダムな順序付けよりも優れたパフォーマンスを示すモデルバリアントを特定しました。
2番目のステージでは、大規模な言語モデルを生成モードでテストし、より強力なベースラインと比較しました。モデルは、すでにある程度の予測能力を持つシステムと競合する必要がありました。
無知の利点
このセットアップでは、重要な制約が存在しました。モデルの知識カットオフと映画の実際の公開日との間の時間差です。言語モデルは、映画の公開前に6〜12か月前に終了したデータでトレーニングされたため、ポストリリース情報にはアクセスできませんでした。
したがって、予測は、学習した聴衆の反応ではなく、メタデータに基づいて行われました。
ベースライン評価
ベースラインを構築するために、著者らは、3つの埋め込みモデル(BERT V4、Linq-Embed-Mistral 7B、Llama 3.3 70B)を使用して、映画のメタデータの意味的表現を生成しました。
各モデルは、候補映画のベクトル埋め込みを生成し、それを前の週に公開されたトップ100の映画の平均埋め込みと比較しました。人気は、埋め込み間のコサイン類似度によって推定されました。
LLM評価
研究者らは、ペアワイズとリストワイズの2つのランキングアプローチを使用してパフォーマンスを評価しました。ペアワイズランキングでは、モデルが2つのアイテムの相対的な順序を正しく評価するかどうかを評価します。リストワイズランキングでは、候補者の完全な順序付きリストの正確性を評価します。
完全な、量子化されていないモデルを使用して、LLMベースの予測と埋め込みベースのベースラインの間のパフォーマンスの低下を防ぎました。
メトリック
ランキングベースと分類ベースの両方のメトリックを使用して、言語モデルが映画の人気をどの程度予測できるかを評価しました。特に、トップ3の最も人気のあるタイトルを特定することに焦点を当てました。
4つのメトリックを適用しました。Accuracy@1は、最も人気のあるアイテムが1位に表示される頻度を測定しました。逆順位は、予測リスト内で最も上位のアイテムの順位の逆数を取りました。NDCG@kは、予測ランキングと実際の人気の間の整列度を評価しました。Recall@3は、実際に人気のあるタイトルのうち、モデルのトップ3の予測に含まれる割合を測定しました。
結論
LLMは、生成的なAIの代名詞となりました。ただし、まだLLMがさまざまな業界で何ができるかについては、多くのことがわかっていません。したがって、LLMを試す価値があります。
この場合、株式市場や天気予報と同様に、歴史的なデータは将来の予測の基礎となる程度にしか使用できません。映画やテレビ番組の場合、配信方法自体が変化しているため、1978年から2011年までのケーブル、衛星、ポータブルメディア(VHS、DVDなど)時代とは異なります。
また、他の作品の成功または失敗の程度が、提案された作品の実現可能性に影響を与えることもありますが、予測方法ではこれを考慮することはできません。映画やテレビ業界は、トレンドに乗ることが多いためです。
ただし、LLMを慎重に使用すると、コールドスタートフェーズでのレコメンデーションシステムを強化し、さまざまな予測方法に対する有用なサポートを提供する可能性があります。
First published Tuesday, 2025年5月6日












