Anderson의 관점

AI를 사용하여 블록버스터 영화 예측하기

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o and Adobe Firefly

영화와 텔레비전은 종종 창의적이고 개방적인 산업으로 간주되지만, 오랜 시간 동안 위험을 회피하는 경향이 있습니다. 높은 제작 비용(미국 프로젝트의 경우海外 촬영의 저렴한 장점을 곧 잃을 수 있음)과 분산된 제작 환경으로 인해 독립 회사들이 큰 손실을 흡수하기 어렵습니다.

따라서 지난 10년 동안 산업은 기계 학습이 제안된 영화와 텔레비전 프로젝트에 대한 관객의 반응에서 추세 또는 패턴을 감지할 수 있는지에 대한 관심이 증가했습니다.

주된 데이터 소스는 니尔슨 시스템(규모는 제공하지만 텔레비전과 광고의 뿌리에서 비롯됨)과 포커스 그룹과 같은 샘플 기반 방법으로, 이는 규모를 위해 큐레이션된 인구 통계를 교환합니다. 후자의 범주에는 무료 영화 미리 보기에서 나온 점수 카드 피드백도 포함되지만, 그 시점에서 대부분의 제작 예산은 이미 지출되었습니다.

빅 히트 이론

초기에는 ML 시스템이 선형 회귀, K-최근접 이웃, 확률적 경사 하강, 의사 결정 트리 및 포레스트, 신경망과 같은 전통적인 분석 방법을 활용했습니다. 이는 대부분 기계 학습 이전의 통계 분석과 유사한 스타일로, 2019년 센트럴 플로리다 대학의 성공적인 TV 쇼 예측을 위한 이니셔티브와 같이 다양한 조합으로 사용되었습니다.

2018년 연구에서는 캐릭터 및/또는 작가의 조합에 따라 에피소드의 성과를 평가했습니다(대부분의 에피소드는 한 명 이상의 작가가 작성했습니다). 출처: https://arxiv.org/pdf/1910.12589

2018년 연구에서는 캐릭터 및/또는 작가의 조합에 따라 에피소드의 성과를 평가했습니다(대부분의 에피소드는 한 명 이상의 작가가 작성했습니다). 출처: https://arxiv.org/pdf/1910.12589

가장 관련된 관련 연구는, 적어도 야생에서 배포된 것은, 추천 시스템 분야에 있습니다.

일반적인 비디오 추천 파이프라인. 카탈로그의 비디오는 수동으로 주석이 달린 기능 또는 자동으로 추출된 기능을 사용하여 색인이 생성됩니다. 추천은 두 단계에서 생성됩니다. 먼저 후보 비디오를 선택한 다음 사용자 프로필에서 추론한 시청 선호도에 따라 순위를 매깁니다. 출처: https://www.frontiersin.org/journals/big-data/articles/10.3389/fdata.2023.1281614/full

일반적인 비디오 추천 파이프라인. 카탈로그의 비디오는 수동으로 주석이 달린 기능 또는 자동으로 추출된 기능을 사용하여 색인이 생성됩니다. 추천은 두 단계에서 생성됩니다. 먼저 후보 비디오를 선택한 다음 사용자 프로필에서 추론한 시청 선호도에 따라 순위를 매깁니다. 출처: https://www.frontiersin.org/journals/big-data/articles/10.3389/fdata.2023.1281614/full

그러나 이러한 접근 방식은 이미 성공한 프로젝트를 분석합니다. 새로운 쇼 또는 영화의 경우 적용할 수 있는 가장 적합한 기준 진실은 명확하지 않습니다. 공중의 기호에 대한 변화와 함께 데이터 소스의 개선 및 보강으로 인해 일반적으로 일관된 데이터가 수십 년 동안 사용할 수 없습니다.

이것은 콜드 스타트 문제의 한 예입니다. 여기서 추천 시스템은 이전 상호 작용 데이터 없이 후보를 평가해야 합니다. 이러한 경우 전통적인 협력 필터링이 손상됩니다. 협력 필터링은 사용자 행동의 패턴(예: 시청, 평가 또는 공유)을 사용하여 예측을 생성합니다. 문제는 대부분의 새로운 영화 또는 쇼의 경우 이러한 방법을 지원할 수 있는 충분한 관객 피드백이 아직 없다는 것입니다.

콤캐스트 예측

콤캐스트 기술 AI와 조지 워싱턴 대학의 새로운 논문은 미발표 영화에 대한 구조화된 메타데이터를 프롬프트하는 언어 모델을 사용하여 이 문제를 해결하는 솔루션을 제안합니다.

입력에는 캐스트, 장르, 시놉시스, 콘텐츠 등급, 분위기 및 수상 등이 포함됩니다. 모델은 출시될 가능성이 높은 영화의 순위가 지정된 목록을 반환합니다.

저자는 모델의 출력을 사용하여 관객의 관심도를 나타내는 대리자로 사용합니다. 이는 아직 상호 작용 데이터가 없을 때입니다. 이미 잘 알려진 제목에 대한 초기 편향을 피하기 위해 제목에 대한 관심을 나타내는 것을 목표로 합니다.

非常히 짧은(세 페이지) 논문LLM을 사용한 미래의 히트 영화 예측이라는 제목으로, 콤캐스트 기술 AI의 6명의 연구자와 GWU의 1명이 저술했으며, 다음과 같이 말합니다:

‘우리의 결과는 LLM이 영화 메타데이터를 사용할 때 기준선보다 훨씬 더 잘 수행될 수 있음을 보여줍니다. 이 접근 방식은 여러 사용 사례에 대한 보조 시스템으로 작용할 수 있으며, 일일 및 주간으로 출시되는大量의 새로운 콘텐츠에 대한 자동 점수를 가능하게 합니다. ‘

‘편집 팀이나 알고리즘이 충분한 상호 작용 데이터를 축적하기 전에 초기 통찰력을 제공함으로써, LLM은 콘텐츠 검토 프로세스를 간소화할 수 있습니다. ‘

‘LLM의 효율성과 추천 에이전트의 상승으로 인해, 이 연구의 통찰력은 다양한 도메인에 적응할 수 있습니다.’

이 접근 방식이 강건하다면, 이는 산업이 후향적 지표와 강력하게 홍보된 제목에 대한 의존도를 줄이는 방법으로, 출시 이전에 유망한 콘텐츠를 식별하는 확장 가능한 방법을 도입할 수 있습니다. 따라서 사용자 행동이 수요를 신호하는 것을 기다리는 대신, 편집 팀은 메타데이터에 의해 구동되는 관객 관심에 대한 초기 예측을 받을 수 있습니다. 이는 새로운 릴리스의 더 넓은 범위에 걸쳐 노출을 재분배할 수 있습니다.

방법 및 데이터

저자는 4단계 워크플로우를 설명합니다. 전용 데이터셋의 구축, 비교를 위한 기준 모델의 설정, 자연어 추론 및 임베딩 기반 예측을 사용하는 적절한 LLM의 평가, 생성 모드에서 출력의 최적화입니다. 이는 메타의 Llama 3.13.3 언어 모델을 사용하여 프롬프트 엔지니어링을 통해 수행됩니다.

저자들은 공개적으로 사용 가능한 데이터셋이 직접 가설을 테스트하는 방법을 제공하지 않는다고 말합니다. 대부분의 기존 컬렉션은 LLM 이전 시대이며, 자세한 메타데이터가 부족합니다. 따라서 저자들은 콤캐스트 엔터테인먼트 플랫폼에서 벤치마크 데이터셋을 구축했습니다. 이 플랫폼은 직접 및 제3자 인터페이스를 통해 수천만 명의 사용자를 지원합니다.

데이터셋은 새로 출시된 영화를 추적하며, 나중에 인기 있는지 여부를 확인합니다. 인기 度는 사용자 상호 작용을 통해 정의됩니다.

수집은 영화에 초점을 맞추고 있으며, 저자들은 다음과 같이 말합니다:

‘우리는 영화에 초점을 맞췄습니다. 영화는 TV 시리즈보다 외부 지식의 영향을 덜 받기 때문에, 실험의 신뢰성을 높입니다.’

레이블은 다양한 시간 창과 목록 크기에 걸쳐 제목이 인기 있는 시간을 분석하여 할당됩니다. LLM은 장르, 시놉시스, 등급, 시대, 캐스트, 스태프, 분위기, 수상, 캐릭터 유형과 같은 메타데이터 필드로 프롬프트됩니다.

비교를 위해 저자들은 두 가지 기준선을 사용했습니다. 무작위 순서 지정 및 인기 임베딩(PE) 모델(稍後 설명합니다).

프로젝트는 순위 지정 방법으로 대규모 언어 모델을 사용하여 순위가 지정된 영화 목록과 예측 인기 점수를 생성했습니다. 이러한 출력은 메타데이터를 사용하여 모델의 예측을 안내하는 프롬프트 엔지니어링 전략에 의해 형성되었습니다.

프롬프트 전략은 모델을 ‘편집 보조’로 프레임화했으며, 구조화된 메타데이터만을 사용하여 출시될 가능성이 가장 높은 영화를 식별하도록 할당했습니다. 그런 다음 모델은 새 항목을 도입하지 않고 고정된 제목 목록을 재정렬하도록 요청받았으며, JSON 형식으로 출력했습니다.

각 응답은 순위가 지정된 목록, 할당된 인기 점수, 순위에 대한 정당성 및 결과에 영향을 미친 이전 예를 참조했습니다. 이러한 여러 수준의 메타데이터는 모델의 맥락적 이해와 관객 추세를 예측하는 능력을 개선하기 위해 설계되었습니다.

테스트

실험은 두 단계로 진행되었습니다. 처음에는 저자들은 무작위 순서 지정 접근 방식보다 더 잘 수행되는 모델 버전을 식별하기 위해 여러 모델 변형을 테스트했습니다.

두 번째로, 저자들은 생성 모드에서 대규모 언어 모델을 테스트했습니다. 강한 기준선과 비교하여 출력을 비교했습니다. 이는 임의의 순위 지정이 아닌 모델의 출력을 비교하는 것이므로, 작업의 난이도를 높였습니다.

이것은 모델이 이미 일부 예측 능력을 보여주는 시스템과 경쟁해야 함을 의미합니다. 따라서 저자들은 평가가 실제 상황을 더 잘 반영한다고 주장합니다. 여기서 편집 팀과 추천 시스템은 모델과 기회 사이에서 선택하는 것이 아니라, 다양한 예측 능력 수준을 갖는 경쟁 시스템 사이에서 선택합니다.

무지의优势

이 설정의 핵심 제약 조건은 모델의 지식 컷오프와 영화의 실제 출시 날짜 사이의 시간 간격입니다. 언어 모델은 영화가 출시되기 6~12개월 전에 종료된 데이터로 훈련되었으므로, 모델은 출시 이후 정보에 접근할 수 없었습니다. 이는 예측이 메타데이터만을 기반으로 하며, 관객의 반응에 기반한 것은 아니라는 것을 보장했습니다.

기준선 평가

기준선을 구성하기 위해 저자들은 세 가지 임베딩 모델을 사용하여 영화 메타데이터의 의미적 표현을 생성했습니다. BERT V4; Linq-Embed-Mistral 7B; 및 Llama 3.3 70B, 실험 환경의 제약을 충족하기 위해 8비트 정밀도로 양자화되었습니다.

Linq-Embed-Mistral은 MTEB(大量 텍스트 임베딩 벤치마크) 리더보드에서 1위를 차지했기 때문에 포함되었습니다.

각 모델은 후보 영화의 벡터 임베딩을 생성했으며, 이는 각 영화 출시 이전 주에 가장 인기 있는 상위 100개 제목의 평균 임베딩과 비교되었습니다.

인기 度는 이러한 임베딩 사이의 코사인 유사도를 사용하여 추론되었습니다. 더 높은 유사도 점수는 더 높은 예측 인기 度를 나타냅니다. 각 모델의 순위 정확도는 무작위 순서 지정 기준선에 대한 성능을 측정하여 평가되었습니다.

인기 임베딩 모델이 무작위 기준선에 비해 성능을 개선한 결과. 각 모델은 4개의 메타데이터 구성으로 테스트되었습니다. V1은 장르만 포함합니다. V2는 시놉시스만 포함합니다. V3은 장르, 시놉시스, 콘텐츠 등급, 캐릭터 유형, 분위기 및 출시 시대를 결합합니다. V4는 V3 구성에 캐스트, 스태프 및 수상 등을 추가합니다. 결과는 더 풍부한 메타데이터 입력이 순위 정확성에 미치는 영향을 보여줍니다.

인기 임베딩 모델이 무작위 기준선에 비해 성능을 개선한 결과. 각 모델은 4개의 메타데이터 구성으로 테스트되었습니다. V1은 장르만 포함합니다. V2는 시놉시스만 포함합니다. V3은 장르, 시놉시스, 콘텐츠 등급, 캐릭터 유형, 분위기 및 출시 시대를 결합합니다. V4는 V3 구성에 캐스트, 스태프 및 수상 등을 추가합니다. 결과는 더 풍부한 메타데이터 입력이 순위 정확성에 미치는 영향을 보여줍니다. 출처: https://arxiv.org/pdf/2505.02693

결과(위에 표시됨)는 BERT V4와 Linq-Embed-Mistral 7B가 상위 3개 가장 인기 있는 제목을 식별하는 데 가장 큰 개선을 보여주었지만, 가장 인기 있는 항목을 예측하는 데 약간 부족했다는 것을 보여줍니다.

BERT는 효율성과 전체적인 이익이 제한을 초과했기 때문에, 이후 LLM과 비교하기 위한 기준 모델로 선택되었습니다.

LLM 평가

연구자들은 순위 지정 접근 방식인 쌍별 및 목록별 두 가지 방법으로 성능을 평가했습니다. 쌍별 순위 지정은 모델이 한 항목을 다른 항목보다 올바르게 순서를 지정하는지 여부를 평가합니다. 목록별 순위 지정은 후보 항목의 전체 순서가 지정된 목록의 정확성을 고려합니다.

이 조합을 사용하면 개별 영화 쌍이 올바르게 순서가 지정되는지(로컬 정확도)뿐만 아니라 전체 후보 목록이 실제 인기 순서를 얼마나 잘 반영하는지(글로벌 정확도)도 평가할 수 있었습니다.

전체, 비양자화 모델은 성능 손실을 방지하기 위해 사용되었습니다. 이는 LLM 기반 예측과 임베딩 기반 기준선 사이에서 일관된 비교를 보장했습니다.

메트릭

언어 모델이 영화 인기 度를 얼마나 잘 예측하는지 평가하기 위해 순위 지정 및 분류 기반 메트릭이 모두 사용되었습니다. 특히 상위 3개 가장 인기 있는 제목을 식별하는 데 주목했습니다.

네 가지 메트릭이 적용되었습니다. 정확도@1는 가장 인기 있는 항목이 첫 번째 위치에 나타나는 빈도를 측정했습니다. 역순위는 예측된 목록에서 상위 항목의 순위를 역수 취하여 측정했습니다. 정규화된 할인 누적 이득(NDCG@k)은 순위와 실제 인기 度 사이의 일치를 평가했습니다. 더 높은 점수가 더 나은 정렬을 나타냅니다. Recall@3은 실제로 인기 있는 제목 중에서 모델의 상위 3개 예측에 나타난 비율을 측정했습니다.

사용자 상호 작용의 대부분은 순위가 지정된 메뉴의 상단 근처에서 발생하므로, 평가에서는 실제 사용 사례를 반영하기 위해 k의 더 낮은 값을 중점적으로 다루었습니다.

대규모 언어 모델이 BERT V4에 비해 순위 메트릭에서 평균 퍼센트 개선입니다. 결과는 모델-프롬프트 조합당 10회 실행으로 평균화되며, 상위 두 값이 강조 표시됩니다. 보고된 수치는 모든 메트릭에서 평균 퍼센트 개선을 반영합니다.

대규모 언어 모델이 BERT V4에 비해 순위 메트릭에서 평균 퍼센트 개선입니다. 결과는 모델-프롬프트 조합당 10회 실행으로 평균화되며, 상위 두 값이 강조 표시됩니다. 보고된 수치는 모든 메트릭에서 평균 퍼센트 개선을 반영합니다.

Llama 모델 3.1(8B), 3.1(405B), 3.3(70B)의 성능은 BERT V4 기준선에 대한 메트릭 개선을 측정하여 평가되었습니다. 각 모델은 정보가 풍부한 프롬프트를 포함하여 일련의 프롬프트로 테스트되었습니다. 이를 통해 입력 세부 정보가 예측 품질에 미치는 영향을 조사했습니다.

저자는 다음과 같이 말합니다:

‘가장 좋은 성능은 Llama 3.1(405B)와 가장 정보가 풍부한 프롬프트를 사용하여 달성되며, 그 다음은 Llama 3.3(70B)입니다. 관찰된 경향에 따라, 복잡하고 길이가 긴 프롬프트(MD V4)를 사용하는 경우, 일반적으로 더 복잡한 언어 모델은 다양한 메트릭에서 성능을 개선합니다. 그러나 추가된 정보의 유형에 민감합니다.’

성능은 캐스트 수상이 프롬프트의 일부로 포함될 때 개선되었습니다. 이 경우 상위 5명의 배우가 받은 주요 수상 등이 포함되었습니다. 이러한 더 풍부한 메타데이터는 더 자세한 프롬프트 구성의 일부였으며, 캐스트 인식이 제외된 더 단순한 버전을 능가했습니다. 이익은 가장 큰 모델인 Llama 3.1(405B)와 3.3(70B)에서 가장 두드러졌으며, 둘 다 이러한 추가적인 명성 및 관객 인식 신호를 받았을 때 더 강력한 예측 정확성을 보여주었습니다.

반면에, 가장 작은 모델인 Llama 3.1(8B)은 프롬프트가 약간 더 자세해질 때 성능이 개선되었지만, 더 많은 필드를 추가할 때 성능이 저하되었습니다. 이는 모델이 복잡한 프롬프트를 효과적으로 통합할 수 있는 능력이 부족하여, 더 약한 일반화로 이어졌습니다.

프롬프트가 장르만으로 제한될 때, 모든 모델은 기준선에 비해 성능이 저하되었습니다. 이는 제한된 메타데이터가 의미 있는 예측을 지원하기에 충분하지 않음을 보여주었습니다.

결론

LLM은 생성형 AI의 대표적인 예입니다. 이는 다른 방법이 더 적합한 분야에서 이러한 모델을 사용하려고 하는 이유일 수 있습니다. 그러나 여전히 이러한 모델이 다양한 산업에서 무엇을 할 수 있는지에 대해 많은 것을 모릅니다. 따라서 이러한 모델을 시도해 보는 것이 합리적입니다.

이 경우, 주식 시장 및 날씨 예측과 마찬가지로, 역사적 데이터가 미래 예측의 기초로 사용될 수 있는 범위는 제한적입니다. 영화 및 텔레비전의 경우, 배달 방법은 현재 이동하는 목표입니다. 이는 1978-2011년 사이에 케이블, 위성 및 휴대용 미디어(VHS, DVD 등)가 일련의 과도기적이거나 발전하는 역사적 혼란을 나타낸 것과는 대조됩니다.

또한, 어떤 예측 방법도 다른 제작의 성공 또는 실패가 제안된 속성의 타당성을 어떻게 影響하는지에 대한 범위는 설명할 수 없습니다. 그러나, 이는 종종 영화 및 텔레비전 산업에서 추세를 따르는 것을 좋아하기 때문에, 이러한 경우입니다.

그러나, 신중하게 사용된다면, LLM은 콜드 스타트 단계에서 추천 시스템을 강화하는 데 도움이 될 수 있습니다. 이는 다양한 예측 방법에서 유용한 지원을 제공할 수 있습니다.

 

2025년 5월 6일 처음 게시됨

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai