Anderson의 관점
AI가 전체 영화를 따라갈 수 있는 기술 개발

AI 모델은 여전히 영화의 등장인물과 줄거리를 이해하는 데 어려움을 겪고 있습니다. 새로운 시스템은 얼굴 인식과 줄거리 요약을 조직하여 등장인물의 일관성을 유지하고 영화의 줄거리를 이해할 수 있습니다.
인공 지능이 할리우드 스타일의 영화를 시청하고 이해하는 것은 마치 지엽적인 목표처럼 보일 수 있지만, 전체 영화를 시청하고 등장인물의 진행을 추적하며 줄거리를 이해할 수 있는 시스템은 다양한 도메인에서 여러 가지 직접적인 응용 프로그램과 주변 도전을 가능하게 합니다.
영화 시청 AI 모델의 저항점은 추천 시스템입니다. 이는 넷플릭스, 아마존 프라임, HBO 맥스와 같은 스트리밍 플랫폼에서 사용됩니다. 줄거리와 등장인물의 행동을 세세하게 이해하면 시청자의 취향과 열정을 더 잘 일치시킬 수 있습니다.
또한, 영화의 더 깊은 이해는 키워드 생성과 더 정확한 분류를 가능하게 합니다. 이는 영화 설명이 десяти년 전으로부터 작성된 경우가 많기 때문에 영화의 내용을 더 잘 이해할 수 있습니다. 이러한 정보는 또한 영화의 성인 주제를 더 잘 이해할 수 있습니다.
또한, 카탈로그의 오래된 영화는 구식 등급과 개요를 가지고 있을 수 있습니다. 예를 들어, 1950년대의 영화에서는 현재 더 주의해야 할 언어와 성어를 사용할 수 있습니다. 그러나 이러한 경우를 과대평가하거나 과소평가할 수 있습니다.
보다 넓은 의미에서, 영화 분석 접근법의 개선은 이벤트 인식과 같은 문제에 크게 기여할 수 있습니다. 이는 보안 모니터링, 자동 스포츠 해설, 및 다양한 미디어의 요약에 필요합니다.
따라서, ‘AI 기반 영화 시청’은 컴퓨터 비전 문헌에서_surprisingly 잘 구독된 장르입니다.
전체를 보는 것
最新의 참가자는 MovieTeller입니다. 중국의 학술/산업 협력으로, 다양한 AI 응용 프로그램을 사용하여 영화의 다양한 하위 작업을 처리합니다.
이전의 Vision-Language Models (VLMs)는 단일 프레임 분석을 넘어서 발전하지 못했습니다. 이러한 모델은 등장인물의 일관성을 유지하는 데 어려움을 겪었습니다.

새로운 시스템, MovieTeller,는 전용 얼굴 인식 시스템을 사용하여 장면에서 사람을 일관되게 식별할 수 있습니다. 그러나 이러한 프레임워크는 맥락에 대한 더 큰 헌신으로 인해 줄거리를 이해할 수 있습니다. 소스
저자들은 다음과 같이 말합니다.
‘일반적인 VLMs는 긴 나레이티브에서 특정 등장인물을 일관되게 인식하고 추적하는 데 어려움을 겪습니다. 한 장면에서 주인공을 “남자”라고 설명하고 다른 장면에서 “사람”이라고 설명할 수 있습니다. 시각적 표현과 일관된 정체성을 결합하지 못합니다.’
저자들은 Transformer의 자기 주의 메커니즘이 사각형 복잡성을 사용하기 때문에 전체 영화의 모든 프레임을 한 번에 처리하는 것이 계산적으로 비용이 많이 든다고 말합니다. 따라서 균일한 프레임 샘플링 또는 단순한 연결에 의존하는 접근 방식은 이야기의 흐름을 분열시키고 조각난 요약을 생성합니다.
대신, 새로운 시스템은 훈련이 없는 파이프라인으로 구성되며, 얼굴 인식과 기억의 지속성을 처리하기 위한 전용 도구가 있습니다.
MovieTeller는 60개의 전체 영화로 테스트되었으며, 이는 약 10,000분의 영상입니다. 양적 절단 테스트와 인간 연구에서, 저자들은 접근 방식이 이전 시스템의 기본 환경과 가정에서 크게 개선되었다고 보고합니다.
새로운 논문은 MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction입니다. 이는 중국의 浙江大学, 중국 미디어 그룹, 그리고 베이징의 Watch AI Group*에서 나온 5명의 저자에 의해 작성되었습니다.
방법
MovieTeller 스키마는 세 단계로 구성됩니다: 장면 분할과 키프레임 추출, 사실 기반 장면 설명 생성, 그리고 진행적 추상화입니다.
초기 단계에서는 PySceneDetect를 사용하여 영화를离散한 장면으로 분할하고, 각 장면을 대표하는 단일 키프레임을 추출합니다.
그러나 모든 프레임이 요약 이미지를 생성하는 데 적합하지 않습니다. 전환 순간, 페이드 아웃, 및 어두운 프레임은 이후 분석을 혼란스럽게 할 수 있습니다. 따라서 단순한 품질 검사로 후보 프레임을 필터링하여 밝기와 시각적 변화를 측정하고, 정보가 풍부한 이미지만을 선택하여 설명합니다.
얼굴을 위치시키는 것
顔を 데이터베이스를 구축하여 주요 등장인물의 이름과 함께 숫자 얼굴 임베딩을 저장했습니다. 얼굴이 키프레임에 나타날 때, 임베딩을 데이터베이스와 일치시키고, 가장 가까운 결과를 수락합니다. 이는 ‘사실 기반’을 생성하여 이름을 특정 바운딩 박스에 연결합니다.
이 목적으로 InsightFace를 사용하여 ArcFace 손실 기반 인식 헤드를 사용합니다:

Additive Angular Margin Loss (ArcFace) 이니셔티브에서 잘 기억된 두 가지 친숙한 얼굴, MovieTeller 프로젝트에서 유사한 방식으로 사용됩니다. 소스
주석이 달린 키프레임은 Qwen 모델에 전달되며, 감지된 등장인물과 위치를 나열하는 프롬프트가 포함됩니다.
비전 언어 모델은 전체 영화를 한 번에 흡수할 수 없기 때문에, MovieTeller는 초기에 장면 설명을 생성합니다. 이러한 설명은 연속적인, 장별 블록으로 그룹화되며, 이후 Qwen2.5에 의해 요약됩니다.
요약된 장별 요약은 연결되어 모델에 새로운 프롬프트와 함께 반환됩니다.

장면 설명 생성을 위한 샘플 프롬프트 템플릿, 확인된 등장인물 이름과 바운딩 박스를 명시적으로 주입하여 비전 언어 모델을 제약하고 일관된 내레이션을 적용합니다.
가정해 보면, 과정은 성공적으로 완료되어 영화의 내레이티브 아크를 반영하는 일관된 출력을 생성해야 합니다.
데이터와 테스트
시스템을 테스트하기 위해, 저자들은 100개의 전체 영화로 구성된 데이터셋을 구축했습니다. 이는 약 166시간의 런타임에 해당합니다. 영화에는 아이언맨 3, さらば、わが愛, 飲食男女, 및 나니아 연대기가 포함됩니다. 연구자들은 포함된 모든 영화가 IMDB에서 5.0 이상의 등급을 받았는지 확인했습니다.

100개의 영화로 구성된 데이터셋, 1992년부터 2025년까지 균형있는 시간적 범위, 비영어 영화의 약간 높은 비율, 및 드라마와 액션을 주도하는 장르 분포를 보여줌
저자들은 또한 InternVL3-8B 및 WeThink-Qwen2.5VL-7B와 같은 다른 최첨단 모델을 사용하여 절단 연구를 수행했습니다.
새로운 프레임워크는 두 가지 절단 변형과 비교되었습니다: No-Hint 기준선, 비전 언어 모델이 키프레임만으로 장면 설명을 생성하는 경우; 및 Name-Only Hint 설정, 모델이 감지된 등장인물 이름을 받지만 바운딩 박스를 받지 못하는 경우입니다.
저자들은 다음과 같이 말합니다.
저자들은 다음과 같이 말합니다.
저자들은 다음과 같이 말합니다.
결론
새로운 시스템은 전체 영화를 따라갈 수 있는 AI 기술을 개발하는 데 중요한 단계입니다. 그러나 이러한 시스템은 여전히 많은 도전을 겪고 있으며, 향후의 연구가 필요합니다.
* 저자는 이 기관을 식별할 수 없습니다.
† IMDB 또는 OMDB와 같은 소스를 가정할 수 있지만, 소스는 지정되지 않았습니다.
†† 원본 논문에서 자세한 절단 연구를 참조하십시오. 저자들은 전체 절단을 다루는 경우에만 이를 다룹니다. 처리되지 않은 절단 연구는 논문의 일반적인 발견을 훼손하지 않는다고 주장합니다.
최초로 게시된 날: 2026년 2월 27일












