Взгляд Anderson
В поисках ИИ, который может просмотреть весь фильм

Модели ИИ все еще теряют счёт, кто есть кто и что происходит в фильме. Новая система оркестрирует распознавание лиц и сценированное суммирование, сохраняя персонажей прямыми, и сюжет связным на протяжении всего фильма.
Получение искусственного интеллекта, чтобы смотреть и понимать фильмы в стиле Голливуда, может показаться нишевым или маргинальным занятием, но система, которая может просмотреть полнометражный фильм от начала до конца, отслеживать прогресс всех персонажей и оставаться на вершине сюжета, не только сделала возможным несколько прямых применений, которые могли бы извлечь выгоду из таких возможностей, но и несколько периферийных или несвязанных задач, в разных областях.
Легко доступные плоды для моделей ИИ, которые смотрят фильмы, – это системы рекомендаций, в платформах потокового вещания, таких как Netflix, Amazon Prime и HBO Max. Гранулярное понимание развития сюжета и действий персонажей позволяет сделать более точное совпадение с (часто спекулятивными) предпочтениями и энтузиазмом зрителей.
Кроме того, более глубокое понимание фильма позволяет генерировать ключевые слова и более точную категоризацию, а не распространять часто копируемые описания фильмов, которые могли быть написаны десятилетия назад. Такие идеи также могут выявить наличие “взрослых” тем в фильме, которые могут не быть очевидными из диалога или визуальных эффектов.
Дополнительно, старые фильмы в каталоге могут иметь устаревшие рейтинги, а также обзоры, например, язык и идиомы, которые были нормализованы в фильме 1950-х годов могут потребовать гораздо больше внимания сейчас. Но без общего понимания контекста, полученного из真正щего следования длинному нарративу фильма, такие инциденты могли быть переоценены или недооценены.
Более широко, улучшенные подходы к анализу фильмов могли бы внести большой вклад в более широкую проблему распознавания событий, которая необходима для инноваций в мониторинге безопасности, автоматических спортивных комментариях и сводках всех видов, во всех видах медиа.
Следовательно, “ИИ-основанное просмотр фильмов” – это удивительно хорошо подписанная тема в литературе по компьютерному зрению.
Видение большой картины
Последний участник называется MovieTeller – академическое/промышленное сотрудничество из Китая, которое делает новые успехи, разделяя различные подзадачи в задаче на различные приложения ИИ, которые подходят для этих задач, вместо того, чтобы, как часто бывает, пытаться обучить дискретные и инкапсулированные модели, которые могут выполнить все необходимые задачи из одного латентного пространства.
Авторы отмечают, что предыдущие модели Vision-Language (VLMs) с той же задачей не смогли продвинуться дальше анализа одного кадра; и что их отсутствие контекста делает трудным для таких моделей постоянно идентифицировать персонажей – возможно, наиболее важную характеристику такой системы:

Новая система, MovieTeller, может постоянно идентифицировать людей в сценах, благодаря использованию специальной системы распознавания лиц; но это более общая приверженность контексту позволяет рамке оставаться на вершине развития сюжета. Источник
Авторы заявляют:
‘Общие модели VLM часто испытывают трудности в распознавании и постоянном отслеживании конкретных персонажей на протяжении длинного нарратива. Они могут описать ключевого протагониста как “мужчину” в одной сцене и “человека” в другой, не связывая визуальное представление с последовательной идентичностью.’
Авторы отмечают, что поскольку механизм самообращения Transformers использует квадратичную сложность, обработка каждого кадра полнометражного фильма одновременно становится слишком вычислительно дорогой. Поэтому подходы, которые полагаются на униформированную выборку кадров или простую конкатенацию, склонны разбивать поток истории, производя фрагментированные сводки вместо связного нарратива.
Вместо этого новая система состоит из оркестрованного трубопровода без обучения, с посвященными инструментами для решения задач распознавания лиц и сохранения памяти (когда персонажи выходят и входят в нарратив фильма).
MovieTeller был протестирован против предыдущих подходов с помощью 60 полнометражных фильмов, эквивалентных 10 000 минутам кадров. В количественных тестах на удаление и исследованиях с участием человека авторы сообщают, что их подход смог значительно улучшиться по сравнению с дефолтными средами и предположениями, используемыми предыдущими системами.
Новая статья называется MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction, и исходит от пяти авторов из Университета Чжэцзяна в Ханчжоу, государственной группы China Media Group и Watch AI Group* (последние две базируются в Пекине).
Метод
Схема MovieTeller состоит из трех этапов: сегментация сцены и извлечение ключевых кадров, которые обрабатываются через проект PySceneDetect; Фактическое описание сцены через настройку модели Qwen2.5-VL-7B-Instruct VLM; и прогрессивная абстракция, которая конденсирует подробные описания сцены в главы и затем в связный синопсис – и это также выполняется моделью Qwen2.5:

Обзор рамки MovieTeller: полнометражный фильм сначала делится на сцены и конденсируется в высококачественные ключевые кадры; затем внешний инструмент распознавания лиц вводит фактические основания, связывая имена персонажей с ограничивающими коробками, которые направляют модель VLM в производстве идентичных описаний сцены. Эти описания затем прогрессивно абстрагируются в главы и интегрируются в связный окончательный синопсис фильма.
Первоначальный этап использует PySceneDetect, чтобы разбить фильм на отдельные сцены, на основе четких визуальных изменений, с каждой сценой, представленной одним ключевым кадром.
Однако не каждый кадр делает хорошую резюмирующую картинку, поскольку переходные моменты, затухания и темные кадры могут запутать последующий анализ. Поэтому простая проверка качества выполняет фильтрацию кандидатов на кадры, измеряя яркость и визуальную вариацию, гарантируя, что только информационно богатые изображения выбираются для описания.
Размещение лица
База данных лиц была построена из общедоступной информации о составе, хранящей имя каждого основного персонажа вместе с численным вложением лица вложения. Когда лицо появляется в ключевом кадре, его вложение сопоставляется с базой данных, и ближайший результат принимается, если он проходит пороговое значение доверия. Это создает “фактические основания”, связывающие имена с конкретными ограничивающими коробками.
Для этих целей используется InsightFace, использующий голову распознавания на основе функции потери ArcFace:

Две знакомые лица хорошо запомнены инициативой Additive Angular Margin Loss (ArcFace), используемой очень похожим образом для проекта MovieTeller. Источник
Помеченные ключевые кадры затем передаются модели Qwen с подсказкой, которая перечисляет обнаруженные персонажей и их позиции.:
Поскольку модели VLM не могут поглотить весь полнометражный фильм за один проход, MovieTeller сначала разбивает материал на описания сцены. Эти описания группируются в последовательные, главоподобные блоки, которые затем передаются модели Qwen2.5, которая суммирует каждую главу, сжимая развитие сюжета, мотивацию персонажей и поворотные моменты, сохраняя при этом ранее проверенные имена персонажей.
Эти сжатые главы затем соединяются и возвращаются к модели с новой подсказкой, которая запрашивает полный синопсис:

Похожий на подсказку, которая запрашивает полный синопсис, этот пример используется для генерации описаний сцены, явно вводящей проверенные имена персонажей и ограничивающие коробки для ограничения модели VLM и обеспечения идентичной нарративной последовательности.
Предполагая, что процесс был успешным, окончательный вывод должен связно отражать нарративную дугу фильма. Это особенно трудная задача в машинном обучении, поскольку разнообразие возможных сводок сюжета и стиля, в котором они могут быть представлены, вместе с необходимой длиной этих данных, делает практически невозможным принятие обычных подходов, основанных на истинных данных.
Данные и тесты
Для тестирования системы авторы создали специальный (и неатрибутированный) набор данных из 100 полнометражных фильмов, эквивалентных примерно 166 часам воспроизведения. В фильмы входили Железный человек 3, Прощай, моя конкубина, Ешь, пей, мужчина, женщина и Хроники Нарнии. Исследователи требовали, чтобы все включенные фильмы имели рейтинг выше 5,0 на IMDB:

Состав набора данных по 100 фильмам, показывающий сбалансированное временное покрытие с 1992 по 2025 год, небольшое большинство неанглийских названий и широкое распространение жанров, возглавляемое драмой и действием, с представительством в научной фантастике, ужасах, комедии, романтике и истории.
Широкий спектр жанров (см. график выше) был разработан для предотвращения предвзятости в пользу одного жанра.
Набор данных лиц для каждого фильма состоял из двух фотографий основных актеров – одной из кадра фильма и одной из связанной фотографии.
Реализованный на Python, тесты были запущены на четырех GPU NVIDIA A40, каждая с 48 ГБ видеопамяти, и с упомянутой моделью Qwen2.5 в качестве центральной VLM. Также были проведены тесты на удалени円 с использованием альтернативных моделей последнего поколения InternVL3-8B и WeThink-Qwen2.5VL-7B.
Новая рамка была протестирована против двух вариантов удаления††: Без подсказки базовый вариант, в котором модель VLM генерирует описания сцены только из ключевого кадра, без каких-либо текстовых подсказок об идентичности персонажей; и Подсказка только с именем настройка, в которой модели даны обнаруженные имена персонажей, но не их ограничивающие коробки, позволяя авторам выделить конкретный вклад пространственной привязки к последовательности идентичности и связности нарратива
Что касается метрик, учитывая вышеупомянутую трудность применения подходов, основанных на истинных данных, к длинным сводкам сюжета, стандартные метрики перекрытия n-грамм, такие как ROUGE и BLEU, были заменены на BERTScore с балльной оценкой F1, для измерения семантического сходства с эталонным синопсисом, взятом из ‘общедоступной энциклопедии’.
Кроме того, Gemini 2.5 Flash был использован для оценки каждого синопсиса по фактической верности; последовательности идентичности и полноте; связности и потоку нарратива; и ластичности, с оценками, усредненными по измерениям.
Наконец, оценка человека 50 случайно выбранных сводок была проведена с помощью парной сравнительной оценки, обеспечивая практическую проверку автоматических оценок.
Ниже мы видим результаты BERTScore (F1) для трех базовых моделей: Qwen2.5-VL, InternVL3 и WeThink. Каждая из них тестируется в трех конфигурациях: Без подсказки, Подсказка только с именем и полная система MovieTeller:

Сравнение BERTScore (F1) по трем базовым моделям VLM и трем экспериментальным настройкам, показывающее последовательные выигрыши от добавления имен персонажей и дальнейшие улучшения при включении пространственной привязки, с MovieTeller, достигающим最高 оценок во всех случаях.
Авторы отмечают, что закономерность последовательна во всех трех базовых моделях: использование только сырого ключевого кадра дает наименьшую производительность; добавление имен персонажей производит скромное улучшение; и объединение имен с ограничивающими коробками дает наилучшие результаты. Хотя выигрыши являются инкрементальными, а не драматическими, полностью привязанная конфигурация достигает наилучшего семантического соответствия с эталонным синопсисом во всех настройках.
Что касается оценки качества нарратива на основе LLM: как мы видим в результатах ниже, Без подсказки базовый вариант больше всего испытывает трудности с последовательностью идентичности, что снижает его общую оценку; но предоставление только имен производит заметный подъем, особенно на измерениях, связанных с идентичностью. Однако полная конфигурация MovieTeller снова занимает высшее место во всех трех базовых моделях:

Оценка LLM-as-a-Judge (1–5 шкала) по трем базовым моделям, показывающая, что добавление имен персонажей улучшает последовательность идентичности и общее качество, в то время как полная рамка MovieTeller достигает наилучших оценок по фактической верности, связности, лаконичности и окончательной оценке.
Наилучшие выигрыши появляются в последовательности идентичности и в окончательной усредненной оценке, что предполагает, что пространственная привязка помогает модели оставаться ясной о том, кто делает что, когда сюжет развивается.
В оценке человека 50 случайно выбранных сводок участники были показаны три сводки одновременно и попросили выбрать лучшую:
<img class=" wp-image-287300" src="https://www.unite.ai/wp-content/uploads/2026/02/table-3-3.jpg" alt="Оценки предпочтения человека в трехсторонней принудительной сравнительной оценке, показывающие, что полностью привязанные сводки MovieTeller выбраны чаще всего во всех трех базовых моделях, значительно превосходя как Без подсказки, так и Подсказка только с именем варианты.” width=”618″ height=”131″ /> Оценки предпочтения человека в трехсторонней принудительной сравнительной оценке, показывающие, что полностью привязанные сводки MovieTeller выбраны чаще всего во всех трех базовых моделях, значительно превосходя как Без подсказки, так и Подсказка только с именем варианты.
Наконец, был проведен качественный тест на фильме Пуля исчезает (2012):

Мы не можем воспроизвести всю эту фигуру из исходной статьи, поскольку она очень высока и тексто-насыщена. Пожалуйста, обратитесь к исходной статье вместо этого.
Здесь Без подсказки базовый вариант производит расплывчатый синопсис, который ссылается на персонажей в общих терминах и размывает их роли, что делает более трудным для понимания цепочки событий. Предоставление только имен улучшает поверхностное воспоминание, но нарратив все еще дрейфует, с отношениями персонажей и мотивациями, описанными в довольно ‘плоском’ виде.
Напротив, полностью привязанная версия MovieTeller сохраняет идентичности стабильными на протяжении всего синопсиса и связывает действия с правильными персонажами, позволяя расследованию сюжета развиваться с более четкой причинно-следственной структурой. Конкретные напряжения и динамика ролей сохраняются, а не абстрагируются, в результате чего сводка, которая читается не как оторванная сводка, а как связное пересказание центральной дуги фильма:

Часть окончательного сравнения, которое мы не можем полностью воспроизвести здесь, показывающее удаленную и полную сводку MovieTeller. Пожалуйста, обратитесь к исходной статье вместо этого.
Вывод
Хотя большинство новых проектов такого рода оказываются в литературе по компьютерному зрению, генерация сводок фильмов на основе ИИ охватывает многие другие дисциплины и области машинного обучения – и трудно сказать, какая из них непреднамеренно внесет вклад в решение проблемы; хотя MovieTeller делает шаг в правильном направлении, разделяя задачи на подходящие модули, вместо того, чтобы пытаться решить все в латентном пространстве, он сохраняет ‘сшитый’ характер, который, как правило, предшествует более элегантному решению.
* Я не могу идентифицировать эту организацию, даже после некоторых поисков.
† Один мог бы предположить что-то вроде IMDB или OMDB, но источник не указан.
†† Пожалуйста, обратитесь к исходной статье для всестороннего удаления, поскольку мы охватываем только полное удаление в исключительных случаях. Я отмечу, что необработанные исследования удаления, упомянутые здесь, не подрывают общих выводов статьи. Опубликовано впервые в пятницу, 27 февраля 2026 года.












