Взгляд Anderson
Использование ИИ для суммирования длинных видеоуроков

Если вы тот, кто увеличивает скорость видеоурока на YouTube, чтобы добраться до информации, которую вы действительно хотите; консультируетесь с транскриптом видео, чтобы получить основную информацию, скрытую в длинных и часто спонсируемых временных интервалах; или надеетесь, что WikiHow создаст менее затратное по времени версию информации в учебном видео; то новый проект из UC Berkeley, Google Research и Brown University может быть интересен вам.
Названный TL;DW? Суммирование учебных видео с помощью задачной актуальности и межмодальной выделяемости, новая статья описывает создание системы суммирования видео с помощью ИИ, которая может выявить соответствующие шаги из видео и отбросить все остальное, в результате чего получаются краткие суммирования, которые быстро доходят до сути.

Использование WikiHow существующих длинных видеоклипов для текстовой и видеоинформации используется проектом IV-Sum для генерации фальшивых суммирований, которые предоставляют основную истину для обучения системы. Источник: https://arxiv.org/pdf/2208.06773.pdf
Результатом являются суммирования, имеющие долю от исходного времени видео, а также многомодальная (т.е. текстовая) информация записывается во время процесса, чтобы будущие системы могли потенциально автоматизировать создание постов в стиле WikiHow, которые могут автоматически парсить длинное видеоурок в краткую и поисковую короткую статью, полную с иллюстрациями, потенциально экономя время и разочарование.
Новая система называется IV-Sum (‘Суммирователь учебных видео’), и использует открытый алгоритм распознавания компьютерного зрения ResNet-50 среди других методов, чтобы индивидуализировать соответствующие кадры и сегменты длинного видео.
Система обучается на псевдосуммированиях, сгенерированных из структуры контента сайта WikiHow, где реальные люди часто используют популярные учебные видео в более плоскую, текстовую мультимедийную форму, часто используя короткие клипы и анимированные GIF-изображения, взятые из исходных учебных видео.
Обсуждая использование проектом WikiHow суммирований в качестве источника основной истины для системы, авторы заявляют:
‘Каждая статья на сайте WikiHow Videos состоит из основного учебного видео, демонстрирующего задачу, которая часто включает рекламный контент, клипы инструктора, говорящего перед камерой без визуальной информации о задаче, и шаги, которые не являются важными для выполнения задачи.
‘Зрители, которые хотят получить обзор задачи, предпочтут более короткое видео без всей вышеупомянутой ненужной информации. Статьи WikiHow (например, см. Как приготовить рис для суши) содержат именно это: соответствующий текст, который содержит все важные шаги в видео, перечисленные с сопровождающими изображениями/клипами, иллюстрирующими различные шаги в задаче.’
Результатом является база данных, называемая WikiHow Summaries. База данных состоит из 2 106 входных видео и их связанных суммирований. Это заметно больше размера набора данных, чем обычно доступно для проектов суммирования видео, которые обычно требуют дорогой и трудоемкой ручной маркировки и аннотации – процесс, который был в значительной степени автоматизирован в новой работе, благодаря более ограниченному кругу суммирования учебных (а не общих) видео.
IV-Sum использует временные 3D свёрточные нейронные сети, а не кадровые представления, характерные для предыдущих работ, и исследование удаления, описанное в статье, подтверждает, что все компоненты этого подхода являются важными для функциональности системы.
IV-Sum протестирован с хорошими результатами против различных сравнимых рамок, включая CLIP-It (над которым работали несколько авторов статьи).

IV-Sum показывает хорошие результаты против сравнимых методов, возможно, из-за более ограниченного применения, по сравнению с общим набором инициатив по суммированию видео. Подробности метрик и методов оценки см. ниже в этой статье.
Метод
Первый этап в процессе суммирования включает использование относительно низкоэффективного, слабо контролируемого алгоритма для создания псевдосуммирований и оценок важности кадров для большого количества веб-скрапированных учебных видео, с только одним задачным ярлыком в каждом видео.
Далее обучается сеть суммирования учебных видео на этих данных. Система принимает авто-транскрибированную речь (например, субтитры, сгенерированные ИИ YouTube для видео) и исходное видео в качестве входных данных.
Сеть состоит из видео-энкодера и трансформера оценки сегментов (SST), и обучение руководствуется оценками важности, назначенными в псевдосуммированиях. Окончательное суммирование создается путем конкатенации сегментов, которые достигли высокой оценки важности.
Из статьи:
‘Основная интуиция, стоящая за нашей трубопроводной генерацией псевдосуммирований, заключается в том, что, учитывая много видео задачи, шаги, которые являются важными для задачи, вероятно, появятся в нескольких видео (задачная актуальность).
‘Кроме того, если шаг важен, то обычно демонстратор говорит об этом шаге либо до, либо во время, либо после выполнения его. Следовательно, субтитры для видео, полученные с помощью автоматического распознавания речи (ASR), вероятно, будут ссылаться на эти ключевые шаги (межмодальная выделяемость).’

Чтобы сгенерировать псевдосуммирование, видео сначала равномерно разделено на сегменты, и сегменты сгруппированы на основе их визуальной подобия в ‘шаги’ (разные цвета на изображении выше). Эти шаги затем назначаются оценками важности на основе ‘задачной актуальности’ и ‘межмодальной выделяемости’ (т.е. корреляции между текстом ASR и изображениями). Шаги с высокими оценками затем выбираются для представления стадий в псевдосуммировании.
Система использует Межмодальную выделяемость, чтобы помочь установить актуальность каждого шага, сравнивая интерпретированную речь с изображениями и действиями в видео. Это достигается с помощью предварительно обученной видео-текстовой модели, где каждый элемент обучается совместно под потерей MIL-NCE, используя 3D CNN видео-энкодер, разработанный, среди прочих, DeepMind.
Общая оценка важности затем получается из рассчитанного среднего значения этих стадий задачной актуальности и межмодального анализа.
Данные
Первоначальный набор псевдосуммирований был сгенерирован для процесса, включающий большинство содержимого двух предыдущих наборов данных – COIN, набор 2019 года, содержащий 11 000 видео, связанных с 180 задачами; и Cross-Task, который содержит 4 700 учебных видео, из которых 3 675 были использованы в исследовании. Cross-Task включает 83 различные задачи.

Выше, примеры из COIN; ниже, из Cross-Task. Источники, соответственно: https://arxiv.org/pdf/1903.02874.pdf и https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
Используя видео, которые фигурировали в обоих наборах данных только один раз, исследователи смогли получить 12 160 видео, охватывающих 263 различные задачи, и 628,53 часа контента для своего набора данных.
Чтобы заполнить набор данных на основе WikiHow, и чтобы предоставить основную истину для системы, авторы скрапировали WikiHow Videos для всех длинных учебных видео, вместе с их изображениями и видеоклипами (т.е. GIF-изображениями), связанными с каждым шагом. Таким образом, структура контента WikiHow должна была служить шаблоном для индивидуации шагов в новой системе.
Извлеченные признаки через ResNet50 были использованы для сопоставления выбранных секций видео в изображениях WikiHow и для локализации шагов. Наиболее подобное полученное изображение в 5-секундном окне видео использовалось в качестве якорной точки.
Эти более короткие клипы затем были склеены в видео, которые должны были составлять основную истину для обучения модели.
Метки были назначены каждому кадру во входном видео, чтобы объявить, принадлежат ли они к входному суммированию или нет, с каждым видео, полученным от исследователей, бинарной меткой на уровне кадра и средней оценкой суммирования, полученной через оценки важности для всех кадров в сегменте.
На этом этапе ‘шаги’ в каждом учебном видео теперь были связаны с текстовыми данными и помечены.
Обучение, тестирование и метрики
Окончательный набор данных WikiHow был разделен на 1 339 тестовых видео и 768 видео для проверки – заметное увеличение по сравнению со средним размером необработанных наборов данных, посвященных анализу видео.
Видео- и текстовые энкодеры в новой сети были обучены совместно на сети S3D с весами, загруженными из предварительно обученной модели HowTo100M под потерей MIL-NCE.
Модель была обучена с оптимизатором Adam на скорости обучения 0,01 при размере пакета 24, с распределенным параллелизмом, распространяющим обучение на восемь GPU NVIDIA RTX 2080, всего 24 ГБ распределенной видеопамяти.
IV-Sum затем был сравнен с различными сценариями для CLIP-It в соответствии с podobnymi предыдущими работами, включая исследование CLIP-It. Используемые метрики были точность, полнота и значение F, на трех несупервизированных базах (см. статью для подробностей).
Результаты перечислены в предыдущем изображении, но исследователи также отмечают, что CLIP-It пропускает ряд возможных шагов на различных этапах тестирования, которых IV-Sum не пропускает. Они приписывают это тому, что CLIP-It был обучен и разработан с использованием заметно меньших наборов данных, чем новый корпус WikiHow.
Последствия
Способная долгосрочная ценность этого направления исследований (которое IV-Sum разделяет с более широкой задачей анализа видео) может заключаться в том, чтобы сделать учебные видеоклипы более доступными для индексирования обычными поисковыми системами, и чтобы ermögнить создание сниженных ‘выделенных фрагментов’ для видео, которые Google часто извлекает из более длинных обычных статей.
Очевидно, что разработка любого процесса, с помощью ИИ, который уменьшает нашу обязанность применять линейное и исключительное внимание к видеоконтенту, может иметь последствия для привлекательности этого медиума для поколения маркетологов, для которых непрозрачность видео, возможно, была единственным способом, которым они чувствовали, что могут нас эксклюзивно вовлечь.
С местом ‘ценного’ контента, трудно определить, пользовательский видеоконтент наслаждался широким (хотя и неохотным) индультом от потребителей медиа в отношении размещения продуктов, спонсорских слотов и общей саморасширения, в которой ценностное предложение видео часто так часто couched. Проекты, такие как IV-Sum, держат обещание, что в конечном итоге подфакты видеоконтента станут гранулярными и отделимыми от того, что многие считают ‘балластом’ в контенте рекламы и неконтентной экстemporization.
Опубликовано впервые 16 августа 2022 года. Обновлено 14:52 16 августа, удалено дублирующее предложение.













