Погляд Anderson
Використання штучного інтелекту для підбиття підсумків довгих відео «Як зробити»

Якщо ви той, хто підвищує швидкість відео на YouTube, щоб отримати інформацію, яку ви дійсно хочете; консультуєте транскрипт відео, щоб отримати основну інформацію, приховану в довгих і часто спонсорованих відео; або сподіваєтеся, що WikiHow створить менш часозатратну версію інформації в інструкційному відео; то новий проект з Університету Каліфорнії в Берклі, Google Research і Браунівського університету може бути цікавим для вас.
Назва проекту TL;DW? Підбиття підсумків інструкційних відео з урахуванням завдання та міжмодальної вибірковості, в новій статті описано створення системи підтримки штучного інтелекту для підбиття підсумків відео, яка може ідентифікувати відповідні кроки у відео та викинути все інше, в результаті чого отримуються короткі підсумки, які швидко доходять до суті.

Використання WikiHow існуючих довгих відеокліпів для текстової та відеоінформації використовується проєктом IV-Sum для генерації фальшивих підсумків, які надають підставу для навчання системи. Джерело: https://arxiv.org/pdf/2208.06773.pdf
Результатні підсумки мають лише частину часу оригінального відео, а багатомодальна (тобто текстова) інформація також реєструється під час процесу, так що майбутні системи потенційно можуть автоматизувати створення статей у стилі WikiHow, які здатні автоматично розібрати довге інструкційне відео на лаконічний і пошуковий короткий статтю, разом з ілюстраціями, потенційно економлячи час і розчарування.
Нова система називається IV-Sum (‘Підбіття підсумків інструкційних відео’), і використовує відкритий вихідний код алгоритм розпізнавання образів ResNet-50, серед інших методів, для індивідуалізації відповідних кадрів і сегментів довгого джерельного відео.
Система тренується на псевдопідсумках, згенерованих з структури вмісту сайту WikiHow, де реальні люди часто використовують популярні інструкційні відео у пласкій, текстовій багатозначній формі, часто використовуючи короткі кліпи та анімовані GIF-образи, взяті з джерельних інструкційних відео.
Обговорюючи використання проекту псевдопідсумків WikiHow як джерела даних для системи, автори заявляють:
‘Кожна стаття на сайті WikiHow Videos складається з основного інструкційного відео, яке демонструє завдання, яке часто включає рекламний контент, кліпи інструктора, який говорить до камери без візуальної інформації про завдання, і кроки, які не є важливими для виконання завдання.
‘Переглядачі, які хочуть огляд завдання, віддають перевагу коротшому відео без усіх вищезазначених неважливих відомостей. Статті WikiHow (наприклад, див. Як зробити рис для суши) містять саме це: відповідний текст, який містить всі важливі кроки у відео, перераховані з супроводжувальними зображеннями/кліпами, які ілюструють різні кроки у завдання.’
Результатна база даних з цього веб-скрейпінгу називається WikiHow Summaries. База даних складається з 2 106 вхідних відео і їхніх пов’язаних підсумків. Це помітно більший розмір набору даних, ніж зазвичай доступний для проектів підбиття підсумків відео, які зазвичай вимагають дорогих і трудомістких ручних міток і анотацій – процес, який був значною мірою автоматизований у цій новій роботі, завдяки більш обмеженому колу підбиття підсумків інструкційних (а не загальних) відео.
IV-Sum використовує тимчасові 3D卷олюційні нейронні мережі, а не кадрові представлення, які характеризують попередні подібні роботи, і дослідження видалення, деталізоване в статті, підтверджує, що всі компоненти цього підходу є важливими для функціональності системи.
IV-Sum протестував добре проти різних порівняльних khungів, включаючи CLIP-It (на якому деякі з авторів статті також працювали).

IV-Sum набирає добре проти порівняльних методів, можливо, через його обмежений застосування, порівняно з загальним руслом ініціатив підбиття підсумків відео.
Метод
Перший етап у процесі підбиття підсумків включає використання відносно низькозатратного, слабо-керованого алгоритму для створення псевдопідсумків і кадрових оцінок важливості для великої кількості веб-скрейпінгових інструкційних відео, з лише однією задачею в кожному відео.
Далі інструкційна мережа підбиття підсумків тренується на цих даних. Система приймає авто-транскрибований текст (наприклад, субтитри YouTube, згенеровані штучним інтелектом) і джерельне відео як вхід.
Мережа складається з відео-кодувальника і трансформера оцінки сегментів (SST), і тренування керується оцінками важливості, призначеними в псевдопідсумках. Остатній підсумок створюється шляхом конкатенації сегментів, які досягли високої оцінки важливості.
З статті:
‘Основна інтуїція за нашим псевдопідсумковим процесом полягає в тому, що дані багатьох відео завдання, кроки, які є важливими для завдання, ймовірно, з’являються у декількох відео (відносність завдання).
‘Крім того, якщо крок важливий, зазвичай демонстратор говорить про цей крок перед, під час або після виконання. Тому субтитри для відео, отримані за допомогою автоматичного розпізнавання мови (ASR), ймовірно, будуть посилатися на ці ключові кроки (міжмодальна вибірковість).’

Для генерації псевдопідсумку відео спочатку рівномірно розбивається на сегменти, а сегменти групуються на основі їх візуальної подібності в «кроки» (різні кольори на зображенні вище).
Система використовує міжмодальну вибірковість, щоб допомогти встановити важливість кожного кроку, порівнюючи інтерпретований текст із зображеннями та діями у відео. Це досягається за допомогою попередньо тренованої відео-текстової моделі, де кожен елемент тренується спільно під втратою MIL-NCE, використовуючи 3D CNN відео-кодувальник, розроблений, серед інших, DeepMind.
Загальна оцінка важливості потім отримується з розрахованої середньої оцінки цих стадій відносності завдання та міжмодальної аналізу.
Дані
Первоначальний набір псевдопідсумків був згенерований для процесу, який складається з більшості вмісту двох попередніх наборів даних – COIN, набору 2019 року, який містить 11 000 відео, пов’язаних з 180 завданнями; і Cross-Task, який містить 4 700 інструкційних відео, з яких 3 675 були використані в дослідженні. Cross-Task містить 83 різні завдання.

Вище, приклади з COIN; нижче, з Cross-Task. Джерела, відповідно: https://arxiv.org/pdf/1903.02874.pdf і https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
Використовуючи відео, які були представлені в обох наборах даних лише один раз, дослідники змогли отримати 12 160 відео, які охоплюють 263 різні завдання, і 628,53 години вмісту для свого набору даних.
Для заповнення набору даних WikiHow і надання підстави для системи автори скрейпінгували відео WikiHow для всіх довгих інструкційних відео, разом з їхніми зображеннями і відеокліпами (тобто GIF-образами), пов’язаними з кожним кроком. Таким чином, структура виведеного вмісту WikiHow мала служити шаблоном для індивідуалізації кроків у новій системі.
Особливості, видобуті за допомогою ResNet50, були використані для перетину вибраних секцій відео в зображеннях WikiHow і виконання локалізації кроків. Найбільше подібне отримане зображення в межах 5-секундного відео-віконця використовувалося як точка прив’язки.
Ці коротші кліпи потім були склеєні в відео, які складали б підставу для навчання моделі.
Мітки були призначені для кожного кадру вхідного відео, щоб оголосити, чи належать вони до вхідного підсумку чи ні, з кожним відео, яке отримувало від дослідників кадрову бінарну мітку, і середню підсумкову оцінку, отриману за допомогою оцінок важливості для всіх кадрів у сегменті.
На цьому етапі «кроки» в кожному інструкційному відео тепер були пов’язані з текстовими даними і позначені.
Тренування, тести та метрики
Остатній набір даних WikiHow був розділений на 1 339 тестових відео і 768 валідних відео – це помітне збільшення середнього розміру не сирого набору даних, присвяченого аналізу відео.
Відео- і текстові кодувальники в новій мережі були спільно треновані на мережі S3D з вагами, завантаженими з попередньо тренованої моделі HowTo100M під втратою MIL-NCE.
Модель була тренована з оптимізатором Adam на швидкості навчання 0,01 при розмірі партії 24, з розподіленим паралельним зв’язком, який розподіляє тренування по восьми графічних процесорах NVIDIA RTX 2080, загалом 24 ГБ розподіленої відеопам’яті.
IV-Sum потім порівнювався з різними сценаріями для CLIP-It згідно з подібними попередніми роботами, включаючи дослідження CLIP-It. Метрики, які використовувалися, були значеннями точності, виклику і F-оцінки, по трьох несупервізованих базових лініях (див. статтю для деталей).
Результати перелічені в попередньому зображенні, але дослідники також відзначають, що CLIP-It пропускає деякі можливі кроки на різних стадіях тестів, яких IV-Sum не пропускає. Вони приписують це тому, що CLIP-It був тренований і розроблений за допомогою набагато менших наборів даних, ніж новий корпус WikiHow.
Наслідки
Аргументована довгострокова цінність цього напрямку досліджень (який IV-Sum поділяє з більш широким викликом аналізу відео) могла б полягати в тому, щоб зробити інструкційні відеокліпи більш доступними для традиційного індексування пошукових систем, і щоб дозволити такий вид редуктивного «фрагмента» результатів для відео, який Google часто витягує з довгої статті.
Очевидно, що розробка будь-якого процесу, підтримуваного штучним інтелектом, який зменшує нашу зобов’язаність застосовувати лінійну і виключну увагу до відеоконтенту, могла б мати наслідки для привабливості цього медіа для покоління маркетологів, для яких непрозорість відео, можливо, була єдиним способом, яким вони відчували себе виключно залученими.
Знаходження «цінного» вмісту важко визначити, відео, створене користувачами, користувалося широким (хоча і неохочим) терпінням медіа-споживачів щодо розміщення продуктів, спонсорських слотів і загальної самозагрузки, в якій цінність пропозиції відео часто закутана. Проекти, такі як IV-Sum, несуть обіцянку, що в кінцевому підсумку підфактори відеоконтенту стануть гранульованими і відокремленими від того, що багато хто вважає «баластом» реклами в контенті та неконтентної імпровізації.
Перша публікація 16 серпня 2022 року. Оновлено 14:52 16 серпня, видалено дублікат фрази.













