Взгляд Anderson
Восстановление переуплотненных видеороликов в социальных сетях с помощью машинного обучения

Новые исследования из Китая предлагают эффективный и новый метод восстановления деталей и разрешения видеороликов, автоматически сжатых на платформах, таких как WeChat и YouTube, для экономии пропускной способности и места на диске.

Сравнение нового метода с предыдущими подходами в плане его способности точно восстановить детали, утерянные во время автоматической оптимизации социальных сетей. Источник: https://arxiv.org/pdf/2208.08597.pdf
В отличие от предыдущих методов, которые могут масштабировать и увеличивать разрешение видеороликов на основе общих данных обучения, новый подход вместо этого получает карту особенностей деградации (DFM) для каждого кадра сжатого видеоролика – по сути, обзор наиболее поврежденных или ухудшенных областей в кадре, которые являются результатом сжатия.

Из новых исследований: второе справа – эталонная ‘чистая’ карта особенностей деградации (DFM); третье справа – оценка повреждения без использования DFM. Слева – гораздо более точная карта повреждения с DFM.
Процесс восстановления, который использует свёрточные нейронные сети (CNN), среди других технологий, руководствуется и фокусируется на информации в DFM, что позволяет новому методу превзойти производительность и точность предыдущих подходов.
Эталонные значения для процесса были получены исследователями путем загрузки высококачественных видеороликов на четыре популярные платформы обмена, скачивания сжатых результатов и разработки компьютерного зрения, способного абстрактно учиться на артефактах сжатия и потере деталей, чтобы применить это к нескольким платформам для восстановления видеороликов до почти原始ного качества на основе совершенно других данных.
Материалы, использованные в исследованиях, были собраны в набор данных HQ/LQ под названием Пользовательские видеоролики, обмененные в социальных сетях (UVSSM) и были сделаны доступными для скачивания (пароль: rsqw) на Baidu для пользы последующих исследовательских проектов, направленных на разработку новых методов восстановления сжатых видеороликов платформ.

Сравнение двух эквивалентных HQ/LQ образцов из скачиваемого набора данных UVSSM (см. ссылки выше для исходных URL). Поскольку даже этот пример может быть подвержен нескольким раундам сжатия (приложение для изображений, CMS, CDN и т. д.), пожалуйста, обратитесь к исходным данным для более точного сравнения.
Код системы, известной как Восстановление видео через адаптивное обнаружение деградации (VOTES), также был опубликован на GitHub, хотя его реализация включает в себя несколько зависимостей.
От артефактов к фактам
Способность восстановить качество веб-видео без генерации, иногда чрезмерной ‘галлюцинации’ деталей, обеспечиваемой программами, такими как Gigapixel (и большинство популярных открытых пакетов аналогичного объема), может иметь последствия для сектора исследований компьютерного зрения.
Исследования видеообоснованных технологий компьютерного зрения часто полагаются на кадры, полученные из платформ, таких как YouTube и Twitter, где методы сжатия и кодеки используются в секрете, не могут быть легко получены на основе закономерностей артефактов или других визуальных индикаторов и могут изменяться периодически.
Большинство проектов, которые используют веб-видео, не исследуют сжатие и должны делать поправки на доступное качество сжатого видео, предлагаемого платформами, поскольку у них нет доступа к исходным высококачественным версиям, которые пользователи загружают.
Следовательно, способность вернуть более высокое качество и разрешение таким видеороликам без введения влияния из не связанных наборов данных компьютерного зрения может помочь устранить частые обходные пути и компромиссы, которые проекты CV должны в настоящее время делать для ухудшенных источников видео.
Хотя платформы, такие как YouTube, иногда объявляют о значительных изменениях в способе сжатия видеороликов пользователей (например, VP9), ни одна из них явно не раскрывает весь процесс или точные кодеки и настройки, используемые для уменьшения размера высококачественных файлов, которые пользователи загружают.
Достижение улучшенного качества вывода из загруженных пользователем видеороликов стало своего рода древним искусством за последние десять лет, с различными (в основном неподтвержденными) ‘обходными путями’, которые входят и выходят из моды.
Метод
Предыдущие подходы к восстановлению видео на основе глубокого обучения включали извлечение общих особенностей, либо как подход к восстановлению отдельных кадров, либо в многокадровой архитектуре, которая использует оптический поток (т. е. учитывает соседние и последующие кадры при восстановлении текущего кадра).
Все эти подходы должны были иметь дело с ‘черным ящиком’ – эффектом, когда они не могут изучать эффекты сжатия в основных технологиях, потому что неясно, какие основные технологии используются или как они были настроены для любого конкретного видеоролика, загруженного пользователем.
VOTES, вместо этого, стремится извлечь важные особенности напрямую из исходного и сжатого видео и определить закономерности преобразования, которые будут обобщаться для стандартов нескольких платформ.
VOTES использует специально разработанный модуль обнаружения деградации (DSM, см. изображение выше) для извлечения особенностей в свёрточных блоках. Множество кадров затем передаются в модуль извлечения и выравнивания особенностей (FEAM), а затем передаются в модуль модуляции деградации (DMM). Наконец, модуль восстановления выводит восстановленное видео.
Данные и эксперименты
В новой работе исследователи сосредоточили свои усилия на восстановлении видеороликов, загруженных на и выкачанных из платформы WeChat, но были обеспокоены обеспечением того, чтобы полученный алгоритм мог быть адаптирован к другим платформам.
Оказалось, что как только они получили эффективную модель восстановления для видеороликов WeChat, адаптация ее к Bilibili, Twitter и YouTube заняла всего 90 секунд для одной эпохи для каждого пользовательского модели для каждой платформы (на машине, работающей на 4 NVIDIA Tesla P40 GPU с общим объемом 96 ГБ ОЗУ).

Адаптация успешной модели WeChat к другим видеоплатформам оказалась довольно тривиальной. Здесь мы видим VOTES, достигающий почти мгновенного паритета производительности на различных платформах, используя собственный набор данных UVSSM и набор данных REDS (см. ниже).
Чтобы заполнить набор данных UVSSM, исследователи собрали 264 видеоролика продолжительностью от 5 до 30 секунд, каждый с частотой кадров 30 fps, полученные либо直接 из камер мобильных телефонов, либо из Интернета. Видеоролики были либо 1920 х 1080, либо 1280 х 270 разрешения.
Содержание (см. предыдущее изображение) включало городские пейзажи, пейзажи, людей и животных, среди других предметов, и могут быть использованы в общедоступном наборе данных по лицензии Creative Commons Attribution, которая позволяет повторное использование.
Авторы загрузили 214 видеороликов на WeChat, используя пять разных марок мобильных телефонов, получив стандартное разрешение видео WeChat 960×540 (если исходный видеоролик не уже меньше этих размеров), среди самых ‘кастрирующих’ преобразований на популярных платформах.

Вверху слева – исходный HQ-кадр с тремя увеличенными секциями; вверху справа – тот же кадр из платформо-ухудшенного сжатого видеоролика; внизу слева – рассчитанная деградация сжатого кадра; и внизу справа – последующая ‘рабочая зона’ для VOTES, чтобы сосредоточить на ней свое внимание. Очевидно, что размер низкокачественного изображения составляет половину HQ, но был изменен здесь для ясности сравнения.
Для последующих сравнений с конверсионными рутинами других платформ исследователи загрузили 50 видеороликов не включенных в исходные 214 на Bilibili, YouTube и Twitter. Исходное разрешение видеороликов было 1280×270, а скачанные версии имели разрешение 640×360.
Это увеличивает набор данных UVSSM до общего количества 364 пар исходных (HQ) и общедоступных (LQ) видеороликов, с 214 на WeChat и 50 на каждой из Bilibili, YouTube и Twitter.
Для экспериментов 10 случайных видеороликов были выбраны в качестве тестового набора, четыре – в качестве набора проверки, и оставшиеся 200 – в качестве основного обучающего набора. Эксперименты проводились пять раз с K-разделением, а результаты усреднялись по этим экземплярам.
В тестах на восстановление видео VOTES был сравнен со Spatio-Temporal Deformable Fusion (STDF). Для повышения разрешения он был протестирован против Enhanced Deformable convolutions (EDVR), RSDN, Video Super-resolution with Temporal Group Attention (VSR_TGA), и BasicVSR. Одностадийный метод Google COMISR также был включен, хотя он не подходит к типу архитектуры предыдущих работ.
Методы были протестированы на обоих UVSS и наборе данных REDS, при этом VOTES достиг最高 баллов:
Авторы утверждают, что качественные результаты также указывают на превосходство VOTES над предыдущими системами:

Кадры видео из REDS, восстановленные конкурирующими подходами. Указательное разрешение только – см. статью для определенного разрешения.
Опубликовано впервые 19 августа 2022 г.















