Погляд Anderson

Відновлення надкомпресованих відеороликів у соціальних мережах за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google
Main image source: DALL-E 2

Нові дослідження китайських вчених пропонують ефективний і новий метод відновлення деталей і роздільної здатності відеороликів, які автоматично стискаються на платформах, таких як WeChat і YouTube, для збереження пропускної здатності і місця на диску.

Порівняння нового методу з попередніми підходами щодо його здатності точно відновлювати деталі, які були втрачені під час автоматичної оптимізації платформою соціальних мереж. Джерело: https://arxiv.org/pdf/2208.08597.pdf

Порівняння нового методу з попередніми підходами щодо його здатності точно відновлювати деталі, які були втрачені під час автоматичної оптимізації платформою соціальних мереж. Джерело: https://arxiv.org/pdf/2208.08597.pdf

На відміну від попередніх методів, які можуть збільшувати і підвищувати якість відео на основі загальних навчальних даних, новий підхід замість цього отримує карту особливостей деградації (DFM) для кожного кадру стиснутого відео – фактично огляд найбільш пошкоджених або погіршених регіонів у кадрі, які виникли в результаті стиснення.

З нового дослідження: другий справа, істинна

З нового дослідження: другий справа, істинна “чиста” карта особливостей деградації (DFM); третій справа, оцінка пошкодження без використання DFM. Зліва, набагато більш точна карта пошкодження з DFM.

Процес відновлення, який використовує卷ячну нейронну мережу (CNN), серед інших технологій, керується і фокусується інформацією в DFM, що дозволяє новому методу перевершити продуктивність і точність попередніх підходів.

Істинна основа для процесу була отримана дослідниками шляхом завантаження високоякісного відео на чотири популярні платформи для обміну, завантаження стиснутих результатів і розробки комп’ютерного зору, який може абстрактно вивчати артефакти стиснення і втрату деталей, так що його можна застосувати до ряду платформ для відновлення відео до майже оригінальної якості на основі повністю протилежних даних.

Приклади з нового набору даних UVSSM дослідників.

Приклади з нового набору даних UVSSM дослідників.

Матеріали, використані в дослідженні, були скомпоновані в набір даних HQ/LQ під назвою Відео, спільні в соціальних мережах (UVSSM) і були зроблені доступними для завантаження (пароль: rsqw) на Baidu, для користі подальших дослідницьких проектів, які спрямовані на розробку нових методів відновлення відео, стиснутого платформою.

Порівняння двох еквівалентних зразків HQ/LQ з набору даних UVSSM (див. вище посилання на джерело). Оскільки навіть цей приклад може бути підданий кільком раундам стиснення (застосування зображення, CMS, CDN тощо), зверніться до оригінальних джерельних даних для більш точного порівняння.

Порівняння двох еквівалентних зразків HQ/LQ з набору даних UVSSM (див. вище посилання на джерело). Оскільки навіть цей приклад може бути підданий кільком раундам стиснення (застосування зображення, CMS, CDN тощо), зверніться до оригінальних джерельних даних для більш точного порівняння.

Код системи, яка називається Відновлення відео через адаптивне виявлення деградації (VOTES), також був опублікований на GitHub, хоча його реалізація передбачає ряд залежностей, що завантажуються.

Стаття дослідження називається Відновлення відео, спільного в соціальних мережах і надходить від трьох дослідників Університету Шеньчженя і одного від кафедри електроніки та інформаційних технологій Університету Гонконгу.

Від артефактів до фактів

Спроможність відновлювати якість веб-видобутих відео без загального, іноді ексцесивного “галюцинації” деталей, яку надають програми, такі як Gigapixel (і більшість популярних відкритих пакетів подібного масштабу), може мати наслідки для сектора досліджень комп’ютерного зору.

Дослідження відео-орієнтованих технологій комп’ютерного зору часто залежить від кадрів, отриманих з платформ, таких як YouTube і Twitter, де методи стиснення і кодеки, використовувані на цих платформах, є секретними, не можуть бути легко витягнуті на основі візуальних індикаторів або артефактів і можуть змінюватися періодично.

Більшість проектів, які використовують веб-видобуте відео, не досліджують стиснення і повинні враховувати доступну якість стиснутого відео, яке пропонують платформи, оскільки вони не мають доступу до оригінальних високоякісних версій, які завантажили користувачі.

Отже, можливість вірно відновити вищу якість і роздільну здатність таких відео без введення впливу з не пов’язаних наборів даних комп’ютерного зору може допомогти уникнути частих обходів і компромісів, які проекти комп’ютерного зору повинні зараз робити для погіршених джерел відео.

Хоча платформи, такі як YouTube, іноді оголошують про значні зміни у способі стиснення відео користувачів (наприклад, VP9), жодна з них явно не розкриває весь процес або точні кодеки і налаштування, використовувані для звуження високоякісних файлів, які завантажили користувачі.

Досягнення покращеної якості виходу з завантажених відео стало певним друїдичним мистецтвом за останні десять років, з різними (в основному не підтвердженими) ‘обхідними шляхами’, які виходять з моди.

Метод

Попередні підходи до відновлення відео на основі глибинного навчання включали загальне витягання особливостей, або як підхід до відновлення окремих кадрів, або у багатокадровій архітектурі, яка використовує оптичний потік (тобто бере до уваги сусідні і пізніші кадри при відновленні поточного кадру).

Всі ці підходи мали справу з “чорною скринькою” – фактом, що вони не можуть вивчати ефекти стиснення в основних технологіях, оскільки не відомо ні те, які саме ці технології, ні як вони були сконфігуровані для будь-якого завантаженого відео користувачем.

VOTES, натомість, намагається витягти важливі особливості безпосередньо з оригінального і стиснутого відео і визначити закономірності перетворення, які будуть узагальнюватися для стандартів ряду платформ.

Упрощена концептуальна архітектура VOTES.

Упрощена концептуальна архітектура VOTES.

VOTES використовує спеціально розроблений модуль виявлення деградації (DSM, див. зображення вище) для витягання особливостей у卷ячних блоках. Потім кілька кадрів передаються до модуля витягання і вирівнювання особливостей (FEAM), після чого вони передаються до модуля модуляції деградації (DMM). Нарешті, модуль відновлення видає відновлене відео.

Дані і експерименти

У новій роботі дослідники сконцентрували свої зусилля на відновленні відео, завантаженого на платформу WeChat і знову завантаженого з неї, але були стурбовані тим, щоб отримана алгоритм могла бути адаптована до інших платформ.

Виявилося, що як тільки вони отримали ефективну модель відновлення для відео WeChat, адаптація її до Bilibili, Twitter і YouTube зайняла лише 90 секунд для однієї епохи для кожної спеціальної моделі для кожної платформи (на машині, що працює на 4 NVIDIA Tesla P40 GPU з загальною пам’яттю 96ГБ).

Адаптація успішної моделі WeChat до інших платформ для обміну відео виявилася досить тривіальною. Тут ми бачимо, як VOTES досягає майже миттєвої паритету продуктивності по різних платформах, використовуючи власний набір даних UVSSM і набір даних REDS (див. нижче).

Адаптація успішної моделі WeChat до інших платформ для обміну відео виявилась досить тривіальною. Тут ми бачимо, як VOTES досягає майже миттєвої паритету продуктивності по різних платформах, використовуючи власний набір даних UVSSM і набір даних REDS (див. нижче).

Для заповнення набору даних UVSSM дослідники зібрали 264 відео тривалістю від 5 до 30 секунд, кожне з кадровою частотою 30 кадрів в секунду, отримані безпосередньо з мобільних телефонів або з Інтернету. Відео мали роздільну здатність 1920 x 1080 або 1280 x 270.

Зміст (див. попереднє зображення) включав міські пейзажі, краєвиди, людей і тварин, серед інших предметів, і можуть бути використані в публічному наборі даних за ліцензією Creative Commons Attribution, що дозволяє повторне використання.

Автори завантажили 214 відео на WeChat, використовуючи п’ять різних марок мобільних телефонів, отримавши стандартну роздільну здатність відео WeChat 960×540 (якщо джерельне відео не було вже меншим за ці розміри), серед найбільш “каральних” перетворень по популярним платформам.

Верхня ліва, оригінальний кадр високої якості з трьома збільшеними ділянками; верхня права, той самий кадр з платформо-деґрадованої стисненої версії того ж відео; нижня ліва, розраховане погіршення стиснутого кадру; і нижня права, підсумована

Верхня ліва, оригінальний кадр високої якості з трьома збільшеними ділянками; верхня права, той самий кадр з платформо-деґрадованої стисненої версії того ж відео; нижня ліва, розраховане погіршення стиснутого кадру; і нижня права, підсумована “робоча зона” для VOTES, щоб сконцентрувати свою увагу на ній. Очевидно, що розмір низькочастотного зображення становить половину розміру високоякісного, але його було збільшено тут для ясності порівняння.

Для пізніх порівнянь з конверсійними процедурами інших платформ дослідники завантажили 50 відео не включених до оригінальних 214 на Bilibili, YouTube і Twitter. Оригінальна роздільна здатність відео становила 1280×270, а завантажені версії мали роздільну здатність 640×360.

Це призводить до того, що набір даних UVSSM складається з 364 пар оригінальних (HQ) і спільних (LQ) відео, з 214 на WeChat і 50 на кожній з Bilibili, YouTube і Twitter.

Для експериментів було вибрано 10 випадкових відео як тестовий набір, 4 як набір валідації, і 200 як основний навчальний набір. Експерименти проводилися 5 разів з K-розподілом, а результати були усереднені по цих екземплярах.

У тестах на відновлення відео VOTES порівнювався з Spatio-Temporal Deformable Fusion (STDF). Для підвищення роздільної здатності він був протестований проти Enhanced Deformable конволюцій (EDVR), RSDN, Video Super-resolution з темпоральним груповим увагою (VSR_TGA), і BasicVSR. Одностадійний метод Google COMISR також був включений, хоча він не підходить до типу архітектури попередніх робіт.

Методи були протестовані на наборах даних UVSS і REDS, а VOTES досягнув найвищих балів:

Автори стверджують, що якісні результати також свідчать про перевагу VOTES над попередніми системами:

Кадри відео з REDS, відновлені конкуруючими підходами. Показана роздільна здатність тільки для порівняння - див. статтю для остаточної роздільної здатності.

Кадри відео з REDS, відновлені конкуруючими підходами. Показана роздільна здатність тільки для порівняння – див. статтю для остаточної роздільної здатності.

 

Перше опубліковане 19 серпня 2022 року.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai