Kąt Andersona

Przywracanie przekomprimowanych filmów wideo z platform mediów społecznościowych za pomocą uczenia maszynowego

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Main image source: DALL-E 2

Nowe badania z Chin oferują skuteczną i nowatorską metodę przywracania szczegółów i rozdzielczości filmów wideo przesyłanych przez użytkowników, które są automatycznie kompresowane na platformach takich jak WeChat i YouTube w celu zaoszczędzenia przepustowości i miejsca na dysku.

Porównanie nowej metody z poprzednimi podejściami, pod względem jej zdolności do dokładnego rozwiązania szczegółów porzuconych podczas automatycznej optymalizacji platformy mediów społecznościowych. Źródło: https://arxiv.org/pdf/2208.08597.pdf

Porównanie nowej metody z poprzednimi podejściami, pod względem jej zdolności do dokładnego rozwiązania szczegółów porzuconych podczas automatycznej optymalizacji platformy mediów społecznościowych. Źródło: https://arxiv.org/pdf/2208.08597.pdf

W przeciwieństwie do poprzednich metod, które mogą skalować i próbkować filmy wideo na podstawie ogólnych danych szkoleniowych, nowe podejście wykorzystuje mapę cech degradacji (DFM) dla każdego klatki kompresowanego filmu wideo – efektywnie przegląd najbardziej uszkodzonych lub zniszczonych obszarów w klatce, które wynikają z kompresji.

Z nowego artykułu: drugi od prawej, prawdziwa mapa cech degradacji (DFM); trzeci od prawej, szacowanie uszkodzenia bez użycia DFM. Lewy, znacznie bardziej dokładna mapa uszkodzenia z DFM.

Z nowego artykułu: drugi od prawej, prawdziwa mapa cech degradacji (DFM); trzeci od prawej, szacowanie uszkodzenia bez użycia DFM. Lewy, znacznie bardziej dokładna mapa uszkodzenia z DFM.

Proces restoracji, który wykorzystuje sieci neuronowe zwane CNN, jest kierowany i skupiony przez informacje w DFM, co pozwala nowej metodzie przewyższyć wydajność i dokładność poprzednich podejść.

Prawdziwa mapa procesu została uzyskana przez badaczy, którzy przesłali filmy wideo o wysokiej jakości na cztery popularne platformy udostępniania, pobrali skompresowane wyniki i opracowali potok widzenia komputerowego, który może abstrakcyjnie uczyć się artefaktów kompresji i utraty szczegółów, tak aby można było go zastosować w różnych platformach w celu przywrócenia filmów wideo do jakości bliskiej oryginałowi, na podstawie całkowicie innych danych.

Przykłady z nowego zestawu danych UVSSM.

Przykłady z nowego zestawu danych UVSSM.

Materiał wykorzystany w badaniach został skompilowany w zestaw danych HQ/LQ o nazwie Filmy wideo udostępniane na platformach mediów społecznościowych (UVSSM) i został udostępniony do pobrania (hasło: rsqw) na platformie Baidu, dla korzyści przyszłych projektów badawczych, które będą dążyć do opracowania nowych metod przywracania filmów wideo skompresowanych przez platformy.

Porównanie między dwoma równoważnymi próbkami HQ/LQ z pobranego zestawu danych UVSSM (patrz powyżej linki do źródła). Ponieważ nawet ten przykład może być poddany wielokrotnym kompresjom (aplikacja obrazu, CMS, CDN itp.), proszę odnieść się do oryginalnych danych źródłowych dla bardziej dokładnego porównania.

Porównanie między dwoma równoważnymi próbkami HQ/LQ z pobranego zestawu danych UVSSM. Ponieważ nawet ten przykład może być poddany wielokrotnym kompresjom, proszę odnieść się do oryginalnych danych źródłowych dla bardziej dokładnego porównania.

Kod systemu, znany jako Przywracanie filmów wideo za pomocą adaptacyjnego wykrywania degradacji (VOTES), został również opublikowany na GitHubie, chociaż jego wdrożenie wymaga kilku zależności.

Artykuł artykuł nosi tytuł Przywracanie filmów wideo udostępnianych na platformach mediów społecznościowych i pochodzi od trzech badaczy z Uniwersytetu w Shenzhen oraz jednego z Wydziału Inżynierii Elektronicznej i Informatycznej na Politechnice w Hongkongu.

Od artefaktów do faktów

Możliwość przywracania jakości filmów wideo bez ogólnych, czasem “halucynacji” szczegółów dostarczanych przez programy takie jak Gigapixel (i większość popularnych pakietów open source o podobnym zakresie) może mieć wpływ na sektor badań nad widzeniem komputerowym.

Badania nad technologiami opartymi na filmach wideo często opierają się na materiałach uzyskanych z platform takich jak YouTube i Twitter, gdzie metody kompresji i kodeki są ściśle strzeżone, nie mogą być łatwo poznane na podstawie wzorców artefaktów lub innych wskaźników wizualnych i mogą zmieniać się okresowo.

Większość projektów, które wykorzystują filmy wideo znalezione w sieci, nie bada kompresji i musi dokonywać ustaleń co do dostępnej jakości skompresowanych filmów wideo, które platformy oferują, ponieważ nie mają dostępu do oryginalnych wersji o wysokiej jakości, które użytkownicy przesłali.

Dlatego też możliwość wiernego przywracania większej jakości i rozdzielczości takim filmom wideo, bez wprowadzania wpływu ze strony innych zbiorów danych z widzenia komputerowego, mogłaby pomóc uniknąć częstych rozwiązań i ustaleń, które projekty CV muszą obecnie dokonywać ze względu na źródła filmów wideo o obniżonej jakości.

Chociaż platformy takie jak YouTube okazjonalnie ogłaszają znaczne zmiany w sposobie kompresji filmów wideo użytkowników (takie jak VP9), nie ujawniają one całego procesu ani dokładnych kodeków i ustawień używanych do zmniejszania rozmiaru plików o wysokiej jakości przesłanych przez użytkowników.

Osiąganie lepszej jakości wyjściowej z przesłanych filmów wideo stało się więc pewnego rodzaju sztuką druidzką sztuką w ciągu ostatnich dziesięciu lat, z różnymi (głównie niepotwierdzonymi) ‘rozwiązaniami’ wchodzącymi i wychodzącymi z mody.

Metoda

Poprzednie podejścia do przywracania filmów wideo opartych na uczeniu maszynowym obejmowały ogólne wyodrębnianie cech, albo jako podejście do restoracji pojedynczych klatek, albo w architekturze wieloklatkowej, która wykorzystuje przepływ optyczny (tj. bierze pod uwagę sąsiednie i późniejsze klatki podczas restoracji bieżącej klatki).

Wszystkie te podejścia musiały się zmagać z “efektem czarnej skrzynki” – faktem, że nie mogą one badać efektów kompresji w podstawowych technologiach, ponieważ nie jest pewne, jakie są te technologie podstawowe, ani jak zostały one skonfigurowane dla konkretnego filmu wideo przesłanego przez użytkownika.

VOTES, zamiast tego, stara się wyodrębnić istotne cechy bezpośrednio z oryginalnego i skompresowanego filmu wideo, oraz określić wzorce transformacji, które będą ogólnie stosowane do standardów wielu platform.

Uproszczona architektura pojęciowa VOTES.

Uproszczona architektura pojęciowa VOTES.

VOTES wykorzystuje specjalnie opracowany moduł wykrywania degradacji (DSM, patrz powyżej obraz) do wyodrębniania cech w blokach konwolucyjnych. Wiele klatek jest następnie przekazywanych do modułu wyodrębniania cech i wyrównania (FEAM), a następnie do modułu modyfikacji degradacji (DMM). Ostatecznie moduł rekonstrukcji wyprowadza przywrócony film wideo.

Dane i eksperymenty

W nowej pracy badacze skoncentrowali swoje wysiłki na przywracaniu filmów wideo przesłanych na platformę WeChat, ale byli zaniepokojeni, aby upewnić się, że wynikający algorytm może być dostosowany do innych platform.

Okazało się, że gdy tylko uzyskali skuteczną model przywracania filmów wideo na WeChat, dostosowanie go do Bilibili, Twittera i YouTube zajęło tylko 90 sekund na jedną epokę dla każdego niestandardowego modelu dla każdej platformy (na maszynie z 4 procesorami NVIDIA Tesla P40 i łączną ilością 96 GB pamięci VRAM).

Dostosowanie udanego modelu WeChat do innych platform udostępniania filmów wideo okazało się dość trywialne. Tutaj widzimy, jak VOTES osiąga niemal natychmiastową równość wyników we wszystkich platformach, korzystając z własnego zestawu danych UVSSM i zestawu danych REDS (patrz poniżej).

Dostosowanie udanego modelu WeChat do innych platform udostępniania filmów wideo okazało się dość trywialne. Tutaj widzimy, jak VOTES osiąga niemal natychmiastową równość wyników we wszystkich platformach.

Aby zaludnić zestaw danych UVSSM, badacze zebrali 264 filmy wideo o długości od 5 do 30 sekund, każdy z częstotliwością klatek 30 fps, pochodzące bezpośrednio z aparatów fotograficznych komórkowych lub z Internetu. Filmy wideo miały rozdzielczość 1920 x 1080 lub 1280 x 270.

Zawartość (patrz powyżej obraz) obejmowała widoki miast, krajobrazy, ludzi i zwierząt, wśród innych tematów, i są dostępne w publicznym zestawie danych na podstawie licencji Creative Commons Attribution, umożliwiającej ponowne użycie.

Badacze przesłali 214 filmów wideo na WeChat, korzystając z pięciu różnych marek telefonów komórkowych, uzyskując domyślną rozdzielczość filmów wideo WeChat o rozdzielczości 960×540 (chyba że film wideo źródłowy ma już mniejszą rozdzielczość), wśród najbardziej “karzących” konwersji na popularnych platformach.

Górny lewy, oryginalna klatka HQ z trzema powiększonymi sekcjami; górny prawy, ta sama klatka z wersji skompresowanej filmu wideo; dolny lewy, obliczona degradacja skompresowanej klatki; i dolny prawy, konsekwentna

Górny lewy, oryginalna klatka HQ z trzema powiększonymi sekcjami; górny prawy, ta sama klatka z wersji skompresowanej filmu wideo; dolny lewy, obliczona degradacja skompresowanej klatki; i dolny prawy, konsekwentna “strefa pracy” dla VOTES, aby skupić swoją uwagę.

Dla późniejszych porównań z rutynami konwersji innych platform, badacze przesłali 50 filmów wideo nie wchodzących w skład pierwotnych 214 do Bilibili, YouTube i Twitter. Filmy wideo miały oryginalną rozdzielczość 1280×270, a pobrane wersje miały rozdzielczość 640×360.

To sprawia, że zestaw danych UVSSM ma łącznie 364 pary oryginalnych (HQ) i udostępnionych (LQ) filmów wideo, z 214 na WeChat i 50 na każdej z platform Bilibili, YouTube i Twitter.

Dla eksperymentów wybrano 10 losowych filmów wideo jako zestaw testowy, 4 jako zestaw walidacyjny i 200 jako podstawowy zestaw szkoleniowy. Eksperymenty zostały przeprowadzone pięć razy z walidacją krzyżową K, a wyniki zostały uśrednione w tych przypadkach.

W testach na przywracanie filmów wideo VOTES został porównany do Spatio-Temporal Deformable Fusion (STDF). Dla poprawy rozdzielczości został on przetestowany w porównaniu z Enhanced Deformable convolutions (EDVR), RSDN, Video Super-resolution with Temporal Group Attention (VSR_TGA), i BasicVSR. Metoda COMISR Google’a została również uwzględniona, chociaż nie pasuje do typu architektury innych poprzednich prac.

Metody zostały przetestowane na zestawach danych UVSS i REDS, a VOTES osiągnął najwyższe wyniki:

Badacze twierdzą, że wyniki jakościowe również wskazują na wyższość VOTES w porównaniu z poprzednimi systemami:

Klatki filmów wideo z REDS przywrócone przez konkurencyjne podejścia. Wskazana rozdzielczość tylko do celów porównawczych - patrz artykuł dla ostatecznej rozdzielczości.

Klatki filmów wideo z REDS przywrócone przez konkurencyjne podejścia. Wskazana rozdzielczość tylko do celów porównawczych – patrz artykuł dla ostatecznej rozdzielczości.

 

Pierwotnie opublikowane 19 sierpnia 2022.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai