Andersonův úhel

Obnovení přehraných sociálních médií s umělou inteligencí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Main image source: DALL-E 2

Nový výzkum z Číny nabízí efektivní a novou metodu pro obnovení detailů a rozlišení uživatelů nahrávaných videí, která jsou automaticky komprimována na platformách, jako je WeChat a YouTube, aby se ušetřila šířka pásma a úložný prostor.

Porovnání nové metody s předchozími přístupy, pokud jde o její schopnost přesně obnovit detaily odstraněné během automatické optimalizace sociálních médií. Zdroj: https://arxiv.org/pdf/2208.08597.pdf

Porovnání nové metody s předchozími přístupy, pokud jde o její schopnost přesně obnovit detaily odstraněné během automatické optimalizace sociálních médií. Zdroj: https://arxiv.org/pdf/2208.08597.pdf

Naproti tomu předchozí metody, které mohou zvětšit a vzorkovat videa na základě obecných trénovacích dat, nová metoda místo toho odvozuje degradační funkci mapy (DFM) pro každý rámec komprimovaného videa – efektivní přehled nejvíce poškozených nebo zhoršených oblastí v rámcích, které jsou výsledkem komprese.

Z nové studie ablace: druhá zprava, ground truth pro 'čistou' degradační funkci mapy (DFM); třetí zprava, odhad poškození bez použití DFM. Vlevo, mnohem přesnější mapa poškození s DFM.

Z nové studie ablace: druhá zprava, ground truth pro ‘čistou’ degradační funkci mapy (DFM); třetí zprava, odhad poškození bez použití DFM. Vlevo, mnohem přesnější mapa poškození s DFM.

Obnovovací proces, který využívá konvoluční neuronové sítě (CNN), je řízen a zaměřen informacemi v DFM, což umožňuje nové metodě překonat výkon a přesnost předchozích přístupů.

Ground truth pro proces byl získán výzkumníky nahráním vysoce kvalitních videí na čtyři populární sdílecí platformy, stažením komprimovaných výsledků a vývojem počítačové vize, která je schopna abstraktně se učit kompresní artefakty a ztrátu detailů, aby je mohla aplikovat napříč několika platformami a obnovit videa do téměř původní kvality na základě zcela odlišných dat.

Příklady z nového datasetu UVSSM výzkumníků.

Příklady z nového datasetu UVSSM výzkumníků.

Materiál použitý ve výzkumu byl zkompilován do datasetu HQ/LQ s názvem Uživatelé sdílejí videa na sociálních médiích (UVSSM) a byl zpřístupněn ke stažení (heslo: rsqw) na Baidu, prospěch následujících výzkumných projektů, které se snaží vyvinout nové metody pro obnovu platformově komprimovaného videa.

Porovnání dvou ekvivalentních HQ/LQ vzorků z datasetu UVSSM (viz odkazy výše pro zdroj URL). Pokud je tento příklad také podroben několika kolům komprese (aplikace obrázků, CMS, CDN atd.), obraťte se na původní zdroj dat pro přesnější porovnání.

Porovnání dvou ekvivalentních HQ/LQ vzorků z datasetu UVSSM (viz odkazy výše pro zdroj URL). Pokud je tento příklad také podroben několika kolům komprese (aplikace obrázků, CMS, CDN atd.), obraťte se na původní zdroj dat pro přesnější porovnání.

Kód systému, známý jako Obnova videa prostřednictvím adaptivní degradační detekce (VOTES), byl také zpřístupněn na GitHubu, i když jeho implementace vyžaduje několik závislostí.

Článek článku se nazývá Obnova uživatelů sdílejí videa na sociálních médiích a pochází od tří výzkumníků ze Šen-čenské univerzity a jednoho z oddělení elektroniky a informačního inženýrství na Hongkongské polytechnické univerzitě.

Od artefaktů k faktům

Schopnost obnovit kvalitu webových videí bez obecného, někdy přehnaného ‘halucinace’ detailů poskytovaných programy, jako je Gigapixel (a většina populárních open source balíčků podobného rozsahu), by mohla mít důsledky pro počítačové vidění výzkumný sektor.

Výzkum založený na video-založených technologiích počítačového vidění často spoléhá na záběry získané z platforem, jako je YouTube a Twitter, kde jsou kompresní metody a kodeky použity úzce střeženy, nelze je snadno získat na základě artefaktových vzorců nebo jiných vizuálních indikátorů a mohou periodicky měnit.

Většina projektů, které využívají webové video, se nevěnují kompresi a musí učinit ústupky pro dostupnou kvalitu komprimovaného videa, které platformy nabízejí, protože nemají přístup k původním vysoce kvalitním verzím, které uživatelé nahráli.

Tudíž schopnost věrně obnovit vyšší kvalitu a rozlišení takových videí bez zavedení downstream vlivu z nesouvisejících počítačových vidění dat by mohla pomoci odstranit časté obejití a ústupky, které projekty CV musí目前 dělat pro degradované video zdroje.

Platformy, jako je YouTube, příležitostně trubky hlásí majoritní změny v tom, jak komprimují uživatelům videa (jako VP9), ale žádná z nich explicitně neodhalí celý proces nebo přesné kodeky a nastavení použité pro ztenčení vysoce kvalitních souborů, které uživatelé nahráli.

Metoda

Předchozí přístupy k hlubokému učení založenému na obnově videa zahrnovaly obecnou extrakci funkcí, buď jako přístup k obnově jednotlivých rámců nebo v multifunkční architektuře, která využívá optický tok (tj. bere v úvahu sousední a pozdější rámce při obnově aktuálního rámce).

Všechny tyto přístupy musely bojovat s ‘černou skříňkou’ – skutečností, že nemohou prozkoumat kompresní účinky v jádru technologií, protože není jisté, zda jsou jádro technologie nebo jak byly nakonfigurovány pro konkrétní uživatelům nahrávané video.

VOTES místo toho hledá extrahovat významné funkce přímo z původního a komprimovaného videa a určit vzorce transformace, které se budou generalizovat na standardy několika platforem.

Zjednodušená konceptuální architektura pro VOTES.

Zjednodušená konceptuální architektura pro VOTES.

VOTES používá speciálně vyvinutý modul pro detekci degradace (DSM, viz obrázek výše) pro extrakci funkcí v konvolučních blocích. Více rámců je pak předáno modulu pro extrakci a zarovnání funkcí (FEAM), se kterými jsou pak předány modulu pro modulaci degradace (DMM). Nakonec modul pro rekonstrukci vystupuje obnovované video.

Data a experimenty

V nové práci se výzkumníci soustředili na obnovu videa nahrávaného na a staženého z platformy WeChat, ale byli znepokojeni tím, aby zajistili, že výsledný algoritmus by mohl být adaptován na jiné platformy.

Ukázalo se, že jednou, co získali efektivní model obnovy pro videa WeChat, přizpůsobení ho na Bilibili, Twitter a YouTube trvalo pouze 90 sekund pro jeden epochu pro každý přizpůsobený model pro každou platformu (na stroji se 4 NVIDIA Tesla P40 GPU s celkovým 96GB VRAM).

Přizpůsobení úspěšného modelu WeChat na jiné video-sdílecí platformy se ukázalo jako poměrně triviální. Zde vidíme VOTES dosahující téměř okamžitě parity výkonu napříč různými platformami, pomocí datasetu UVSSM a datasetu REDS (viz níže).

Přizpůsobení úspěšného modelu WeChat na jiné video-sdílecí platformy se ukázalo jako poměrně triviální. Zde vidíme VOTES dosahující téměř okamžitě parity výkonu napříč různými platformami, pomocí datasetu UVSSM a datasetu REDS (viz níže).

Pro naplnění datasetu UVSSM výzkumníci shromáždili 264 videí v délce 5-30 sekund, každé s rámcovou frekvencí 30fps, pocházejících buď přímo z mobilních telefonních kamer nebo z internetu. Videa byla buď 1920 x 1080 nebo 1280 x 270 rozlišení.

Obsah (viz předchozí obrázek) zahrnoval městské pohledy, krajiny, lidi a zvířata, mezi mnoha dalšími tématy, a jsou použitelná v veřejném datasetu prostřednictvím Creative Commons Attribution licence, která umožňuje opětovné použití.

Autoři nahráli 214 videí na WeChat pomocí pěti různých značek mobilních telefonů, získali výchozí video rozlišení WeChat 960×540 (pokud zdroj video není již menší než tyto rozměry), mezi nejvíce ‘trestající’ konverze napříč populárními platformami.

Nahoře vlevo, původní HQ rámec se třemi zvětšenými částmi; nahoře vpravo, stejný rámec z platformy-degradovaného komprimovaného verze stejného videa; dole vlevo, vypočtená degradace komprimovaného rámce; a dole vpravo, následná 'pracovní oblast' pro VOTES, aby se soustředil na ni. Zjevně je velikost nízkokvalitního obrázku polovina velikosti HQ, ale byla zde změněna pro srovnání.

Nahoře vlevo, původní HQ rámec se třemi zvětšenými částmi; nahoře vpravo, stejný rámec z platformy-degradovaného komprimovaného verze stejného videa; dole vlevo, vypočtená degradace komprimovaného rámce; a dole vpravo, následná ‘pracovní oblast’ pro VOTES, aby se soustředil na ni. Zjevně je velikost nízkokvalitního obrázku polovina velikosti HQ, ale byla zde změněna pro srovnání.

Pro pozdější srovnání s konverzními rutinami jiných platforem výzkumníci nahráli 50 videí ne zahrnutých do původních 214 na Bilibili, YouTube a Twitter. Původní rozlišení videí bylo 1280×270, s staženými verzemi o rozměrech 640×360.

To přináší dataset UVSSM do celkového počtu 364 párů původních (HQ) a sdílených (LQ) videí, se 214 na WeChat a 50 na Bilibili, YouTube a Twitter.

Pro experimenty byly vybrány 10 náhodných videí jako testovací sada, čtyři jako validační sada a zbývajících 200 jako základní trénovací sada. Experimenty byly provedeny pětkrát s K-fold cross validací, s výsledky průměrovány napříč těmito instancemi.

Při testech na obnovu videa byl VOTES porovnán se Spatio-Temporal Deformable Fusion (STDF). Pro zvýšení rozlišení byl testován proti Enhanced Deformable konvolucím (EDVR), RSDN, Video Super-resolution s Temporal Group Attention (VSR_TGA) a BasicVSR. Google’s jedno-etapová metoda COMISR byla také zahrnuta, i když se nehodí do architektury typu předchozích prací.

Metody byly testovány proti oběma UVSS a REDS dataset, s VOTES dosahující nejvyšší skóre:

Autoři tvrdí, že kvalitativní výsledky také naznačují převahu VOTES proti předchozím systémům:

Video rámce z REDS obnovené konkurenčními přístupy. Indikativní rozlišení pouze - viz článek pro definitivní rozlišení.

Video rámce z REDS obnovené konkurenčními přístupy. Indikativní rozlišení pouze – viz článek pro definitivní rozlišení.

Poprvé publikováno 19. srpna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai