Andersonův úhel
Změna emocí ve videích pomocí umělé inteligence

Výzkumníci z Řecka a Spojeného království vyvinuli novou hlubokou učící metodu pro změnu výrazů a zdánlivého rozpoložení lidí ve videích, zatímco zachovávají věrnost pohybům rtů původnímu zvuku způsobem, který předchozí pokusy nedokázaly dosáhnout.

Z videa, které doprovází článek (přiloženo na konci tohoto článku), krátký klip herce Al Pacina, jehož výraz byl jemně upraven pomocí NED, na základě vysokých sémantických konceptů definujících jednotlivé výrazy obličeje a jejich spojené emoce. Metoda “Reference-Driven” na pravé straně bere interpretované emoce ze zdrojového videa a aplikuje je na celou video sekvenci. Source: https://www.youtube.com/watch?v=Li6W8pRDMJQ
Tato konkrétní oblast spadá do rostoucí kategorie deepfaked emocí, kde je zachována identita původního mluvčího, ale jeho výrazy a mikrovýrazy jsou změněny. Jakmile se tato konkrétní technologie umělé inteligence zdokonalí, nabízí možnost pro filmová a televizní produkce provést jemné úpravy výrazů herců – ale také otevírá zcela novou kategorii “emocionálně upravených” video deepfakes.
Čímění tváří
Výrazy obličeje pro veřejně známé osoby, jako jsou politici, jsou přísně kurátorovány; v roce 2016 byly výrazy obličeje Hillary Clintonové podrobeny intenzivní mediální kontrole pro jejich potenciální negativní dopad na její volební vyhlídky; výrazy obličeje, jak se ukazuje, jsou také tématem zájmu pro FBI; a jsou kritickým ukazatelem v pracovních pohovorech, což činí (velmi vzdálenou) perspektivu živého “filtru kontroly výrazu” žádoucí pro uchazeče o práci, kteří se snaží projít předvýběrem na Zoomu.
Studie z roku 2005 z Velké Británie tvrdila, že vzhled obličeje ovlivňuje volební rozhodnutí, zatímco článek z roku 2019 ve Washington Post prozkoumal použití “mimo kontext” sdílení videoklipů, které je目前 nejbližší věc, co mají zastánci falešných zpráv, aby mohli skutečně měnit, jak se veřejně známá osoba zdá, že se chová, reaguje nebo cítí.
Směr k neuronové manipulaci výrazu
V současné době je stav umění v manipulaci s tváří poměrně rudimentární, protože zahrnuje řešení disentanglementu vysokých konceptů (jako smutný, rozzlobený, šťastný, úsměv) z skutečného videoobsahu. Ačkoli tradiční architektury deepfakes zdánlivě dosahují tohoto disentanglementu poměrně dobře, zrcadlení emocí napříč různými identitami stále vyžaduje, aby dvě tréninkové sady obličeje obsahovaly odpovídající výrazy pro každou identitu.

Typické příklady obrázků obličeje v sadách použitých pro trénování deepfakes. V současné době můžete změnit výraz osoby pouze vytvořením ID-specifických cest výrazvýraz v neuronové síti deepfakes. Softwarové deepfakes z roku 2017 nemají žádný vnitřní, sémantický pochopení “úsměvu” – pouze mapují a shodují se s vnímanými změnami geometrie obličeje napříč dvěma subjekty.
Co je žádoucí a dosud nebylo dokonale dosaženo, je rozpoznat, jak subjekt B (například) úsměv, a jednoduše vytvořit ‘úsměv’ přepínač v architektuře, bez nutnosti mapovat ho na ekvivalentní obraz subjektu A úsměvu.
Nová studie se nazývá Neuronový režisér emocí: Řízení výrazů obličeje pomocí sémantických konceptů v “divokých” videích a pochází od výzkumníků ze Školy elektrotechniky a počítačového inženýrství na Národní technické univerzitě v Aténách, Ústavu počítačové vědy na Nadaci pro výzkum a technologii Hellas (FORTH) a College of Engineering, Mathematics and Physical Sciences na University of Exeter ve Spojeném království.
Tým vyvinul rámec nazvaný Neuronový režisér emocí (NED), který zahrnuje 3D založenou síť pro překlad emocí, 3D-Based Emotion Manipulator.
NED bere přijatou sekvenci parametrů výrazu a překládá je do cílové domény. Je trénován na nezarovnaných datech, což znamená, že není nutné trénovat na datech, kde každá identita má odpovídající výrazy obličeje.

Video, které je uvedeno na konci tohoto článku, prochází sérií testů, kde NED uplatňuje zdánlivý emocionální stav na footage z YouTube datového souboru.
Autoři tvrdí, že NED je první video-založená metoda pro “řízení” herců v náhodných a nepředvídatelných situacích a zpřístupnili kód na projektové stránce NED.
Metoda a architektura
Systém je trénován na dvou velkých video datech, která jsou anotována “emocionálními” štítky.
Výstup je umožněn videem rendererem obličeje, který vykresluje požadovaný výraz do videa pomocí tradičních technik syntézy obličeje, včetně segmentace obličeje, zarovnání obličejových rysů a míchání, kde je pouze oblast obličeje syntetizována a poté aplikována na původní footage.

Architektura pro pipeline Neuronového režiséra emocí (NED). Source: https://arxiv.org/pdf/2112.00585.pdf
Původně systém získá 3D obnovu obličeje a aplikuje zarovnání obličejových rysů na vstupní snímky, aby identifikoval výraz. Poté jsou tyto obnovené parametry výrazu předány 3D založenému manipulátoru emocí a vypočtenému stylu vektorem pomocí buď sémantického štítku (jako “šťastný”) nebo referenčního souboru.
Referenční soubor je video, které zobrazuje konkrétní rozpoznávaný výraz/emoci, který je poté aplikován na celou cílovou video sekvenci, nahrazující původní výraz.
Konečná vygenerovaná 3D tvar obličeje je poté spojen s Normalizovaným Středním Souřadnicovým Obličejem (NMFC) a obrázky očí (červené tečky na obrázku výše) a předán neuronovému rendereru, který provede konečnou manipulaci.
Výsledky
Výzkumníci provedli rozsáhlé studie, včetně uživatelských a ablačních studií, aby vyhodnotili účinnost metody proti předchozím pracím a zjistili, že v meisten kategoriích NED překonává současný stav umění v tomto sub-sektoru neuronové manipulace obličeje.

Autoři studie předpokládají, že pozdější implementace této práce a nástroje podobné povahy budou užitečné především v televizním a filmovém průmyslu, uvádějí:
‘Naše metoda otevírá řadu nových možností pro užitečné aplikace neuronových renderovacích technologií, od postprodukce filmů a videoher po fotorealistické afektivní avatary.’
Toto je raná práce v oblasti, ale jedna z prvních, která se pokusila o opětovné vytvoření obličeje s videem místo statických obrázků. Ačkoli videa jsou vlastně mnoha statickými obrázky běžícími velmi rychle, existují časové úvahy, které činí předchozí aplikace přenosu emocí méně účinnými. Ve videu, které doprovází článek, a příkladech v článku, autoři zahrnuli vizuální srovnání výstupu NED proti ostatním srovnatelným nedávným metodám.
Více podrobných srovnání a mnoho dalších příkladů NED lze nalézt ve videu níže:
3. prosince 2021, 18:30 GMT+2 – Na žádost jednoho z autorů studie byly provedeny opravy týkající se “referenčního souboru”, který jsem omylem uvedl jako statický obrázek (když ve skutečnosti jde o video klip). Také byla provedena oprava názvu Ústavu počítačové vědy na Nadaci pro výzkum a technologii.
3. prosince 2021, 20:50 GMT+2 – Druhá žádost od jednoho z autorů studie o další opravě názvu výše uvedené instituce.














