Andersonův úhel
Google’s LipSync3D nabízí vylepšenou synchronizaci ústních pohybů pomocí “deepfaked” technologie

Spolupráce mezi výzkumníky Google AI a Indickým technologickým institutem v Kharagpuru nabízí nový rámec pro syntézu mluvících hlav z audioobsahu. Projekt si klade za cíl vytvořit optimalizované a rozumně zdrojové způsoby pro vytváření obsahu mluvících hlav z audio, pro účely synchronizace ústních pohybů s dabovaným nebo strojově přeloženým audio a pro použití v avatarech, interaktivních aplikacích a jiných reálných prostředích.

Source: https://www.youtube.com/watch?v=L1StbX9OznY
Modely strojového učení vyškolené v tomto procesu – nazvané LipSync3D – vyžadují pouze jediné video cílové identity obličeje jako vstupní data. Datový přípravný pipeline odděluje extrakci obličejové geometrie od hodnocení osvětlení a dalších aspektů vstupního videa, což umožňuje ekonomičtější a zaměřenější výcvik.

The two-stage work-flow of LipSync3D. Above, the generation of a dynamically textured 3D face from the ‘target’ audio; below, the insertion of the generated mesh into a target video.
Ve skutečnosti může být nejvýznamnějším příspěvkem LipSync3D k výzkumu v této oblasti jeho algoritmus normalizace osvětlení, který odděluje výcvik a inferenci osvětlení.

Decoupling illumination data from general geometry helps LipSync3D to produce more realistic lip movement output under challenging conditions. Other approaches of recent years have limited themselves to ‘fixed’ lighting conditions that won’t reveal their more limited capacity in this respect.
Během předzpracování vstupních datových rámců musí systém identifikovat a odstranit specifické body, protože tyto jsou specifické pro osvětlení, za kterých bylo video pořízeno, a jinak by interferovaly s procesem přeosvětlení.

LipSync3D, jak jeho název napovídá, nevykonává pouze pixelovou analýzu obličejů, které vyhodnocuje, ale aktivně používá identifikované obličejové orientační body pro generování pohyblivých CGI-style mesh, spolu s “rozvinutými” texturami, které jsou obaleny kolem nich v tradičním CGI pipeline.

Pose normalization in LipSync3D. On the left are the input frames and detected features; in the middle, the normalized vertices of the generated mesh evaluation; and on the right, the corresponding texture atlas, which provides the ground truth for texture prediction. Source: https://arxiv.org/pdf/2106.04185.pdf
Kromě nového metodou osvětlení tvrzení výzkumníci, že LipSync3D nabízí tři hlavní inovace oproti předchozím pracím: separaci geometrie, osvětlení, polohy a textury do samostatných datových proudů v normalizovaném prostoru; snadno trénovatelný auto-regresivní model předpovědi textury, který produkuje časově konzistentní video syntézu; a zvýšenou realističnost, jak je hodnoceno lidskými hodnoceními a objektivními metrikami.

Splitting out the various facets of the video facial imagery allows greater control in video synthesis.
LipSync3D může odvodit vhodnou geometrii ústních pohybů přímo z audio analýzou fonémů a dalších aspektů řeči a překladem jich do známých odpovídajících svalových poloh kolem úst.

Tento proces používá společný predikční pipeline, kde inferovaná geometrie a textura mají vyhrazené kódéry v autoencoderovém nastavení, ale sdílejí audio kódér s řečí, která má být uložena v modelu:
LipSync3D’s labile pohyb syntéza je také určena k ovládání stylizovaných CGI avatarů, které jsou ve skutečnosti pouze stejné druhy mesh a texturové informace jako reálné světové obrazové informace:

A stylized 3D avatar has its lip movements powered in real time by a source speaker video. In such a scenario, the best results would be obtained by personalized pre-training.
Výzkumníci také předpokládají použití avatarů s trochu realističtějším pocitem:
![]()
Ukázka trénovacích časů pro videa se pohybuje od 3-5 hodin pro 2-5 minutové video, v pipeline, která používá TensorFlow, Python a C++ na GeForce GTX 1080. Trénovací relace používaly velikost batche 128 rámců přes 500-1000 epoch, s každým epochem reprezentujícím kompletní vyhodnocení videa.
Směrem k dynamickému opětovnému synchronizování ústních pohybů
Obor opětovného synchronizování ústních pohybů, aby se přizpůsobil novému audio tracku, získal velkou pozornost ve výzkumu počítačového vidění v posledních letech (viz níže), nejméně jako vedlejší produkt kontroverzní deepfake technologie.
V roce 2017 Univerzita ve Washingtonu představila výzkum schopný se učit synchronizaci úst z audio a použít ji ke změně ústních pohybů tehdejšího prezidenta Obamy. V roce 2018; Max Planck Institute for Informatics vedl další výzkumnou iniciativu k umožnění identity>identity video transferu, s lip sync jako vedlejší produkt procesu; a v květnu 2021 AI startup FlawlessAI odhalil svou proprietární lip-sync technologii TrueSync, široce přijatou v tisku jako umožňující vylepšené dabingové technologie pro hlavní filmové verze napříč jazyky.
A samozřejmě, probíhající vývoj deepfake otevřených zdrojových repozitářů poskytuje další větev aktivního uživatelsky přispívaného výzkumu v této sféře obličejové image syntézy.
nc technologie TrueSync, široce přijatá v tisku jako umožňující vylepšené dabingové technologie pro hlavní filmové verze napříč jazyky. A samozřejmě, probíhající vývoj deepfake otevřených zdrojových repozitářů poskytuje další větev aktivního uživatelsky přispívaného výzkumu v této sféře obličejové image syntézy.











