Andersons vinkel

Konsekvent AI-videoinnehållsredigering med textstyrd inmatning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Medan den professionella VFX-gemenskapen är fascinerad – och ibland känner sig lite hotad – av nya innovationer inom bild- och videosyntes, så förpassas många av dessa ansträngningar till den “psykedeliska” sfären på grund av bristen på tidskontinuitet i de flesta AI-baserade videoredigeringsprojekt, med skimrande och snabbt ändrade texturer och strukturer, inkonsekventa effekter och den typen av grov teknologi som påminner om foto kemisk era av visuella effekter.

Om du vill ändra något mycket specifikt i en video som inte faller inom området för deepfakes (dvs. påtvinga en ny identitet på befintliga inspelningar av en person), så fungerar de flesta av de nuvarande lösningarna under ganska allvarliga begränsningar, när det gäller den precision som krävs för produktionskvalitetsvisuella effekter.

En undantag är det pågående arbetet av en lös association av akademiker från Weizmann Institute of Science. 2021 meddelade tre av dess forskare, i samarbete med Adobe, en ny metod för att bryta ner video och lägga till en konsekvent inre karta – en lagrad neural atlas – i en sammansatt utdata, komplett med alfa-kanaler och tidskoherent utdata.

Från 2021-papperet: en uppskattning av den fullständiga genomresan av vägen i källklippet redigeras via ett neuronnätverk på ett sätt som traditionellt skulle kräva omfattande rotoskoping och match-moving. Eftersom bakgrundselement och förgrundsobjekt hanteras av olika nätverk är maskerna verkligen 'automatiska'.

Från 2021-papperet: en uppskattning av den fullständiga genomresan av vägen i källklippet redigeras via ett neuronnätverk på ett sätt som traditionellt skulle kräva omfattande rotoskoping och match-moving. Eftersom bakgrundselement och förgrundsobjekt hanteras av olika nätverk är maskerna verkligen ‘automatiska’. Källa: https://layered-neural-atlases.github.io/

Även om det ligger någonstans i det område som täcks av optisk flöde i VFX-pipeliner, har den lagrade atlasen ingen direkt motsvarighet i traditionella CGI-arbetsflöden, eftersom den i princip utgör en “tids-texturkarta” som kan produceras och redigeras genom traditionella programvarumetoder. I den andra bilden i illustrationen ovan representeras vägytan (figurativt) över hela videons löptid. Att ändra den här underliggande bilden (tredje bilden från vänster i illustrationen ovan) producerar en konsekvent förändring i bakgrunden.

Bilderna av den “utvecklade” atlasen ovan representerar endast enskilda tolkade ramar; konsekventa förändringar i valfri målvideo ram mappas tillbaka till den ursprungliga ramen, med bibehållande av eventuella nödvändiga ockultationer och andra krävda scenerelaterade effekter, såsom skuggor eller reflektioner.

Kärnarkitekturen använder ett Multilayer Perceptron (MLP) för att representera de utvecklade atlasen, alfa-kanalerna och kartorna, alla av vilka optimeras i konsert, och helt i ett 2D-utrymme, vilket eliminerar NeRF-liknande förkunskap om 3D-geometri punkter, djup kartor och liknande CGI-liknande attribut.

Referensatlasen för enskilda objekt kan också ändras på ett tillförlitligt sätt:

Konsekvent förändring av ett rörligt objekt under 2021-ramverket.

Konsekvent förändring av ett rörligt objekt under 2021-ramverket. Källa: https://www.youtube.com/watch?v=aQhakPFC4oQ

I princip kombinerar 2021-systemet geometrijustering, match-moving, kartläggning, omtexturering och rotoskoping till en diskret neural process.

Text2Live

De tre ursprungliga forskarna från 2021-papperet, tillsammans med NVIDIA -forskning, är bland bidragsgivarna till en ny innovation på tekniken som kombinerar kraften i lagrade atlas med den typen av textstyrd CLIP-teknologi som har återvänt till framträdande ställning den här veckan med OpenAI:s utgåva av DALL-E 2-ramverket.

Den nya arkitekturen, med titeln Text2Live, tillåter en slutanvändare att skapa lokaliserade redigeringar av faktisk videoinnehåll baserat på textprompt:

Två exempel på redigering av förgrunden. För bättre upplösning och definition, se de ursprungliga videorna på https://text2live.github.io/sm/pages/video_results_atlases.html

Två exempel på redigering av förgrunden. För bättre upplösning och definition, se de ursprungliga videorna på https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live erbjuder semantisk och högt lokaliserad redigering utan användning av en förtränad generator, genom att utnyttja en intern databas som är specifik för den video klipp som påverkas.

Bakgrund och förgrunds (objekt) transformationer under Text2Live.

Bakgrund och förgrunds (objekt) transformationer under Text2Live. Källa: https://text2live.github.io/sm/pages/video_results_atlases.html

Tekniken kräver inte användarangiven mask, såsom en typisk rotoskoping eller green-screen arbetsflöde, utan snarare uppskattar relevans kartor genom en bootstrapping-teknik baserad på 2021 forskning från The School of Computer Science at Tel Aviv University och Facebook AI Research (FAIR).

Utmatningskartor genererade via en transformer-baserad generisk uppmärksamhetsmodell.

Utmatningskartor genererade via en transformer-baserad generisk uppmärksamhetsmodell.

Den nya papperet är titeln Text2LIVE: Text-Driven Layered Image and Video Editing. Det ursprungliga 2021-laget är anslutet av Weizmanns Omer Bar-Tal, och Yoni Kasten av NVIDIA Research.

Arkitektur

Text2Live består av en generator som tränats på en enda inmatningsbild och måltextprompt. En Contrastive Language-Image Pretraining (CLIP) modell förtränad på 400 miljoner text/bildpar tillhandahåller associerat visuellt material från vilket användarindata transformationer kan tolkas.

Generatoren accepterar en inmatningsbild (ram) och producerar en mål RGBA-lager som innehåller färg- och opacitetsinformation. Detta lager komponeras sedan in i den ursprungliga filmen med ytterligare förstärkningar.

Alfa-kanalen i det genererade RGBA-lagret tillhandahåller en intern kompositfunktion utan återgång till traditionella pipelines som involverar pixelbaserad programvara som After Effects.

Alfa-kanalen i det genererade RGBA-lagret tillhandahåller en intern kompositfunktion utan återgång till traditionella pipelines som involverar pixelbaserad programvara som After Effects.

Genom att träna på interna bilder som är relevanta för målvideon eller bilden, undviker Text2Live kravet att antingen invertera inmatningsbilden till den latenta utrymmet för en Generative Adversarial Network (GAN), en praxis som för närvarande är långt ifrån exakt nog för produktionsvideo redigeringskrav, eller använda en Diffusionsmodell som är mer exakt och konfigurerbar, men inte kan upprätthålla trohet till målvideon.

Varierande prompt-baserad transformationsredigering från Text2Live.

Varierande prompt-baserad transformationsredigering från Text2Live.

Tidigare tillvägagångssätt har antingen använt baserade metoder eller optiskt flödesbaserade tillvägagångssätt. Eftersom dessa tekniker är till viss del ram-baserade, kan varken av dem skapa en konsekvent tidsmässig utseende av förändringar i utdata-videon. En neural lagrad atlas, istället, tillhandahåller ett enda utrymme för att hantera förändringar, som sedan kan förbli trogen mot den åtagande förändringen när videon fortskrider.

Inga 'sizzling' eller slumpmässiga hallucinationer: Text2Live erhåller en tolkning av textprompten 'rostig jeep', och tillämpar den en gång på den neurala lagrade atlasen av bilen i videon, istället för att starta om transformationen för varje tolkad ram.

Inga ‘sizzling’ eller slumpmässiga hallucinationer: Text2Live erhåller en tolkning av textprompten ‘rostig jeep’, och tillämpar den en gång på den neurala lagrade atlasen av bilen i videon, istället för att starta om transformationen för varje tolkad ram.

Arbetsflöde för Text2Lives konsekventa transformation av en Jeep till en rostig relikt.

Arbetsflöde för Text2Lives konsekventa transformation av en Jeep till en rostig relikt.

Text2Live är närmare ett genombrott i AI-baserad kompositing, snarare än i den fruktbara text-till-bild-rymden som har dragit så mycket uppmärksamhet den här veckan med utgåvan av den andra generationen av OpenAI:s DALL-E-ramverk (som kan inkorporera målbilder som en del av transformationsprocessen, men förblir begränsad i sin förmåga att direkt ingripa i en foto, utöver censur av källträningsdata och påtvingande av filter, utformade för att förhindra användarmissbruk).

Text2Live tillåter istället slutanvändaren att extrahera en atlas och sedan redigera den i ett pass i högkontroll pixelbaserade miljöer som Photoshop (och eventuellt ännu mer abstrakta bildsyntes-ramverk som NeRF), innan den matas tillbaka till en korrekt orienterad miljö som ändå inte förlitar sig på 3D-estimering eller bakåtriktade CGI-baserade tillvägagångssätt.

Text2Live, hävdar författarna, är det första jämförbara ramverket som uppnår maskering och kompositing på ett helt automatiskt sätt.

 

Publicerad första gången 7 april 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai