Andersons hoek

Consistente AI-video-inhoudsbewerking met tekstgeleide invoer

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Terwijl de professionele VFX-gemeenschap geïnteresseerd is – en soms een beetje bedreigd voelt – door nieuwe innovaties in beeld- en videosynthese, leidt het gebrek aan temporele continuïteit in de meeste AI-gebaseerde video-editingprojecten ertoe dat veel van deze inspanningen worden toegeschreven aan de ‘psychedelische’ sfeer, met schitterende en snel veranderende texturen en structuren, inconsistent effecten en het soort grove technologie-hantering dat doet denken aan de fotochemische era van visuele effecten.

Als je iets heel specifieks in een video wilt veranderen dat niet valt onder de categorie deepfakes (d.w.z. het opleggen van een nieuwe identiteit op bestaande beelden van een persoon), werken de meeste huidige oplossingen onder zeer strenge beperkingen, in termen van de precisie die nodig is voor productie-kwaliteit visuele effecten.

Een uitzondering is het voortdurende werk van een losse associatie van academici van het Weizmann Instituut voor Wetenschap. In 2021 kondigden drie van hun onderzoekers, in samenwerking met Adobe, een nieuw methode aan voor het decomponeren van video’s en het opleggen van een consistente interne mapping – een geordend neurale atlas – in een samengestelde uitvoer, complete met alfakanalen en temporeel samenhangende uitvoer.

Uit het paper van 2021: een schatting van de complete doorgang van de weg in de bronclip wordt bewerkt via een neurale netwerk op een manier die traditioneel uitgebreide rotoscoping en match-moving zou vereisen. Aangezien de achtergrond- en voorgrondelementen worden afgehandeld door verschillende netwerken, zijn masks echt 'automatisch'. Bron: https://layered-neural-atlases.github.io/

Uit het paper van 2021: een schatting van de complete doorgang van de weg in de bronclip wordt bewerkt via een neurale netwerk op een manier die traditioneel uitgebreide rotoscoping en match-moving zou vereisen. Aangezien de achtergrond- en voorgrondelementen worden afgehandeld door verschillende netwerken, zijn masks echt ‘automatisch’. Bron: https://layered-neural-atlases.github.io/

Hoewel het valt onder het bereik van optische stroom in VFX-pijpleidingen, heeft de geordende atlas geen directe equivalent in traditionele CGI-werkprocessen, aangezien het essentieel een ‘temporele textuurkaart’ vormt die kan worden geproduceerd en bewerkt via traditionele softwaremethoden. In de tweede afbeelding in de illustratie hierboven wordt de achtergrond van de wegoppervlak (figuurlijk) weergegeven over de gehele looptijd van de video. Het veranderen van die basisafbeelding (derde afbeelding van links in de illustratie hierboven) produceert een consistente verandering in de achtergrond.

De afbeeldingen van de ‘uitgevouwen’ atlas hierboven vertegenwoordigen alleen individuele geïnterpreteerde frames; consistente veranderingen in elk doelvideoframe worden teruggekaart naar het oorspronkelijke frame, met behoud van eventuele noodzakelijke occlusies en andere vereiste scène-effecten, zoals schaduwen of reflecties.

De kernarchitectuur gebruikt een Multilayer Perceptron (MLP) om de uitgevouwen atlases, alfakanalen en mappings weer te geven, die allemaal worden geoptimaliseerd in concert, en geheel in een 2D-ruimte, waardoor NeRF-achtige voorafgaande kennis van 3D-geometriepunten, dieptekaarten en soortgelijke CGI-achtige attributen overbodig wordt.

De referentie-atlas van individuele objecten kan ook betrouwbaar worden gewijzigd:

Consistente verandering van een bewegend object onder het kader van 2021. Bron: https://www.youtube.com/watch?v=aQhakPFC4oQ

Consistente verandering van een bewegend object onder het kader van 2021. Bron: https://www.youtube.com/watch?v=aQhakPFC4oQ

In wezen combineert het systeem van 2021 geometrie-alignment, match-moving, mapping, re-texturizing en rotoscoping in een discreet neuronaal proces.

Text2Live

De drie oorspronkelijke onderzoekers van het paper van 2021, samen met NVIDIA -onderzoek, zijn enkele van de bijdragers aan een nieuwe innovatie op de techniek die de kracht van geordende atlases combineert met het soort tekstgeleide CLIP-technologie dat deze week weer prominent aanwezig is met de release van het DALL-E 2-kader.

De nieuwe architectuur, getiteld Text2Live, stelt een eindgebruiker in staat om lokale bewerkingen uit te voeren op daadwerkelijke video-inhoud op basis van tekstprompts:

Twee voorbeelden van voorgrond-bewerking. Voor betere resolutie en definitie, bekijk de originele video's op https://text2live.github.io/sm/pages/video_results_atlases.html

Twee voorbeelden van voorgrond-bewerking. Voor betere resolutie en definitie, bekijk de originele video’s op https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live biedt semantische en hoogwaardig gelokaliseerde bewerking zonder het gebruik van een vooraf getrainde generator, door gebruik te maken van een interne database die specifiek is voor de videoClip die wordt beïnvloed.

Achtergrond- en voorgrond (object) transformaties onder Text2Live. Bron: https://text2live.github.io/sm/pages/video_results_atlases.html

Achtergrond- en voorgrond (object) transformaties onder Text2Live. Bron: https://text2live.github.io/sm/pages/video_results_atlases.html

De techniek vereist geen door de gebruiker verstrekte masks, zoals een typische rotoscoping- of green-screen-werkstroom, maar schat relevancy-kaarten door een bootstrapping-techniek op basis van 2021-onderzoek van The School of Computer Science at Tel Aviv University en Facebook AI Research (FAIR).

Uitvoerkaarten gegenereerd via een transformer-gebaseerd generisch aandachtmodel.

Uitvoerkaarten gegenereerd via een transformer-gebaseerd generisch aandachtmodel.

Het nieuwe paper is getiteld Text2LIVE: Text-Driven Layered Image and Video Editing. Het originele team van 2021 wordt vergezeld door Weizmann’s Omer Bar-Tal, en Yoni Kasten van NVIDIA Research.

Architectuur

Text2Live bestaat uit een generator die getraind is op een enkele invoerbeeld en doeltekstprompts. Een Contrastive Language-Image Pretraining (CLIP) model dat vooraf getraind is op 400 miljoen tekst/afbeelding-paren, biedt geassocieerde visuele materialen waaruit gebruikersinvoertransformaties kunnen worden geïnterpreteerd.

De generator accepteert een invoerbeeld (frame) en produceert een doel-RGBA-laag met kleur- en transparantie-informatie. Deze laag wordt vervolgens samengesteld in de oorspronkelijke footage met aanvullende augmentaties.

De alfakanaal in de gegenereerde RGBA-laag biedt een interne compositiefunctie zonder terug te vallen op traditionele pijpleidingen met pixel-gebaseerde software zoals After Effects.

De alfakanaal in de gegenereerde RGBA-laag biedt een interne compositiefunctie zonder terug te vallen op traditionele pijpleidingen met pixel-gebaseerde software zoals After Effects.

Door te trainen op interne beelden die relevant zijn voor de doelvideo of -afbeelding, vermijdt Text2Live de vereiste om om te keren het invoerbeeld in de latent ruimte van een Generatief Adversarial Network (GAN), een praktijk die momenteel verre van exact genoeg is voor productievideo-editingvereisten, of om een Diffusiemodel te gebruiken dat nauwkeuriger en configureerbaar is, maar niet in staat is om trouw te blijven aan de doelvideo.

Verschillende prompt-gebaseerde transformatie-bewerkingen van Text2Live.

Verschillende prompt-gebaseerde transformatie-bewerkingen van Text2Live.

Vorige benaderingen hebben ofwel propagatie-gebaseerde methoden gebruikt of optische stroom-gebaseerde benaderingen. Aangezien deze technieken in zekere mate frame-gebaseerd zijn, zijn ze niet in staat om een consistente temporele verschijning van veranderingen in de uitvoervideo te creëren. Een neurale geordende atlas biedt daarentegen een enkele ruimte om veranderingen aan te pakken, die vervolgens trouw kunnen blijven aan de gepleegde verandering terwijl de video vordert.

Geen 'sizzling' of willekeurige hallucinaties: Text2Live verkrijgt een interpretatie van de tekstprompt 'roestige jeep' en past deze eenmaal toe op de neurale geordende atlas van de auto in de video, in plaats van de transformatie opnieuw te starten voor elk geïnterpreteerd frame.

Geen ‘sizzling’ of willekeurige hallucinaties: Text2Live verkrijgt een interpretatie van de tekstprompt ‘roestige jeep’ en past deze eenmaal toe op de neurale geordende atlas van de auto in de video, in plaats van de transformatie opnieuw te starten voor elk geïnterpreteerd frame.

Werkstroom van Text2Live's consistente transformatie van een Jeep in een roestige relic.

Werkstroom van Text2Live’s consistente transformatie van een Jeep in een roestige relic.

Text2Live is dichter bij een doorbraak in AI-gebaseerde compositing, eerder dan in de vruchtbare tekst-naar-afbeelding-ruimte die deze week veel aandacht heeft getrokken met de tweede generatie van OpenAI’s DALL-E-kader (die doelafbeeldingen kan incorporeren als onderdeel van het transformatieproces, maar beperkt is in zijn vermogen om direct in te grijpen in een foto, naast de censuur van brontrainingsgegevens en het opleggen van filters, ontworpen om gebruikersmisbruik te voorkomen).

Text2Live stelt de eindgebruiker in staat om een atlas te extraheren en deze vervolgens in één bewerking te bewerken in een hoge-controle pixel-gebaseerde omgeving zoals Photoshop (en mogelijk zelfs meer abstracte beeldsyntheseframeworks zoals NeRF), voordat het terug wordt gevoerd in een correct georiënteerde omgeving die niettemin niet vertrouwt op 3D-schatting of achterwaarts-georiënteerde CGI-gebaseerde benaderingen.

Verder, zoals de auteurs claimen, is Text2Live het eerste vergelijkbare kader dat masking en compositing bereikt in een geheel automatische manier.

 

Origineel gepubliceerd op 7 april 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai