Andersons hoek

ST-NeRF: Compositing en Editing voor Video Synthese

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
ST-NeRF

Een Chinees onderzoeksconsortium heeft technieken ontwikkeld om bewerkings- en compositiemogelijkheden toe te voegen aan een van de meest recente onderzoeksgebieden van beeldsynthese – Neurale Radiance Fields (NeRF). Het systeem heet ST-NeRF (Spatio-Temporeel Coherent Neurale Radiance Field).

Het lijkt alsof er een fysieke camerabeweging in de afbeelding hieronder is, maar in werkelijkheid is het alleen een gebruiker die door verschillende gezichtspunten op video-inhoud scrolt die bestaat in een 4D-ruimte. Het gezichtspunt is niet vastgelegd op de prestaties van de mensen die in de video worden afgebeeld, waarvan de bewegingen vanuit elk deel van een 180-gradenradius kunnen worden bekeken.

ST-NeRF

Elk facet binnen de video is een afzonderlijk vastgelegd element, samengesteld tot een samenhangende scène die dynamisch kan worden verkend.

De facetten kunnen vrij worden gedupliceerd binnen de scène of worden vergroot:

ST-NeRF

Bovendien kan het temporale gedrag van elk facet gemakkelijk worden gewijzigd, vertraagd, omgekeerd of op een andere manier gemanipuleerd, waardoor een pad wordt geopend voor filterarchitecturen en een extreem hoog niveau van interpreteerbaarheid.

Twee afzonderlijke NeRF-facetten die op verschillende snelheden in dezelfde scène worden uitgevoerd. Bron: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Twee afzonderlijke NeRF-facetten die op verschillende snelheden in dezelfde scène worden uitgevoerd. Bron: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Er is geen noodzaak om performers of omgevingen te rotoscopen of om performers te laten bewegen zonder context van de bedoelde scène. In plaats daarvan wordt de beeldmateriaal op een natuurlijke manier vastgelegd via een array van 16 videocamera’s die 180 graden bestrijken:

16 camera's ST-NeRF

De drie elementen die hierboven worden afgebeeld, de twee mensen en de omgeving, zijn afzonderlijk en alleen voor illustratieve doeleinden omlijnd. Elk kan worden uitgewisseld en elk kan op een eerder of later tijdstip in hun individuele vastleggingstijdbalk worden geïntroduceerd.

De drie elementen die hierboven worden afgebeeld, de twee mensen en de omgeving, zijn afzonderlijk en alleen voor illustratieve doeleinden omlijnd. Elk kan worden uitgewisseld en elk kan op een eerder of later tijdstip in hun individuele vastleggingstijdbalk worden geïntroduceerd.

ST-NeRF is een innovatie op onderzoek naar Neurale Radiance Fields (NeRF), een machine learning-kader waarbij meerdere gezichtspuntvastleggingen worden gesynthetiseerd tot een navigeerbare virtuele ruimte door uitgebreide training (hoewel enkelvoudige gezichtspuntvastlegging ook een subsector van NeRF-onderzoek is).

Neurale Radiance Fields werken door meerdere gezichtspuntvastleggingen samen te voegen tot een enkele samenhangende en navigeerbare 3D-ruimte, met de gaten tussen de dekking geschat en weergegeven door een neurale netwerk. Waar video (in plaats van still images) wordt gebruikt, zijn de benodigde renderbronnen vaak aanzienlijk. Bron: https://www.matthewtancik.com/nerf

Neurale Radiance Fields werken door meerdere gezichtspuntvastleggingen samen te voegen tot een enkele samenhangende en navigeerbare 3D-ruimte, met de gaten tussen de dekking geschat en weergegeven door een neurale netwerk. Waar video (in plaats van still images) wordt gebruikt, zijn de benodigde renderbronnen vaak aanzienlijk. Bron: https://www.matthewtancik.com/nerf

De interesse in NeRF is de afgelopen negen maanden intens geworden, en een door Reddit onderhouden lijst van afgeleide of exploratorische NeRF-papers bevat momenteel zestig projecten.

 

Slechts een paar van de vele uitlopers van het oorspronkelijke NeRF-paper. Bron: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Slechts een paar van de vele uitlopers van het oorspronkelijke NeRF-paper. Bron: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Betaalbare Training

Het paper is een samenwerking tussen onderzoekers aan de Shanghai Tech University en DGene Digital Technology, en is met enthousiasme ontvangen op Open Review.

ST-NeRF biedt een aantal innovaties ten opzichte van eerdere initiatieven op het gebied van ML-gebaseerde navigeerbare video-ruimtes. Niet in de laatste plaats bereikt het een hoog niveau van realisme met slechts 16 camera’s. Hoewel Facebook’s DyNeRF slechts twee camera’s meer gebruikt, biedt het een veel beperktere navigeerbare boog.

Een voorbeeld van Facebook's DyNeRF-omgeving, met een meer beperkte bewegingsvrijheid en meer camera's per vierkante voet nodig om de scène te reconstrueren. Bron: https://neural-3d-video.github.io

Een voorbeeld van Facebook’s DyNeRF-omgeving, met een meer beperkte bewegingsvrijheid en meer camera’s per vierkante voet nodig om de scène te reconstrueren. Bron: https://neural-3d-video.github.io

Naast het ontbreken van de mogelijkheid om individuele facetten te bewerken en samen te voegen, is DyNeRF ook bijzonder duur in termen van rekenbronnen. In tegenstelling tot de Chinese onderzoekers, die stellen dat de trainingskosten voor hun gegevens tussen de $900-$3.000 liggen, in vergelijking met de $30.000 voor het state-of-the-art video-generatiemodel DVDGAN en intensieve systemen zoals DyNeRF.

Recensenten hebben ook opgemerkt dat ST-NeRF een belangrijke innovatie biedt door het proces van bewegingsleren te scheiden van het proces van beeldsynthese. Deze scheiding is wat bewerking en compositie mogelijk maakt, met eerdere benaderingen restrictief en lineair in vergelijking.

Hoewel 16 camera’s een zeer beperkte array is voor een volledige halve cirkel van zicht, hopen de onderzoekers om dit aantal in toekomstig werk verder te verlagen door het gebruik van proxy-voorgeprogrammeerde statische achtergronden en meer gegevensgedreven scène-modelleringbenaderingen. Ze hopen ook om herverlichtingsmogelijkheden te incorporeren, een recente innovatie in NeRF-onderzoek.

Beperkingen van ST-NeRF aanpakken

In de context van academische CS-papers die de werkelijke bruikbaarheid van een nieuw systeem in een afwerpbaar eindparagraaf neigen te vernietigen, zijn de beperkingen die de onderzoekers erkennen voor ST-NeRF ongebruikelijk.

Zij merken op dat het systeem momenteel geen afzonderlijke objecten in een scène kan identificeren en afzonderlijk weergeven, omdat de mensen in de beeldmateriaal zijn gesegmenteerd in afzonderlijke entiteiten via een systeem dat is ontworpen om mensen en niet objecten te herkennen – een probleem dat gemakkelijk kan worden opgelost met YOLO en soortgelijke kaders, met de moeilijkere taak van het extraheren van menselijke video al voltooid.

Hoewel de onderzoekers opmerken dat het momenteel niet mogelijk is om slow-motion te genereren, lijkt er weinig te zijn om de implementatie van deze functionaliteit met bestaande innovaties in frame-interpolatie, zoals DAIN en RIFE, te voorkomen.

Net als bij alle NeRF-implementaties en in veel andere sectoren van computer vision-onderzoek, kan ST-NeRF falen in gevallen van ernstige occlusie, waar het onderwerp tijdelijk wordt verborgen door een andere persoon of object, en kan het moeilijk zijn om het onderwerp voortdurend te volgen of om het nauwkeurig opnieuw te verkrijgen. Net als elders kan deze moeilijkheid moeten wachten op oplossingen upstream. Ondertussen geven de onderzoekers toe dat handmatige interventie noodzakelijk is in deze geocludeerde frames.

Tenslotte merken de onderzoekers op dat de menselijke segmentatieprocedures momenteel afhankelijk zijn van kleurverschillen, wat zou kunnen leiden tot onbedoelde samenvoeging van twee personen in één segmentatieblok – een struikelblok dat niet beperkt is tot ST-NeRF, maar inherent is aan de bibliotheek die wordt gebruikt, en dat mogelijk kan worden opgelost door optische flow-analyse en andere opkomende technieken.

Origineel gepubliceerd op 7 mei 2021.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]