AI-modellen en platforms

Onderzoekers ontwikkelen JL2P-computermodel om filmscripts om te zetten in animaties

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers aan de Carnegie Mellon University hebben een computermodel ontwikkeld dat in staat is om tekst die fysieke bewegingen beschrijft om te zetten in eenvoudige computergegenereerde animaties. Deze nieuwe ontwikkelingen kunnen het mogelijk maken om films en andere animaties rechtstreeks te creëren vanuit een computermodel dat de scripts leest.

Wetenschappers hebben vooruitgang geboekt in het begrijpen van natuurlijke taal en het genereren van fysieke houdingen uit scripts. Dit nieuwe computermodel kan de verbinding tussen deze twee zijn.

Louis-Philippe Morency, een associate professor aan het Language Technologies Institute (LTI), en Chaitanya Ahuja, een LTI-promovendus, hebben een neurale architectuur gebruikt die Joint Language-to-Pose (JL2P) wordt genoemd. Het JL2P-model is in staat om zinnen en fysieke bewegingen samen te voegen. Dit stelt het in staat om te leren hoe taal verbonden is met actie, gebaren en bewegingen.

“Ik denk dat we in een vroeg stadium van dit onderzoek zitten, maar vanuit een modellerings-, kunstmatige intelligentie- en theorieperspectief is het een zeer spannend moment,” zei Morency. “Op dit moment praten we over het animeren van virtuele personages. Uiteindelijk kan deze verbinding tussen taal en gebaren ook op robots worden toegepast; we kunnen een persoonlijke assistentrobot gewoon vertellen wat we willen dat hij doet.

“We kunnen ook uiteindelijk de andere kant op gaan – met deze verbinding tussen taal en animatie kan een computer beschrijven wat er in een video gebeurt,” voegde hij eraan toe.

Het Joint Language-to-Pose-model zal op 19 september worden gepresenteerd door Ahuja op de International Conference on 3D Vision. Deze conferentie vindt plaats in Quebec City, Canada.

Het JL2P-model is gemaakt met een curriculum-lerenbenadering. De eerste belangrijke stap was dat het model korte, eenvoudige sequenties moest leren. Dat zou iets zijn als “Een persoon loopt naar voren.” Vervolgens ging het verder met langere en moeilijkere sequenties, zoals “Een persoon stapt naar voren, draait zich om en stapt weer naar voren,” of “Een persoon springt over een obstakel terwijl hij rent.”

Wanneer het model de sequenties gebruikt, kijkt het naar werkwoorden en bijwoorden. Deze beschrijven de actie en de snelheid/versnelling van de actie. Vervolgens kijkt het naar zelfstandige naamwoorden en bijvoeglijke naamwoorden, die locaties en richtingen beschrijven. Volgens Ahuja is het einddoel van het model om complexe sequenties met meerdere acties te animeren die tegelijkertijd of in sequentie plaatsvinden.

Op dit moment zijn de animaties beperkt tot stickfiguren, maar de wetenschappers zullen het model blijven ontwikkelen. Een van de complicaties die ontstaat, is dat volgens Morency veel dingen tegelijkertijd gebeuren. Sommige daarvan gebeuren zelfs in eenvoudige sequenties.

“Synchronisatie tussen lichaamsdelen is zeer belangrijk,” zei Morency. “Elke keer dat je je benen beweegt, beweeg je ook je armen, je torso en mogelijk je hoofd. De lichaamsanimaties moeten deze verschillende componenten coördineren, terwijl ze tegelijkertijd complexe acties bereiken. Het opnemen van taalverhalen in deze complexe animatieomgeving is zowel uitdagend als spannend. Dit is een pad naar een beter begrip van spraak en gebaren.”

Als het Joint Language-to-Pose-model in staat is om complexe animaties en acties te creëren op basis van taal, zijn de mogelijkheden enorm. Het kan niet alleen worden gebruikt in gebieden zoals film en animatie, maar zal ook helpen bij de ontwikkeling van het begrijpen van spraak en gebaren.

Als we kijken naar kunstmatige intelligentie, kan het JL2P-model worden gebruikt op robots. Bijvoorbeeld, robots kunnen worden gecontroleerd en verteld wat ze moeten doen, en ze zullen in staat zijn om de taal te begrijpen en dienovereenkomstig te reageren.

Deze nieuwe ontwikkelingen zullen veel verschillende gebieden beïnvloeden, en het model zal blijven groeien in zijn vermogen om complexe taal te begrijpen.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.