AI-modeller og plattformer

Forskere utvikler JL2P datamodell for å oversette filmmanus til animasjoner

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere ved Carnegie Mellon University har utviklet en datamodell som kan oversette tekst som beskriver fysiske bevegelser til enkle datagenererte animasjoner. Disse nye utviklingene kan gjøre det mulig å lage filmer og andre animasjoner direkte fra en datamodell som leser manus. 

Vitenskapsmenn har gjort fremgang i å få datamaskiner til å forstå både naturlig språk og generere fysiske posisjoner fra manus. Denne nye datamodellen kan være lenken mellom dem. 

Louis-Philippe Morency, en assosiert professor ved Language Technologies Institute (LTI), og Chaitanya Ahuja, en LTI-ph.d.-student, har brukt en neural arkitektur som kalles Joint Language-to-Pose (JL2P). JL2P-modellen kan sammenkoble setninger og fysiske bevegelser. Dette gjør det mulig for den å lære hvordan språk er koblet til handling, gester og bevegelser. 

“Jeg tror vi er i en tidlig fase av denne forskningen, men fra et modellering-, kunstig intelligens- og teoretisk perspektiv, er det en veldig spennende tid,” sa Morency. “For øyeblikket snakker vi om å animere virtuelle karakterer. Til slutt kan denne lenken mellom språk og gester bli brukt på roboter; vi kan kanskje bare si til en personlig assistent-robot hva vi ønsker at den skal gjøre.

“Vi kan også til slutt gå den andre veien — bruke denne lenken mellom språk og animasjon så en datamaskin kan beskrive hva som skjer i en video,” la han til.

Joint Language-to-Pose-modellen vil bli presentert av Ahuja den 19. september på den internasjonale konferansen om 3D-visjon. Den konferansen vil finne sted i Quebec City, Canada. 

JL2P-modellen ble skapt ved hjelp av en læreplan-tilnærming. Det første viktige skrittet var for modellen å lære korte, enkle sekvenser. Det ville være noe som “En person går fremover.” Den gikk deretter over til lengre og vanskeligere sekvenser som “En person går fremover, så snur seg om og går fremover igjen,” eller “En person hopper over et hinder mens den løper.” 

Når modellen bruker sekvensene, ser den på verb og adverb. Disse beskriver handlingen og hastigheten/akselerasjonen av handlingen. Deretter ser den på substantiv og adjektiver som beskriver lokasjoner og retninger. Ifølge Ahuja er sluttmålet for modellen å animere komplekse sekvenser med flere handlinger som skjer samtidig eller i sekvens. 

For øyeblikket er animasjonene begrenset til stikkmenn, men vitenskapsmennene vil fortsette å utvikle modellen. En av komplikasjonene som oppstår er at ifølge Morency, mange ting skjer samtidig. Noen av dem skjer sogar i enkle sekvenser. 

“Synchronisering mellom kroppsdeler er veldig viktig,” sa Morency. “Hver gang du flytter bena dine, flytter du også armene dine, torsoen din og kanskje hodet ditt. Kroppanimasjonene må koordinere disse forskjellige komponentene, samtidig som de oppnår komplekse handlinger. Å bringe språklig narrative inn i denne komplekse animasjonsmiljøet er både utfordrende og spennende. Dette er en vei mot bedre forståelse av tale og gester.”

Hvis Joint Language-to-Pose-modellen kan utvikles til å kunne lage komplekse animasjoner og handlinger basert på språk, er mulighetene enorme. Den kan ikke bare brukes i områder som film og animasjon, men vil også bidra til utviklingen av forståelse av tale og gester. 

Vendt mot kunstig intelligens, kan JL2P-modellen brukes på roboter. For eksempel kan roboter kanskje bli kontrollert og fortalt hva de skal gjøre, og de vil være i stand til å forstå språket og svare deretter. 

Disse nye utviklingene vil påvirke mange forskjellige felt, og modellen vil fortsette å bli mer kapabel til å forstå kompleks språk.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.