Modele i platformy AI
Badacze opracowali model komputerowy JL2P do tłumaczenia scenariuszy filmowych na animacje

Badacze z Uniwersytetu Carnegie Mellon opracowali model komputerowy, który jest w stanie tłumaczyć tekst opisujący ruchy fizyczne na proste animacje generowane przez komputer. Nowe rozwiązanie może umożliwić tworzenie filmów i innych animacji bezpośrednio z modelu komputerowego czytającego scenariusz.
Naukowcy dokonali postępów w rozumieniu przez komputery języka naturalnego i generowaniu pozycji fizycznych z scenariusza. Ten nowy model komputerowy może być połączeniem między nimi.
Louis-Philippe Morency, associate professor w Language Technologies Institute (LTI), i Chaitanya Ahuja, student doktorancki LTI, wykorzystali architekturę neuronową zwaną Joint Language-to-Pose (JL2P). Model JL2P jest w stanie łączyć zdania i ruchy fizyczne. Pozwala mu to nauczyć się, jak język jest połączony z działaniem, gestami i ruchami.
“Myślę, że jesteśmy na wczesnym etapie tego badania, ale z punktu widzenia modelowania, sztucznej inteligencji i teorii jest to bardzo ekscytujący moment”, powiedział Morency. “Aktualnie mówimy o animowaniu wirtualnych postaci. Ostatecznie to połączenie między językiem a gestami może być zastosowane w robotach; możemy im powiedzieć, co chcemy, aby zrobili.
“Możemy również pójść w przeciwnym kierunku – użyć tego połączenia między językiem a animacją, aby komputer mógł opisać, co dzieje się w filmie”, dodał.
Model Joint Language-to-Pose zostanie przedstawiony przez Ahuję 19 września na Międzynarodowej Konferencji o Wizji 3D. Konferencja odbędzie się w Quebec City, Kanada.
Model JL2P został stworzony przy użyciu podejścia opartego na kursie. Pierwszym ważnym krokiem było nauczenie modelu krótkich, łatwych sekwencji. Mogłoby to być coś w rodzaju “Osoba idzie do przodu”. Następnie przeszedł do dłuższych i trudniejszych sekwencji, takich jak “Osoba idzie do przodu, potem obraca się i idzie do przodu ponownie” lub “Osoba skacze przez przeszkodę, biegnąc”.
Gdy model używa sekwencji, patrzy na czasowniki i przysłówki. Opisują one działanie i prędkość/ przyspieszenie działania. Następnie patrzy na rzeczowniki i przymiotniki, które opisują lokalizację i kierunki. Według Ahuji, ostatecznym celem modelu jest animowanie złożonych sekwencji z wieloma działaniami, które występują jednocześnie lub w sekwencji.
Na razie animacje są ograniczone do postaci z linii, ale naukowcy będą dalej rozwijać model. Jednym z powikłań, które pojawiają się, jest to, że według Morency’ego wiele rzeczy dzieje się jednocześnie. Niektóre z nich nawet występują w prostych sekwencjach.
“Synchronizacja między częściami ciała jest bardzo ważna”, powiedział Morency. “Każdy raz, gdy poruszasz nogami, poruszasz również rękami, tułowiem i możliwe, że głową. Animacje ciała muszą koordynować te różne składniki, jednocześnie osiągając złożone działania. Wprowadzanie narracji językowej w tym złożonym środowisku animacji jest zarówno wyzwaniem, jak i ekscytującym. To jest droga do lepszego zrozumienia mowy i gestów.”
Jeśli model Joint Language-to-Pose będzie w stanie rozwinąć się do punktu, w którym może tworzyć złożone animacje i działania na podstawie języka, możliwości są ogromne. Nie tylko może być on wykorzystywany w dziedzinach takich jak film i animacja, ale również pomoże w rozwoju zrozumienia mowy i gestów.
Przechodząc do sztucznej inteligencji, model JL2P może być wykorzystywany w robotach. Na przykład, roboty mogą być kontrolowane i powiedziane, co mają robić, i będą w stanie zrozumieć język i odpowiedzieć odpowiednio.
Te nowe rozwiązania będą miały wpływ na wiele różnych dziedzin, a model będzie coraz bardziej zdolny do zrozumienia złożonego języka.












