KI-Modelle und Plattformen
Forscher entwickeln JL2P-Computermodell, um Film-Skripte in Animationen umzuwandeln

Forscher an der Carnegie Mellon University haben ein Computermodell entwickelt, das in der Lage ist, Text, der physische Bewegungen beschreibt, in einfache computer-generierte Animationen umzuwandeln. Diese neuen Entwicklungen könnten es ermöglichen, dass Filme und andere Animationen direkt aus einem Computermodell erstellt werden, das die Skripte liest.
Wissenschaftler haben Fortschritte gemacht, um Computer dazu zu bringen, sowohl natürliche Sprache als auch physische Posen aus Skripten zu verstehen. Dieses neue Computermodell kann die Verbindung zwischen ihnen sein.
Louis-Philippe Morency, ein Associate Professor am Language Technologies Institute (LTI), und Chaitanya Ahuja, ein LTI-Doktorand, haben eine neuronale Architektur verwendet, die als Joint Language-to-Pose (JL2P) bezeichnet wird. Das JL2P-Modell ist in der Lage, Sätze und physische Bewegungen gemeinsam zu verbinden. Dies ermöglicht es, zu lernen, wie Sprache mit Aktion, Gesten und Bewegungen verbunden ist.
“Ich denke, wir sind in einem frühen Stadium dieser Forschung, aber aus einer modell-, künstlicher-Intelligenz- und Theorie-Perspektive ist es ein sehr aufregendes Moment”, sagte Morency. “Im Moment sprechen wir über die Animation von virtuellen Charakteren. Schließlich könnte diese Verbindung zwischen Sprache und Gesten auf Roboter angewendet werden; wir könnten einfach einem persönlichen Assistenten-Roboter sagen, was wir wollen, dass er tut.
“Wir könnten auch schließlich in die andere Richtung gehen – mithilfe dieser Verbindung zwischen Sprache und Animation könnte ein Computer beschreiben, was in einem Video passiert”, fügte er hinzu.
Das Joint Language-to-Pose-Modell wird von Ahuja am 19. September auf der International Conference on 3D Vision präsentiert. Diese Konferenz findet in Quebec City, Kanada, statt.
Das JL2P-Modell wurde durch einen curriculum-basierten Ansatz erstellt. Der erste wichtige Schritt war, dass das Modell kurze, einfache Sequenzen lernte. Das wäre etwas wie “Eine Person geht nach vorne.” Es ging dann zu längeren und schwierigeren Sequenzen über, wie “Eine Person geht nach vorne, dann dreht sich um und geht nach vorne wieder” oder “Eine Person springt über ein Hindernis, während sie rennt.”
Wenn das Modell diese Sequenzen verwendet, betrachtet es Verben und Adverben. Diese beschreiben die Aktion und die Geschwindigkeit/Beschleunigung der Aktion. Dann betrachtet es Nomen und Adjektive, die Orte und Richtungen beschreiben. Laut Ahuja ist das Endziel des Modells, komplexe Sequenzen mit mehreren Aktionen zu animieren, die gleichzeitig oder in Folge auftreten.
Derzeit sind die Animationen auf Stangenfiguren beschränkt, aber die Wissenschaftler werden das Modell weiterentwickeln. Eine der Komplikationen, die entsteht, ist, dass laut Morency viele Dinge gleichzeitig passieren. Einige davon passieren sogar in einfachen Sequenzen.
“Die Synchronität zwischen Körperteilen ist sehr wichtig”, sagte Morency. “Jedes Mal, wenn Sie Ihre Beine bewegen, bewegen Sie auch Ihre Arme, Ihren Rumpf und möglicherweise Ihren Kopf. Die Körperanimationen müssen diese verschiedenen Komponenten koordinieren, während sie gleichzeitig komplexe Aktionen ausführen. Die Einbeziehung von Sprachnarrativen in diese komplexe Animationsumgebung ist sowohl herausfordernd als auch aufregend. Dies ist ein Weg, um Sprache und Gesten besser zu verstehen.”
Wenn das Joint Language-to-Pose-Modell so weit entwickelt ist, dass es komplexe Animationen und Aktionen auf der Grundlage von Sprache erstellen kann, sind die Möglichkeiten enorm. Es kann nicht nur in Bereichen wie Film und Animation verwendet werden, sondern auch zu Entwicklungen im Verständnis von Sprache und Gesten führen.
Wenn man zu künstlicher Intelligenz übergeht, kann das JL2P-Modell auf Roboter angewendet werden. Zum Beispiel könnten Roboter kontrolliert und angewiesen werden, was sie tun sollen, und sie könnten die Sprache verstehen und entsprechend reagieren.
Diese neuen Entwicklungen werden viele verschiedene Bereiche beeinflussen, und das Modell wird immer besser darin, komplexe Sprache zu verstehen.












