AIモデルとプラットフォーム

研究者が映画の脚本をアニメーション化するJL2Pコンピューターモデルを開発

mm
Unite.AI を Google の優先ソースに追加

カーネギーメロン大学の研究者は、物理的な動きを記述するテキストを単純なコンピューターゲネレーテッドアニメーションに翻訳できるコンピューターモデルを開発しました。これらの新しい開発により、映画やその他のアニメーションがコンピューターモデルが脚本を読み取ることで直接作成される可能性があります。

科学者は、コンピュータが自然言語を理解し、スクリプトから物理的なポーズを生成することを可能にするために進歩を遂げてきました。この新しいコンピューターモデルは、これらを結び付けるリンクとなる可能性があります。

言語テクノロジー研究所(LTI)の准教授であるルイ・フィリップ・モレンシーと、LTIの博士課程の学生であるチャイタニヤ・アフジャは、ジョイント言語・ポーズ(JL2P)と呼ばれるニューラルアーキテクチャを使用しています。JL2Pモデルは、文と物理的な動きを同時に埋め込むことができます。これにより、言語とアクション、ジェスチャー、動きの関係を学習することができます。

「私は、この研究の初期段階にありますが、モデリング、人工知能、理論の観点から見ると、非常に興奮する時期です」とモレンシーは述べました。「現在、私たちは仮想キャラクターのアニメーションについて話していますが、最終的には、この言語とジェスチャーのリンクはロボットに適用される可能性があります。ロボットに何をして欲しいかを単純に伝えることができるようになるかもしれません。」

「また、言語とアニメーションのリンクを使用して、コンピュータがビデオで何が起こっているかを説明することもできるようになる可能性があります」と彼は付け加えました。

ジョイント言語・ポーズモデルは、9月19日にカナダのケベックシティで開催される3Dビジョンの国際会議でアフジャによって発表される予定です。

JL2Pモデルは、カリキュラム学習アプローチによって作成されました。最初の重要なステップは、モデルが短い、簡単なシーケンスを学習することでした。例えば、「人々が前方に歩く」というようなものです。次に、より長く、より難しいシーケンスに移行しました。例えば、「人々が前方に歩き、次に回転して再び前方に歩く」というようなものです。

モデルがシーケンスを使用する際には、動作と速度/加速度を記述する動詞と副詞を考慮します。次に、場所と方向を記述する名詞と形容詞を考慮します。アフジャによると、モデルの最終的な目標は、同時に発生したりシーケンスで発生したりする複数の動作を持つ複雑なシーケンスをアニメーション化することです。

現在、アニメーションはスティックフィギュアに限定されていますが、科学者はモデルをさらに開発する予定です。モレンシーによると、複数のものが同時に発生しているという複雑さが生じます。

「身体の部分間の同期は非常に重要です」とモレンシーは述べました。「足を動かすたびに、腕、胴体、そして可能な場合は頭も動かします。身体のアニメーションは、これらの異なるコンポーネントを調整しながら、複雑な動作を達成する必要があります。言語の物語をこの複雑なアニメーション環境に取り入れることは、挑戦的ですが、興奮するものです。これは、話し手とジェスチャーの理解を向上させるための道です。」

ジョイント言語・ポーズモデルが複雑なアニメーションと動作を言語に基づいて生成できるようになれば、可能性は巨大です。映画やアニメーションだけでなく、話し手とジェスチャーの理解を向上させるための開発にも役立つことになります。

人工知能に移ると、JL2Pモデルはロボットで使用できる可能性があります。例えば、ロボットに何をして欲しいかを単純に伝えることができるようになるかもしれません。ロボットは言語を理解し、応答することができるようになるからです。

これらの新しい開発は、多くの分野に影響を与えるでしょう。モデルは、複雑な言語を理解する能力をさらに高めるでしょう。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。