AI 모델 및 플랫폼

연구자들, 영화 대본을 애니메이션으로 변환하는 JL2P 컴퓨터 모델 개발

mm
Unite.AI를 Google의 선호 소스에 추가

카네기 멜런 대학교의 연구자들은 물리적 움직임을 설명하는 텍스트를 단순한 컴퓨터 생성 애니메이션으로 변환할 수 있는 컴퓨터 모델을 개발했습니다. 이러한 새로운 개발은 영화와 다른 애니메이션을 컴퓨터 모델이 대본을 읽는 것만으로 직접 생성할 수 있도록 만들 수 있습니다.

과학자들은 자연어와 물리적 姿勢를 생성하는 컴퓨터를 이해하는 데 진행을 하고 있습니다. 이 새로운 컴퓨터 모델은 그들 사이의 연결을 제공할 수 있습니다.

언어 기술 연구소(LTI)의 부교수인 루이 필립 모렌시(Louis-Philippe Morency)와 LTI의 박사 과정 학생인 차이타냐 아후자(Chaitanya Ahuja)는 Joint Language-to-Pose(JL2P)라는 신경 구조를 사용하고 있습니다. JL2P 모델은 문장과 물리적 움직임을 공동으로 임베딩할 수 있습니다. 이것은 언어와 행동, 제스처, 움직임 사이의 연결을 학습할 수 있도록 합니다.

“저는 이 연구가 초기 단계에 있다고 생각하지만, 모델링, 인공 지능, 이론적인 관점에서 볼 때 매우 흥미로운 순간입니다.” 모렌시 曰. “현재 우리는 가상 캐릭터를 애니메이션화하는 것에 대해 이야기하고 있습니다. 궁극적으로, 언어와 제스처 사이의 연결은 로봇에 적용될 수 있습니다. 우리는 개인용 로봇 조종사에게 우리가 원하는 것을 einfach하게 말할 수 있을 것입니다.

“우리는 또한 반대로 갈 수 있습니다. 언어와 애니메이션 사이의 연결을 사용하여 컴퓨터가 비디오에서发生하는 것을 설명할 수 있습니다.” 그는 추가했습니다.

Joint Language-to-Pose 모델은 9월 19일 퀘벡 시티에서 열리는 3D 비전 국제 컨퍼런스에서 아후자에 의해 발표될 예정입니다.

JL2P 모델은 커리큘럼-러닝 접근 방식을 통해 생성되었습니다. 첫 번째 중요한 단계는 모델이 짧고 쉬운 시퀀스를 학습하는 것이었습니다. 예를 들어, “一个人走向前方”과 같은 시퀀스입니다. 그런 다음 더 긴 시퀀스로 이동하여 “一个人向前 步行, 然后 转身并再次向前 步行” 또는 “一个人跳过 장애물ながら 달리기”와 같은 시퀀스를 학습했습니다.

모델이 시퀀스를 사용할 때, 동사와 부사에 주목합니다. 이것은 행동과 속도/가속도를 설명합니다. 그런 다음, 명사와 형용사에 주목합니다. 이것은 위치와 방향을 설명합니다. 아후자의 말에 따르면, 모델의 최종 목표는 복잡한 시퀀스를 동시에 또는 순차적으로 애니메이션화하는 것입니다.

현재, 애니메이션은 스티크 피규어로 제한되지만 과학자들은 모델을 계속 개발할 것입니다. 모렌시가 말한 한 가지 복잡성은 많은 것들이同時에 발생한다는 것입니다. 일부는 심지어 단순한 시퀀스에서 발생합니다.

“신체 부위 사이의同步性은 매우 중요합니다.” 모렌시 曰. “매번 다리를 움직일 때, आप 또한 팔, 몸통, 그리고 가능的话 머리를 움직입니다. 몸의 애니메이션은 이러한不同的 구성 요소를 조정해야 하며, 동시에 복잡한 행동을 달성해야 합니다. 언어 내러티브를 이러한 복잡한 애니메이션 환경 내에서 이해하는 것은 도전적이며 흥미롭습니다. 이것은 언어와 제스처를 더 잘 이해하는 길입니다.”

만약 Joint Language-to-Pose 모델이 언어에 기반한 복잡한 애니메이션과 행동을 생성할 수 있는 지점까지 발전한다면, 가능성은巨大합니다. 영화와 애니메이션뿐만 아니라 언어와 제스처를 이해하는 데에도 도움이 될 것입니다.

인공 지능으로 돌아가면, JL2P 모델은 로봇에서 사용될 수 있습니다. 예를 들어, 로봇은 조종할 수 있고 우리가 원하는 것을 할 수 있으며 언어를 이해하고 따라서 반응할 수 있습니다.

이러한 새로운 개발은 많은 다른 분야에 영향을 미칠 것입니다. 그리고 모델은 복잡한 언어를 이해하는 능력을 계속 발전시킬 것입니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.