Mô hình và nền tảng AI
Các nhà nghiên cứu phát triển mô hình máy tính JL2P để dịch kịch bản phim thành hoạt hình

Các nhà nghiên cứu tại Đại học Carnegie Mellon đã phát triển một mô hình máy tính có khả năng dịch văn bản mô tả chuyển động vật lý thành hoạt hình máy tính đơn giản. Những phát triển mới này có thể làm cho việc tạo ra phim và hoạt hình khác trở nên dễ dàng hơn bằng cách cho phép máy tính đọc kịch bản và tạo ra hoạt hình trực tiếp.
Các nhà khoa học đã đạt được tiến bộ trong việc giúp máy tính hiểu cả ngôn ngữ tự nhiên và tạo ra các tư thế vật lý từ kịch bản. Mô hình máy tính mới này có thể là cầu nối giữa hai lĩnh vực này.
Louis-Philippe Morency, giáo sư phụ tá tại Viện Công nghệ Ngôn ngữ (LTI), và Chaitanya Ahuja, sinh viên tiến sĩ LTI, đã sử dụng một kiến trúc thần kinh được gọi là Joint Language-to-Pose (JL2P). Mô hình JL2P có khả năng nhúng chung các câu và chuyển động vật lý. Điều này cho phép nó học cách ngôn ngữ được kết nối với hành động, cử chỉ và chuyển động.
“Tôi nghĩ chúng ta đang ở giai đoạn đầu của nghiên cứu này, nhưng từ góc độ mô hình, trí tuệ nhân tạo và lý thuyết, đây là một thời điểm rất thú vị,” Morency nói. “Hiện tại, chúng ta đang nói về việc tạo hoạt hình cho các nhân vật ảo. Cuối cùng, liên kết giữa ngôn ngữ và cử chỉ này có thể được áp dụng cho robot; chúng ta có thể chỉ cần nói với robot trợ lý cá nhân về việc chúng ta muốn nó làm.
“Chúng ta cũng có thể đi theo hướng ngược lại – sử dụng liên kết giữa ngôn ngữ và hoạt hình để máy tính có thể mô tả những gì đang xảy ra trong một video,” anh thêm.
Mô hình Joint Language-to-Pose sẽ được Ahuja trình bày vào ngày 19 tháng 9 tại Hội nghị Quốc tế về Tầm nhìn 3D. Hội nghị này sẽ diễn ra tại thành phố Quebec, Canada.
Mô hình JL2P được tạo ra bằng cách tiếp cận học tập theo chương trình.Bước quan trọng đầu tiên là mô hình phải học các chuỗi ngắn và dễ dàng. Điều đó sẽ là một thứ như “Một người đi bộ về phía trước.” Sau đó, nó chuyển sang các chuỗi dài hơn và khó hơn như “Một người bước về phía trước, sau đó quay lại và bước về phía trước một lần nữa,” hoặc “Một người nhảy qua chướng ngại vật trong khi chạy.”
Khi mô hình sử dụng các chuỗi, nó xem xét động từ và trạng từ. Những từ này mô tả hành động và tốc độ / gia tốc của hành động. Sau đó, nó xem xét danh từ và tính từ, mô tả vị trí và hướng. Theo Ahuja, mục tiêu cuối cùng cho mô hình là tạo ra các chuỗi phức tạp với nhiều hành động xảy ra đồng thời hoặc theo trình tự.
Hiện tại, các hoạt hình chỉ giới hạn ở hình que, nhưng các nhà khoa học sẽ tiếp tục phát triển mô hình. Một trong những phức tạp phát sinh là theo Morency, nhiều thứ đang xảy ra cùng một lúc. Một số trong số chúng thậm chí đang xảy ra trong các chuỗi đơn giản.
“Sự đồng bộ giữa các bộ phận cơ thể rất quan trọng,” Morency nói. “Mỗi lần bạn di chuyển chân, bạn cũng di chuyển tay, thân và có thể đầu. Hoạt hình cơ thể cần phối hợp các thành phần khác nhau này, đồng thời đạt được các hành động phức tạp. Đưa câu chuyện ngôn ngữ vào môi trường hoạt hình phức tạp này vừa thách thức vừa thú vị. Đây là con đường dẫn đến sự hiểu biết tốt hơn về ngôn ngữ và cử chỉ.”
Nếu mô hình Joint Language-to-Pose có thể phát triển đến mức nó có thể tạo ra các hoạt hình và hành động phức tạp dựa trên ngôn ngữ, thì khả năng là vô tận. Không chỉ nó có thể được sử dụng trong các lĩnh vực như phim và hoạt hình, mà nó cũng sẽ giúp dẫn đến các phát triển trong việc hiểu ngôn ngữ và cử chỉ.
Khi nói đến trí tuệ nhân tạo, mô hình JL2P này có thể được sử dụng trên robot. Ví dụ, robot có thể được điều khiển và nói cho chúng biết phải làm gì, và chúng sẽ có thể hiểu ngôn ngữ và phản hồi tương ứng.
Những phát triển mới này sẽ ảnh hưởng đến nhiều lĩnh vực khác nhau, và mô hình sẽ tiếp tục trở nên mạnh mẽ hơn trong việc hiểu ngôn ngữ phức tạp.












