Góc nhìn Anderson

Disney Kết Hợp CGI Với Kỹ Thuật Kết Xuất Neural Để Giải Quyết Hiệu Ứng “Thung Lũng Kỳ Lạ”

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Bộ phận nghiên cứu AI của Disney đã phát triển một phương pháp lai cho mô phỏng khuôn mặt đạt chất lượng điện ảnh, kết hợp ưu điểm của việc kết xuất khuôn mặt bằng mạng nơ-ron với tính nhất quán của cách tiếp cận dựa trên CGI.

Bài báo đang chờ công bố có tiêu đề Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering, và được giới thiệu trong một video mới dài 10 phút trên kênh Disney Research của YouTube (được nhúng ở cuối bài viết*).

Meshes combined with neural facial renders. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Lưới được kết hợp với các kết xuất khuôn mặt neural. Xem video nhúng ở cuối bài để có chi tiết và chất lượng tốt hơn. Nguồn: https://www.youtube.com/watch?v=TwpLqTmvqVk

Như video đã chỉ ra, kết xuất khuôn mặt bằng mạng nơ-ron (bao gồm deepfake) có thể tạo ra mắt và bên trong miệng chân thực hơn rất nhiều so với khả năng của CGI, trong khi các kết cấu khuôn mặt do CGI tạo ra lại nhất quán hơn và phù hợp cho đầu ra VFX cấp điện ảnh.

Do đó, Disney đang thử nghiệm việc để bộ tạo mạng nơ-ron StyleGan2 của NVIDIA StyleGan2 xử lý các đặc điểm xung quanh khuôn mặt và các yếu tố “cực kỳ quan trọng” như mắt, trong khi chồng lên lớp da khuôn mặt CGI nhất quán và các thành phần liên quan vào kết quả.

From the video (see end of article), the architectural concept behind Disney's hybrid approach, where an old-school CGI mesh, of the type used to recreate 'young' Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

Từ video (xem cuối bài), khái niệm kiến trúc đằng sau cách tiếp cận lai của Disney, trong đó một lưới CGI kiểu cũ, giống như loại được dùng để tái tạo Carrie Fisher trẻ và Peter Cushing đã khuất cho Rogue One (2016), được tích hợp vào môi trường khuôn mặt được kết xuất bằng mạng nơ-ron.

Video ngầm đề cập đến những chỉ trích thường xuyên về tính không xác thực và hiệu ứng “thung lũng kỳ lạ” của việc tái tạo CGI diễn viên người Anh đã qua đời trong Star Wars, Peter Cushing, trong Rogue One (2016), đồng thời thừa nhận:

‘[Có] vẫn còn một khoảng cách rất lớn giữa những gì mọi người có thể dễ dàng ghi lại và kết xuất so với các bản sao kỹ thuật số chân thực cuối cùng, đầy đủ tóc, mắt và bên trong miệng. Để thu hẹp khoảng cách này, thường cần rất nhiều công việc thủ công từ các nghệ sĩ lành nghề.’

Thực tế, ngay cả các hệ thống ghi nhận khuôn mặt hiện đại nhất cũng không cố gắng tái tạo mắt, bên trong miệng hoặc tóc, vì chúng gặp vấn đề về tính xác thực trong các kỹ thuật như vậy (đối với mắt) hoặc về tính nhất quán thời gian (đối với tóc).

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline.

Video minh họa những gì các nghệ sĩ VFX sẽ nhận được sau một buổi ghi nhận khuôn mặt hiện đại điển hình. Mắt, tóc, râu mặt và bên trong miệng sẽ phải được các đội riêng biệt trong quy trình sản xuất xử lý, cùng với việc tạo kết cấu và chiếu sáng.

Kiểm Soát Chiếu Sáng

Phương pháp lai cũng mang lại lợi thế trong việc chiếu sáng lại – một thách thức đáng chú ý đối với việc kết xuất khuôn mặt bằng mạng nơ-ron, vì các lớp da CGI được chồng lên có thể được chiếu sáng lại một cách dễ dàng hơn.

An animated version of the CGI/Neural approach.

Một phiên bản hoạt hình của cách tiếp cận CGI/Neural.

Trong những môi trường khó khăn hơn, chẳng hạn như các buổi quay ngoài trời, các nhà nghiên cứu đã phát triển một phương pháp tô lại (inpainting) xung quanh một loại vùng phi quân sự bao quanh người đang được “tạo”.

A black margin is generated to allow a 'canvas' for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

Một lề đen được tạo ra để cung cấp một “bảng vẽ” cho việc tô lại các phần bên ngoài của danh tính và tích hợp da CGI vào đầu ra kết hợp CGI/neural.

Video ghi chú:

‘[Bộ] kết xuất neural không khớp hoàn hảo với ràng buộc nền. – nó chỉ được dùng làm hướng dẫn, vì việc tối ưu các thành phần con người thực tế như tóc, mắt và răng là mục tiêu chính. Thách thức hơn là cố gắng duy trì một danh tính nhất quán, trong khi thay đổi ánh sáng môi trường.’

Tạo Lưới CGI Từ Các Kết Xuất Neural

Nhóm nghiên cứu cũng đã phát triển một bộ mã hoá tự động biến đổi (variational autoencoder) được huấn luyện trên một cơ sở dữ liệu lớn (không được chỉ định) các hình ảnh khuôn mặt 3D, và khẳng định nó có thể tạo ra các lưới khuôn mặt 3D “ngẫu nhiên nhưng hợp lý” từ dữ liệu thực.

Có một số hạn chế mà nghiên cứu này cần vượt qua, bao gồm khó khăn trong việc giữ cho tóc duy trì tính nhất quán thời gian trong các kết xuất neural, và video (xem bên dưới) cho thấy một số ví dụ về tóc biến đổi nhanh chóng trong khi khung quay xung quanh khuôn mặt CGI/neural vẫn nhất quán.

Tính nhất quán thời gian trong việc kết xuất video neural là một vấn đề rộng hơn nhiều so với chỉ Disney, và có vẻ khả năng các phiên bản sau của hệ thống này sẽ dựa vào việc thêm tóc “sau khi render”, hoặc các phương pháp khác để tạo tóc thay vì hy vọng một cách tiếp cận neural mới sẽ cuối cùng giải quyết được.

Ứng Dụng Cho Việc Tạo Dữ Liệu

Phương pháp này cũng được đề xuất như một cách tiềm năng để tạo dữ liệu tổng hợp, và làm phong phú thêm bộ sưu tập hình ảnh khuôn mặt, vốn trong những năm gần đây đã trở nên độc điệu một cách nguy hiểm.

Disney envisages the new technique populating facial image datasets.

Disney hình dung kỹ thuật mới sẽ lấp đầy các bộ dữ liệu hình ảnh khuôn mặt.

‘[Mỗi] kết quả ảnh thực tế mà chúng tôi tạo ra đều có một hình học và bản đồ ngoại hình tương ứng, được kết xuất từ các góc nhìn camera không xác định với ánh sáng đã biết. Thông tin “đúng thực” này có thể quan trọng cho việc đào tạo các ứng dụng downstream, như tái tạo khuôn mặt 3D đơn mắt, nhận dạng khuôn mặt, hoặc hiểu cảnh. Do đó mỗi lần kết xuất kết quả có thể được coi là một mẫu dữ liệu, và chúng tôi có thể tạo ra nhiều biến thể của nhiều cá nhân khác nhau.’

‘Hơn nữa, ngay cả đối với một người duy nhất được kết xuất với một biểu cảm, một góc nhìn và một ánh sáng duy nhất, chúng tôi vẫn có thể tạo ra các biến thể ngẫu nhiên của kết xuất ảnh thực bằng cách thay đổi hạt ngẫu nhiên trong quá trình tối ưu.’

Các nhà nghiên cứu lưu ý rằng sự đa dạng trong đầu ra có thể cấu hình này có thể hữu ích trong việc đào tạo các ứng dụng nhận dạng khuôn mặt, kết luận:

‘[Phương pháp] của chúng tôi có thể tận dụng công nghệ hiện tại cho việc ghi nhận da khuôn mặt, mô hình hoá và kết xuất, và tự động tạo ra các kết xuất khuôn mặt ảnh thực đầy đủ phù hợp với danh tính, biểu cảm và cấu hình cảnh mong muốn. Cách tiếp cận này có ứng dụng trong việc kết xuất khuôn mặt cho phim và giải trí, tiết kiệm công sức của các nghệ sĩ thủ công và cũng cho việc tạo dữ liệu trong các lĩnh vực học sâu khác nhau.’

Để xem chi tiết hơn về cách tiếp cận mới, hãy xem video dài 10 phút được phát hành hôm nay:

 * Liên kết video gốc đã được thay thế bằng một liên kết khác có vẻ giống hệt sau 8 giờ kể từ khi bài viết này được đăng. Tôi đã thay đổi tất cả các liên kết liên quan, vì không còn dấu vết của video gốc.

 

8:24 GMT+2 – Đã thay thế video, vì nó đã bị kênh Disney Research trên YouTube thay đổi vì lý do nào đó.

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai