Góc nhìn Anderson
GAN như một trình kết xuất khuôn mặt cho ‘CGI truyền thống’

Ý kiến Khi các Mạng đối kháng sinh (GANs) lần đầu tiên chứng minh khả năng của chúng trong việc tái tạo khuôn mặt 3D thực tế một cách ấn tượng, sự kiện này đã kích hoạt một cuộc đổ xô để khai thác tiềm năng chưa được khai thác của GANs trong việc tạo ra video có tính nhất quán về thời gian, đặc biệt là khuôn mặt con người.
Ở đâu đó trong không gian tiềm ẩn của GAN, dường như có một thứ tự và logic hợp lý – một sơ đồ logic ngữ nghĩa tiềm ẩn trong mã tiềm ẩn, cho phép GAN tạo ra nhiều góc nhìn và cách diễn giải khác nhau (như thay đổi biểu cảm) của một khuôn mặt – và sau đó cung cấp một phương pháp tạo video giả mạo sâu sắc thuyết phục về thời gian mà sẽ vượt qua tự mã hóa.
Đầu ra độ phân giải cao sẽ trở nên đơn giản so với môi trường độ phân giải thấp như slum, nơi các hạn chế của GPU buộc DeepFaceLab và FaceSwap phải hoạt động, trong khi ‘khu vực hoán đổi’ của một khuôn mặt (trong các công việc của tự mã hóa) sẽ trở thành ‘khu vực tạo’ của một GAN, được thông báo bởi một số hình ảnh đầu vào, hoặc thậm chí chỉ một hình ảnh.
Sẽ không còn sự không phù hợp giữa khuôn mặt ‘hoán đổi’ và ‘chủ’ vì toàn bộ hình ảnh sẽ được tạo từ đầu, bao gồm cả tóc, đường nét hàm và các cực của đường nét khuôn mặt, thường chứng minh là một thách thức đối với các công việc giả mạo sâu sắc của tự mã hóa.
Mùa đông khuôn mặt video GAN
Như nó đã xảy ra, nó không dễ như vậy. Cuối cùng, phân tách đã chứng minh là vấn đề trung tâm và vẫn là thách thức chính. Làm thế nào bạn có thể giữ được một bản sắc khuôn mặt riêng biệt và thay đổi tư thế hoặc biểu cảm mà không cần thu thập một tập hợp các hình ảnh tham chiếu hàng nghìn để dạy cho một mạng lưới thần kinh những gì xảy ra khi những thay đổi này được thực hiện, giống như các hệ thống tự mã hóa đã làm một cách cẩn thận?
Sau đó, suy nghĩ tiếp theo trong nghiên cứu tổng hợp và tổng hợp khuôn mặt GAN là một bản sắc đầu vào có thể được đưa ra các biến đổi mục đích, chung, mẫu không đặc异 cho bản sắc. Một ví dụ về điều này sẽ là áp dụng một biểu cảm lên một khuôn mặt GAN mà không có trong bất kỳ hình ảnh nào của người đó mà GAN biết.

Từ bài báo 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space, các biểu cảm mẫu được áp dụng cho một khuôn mặt đầu vào từ tập dữ liệu FFHQ. Nguồn: https://arxiv.org/pdf/2205.06102.pdf
Đó rõ ràng là một cách tiếp cận ‘một kích cỡ phù hợp với tất cả’ không thể bao gồm sự đa dạng của các biểu cảm khuôn mặt duy nhất cho một cá nhân. Chúng ta phải tự hỏi liệu một nụ cười độc đáo như của Jack Nicholson hoặc Willem Dafoe có thể nhận được một diễn giải trung thành dưới ảnh hưởng của các mã tiềm ẩn ‘trung bình’ như vậy.
Các khả năng ‘hóa thân’ theo phong cách những năm 1980 của InterFaceGAN và các khung tương tự chủ yếu là một cách để minh họa con đường hướng tới biến đổi như một hình ảnh được tái chiếu qua một mã tiềm ẩn phù hợp (như ‘tuổi’). Về việc sản xuất cảnh quay video có tính nhất quán về thời gian, những kế hoạch như vậy cho đến nay đã đủ điều kiện là ‘thảm họa ấn tượng’.
Nếu bạn thêm vào đó khó khăn trong việc tạo ra tóc nhất quán về thời gian, và thực tế là kỹ thuật khám phá/mã hóa mã tiềm ẩn không có hướng dẫn thời gian nội tại để làm việc (và nó khó biết cách tiêm những hướng dẫn đó vào một khung được thiết kế để tạo và tạo ra hình ảnh tĩnh, và không có điều khoản bản địa cho đầu ra video), thì có thể hợp lý khi kết luận rằng GAN không phải là Tất cả những gì bạn Cần ™ cho tổng hợp video khuôn mặt.
Hướng dẫn tham số
Cộng đồng nghiên cứu tổng hợp khuôn mặt GAN đang ngày càng chuyển hướng sang việc sử dụng khuôn mặt CGI ‘truyền thống’ tham số như một phương pháp để hướng dẫn và đưa ra trật tự cho các mã tiềm ẩn ấn tượng nhưng không kỷ luật trong không gian tiềm ẩn của một GAN.
Mặc dù các nguyên tắc khuôn mặt tham số đã là một phần của nghiên cứu thị giác máy tính trong hơn hai mươi năm, sự quan tâm đến cách tiếp cận này đã tăng lên gần đây, với việc sử dụng rộng rãi các nguyên tắc CGI Skinned Multi-Person Linear Model (SMPL) và kể từ đó được cải tiến với khuôn khổ Sparse Trained Articulated Human Body Regressor (STAR) do Viện Max Planck và ILM tiên phong.

SMPL (trong trường hợp này là một biến thể gọi là SMPL-X) có thể áp đặt một lưới tham số CGI phù hợp với tư thế ước tính (bao gồm cả biểu cảm, nếu cần) của toàn bộ cơ thể con người trong một hình ảnh, cho phép thực hiện các hoạt động mới trên hình ảnh bằng cách sử dụng lưới tham số như một hướng dẫn thể tích hoặc nhận thức. Nguồn: https://arxiv.org/pdf/1904.05866.pdf
Phát triển được hoan nghênh nhất trong dòng này là sáng kiến Rendering with Style của Disney vào năm 2019, kết hợp sử dụng bản đồ kết cấu truyền thống với hình ảnh được tạo bởi GAN, trong một nỗ lực để tạo ra đầu ra hoạt hình được cải thiện, giống như giả mạo sâu sắc.
GAN có một vị trí trong tổng hợp video khuôn mặt?
Việc đạt được biểu cảm động và tư thế ngoài phân phối từ một hình ảnh nguồn duy nhất dường như là một sự ám ảnh giống như thuật giả kim trong nghiên cứu tổng hợp khuôn mặt GAN tại thời điểm này, chủ yếu vì GANs là phương pháp duy nhất hiện có khả năng tạo ra khuôn mặt thần kinh có độ phân giải cao và độ trung thực tương đối cao: mặc dù các khuôn khổ giả mạo sâu sắc của tự mã hóa có thể đào tạo trên nhiều tư thế và biểu cảm trong thế giới thực, chúng phải hoạt động ở độ phân giải đầu vào/đầu ra bị hạn chế bởi VRAM và yêu cầu một ‘chủ’; trong khi NeRF bị hạn chế tương tự và – không giống như hai phương pháp kia – hiện không có phương pháp thành lập để thay đổi biểu cảm khuôn mặt và bị hạn chế về khả năng chỉnh sửa nói chung.
Dường như cách duy nhất để tiến về phía trước cho một hệ thống tổng hợp khuôn mặt CGI/GAN chính xác là một sáng kiến mới tìm cách lắp ráp một thực thể bản sắc đa ảnh trong không gian tiềm ẩn, nơi một mã tiềm ẩn cho bản sắc của một người không cần phải đi qua toàn bộ không gian tiềm ẩn để khai thác các tham số tư thế không liên quan, nhưng có thể tham khảo các hình ảnh thực tế của chính nó như tham chiếu cho các biến đổi.
Thậm chí trong một trường hợp như vậy, hoặc thậm chí nếu một mạng lưới StyleGAN hoàn chỉnh được đào tạo trên một tập hợp khuôn mặt đơn nhất (tương tự như các tập hợp đào tạo mà tự mã hóa sử dụng), logic ngữ nghĩa thiếu vẫn sẽ cần phải được cung cấp bởi các công nghệ phụ trợ như phân đoạn ngữ nghĩa hoặc khuôn mặt 3DMM tham số, những công nghệ này sẽ có ít nhất nhiều vật liệu hơn để làm việc.












