Góc nhìn Anderson
Xử lý ‘ngày tóc xấu’ trong Tổng hợp Hình ảnh Con người

Kể từ thời kỳ hoàng kim của tượng đá La Mã, việc miêu tả tóc con người đã là một thách thức đầy gai góc. Đầu người trung bình chứa 100.000 sợi tóc, có chỉ số khúc xạ khác nhau tùy theo màu sắc của nó, và ngoài một độ dài nhất định, sẽ di chuyển và thay đổi hình dạng theo cách chỉ có thể được mô phỏng bằng các mô hình vật lý phức tạp – cho đến nay, chỉ có thể áp dụng thông qua các phương pháp CGI truyền thống.

Từ nghiên cứu năm 2017 của Disney, một mô hình dựa trên vật lý cố gắng áp dụng chuyển động thực tế cho một kiểu tóc lỏng trong một quy trình CGI. Nguồn: https://www.youtube.com/watch?v=-6iF3mufDW0
Vấn đề này không được giải quyết tốt bởi các phương pháp deepfakes hiện đại. Trong một số năm, gói hàng đầu DeepFaceLab đã có một mô hình ‘toàn đầu’ có thể chỉ bắt được các hình thể cứng nhắc của các kiểu tóc ngắn (thường là của nam); và gần đây, DFL stablemate FaceSwap (cả hai gói đều được派 sinh từ mã nguồn DeepFakes năm 2017) đã cung cấp một triển khai của mô hình BiseNet phân đoạn ngữ nghĩa, cho phép người dùng bao gồm tai và tóc trong đầu ra deepfake.
Ngay cả khi miêu tả các kiểu tóc rất ngắn, kết quả thường hạn chế về chất lượng, với toàn bộ đầu xuất hiện chồng lên footage, chứ không được tích hợp vào nó.
Tóc GAN
Hai phương pháp cạnh tranh chính để mô phỏng con người là Truyền phát Quang học Neuron (NeRF), có thể bắt một cảnh từ nhiều góc nhìn và bao gồm một biểu diễn 3D của các góc nhìn này trong một mạng nơ-ron có thể khám phá; và Mạng Đối nghịch Generative (GAN), đáng chú ý hơn về mặt tổng hợp hình ảnh con người (không chỉ vì NeRF chỉ xuất hiện vào năm 2020).
Sự hiểu biết được suy luận của NeRF về hình học 3D cho phép nó tái tạo một cảnh với độ trung thực và nhất quán cao, ngay cả khi hiện tại nó có rất ít hoặc không có khả năng áp dụng các mô hình vật lý – và trên thực tế, phạm vi tương đối hạn chế cho bất kỳ loại biến đổi nào trên dữ liệu thu thập được mà không liên quan đến việc thay đổi góc nhìn của máy ảnh. Hiện tại, NeRF có khả năng rất hạn chế về việc tái tạo chuyển động tóc.
Phương pháp dựa trên GAN bắt đầu từ một bất lợi gần như致命, vì không giống như NeRF, không gian tiềm ẩn của một GAN không tự nhiên bao gồm sự hiểu biết về thông tin 3D. Do đó, tổng hợp hình ảnh khuôn mặt 3D dựa trên GAN đã trở thành một mục tiêu nóng trong nghiên cứu tạo hình ảnh gần đây, với InterFaceGAN năm 2019 là một trong những đột phá hàng đầu.
Tuy nhiên, ngay cả những kết quả được trình bày và chọn lọc của InterFaceGAN cũng chứng minh rằng sự nhất quán của tóc neuron vẫn là một thách thức khó khăn về tính nhất quán thời gian, đối với các quy trình VFX tiềm năng:

Tóc ‘nóng’ trong một biến đổi tư thế từ InterFaceGAN. Nguồn: https://www.youtube.com/watch?v=uoftpl3Bj6w
Khi nó trở nên rõ ràng hơn rằng việc tạo ra góc nhìn nhất quán thông qua việc điều khiển không gian tiềm ẩn alone có thể là một việc khó khăn, ngày càng nhiều bài báo đang xuất hiện rằng tích hợp thông tin 3D dựa trên CGI vào một quy trình GAN như một ràng buộc ổn định và chuẩn hóa.
Phần tử CGI có thể được đại diện bởi các nguyên thủy 3D trung gian như Mô hình Đường thẳng Đa người có Da (SMPL), hoặc bằng cách áp dụng các kỹ thuật suy luận 3D theo cách tương tự như NeRF, nơi hình học được đánh giá từ hình ảnh hoặc video nguồn.
Một công việc mới theo hướng này, được phát hành tuần này, là Mạng Đối nghịch Generative Consistent từ nhiều góc nhìn cho Tổng hợp Hình ảnh 3D (MVCGAN), một sự hợp tác giữa ReLER, AAII, Đại học Công nghệ Sydney, Học viện DAMO tại Tập đoàn Alibaba và Đại học Zhejiang.

Các tư thế khuôn mặt mới đáng tin cậy và mạnh mẽ được tạo ra bởi MVCGAN trên hình ảnh có nguồn gốc từ tập dữ liệu CELEBA-HQ. Nguồn: https://arxiv.org/pdf/2204.06307.pdf
MVCGAN tích hợp một mạng lưới phát xạ generative (GRAF) có khả năng cung cấp các ràng buộc hình học trong một Mạng Đối nghịch Generative, có thể đạt được một số khả năng tạo tư thế chân thực nhất trong các phương pháp dựa trên GAN tương tự.
Tuy nhiên, tài liệu bổ sung cho MVCGAN tiết lộ rằng việc đạt được sự nhất quán về thể tích tóc, sự sắp xếp, vị trí và hành vi là một vấn đề không dễ dàng được giải quyết thông qua các ràng buộc dựa trên hình học 3D được áp đặt từ bên ngoài.

Từ tài liệu bổ sung không được phát hành công khai tại thời điểm viết, chúng ta thấy rằng trong khi tổng hợp tư thế khuôn mặt từ MVCGAN đại diện cho một bước tiến đáng kể so với hiện trạng, sự nhất quán tóc thời gian vẫn là một vấn đề.
Vì các quy trình CGI ‘trực tiếp’ vẫn tìm thấy việc tái tạo tóc thời gian là một thách thức, không có lý do gì để tin rằng các phương pháp dựa trên hình học truyền thống của loại này sẽ mang lại sự tổng hợp tóc nhất quán đến không gian tiềm ẩn bất cứ lúc nào sớm.
Ổn định Tóc với Mạng Nơ-ron Lồi
Tuy nhiên, một bài báo sắp tới từ ba nhà nghiên cứu tại Viện Công nghệ Chalmers ở Thụy Điển có thể cung cấp một bước tiến thêm trong mô phỏng tóc neuron.

Trái: biểu diễn tóc được ổn định bởi CNN, phải: sự thật. Xem video nhúng ở cuối bài viết để có độ phân giải tốt hơn và các ví dụ thêm. Nguồn: https://www.youtube.com/watch?v=AvnJkwCmsT4
Được đặt tên là Bộ lọc Tóc thời gian thực với Mạng Nơ-ron Lồi, bài báo sẽ được xuất bản cho hội thảo i3D vào đầu tháng Năm.
Hệ thống bao gồm một mạng nơ-ron tự động mã hóa có khả năng đánh giá độ phân giải tóc, bao gồm cả tự bóng và tính đến độ dày của tóc, trong thời gian thực, dựa trên một số mẫu ngẫu nhiên hạn chế được tạo bởi OpenGL.
Phương pháp này kết xuất một số mẫu hạn chế với độ trong suốt ngẫu nhiên và sau đó đào tạo một U-net để tái tạo hình ảnh gốc.

Dưới MVCGAN, một CNN lọc các yếu tố màu ngẫu nhiên, highlight, tiếp tuyến, độ sâu và alpha, lắp ráp các kết quả tổng hợp vào một hình ảnh tổng hợp.
Mạng nơ-ron được đào tạo trên PyTorch, hội tụ trong khoảng từ 6 đến 12 giờ, tùy thuộc vào khối lượng mạng và số lượng tính năng đầu vào. Các tham số được đào tạo (trọng số) sau đó được sử dụng trong việc triển khai thời gian thực của hệ thống.
Dữ liệu đào tạo được tạo bằng cách kết xuất hàng trăm hình ảnh cho các kiểu tóc thẳng và gợn sóng, sử dụng khoảng cách và tư thế ngẫu nhiên, cũng như các điều kiện chiếu sáng đa dạng.

Các ví dụ về đầu vào đào tạo.
Độ trong suốt tóc trên các mẫu được tính trung bình từ hình ảnh được kết xuất với độ trong suốt ngẫu nhiên ở độ phân giải siêu mẫu. Dữ liệu độ phân giải cao ban đầu được giảm mẫu để phù hợp với giới hạn mạng và phần cứng, và sau đó được tăng mẫu, trong một quy trình tự động mã hóa điển hình.
Ứng dụng suy luận thời gian thực (phần mềm ‘trực tiếp’ tận dụng thuật toán được dẫn xuất từ mô hình được đào tạo) sử dụng một hỗn hợp của NVIDIA CUDA với cuDNN và OpenGL. Các tính năng đầu vào ban đầu được đổ vào các bộ đệm màu đa mẫu của OpenGL, và kết quả được chuyển sang các tensor cuDNN trước khi được xử lý trong CNN. Những tensor sau đó được sao chép trở lại vào một kết cấu OpenGL ‘trực tiếp’ để áp vào hình ảnh cuối cùng.
Hệ thống thời gian thực hoạt động trên một NVIDIA RTX 2080, tạo ra độ phân giải 1024×1024 pixel.
Vì các giá trị màu tóc hoàn toàn được tách rời trong các giá trị cuối cùng được mạng nơ-ron thu được, việc thay đổi màu tóc là một việc đơn giản, mặc dù các hiệu ứng như độ dốc và sọc vẫn còn là một thách thức trong tương lai.

Các tác giả đã phát hành mã được sử dụng trong các đánh giá của bài báo tại GitLab. Xem video bổ sung cho MVCGAN dưới đây.
Kết luận
Đi qua không gian tiềm ẩn của một tự động mã hóa hoặc GAN vẫn còn giống như đi biển hơn là lái xe chính xác. Chỉ trong giai đoạn rất gần đây, chúng ta mới bắt đầu thấy được những kết quả đáng tin cậy cho việc tạo tư thế của ‘hình học đơn giản’ như khuôn mặt, trong các phương pháp như NeRF, GAN và các khung tự động mã hóa không phải deepfake (2017).
Độ phức tạp kiến trúc đáng kể của tóc con người, kết hợp với nhu cầu phải tích hợp các mô hình vật lý và các đặc điểm khác mà các phương pháp tổng hợp hình ảnh hiện tại không có quy định, cho thấy rằng tổng hợp tóc không có khả năng vẫn là một thành phần tích hợp trong tổng hợp khuôn mặt chung, mà sẽ đòi hỏi các mạng và khuôn khổ tổng hợp khuôn mặt phức tạp và riêng biệt – ngay cả khi những mạng và khuôn khổ đó có thể cuối cùng được tích hợp vào các khuôn khổ tổng hợp khuôn mặt rộng lớn và phức tạp hơn.
Được xuất bản lần đầu vào ngày 15 tháng 4 năm 2022.













