Góc nhìn Anderson
Tái cấu trúc khuôn mặt trong video với Học máy

Một nghiên cứu hợp tác giữa Trung Quốc và Vương quốc Anh đã tạo ra một phương pháp mới để thay đổi khuôn mặt trong video. Kỹ thuật này cho phép thay đổi khuôn mặt một cách thuyết phục, với sự nhất quán cao và không có hiện tượng vật lý.

Từ một video trên YouTube được sử dụng làm tài liệu tham khảo bởi các nhà nghiên cứu, nữ diễn viên Jennifer Lawrence xuất hiện như một nhân vật hơn (bên phải). Xem video đi kèm được nhúng ở cuối bài viết để xem thêm nhiều ví dụ với độ phân giải tốt hơn. Nguồn: https://www.youtube.com/watch?v=tA2BxvrKvjE
Loại biến đổi này thường chỉ có thể thực hiện được thông qua các phương pháp CGI truyền thống, đòi hỏi phải tái tạo lại toàn bộ khuôn mặt thông qua các thủ tục phức tạp và tốn kém.
Thay vào đó, các kỹ thuật CGI trong phương pháp này được tích hợp vào một đường ống dẫn thần kinh như thông tin khuôn mặt 3D tham số, sau đó được sử dụng làm cơ sở cho một quy trình học máy.

Các khuôn mặt tham số truyền thống đang ngày càng được sử dụng làm hướng dẫn cho các quá trình biến đổi sử dụng trí tuệ nhân tạo thay vì CGI. Nguồn: https://arxiv.org/pdf/2205.02538.pdf
Các tác giả tuyên bố:
‘Mục tiêu của chúng tôi là tạo ra kết quả biến đổi khuôn mặt chất lượng cao bằng cách chỉnh sửa hình dạng tổng thể của khuôn mặt theo sự biến dạng tự nhiên của khuôn mặt trong thế giới thực. Điều này có thể được sử dụng cho các ứng dụng như tạo khuôn mặt đẹp cho mục đích làm đẹp và tạo khuôn mặt phóng đại cho hiệu ứng hình ảnh.’
Mặc dù việc biến dạng và làm cong khuôn mặt 2D đã có sẵn cho người tiêu dùng từ khi ra đời của Photoshop (và đã dẫn đến những văn hóa kỳ lạ và thường không thể chấp nhận được xung quanh biến dạng khuôn mặt và rối loạn hình dạng cơ thể), việc thực hiện điều này trong video mà không sử dụng CGI là một việc khó khăn.

Kích thước khuôn mặt của Mark Zuckerberg được mở rộng và thu hẹp bởi kỹ thuật mới của Trung Quốc và Anh.
Biến đổi cơ thể hiện đang là một lĩnh vực được quan tâm mạnh mẽ trong lĩnh vực thị giác máy tính, chủ yếu do tiềm năng của nó trong thương mại điện tử thời trang, mặc dù việc làm cho ai đó xuất hiện cao hơn hoặc đa dạng về xương là một thách thức đáng chú ý.
Tương tự, việc thay đổi hình dạng của đầu trong footage video một cách nhất quán và thuyết phục đã là chủ đề của các nghiên cứu trước đây từ các nhà nghiên cứu của bài báo mới, mặc dù việc thực hiện đó đã bị ảnh hưởng bởi các hiện象 và hạn chế khác. Hệ thống mới mở rộng khả năng của nghiên cứu trước đó từ đầu ra tĩnh sang đầu ra video.
Hệ thống mới được đào tạo trên một máy tính để bàn với AMD Ryzen 9 3950X với 32GB bộ nhớ, và sử dụng một thuật toán dòng quang từ OpenCV cho các bản đồ chuyển động, được làm mịn bởi khuôn khổ StructureFlow; Mạng lưới Đối齐 khuôn mặt (FAN) cho ước tính điểm mốc, cũng được sử dụng trong các gói deepfakes phổ biến; và Ceres Solver để giải quyết các thách thức tối ưu hóa.

Một ví dụ cực đoan về việc làm rộng khuôn mặt với hệ thống mới.
Bài báo có tiêu đề Parametric Reshaping of Portraits in Videos, và đến từ ba nhà nghiên cứu tại Đại học Zhejiang, và một từ Đại học Bath.
Về khuôn mặt
Dưới hệ thống mới, video được trích xuất thành một chuỗi hình ảnh, và một tư thế cứng được ước tính cho mỗi khuôn mặt. Sau đó, một số khung hình tiếp theo được ước tính chung để xây dựng các tham số bản sắc nhất quán dọc theo toàn bộ chuỗi hình ảnh (tức là các khung hình của video).

Kiến trúc dòng chảy của hệ thống biến dạng khuôn mặt.
Sau đó, biểu cảm được đánh giá, cho ra một tham số biến dạng được thực hiện bằng hồi quy tuyến tính. Tiếp theo, một phương pháp hàm khoảng cách ký hiệu mới (SDF) xây dựng một bản đồ 2D dày đặc của các đường nét khuôn mặt trước và sau khi biến dạng.
Cuối cùng, một tối ưu hóa biến dạng nội dung được thực hiện trên video đầu ra.
Khuôn mặt tham số
Quá trình này sử dụng một Mô hình khuôn mặt 3D có thể biến dạng (3DMM), một phụ kiện ngày càng phổ biến cho các hệ thống tổng hợp khuôn mặt dựa trên thần kinh và GAN, cũng như được áp dụng cho các hệ thống phát hiện deepfake.

Không từ bài báo mới, nhưng đây là một ví dụ về Mô hình khuôn mặt 3D có thể biến dạng (3DMM) – một khuôn mặt nguyên mẫu tham số được sử dụng trong dự án mới. Trên cùng bên trái, ứng dụng điểm mốc trên khuôn mặt 3DMM. Trên cùng bên phải, các đỉnh lưới 3D của một bản đồ đẳng giá. Dưới cùng bên trái cho thấy việc phù hợp điểm mốc; dưới cùng giữa, một bản đồ đẳng giá của kết cấu khuôn mặt được trích xuất; và dưới cùng bên phải, một kết quả phù hợp và hình dạng. Nguồn: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Quy trình của hệ thống mới phải xem xét các trường hợp che khuất, chẳng hạn như khi đối tượng nhìn đi nơi khác. Đây là một trong những thách thức lớn nhất trong phần mềm deepfake, vì các điểm mốc FAN có rất ít khả năng tính đến các trường hợp này và có xu hướng bị suy giảm chất lượng khi khuôn mặt tránh hoặc bị che khuất.
Hệ thống mới có thể tránh được bẫy này bằng cách định nghĩa một năng lượng đường viền có khả năng phù hợp với ranh giới giữa khuôn mặt 3D (3DMM) và khuôn mặt 2D (được định nghĩa bởi các điểm mốc FAN).
Tối ưu hóa
Một triển khai hữu ích cho hệ thống như vậy sẽ là thực hiện biến dạng thời gian thực, chẳng hạn như trong các bộ lọc trò chuyện video. Khung hiện tại không cho phép điều này, và các tài nguyên tính toán cần thiết sẽ khiến biến dạng “trực tiếp” trở thành một thách thức đáng kể.
Theo bài báo, và giả sử một mục tiêu video 24fps, các hoạt động khung hình trong đường ống dẫn đại diện cho độ trễ 16,344 giây cho mỗi giây footage, với các hit một lần cho ước tính bản sắc và biến dạng khuôn mặt 3D (321ms và 160ms, tương ứng).
Do đó, tối ưu hóa là chìa khóa để tiến tới giảm độ trễ. Vì tối ưu hóa chung trên tất cả các khung hình sẽ thêm gánh nặng nghiêm trọng vào quá trình, và tối ưu hóa kiểu init (giả định bản sắc nhất quán của người nói từ khung hình đầu tiên) có thể dẫn đến các hiện tượng bất thường, các tác giả đã áp dụng một lược đồ thưa để tính toán các hệ số của các khung hình được lấy mẫu ở các khoảng thời gian thực tế.
Tối ưu hóa chung sau đó được thực hiện trên tập hợp con các khung hình này, dẫn đến một quá trình tái tạo tinh gọn hơn.
Biến dạng khuôn mặt
Kỹ thuật biến dạng được sử dụng trong dự án là một sự thích nghi của công việc năm 2020 của các tác giả Deep Shapely Portraits (DSP).

Deep Shapely Portraits, một bài nộp năm 2020 cho ACM Multimedia. Bài báo do các nhà nghiên cứu từ ZJU-Tencent Game và Intelligent Graphics Innovation Technology Joint Lab dẫn đầu. Nguồn: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Các tác giả quan sát ‘Chúng tôi mở rộng phương pháp này từ việc biến dạng một hình ảnh đơn sắc thành biến dạng toàn bộ chuỗi hình ảnh.’
Thử nghiệm
Bài báo lưu ý rằng không có tài liệu trước đó để so sánh với phương pháp mới. Do đó, các tác giả đã so sánh các khung hình của đầu ra video biến dạng với đầu ra tĩnh của DSP.

Thử nghiệm hệ thống mới với hình ảnh tĩnh từ Deep Shapely Portraits.
Các tác giả lưu ý rằng các hiện tượng vật lý xuất hiện từ phương pháp DSP, do sử dụng ánh xạ thưa – một vấn đề mà khuôn khổ mới giải quyết bằng ánh xạ dày. Ngoài ra, video được sản xuất bởi DSP, bài báo cho rằng demonstrates sự thiếu mịn màng và tính nhất quán về hình ảnh.
Các tác giả tuyên bố:
‘Kết quả cho thấy phương pháp của chúng tôi có thể tạo ra các video khuôn mặt biến dạng một cách mạnh mẽ trong khi phương pháp dựa trên hình ảnh có thể dễ dàng dẫn đến các hiện tượng vật lý nhấp nháy.’
Xem video đi kèm dưới đây để xem thêm nhiều ví dụ:
Được xuất bản lần đầu vào ngày 9 tháng 5 năm 2022. Sửa đổi vào lúc 6 giờ chiều EET, thay thế ‘trường’ bằng ‘chức năng’ cho SDF.












