Góc nhìn Anderson
Phương Pháp Deepfake Mới Giải Quyết Vấn Đề ‘Mặt Chủ’

Mặc dù đã có nhiều năm đưa tin về khả năng của hình ảnh deepfake có thể làm suy yếu niềm tin lâu dài của chúng ta vào tính xác thực của video, nhưng tất cả các phương pháp phổ biến hiện nay đều dựa trên việc tìm kiếm ‘mặt chủ’ có hình dạng tương tự với khuôn mặt mục tiêu.
Trong trường hợp footage gốc có khuôn mặt rộng, nhưng chủ thể mục tiêu có khuôn mặt hẹp, kết quả luôn gặp vấn đề, vì việc chuyển giao này liên quan đến việc cắt bỏ một phần khuôn mặt gốc và xây dựng lại nền tảng hiện tại. Các gói hiện tại như DeepFaceLab và FaceSwap có thể tạo ra kết quả hạn chế khi cấu hình được đảo ngược (hẹp > rộng), nhưng không có tính năng nào để giải quyết tình huống này một cách thuyết phục.
Giờ đây, một sự hợp tác giữa Tencent và Đại học Xiamen của Trung Quốc đã phát triển một phương pháp mới, có tên là HifiFace, được thiết kế để giải quyết sự thiếu hụt này.

Hai hình ảnh deepfake HifiFace, hình đầu tiên là Anne Hathaway, nơi có được sự giống nhau tốt mặc dù hình dạng khuôn mặt không tương thích. HifiFace cũng hoạt động tốt trên các mục tiêu có kính, truyền thống là một điểm yếu trong deepfake. Nguồn: https://arxiv.org/pdf/2106.09965.pdf
Remodeling a Deepfake Face
Các phương pháp trước đây, như Subject Agnostic Face Swapping and Reenactment (FSGAN), đã dựa trên 3DMM fitting (3D Morphable Models) hoặc các phương pháp khác dựa trên nhận dạng khuôn mặt hoặc biến đổi, nơi các đặc điểm khuôn mặt của khuôn mặt cần ‘ghi đè’ gần như quyết định giới hạn của việc hoán đổi:

Phát hiện đặc điểm khuôn mặt 3DMM. Nguồn: https://github.com/Yinghao-Li/3DMM-fitting
Mặc dù các phương pháp cạnh tranh đã dựa trên các tính năng được lấy từ mạng lưới nhận dạng khuôn mặt, nhưng chúng chủ yếu nhằm tái tạo lại kết cấu hơn là cấu trúc, và tương tự như vậy tạo ra một hiệu ứng ‘mặt nạ’ trong các trường hợp khuôn mặt không tương thích (tức là giới hạn và hình dạng của đường chân tóc, cằm và gò má).
Để giải quyết những vấn đề này, các nhà nghiên cứu Trung Quốc, dựa tại Phòng thí nghiệm Phân tích và Máy tính Truyền thông tại Khoa Trí tuệ Nhân tạo của trường đại học, đã phát triển một mạng lưới từ đầu đến cuối mà suy ra các hệ số của khuôn mặt mục tiêu và khuôn mặt nguồn bằng cách sử dụng một mô hình 3D, sau đó được kết hợp lại thành thông tin hình dạng, và nối tiếp với thông tin vector nhận dạng từ một mạng lưới nhận dạng khuôn mặt.
Thông tin hình học này sau đó được đưa vào một mô hình mã hóa-giải mã như thông tin cấu trúc, hòa trộn với biểu thức và tư thế của khuôn mặt mục tiêu, được tận dụng như các nguồn phụ để chuyển giao chính xác.
Semantic Facial Fusion
Ngoài ra, HifiFace bao gồm một thành phần Fusion Facial Semantic (SFF), sử dụng một tính năng cấp thấp trong mã hóa để bảo tồn thông tin không gian và kết cấu, mà không hy sinh danh tính của hình ảnh mục tiêu. Các tính năng từ mã hóa và giải mã được tích hợp vào một mặt nạ thích ứng được học, và thông tin nền được hòa trộn vào đầu ra bằng cách sử dụng mặt nạ khuôn mặt được học.

HifiFace hoạt động. Nguồn: https://johann.wang/HifiFace/
Theo cách này, HifiFace khác với việc sử dụng ranh giới khuôn mặt ban đầu như một giới hạn cứng, bằng cách sử dụng phân đoạn ngữ nghĩa khuôn mặt giãn, trong đó mô hình có thể thực hiện sự hòa trộn thích ứng tốt hơn trên các ranh giới của khuôn mặt.

Hai phương pháp trước đây (trên và dưới bên trái), và kiến trúc HifiFace mới, bao gồm một mã hóa, giải mã, trình trích xuất nhận dạng hình dạng 3D và mô-đun SFF.
Trong một so sánh với các phương pháp trước đây FSGAN, SimSwap và FaceShifter, HifiFace chứng tỏ một sự tái tạo khuôn mặt vượt trội, vì nó không phải xấp xỉ các yếu tố ‘ma’ nơi các ranh giới khuôn mặt gây nhầm lẫn với việc ánh xạ danh tính > danh tính, mà rõ ràng tái tạo chúng.
Testing
Các nhà nghiên cứu đã thực hiện hệ thống bằng cách sử dụng VGGFace2 và các tập dữ liệu DeepGlint Asian-Celeb. Các khuôn mặt được căn chỉnh qua 5 điểm mốc hướng ra ngoài và cắt lại thành 256×256 pixel. Một mạng lưới tăng cường chân dung cũng được sử dụng để tạo ra một phiên bản 512×512 pixel, cho một mô hình có độ phân giải cao hơn. Mô hình được đào tạo dưới Adam.
Mặc dù FaceShifter bảo tồn danh tính tốt, nhưng nó không thể giải quyết các vấn đề như biểu thức, màu sắc và che khuất một cách hiệu quả như HifiFace, và có một cấu trúc mạng lưới phức tạp hơn. FSGAN có vấn đề trong việc chuyển giao ánh sáng từ nguồn đến mục tiêu.
Các nhà nghiên cứu sử dụng FaceForensics++ cho các so sánh định lượng, lấy mẫu mười khung hình mỗi trong một lô video chuyển đổi trên các phương pháp cạnh tranh, và tìm thấy rằng HifiFace đạt được một điểm số nhận dạng ID vượt trội. Trong việc kiểm tra một loạt các yếu tố khác, như chất lượng hình ảnh, các nhà nghiên cứu cũng tìm thấy rằng phương pháp của họ vượt trội so với các phương pháp đối thủ.
Công việc này đại diện cho một bước tiến xa hơn trong việc trừu tượng hóa vật liệu nguồn để nó chỉ là một khuôn mẫu thô vào đó các danh tính chính xác có thể được chuyển giao. Một số gói FOSS hiện tại, bao gồm DeepFaceLab, có tính năng chức năng để thay thế toàn bộ đầu, nhưng như HifiFace, chúng không tính đến tóc, và chúng hiệu quả hơn trong việc ‘xây dựng’ một khuôn mặt hơn là ‘cắt’ nó để phù hợp với một nguồn mục tiêu mong muốn.

















