Góc nhìn Anderson

Phương Pháp Deepfake Mới Giải Quyết Vấn Đề ‘Mặt Chủ’

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Mặc dù đã có nhiều năm đưa tin về khả năng của hình ảnh deepfake có thể làm suy yếu niềm tin lâu dài của chúng ta vào tính xác thực của video, nhưng tất cả các phương pháp phổ biến hiện nay đều dựa trên việc tìm kiếm ‘mặt chủ’ có hình dạng tương tự với khuôn mặt mục tiêu.

Trong trường hợp footage gốc có khuôn mặt rộng, nhưng chủ thể mục tiêu có khuôn mặt hẹp, kết quả luôn gặp vấn đề, vì việc chuyển giao này liên quan đến việc cắt bỏ một phần khuôn mặt gốc và xây dựng lại nền tảng hiện tại. Các gói hiện tại như DeepFaceLab và FaceSwap có thể tạo ra kết quả hạn chế khi cấu hình được đảo ngược (hẹp > rộng), nhưng không có tính năng nào để giải quyết tình huống này một cách thuyết phục.

Giờ đây, một sự hợp tác giữa Tencent và Đại học Xiamen của Trung Quốc đã phát triển một phương pháp mới, có tên là HifiFace, được thiết kế để giải quyết sự thiếu hụt này.

Hai hình ảnh deepfake HifiFace, hình đầu tiên là Anne Hathaway, nơi có được sự giống nhau tốt mặc dù hình dạng khuôn mặt không tương thích. HifiFace cũng hoạt động tốt trên các mục tiêu có kính, truyền thống là một điểm yếu trong deepfake. Nguồn: https://arxiv.org/pdf/2106.09965.pdf

Hai hình ảnh deepfake HifiFace, hình đầu tiên là Anne Hathaway, nơi có được sự giống nhau tốt mặc dù hình dạng khuôn mặt không tương thích. HifiFace cũng hoạt động tốt trên các mục tiêu có kính, truyền thống là một điểm yếu trong deepfake. Nguồn: https://arxiv.org/pdf/2106.09965.pdf

Remodeling a Deepfake Face

Các phương pháp trước đây, như Subject Agnostic Face Swapping and Reenactment (FSGAN), đã dựa trên 3DMM fitting (3D Morphable Models) hoặc các phương pháp khác dựa trên nhận dạng khuôn mặt hoặc biến đổi, nơi các đặc điểm khuôn mặt của khuôn mặt cần ‘ghi đè’ gần như quyết định giới hạn của việc hoán đổi:

Nguồn: https://github.com/Yinghao-Li/3DMM-fitting

Phát hiện đặc điểm khuôn mặt 3DMM. Nguồn: https://github.com/Yinghao-Li/3DMM-fitting

Mặc dù các phương pháp cạnh tranh đã dựa trên các tính năng được lấy từ mạng lưới nhận dạng khuôn mặt, nhưng chúng chủ yếu nhằm tái tạo lại kết cấu hơn là cấu trúc, và tương tự như vậy tạo ra một hiệu ứng ‘mặt nạ’ trong các trường hợp khuôn mặt không tương thích (tức là giới hạn và hình dạng của đường chân tóc, cằm và gò má).

Để giải quyết những vấn đề này, các nhà nghiên cứu Trung Quốc, dựa tại Phòng thí nghiệm Phân tích và Máy tính Truyền thông tại Khoa Trí tuệ Nhân tạo của trường đại học, đã phát triển một mạng lưới từ đầu đến cuối mà suy ra các hệ số của khuôn mặt mục tiêu và khuôn mặt nguồn bằng cách sử dụng một mô hình 3D, sau đó được kết hợp lại thành thông tin hình dạng, và nối tiếp với thông tin vector nhận dạng từ một mạng lưới nhận dạng khuôn mặt.

Thông tin hình học này sau đó được đưa vào một mô hình mã hóa-giải mã như thông tin cấu trúc, hòa trộn với biểu thức và tư thế của khuôn mặt mục tiêu, được tận dụng như các nguồn phụ để chuyển giao chính xác.

Semantic Facial Fusion

Ngoài ra, HifiFace bao gồm một thành phần Fusion Facial Semantic (SFF), sử dụng một tính năng cấp thấp trong mã hóa để bảo tồn thông tin không gian và kết cấu, mà không hy sinh danh tính của hình ảnh mục tiêu. Các tính năng từ mã hóa và giải mã được tích hợp vào một mặt nạ thích ứng được học, và thông tin nền được hòa trộn vào đầu ra bằng cách sử dụng mặt nạ khuôn mặt được học.

HifiFace hoạt động. Nguồn: https://johann.wang/HifiFace/

HifiFace hoạt động. Nguồn: https://johann.wang/HifiFace/

Theo cách này, HifiFace khác với việc sử dụng ranh giới khuôn mặt ban đầu như một giới hạn cứng, bằng cách sử dụng phân đoạn ngữ nghĩa khuôn mặt giãn, trong đó mô hình có thể thực hiện sự hòa trộn thích ứng tốt hơn trên các ranh giới của khuôn mặt.

Hai phương pháp trước đây (trên và dưới bên trái), và kiến trúc HifiFace mới, bao gồm một mã hóa, giải mã, trình trích xuất nhận dạng hình dạng 3D và mô-đun SFF.

Hai phương pháp trước đây (trên và dưới bên trái), và kiến trúc HifiFace mới, bao gồm một mã hóa, giải mã, trình trích xuất nhận dạng hình dạng 3D và mô-đun SFF.

Trong một so sánh với các phương pháp trước đây FSGAN, SimSwapFaceShifter, HifiFace chứng tỏ một sự tái tạo khuôn mặt vượt trội, vì nó không phải xấp xỉ các yếu tố ‘ma’ nơi các ranh giới khuôn mặt gây nhầm lẫn với việc ánh xạ danh tính > danh tính, mà rõ ràng tái tạo chúng.

Testing

Các nhà nghiên cứu đã thực hiện hệ thống bằng cách sử dụng VGGFace2 và các tập dữ liệu DeepGlint Asian-Celeb. Các khuôn mặt được căn chỉnh qua 5 điểm mốc hướng ra ngoài và cắt lại thành 256×256 pixel. Một mạng lưới tăng cường chân dung cũng được sử dụng để tạo ra một phiên bản 512×512 pixel, cho một mô hình có độ phân giải cao hơn. Mô hình được đào tạo dưới Adam.

Mặc dù FaceShifter bảo tồn danh tính tốt, nhưng nó không thể giải quyết các vấn đề như biểu thức, màu sắc và che khuất một cách hiệu quả như HifiFace, và có một cấu trúc mạng lưới phức tạp hơn. FSGAN có vấn đề trong việc chuyển giao ánh sáng từ nguồn đến mục tiêu.

Các nhà nghiên cứu sử dụng FaceForensics++ cho các so sánh định lượng, lấy mẫu mười khung hình mỗi trong một lô video chuyển đổi trên các phương pháp cạnh tranh, và tìm thấy rằng HifiFace đạt được một điểm số nhận dạng ID vượt trội. Trong việc kiểm tra một loạt các yếu tố khác, như chất lượng hình ảnh, các nhà nghiên cứu cũng tìm thấy rằng phương pháp của họ vượt trội so với các phương pháp đối thủ.

Các đường nét khuôn mặt của Benedict Cumberbatch được tái tạo trung thực.

Các đường nét khuôn mặt của Benedict Cumberbatch được tái tạo trung thực.

Công việc này đại diện cho một bước tiến xa hơn trong việc trừu tượng hóa vật liệu nguồn để nó chỉ là một khuôn mẫu thô vào đó các danh tính chính xác có thể được chuyển giao. Một số gói FOSS hiện tại, bao gồm DeepFaceLab, có tính năng chức năng để thay thế toàn bộ đầu, nhưng như HifiFace, chúng không tính đến tóc, và chúng hiệu quả hơn trong việc ‘xây dựng’ một khuôn mặt hơn là ‘cắt’ nó để phù hợp với một nguồn mục tiêu mong muốn.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai