Góc nhìn Anderson
Phương Pháp Deepfake Mới và Đơn Giản Hơn Các Phương Pháp Trước Đó

Một sự hợp tác giữa một nhóm nghiên cứu trí tuệ nhân tạo của Trung Quốc và các nhà nghiên cứu tại Mỹ đã phát triển một phương pháp deepfake mới, có thể là sự đổi mới thực sự đầu tiên trong công nghệ deepfake kể từ khi nó xuất hiện bốn năm trước.
Phương pháp mới này có thể thực hiện các phép thay thế khuôn mặt mà không cần phải thu thập và chỉnh sửa các tập dữ liệu lớn và chuyên dụng, cũng như không cần phải đào tạo chúng trong một tuần chỉ để nhận dạng một khuôn mặt. Đối với các ví dụ được trình bày trong bài báo mới, các mô hình đã được đào tạo trên toàn bộ hai tập dữ liệu về người nổi tiếng phổ biến, trên một GPU NVIDIA Tesla P40 trong khoảng ba ngày.

Video đầy đủ có sẵn ở cuối bài viết này. Trong mẫu này từ video trong tài liệu bổ sung được cung cấp bởi một trong những tác giả của bài báo mới, khuôn mặt của Scarlett Johansson được chuyển sang video nguồn. CihaNet loại bỏ vấn đề về mặt nạ cạnh khi thực hiện một phép thay thế, bằng cách tạo và thực hiện các mối quan hệ sâu sắc hơn giữa các bản sắc nguồn và đích, có nghĩa là kết thúc các ‘biên giới rõ ràng’ và các lỗi siêu hình khác xảy ra trong các phương pháp deepfake truyền thống. Nguồn: https://mitchellx.github.io/#video
Phương pháp mới này loại bỏ nhu cầu ‘dán’ bản sắc được cấy ghép một cách thô thiển vào video đích, điều này thường dẫn đến các dấu vết dễ nhận thấy của các hình ảnh được tạo ra bằng trí tuệ nhân tạo xuất hiện ở nơi khuôn mặt giả kết thúc và khuôn mặt thực sự, ẩn dưới bề mặt, bắt đầu. Thay vào đó, ‘bản đồ ảo’ được sử dụng để thực hiện sự pha trộn sâu sắc hơn của các khía cạnh hình ảnh, vì hệ thống tách biệt bản sắc khỏi bối cảnh một cách hiệu quả hơn so với các phương pháp hiện tại, và do đó có thể hòa trộn bản sắc đích tại một mức độ sâu sắc hơn.

Từ bài báo. Các phép biến đổi CihaNet được thực hiện thông qua các bản đồ ảo (hàng dưới cùng). Hệ thống sử dụng thông tin bối cảnh (tức là hướng khuôn mặt, tóc, kính và các che khuất khác, v.v.) hoàn toàn từ hình ảnh mà bản sắc mới sẽ được siêu hình, và thông tin bản sắc khuôn mặt hoàn toàn từ người sẽ được chèn vào hình ảnh. Khả năng tách biệt khuôn mặt khỏi bối cảnh là yếu tố quan trọng cho sự thành công của hệ thống. Nguồn: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
Hiệu quả, bản đồ ảo mới cung cấp một bối cảnh hoàn chỉnh hơn cho phép thay thế, trái ngược với các mặt nạ cứng thường yêu cầu sự thu thập và chỉnh sửa chuyên dụng (và trong trường hợp của DeepFaceLab, đào tạo riêng) trong khi cung cấp sự linh hoạt hạn chế về việc kết hợp thực sự hai bản sắc.

Từ các mẫu được cung cấp trong tài liệu bổ sung, sử dụng cả hai tập dữ liệu FFHQ và Celeb-A HQ, trên VGGFace và Forensics++. Hai cột đầu tiên hiển thị các hình ảnh được chọn ngẫu nhiên (thực) để được trao đổi. Bốn cột tiếp theo hiển thị kết quả của phép trao đổi sử dụng bốn phương pháp hiệu quả nhất hiện có, trong khi cột cuối cùng hiển thị kết quả từ CihaNet. Kho lưu trữ FaceSwap đã được sử dụng, thay vì FaceSwap phổ biến hơn, vì cả hai dự án đều là các nhánh của mã nguồn gốc Deepfakes năm 2017 trên GitHub. Mặc dù mỗi dự án đã thêm các mô hình, kỹ thuật, giao diện người dùng đa dạng và các công cụ bổ sung, mã cơ bản tạo ra deepfakes vẫn không thay đổi và vẫn chung cho cả hai. Nguồn: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
Bài báo này, có tiêu đề Mạng Lưới ảo Hóa và Nhận Dạng, được viết bởi các nhà nghiên cứu thuộc JD AI Research và Đại học Massachusetts Amherst, và được hỗ trợ bởi Chương trình Nghiên cứu và Phát triển then chốt của Trung Quốc theo số Grant No. 2020AAA0103800. Nó được giới thiệu tại Hội nghị Quốc tế lần thứ 29 về Truyền thông Đa phương tiện, từ ngày 20 đến 24 tháng 10, tại Chengdu, Trung Quốc.
Không Cần ‘Tương Tự’ Khuôn Mặt
Cả phần mềm deepfake phổ biến nhất hiện nay, DeepFaceLab, và phần mềm cạnh tranh FaceSwap, thực hiện các quy trình làm việc phức tạp và thường được chỉnh sửa thủ công để xác định hướng khuôn mặt, chướng ngại vật và các trở ngại khác, và phải đối mặt với nhiều trở ngại khác (bao gồm cả ánh sáng) làm cho việc sử dụng chúng không giống như trải nghiệm ‘trỏ và nhấp’ được mô tả trong truyền thông kể từ khi deepfakes xuất hiện.
Ngược lại, CihaNet không yêu cầu hai hình ảnh phải đối diện trực tiếp với máy ảnh để trích xuất và khai thác thông tin bản sắc hữu ích từ một hình ảnh đơn.

Trong các ví dụ này, một loạt các phần mềm deepfake cạnh tranh được thử thách với nhiệm vụ trao đổi khuôn mặt không chỉ khác biệt về bản sắc mà còn không đối diện theo cùng một hướng. Phần mềm được dẫn xuất từ kho lưu trữ deepfakes ban đầu (như FaceSwap phổ biến và được hiển thị ở trên) không thể xử lý sự khác biệt về góc giữa hai hình ảnh được trao đổi (xem cột thứ ba). Trong khi đó, CihaNet có thể trừu tượng hóa bản sắc một cách chính xác, vì ‘tư thế’ của khuôn mặt không phải là một phần nội tại của thông tin bản sắc.
Cấu Trúc
Dự án CihaNet, theo các tác giả, được lấy cảm hứng từ sự hợp tác năm 2019 giữa Microsoft Research và Đại học Peking, gọi là FaceShifter, mặc dù nó thực hiện một số thay đổi đáng kể và quan trọng đối với kiến trúc cốt lõi của phương pháp cũ.
FaceShifter sử dụng hai mạng lưới chuẩn hóa thể hiện (AdaIN) để xử lý thông tin bản sắc, sau đó được chuyển vào hình ảnh đích thông qua một mặt nạ, theo cách tương tự như phần mềm deepfake phổ biến hiện nay (và với tất cả các hạn chế liên quan), sử dụng một mạng lưới HEAR-Net (bao gồm một mạng con được đào tạo riêng trên các chướng ngại vật che khuất – một lớp phức tạp bổ sung).
Thay vào đó, kiến trúc mới trực tiếp sử dụng thông tin ‘bối cảnh’ này cho quá trình biến đổi, thông qua một hoạt động chuẩn hóa thể hiện级联 (C-AdaIN) hai bước, cung cấp sự nhất quán của bối cảnh (tức là da khuôn mặt và các che khuất) của các khu vực liên quan đến bản sắc.
Phần mạng con quan trọng thứ hai của hệ thống được gọi là Khối trao đổi (SwapBlk), tạo ra một tính năng tích hợp từ bối cảnh của hình ảnh tham chiếu và thông tin bản sắc ‘nhúng’ từ hình ảnh nguồn, bỏ qua các giai đoạn đa cấp cần thiết để thực hiện việc này bằng các phương tiện thông thường.
Để giúp phân biệt giữa bối cảnh và bản sắc, một bản đồ ảo được tạo ra cho mỗi cấp độ, thay thế cho một mặt nạ phân đoạn mềm, và hoạt động trên một loạt các tính năng rộng hơn cho phần quan trọng này của quá trình deepfake.

Khi giá trị của bản đồ ảo (hình dưới bên phải) tăng lên, một con đường rõ ràng hơn giữa các bản sắc xuất hiện.
Như vậy, toàn bộ quá trình trao đổi được thực hiện trong một giai đoạn và không cần xử lý hậu kỳ.
Dữ Liệu và Kiểm Thử
Để thử nghiệm hệ thống, các nhà nghiên cứu đã đào tạo bốn mô hình trên hai tập dữ liệu hình ảnh mở phổ biến và đa dạng – CelebA-HQ và tập dữ liệu Flickr-Faces-HQ của NVIDIA (FFHQ), mỗi tập chứa 30.000 và 70.000 hình ảnh tương ứng.
Không có việc cắt tỉa hoặc lọc được thực hiện trên các tập dữ liệu cơ bản này. Trong mỗi trường hợp, các nhà nghiên cứu đã đào tạo toàn bộ mỗi tập dữ liệu trên một GPU Tesla đơn trong ba ngày, với tốc độ học 0,0002 trên tối ưu hóa Adam.
Sau đó, họ đã tạo ra một loạt các phép trao đổi ngẫu nhiên giữa hàng nghìn nhân vật được giới thiệu trong các tập dữ liệu, mà không quan tâm đến việc các khuôn mặt có tương tự hay không, và so sánh kết quả của CihaNet với đầu ra từ bốn khuôn khổ deepfake hàng đầu: FaceSwap (đại diện cho FaceSwap phổ biến hơn, vì cả hai đều có chung mã nguồn trong kho lưu trữ deepfakes năm 2017 đã đưa deepfakes đến thế giới); FaceShifter đã đề cập; FSGAN; và SimSwap.
Trong việc so sánh kết quả thông qua VGG-Face, FFHQ, CelebA-HQ và FaceForensics++, các tác giả đã tìm thấy rằng mô hình mới của họ vượt trội so với tất cả các mô hình trước đó, như được chỉ ra trong bảng dưới đây.

Ba chỉ số được sử dụng để đánh giá kết quả là Tương đồng Cấu trúc (SSIM), lỗi ước tính tư thế và độ chính xác thu hồi ID, được tính toán dựa trên tỷ lệ cặp thành công được thu hồi.
Các nhà nghiên cứu cho rằng CihaNet đại diện cho một phương pháp tiếp cận vượt trội về mặt kết quả định tính, và một bước tiến đáng kể so với trạng thái hiện tại của công nghệ deepfake, bằng cách loại bỏ gánh nặng của các kiến trúc mặt nạ và phương pháp phức tạp, và đạt được sự tách biệt hữu ích hơn giữa bản sắc và bối cảnh.
Hãy xem thêm các ví dụ video về phương pháp mới này. Bạn có thể tìm thấy video đầy đủ tại đây.
Từ tài liệu bổ sung cho bài báo mới, CihaNet thực hiện việc trao đổi khuôn mặt trên các bản sắc khác nhau. Nguồn: https://mitchellx.github.io/#video














