Góc nhìn Anderson

Phát Hiện Deepfake Mới: Mô Hình Latent Diffusion và GAN

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Ý Kiến  

Gần đây, cộng đồng nghiên cứu phát hiện deepfake, đã dành phần lớn thời gian từ cuối năm 2017 để nghiên cứu khuôn khổ dựa trên autoencoder mà đã ra mắt vào thời điểm đó và gây được sự chú ý của công chúng (và sự thất vọng), đã bắt đầu quan tâm đến các kiến trúc ít tĩnh hơn, bao gồm mô hình khuếch tán tiềm ẩn như DALL-E 2Stable Diffusion, cũng như đầu ra của Mạng Đối Nghịch Sinh (GAN). Ví dụ, vào tháng 6, UC Berkeley đã công bố kết quả nghiên cứu về việc phát triển một bộ phát hiện cho đầu ra của DALL-E 2.

Điều gì dường như đang thúc đẩy sự quan tâm ngày càng tăng này là sự nhảy vọt tiến hóa đột ngột trong khả năng và sẵn có của mô hình khuếch tán tiềm ẩn vào năm 2022, với việc phát hành DALL-E 2 vào mùa xuân, sau đó là việc mở nguồn Stable Diffusion bởi stability.ai vào cuối mùa hè.

GAN cũng đã được nghiên cứu trong bối cảnh này, mặc dù ít được quan tâm, vì nó rất khó để sử dụng chúng cho việc tái tạo video dựa trên người một cách thuyết phục và tinh tế; ít nhất, so với các gói autoencoder đã được chứng minh như FaceSwapDeepFaceLab – và người anh em trực tuyến của nó, DeepFaceLive.

Ảnh Động

Trong cả hai trường hợp, yếu tố then chốt dường như là triển vọng của một cuộc chạy đua phát triển tiếp theo cho video tổng hợp. Đầu tháng 10 – và mùa hội nghị lớn năm 2022 – được đánh dấu bằng một loạt các giải pháp đột ngột và không ngờ cho các vấn đề tổng hợp video lâu đời: không lâu sau khi Facebook phát hành mẫu của nền tảng văn bản-sang-video, Google Research nhanh chóng nhấn chìm sự ca ngợi ban đầu bằng cách công bố kiến trúc Imagen-to-Video T2V mới, có khả năng tạo ra phim độ phân giải cao (mặc dù chỉ thông qua một mạng lưới 7 lớp của các công cụ tăng cường).

Nếu bạn tin rằng loại điều này đến trong ba, hãy xem xét cũng sự hứa hẹn bí ẩn của stability.ai rằng ‘video đang đến’ với Stable Diffusion, rõ ràng là vào cuối năm nay, trong khi Stable Diffusion đồng phát triển Runway đã đặt ra một lời hứa tương tự, mặc dù không rõ liệu họ có đang đề cập đến cùng một hệ thống hay không. Thông điệp Discord từ CEO Emad Mostaque của Stability cũng hứa hẹn ‘âm thanh, video [và] 3D’.

Có vẻ như ý tưởng rằng các khuôn khổ ‘tĩnh’ như GAN và khuếch tán sẽ cuối cùng chiếm vị trí của mình như các phụ trợ hỗ trợ cho các khuôn khổ hoạt hình bên ngoài đang bắt đầu có được lực kéo thực sự.

Tóm lại, có vẻ như thế giới bị hạn chế của các deepfake dựa trên autoencoder, chỉ có thể thay thế hiệu quả phần trung tâm của khuôn mặt, có thể bị lu mờ bởi một thế hệ mới của các công nghệ deepfake dựa trên khuếch tán – các phương pháp mở, phổ biến có tiềm năng tạo ra không chỉ toàn bộ cơ thể mà còn cả toàn bộ cảnh.

Vì lý do này, có lẽ, cộng đồng nghiên cứu chống lại deepfake đang bắt đầu coi trọng việc tổng hợp hình ảnh, và nhận ra rằng nó có thể phục vụ nhiều mục đích hơn là chỉ tạo ra hình ảnh hồ sơ LinkedIn giả; và nếu tất cả các không gian tiềm ẩn không thể đạt được trong chuyển động thời gian là để hoạt động như một bộ kết xuất kết cấu tuyệt vời, thì đó có thể là đủ.

Blade Runner

Hai bài báo mới nhất để giải quyết, lần lượt, phát hiện deepfake dựa trên khuếch tán tiềm ẩn và GAN, là, lần lượt, DE-FAKE: Phát Hiện và Thuộc tính của Hình ảnh Giả được Tạo bởi Mô hình Khuếch tán Văn bản-sang-Hình ảnh, một sự hợp tác giữa Trung tâm An ninh Thông tin CISPA Helmholtz và Salesforce; và BLADERUNNER: Biện pháp Phản công Nhanh cho Mặt StyleGAN Tổng hợp (AI-Generated) , từ Adam Dorian Wong tại Phòng thí nghiệm Lincoln của MIT.

Trước khi giải thích phương pháp mới, bài báo sau dành một chút thời gian để xem xét các phương pháp trước đó để xác định liệu một hình ảnh có được tạo bởi GAN hay không (bài báo này xử lý cụ thể với gia đình StyleGAN của NVIDIA ).

Phương pháp ‘Brady Bunch’ – có thể là một tham chiếu vô nghĩa cho bất kỳ ai không xem TV vào những năm 1970, hoặc ai đã bỏ lỡ các bộ phim chuyển thể từ những năm 1990 – xác định nội dung giả mạo GAN dựa trên các vị trí cố định mà các bộ phận cụ thể của khuôn mặt GAN sẽ chiếm, do quá trình ‘sản xuất’ khuôn mẫu và máy móc.

Phương pháp 'Brady Bunch' được đề xuất bởi một buổi phát trực tuyến từ Viện SANS vào năm 2022: một bộ tạo khuôn mặt GAN sẽ thực hiện việc đặt các tính năng khuôn mặt một cách đồng đều, tiết lộ nguồn gốc của ảnh, trong một số trường hợp. Nguồn: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf

Phương pháp ‘Brady Bunch’ được đề xuất bởi một buổi phát trực tuyến từ Viện SANS vào năm 2022: một bộ tạo khuôn mặt GAN sẽ thực hiện việc đặt các tính năng khuôn mặt một cách đồng đều, tiết lộ nguồn gốc của ảnh, trong một số trường hợp. Nguồn: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf

Một dấu hiệu khác hữu ích là sự không thể thường xuyên của StyleGAN trong việc kết xuất nhiều khuôn mặt (hình ảnh đầu tiên dưới đây), nếu cần, cũng như sự thiếu tài năng trong việc phối hợp phụ kiện (hình ảnh giữa dưới đây), và xu hướng sử dụng đường chân tóc như điểm bắt đầu của một chiếc mũ (hình ảnh thứ ba dưới đây).

Phương pháp thứ ba mà nhà nghiên cứu chú ý đến là đặt lớp ảnh (một ví dụ có thể được nhìn thấy trong bài viết tháng 8 của chúng tôi về đánh giá biểu cảm khuôn mặt AI để chẩn đoán rối loạn sức khỏe tâm thần), sử dụng phần mềm trộn ảnh ‘trộn ảnh’ như loạt CombineZ để kết hợp nhiều ảnh thành một ảnh duy nhất, thường tiết lộ các điểm tương đồng cơ bản trong cấu trúc – một dấu hiệu tiềm năng của tổng hợp.

Kiến trúc được đề xuất trong bài báo mới có tiêu đề (có thể là chống lại tất cả các lời khuyên về SEO) Blade Runner, ám chỉ bài kiểm tra Voight-Kampff xác định liệu các nhân vật phản diện trong loạt phim khoa học viễn tưởng có phải là ‘giả’ hay không.

Đường ống này bao gồm hai giai đoạn, giai đoạn đầu là bộ phân tích PapersPlease, có thể đánh giá dữ liệu được thu thập từ các trang web khuôn mặt GAN được biết đến như thispersondoesnotexist.com, hoặc được tạo.

Mặc dù một phiên bản cắt giảm của mã có thể được xem trên GitHub (xem dưới đây), nhưng ít chi tiết được cung cấp về mô-đun này, ngoại trừ việc OpenCV và DLIB được sử dụng để phác thảo và phát hiện khuôn mặt trong tài liệu thu thập được.

Mô-đun thứ hai là bộ phát hiện AmongUs. Hệ thống được thiết kế để tìm kiếm việc đặt mắt phối hợp trong ảnh, một tính năng nhất quán của đầu ra khuôn mặt StyleGAN, điển hình trong kịch bản ‘Brady Bunch’ được mô tả ở trên. AmongUs được cung cấp bởi một bộ phát hiện điểm mốc 68 tiêu chuẩn.

Các chú thích điểm khuôn mặt thông qua Nhóm Hiểu Biết Hành Vi Thông Minh (IBUG), mã code vẽ điểm mốc khuôn mặt của họ được sử dụng trong gói Blade Runner.

Các chú thích điểm khuôn mặt thông qua Nhóm Hiểu Biết Hành Vi Thông Minh (IBUG), mã code vẽ điểm mốc khuôn mặt của họ được sử dụng trong gói Blade Runner.

AmongUs phụ thuộc vào các điểm mốc đã được đào tạo trước dựa trên các tọa độ ‘Brady bunch’ được biết đến từ PapersPlease, và được thiết kế để sử dụng chống lại các mẫu khuôn mặt StyleGAN dựa trên web.

Blade Runner, tác giả đề xuất, là một giải pháp plug-and-play được thiết kế cho các công ty hoặc tổ chức thiếu nguồn lực để phát triển các giải pháp phát hiện deepfake trong nhà, và một ‘biện pháp tạm thời để mua thời gian cho các biện pháp phản công vĩnh viễn’.

Thực tế, trong lĩnh vực an ninh này, có rất ít giải pháp tùy chỉnh hoặc giải pháp của nhà cung cấp đám mây mà một công ty thiếu nguồn lực có thể hiện đang quay lại với sự tự tin.

Mặc dù Blade Runner hoạt động kém đối với đeo kính người giả mạo StyleGAN, đây là một vấn đề tương đối phổ biến trên các hệ thống tương tự, những hệ thống này dự kiến sẽ có thể đánh giá các đường viền mắt như các điểm tham chiếu cốt lõi, bị che khuất trong những trường hợp như vậy.

Một phiên bản giảm của Blade Runner đã được phát hành trên GitHub. Một phiên bản độc quyền nhiều tính năng hơn tồn tại, có thể xử lý nhiều ảnh, thay vì một ảnh mỗi hoạt động của kho lưu trữ mã nguồn mở. Tác giả dự định, anh nói, sẽ nâng cấp phiên bản GitHub lên cùng tiêu chuẩn cuối cùng, khi thời gian cho phép. Anh cũng thừa nhận rằng StyleGAN có khả năng sẽ phát triển vượt ra ngoài các điểm yếu và thiếu sót đã biết, và phần mềm cũng sẽ cần phải phát triển cùng với nó.

DE-FAKE

Kiến trúc DE-FAKE nhằm không chỉ đạt được ‘phát hiện phổ quát’ cho hình ảnh được tạo bởi các mô hình khuếch tán văn bản-sang-hình ảnh, mà còn cung cấp một phương pháp để phân biệt nào mô hình khuếch tán tiềm ẩn (LD) đã tạo ra hình ảnh.

Khung phát hiện phổ quát trong DE-FAKE giải quyết ảnh cục bộ, một khung hỗn hợp (xanh lá cây), và ảnh thế giới mở (xanh da trời). Nguồn: http://export.arxiv.org/pdf/2210.06998

Khung phát hiện phổ quát trong DE-FAKE giải quyết ảnh cục bộ, một khung hỗn hợp (xanh lá cây), và ảnh thế giới mở (xanh da trời). Nguồn: http://export.arxiv.org/pdf/2210.06998

Để trung thực, hiện tại, đây là một nhiệm vụ khá đơn giản, vì tất cả các mô hình LD phổ biến – mã nguồn đóng hoặc mã nguồn mở – đều có các đặc điểm khác biệt đáng chú ý.

Thêm vào đó, hầu hết đều chia sẻ một số điểm yếu chung, chẳng hạn như xu hướng cắt đầu, do cách tùy tiện mà các hình ảnh web được thu thập không theo hình vuông được đưa vào các tập dữ liệu lớn cung cấp năng lượng cho các hệ thống như DALL-E 2, Stable Diffusion và MidJourney:

Mô hình khuếch tán tiềm ẩn, giống như tất cả các mô hình tầm nhìn máy tính, yêu cầu đầu vào định dạng hình vuông; nhưng việc thu thập web tổng hợp cung cấp cho tập dữ liệu LAION5B không cung cấp 'đặc quyền' như khả năng nhận ra và tập trung vào khuôn mặt (hoặc bất cứ thứ gì khác), và cắt hình ảnh một cách tàn bạo thay vì lấp đầy chúng (điều này sẽ giữ lại toàn bộ hình ảnh nguồn, nhưng ở độ phân giải thấp hơn). Khi được đào tạo, những 'crops' này trở nên bình thường và thường xuyên xảy ra trong đầu ra của các hệ thống khuếch tán tiềm ẩn như Stable Diffusion.

Mô hình khuếch tán tiềm ẩn, giống như tất cả các mô hình tầm nhìn máy tính, yêu cầu đầu vào định dạng hình vuông; nhưng việc thu thập web tổng hợp cung cấp cho tập dữ liệu LAION5B không cung cấp ‘đặc quyền’ như khả năng nhận ra và tập trung vào khuôn mặt (hoặc bất cứ thứ gì khác), và cắt hình ảnh một cách tàn bạo thay vì lấp đầy chúng (điều này sẽ giữ lại toàn bộ hình ảnh nguồn, nhưng ở độ phân giải thấp hơn). Khi được đào tạo, những ‘crops’ này trở nên bình thường và thường xuyên xảy ra trong đầu ra của các hệ thống khuếch tán tiềm ẩn như Stable Diffusion.

DE-FAKE được thiết kế để trở nên không phụ thuộc vào thuật toán, một mục tiêu lâu dài của các nhà nghiên cứu chống lại deepfake dựa trên autoencoder, và hiện tại, khá dễ đạt được trong mối quan hệ với các hệ thống LD.

Khung này sử dụng thư viện đa phương tiện Pretraining Ngôn ngữ-Hình ảnh tương phản của OpenAI (CLIP) – một yếu tố thiết yếu trong Stable Diffusion và đang trở thành trái tim của làn sóng mới của các hệ thống tổng hợp hình ảnh/đideo – như một cách để trích xuất các bản nhúng từ ‘hình ảnh LD giả’ và đào tạo một bộ phân loại trên các mẫu và lớp quan sát được.

Trong một kịch bản ‘hộp đen’ hơn, nơi các khối PNG chứa thông tin về quá trình tạo ra đã bị xóa bởi các quy trình tải lên và vì các lý do khác, các nhà nghiên cứu sử dụng khuôn khổ BLIP của Salesforce (cũng là một thành phần trong ít nhất một phân phối của Stable Diffusion) để ‘mù quáng’ thăm dò các hình ảnh cho cấu trúc ngữ nghĩa có thể của các lời nhắc tạo ra chúng.

Các nhà nghiên cứu đã sử dụng Stable Diffusion, Latent Diffusion (mình là một sản phẩm rời rạc), GLIDE và DALL-E 2 để tạo ra một tập dữ liệu đào tạo và kiểm tra bằng cách tận dụng MSCOCO và Flickr30k.

Các nhà nghiên cứu đã sử dụng Stable Diffusion, Latent Diffusion (mình là một sản phẩm rời rạc), GLIDE và DALL-E 2 để tạo ra một tập dữ liệu đào tạo và kiểm tra bằng cách tận dụng MSCOCO và Flickr30k.

Thông thường, chúng tôi sẽ xem xét khá kỹ lưỡng kết quả của các thí nghiệm của các nhà nghiên cứu cho một khuôn khổ mới; nhưng thực tế, kết quả của DE-FAKE dường như sẽ có ích hơn như một điểm chuẩn tương lai cho các phiên bản và dự án tương tự, hơn là một thước đo có ý nghĩa của thành công dự án, xem xét môi trường dễ thay đổi mà nó đang hoạt động, và hệ thống mà nó đang cạnh tranh trong các thử nghiệm của bài báo là gần ba năm tuổi – từ khi cảnh tổng hợp hình ảnh còn non trẻ.

Hai hình ảnh bên trái nhất: khuôn khổ trước đó bị thách thức, bắt nguồn từ năm 2019, đương nhiên ít thành công hơn so với DE-FAKE (hai hình ảnh bên phải nhất) trên bốn hệ thống LD được thử nghiệm.  

Hai hình ảnh bên trái nhất: khuôn khổ trước đó bị thách thức, bắt nguồn từ năm 2019, đương nhiên ít thành công hơn so với DE-FAKE (hai hình ảnh bên phải nhất) trên bốn hệ thống LD được thử nghiệm.

Kết quả của nhóm nghiên cứu rất tích cực vì hai lý do: có rất ít công việc trước đó để so sánh, và không có công việc nào cung cấp một sự so sánh công bằng, tức là bao gồm cả 12 tuần kể từ khi Stable Diffusion được phát hành dưới dạng mã nguồn mở.

Thứ hai, như đã đề cập ở trên, mặc dù lĩnh vực tổng hợp hình ảnh LD đang phát triển với tốc độ tăng trưởng theo cấp số nhân, nhưng nội dung đầu ra của các dịch vụ hiện tại hiệu quả tự ‘đánh dấu’ bản thân bằng cách tận dụng các điểm yếu và đặc điểm cấu trúc (và rất dễ đoán) – nhiều trong số đó có khả năng sẽ được khắc phục, ít nhất là đối với Stable Diffusion, bởi việc phát hành mô hình 4GB được đào tạo (động lực đằng sau hệ thống).

Đồng thời, Stability đã chỉ ra rằng họ có một lộ trình rõ ràng cho V2 và V3 của hệ thống. Với những sự kiện gây chú ý trong ba tháng qua, bất kỳ sự ‘ngủ yên’ của OpenAI và các đối thủ cạnh tranh khác trong không gian tổng hợp hình ảnh có thể đã bị xóa bỏ, có nghĩa là chúng ta có thể mong đợi một tốc độ tiến bộ tương tự cũng trong không gian tổng hợp hình ảnh mã nguồn đóng.

 

Được xuất bản lần đầu vào ngày 14 tháng 10 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai