Góc nhìn Anderson

Phát hiện cuộc gọi video Deepfake thông qua ánh sáng màn hình

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một sự hợp tác mới giữa một nhà nghiên cứu từ Cơ quan An ninh Quốc gia Hoa Kỳ (NSA) và Đại học California tại Berkeley cung cấp một phương pháp mới để phát hiện nội dung deepfake trong bối cảnh video trực tiếp – bằng cách quan sát hiệu ứng của ánh sáng màn hình trên diện mạo của người ở đầu kia của cuộc gọi video.

Người dùng DeepFaceLive phổ biến Druuzil Tech & Games thử nghiệm mô hình Christian Bale DeepFaceLab của mình trong một phiên trực tiếp với người theo dõi của mình, trong khi các nguồn ánh sáng thay đổi. Nguồn: https://www.youtube.com/watch?v=XPQLDnogLKA

Người dùng DeepFaceLive phổ biến Druuzil Tech & Games thử nghiệm mô hình Christian Bale DeepFaceLab của mình trong một phiên trực tiếp với người theo dõi của mình, trong khi các nguồn ánh sáng thay đổi. Nguồn: https://www.youtube.com/watch?v=XPQLDnogLKA

Hệ thống này hoạt động bằng cách đặt một yếu tố đồ họa trên màn hình của người dùng thay đổi một phạm vi màu sắc hẹp hơn so với hệ thống deepfake thông thường có thể phản ứng – ngay cả khi, như triển khai streaming deepfake thời gian thực DeepFaceLive (hình trên), nó có một số khả năng duy trì chuyển giao màu sắc trực tiếp và tính toán ánh sáng xung quanh.

Hình ảnh màu sắc đồng nhất được hiển thị trên màn hình của người ở đầu kia (tức là kẻ lừa đảo deepfake tiềm năng) chu kỳ qua một biến thể màu sắc hạn chế được thiết kế không để kích hoạt cân bằng trắng tự động của webcam và các hệ thống bù sáng ad hoc khác, điều này sẽ làm hỏng phương pháp.

Từ bài báo, một hình minh họa về sự thay đổi điều kiện ánh sáng từ màn hình trước mặt người dùng, hoạt động như một 'đèn khu vực'漫漫.

Từ bài báo, một hình minh họa về sự thay đổi điều kiện ánh sáng từ màn hình trước mặt người dùng, hoạt động như một ‘đèn khu vực’漫漫. Nguồn: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

Ly thuyết đằng sau phương pháp này là các hệ thống deepfake trực tiếp không thể phản ứng kịp thời với các thay đổi được mô tả trong đồ họa trên màn hình, làm tăng ‘trì hoãn’ của hiệu ứng deepfake ở một số phần của phổ màu sắc, tiết lộ sự hiện diện của nó.

Để có thể đo lường ánh sáng màn hình phản xạ một cách chính xác, hệ thống cần phải tính toán và sau đó loại bỏ hiệu ứng của ánh sáng môi trường chung không liên quan đến ánh sáng từ màn hình. Sau đó, nó có thể phân biệt sự thiếu hụt trong đo lường màu sắc hoạt động và màu sắc khuôn mặt của người dùng, đại diện cho một sự thay đổi thời gian 1-4 khung hình giữa mỗi:

Bằng cách hạn chế sự thay đổi màu sắc trong đồ họa 'phát hiện' trên màn hình, và đảm bảo rằng webcam của người dùng không được kích hoạt để tự động điều chỉnh cài đặt chụp bởi sự thay đổi quá mức trong mức độ ánh sáng màn hình, các nhà nghiên cứu đã có thể phân biệt một sự 'trì hoãn' đáng kể trong việc điều chỉnh hệ thống deepfake với sự thay đổi ánh sáng.

Bằng cách hạn chế sự thay đổi màu sắc trong đồ họa ‘phát hiện’ trên màn hình, và đảm bảo rằng webcam của người dùng không được kích hoạt để tự động điều chỉnh cài đặt chụp bởi sự thay đổi quá mức trong mức độ ánh sáng màn hình, các nhà nghiên cứu đã có thể phân biệt một sự ‘trì hoãn’ đáng kể trong việc điều chỉnh hệ thống deepfake với sự thay đổi ánh sáng.

Bài báo kết luận:

‘Vì sự tin tưởng hợp lý mà chúng ta đặt vào các cuộc gọi video trực tiếp, và sự phổ biến ngày càng tăng của các cuộc gọi video trong cuộc sống cá nhân và chuyên nghiệp của chúng ta, chúng tôi đề xuất rằng các kỹ thuật để xác thực video (và âm thanh) sẽ chỉ tăng lên về tầm quan trọng.’

Bài nghiên cứu này có tiêu đề Phát hiện video Deepfake thời gian thực bằng cách sử dụng ánh sáng hoạt động, và đến từ Candice R. Gerstner, một nhà toán học ứng dụng tại Bộ Quốc phòng Hoa Kỳ, và Giáo sư Hany Farid của Berkeley.

Sự xói mòn niềm tin

Cảnh quan nghiên cứu chống deepfake đã thay đổi đáng kể trong sáu tháng qua, từ việc phát hiện deepfake chung (tức là nhắm vào các video được ghi lại trước và nội dung khiêu dâm) sang việc phát hiện ‘sự sống’ (trong các cuộc gọi video hội nghị), để đáp ứng với một làn sóng ngày càng tăng các vụ việc sử dụng deepfake trong các cuộc gọi video hội nghị, và để đáp ứng với cảnh báo gần đây của FBI về việc sử dụng ngày càng tăng các công nghệ như vậy trong các ứng dụng làm việc từ xa.

Ngay cả khi một cuộc gọi video không bị deepfake, các cơ hội ngày càng tăng cho các kẻ giả mạo video AI đang bắt đầu tạo ra sự hoảng loạn.

Bài báo mới này tuyên bố:

‘Việc tạo ra các deepfake thời gian thực [đặt ra] các mối đe dọa duy nhất vì sự tin tưởng chung xung quanh một cuộc gọi video hoặc điện thoại trực tiếp, và thách thức trong việc phát hiện deepfake trong thời gian thực, khi cuộc gọi đang diễn ra.’

Cộng đồng nghiên cứu đã đặt ra mục tiêu từ lâu là tìm ra các dấu hiệu không thể chối cãi của nội dung deepfake mà không thể dễ dàng bù đắp. Mặc dù truyền thông thường mô tả điều này dưới dạng một cuộc chiến công nghệ giữa các nhà nghiên cứu an ninh và các nhà phát triển deepfake, hầu hết các phủ nhận của các phương pháp ban đầu (như phân tích chớp mắt, phân biệt tư thế đầu, và phân tích hành vi) đã xảy ra đơn giản vì các nhà phát triển và người dùng đang cố gắng tạo ra các deepfake thực tế hơn nói chung, chứ không phải cụ thể là giải quyết ‘dấu hiệu’ mới nhất được xác định bởi cộng đồng an ninh.

Chiếu sáng video Deepfake trực tiếp

Phát hiện deepfake trong môi trường video trực tiếp mang theo gánh nặng của việc tính toán các kết nối video kém, rất phổ biến trong các kịch bản hội nghị video. Ngay cả khi không có một lớp deepfake can thiệp, nội dung video có thể bị ảnh hưởng bởi độ trễ kiểu NASA, các hiện tượng kết xuất, và các loại suy giảm khác trong âm thanh và video. Những điều này có thể phục vụ để che giấu các cạnh thô trong một kiến trúc deepfake trực tiếp, cả về video và giọng nói deepfake.

Các tác giả của hệ thống mới này đã cải tiến kết quả và phương pháp được trình bày trong một xuất bản năm 2020 từ Trung tâm Máy tính Mạng tại Đại học Temple ở Philadelphia.

Từ bài báo năm 2020, chúng ta có thể quan sát sự thay đổi trong 'đèn chiếu sáng khuôn mặt' khi nội dung trên màn hình của người dùng thay đổi. Nguồn: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

Từ bài báo năm 2020, chúng ta có thể quan sát sự thay đổi trong ‘đèn chiếu sáng khuôn mặt’ khi nội dung trên màn hình của người dùng thay đổi. Nguồn: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

Sự khác biệt trong công việc mới là nó tính đến cách các webcam phản ứng với sự thay đổi ánh sáng. Các tác giả giải thích:

‘Vì tất cả các webcam hiện đại thực hiện tự động phơi sáng, loại chiếu sáng hoạt động cường độ cao [sử dụng trong công việc trước] có khả năng kích hoạt tự động phơi sáng của máy ảnh, điều này sẽ làm hỏng sự xuất hiện của khuôn mặt được ghi lại. Để tránh điều này, chúng tôi sử dụng một chiếu sáng hoạt động bao gồm một sự thay đổi đồng màu về màu sắc. ‘

‘Mặc dù điều này tránh được tự động phơi sáng của máy ảnh, nhưng nó có thể kích hoạt cân bằng trắng của máy ảnh, điều này sẽ lại làm hỏng sự xuất hiện của khuôn mặt được ghi lại. Để tránh điều này, chúng tôi hoạt động trong một phạm vi màu sắc mà chúng tôi đã xác định không kích hoạt cân bằng trắng.’

Đối với sáng kiến này, các tác giả cũng xem xét các nỗ lực tương tự trước đó, như LiveScreen,forcing một mẫu chiếu sáng không rõ ràng lên màn hình của người dùng cuối cùng trong nỗ lực để tiết lộ nội dung deepfake.

Mặc dù hệ thống đó đạt được tỷ lệ chính xác 94,8%, các nhà nghiên cứu kết luận rằng sự tinh tế của các mẫu ánh sáng sẽ khiến việc triển khai một cách tiếp cận bí mật trở nên khó khăn trong các môi trường sáng sủa, và thay vào đó đề xuất rằng hệ thống của họ, hoặc một hệ thống theo cùng các dòng, có thể được tích hợp công khai và theo mặc định vào phần mềm hội nghị video phổ biến:

‘Can thiệp của chúng tôi có thể được thực hiện bởi một người tham gia cuộc gọi chia sẻ màn hình và hiển thị mẫu thay đổi theo thời gian, hoặc, lý tưởng nhất, nó có thể được tích hợp trực tiếp vào khách hàng cuộc gọi video.’

Thử nghiệm

Các tác giả đã sử dụng một hỗn hợp của các đối tượng tổng hợp và thực tế để thử nghiệm bộ phát hiện deepfake Dlib-driven của họ. Đối với kịch bản tổng hợp, họ sử dụng Mitsuba, một trình kết xuất chuyển tiếp và ngược từ Viện Công nghệ Liên bang Thụy Sĩ tại Lausanne.

Các mẫu từ bộ dữ liệu mô phỏng, với các màu da khác nhau, kích thước nguồn sáng, cường độ ánh sáng xung quanh và khoảng cách đến máy ảnh.

Các mẫu từ thử nghiệm môi trường mô phỏng, với các màu da khác nhau, kích thước nguồn sáng, cường độ ánh sáng xung quanh và khoảng cách đến máy ảnh.

Cảnh được mô tả bao gồm một đầu CGI tham số được chụp từ một máy ảnh ảo với góc nhìn 90°. Các đầu này có phản xạ Lambertian và màu da trung tính, và được đặt 2 feet trước máy ảnh ảo.

Để thử nghiệm khuôn khổ trên một loạt các cấu hình có thể, các nhà nghiên cứu đã chạy một loạt các thử nghiệm, thay đổi các khía cạnh khác nhau tuần tự. Các khía cạnh được thay đổi bao gồm màu da, khoảng cách và kích thước nguồn sáng.

Các tác giả nhận xét:

‘Trong mô phỏng, với các giả định của chúng tôi được thỏa mãn, kỹ thuật đề xuất của chúng tôi rất mạnh mẽ đối với một loạt các cấu hình hình ảnh.’

Đối với kịch bản thực tế, các nhà nghiên cứu đã sử dụng 15 tình nguyện viên với các màu da khác nhau, trong các môi trường đa dạng. Mỗi người đã trải qua hai chu kỳ của sự thay đổi màu sắc hạn chế, trong điều kiện mà tốc độ làm mới màn hình 30Hz được đồng bộ hóa với webcam, có nghĩa là chiếu sáng hoạt động sẽ chỉ tồn tại trong một giây tại một thời điểm. Kết quả tương tự như các thử nghiệm tổng hợp, mặc dù sự tương quan tăng đáng kể với các giá trị chiếu sáng lớn hơn.

Hướng phát triển trong tương lai

Hệ thống, các nhà nghiên cứu thừa nhận, không tính đến các che khuất khuôn mặt thông thường, chẳng hạn như tóc mái, kính, hoặc râu. Tuy nhiên, họ lưu ý rằng việc che khuất như vậy có thể được thêm vào các hệ thống sau này (thông qua nhãn và phân đoạn ngữ nghĩa sau), có thể được đào tạo để lấy giá trị chỉ từ các khu vực da được nhận thức của đối tượng mục tiêu.

Các tác giả cũng đề xuất rằng một khuôn khổ tương tự có thể được sử dụng để phát hiện các cuộc gọi âm thanh deepfake, và âm thanh cần thiết có thể được phát trong một tần số ngoài phạm vi thính giác bình thường của con người.

Có lẽ điều thú vị nhất, các nhà nghiên cứu cũng đề xuất rằng việc mở rộng khu vực đánh giá ngoài khuôn mặt trong một khuôn khổ bắt gặp phong phú hơn có thể cải thiện đáng kể khả năng phát hiện deepfake:

‘Một ước tính 3-D chiếu sáng tinh vi hơn sẽ cung cấp một mô hình ngoại hình phong phú hơn mà sẽ khó khăn hơn cho một kẻ lừa đảo để tránh. Trong khi chúng tôi chỉ tập trung vào khuôn mặt, màn hình máy tính cũng chiếu sáng cổ, thân trên và nền xung quanh, từ đó có thể thực hiện các phép đo tương tự. ‘

‘Các phép đo bổ sung này sẽ buộc kẻ lừa đảo phải xem xét toàn bộ cảnh 3-D, không chỉ khuôn mặt.’

 

* Tôi đã chuyển đổi các trích dẫn nội dòng của tác giả thành liên kết.

Được xuất bản lần đầu vào ngày 6 tháng 7 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai