Góc nhìn Anderson

Xác định lại Dữ liệu Nguồn cho Máy phát GAN

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu mới từ Pháp đã đề xuất một kỹ thuật để ‘xác định lại’ các danh tính nguồn đã đóng góp vào dữ liệu được tạo tổng hợp, chẳng hạn như ‘người không tồn tại’ được tạo bởi các dự án tạo khuôn mặt như This Person Does Not Exist.

Phương pháp được mô tả trong bài báo, có tiêu đề This Person (Probably) Exists. Identity Membership Attacks Against GAN Generated Faces, không yêu cầu (không thể) truy cập vào kiến trúc đào tạo hoặc dữ liệu mô hình, và có thể được áp dụng cho nhiều ứng dụng mà việc sử dụng Mạng Đối kháng Tạo (GANs) đang được khám phá như các phương pháp để ẩn danh thông tin nhận dạng cá nhân (PII) hoặc tạo dữ liệu tổng hợp trong khi bảo vệ tài liệu nguồn.

Các nhà nghiên cứu đã xây dựng một phương pháp gọi là Identity Membership Attack, đánh giá khả năng một danh tính duy nhất xuất hiện thường xuyên trong tập dữ liệu đóng góp, thay vì cố gắng tập trung vào các đặc điểm cụ thể của một danh tính (ví dụ: các nhóm pixel của hình ảnh gốc được sử dụng để đào tạo mô hình tạo).

Source: https://arxiv.org/pdf/2107.06018.pdf

Source: https://arxiv.org/pdf/2107.06018.pdf

Trong hình ảnh trên, từ nghiên cứu, mỗi hàng bắt đầu với hình ảnh được tạo bởi StyleGAN. Khối hình ảnh bên trái được tạo từ cơ sở dữ liệu 40.000 hình ảnh, hình ảnh giữa từ 80.000 và khối hình ảnh bên phải từ 46.000 hình ảnh. Tất cả hình ảnh đến từ tập dữ liệu VGG2Face2.

Một số mẫu có sự tương đồng thoáng qua, trong khi những mẫu khác tương quan mạnh mẽ với dữ liệu đào tạo. Các khuôn mặt đã được xác định thành công bởi các nhà nghiên cứu sử dụng mạng lưới nhận dạng khuôn mặt.

More Than Value

Các phương pháp xác định lại này có nhiều ý nghĩa trên nhiều lĩnh vực nghiên cứu; các nhà nghiên cứu, đặt tại Đại học Caen ở Normandy, nhấn mạnh rằng kỹ thuật của họ không giới hạn ở tập hợp khuôn mặt và khuôn khổ tạo khuôn mặt GAN, mà cũng có thể áp dụng cho tập dữ liệu hình ảnh y tế và dữ liệu sinh trắc học, trong số các bề mặt tấn công có thể khác trong các khuôn khổ tổng hợp hình ảnh.

‘Chúng tôi cho rằng nếu thành công, một cuộc tấn công như vậy sẽ tiết lộ một chướng ngại vật nghiêm trọng cho việc trao đổi an toàn của GANs trong các ngữ cảnh nhạy cảm. Ví dụ, trong ngữ cảnh của các bức tranh hoặc các tác phẩm nghệ thuật khác, việc phân phối một máy phát không riêng tư có thể bị loại bỏ vì các vấn đề bản quyền rõ ràng. Quan trọng hơn, hãy xem xét một công ty sinh trắc học A phát hành một máy phát phơi bày danh tính người tiêu dùng của nó. Một công ty B khác có thể có khả năng phát hiện những khách hàng nào của họ cũng là khách hàng của công ty A. Các tình huống tương tự có thể tạo ra các vấn đề nghiêm trọng cho dữ liệu y tế, nơi việc tiết lộ một GAN có thể vi phạm thông tin cá nhân về bệnh của bệnh nhân.’

Xác định lại Dữ liệu Web-Scraped hoặc Riêng tư Không Hợp pháp

Mặc dù bài báo chỉ chạm nhẹ vào chủ đề này, khả năng xác định dữ liệu nguồn từ đầu ra trừu tượng (chẳng hạn như khuôn mặt được tạo bởi GAN, mặc dù điều này cũng áp dụng cho các hệ thống mã hóa/giải mã và các kiến trúc khác) có các ý nghĩa đáng chú ý cho việc thực hiện bảo vệ bản quyền trong 5-10 năm tới.

Hiện tại, hầu hết các quốc gia đang hoạt động theo cách laissez faire đối với việc thu thập dữ liệu web công khai để không bị tụt lại phía sau trong giai đoạn phát triển của các nền kinh tế học máy sắp tới. Khi khí hậu này trở nên thương mại hóa và củng cố, có tiềm năng đáng kể cho một thế hệ mới của ‘Data Trolls’ để trình bày các yêu cầu bản quyền về hình ảnh được xác nhận đã được sử dụng trong lịch sử trong các tập dữ liệu đã đóng góp cho các thuật toán học máy.

Khi các thuật toán phát triển trưởng thành và trở nên có giá trị hơn theo thời gian, bất kỳ hình ảnh không được phép nào được sử dụng trong quá trình phát triển ban đầu của chúng và có thể được suy luận từ đầu ra của chúng bằng các phương pháp tương tự như những phương pháp được đề xuất trong bài báo mới của Pháp, là một trách nhiệm pháp lý tiềm năng trên quy mô của vụ kiện SCO Vs IBM (một vụ kiện công nghệ dài nổi tiếng vẫn tiếp tục đe dọa hệ điều hành Linux).

Khai thác Mexican Stand-off của Sự đa dạng so với Tần suất

Kỹ thuật chính được các nhà nghiên cứu Pháp sử dụng khai thác tần suất của hình ảnh trong tập dữ liệu nguồn như một khóa để xác định lại. Càng nhiều một danh tính cụ thể được tìm thấy trong tập dữ liệu, càng có khả năng xác định danh tính nguồn đó bằng cách tương quan kết quả của cuộc tấn công với các tập dữ liệu công khai hoặc riêng tư có sẵn.

Các nhà nghiên cứu lưu ý rằng điều này có thể được giảm thiểu bằng cách bao gồm sự đa dạng lớn hơn của dữ liệu (ví dụ, khuôn mặt) trong tập dữ liệu nguồn và không đào tạo tập dữ liệu quá lâu để quá trình phù hợp xảy ra. Vấn đề với điều này là mô hình phải đạt được sự trừu tượng hóa tốt trong không gian chiều cao hơn và với một lượng dữ liệu lớn hơn nhiều so với cần thiết để có được kết quả tổng hợp hợp lý.

Để đạt được sự khái quát hóa tối ưu như vậy là tốn kém và mất thời gian; không gian tiềm ẩn (phần phân tích công thức của mô hình học máy mà dữ liệu được đưa vào) sẽ cần nhiều tài nguyên hơn; tập dữ liệu sẽ cần nhiều công việc chuẩn bị hơn; và vì lượng dữ liệu sẽ cần phải đáng kể, kích thước lô và lịch trình tốc độ sẽ phải được tối ưu hóa cho chất lượng và mức độ khái quát hóa cao, thay vì tốc độ đào tạo và tiết kiệm, dẫn đến chi phí phát triển cao hơn và thời gian phát triển dài hơn.

Hơn nữa, các thuật toán tạo quá mức có thể đạt được dữ liệu tổng hợp rất thực tế, ngay cả khi dữ liệu đầu ra (ví dụ: khuôn mặt, bản đồ, hình ảnh y sinh, v.v.) không hoàn toàn trừu tượng, nhưng có các đặc điểm phân biệt lớn hơn từ dữ liệu nguồn so với lý tưởng – một lối tắt hấp dẫn. Trong khí hậu ‘phương tây hoang dã’ hiện tại của lĩnh vực học máy, nơi các sáng kiến nhỏ hơn đang cố gắng thách thức sự dẫn đầu của FAANG với ít tài nguyên hơn (hoặc để thu hút sự chú ý cho việc mua lại), nó có thể đặt câu hỏi liệu các tiêu chuẩn luôn tăng cao như vậy.

Bài báo cũng quan sát thấy rằng sự đa dạng của các điểm dữ liệu nguồn (chẳng hạn như khuôn mặt) không đủ để ngăn chặn việc xác định lại thông qua các phương pháp này và tương tự, vì việc dừng đào tạo sớm có thể để lại các danh tính nguồn không được trừu tượng hóa đầy đủ.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai