Góc nhìn Anderson

Đánh cắp mô hình học máy thông qua đầu ra API

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu mới từ Canada cung cấp một phương pháp có thể giúp các kẻ tấn công đánh cắp thành quả của các khuôn khổ học máy tốn kém, ngay cả khi chỉ có quyền truy cập vào một hệ thống độc quyền thông qua một API được bảo vệ cao (một giao diện hoặc giao thức xử lý các truy vấn của người dùng trên máy chủ và trả về chỉ phản hồi đầu ra).

Khi lĩnh vực nghiên cứu ngày càng tập trung vào việc kiếm tiền từ việc đào tạo mô hình tốn kém thông qua các triển khai Học máy như một Dịch vụ (MLaaS), nghiên cứu mới này cho thấy rằng các mô hình Học tự giám sát (SSL) dễ bị tổn thương hơn bởi loại tấn công này, vì chúng được đào tạo mà không có nhãn, làm cho việc trích xuất trở nên đơn giản hơn, và thường cung cấp kết quả chứa nhiều thông tin hữu ích cho người muốn sao chép mô hình nguồn (được ẩn).

Trong các mô phỏng kiểm tra “hộp đen” (trong đó các nhà nghiên cứu đã cấp cho mình không có quyền truy cập vào mô hình “nạn nhân” cục bộ hơn là một người dùng điển hình sẽ có thông qua một API web), các nhà nghiên cứu đã có thể sao chép các hệ thống mục tiêu với tài nguyên tương đối thấp:

‘[Các] cuộc tấn công của chúng tôi có thể đánh cắp một bản sao của mô hình nạn nhân đạt được hiệu suất đáng kể trong ít hơn 1/5 số truy vấn được sử dụng để đào tạo mô hình nạn nhân. Đối với một mô hình nạn nhân được đào tạo trên 1,2 triệu mẫu không có nhãn từ ImageNet, với độ chính xác 91,9% trong nhiệm vụ phân loại Fashion-MNIST, cuộc tấn công trích xuất trực tiếp của chúng tôi với mất mát InfoNCE đã đánh cắp một bản sao của bộ mã hóa đạt được độ chính xác 90,5% trong 200.000 truy vấn.

‘Tương tự, đối với một mô hình nạn nhân được đào tạo trên 50.000 mẫu không có nhãn từ CIFAR10, với độ chính xác 79,0% trong nhiệm vụ phân loại CIFAR10, cuộc tấn công trích xuất trực tiếp của chúng tôi với mất mát SoftNN đã đánh cắp một bản sao đạt được độ chính xác 76,9% trong 9.000 truy vấn.’

Các nhà nghiên cứu đã sử dụng ba phương pháp tấn công, phát hiện ra rằng 'Trích xuất trực tiếp' là phương pháp hiệu quả nhất. Những mô hình này đã bị đánh cắp từ một mô hình mã hóa CIFAR10 nạn nhân được tạo lại cục bộ sử dụng 9.000 truy vấn từ tập kiểm tra CIFAR10. Nguồn: https://arxiv.org/pdf/2205.07890.pdf

Các nhà nghiên cứu đã sử dụng ba phương pháp tấn công, phát hiện ra rằng ‘Trích xuất trực tiếp’ là phương pháp hiệu quả nhất. Những mô hình này đã bị đánh cắp từ một mô hình mã hóa CIFAR10 nạn nhân được tạo lại cục bộ sử dụng 9.000 truy vấn từ tập kiểm tra CIFAR10. Nguồn: https://arxiv.org/pdf/2205.07890.pdf

Các nhà nghiên cứu cũng lưu ý rằng các phương pháp phù hợp để bảo vệ các mô hình được đào tạo có giám sát khỏi các cuộc tấn công không thích ứng tốt với các mô hình được đào tạo trên cơ sở không có giám sát – mặc dù những mô hình như vậy đại diện cho một số thành quả được mong đợi và chào đón nhất của lĩnh vực tổng hợp hình ảnh.

Nghiên cứu mới bài báo có tiêu đề Về sự khó khăn của việc bảo vệ Học tự giám sát khỏi việc trích xuất mô hình, và đến từ Đại học Toronto và Viện Vector cho Trí tuệ Nhân tạo.

Sự nhận thức của bản thân

Trong Học tự giám sát, một mô hình được đào tạo trên dữ liệu không có nhãn. Không có nhãn, một mô hình SSL phải học các mối quan hệ và nhóm từ cấu trúc ngầm của dữ liệu, tìm kiếm các khía cạnh tương tự của dữ liệu và dần dần thu thập những khía cạnh này vào các nút, hoặc biểu diễn.

Ở nơi một phương pháp SSL có thể thực hiện được, nó vô cùng sản xuất, vì nó bỏ qua nhu cầu về việc phân loại tốn kém (thường được thuê ngoài và đáng tranh cãi) bởi các công nhân đám đông, và cơ bản hợp lý hóa dữ liệu một cách tự chủ.

Ba phương pháp SSL được xem xét bởi các tác giả của bài báo mới là SimCLR, một Mạng Siamese; SimSiam, một Mạng Siamese khác tập trung vào việc học biểu diễn; và Barlow Twins, một phương pháp SSL đạt được hiệu suất phân loại ImageNet tốt nhất vào năm 2021.

Trích xuất mô hình cho dữ liệu có nhãn (tức là một mô hình được đào tạo thông qua học có giám sát) là một lĩnh vực nghiên cứu tương đối được ghi chép lại. Nó cũng dễ bảo vệ hơn, vì kẻ tấn công phải có được các nhãn từ mô hình nạn nhân để tái tạo nó.

Một mô hình 'knockoff classifier' tấn công đối với một kiến trúc học có giám sát. Nguồn: https://arxiv.org/pdf/1812.02766.pdf

Một mô hình ‘knockoff classifier’ tấn công đối với một kiến trúc học có giám sát. Nguồn: https://arxiv.org/pdf/1812.02766.pdf

Không có quyền truy cập trắng, đây không phải là một nhiệm vụ tầm thường, vì đầu ra điển hình từ một yêu cầu API đến mô hình như vậy chứa ít thông tin hơn so với một API SSL điển hình.

Từ bài báo*:

‘Công việc trước đây về trích xuất mô hình tập trung vào thiết lập Học có giám sát (SL), nơi mô hình nạn nhân thường trả về một nhãn hoặc đầu ra thấp chiều khác như điểm tự tin hoặc logits.

‘Ngược lại, các bộ mã hóa SSL trả về các biểu diễn chiều cao; de facto đầu ra cho một mô hình Sim-CLR ResNet-50, một kiến trúc phổ biến trong tầm nhìn, là một vector 2048 chiều.

‘Chúng tôi đưa ra giả thuyết rằng sự rò rỉ thông tin cao hơn đáng kể từ các bộ mã hóa làm cho chúng dễ bị tổn thương hơn bởi các cuộc tấn công trích xuất so với các mô hình SL.’

Kiến trúc và Dữ liệu

Các nhà nghiên cứu đã kiểm tra ba phương pháp để suy luận/trích xuất mô hình SSL: Trích xuất trực tiếp, trong đó đầu ra API được so sánh với đầu ra của một bộ mã hóa được tạo lại thông qua một hàm mất mát phù hợp như Mean Squared Error (MSE); tái tạo đầu dự án, nơi một chức năng phân tích quan trọng của mô hình, thường bị loại bỏ trước khi triển khai, được tái tạo và sử dụng trong một mô hình sao chép; và truy cập đầu dự án, chỉ có thể thực hiện được trong các trường hợp mà các nhà phát triển ban đầu đã làm cho kiến trúc có sẵn.

Trong phương pháp #1, Trích xuất trực tiếp, đầu ra của mô hình nạn nhân được so sánh với đầu ra của một mô hình cục bộ; phương pháp #2 liên quan đến việc tái tạo đầu dự án được sử dụng trong kiến trúc đào tạo ban đầu (và thường không được bao gồm trong một mô hình được triển khai).

Trong phương pháp #1, Trích xuất trực tiếp, đầu ra của mô hình nạn nhân được so sánh với đầu ra của một mô hình cục bộ; phương pháp #2 liên quan đến việc tái tạo đầu dự án được sử dụng trong kiến trúc đào tạo ban đầu (và thường không được bao gồm trong một mô hình được triển khai).

Các nhà nghiên cứu phát hiện ra rằng Trích xuất trực tiếp là phương pháp hiệu quả nhất để có được một bản sao chức năng của mô hình mục tiêu, và có lợi thế thêm là khó xác định nó như một ‘cuộc tấn công’ (vì nó cơ bản hành động không khác gì so với một người dùng cuối hợp lệ).

Các tác giả đã đào tạo các mô hình nạn nhân trên ba tập dữ liệu hình ảnh: CIFAR10, ImageNet, và Stanford’s Street View House Numbers (SVHN). ImageNet được đào tạo trên ResNet50, trong khi CIFAR10 và SVHN được đào tạo trên ResNet18 và ResNet24 trên một triển khai PyTorch có sẵn của SimCLR.

Hiệu suất của mô hình khi triển khai (tức là được triển khai) đã được kiểm tra chống lại CIFAR100, STL10, SVHN, và Fashion-MNIST. Các nhà nghiên cứu cũng đã thực nghiệm với các phương pháp ‘hộp trắng’ hơn của việc chiếm hữu mô hình, mặc dù nó đã được chứng minh rằng Trích xuất trực tiếp, phương pháp được đặc quyền thấp nhất, đã mang lại kết quả tốt nhất.

Để đánh giá các biểu diễn được suy luận và sao chép trong các cuộc tấn công, các tác giả đã thêm một lớp dự đoán tuyến tính vào mô hình, được tinh chỉnh trên toàn bộ tập đào tạo có nhãn từ nhiệm vụ (triển khai) sau, với các lớp mạng còn lại bị đóng băng. Theo cách này, độ chính xác của lớp dự đoán có thể hoạt động như một metric cho hiệu suất. Vì nó không đóng góp gì cho quá trình suy luận, điều này không đại diện cho chức năng ‘hộp trắng’.

Kết quả trên các lần chạy kiểm tra, được thực hiện có thể bởi Lớp đánh giá tuyến tính (non-contributing). Điểm chính xác trong chữ đậm.

Kết quả trên các lần chạy kiểm tra, được thực hiện có thể bởi Lớp đánh giá tuyến tính (non-contributing). Điểm chính xác trong chữ đậm.

Nhận xét về kết quả, các nhà nghiên cứu tuyên bố:

‘Chúng tôi phát hiện ra rằng mục tiêu trực tiếp của việc bắt chước các biểu diễn của nạn nhân mang lại hiệu suất cao trên các nhiệm vụ sau despite đòi hỏi chỉ một phần nhỏ (dưới 15% trong một số trường hợp) số lượng truy vấn cần thiết để đào tạo bộ mã hóa bị đánh cắp từ đầu.’

Và tiếp tục:

‘[Nó] là một thách thức để bảo vệ các bộ mã hóa được đào tạo với SSL vì các biểu diễn đầu ra rò rỉ một lượng thông tin đáng kể. Các phương pháp phòng thủ hứa hẹn nhất là các phương pháp phản ứng, chẳng hạn như watermarking, có thể nhúng các tăng cường cụ thể vào các bộ mã hóa có dung lượng cao.’

 

* Tôi đã chuyển đổi các trích dẫn trong bài báo sang các liên kết.

Được xuất bản lần đầu vào ngày 18 tháng 5 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai