Mô hình và nền tảng AI
Thuật toán TextFooler đánh lừa trí tuệ nhân tạo NLP
Mặc dù các thuật toán và hệ thống xử lý ngôn ngữ tự nhiên đã trở nên ấn tượng trong những năm gần đây, nhưng chúng vẫn dễ bị tấn công bởi một loại khai thác gọi là “ví dụ đối lập”. Các ví dụ đối lập là các cụm từ được thiết kế cẩn thận có thể khiến hệ thống NLP hoạt động không mong muốn và không mong muốn. Các chương trình AI có thể bị đánh lừa bởi những ví dụ kỳ lạ này, và do đó, các nhà nghiên cứu AI đang cố gắng thiết kế cách bảo vệ chống lại tác động của các ví dụ đối lập.
Gần đây, một nhóm nghiên cứu từ Đại học Hồng Kông và Cơ quan Khoa học, Công nghệ và Nghiên cứu của Singapore đã hợp tác để tạo ra một thuật toán chứng minh sự nguy hiểm của các ví dụ đối lập. Theo báo cáo của Wired, thuật toán này được nhóm nghiên cứu đặt tên là TextFooler và nó hoạt động bằng cách thay đổi tinh vi các phần của một câu, ảnh hưởng đến cách một phân loại器 NLP giải thích câu đó. Ví dụ, thuật toán đã chuyển một câu thành một câu khác tương tự và câu đó được đưa vào một phân loại器 được thiết kế để xác định xem một đánh giá là tiêu cực hay tích cực. Câu gốc là:
“Các nhân vật, được chọn trong những tình huống không thể xảy ra, là hoàn toàn xa rời thực tế.”
Nó được chuyển thành câu này:
“Các nhân vật, được chọn trong những tình huống được thiết kế, là hoàn toàn xa rời thực tế.”
Các thay đổi tinh vi này đã khiến phân loại器 văn bản phân loại đánh giá là tích cực thay vì tiêu cực. Nhóm nghiên cứu đã thử nghiệm cách tiếp cận tương tự (thay thế một số từ bằng đồng nghĩa) trên nhiều tập dữ liệu và thuật toán phân loại văn bản khác nhau. Nhóm nghiên cứu báo cáo rằng họ đã có thể giảm độ chính xác phân loại của một thuật toán xuống chỉ 10%, từ 90%. Điều này mặc dù người đọc những câu này sẽ giải thích chúng có cùng ý nghĩa.
Kết quả này gây lo ngại trong một thời đại mà các thuật toán NLP và AI đang được sử dụng ngày càng nhiều và cho các nhiệm vụ quan trọng như đánh giá yêu cầu y tế hoặc phân tích tài liệu pháp lý. Không rõ mức độ nguy hiểm của các ví dụ đối lập đối với các thuật toán hiện đang được sử dụng. Các nhóm nghiên cứu trên toàn thế giới vẫn đang cố gắng xác định mức độ tác động của chúng. Gần đây, một báo cáo được công bố bởi nhóm Trí tuệ nhân tạo lấy con người làm trung tâm của Stanford đã đề xuất rằng các ví dụ đối lập có thể đánh lừa các thuật toán AI và được sử dụng để thực hiện gian lận thuế.
Có một số hạn chế trong nghiên cứu gần đây. Ví dụ, trong khi Sameer Singh, giáo sư trợ lý khoa học máy tính tại UC Irvine, lưu ý rằng phương pháp đối lập được sử dụng là hiệu quả, nó phụ thuộc vào một số kiến thức về kiến trúc AI. AI phải được thăm dò nhiều lần cho đến khi một nhóm từ hiệu quả có thể được tìm thấy, và những cuộc tấn công lặp đi lặp lại như vậy có thể được nhận thấy bởi các chương trình bảo mật. Singh và các đồng nghiệp đã thực hiện nghiên cứu của riêng họ về chủ đề này và phát hiện ra rằng các hệ thống tiên tiến như các thuật toán OpenAI có thể cung cấp văn bản có hại, phân biệt chủng tộc khi được kích hoạt bởi các cụm từ kích hoạt nhất định.
Các ví dụ đối lập cũng là một vấn đề tiềm ẩn khi xử lý dữ liệu trực quan như ảnh hoặc video. Một ví dụ nổi tiếng liên quan đến việc áp dụng các biến đổi kỹ thuật số tinh vi cho một hình ảnh mèo con, khiến phân loại器 hình ảnh giải thích nó là một màn hình hoặc máy tính để bàn. Trong một ví dụ khác, nghiên cứu được thực hiện bởi giáo sư Dawn Song của UC Berkeley đã tìm thấy rằng các ví dụ đối lập có thể được sử dụng để thay đổi cách các biển báo đường bộ được nhận thức bởi các hệ thống tầm nhìn máy tính, điều này có thể tiềm ẩn nguy hiểm cho các phương tiện tự hành.
Nghiên cứu như loại được thực hiện bởi nhóm Hồng Kông-Singapore có thể giúp các kỹ sư AI hiểu rõ hơn về các loại lỗ hổng mà các thuật toán AI có và có thể thiết kế cách bảo vệ chống lại những lỗ hổng này. Ví dụ, các phân loại器 tập hợp có thể được sử dụng để giảm khả năng một ví dụ đối lập sẽ đánh lừa hệ thống tầm nhìn máy tính. Với kỹ thuật này, một số phân loại器 được sử dụng và các biến đổi tinh vi được thực hiện trên hình ảnh đầu vào. Hầu hết các phân loại器 sẽ thường phân biệt các khía cạnh của nội dung thực sự của hình ảnh, sau đó được tổng hợp lại. Kết quả là ngay cả khi một số phân loại器 bị đánh lừa, hầu hết chúng sẽ không và hình ảnh sẽ được phân loại đúng.












