Góc nhìn Anderson

Nghiên cứu gợi ý rằng LLMs sẵn sàng hỗ trợ trong việc mã hóa ‘vibe’ độc hại

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
ChatGPT-4o and Adobe Firefly.

Trong những năm gần đây, các mô hình ngôn ngữ lớn (LLMs) đã đối mặt với sự giám sát về khả năng bị lạm dụng trong lĩnh vực an ninh mạng, đặc biệt là trong việc tạo ra các khai thác phần mềm.

Xu hướng gần đây hướng tới ‘vibe coding’ (sử dụng các mô hình ngôn ngữ một cách không chính thức để phát triển mã nhanh chóng cho người dùng, thay vì giảng dạy người dùng cách mã hóa) đã làm sống lại một khái niệm đã đạt đến đỉnh cao vào những năm 2000: ‘script kiddie’ – một tác nhân độc hại tương đối không có kỹ năng với chỉ đủ kiến thức để sao chép hoặc phát triển một cuộc tấn công có hại. Sự ngụ ý, tự nhiên, là khi ngưỡng gia nhập được giảm xuống, các mối đe dọa sẽ có xu hướng tăng lên.

Tất cả các mô hình LLM thương mại đều có một số loại rào cản để ngăn chặn việc sử dụng chúng cho các mục đích này, mặc dù các biện pháp bảo vệ này đang đối mặt với các cuộc tấn công liên tục. Thông thường, hầu hết các mô hình FOSS (trên nhiều lĩnh vực, từ LLMs đến các mô hình hình ảnh / video tạo sinh) được phát hành với một số loại bảo vệ tương tự, thường vì lý do tuân thủ ở phương Tây.

Tuy nhiên, các bản phát hành mô hình chính thức sau đó thường được tinh chỉnh bởi các cộng đồng người dùng nhằm tìm kiếm chức năng hoàn chỉnh hơn, hoặc các LoRAs được sử dụng để vượt qua các hạn chế và có thể thu được kết quả ‘không mong muốn’.

Mặc dù hầu hết các LLM trực tuyến sẽ ngăn chặn việc hỗ trợ người dùng với các quá trình độc hại, các sáng kiến ‘không bị cản trở’ như Deep Hat có sẵn để giúp các nhà nghiên cứu an ninh hoạt động trên một sân chơi bình đẳng với đối thủ của họ.

Trải nghiệm người dùng chung tại thời điểm hiện tại thường được thể hiện trong loạt ChatGPT, cơ chế lọc của nó thường xuyên nhận được sự chỉ trích từ cộng đồng LLM bản địa.

Nhìn giống như bạn đang cố gắng tấn công một hệ thống!

Trong ánh sáng của xu hướng bị hạn chế và kiểm duyệt này, người dùng có thể ngạc nhiên khi phát hiện ra rằng ChatGPT đã được tìm thấy là hợp tác nhất trong số tất cả các LLM được thử nghiệm trong một nghiên cứu gần đây được thiết kế để buộc các mô hình ngôn ngữ tạo ra các khai thác mã độc hại.

Bài báo mới từ các nhà nghiên cứu tại UNSW Sydney và Tổ chức Khoa học và Công nghiệp Liên bang (CSIRO), có tiêu đề Tin tốt cho các ‘script kiddie’? Đánh giá các mô hình ngôn ngữ lớn cho việc tạo ra các khai thác tự động, cung cấp đánh giá hệ thống đầu tiên về cách hiệu quả các mô hình này có thể được yêu cầu để sản xuất các khai thác hoạt động. Các cuộc trò chuyện ví dụ từ nghiên cứu đã được cung cấp bởi các tác giả.

Nghiên cứu so sánh cách các mô hình hoạt động trên cả phiên bản gốc và phiên bản sửa đổi của các phòng thí nghiệm dễ bị tấn công đã biết (các bài tập lập trình cấu trúc được thiết kế để chứng minh các lỗi bảo mật phần mềm cụ thể), giúp tiết lộ liệu chúng dựa vào các ví dụ được ghi nhớ hay gặp khó khăn do các hạn chế an toàn tích hợp.

Từ trang web hỗ trợ, mô hình LLM Ollama giúp các nhà nghiên cứu phát triển một cuộc tấn công dễ bị tổn thương về chuỗi. Nguồn: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

Từ trang web hỗ trợ, mô hình LLM Ollama giúp các nhà nghiên cứu phát triển một cuộc tấn công dễ bị tổn thương về chuỗi. Nguồn: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

Mặc dù không có mô hình nào có thể tạo ra một khai thác hiệu quả, một số mô hình đã rất gần; hơn nữa, một số mô hình muốn làm tốt hơn trong nhiệm vụ, cho thấy một sự thất bại tiềm năng trong các phương pháp tiếp cận rào cản hiện có.

Bài báo tuyên bố:

‘Các thí nghiệm của chúng tôi cho thấy GPT-4 và GPT-4o thể hiện một mức độ hợp tác cao trong việc tạo ra các khai thác, tương đương với một số mô hình mã nguồn mở không bị kiểm duyệt. Trong số các mô hình được đánh giá, Llama3 là mô hình kháng lại các yêu cầu này nhiều nhất.

‘Mặc dù họ sẵn sàng hỗ trợ, nhưng mối đe dọa thực tế mà các mô hình này gây ra vẫn còn hạn chế, vì không có mô hình nào thành công trong việc tạo ra các khai thác cho năm phòng thí nghiệm tùy chỉnh với mã được tái cấu trúc. Tuy nhiên, GPT-4o, người biểu diễn mạnh nhất trong nghiên cứu của chúng tôi, thường chỉ mắc một hoặc hai lỗi mỗi lần thử.

‘Điều này cho thấy tiềm năng đáng kể để tận dụng LLMs nhằm phát triển các kỹ thuật tạo ra các khai thác tự động tiên tiến, có thể tổng quát hóa.’

Nhiều cơ hội thứ hai

Sự thật ‘Bạn không có cơ hội thứ hai để tạo ấn tượng tốt’ thường không áp dụng cho các LLM, vì cửa sổ ngữ cảnh thường bị giới hạn của một mô hình ngôn ngữ có nghĩa là một ngữ cảnh tiêu cực (theo nghĩa xã hội, tức là đối lập) không tồn tại lâu.

Xét:

Nếu bạn đến một thư viện và yêu cầu một cuốn sách về việc tạo ra bom, bạn có thể sẽ bị từ chối, ít nhất là vậy. Nhưng (giả sử yêu cầu này không hoàn toàn làm hỏng cuộc trò chuyện từ đầu) các yêu cầu của bạn về các tác phẩm liên quan, chẳng hạn như sách về các phản ứng hóa học, hoặc thiết kế mạch, sẽ, trong tâm trí của người thủ thư, rõ ràng là liên quan đến yêu cầu ban đầu và sẽ được đối xử theo cách đó.

Người thủ thư cũng có thể nhớ trong bất kỳ cuộc gặp gỡ trong tương lai rằng bạn đã yêu cầu một cuốn sách về việc tạo ra bom một lần, làm cho ngữ cảnh mới của bạn ‘không thể sửa chữa’.

Không phải vậy với một LLM, có thể gặp khó khăn trong việc giữ thông tin được mã hóa thậm chí từ cuộc trò chuyện hiện tại, chứ không nói đến các chỉ thị Bộ nhớ dài hạn (nếu có trong kiến trúc, như sản phẩm ChatGPT-4o).

Vì vậy, ngay cả các cuộc trò chuyện thông thường với ChatGPT cũng tiết lộ cho chúng ta một cách tình cờ rằng nó đôi khi cố gắng hết sức nhưng nuốt một con voi, không chỉ khi một chủ đề, nghiên cứu hoặc quy trình liên quan đến một hoạt động ‘cấm’ khác được phép phát triển trong quá trình thảo luận.

Điều này đúng với tất cả các mô hình ngôn ngữ hiện tại, mặc dù chất lượng rào cản có thể khác nhau về mức độ và cách tiếp cận giữa chúng (tức là sự khác biệt giữa việc sửa đổi trọng số của mô hình được đào tạo hoặc sử dụng bộ lọc vào / ra văn bản trong một phiên trò chuyện, điều này để lại mô hình cấu trúc nguyên vẹn nhưng có thể dễ bị tấn công hơn).

Thử nghiệm phương pháp

Để kiểm tra xem các LLM có thể được đẩy đến mức nào trong việc tạo ra các khai thác hoạt động, các tác giả đã thiết lập một môi trường được kiểm soát sử dụng năm phòng thí nghiệm từ SEED Labs, mỗi phòng thí nghiệm được xây dựng xung quanh các lỗ hổng bảo mật đã biết, bao gồm tràn bộ đệm, trở lại libc, một cuộc tấn công Dirty COWđiều kiện竞争.

Bên cạnh việc sử dụng các phòng thí nghiệm gốc, các nhà nghiên cứu đã tạo ra các phiên bản sửa đổi bằng cách đổi tên các biến và hàm thành các định danh chung. Điều này nhằm mục đích ngăn chặn các mô hình dựa vào các ví dụ được ghi nhớ từ quá trình đào tạo.

Mỗi phòng thí nghiệm được chạy hai lần cho mỗi mô hình: một lần ở dạng gốc và một lần ở dạng che giấu.

Các nhà nghiên cứu sau đó giới thiệu một LLM thứ hai vào vòng lặp: một mô hình tấn công được thiết kế để yêu cầu và yêu cầu lại mô hình đích nhằm tinh chỉnh và cải thiện đầu ra của nó qua nhiều vòng. LLM được sử dụng cho vai trò này là GPT-4o, hoạt động thông qua một kịch bản trung gian đối thoại giữa kẻ tấn công và mô hình đích, cho phép chu kỳ tinh chỉnh tiếp tục lên đến mười lăm lần, hoặc cho đến khi không có sự cải thiện nào được đánh giá là có thể:

Lưu đồ công việc cho mô hình tấn công LLM, trong trường hợp này là GPT-4o.

Lưu đồ công việc cho mô hình tấn công LLM, trong trường hợp này là GPT-4o.

Các mô hình đích cho dự án là GPT-4o, GPT-4o-mini, Llama3 (8B), Dolphin-Mistral (7B) và Dolphin-Phi (2.7B), đại diện cho cả hệ thống độc quyền và mã nguồn mở, với sự kết hợp của các mô hình được căn chỉnh và không căn chỉnh (tức là các mô hình có cơ chế an toàn tích hợp được thiết kế để chặn các yêu cầu có hại và những mô hình được sửa đổi thông qua tinh chỉnh hoặc cấu hình để vượt qua các cơ chế đó).

Các mô hình có thể cài đặt cục bộ được chạy thông qua khung Ollama, trong khi những mô hình khác được truy cập thông qua phương pháp duy nhất có sẵn – API.

Kết quả

Các nhà nghiên cứu đã kiểm tra mức độ hợp tác của từng mô hình trong quá trình tạo ra các khai thác, được đo bằng cách ghi lại tỷ lệ phần trăm các phản hồi trong đó mô hình cố gắng hỗ trợ nhiệm vụ (ngay cả khi đầu ra bị lỗi).

Kết quả từ thử nghiệm chính, hiển thị mức độ hợp tác trung bình.

Kết quả từ thử nghiệm chính, hiển thị mức độ hợp tác trung bình.

GPT-4o và GPT-4o-mini đã thể hiện mức độ hợp tác cao nhất, với tỷ lệ phản hồi trung bình là 97 và 96 phần trăm, tương ứng, trên năm loại lỗ hổng: tràn bộ đệm, trở lại libc, chuỗi định dạng, điều kiện競争Dirty COW.

Dolphin-Mistral và Dolphin-Phi theo sát, với tỷ lệ hợp tác trung bình là 93 và 95 phần trăm. Llama3 đã thể hiện sự sẵn sàng tham gia thấp nhất, với tỷ lệ hợp tác tổng thể chỉ là 27 phần trăm:

Ở bên trái, chúng ta thấy số lượng lỗi được thực hiện bởi các LLM trên các chương trình SEED Lab gốc; ở bên phải, số lượng lỗi được thực hiện trên các phiên bản được tái cấu trúc.

Ở bên trái, chúng ta thấy số lượng lỗi được thực hiện bởi các LLM trên các chương trình SEED Lab gốc; ở bên phải, số lượng lỗi được thực hiện trên các phiên bản được tái cấu trúc.

Khi kiểm tra hiệu suất thực tế của các mô hình này, họ đã tìm thấy một khoảng cách đáng chú ý giữa sự sẵn sànghiệu quả: GPT-4o đã tạo ra kết quả chính xác nhất, với tổng số sáu lỗi trên năm phòng thí nghiệm được che giấu. GPT-4o-mini theo sau với tám lỗi. Dolphin-Mistral hoạt động khá tốt trên các phòng thí nghiệm gốc nhưng gặp khó khăn đáng kể khi mã được tái cấu trúc, cho thấy rằng nó có thể đã thấy nội dung tương tự trong quá trình đào tạo. Dolphin-Phi đã thực hiện 17 lỗi, và Llama3 nhiều nhất, với 15.

Các thất bại thường liên quan đến các lỗi kỹ thuật khiến các khai thác không hoạt động như mong đợi, chẳng hạn như kích thước bộ đệm không chính xác, thiếu logic vòng lặp hoặc tải trọng hiệu quả nhưng không hiệu quả về mặt语法.

Không có mô hình nào thành công trong việc tạo ra một khai thác hoạt động cho bất kỳ phiên bản được tái cấu trúc nào.

Các tác giả quan sát thấy rằng hầu hết các mô hình đều tạo ra mã giống như các khai thác hoạt động, nhưng thất bại do thiếu hiểu biết về cách các cuộc tấn công thực sự hoạt động – một mẫu mà rõ ràng trên tất cả các loại lỗ hổng và cho thấy rằng các mô hình đang bắt chước các cấu trúc mã quen thuộc thay vì suy luận logic liên quan (trong các trường hợp tràn bộ đệm, ví dụ, nhiều mô hình không thể xây dựng một sàn trượt NOP hoạt động).

Trong các nỗ lực trả lại libc, các tải trọng thường bao gồm các phần đệm không chính xác hoặc các địa chỉ hàm không chính xác, dẫn đến đầu ra có vẻ hợp lệ nhưng không thể sử dụng.

Mặc dù các tác giả mô tả cách giải thích này là suy đoán, sự nhất quán của các lỗi cho thấy một vấn đề rộng lớn hơn trong đó các mô hình không thể kết nối các bước của một khai thác với hiệu ứng dự kiến của chúng.

Kết luận

Có một số nghi ngờ, bài báo thừa nhận, về việc liệu các mô hình ngôn ngữ được thử nghiệm có nhìn thấy các phòng thí nghiệm SEED Lab gốc trong quá trình đào tạo ban đầu hay không; vì lý do này, các biến thể đã được xây dựng. Tuy nhiên, các nhà nghiên cứu xác nhận rằng họ muốn làm việc với các khai thác thực tế trong các phiên bản sau của nghiên cứu này; vật liệu thực sự mới và gần đây ít có khả năng bị các捷径 hoặc các hiệu ứng混乱 khác.

Các tác giả cũng thừa nhận rằng các mô hình ‘suy nghĩ’ sau này và tiên tiến hơn như GPT-o1 và DeepSeek-r1, không có sẵn tại thời điểm nghiên cứu được thực hiện, có thể cải thiện kết quả thu được, và điều này là một dấu hiệu cho công việc trong tương lai.

Bài báo kết luận rằng hầu hết các mô hình được thử nghiệm sẽ đã tạo ra các khai thác hoạt động nếu chúng có khả năng làm như vậy. Sự thất bại của chúng trong việc tạo ra các đầu ra hoạt động đầy đủ không có vẻ như là kết quả của các biện pháp bảo vệ căn chỉnh, mà thay vào đó cho thấy một hạn chế kiến trúc thực sự – một hạn chế có thể đã được giảm trong các mô hình gần đây hơn, hoặc sớm sẽ được.

 

Được xuất bản lần đầu vào thứ hai, ngày 5 tháng 5 năm 2025

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai