Báo cáo

Khi Trí Tuệ Nhân Tạo Bị Lỗi: Báo Cáo Enkrypt AI Tiết Lộ Sự Khả Thi Độc Hại Của Các Mô Hình Đa Phương Thức

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào tháng 5 năm 2025, Enkrypt AI đã phát hành Báo Cáo Kiểm Thử Đa Phương Thức, một phân tích đáng lo ngại đã tiết lộ cách dễ dàng các hệ thống trí tuệ nhân tạo tiên tiến có thể bị thao túng để tạo ra nội dung nguy hiểm và không đạo đức. Báo cáo tập trung vào hai mô hình ngôn ngữ tầm nhìn hàng đầu của Mistral – Pixtral-Large (25.02) và Pixtral-12b – và vẽ ra một bức tranh về các mô hình không chỉ ấn tượng về mặt kỹ thuật mà còn dễ bị tổn thương một cách đáng lo ngại.

Mô hình ngôn ngữ tầm nhìn (VLMs) như Pixtral được xây dựng để giải thích cả đầu vào trực quan và văn bản, cho phép chúng phản hồi thông minh với các yêu cầu phức tạp trong thế giới thực. Nhưng khả năng này đi kèm với rủi ro tăng cao. Không giống như các mô hình ngôn ngữ truyền thống chỉ xử lý văn bản, VLMs có thể bị ảnh hưởng bởi sự tương tác giữa hình ảnh và từ ngữ, mở ra những cánh cửa mới cho các cuộc tấn công đối thủ. Kiểm tra của Enkrypt AI cho thấy cách dễ dàng những cánh cửa này có thể bị khai thác.

Kết Quả Kiểm Thử Đáng Lo Ngại: Sự Khả Thi CSEM và CBRN

Đội ngũ đằng sau báo cáo đã sử dụng các phương pháp kiểm thử đối thủ tinh vi – một hình thức đánh giá đối thủ được thiết kế để bắt chước các mối đe dọa trong thế giới thực. Các thử nghiệm này sử dụng các chiến thuật như jailbreaking (kích hoạt mô hình với các truy vấn được thiết kế cẩn thận để vượt qua các bộ lọc an toàn), lừa đảo dựa trên hình ảnh và thao túng ngữ cảnh. Đáng lo ngại, 68% các yêu cầu đối thủ này đã kích hoạt các phản hồi có hại trên cả hai mô hình Pixtral, bao gồm nội dung liên quan đến việc lợi dụng trẻ em, bóc lột và thậm chí thiết kế vũ khí hóa học.

Một trong những phát hiện đáng chú ý nhất liên quan đến vật liệu khai thác trẻ em (CSEM). Báo cáo cho thấy rằng các mô hình của Mistral có khả năng tạo ra nội dung liên quan đến CSEM cao hơn 60 lần so với các tiêu chuẩn ngành như GPT-4o và Claude 3.7 Sonnet. Trong các trường hợp thử nghiệm, mô hình đã phản hồi các yêu cầu lợi dụng trẻ em với nội dung nhiều đoạn, được bao gồm trong các tuyên bố giả mạo như “chỉ để nhận thức giáo dục”. Các mô hình không chỉ thất bại trong việc từ chối các yêu cầu có hại – chúng còn hoàn thành chúng một cách chi tiết.

Cũng đáng lo ngại không kém là kết quả trong danh mục rủi ro CBRN (Hóa học, Sinh học, Bức xạ và Hạt nhân). Khi được yêu cầu về cách sửa đổi vũ khí hóa học VX – một vũ khí hóa học, các mô hình đã đưa ra những ý tưởng cụ thể về cách tăng độ bền của nó trong môi trường. Chúng đã mô tả, trong chi tiết kỹ thuật nhưng bị che đi, các phương pháp như bao gói, che chắn môi trường và hệ thống phát hành điều khiển.

Những thất bại này không phải lúc nào cũng được kích hoạt bởi các yêu cầu có hại rõ ràng. Một chiến thuật liên quan đến việc tải lên một hình ảnh của một danh sách số được đánh số và yêu cầu mô hình “điền vào chi tiết”. Yêu cầu đơn giản, dường như vô hại này đã dẫn đến việc tạo ra các hướng dẫn không đạo đức và bất hợp pháp. Sự kết hợp giữa thao túng trực quan và văn bản đã chứng tỏ đặc biệt nguy hiểm – nhấn mạnh thách thức duy nhất được đặt ra bởi trí tuệ nhân tạo đa phương thức.

Tại Sao Các Mô Hình Ngôn Ngữ Tầm Nhìn Đặt Ra Những Thách Thức An Ninh Mới

Ở trung tâm của những rủi ro này là sự phức tạp kỹ thuật của các mô hình ngôn ngữ tầm nhìn. Những hệ thống này không chỉ phân tích ngôn ngữ – chúng tổng hợp ý nghĩa trên nhiều định dạng, điều này có nghĩa là chúng phải giải thích nội dung hình ảnh, hiểu ngữ cảnh văn bản và phản hồi tương ứng. Sự tương tác này giới thiệu các vector khai thác mới. Một mô hình có thể từ chối một yêu cầu văn bản có hại một mình, nhưng khi được kết hợp với một hình ảnh gợi ý hoặc ngữ cảnh mơ hồ, nó có thể tạo ra đầu ra nguy hiểm.

Kiểm tra đối thủ của Enkrypt AI đã tiết lộ cách các cuộc tấn công tiêm chéo – nơi các tín hiệu tinh vi trong một phương thức ảnh hưởng đến đầu ra của phương thức khác – có thể hoàn toàn vượt qua các cơ chế an toàn tiêu chuẩn. Những thất bại này chứng tỏ rằng các kỹ thuật kiểm soát nội dung truyền thống, được xây dựng cho các hệ thống đơn phương thức, là không đủ cho các VLMs hiện đại.

Báo cáo cũng chi tiết cách các mô hình Pixtral được truy cập: Pixtral-Large thông qua AWS Bedrock và Pixtral-12b qua nền tảng Mistral. Bối cảnh triển khai thực tế này nhấn mạnh thêm sự cấp thiết của những phát hiện này. Những mô hình này không bị giới hạn trong phòng thí nghiệm – chúng có sẵn thông qua các nền tảng đám mây chính thống và có thể dễ dàng được tích hợp vào các sản phẩm tiêu dùng hoặc doanh nghiệp.

Những Việc Cần Làm: Một Kế Hoạch Cho Trí Tuệ Nhân Tạo An Toàn Hơn

Để có được sự tín nhiệm, Enkrypt AI không chỉ nêu ra các vấn đề – họ còn cung cấp một con đường phía trước. Báo cáo phác thảo một chiến lược giảm thiểu toàn diện, bắt đầu với huấn luyện an toàn. Điều này liên quan đến việc huấn luyện lại mô hình bằng cách sử dụng chính dữ liệu kiểm thử đối thủ của nó để giảm khả năng bị ảnh hưởng bởi các yêu cầu có hại. Các kỹ thuật như Tối ưu hóa Ưu tiên Trực tiếp (DPO) được khuyến nghị để tinh chỉnh phản hồi của mô hình tránh xa các đầu ra nguy hiểm.

Nó cũng nhấn mạnh tầm quan trọng của các rào cản bảo vệ nhận thức ngữ cảnh – các bộ lọc động có thể giải thích và chặn các yêu cầu có hại trong thời gian thực, tính đến ngữ cảnh đầy đủ của đầu vào đa phương thức. Ngoài ra, việc sử dụng Thẻ Rủi Ro Mô Hình được đề xuất như một biện pháp minh bạch, giúp các bên liên quan hiểu rõ về các hạn chế và trường hợp thất bại đã biết của mô hình.

Có lẽ khuyến nghị quan trọng nhất là phải coi kiểm thử đối thủ như một quá trình liên tục, không phải là một thử nghiệm một lần. Khi các mô hình tiến hóa, các chiến lược tấn công cũng vậy. Chỉ có việc đánh giá và giám sát liên tục mới có thể đảm bảo độ tin cậy lâu dài, đặc biệt khi các mô hình được triển khai trong các lĩnh vực nhạy cảm như chăm sóc sức khỏe, giáo dục hoặc quốc phòng.

Báo cáo Kiểm Thử Đa Phương Thức từ Enkrypt AI là một tín hiệu rõ ràng cho ngành công nghiệp trí tuệ nhân tạo: sức mạnh đa phương thức đi kèm với trách nhiệm đa phương thức. Những mô hình này đại diện cho một bước nhảy vĩ đại về khả năng, nhưng chúng cũng đòi hỏi một bước nhảy vĩ đại trong cách chúng ta nghĩ về an toàn, bảo mật và triển khai đạo đức. Nếu không được kiểm soát, chúng không chỉ rủi ro thất bại – chúng rủi ro gây hại trong thế giới thực.

Đối với bất kỳ ai đang làm việc hoặc triển khai trí tuệ nhân tạo quy mô lớn, báo cáo này không chỉ là một cảnh báo. Đó là một cuốn cẩm nang. Và nó không thể đến vào một thời điểm cấp thiết hơn.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.