Mô hình và nền tảng AI

OpenAI Giới Thiệu GPT-Red, Một Hệ Thống Trí Tuệ Nhân Tạo Được Thiết Kế Để Tăng Cường GPT-5.6

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

OpenAI đã tiết lộ GPT-Red, một hệ thống trí tuệ nhân tạo nội bộ được đào tạo để tấn công các mô hình của chính công ty, lộ ra các điểm yếu của chúng và tạo ra dữ liệu đối lập mà có thể được sử dụng để tăng cường các phiên bản tương lai.

Thay vì hoạt động như một trình trò chuyện công cộng, GPT-Red hoạt động như một đội đỏ tự động. Nó liên tục gửi các hướng dẫn độc hại hoặc đánh lừa đến các mô hình mục tiêu, quan sát phản hồi của chúng và điều chỉnh chiến lược của mình cho đến khi nó thành công hoặc cạn kiệt đường tấn công có sẵn. OpenAI cho biết hệ thống này đặc biệt tập trung vào việc tiêm lệnh, một vấn đề an ninh ngày càng tăng cho các tác nhân AI tương tác với email, trang web, tệp, kho mã và ứng dụng kết nối.

Tại Sao Tiêm Lệnh Trở Nên Nguy Hiểm Hơn

Tiêm lệnh xảy ra khi một kẻ tấn công đặt các hướng dẫn bên trong dữ liệu mà một hệ thống AI được dự kiến sẽ đọc. Một lệnh độc hại có thể được ẩn trong email, trang web, tài liệu được tải lên, phản hồi công cụ hoặc kho mã.

Hệ thống AI có thể vô tình coi nội dung bên ngoài đó là một hướng dẫn hợp pháp. Thay vì hoàn thành nhiệm vụ ban đầu của người dùng, nó có thể tiết lộ thông tin bí mật, tải tệp lên máy chủ được kiểm soát bởi kẻ tấn công, thay đổi cài đặt tài khoản, thực thi mã không an toàn hoặc thực hiện các hành động không được ủy quyền thông qua các công cụ kết nối.

Vấn đề trở nên nghiêm trọng hơn khi các hệ thống AI vượt ra ngoài việc trả lời câu hỏi và bắt đầu hành động thay mặt cho người dùng. Một tác nhân có quyền truy cập vào lưu trữ đám mây, hệ thống thanh toán, mã nguồn, ứng dụng kinh doanh hoặc dữ liệu công ty nội bộ sẽ có một “vùng ảnh hưởng” lớn hơn khi các hướng dẫn của nó bị thao túng thành công.

OpenAI mô tả tiêm lệnh là một trong những thách thức trung tâm được tạo ra bởi AI tác nhân. Các công cụ kết nối làm cho các mô hình trở nên hữu ích hơn, nhưng mỗi nguồn dữ liệu mới cũng cung cấp một kênh khác mà kẻ tấn công có thể cố gắng ảnh hưởng đến hành vi của mô hình.

GPT-Red Học Thông Qua Tự Chơi

GPT-Red được phát triển thông qua tự chơi tăng cường học, một phương pháp trong đó một mô hình tấn công và một tập hợp các mô hình phòng thủ được cải thiện bằng cách cạnh tranh với nhau.

Mô hình tấn công nhận được phần thưởng khi nó tạo ra một thất bại hợp lệ, chẳng hạn như thuyết phục một mô hình thực hiện tiêm lệnh. Mô hình phòng thủ được thưởng khi nó từ chối hướng dẫn độc hại trong khi vẫn hoàn thành nhiệm vụ hợp pháp mà nó đã được giao.

Khi các mô hình phòng thủ trở nên tốt hơn trong việc nhận ra các cuộc tấn công, GPT-Red phải tìm ra các cách tinh vi và đa dạng hơn để vượt qua chúng. Những cuộc tấn công mới đó sau đó có thể được tích hợp vào quá trình đào tạo của các mô hình phòng thủ, tạo ra một chu kỳ leo thang giữa các khả năng tấn công và phòng thủ.

OpenAI đã xây dựng một tập hợp lớn các môi trường mô phỏng cho quá trình này. Tùy thuộc vào kịch bản, GPT-Red có thể kiểm soát một phần của tệp cục bộ, văn bản của email, biểu ngữ trang web hoặc đầu ra được trả về bởi một công cụ bên ngoài. Mỗi môi trường định nghĩa những gì kẻ tấn công có thể thao túng và kết quả nào đủ điều kiện là một sự thỏa hiệp thành công.

Công ty cho biết GPT-Red đã được đào tạo bằng các tài nguyên tính toán tương đương với một số lần chạy hậu đào tạo lớn nhất của họ, đại diện cho một phân bổ tính toán không thường xuyên chỉ dành cho nghiên cứu an toàn. Sau khi đào tạo, mô hình có thể thỏa hiệp gần như mọi mô hình nội bộ và sản xuất mà nó được thử nghiệm, bao gồm cả GPT-5.5.

GPT-Red Vượt Qua Các Kẻ Tấn Công Con Người Trong Kiểm Tra

Để đánh giá xem GPT-Red có thể tổng quát hóa ngoài các môi trường đào tạo hay không, OpenAI đã thử nghiệm nó bằng cách sử dụng một phiên bản sao chép của một thách thức tiêm lệnh gián tiếp năm 2025.

GPT-Red và các đội đỏ con người được yêu cầu phát triển các cuộc tấn công chống lại GPT-5.1 trong các kịch bản mà không được bao gồm trong đào tạo của GPT-Red. Hệ thống tự động tạo ra các cuộc tấn công thành công trong 84% các kịch bản, so với 13% đối với các tham gia con người.

Kết quả đó không có nghĩa là các nhà nghiên cứu bảo mật con người đã trở nên không cần thiết. Ưu thế của GPT-Red nằm chủ yếu ở khả năng thực hiện một lượng lớn các thí nghiệm, loại bỏ các chiến lược không thành công và liên tục tinh chỉnh các cuộc tấn công đầy hứa hẹn mà không bị giới hạn bởi thời gian và nhân lực của một đội con người.

Các tester con người vẫn quan trọng trong việc xác định các rủi ro không lường trước, hiểu các hậu quả rộng lớn hơn của các thất bại và thiết kế các kịch bản mà các hệ thống tự động có thể không xem xét. Jessica Ji, một nhà phân tích nghiên cứu cao cấp tại Trung tâm Công nghệ và An ninh Tiềm ẩn của Đại học Georgetown, mô tả kết quả là đầy hứa hẹn trong khi nhấn mạnh rằng chuyên môn con người vẫn thiết yếu.

Một Máy Bán Hàng Tự Động Trở Thành Mục Tiêu Trong Thế Giới Thực

OpenAI cũng đã thử nghiệm xem các cuộc tấn công được phát hiện trong mô phỏng có thể chuyển sang các tác nhân AI hoạt động hay không.

Một thí nghiệm nhắm vào một tác nhân máy bán hàng tự động được tạo bởi Andon Labs và triển khai trong một văn phòng của OpenAI. GPT-Red ban đầu được cung cấp một phiên bản mô phỏng của hệ thống, cùng với khả năng quan sát cách tác nhân sử dụng các công cụ của nó.

Sau khi thử nghiệm và tinh chỉnh các cuộc tấn công trong mô phỏng, GPT-Red đã chuyển chúng sang tác nhân sản xuất. Nó đã đạt được cả ba mục tiêu được giao: giảm giá của một sản phẩm đắt tiền xuống 0,50 đô la, đặt hàng một mặt hàng mới trị giá hơn 100 đô la và cung cấp nó với giá 0,50 đô la, và hủy đơn đặt hàng của một khách hàng khác. OpenAI cho biết các điểm yếu đã được tiết lộ và các biện pháp bảo vệ bổ sung đang được thử nghiệm.

Thí nghiệm minh họa tại sao tiêm lệnh không chỉ là vấn đề tạo ra một phản hồi không phù hợp từ một trình trò chuyện. Khi một mô hình AI kiểm soát các hệ thống bên ngoài, một sự tiêm lệnh thành công có thể dẫn đến các giao dịch tài chính, hồ sơ bị thay đổi, mất dữ liệu hoặc hậu quả trong thế giới thực.

GPT-Red cũng được thử nghiệm chống lại một tác nhân dòng lệnh Codex được cung cấp bởi GPT-5.4 mini. Trong 10 kịch bản trích xuất dữ liệu trước đó không được nhìn thấy, nó đã thành công hơn và hiệu quả hơn về mặt token so với một baseline GPT-5.5 được nhắc khi thuyết phục tác nhân mã hóa tiết lộ thông tin nhạy cảm.

Cách GPT-Red Đã Thay Đổi GPT-5.6

Một trong những phát hiện đáng chú ý nhất của GPT-Red là một loại tiêm lệnh trực tiếp mà OpenAI gọi là “cuộc tấn công chuỗi suy nghĩ giả”.

Ở mức cao, kỹ thuật này trình bày thông tin xác thực hoặc xác minh giả mạo mà khuyến khích mô hình mục tiêu giả định rằng một lệnh độc hại đã được xem xét và phê duyệt. Nghiên cứu viên của OpenAI Chris Choquette-Choo so sánh khái niệm này với việc nói dối với ai đó rằng một câu trả lời không chính xác đã được xác minh, khiến họ có nhiều khả năng chấp nhận nó mà không lặp lại lý do cơ bản.

Các cuộc tấn công này được cho là đã thành công hơn 95% thời gian chống lại GPT-5.1. Sau đào tạo đối lập sử dụng các cuộc tấn công được tạo ra bởi GPT-Red, tỷ lệ thành công đã giảm xuống dưới 10% chống lại GPT-5.6 Sol. Trên một tập hợp rộng hơn của các môi trường tiêm lệnh trực tiếp, OpenAI cho biết GPT-5.6 Sol chỉ thất bại trong 0,05% các nỗ lực của GPT-Red.

OpenAI cũng đã đánh giá xem liệu các biện pháp phòng thủ bổ sung có làm cho GPT-5.6 ít sẵn sàng thực hiện các yêu cầu hợp pháp hay không. Công ty cho biết các khả năng chung và các đánh giá từ chối quá mức được nhắm mục tiêu vẫn không bị ảnh hưởng đáng kể, cho thấy rằng sự cải thiện đến từ việc phân biệt tốt hơn giữa các lệnh độc hại và hợp pháp chứ không phải từ việc làm cho mô hình ít sẵn sàng hành động hơn.

Điều đó rất quan trọng. Một mô hình có thể xuất hiện an toàn nếu nó từ chối mở tệp, duyệt trang web, thực thi mã hoặc tương tác với các ứng dụng bên ngoài, nhưng nó cũng sẽ mất đi nhiều giá trị thực tế. Sự mạnh mẽ hiệu quả đòi hỏi phải bảo tồn việc sử dụng công cụ hợp pháp trong khi chống lại các lệnh được chèn bởi các bên không đáng tin cậy.

Tại Sao OpenAI Không Phát Hành GPT-Red

GPT-Red sẽ vẫn là một hệ thống nội bộ và được giữ riêng biệt với các mô hình được triển khai công khai của OpenAI.

Quyết định đó phản ánh bản chất sử dụng kép của việc kiểm tra đỏ tự động. Mô hình tự động có thể giúp các nhà phát triển phát hiện ra các điểm yếu tiêm lệnh cũng có thể giúp các kẻ tấn công phát triển các phương pháp hiệu quả hơn để thỏa hiệp các tác nhân AI được vận hành bởi các công ty khác.

Phương pháp của OpenAI là giữ lại kẻ tấn công nội bộ trong khi chuyển kiến thức phòng thủ kết quả vào các mô hình sản xuất. Công ty cho biết sự tách biệt này nhằm mục đích ngăn chặn các khả năng độc hại được đào tạo một cách có chủ ý vào GPT-Red trở nên có sẵn cho các đối thủ bên ngoài.

Điều này cũng có nghĩa là GPT-Red không nên bị nhầm lẫn với các mô hình an ninh mạng công khai hoặc chương trình phòng thủ của OpenAI. Nó không phải là một sản phẩm kiểm tra thâm nhập, cũng không được thiết kế chủ yếu để tự động phát hiện các lỗ hổng phần mềm thông thường. Hiện tại, nó tập trung vào việc tấn công hành vi tuân theo hướng dẫn của các hệ thống AI, đặc biệt là các tác nhân暴露 với dữ liệu không đáng tin cậy.

Kiểm Tra Đỏ Tự Động Vẫn Còn Điểm Mù

Mặc dù có kết quả mạnh mẽ, GPT-Red vẫn không cung cấp một giải pháp hoàn chỉnh cho an ninh AI.

Báo cáo về nghiên cứu cho thấy hệ thống vẫn kém hiệu quả hơn trong các cuộc tấn công nhiều lượt diễn ra dần dần trong suốt một cuộc trò chuyện dài. Nó cũng có khả năng hạn chế trong việc phát triển các lệnh tiêm lệnh nhúng trong hình ảnh, để lại các bề mặt tấn công đa phương tiện quan trọng không được bảo vệ đầy đủ.

Kết quả cũng dựa nặng vào các môi trường và tiêu chí thành công được thiết kế bởi OpenAI. Mặc dù công ty đã thử nghiệm GPT-Red trên các kịch bản được giữ lại và các tác nhân hoạt động, các nhà nghiên cứu độc lập sẽ có khả năng hạn chế trong việc tái tạo các phát hiện trong khi mô hình và phần lớn cơ sở hạ tầng đánh giá của nó vẫn còn riêng tư.

OpenAI cho biết họ sẽ tiếp tục kết hợp kiểm tra tự động với kiểm tra đỏ của con người và bên thứ ba, các biện pháp bảo vệ sản phẩm phân lớp, kiểm soát truy cập, giám sát và phát hiện lạm dụng thời gian thực. Chiến lược phòng thủ này phản ánh thực tế rằng không có mô hình hoặc tiêu chuẩn nào có thể dự đoán mọi cuộc tấn công có thể xuất hiện sau khi triển khai.

Một Cuộc Đua An Ninh Mới Giữa Các Kẻ Tấn Công và Người Phòng Thủ AI

“Sự tự cải thiện” được mô tả trong thông báo của OpenAI không phải là một mô hình được triển khai tự động viết lại trọng số của nó hoặc độc lập tạo ra một người kế thừa mạnh mẽ hơn. Thay vào đó, nó là một vòng đào tạo được kiểm soát trong đó một hệ thống AI tạo ra các ví dụ đối lập mà các nhà nghiên cứu sử dụng để cải thiện một hệ thống khác.

Dù vậy, GPT-Red đại diện cho một sự thay đổi có ý nghĩa trong cách các mô hình tiền phong có thể được bảo vệ. Các đội đỏ con người có thể phát hiện ra các điểm yếu tinh vi, nhưng họ không thể tự tạo ra quy mô và sự đa dạng của các cuộc tấn công cần thiết để liên tục đào tạo các tác nhân AI ngày càng mạnh mẽ.

Các kẻ tấn công tự động có thể lấp đầy một phần khoảng trống đó, tạo ra một vòng quay an ninh trong đó mỗi người phòng thủ mạnh hơn buộc mô hình kiểm tra đỏ phải phát hiện ra các điểm yếu mới. Những điểm yếu đó sau đó trở thành tài liệu đào tạo cho thế hệ hệ thống sản xuất tiếp theo.

Rủi ro là các khả năng tương tự sẽ không còn độc quyền cho các phòng thí nghiệm phòng thủ. Khi các mô hình mở và thương mại trở nên tốt hơn trong việc lập kế hoạch đường dài, sử dụng công cụ, an ninh mạng, và thí nghiệm tự động, các kẻ tấn công sẽ có được quyền truy cập vào các hệ thống ngày càng mạnh mẽ của riêng họ.

GPT-Red do đó đánh dấu cả sự tiến bộ và một dấu hiệu sớm của cuộc thi sắp tới. Các phòng thí nghiệm AI đang bắt đầu sử dụng các mô hình mạnh mẽ để bảo vệ thế hệ tác nhân tiếp theo của họ, nhưng những biện pháp phòng thủ đó sẽ cần phải phát triển liên tục khi cùng các công nghệ cơ bản làm cho các cuộc tấn công tự động trở nên rẻ hơn, nhanh hơn và linh hoạt hơn.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.