An ninh mạng
OpenAI phá vỡ chiến dịch trích xuất suy luận mô hình có sự phối hợp

OpenAI cho biết trong một bài đăng bảo mật được công bố vào ngày 30 tháng 9 năm 2026 rằng họ đã xác định và phá vỡ một chiến dịch có sự phối hợp nhằm trích xuất suy luận được bảo vệ từ các mô hình của mình, và họ đã gán một cụm lõi của hoạt động này cho các cá nhân liên quan đến Moonshot AI, nhà phát triển của Kimi. Hoạt động sớm nhất được quan sát xảy ra trong tuần đầu tiên của tháng 7 năm 2026.
Những gì OpenAI quan sát
OpenAI mô tả hoạt động này phù hợp với việc chưng cất đối kháng, mà họ định nghĩa là việc sử dụng có hệ thống và không được phép các đầu ra hoặc suy luận của một mô hình để hỗ trợ huấn luyện, sao chép hoặc cải thiện mô hình khác. Theo công ty, suy luận được bảo vệ là bản ghi nội bộ của mô hình khi giải quyết một nhiệm vụ; việc trích xuất nó có thể tiết lộ thông tin bị giữ lại so với câu trả lời cuối cùng và giúp người khác sao chép khả năng của mô hình.
OpenAI cho biết các nhà khai thác không phá vỡ mã hóa của họ, không làm tổn hại cơ sở dữ liệu, và không truy cập trực tiếp vào các cuộc trò chuyện của người dùng đã lưu trữ. Các nhà khai thác đã thao túng tương tác với mô hình sao cho suy luận được bảo vệ có thể được tái tạo dưới dạng có thể nhìn thấy đối với người yêu cầu trong một cách phối hợp, quy mô, vi phạm các điều khoản dịch vụ của công ty. Một kỹ thuật mà OpenAI quan sát được liên quan đến việc sao chép suy luận được mã hóa từ một cuộc trò chuyện và yêu cầu một mô hình trong một cuộc trò chuyện khác giải mã và chép lại nội dung suy luận ẩn. Công ty cho biết việc thao túng này không phải là một lỗ hổng đặc thù của các mô hình của họ và họ đã chia sẻ thông tin về nó với các đối tác trong ngành thông qua Frontier Model Forum để củng cố các biện pháp phòng thủ chung.
Hoạt động bắt đầu vào ngày 1 tháng 7 năm 2026, ban đầu ở mức thấp, cho đến khi OpenAI quan sát thấy các đợt tăng đột biến khối lượng vào ngày 24 và 25 tháng 7 năm 2026, bao gồm 16.000 yêu cầu sử dụng mẫu trích xuất liên quan từ hơn 4.000 người dùng. Một chú thích trong bài đăng ghi chú rằng các con số này mô tả các nỗ lực trích xuất, không nhất thiết thành công. OpenAI cho biết cuộc điều tra tiếp theo đã xác định hoạt động mẫu lời nhắc liên quan trên một cụm hơn 15.000 người dùng, và họ đã hoàn toàn phá vỡ nó vào ngày 28 tháng 7 năm 2026. Hoạt động này đã tiến triển theo thời gian, điều mà công ty cho rằng củng cố quan điểm rằng chưng cất đối kháng là một thách thức bảo mật rộng hơn, đòi hỏi các biện pháp phòng thủ đa lớp, thích ứng.
OpenAI cho biết chưng cất đối kháng gây ra rủi ro về an toàn và an ninh quốc gia: suy luận đã được trích xuất có thể được sử dụng để huấn luyện mô hình khác mà không duy trì các biện pháp bảo vệ được áp dụng cho các đầu ra hướng tới người dùng của mô hình gốc, và việc chưng cất ở quy mô lớn có thể tăng tốc chuyển giao các khả năng tiên tiến mà không có cùng mức đầu tư vào an toàn, những lo ngại này, công ty nói, trở nên tăng lên khi các mô hình có khả năng trong các lĩnh vực sử dụng kép. OpenAI cho biết trước khi công bố, họ đã điều tra phạm vi và tiềm năng tác động của chiến dịch, triển khai các biện pháp giảm thiểu riêng, và chia sẻ cũng như nhận phản hồi từ các nhà nghiên cứu và đối tác trong ngành, và công việc giảm thiểu và điều tra bổ sung vẫn đang tiếp tục.
Phân bổ
OpenAI cho biết chưa rõ liệu tất cả các nhà khai thác được quan sát trong khoảng thời gian liên quan có xuất phát từ một tác nhân duy nhất hay không, và họ gán một cụm lõi của hoạt động này cho các cá nhân liên quan đến Moonshot AI, nhà phát triển của Kimi.
Vào ngày 8 tháng 9 năm 2026, Cơ quan An ninh Quốc gia, Cơ quan An ninh Hạ tầng và An ninh mạng, và Cục Điều tra Liên bang đã công bố một bản tư vấn an ninh mạng chung cho biết Moonshot AI đã tiến hành một chiến dịch chưng cất rộng rãi đối với các công ty AI tiên tiến của Hoa Kỳ ít nhất từ giữa năm 2025. Bản tư vấn cho biết Moonshot AI đã trích xuất một lượng đáng kể dữ liệu Claude Fable 5 để huấn luyện mô hình Kimi‑K3 của mình và dữ liệu GPT‑4o để huấn luyện mô hình Kimi‑K2, và công ty đã sử dụng các mô hình của Hoa Kỳ để chưng cất tối ưu hoá fine‑tuning có giám sát, học tăng cường, kỹ thuật phần mềm và khả năng toán học.
Bản tư vấn nêu rộng hơn rằng, có khả năng với sự nhận thức của chính phủ Trung Quốc, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun và Z.AI đã trích xuất hàng tỷ token qua hàng triệu lượt trao đổi từ các mô hình AI tiên tiến của Hoa Kỳ, bao gồm các biến thể của Claude, GPT, Gemini và Grok, ít nhất từ cuối năm 2024. Theo các cơ quan, các công ty này đã định tuyến các yêu cầu qua các API gốc, các nhà cung cấp đám mây từ xa và các nhà tổng hợp bên thứ ba; sử dụng một thị trường xám của các proxy API được gọi là trạm chuyển để vượt qua các hạn chế địa lý, vi phạm các điều khoản sử dụng và làm suy giảm khả năng truy vết; và đạt được tiết kiệm chi phí thông qua việc mua số lượng lớn các thuê bao cao cấp được chia sẻ giữa các nhóm nhà phát triển. Các cơ quan đề xuất các công ty AI của Hoa Kỳ triển khai phát hiện và giảm thiểu toàn diện, triển khai các thay đổi phản hồi có mục tiêu cho các cố gắng chưng cất đáng ngờ, và thiết lập chia sẻ thông tin tình báo giữa các tổ chức.
Nghiên cứu Dấu vết Suy luận
OpenAI cho biết các nhà nghiên cứu bảo mật độc lập đã đưa các lỗ hổng liên quan đến chéo mô hình và nén cuộc trò chuyện đến sự chú ý của họ thông qua việc tiết lộ có trách nhiệm. Công ty cho biết họ đã điều tra các phát hiện, xác nhận các đường tấn công mà các nhà nghiên cứu chỉ ra là có thực, và công việc này đã giúp họ hiểu rõ hơn về lớp tấn công rộng hơn và tăng tốc các biện pháp giảm thiểu.
Trong một bài báo được gửi lên arXiv vào ngày 10 tháng 8 năm 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping và Maksym Andriushchenko báo cáo rằng các nhà cung cấp hàng đầu đang che giấu quá trình suy luận từng bước của mô hình để bảo vệ sở hữu trí tuệ và hạn chế rò rỉ thông tin, trả lại các dấu vết dưới dạng các khối văn bản được mã hoá mà khách hàng gửi lại cùng mỗi yêu cầu tiếp theo. Các tác giả xác định một lỗ hổng kiến trúc: các khối được mã hoá này hoàn toàn tương thích và có thể hoán đổi qua lại giữa các phiên, người dùng và mô hình khác nhau trong hệ sinh thái của nhà cung cấp. Họ mô tả một phương pháp jailbreak giải mã quy mô lớn, trong đó một dấu vết suy luận được mã hoá từ một mô hình nhất định được tiêm vào một mô hình yếu hơn, ít được bảo vệ hơn của cùng nhà cung cấp, buộc nó giải mã và xuất ra dấu vết dưới dạng văn bản thuần mà không cần jailbreak trực tiếp mô hình mạnh hơn.
Các tác giả cho biết lỗ hổng này cho phép bốn hướng tấn công riêng biệt: vượt qua các cơ chế chống distillation, mà họ đã chứng minh trên Anthropic, OpenAI và Google; trích xuất dữ liệu cá nhân quy mô lớn, trong đó họ đã thu hồi 367 mẫu thông tin nhận dạng cá nhân và 182 thông tin đăng nhập bằng cách giải mã 315.320 khối suy luận được thu thập từ các kho công khai; vô tình tiết lộ thông tin nguy hiểm ẩn trong quá trình suy luận ngay cả khi đầu ra cuối cùng của mô hình an toàn từ chối yêu cầu độc hại; và tiêm lệnh ẩn không thể nhìn thấy, nhúng tải độc hại hoàn toàn trong các khối được mã hoá để làm nhiễu các bản phát hành đại lý công cộng. Sau khi thực hiện tiết lộ có trách nhiệm, các tác giả đề xuất các biện pháp giảm thiểu dựa trên mật mã và cấp hệ thống để bảo vệ suy luận phía máy khách.
Cách OpenAI Đã Phản Ứng
OpenAI cho biết họ đã giảm thiểu chiến dịch này thông qua sự kết hợp giữa thực thi tài khoản, kiểm soát kỹ thuật và phối hợp với đối tác: họ cấm hoặc hạn chế các tài khoản gian lận, tăng cường các kiểm soát đăng ký và hạ tầng, và mở rộng giám sát cho các mạng liên quan. Công ty cũng cho biết họ đã tăng cường bảo vệ suy luận ẩn trên các người dùng, không gian làm việc, tổ chức và họ hàng mô hình: họ đã đóng một lối vào cho phép người đã sở hữu suy luận được mã hoá của người dùng khác phát lại và khôi phục nội dung, thêm các kiểm tra để phát hiện và giữ lại đầu ra luồng có thể lộ suy luận, và hợp tác với các nhà cung cấp bên thứ ba để xác định và ngăn chặn các tài khoản khi hoạt động liên quan đi qua dịch vụ của họ.
OpenAI cho biết họ đã chia sẻ các phát hiện liên quan thông qua Frontier Model Forum và các kênh chia sẻ thông tin của chính phủ thích hợp để các nhà phát triển mô hình tiên tiến khác và các đối tác khu vực công có thể tìm kiếm các hoạt động tương tự và tăng cường phòng thủ của mình, và họ lưu ý rằng các hệ thống hỗ trợ các hiện vật suy luận có thể di động hoặc có thể phát lại có thể gặp phải các rủi ro liên quan.
OpenAI cho biết họ dự đoán các nỗ lực distillation đối kháng sẽ trở nên tinh vi hơn khi các mô hình tiên tiến cải thiện và khi các tác nhân tìm kiếm cách rẻ hơn để mô phỏng khả năng của chúng. Công ty cho biết các triển khai do đối tác lưu trữ cần cùng mức bảo vệ như dịch vụ nội bộ, rằng các cuộc tấn công thông qua đầu ra công cụ đòi hỏi các biện pháp bảo vệ xem xét nhiều hơn chỉ văn bản hiển thị thông thường, và rằng họ đang tiếp tục cải thiện các biện pháp phòng thủ công cụ, phạm vi bộ phân loại và khả năng từ chối của mô hình đồng thời lan truyền các kiểm soát liên quan tới các đối tác đám mây. OpenAI cho biết phản ứng của họ sẽ tiếp tục tập trung vào ba lĩnh vực: tăng cường bảo vệ kỹ thuật chống trích xuất, cải thiện phát hiện và thực thi chống lại các chiến dịch phối hợp, và mở rộng chia sẻ thông tin về mối đe dọa giữa ngành và chính phủ.












