An ninh mạng

Simbian Ra Mắt Benchmark Phòng Thủ Mạng, Vạch Trần Khoảng Trống Lớn Trong Khả Năng Bảo Mật Của Trí Tuệ Nhân Tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một benchmark mới được phát hành bởi Simbian đang thách thức một trong những giả định phổ biến nhất trong trí tuệ nhân tạo: rằng những mô hình có khả năng tìm ra điểm yếu cũng có thể bảo vệ chống lại chúng.

Công ty đã giới thiệu Benchmark Phòng Thủ Mạng mới, được phát triển bởi Phòng thí nghiệm nghiên cứu Simbian, đánh giá hiệu suất của các mô hình ngôn ngữ lớn (LLM) hàng đầu trong các kịch bản phòng thủ mạng thực tế. Kết quả rất đáng chú ý. Trong khi các hệ thống trí tuệ nhân tạo hiện đại ngày càng hiệu quả trong việc phát hiện và khai thác điểm yếu, chúng gặp khó khăn đáng kể khi được giao nhiệm vụ xác định và ngăn chặn các cuộc tấn công hoạt động.

Các Mô Hình Tiên Phong Không Đáp Ứng Được Tiêu Chuẩn Tối Thiểu Cho Phòng Thủ

Benchmark đã kiểm tra các mô hình hàng đầu bao gồm Claude Opus 4.6, GPT-5, Gemini 3.1 Pro và các mô hình khác trong môi trường doanh nghiệp mô phỏng.

Không có mô hình nào đạt được điểm đậu.

Claude Opus 4.6, mô hình mạnh nhất trong thử nghiệm, chỉ phát hiện một phần bằng chứng tấn công trên MITRE ATT&CK chiến thuật, trong khi nhiều mô hình không thể xác định toàn bộ danh mục hoạt động恶意. Nghiên cứu học thuật độc lập phù hợp với những phát hiện này, cho thấy rằng thậm chí các mô hình hàng đầu cũng gặp khó khăn khi săn tìm mối đe dọa mở, chỉ phát hiện một phần nhỏ của các sự kiện恶意 trong các kịch bản thực tế.

Khoảng trống này突出 một hạn chế quan trọng. Các hệ thống trí tuệ nhân tạo ngày nay có thể xuất sắc trong việc trả lời các câu hỏi có cấu trúc hoặc giải quyết các vấn đề được chứa, nhưng chúng gặp khó khăn khi cần điều tra các chuỗi tấn công phức tạp,不断 thay đổi mà không có hướng dẫn.

Sự Chuyển Đổi Hướng Đến Đánh Giá Dựa Trên Thực Tế, Dựa Trên Đại Diện

Điều gì làm cho benchmark này khác biệt là thiết kế của nó.

Không giống như các thử nghiệm an ninh mạng trước đây dựa trên các câu hỏi trắc nghiệm hoặc tập dữ liệu tĩnh, phương pháp của Simbian sử dụng dữ liệu telemetry thực và đặt các mô hình vào một vòng lặp điều tra đại diện. Thay vì được hướng dẫn tìm kiếm gì, trí tuệ nhân tạo phải khám phá các nhật ký, hình thành giả thuyết và xác định các mối đe dọa một cách độc lập.

Điều này phản ánh cách các nhà phân tích bảo mật con người hoạt động trong các Trung tâm vận hành bảo mật thực tế.

Benchmark bao gồm hàng chục kỹ thuật tấn công trên nhiều giai đoạn, buộc các mô hình phải kết nối các tín hiệu trên thời gian và hệ thống. Bằng cách thay đổi bối cảnh và áp dụng việc đánh giá quyết định, nó cũng giảm thiểu rủi ro các mô hình chỉ nhớ các mẫu.

Sự chuyển đổi này hướng tới thực tế là đáng kể. Trong việc phát triển trí tuệ nhân tạo, việc tạo ra một benchmark phản ánh chính xác sự phức tạp của thế giới thực thường là bước đầu tiên để giải quyết vấn đề itu.

Sự Phân Chia Ngày Càng Tăng Của Trí Tuệ Nhân Tạo Tấn Công Và Phòng Thủ

Các phát hiện củng cố một xu hướng rộng lớn hơn đang xuất hiện trên toàn ngành.

Trí tuệ nhân tạo đang nhanh chóng cải thiện trong các nhiệm vụ tấn công mạng. Các nghiên cứu gần đây cho thấy rằng các mô hình tiên phong đã có thể thực hiện các cuộc tấn công đa bước trong môi trường mô phỏng và ngày càng làm như vậy với công cụ tối thiểu. Đồng thời, khả năng phòng thủ đang tụt lại phía sau.

Sự mất cân bằng này tạo ra một sự bất đối xứng ngày càng tăng. Những kẻ tấn công có thể tận dụng tự động hóa và quy mô, trong khi những người phòng thủ vẫn phụ thuộc nặng nề vào chuyên môn con người và công cụ phân mảnh. Ngay cả khi trí tuệ nhân tạo xác định được một điểm yếu, nó có thể hiểu lầm mức độ nghiêm trọng hoặc không hành động phù hợp, nhấn mạnh khoảng trống giữa việc phát hiện và hiểu biết.

Tại Sao Trí Tuệ Nhân Tạo “Sẵn Sàng Sử Dụng” Thất Bại

Kết luận của Simbian không phải là trí tuệ nhân tạo không thể bảo vệ hệ thống, mà là nó không thể làm như vậy một mình.

Benchmark gợi ý rằng các LLM cần những gì công ty mô tả là một “hệ thống phức tạp” – sự kết hợp của thông tin bên ngoài, các quy trình có cấu trúc và tích hợp cấp hệ thống – để hoạt động hiệu quả trong môi trường bảo mật.

Điều này phù hợp với nghiên cứu rộng lớn hơn cho thấy việc thêm công cụ, bộ nhớ và bối cảnh cải thiện đáng kể hiệu suất của trí tuệ nhân tạo trong các nhiệm vụ bảo mật.

Trong môi trường sản xuất, Simbian tuyên bố đã đạt được độ chính xác phát hiện cao hơn đáng kể bằng cách kết hợp các mô hình với các lớp bổ sung này. Ý nghĩa là rõ ràng: khả năng của mô hình thô chỉ là một phần của bức tranh.

Một Loại Benchmark Mới Cho Bảo Mật Trí Tuệ Nhân Tạo

Việc phát hành Benchmark Phòng Thủ Mạng đánh dấu một bước quan trọng trong cách các hệ thống trí tuệ nhân tạo được đánh giá cho việc triển khai thực tế.

Bằng cách tập trung vào việc săn tìm mối đe dọa dựa trên bằng chứng thay vì trả lời câu hỏi, nó định hình lại vấn đề từ thông tin đến thực thi. Nó cũng giới thiệu chi phí như một yếu tố có thể đo lường, làm nổi bật sự đánh đổi giữa hiệu suất và hiệu quả trên các mô hình.

Khi trí tuệ nhân tạo tiếp tục thay đổi bảo mật, các benchmark như thế này có thể trở thành công cụ thiết yếu để hiểu không chỉ những gì các mô hình có thể làm, mà còn nơi chúng thất bại – và tại sao.

Hiện tại, kết luận rất rõ ràng. Mặc dù có tiến bộ nhanh chóng trong trí tuệ nhân tạo, phòng thủ mạng tự động hoàn toàn vẫn còn ngoài tầm với. Giai đoạn đổi mới tiếp theo có thể phụ thuộc ít hơn vào việc xây dựng các mô hình lớn hơn và nhiều hơn vào việc thiết kế các hệ thống kết hợp trí tuệ nhân tạo với thông tin có cấu trúc, bối cảnh và giám sát của con người.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.