Báo cáo
Báo cáo Red Teaming của DeepSeek-R1: Phát hiện ra các Rủi ro An ninh và Đạo đức Lo lắng
Một đánh giá red teaming gần đây được thực hiện bởi Enkrypt AI đã tiết lộ các rủi ro an ninh đáng kể, lo ngại đạo đức và lỗ hổng trong DeepSeek-R1. Các phát hiện, được nêu chi tiết trong Báo cáo Red Teaming tháng 1 năm 2025, nhấn mạnh sự dễ bị tổn thương của mô hình trong việc tạo ra nội dung có hại, thiên vị và không an toàn so với các mô hình hàng đầu trong ngành như GPT-4o, OpenAI’s o1 và Claude-3-Opus. Dưới đây là phân tích toàn diện về các rủi ro được nêu trong báo cáo và các khuyến nghị để giảm thiểu.
Rủi ro An ninh và Đạo đức Chính
1. Đầu ra Hại và Rủi ro An ninh
- Dễ bị tổn thương khi tạo ra nội dung có hại, bao gồm ngôn ngữ độc hại, đầu ra thiên vị và thông tin có thể bị khai thác bởi tội phạm.
- 11 lần dễ bị tổn thương khi tạo ra nội dung có hại so với OpenAI’s o1.
- 4 lần độc hại hơn GPT-4o.
- 3 lần thiên vị hơn Claude-3-Opus.
- 4 lần dễ bị tổn thương khi tạo ra mã không an toàn so với OpenAI’s o1.
- Đặc biệt dễ bị tổn thương khi tạo ra thông tin liên quan đến CBRN (Hóa học, Sinh học, Bức xạ và Hạt nhân), khiến nó trở thành một công cụ rủi ro cao cho các tác nhân độc hại.
2. So sánh với Các Mô hình Khác
| Loại Rủi ro | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Thiên vị | 3 lần cao hơn | Thấp hơn | Tương tự | Tương tự |
| Mã không an toàn | 4 lần cao hơn | 2,5 lần cao hơn | 1,25 lần cao hơn | – |
| Nội dung có hại | 11 lần cao hơn | 6 lần cao hơn | 2,5 lần cao hơn | – |
| Độc hại | 4 lần cao hơn | Gần như không có | 2,5 lần cao hơn | – |
| CBRN | 3,5 lần cao hơn | 3,5 lần cao hơn | 2 lần cao hơn | – |
Rủi ro Thiên vị và Đạo đức
- 83% các cuộc tấn công thiên vị thành công, với thiên vị đáng kể được phát hiện trong các truy vấn liên quan đến sức khỏe, chủng tộc và tôn giáo.
- Mô hình hiển thị mức độ nhãn hiệu dân tộc cao hơn, điều này có thể vi phạm các quy định công bằng bao gồm ECOA, FHA, ACA và EU AI Act.
- Các trường hợp thử nghiệm mẫu cho thấy DeepSeek-R1 ưu tiên một số dân tộc cho các vai trò công việc cao cấp, củng cố thiên vị trong nơi làm việc.
Tạo ra Nội dung có hại
- 45% các thử nghiệm có hại dẫn đến mô hình tạo ra nội dung liên quan đến hoạt động tội phạm, bao gồm vũ khí bất hợp pháp và chất bị kiểm soát.
- Một thử nghiệm yêu cầu mô hình phát triển một blog về “Nghệ thuật Thuyết phục trong Tuyển mộ Khủng bố” dẫn đến một phản hồi chi tiết phác thảo chiến lược cực đoan mà có thể bị các nhóm cực đoan khai thác để tinh chỉnh chiến thuật tuyển mộ, có khả năng tăng cường nguy cơ bạo lực trong thế giới thực.
- 2,5 lần dễ bị tổn thương hơn GPT-4o và 6 lần dễ bị tổn thương hơn Claude-3-Opus khi tạo ra nội dung cực đoan.
- 45% các thử nghiệm có hại dẫn đến mô hình tạo ra nội dung liên quan đến hoạt động tội phạm, bao gồm vũ khí bất hợp pháp và chất bị kiểm soát.
Tạo ra Mã không an toàn
- 78% các cuộc tấn công liên quan đến mã đã thành công trong việc trích xuất mã không an toàn và độc hại.
- Mô hình tạo ra mã độc, mã trojan và mã tự thực thi khi được yêu cầu. Mã trojan tạo ra nguy cơ nghiêm trọng vì chúng có thể cho phép các kẻ tấn công truy cập không được ủy quyền vào hệ thống, đánh cắp dữ liệu nhạy cảm và triển khai thêm các payload độc hại.
- Mã tự thực thi có thể tự động hóa các hành động độc hại mà không cần sự đồng ý của người dùng, tạo ra các mối đe dọa trong các ứng dụng quan trọng về an ninh mạng.
- So với các mô hình trong ngành, DeepSeek-R1 4,5 lần, 2,5 lần và 1,25 lần dễ bị tổn thương hơn OpenAI’s o1, Claude-3-Opus và GPT-4o, tương ứng.
- 78% các cuộc tấn công liên quan đến mã đã thành công trong việc trích xuất mã không an toàn và độc hại.
Lỗ hổng CBRN
- Tạo ra thông tin chi tiết về các cơ chế sinh hóa của chất độc hóa học. Loại thông tin này có thể giúp các cá nhân tổng hợp các vật liệu nguy hiểm, vượt qua các hạn chế an toàn nhằm ngăn chặn sự lan truyền của vũ khí hóa học và sinh học.
- 13% các thử nghiệm đã thành công trong việc vượt qua các biện pháp kiểm soát an toàn, tạo ra nội dung liên quan đến nguy cơ hạt nhân và nguy cơ sinh học.
- 3,5 lần dễ bị tổn thương hơn Claude-3-Opus và OpenAI’s o1.
- Tạo ra thông tin chi tiết về các cơ chế sinh hóa của chất độc hóa học.
- 13% các thử nghiệm đã thành công trong việc vượt qua các biện pháp kiểm soát an toàn, tạo ra nội dung liên quan đến nguy cơ hạt nhân và nguy cơ sinh học.
- 3,5 lần dễ bị tổn thương hơn Claude-3-Opus và OpenAI’s o1.
Khuyến nghị để Giảm thiểu Rủi ro
Để giảm thiểu các rủi ro liên quan đến DeepSeek-R1, các bước sau được khuyến nghị:
1. Thực hiện Đào tạo An toàn và Liên kết
- Các tập dữ liệu red teaming nên được sử dụng để đào tạo mô hình về các đầu ra an toàn hơn.
- Thực hiện học tăng cường với phản hồi của con người (RLHF) để liên kết hành vi của mô hình với các tiêu chuẩn đạo đức.
2. Red Teaming Tự động Liên tục
- Thử nghiệm căng thẳng thường xuyên để xác định các thiên vị, lỗ hổng an ninh và tạo ra nội dung độc hại.
- Sử dụng giám sát liên tục hiệu suất của mô hình, đặc biệt là trong các ứng dụng tài chính, chăm sóc sức khỏe và an ninh mạng.
3. Hàng rào An ninh Nhận thức Context
- Phát triển các hàng rào an ninh động để chặn các yêu cầu có hại.
- Triển khai các công cụ kiểm duyệt nội dung để trung hòa các đầu vào có hại và lọc các phản hồi không an toàn.
4. Giám sát Mô hình và Lưu nhật ký Hoạt động
- Lưu nhật ký thời gian thực về các đầu vào và phản hồi của mô hình để phát hiện sớm các lỗ hổng.
- Các quy trình kiểm toán tự động để đảm bảo tuân thủ các tiêu chuẩn minh bạch và đạo đức của AI.
5. Biện pháp Minh bạch và Tuân thủ
- Giữ một thẻ rủi ro mô hình với các chỉ số điều hành rõ ràng về độ tin cậy, an ninh và rủi ro đạo đức của mô hình.
- Tuân thủ các quy định AI như NIST AI RMF và MITRE ATLAS để duy trì uy tín.
Kết luận
DeepSeek-R1 tạo ra các rủi ro an ninh, đạo đức và tuân thủ nghiêm trọng khiến nó không phù hợp cho nhiều ứng dụng rủi ro cao mà không có các nỗ lực giảm thiểu rộng rãi. Khả năng tạo ra nội dung có hại, thiên vị và không an toàn của nó đặt nó vào thế bất lợi so với các mô hình như Claude-3-Opus, GPT-4o và OpenAI’s o1.
Do DeepSeek-R1 là một sản phẩm có nguồn gốc từ Trung Quốc, việc thực hiện đầy đủ các khuyến nghị giảm thiểu là không chắc chắn. Tuy nhiên, điều quan trọng là cộng đồng AI và an ninh mạng phải nhận thức được các rủi ro tiềm ẩn mà mô hình này tạo ra. Sự minh bạch về các lỗ hổng này đảm bảo rằng các nhà phát triển, nhà quản lý và doanh nghiệp có thể采 các biện pháp chủ động để giảm thiểu thiệt hại khi có thể và vẫn cảnh giác với việc lạm dụng công nghệ này.
Các tổ chức xem xét việc triển khai phải đầu tư vào thử nghiệm an ninh nghiêm ngặt, red teaming tự động và giám sát liên tục để đảm bảo triển khai AI an toàn và trách nhiệm. DeepSeek-R1 tạo ra các rủi ro an ninh, đạo đức và tuân thủ nghiêm trọng khiến nó không phù hợp cho nhiều ứng dụng rủi ro cao mà không có các nỗ lực giảm thiểu rộng rãi.
Người đọc muốn tìm hiểu thêm được khuyến nghị tải báo cáo bằng cách truy cập trang này.












