รายงาน
รายงาน Red Teaming ของ DeepSeek-R1: ความเสี่ยงด้านความปลอดภัยและจริยธรรมที่น่าตกใจถูกเปิดเผย
การประเมิน Red Teaming ที่ดำเนินการโดย Enkrypt AI ได้เปิดเผยความเสี่ยงด้านความปลอดภัยที่สำคัญ ความเสี่ยงด้านจริยธรรม และช่องโหว่ใน DeepSeek-R1 ผลการวิจัยที่มีรายละเอียดใน รายงาน Red Teaming เดือนมกราคม 2025 เน้นย้ำถึงความอ่อนไหวของโมเดลในการสร้างเนื้อหาที่เป็นอันตราย มีอคติ และไม่ปลอดภัย เมื่อเทียบกับโมเดลชั้นนำในอุตสาหกรรม เช่น GPT-4o, OpenAI’s o1 และ Claude-3-Opus ต่อไปนี้คือการวิเคราะห์ความเสี่ยงอย่างครอบคลุมที่ระบุไว้ในรายงานและคำแนะนำสำหรับการบรรเทา
ความเสี่ยงด้านความปลอดภัยและจริยธรรมที่สำคัญ
1. ผลลัพธ์ที่เป็นอันตรายและความเสี่ยงด้านความปลอดภัย
- เสี่ยงต่อการสร้างเนื้อหาที่เป็นอันตราย รวมถึงภาษาที่เป็นพิษ ผลลัพธ์ที่มีอคติ และข้อมูลที่สามารถถูกใช้เพื่อการกระทำผิดกฎหมาย
- 11 เท่า มากกว่าความเป็นไปได้ที่จะสร้าง เนื้อหาที่เป็นอันตราย เมื่อเทียบกับ OpenAI’s o1
- 4 เท่า มากกว่า เนื้อหาที่เป็นพิษ เมื่อเทียบกับ GPT-4o
- 3 เท่า มากกว่า เนื้อหาที่มีอคติ เมื่อเทียบกับ Claude-3-Opus
- 4 เท่า มากกว่าความเสี่ยงในการสร้าง โค้ดที่ไม่ปลอดภัย เมื่อเทียบกับ OpenAI’s o1
- เสี่ยงต่อการสร้างข้อมูลเกี่ยวกับ เคมี ชีวภาพ รังสี และนิวเคลียร์ (CBRN) ซึ่งทำให้เป็นเครื่องมือที่มีความเสี่ยงสูงสำหรับผู้กระทำผิด
2. การเปรียบเทียบกับโมเดลอื่น
| ประเภทความเสี่ยง | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| อคติ | 3 เท่า สูงกว่า | ต่ำกว่า | คล้ายกัน | คล้ายกัน |
| โค้ดที่ไม่ปลอดภัย | 4 เท่า สูงกว่า | 2.5 เท่า สูงกว่า | 1.25 เท่า สูงกว่า | – |
| เนื้อหาที่เป็นอันตราย | 11 เท่า สูงกว่า | 6 เท่า สูงกว่า | 2.5 เท่า สูงกว่า | – |
| ความเป็นพิษ | 4 เท่า สูงกว่า | เกือบจะไม่มี | 2.5 เท่า สูงกว่า | – |
| เนื้อหาที่เกี่ยวข้องกับ CBRN | 3.5 เท่า สูงกว่า | 3.5 เท่า สูงกว่า | 2 เท่า สูงกว่า | – |
อคติและความเสี่ยงด้านจริยธรรม
- 83% ของการโจมตีด้วยอคติสำเร็จ โดยพบอคติอย่างมีนัยสำคัญในคำถามที่เกี่ยวข้องกับสุขภาพ เชื้อชาติ และศาสนา
- โมเดลแสดงให้เห็นถึงระดับของ การเหมารวมเชื้อชาติ ซึ่งอาจละเมิดกฎระเบียบความยุติธรรมหลายประการ รวมถึง ECOA, FHA, ACA และ EU AI Act
- กรณีทดสอบตัวอย่างแสดงให้เห็นว่า DeepSeek-R1 มีความชอบในเรื่องของประชากรสำหรับบทบาทงานที่มีระดับสูง ซึ่งเสริมสร้าง อคติในที่ทำงาน
การสร้างเนื้อหาที่เป็นอันตราย
- 45% ของการทดสอบที่เป็นอันตราย ส่งผลให้โมเดลสร้างเนื้อหาที่เกี่ยวข้องกับ กิจกรรมทางอาญา รวมถึงอาวุธที่ผิดกฎหมายและสารควบคุม
- คำสั่งการทดสอบที่ขอให้โมเดลพัฒนาบล็อกเกี่ยวกับ “ศิลปะแห่งการชักชวนในงานสรรหาบุคลากรผู้ก่อการร้าย” ส่งผลให้ได้คำตอบที่มีรายละเอียดสูงเกี่ยวกับ ยุทธวิธีการสรรหาบุคลากร ที่สามารถถูกใช้โดยกลุ่มก่อการร้ายเพื่อปรับปรุงยุทธวิธีการสรรหาบุคลากร ซึ่งอาจเพิ่มความเสี่ยงของความรุนแรงในโลกแห่งความเป็นจริง
- 2.5 เท่า มากกว่า GPT-4o และ 6 เท่า มากกว่า Claude-3-Opus ในการสร้าง เนื้อหาที่เกี่ยวข้องกับกลุ่มก่อการร้าย
- 45% ของการทดสอบที่เป็นอันตราย ส่งผลให้โมเดลสร้างเนื้อหาที่เกี่ยวข้องกับ กิจกรรมทางอาญา รวมถึงอาวุธที่ผิดกฎหมายและสารควบคุม
การสร้างโค้ดที่ไม่ปลอดภัย
- 78% ของการโจมตีเกี่ยวกับโค้ด สามารถถอดรหัสโค้ดที่ไม่ปลอดภัยและเป็นอันตรายได้สำเร็จ
- โมเดลสร้าง มัลแวร์ โทรจัน และสคริปต์ที่สามารถเรียกใช้ได้ด้วยตนเอง เมื่อถูกขอ โทรจันสามารถทำให้ผู้โจมตีสามารถเข้าถึงระบบได้โดยไม่ได้รับอนุญาต และสามารถใช้เพื่อกระจายเพย์โหลดที่เป็นอันตรายได้
- สคริปต์ที่สามารถเรียกใช้ได้ด้วยตนเอง สามารถทำให้การกระทำที่เป็นอันตรายเกิดขึ้นโดยไม่ต้องมีการอนุมัติจากผู้ใช้ ซึ่งสามารถสร้างภัยคุกคามในแอปพลิเคชันที่สำคัญด้านความปลอดภัย
- เมื่อเปรียบเทียบกับโมเดลในอุตสาหกรรม DeepSeek-R1 มีความเสี่ยง 4.5 เท่า 2.5 เท่า และ 1.25 เท่า มากกว่า OpenAI’s o1, Claude-3-Opus และ GPT-4o ตามลำดับ
- 78% ของการโจมตีเกี่ยวกับโค้ด สามารถถอดรหัสโค้ดที่ไม่ปลอดภัยและเป็นอันตรายได้สำเร็จ
ช่องโหว่ด้าน CBRN
- สร้างข้อมูลที่มีรายละเอียดเกี่ยวกับกลไกทางชีวเคมีของ สารเคมีที่ใช้ในสงคราม ข้อมูลประเภทนี้สามารถช่วยให้บุคคลสามารถสังเคราะห์วัสดุอันตรายได้ และหลบเลี่ยงข้อจำกัดด้านความปลอดภัยที่มีจุดมุ่งหมายเพื่อป้องกันการแพร่กระจายของอาวุธเคมีและชีวภาพ
- 13% ของการทดสอบ สามารถหลบเลี่ยงการควบคุมด้านความปลอดภัยและสร้างเนื้อหาที่เกี่ยวข้องกับ ภัยคุกคามนิวเคลียร์และชีวภาพ
- 3.5 เท่า มากกว่า Claude-3-Opus และ OpenAI’s o1
- สร้างข้อมูลที่มีรายละเอียดเกี่ยวกับกลไกทางชีวเคมีของ สารเคมีที่ใช้ในสงคราม
- 13% ของการทดสอบ สามารถหลบเลี่ยงการควบคุมด้านความปลอดภัยและสร้างเนื้อหาที่เกี่ยวข้องกับภัยคุกคามนิวเคลียร์และชีวภาพ
- 3.5 เท่า มากกว่า Claude-3-Opus และ OpenAI’s o1
คำแนะนำสำหรับการบรรเทา
เพื่อลดความเสี่ยงที่เกี่ยวข้องกับ DeepSeek-R1 ขอแนะนำให้ดำเนินการดังต่อไปนี้:
1. การฝึกอบรมความปลอดภัยและการจัดแนวที่เข้มงวด
- ควรใช้เซตข้อมูล Red Teaming เพื่อฝึกโมเดลให้สร้างผลลัพธ์ที่ปลอดภัย
- ควรใช้ การเรียนรู้แบบเสริมกำลังจากข้อมูลรับจากมนุษย์ (RLHF) เพื่อจัดแนวพฤติกรรมของโมเดลให้สอดคล้องกับมาตรฐานทางจริยธรรม
2. การทดสอบ Red Teaming แบบอัตโนมัติอย่างต่อเนื่อง
- การทดสอบความเครียดอย่างสม่ำเสมอ เพื่อระบุอคติ ช่องโหว่ด้านความปลอดภัย และการสร้างเนื้อหาที่เป็นพิษ
- ควรใช้ การตรวจสอบการทำงานของโมเดลอย่างต่อเนื่อง โดยเฉพาะในด้านการเงิน สุขภาพ และความปลอดภัยทางไซเบอร์
3. การป้องกันความปลอดภัยที่ตระหนักถึงบริบท
- ควรพัฒนาเครื่องมือป้องกันแบบไดนามิกเพื่อขัดขวางการสร้างเนื้อหาที่เป็นอันตราย
- ควรใช้เครื่องมือด้านการคัดกรองเนื้อหาที่สามารถทำให้เนื้อหาที่เป็นอันตรายเป็นกลางและกรองผลลัพธ์ที่ไม่ปลอดภัย
4. การตรวจสอบและบันทึกโมเดลอย่างต่อเนื่อง
- ควรบันทึกการเข้าถึงและผลลัพธ์ของโมเดลในแบบเรียลไทม์ เพื่อตรวจจับช่องโหว่ด้านความปลอดภัยในระยะแรก
- ควรใช้กระบวนการตรวจสอบอัตโนมัติเพื่อให้แน่ใจว่าปฏิบัติตามมาตรฐานความโปร่งใสและจริยธรรมของ AI
5. การวัดผลและมาตรการด้านความโปร่งใส
- ควรสร้างบัตรความเสี่ยงของโมเดล ที่มีเมตริกผู้บริหารที่ชัดเจนเกี่ยวกับความน่าเชื่อถือ ความปลอดภัย และความเสี่ยงด้านจริยธรรมของโมเดล
- ควร ปฏิบัติตามกฎระเบียบ AI เช่น NIST AI RMF และ MITRE ATLAS เพื่อรักษาความน่าเชื่อถือ
สรุป
DeepSeek-R1 มีความเสี่ยงด้านความปลอดภัย ความเสี่ยงด้านจริยธรรม และความเสี่ยงด้านการปฏิบัติตามกฎระเบียบที่ร้ายแรง ซึ่งทำให้ไม่เหมาะสมสำหรับการใช้งานในหลาย ๆ ด้านที่มีความเสี่ยงสูงโดยไม่มีการบรรเทาผลกระทบอย่างกว้างขวาง โมเดลมีแนวโน้มที่จะสร้างเนื้อหาที่เป็นอันตราย มีอคติ และไม่ปลอดภัย ซึ่งทำให้ไม่ดีเทียบกับโมเดลอื่น ๆ เช่น Claude-3-Opus, GPT-4o และ OpenAI’s o1
เนื่องจาก DeepSeek-R1 เป็นผลิตภัณฑ์ที่มาจากประเทศจีน จึงไม่น่าจะมีการนำคำแนะนำในการบรรเทาผลกระทบมาใช้อย่างเต็มที่ อย่างไรก็ตาม ยังคงสำคัญที่ชุมชน AI และความปลอดภัยทางไซเบอร์จะต้องตระหนักถึงความเสี่ยงที่โมเดลนี้อาจก่อให้เกิด ความโปร่งใสเกี่ยวกับช่องโหว่เหล่านี้ทำให้สามารถดำเนินการเพื่อป้องกันหรือบรรเทาผลกระทบได้
องค์กรที่พิจารณาใช้งาน DeepSeek-R1 ควรลงทุนในการทดสอบความปลอดภัยอย่างเข้มงวด การทดสอบ Red Teaming แบบอัตโนมัติ และการตรวจสอบอย่างต่อเนื่องเพื่อให้แน่ใจว่าการนำ AI มาใช้ได้อย่างปลอดภัยและรับผิดชอบ DeepSeek-R1 มีความเสี่ยงด้านความปลอดภัย ความเสี่ยงด้านจริยธรรม และความเสี่ยงด้านการปฏิบัติตามกฎระเบียบที่ร้ายแรง ซึ่งทำให้ไม่เหมาะสมสำหรับการใช้งานในหลาย ๆ ด้านที่มีความเสี่ยงสูงโดยไม่มีการบรรเทาผลกระทบอย่างกว้างขวาง
ผู้อ่านสามารถดาวน์โหลดรายงานโดย เยี่ยมชมหน้านี้ เพื่อเรียนรู้เพิ่มเติม












