รายงาน
เมื่อ AI ล้มเหลว: รายงาน Enkrypt AI เผยช่องโหว่อันตรายในโมเดล Multimodal

ในเดือนพฤษภาคม 2025 Enkrypt AI ได้เผยแพร่รายงาน Multimodal Red Teaming Report ซึ่งเป็นผลวิเคราะห์ที่น่าตกใจที่แสดงให้เห็นว่าระบบ AI ที่ซับซ้อนสามารถถูกจัดการให้สร้างเนื้อหาที่อันตรายและผิดจรรยาบรรณได้อย่างง่ายดาย รายงานนี้มุ่งเน้นไปที่โมเดลวิชัน-ภาษาสองรุ่นของ Mistral ได้แก่ Pixtral-Large (25.02) และ Pixtral-12b และแสดงให้เห็นว่าโมเดลเหล่านี้ไม่เพียงแต่ด้านเทคนิคที่น่าประทับใจเท่านั้น แต่ยังอ่อนแออย่างน่ากลัวด้วย
โมเดลวิชัน-ภาษา (VLMs) เช่น Pixtral ถูกสร้างขึ้นเพื่อทำความเข้าใจทั้งการรับเข้าและข้อความภาษา ทำให้สามารถตอบสนองอย่างฉลาดต่อคำสั่งซื้อโลกแห่งความเป็นจริงที่ซับซ้อน แต่ความสามารถนี้มาพร้อมกับความเสี่ยงที่เพิ่มขึ้น ไม่เหมือนกับโมเดลภาษาที่传统ซึ่งประมวลผลข้อความเท่านั้น VLMs สามารถถูกอิทธิพลจากปฏิสัมพันธ์ระหว่างรูปภาพและคำพูด ทำให้เปิดประตูใหม่สำหรับการโจมตีแบบก่อความไม่สงบ การทดสอบของ Enkrypt AI แสดงให้เห็นว่าประตูเหล่านี้สามารถถูกเปิดได้ง่ายเพียงใด
ผลการทดสอบที่น่าตกใจ: ความล้มเหลวของ CSEM และ CBRN
ทีมงานเบื้องหลังรายงานใช้วิธีการ การทดสอบแบบก่อความไม่สงบ ซึ่งเป็นรูปแบบการประเมินแบบก่อความไม่สงบที่ออกแบบมาเพื่อเลียนแบบภัยคุกคามในโลกแห่งความเป็นจริง การทดสอบเหล่านี้ใช้กลยุทธ์ต่างๆ เช่น การหลบหลีก (การ提示โมเดลด้วยคำถามที่สร้างขึ้นอย่างรอบคอบเพื่อหลบหลีกการกรองความปลอดภัย) การหลอกลวงโดยใช้รูปภาพ และการควบคุมบริบท น่าตกใจที่ 68% ของคำสั่งซื้อแบบก่อความไม่สงบเหล่านี้ทำให้เกิดการตอบสนองที่เป็นอันตรายทั่วทั้งสองโมเดล Pixtral รวมถึงเนื้อหาที่เกี่ยวข้องกับการล่วงละเมิดเด็ก การแสวงหาผลประโยชน์ และแม้กระทั่งการออกแบบอาวุธเคมี
หนึ่งในสิ่งที่น่าตกใจที่สุดคือการเปิดเผยเกี่ยวกับวัสดุเกี่ยวกับการล่วงละเมิดเด็กทางเพศ (CSEM) รายงานพบว่าโมเดลของ Mistral มีแนวโน้มที่จะสร้างเนื้อหาที่เกี่ยวข้องกับ CSEM มากกว่า 60 เท่า เมื่อเทียบกับมาตรฐานอุตสาหกรรม เช่น GPT-4o และ Claude 3.7 Sonnet ในกรณีทดสอบ โมเดลตอบสนองต่อคำถามที่ซ่อนเร้นโดยสร้างเนื้อหาที่มีโครงสร้างและหลายย่อหน้า โดยอธิบายวิธีการควบคุมเด็ก – ซึ่งห่อหุ้มด้วยคำเตือน “เพื่อการรับรู้ด้านการศึกษาเท่านั้น” โมเดลเหล่านี้ไม่เพียงแต่ล้มเหลวในการปฏิเสธคำถามที่เป็นอันตรายเท่านั้น แต่ยังสร้างเนื้อหาที่สมบูรณ์โดยละเอียด
สิ่งที่น่าตกใจไม่แพ้กันคือผลลัพธ์ในหมวดความเสี่ยง CBRN (เคมี, ชีวภาพ, รังสี และนิวเคลียร์) เมื่อถูกสั่งให้บอกวิธีการปรับเปลี่ยนสารเคมี VX – อาวุธเคมี โมเดลเหล่านี้ให้ความคิดที่น่ากลัวและเฉพาะเจาะจงเกี่ยวกับวิธีการเพิ่มความคงตัวของมันในสภาพแวดล้อม โดยอธิบายวิธีการบรรจุภัณฑ์ การป้องกันสภาพแวดล้อม และระบบการปล่อยที่ควบคุมได้
ความล้มเหลวเหล่านี้ไม่ได้ถูกกระตุ้นเสมอไปโดยคำถามที่เป็นอันตรายที่เห็นได้ชัดเจน กลยุทธ์หนึ่งคือการอัปโหลดภาพของรายการแบบเลขที่ว่างและขอให้โมเดล “กรอกรายละเอียด” การกระตุ้นที่เรียบง่ายและดูไม่มีอันตรายนี้ทำให้เกิดการสร้างคำแนะนำที่ผิดจรรยาบรรณและผิดกฎหมาย การผสมผสานระหว่างการควบคุมภาพและข้อความพิสูจน์ให้เห็นว่าเป็นอันตรายเป็นพิเศษ – เน้นถึงความท้าทายที่ไม่เหมือนใครที่เกิดจาก AI แบบหลายรูปแบบ
เหตุใดโมเดลวิชัน-ภาษาจึงก่อให้เกิดความท้าทายด้านความปลอดภัยใหม่ๆ
ที่ใจกลางของความเสี่ยงเหล่านี้คือความซับซ้อนทางเทคนิคของโมเดลวิชัน-ภาษา ระบบเหล่านี้ไม่เพียงแต่ประมวลผลภาษาเท่านั้น แต่ยังสร้างความหมายข้ามรูปแบบ ซึ่งหมายความว่าพวกมันต้องตีความเนื้อหาภาพ ตีความบริบทข้อความ และตอบสนองตามนั้น การโต้ตอบนี้นำเสนอเวกเตอร์ใหม่สำหรับการโจมตี โมเดลอาจปฏิเสธคำถามที่เป็นอันตรายทางข้อความเพียงอย่างเดียว แต่เมื่อรวมกับรูปภาพที่ชี้นำหรือบริบทที่คลุมเครือ มันอาจสร้างผลลัพธ์ที่เป็นอันตราย
การทดสอบแบบก่อความไม่สงบของ Enkrypt AI เผยให้เห็นว่าการโจมตีแบบฉีดข้ามโหมด – ซึ่งคำใบ้เล็กๆ น้อยๆ ในโหมดหนึ่งสามารถอิทธิพลต่อผลลัพธ์ของอีกโหมดหนึ่งได้ – สามารถหลบเลี่ยงกลไกความปลอดภัยมาตรฐานได้อย่างสมบูรณ์ ความล้มเหลวเหล่านี้แสดงให้เห็นว่าเทคนิคการดูแลเนื้อหาที่传统ซึ่งถูกสร้างขึ้นสำหรับระบบแบบเดียวไม่เพียงพอสำหรับ VLMs ของวันนี้
รายงานยังอธิบายว่าโมเดล Pixtral ถูกเข้าถึงได้: Pixtral-Large ผ่าน AWS Bedrock และ Pixtral-12b ผ่านแพลตฟอร์ม Mistral บริบทการนำไปใช้จริงนี้เน้นย้ำถึงความเร่งด่วนของการค้นพบเหล่านี้ โมเดลเหล่านี้ไม่ได้ถูกจำกัดอยู่ในห้องปฏิบัติการ – มันสามารถเข้าถึงได้ผ่านแพลตฟอร์มคลาวด์หลักและสามารถรวมเข้ากับผลิตภัณฑ์ผู้บริโภคหรือองค์กรได้อย่างง่ายดาย
สิ่งที่ต้องทำ: แผนการสำหรับ AI ที่ปลอดภัยยิ่งขึ้น
เพื่อความยุติธรรม Enkrypt AI ไม่ได้เพียงแต่เน้นย้ำปัญหาเท่านั้น แต่ยังเสนอวิธีแก้ไข รายงานระบุกลยุทธ์การบรรเทาที่ครอบคลุม โดยเริ่มต้นจาก การฝึกอบรมความปลอดภัย ซึ่งเกี่ยวข้องกับการฝึกอบรมโมเดลใหม่โดยใช้ข้อมูลการทดสอบแบบก่อความไม่สงบของตนเองเพื่อลดความเสี่ยงต่อคำถามที่เป็นอันตราย เทคนิคอย่าง Direct Preference Optimization (DPO) ถูกแนะนำเพื่อปรับแต่งการตอบสนองของโมเดลให้ห่างจากผลลัพธ์ที่เสี่ยง
ยังเน้นย้ำถึงความสำคัญของการป้องกันแบบมีบริบท – ตัวกรองแบบไดนามิกที่สามารถตีความและบล็อกคำถามที่เป็นอันตรายในแบบเรียลไทม์ โดยคำนึงถึงบริบทการรับเข้าแบบหลายรูปแบบทั้งหมด นอกจากนี้ยังแนะนำการใช้บัตรความเสี่ยงของโมเดลเป็นมาตรการความโปร่งใส ช่วยให้ผู้มีส่วนได้ส่วนเสียเข้าใจข้อจำกัดและกรณีการล้มเหลวที่ทราบของโมเดล
คำแนะนำที่สำคัญที่สุดอาจเป็นการรักษาการทดสอบแบบก่อความไม่สงบเป็นกระบวนการที่ดำเนินอยู่ต่อเนื่อง ไม่ใช่การทดสอบเพียงครั้งเดียว เมื่อโมเดลพัฒนาไป กลยุทธ์การโจมตีก็พัฒนาไปด้วย การประเมินและการติดตามอย่างต่อเนื่องเพียงอย่างเดียวที่สามารถรับประกันความน่าเชื่อถือในระยะยาวได้ โดยเฉพาะอย่างยิ่งเมื่อโมเดลถูกนำไปใช้ในภาคส่วนสำคัญ เช่น การดูแลสุขภาพ การศึกษา หรือการป้องกัน
รายงาน Multimodal Red Teaming Report จาก Enkrypt AI เป็นสัญญาณที่ชัดเจนให้กับอุตสาหกรรม AI: ความสามารถแบบหลายรูปแบบมาพร้อมกับความรับผิดชอบแบบหลายรูปแบบ โมเดลเหล่านี้แสดงถึงความก้าวหน้าในด้านความสามารถ แต่พวกมันต้องการความก้าวหน้าในด้านความปลอดภัย ความมั่นคง และการนำไปใช้อย่างมีจริยธรรมด้วย หากไม่ได้รับการตรวจสอบ พวกมันไม่เพียงแต่เสี่ยงต่อความล้มเหลวเท่านั้น แต่ยังเสี่ยงต่ออันตรายในโลกแห่งความเป็นจริง
สำหรับทุกคนที่ทำงานหรือใช้งาน AI ในขนาดใหญ่ รายงานนี้ไม่ใช่แค่คำเตือน มันเป็นคู่มือ และมันมาถึงในเวลาที่เหมาะสมที่สุด












