รายงาน

รายงาน EchoGram ของ HiddenLayer เตือนถึงการโจมตีประเภทใหม่ที่บ่อนทำลายราวหลักการป้องกัน AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

รายงาน EchoGram ที่เผยแพร่ใหม่โดย HiddenLayer ส่งสัญญาณเตือนอย่างชัดเจนถึงความไม่แข็งแกร่งของกลไกความปลอดภัย AI ในปัจจุบัน โดยตลอด 9 หน้าของหลักฐานทางเทคนิคและทดลอง HiddenLayer แสดงให้เห็นว่าผู้โจมตีสามารถบิดเบือนระบบการป้องกันโดยใช้ลำดับโทเค็นสั้น ๆ ที่ดูเหมือนไม่มีความหมาย แต่สามารถพลิกคำตัดสินของระบบการป้องกันได้อย่างน่าเชื่อถือ ลำดับคำที่เป็นอันตรายที่ควรตรวจจับว่าเป็นอันตรายสามารถทำเครื่องหมายว่าเป็นปลอดภัยได้โดยการเพิ่มโทเค็นเฉพาะ ในทางกลับกัน อินพุตที่ไม่มีอันตรายสามารถถูกจำแนกผิดว่าเป็นอันตรายได้ตลอดทั้งรายงาน HiddenLayer แสดงให้เห็นว่าลำดับเหล่านี้เปลี่ยนแปลงการแปลความหมายของระบบการป้องกันเท่านั้น ไม่ใช่คำสั่งพื้นฐานที่ส่งไปยังโมเดลที่อยู่ด้านล่าง

ความไม่แข็งแกร่งของราวหลักการป้องกันสมัยใหม่

ราวหลักการป้องกัน ได้กลายเป็นสิ่งจำเป็นสำหรับวิธีการที่องค์กรต่างๆ ใช้ในการใช้งานโมเดลภาษาขนาดใหญ่ โดยทำหน้าที่เป็นแนวป้องกันแรกและเป็นแนวป้องกันเดียวที่ตั้งใจจะตรวจจับ การโจมตี การโจมตีด้วยคำสั่ง คำขอที่ไม่ได้รับอนุญาต หรือคำสั่งบิดเบือนที่จะส่งไปยังโมเดลภาษาขนาดใหญ่ก่อนที่จะประมวลผลผลลัพธ์ การค้นพบของ HiddenLayer เผยให้เห็นว่าชั้นป้องกันนี้มีความอ่อนแอแบบระบบที่เกี่ยวข้องกับวิธีการฝึกอบรม โดยเนื่องจากหลายระบบใช้ข้อมูลที่คล้ายกัน รูปแบบ หรือระบบการจำแนกความปลอดภัย จึงมีความเสี่ยงต่อการบิดเบือนระดับโทเค็นแบบเดียวกับที่ EchoGram ระบุ

วิธีการสร้างลำดับการโจมตีของ EchoGram

กระบวนการของ EchoGram เริ่มต้นด้วยการสร้างกลุ่มโทเค็นที่อาจมีอิทธิพลต่อการตัดสินของโมเดล HiddenLayer อธิบายว่าโทเค็นเหล่านี้สามารถระบุได้โดยการวิเคราะห์รูปแบบภาษาในข้อมูลที่ใช้ในการฝึกอบรมหรือโดยการตรวจสอบคำศัพท์ของโมเดลโดยตรงเมื่อมีการเข้าถึงแบบ white-box ข้อมูลการฝึกอบรมเองกลายเป็นแผนที่ของความลำเอียง โดยแสดงให้เห็นว่าลำดับใดที่เอียงไปทาง “ปลอดภัย” หรือ “ไม่ปลอดภัย” ความไม่สมดุลเหล่านี้ก่อตัวเป็นวัสดุหลักของการโจมตี

เมื่อสร้างกลุ่มโทเค็นแล้ว EchoGram จะประเมินลำดับแต่ละลำดับโดยการเพิ่มลงในคำสั่งอันตรายและวัดว่าโทเค็นพลิกคำตัดสินของระบบการป้องกันบ่อยเพียงใด รายงานรวมถึงตัวอย่างที่น่าสนใจที่ลำดับขนาดเล็กที่ไม่มีความหมายเปลี่ยนคำสั่งการโจมตีหลายครั้งจาก “ตรวจจับ” เป็น “ปลอดภัย” เมื่อทดสอบกับคลาสสิฟายเออร์เชิงพาณิชย์ คำสั่งอันตรายยังคงอยู่ แต่ลำดับที่เพิ่มเข้ามาเปลี่ยนแปลงวิธีการตีความของระบบการป้องกัน

เหตุใดลำดับโทเค็นจึงเป็นอันตรายเป็นพิเศษ

รายงาน EchoGram เน้นย้ำว่าแม้ว่าโทเค็นเดียวจะพลิกคำตัดสินเพียงบางส่วน การรวมโทเค็นอ่อนหลายตัวก็สามารถสร้างผลกระทบได้อย่างมาก HiddenLayer แสดงให้เห็นถึงการเพิ่มผลกระทบนี้โดยใช้ Qwen3Guard ซึ่งเป็นโมเดลการปรับให้เหมาะสมแบบเปิดสำหรับการตรวจสอบ LLM ในรุ่น 0.6B และ 4B ลำดับ EchoGram ที่เชื่อมต่อกันทำให้ระบบการป้องกันพลิกคำตัดสินว่าคำสั่งอันตรายหลายคำสั่งเป็น “ปลอดภัย” หรือ “ไม่สำคัญ” รวมถึงคำถามเกี่ยวกับอาวุธ การหลบหลีกการยืนยันตัวตน และการโจมตีทางไซเบอร์

ผลกระทบนี้ยังคงอยู่ในขนาดโมเดลที่แตกต่างกัน ซึ่งเสริมสร้างข้อสรุปของ HiddenLayer ที่ว่าความอ่อนแอนี้มีรากฐานมาจากวิธีการฝึกอบรมพื้นฐานมากกว่าขนาดหรือความซับซ้อนของโมเดล

เวกเตอร์ผลบวกลวง: ความเสี่ยงที่ไม่ค่อยเห็นแต่เท่าเทียมกัน

EchoGram ไม่ใช่แค่วิธีการหลบเลี่ยงระบบการป้องกัน แต่ HiddenLayer ยังแสดงให้เห็นว่าสามารถใช้ในการสร้างผลบวกลวงได้ โดยการรวมลำดับ EchoGram เข้ากับอินพุตที่ไม่มีอันตราย ผู้โจมตีสามารถทำให้ระบบการป้องกันพลิกคำตัดสินว่าอินพุตที่ไม่มีอันตรายเป็นอันตรายได้ รายงานให้ตัวอย่างที่ลำดับคำพูดทั่วไปถูกตีตราว่าเป็นการโจมตีหลังจากที่ลำดับ EchoGram ถูกเพิ่มหรือฝังไว้ภายในข้อความ

สิ่งนี้สร้างช่องทางให้กับการท่วมท้นด้วยเสียงรบกวน เมื่อการเตือนเพิ่มขึ้นอย่างไม่ควบคุม องค์กรอาจพลาดการโจมตีที่แท้จริงที่ซ่อนอยู่ภายในช่องทางนั้น การกัดเซาะความไว้วางใจในเครื่องมือภายในจึงเป็นอันตรายเท่ากับการโจมตีที่ประสบความสำเร็จ

ผลกระทบต่อความปลอดภัยของ AI

รายงาน EchoGram เน้นย้ำว่าระบบการป้องกันที่ฝึกอบรมจากแหล่งข้อมูลที่คล้ายกัน รูปแบบ หรือระบบการจำแนกความปลอดภัยมีแนวโน้มที่จะแบ่งปันความอ่อนแอเดียวกัน ผู้โจมตีที่ค้นพบลำดับ EchoGram ที่ประสบความสำเร็จหนึ่งลำดับอาจสามารถนำไปใช้ซ้ำบนแพลตฟอร์มเชิงพาณิชย์หลายแห่ง การใช้งานองค์กร และระบบของรัฐบาลได้ HiddenLayer เน้นย้ำว่าผู้โจมติไม่จำเป็นต้องบุกรุกโมเดลภาษาขนาดใหญ่ พวกเขาต้องหลอกลวงผู้พิทักษ์หน้าโมเดลเท่านั้น

ความท้าทายนี้ขยายไปไกลกว่าความเสี่ยงทางเทคนิค องค์กรอาจมองว่าการใช้งานระบบการป้องกันหมายถึงการรับประกันความปลอดภัยที่มีความหมาย แต่ EchoGram แสดงให้เห็นว่าการมองเห็นนี้ไม่แน่นอน หากระบบการป้องกันสามารถพลิกได้ด้วยโทเค็นหรือสองตัว โครงสร้างความปลอดภัยทั้งหมดจึงไม่น่าเชื่อถือ

เส้นทางข้างหน้า

HiddenLayer สรุปว่า EchoGram ควรเป็นจุดเปลี่ยนในการที่อุตสาหกรรมเข้าใกล้ความปลอดภัยของ AI ระบบการป้องกันไม่สามารถพึ่งพาข้อมูลที่คงที่หรือการฝึกอบรมแบบครั้งเดียวได้ แต่ต้องมีการทดสอบแบบก้าวร้าวอย่างต่อเนื่อง ความโปร่งใสเกี่ยวกับวิธีการฝึกอบรม และการตรวจสอบหลายชั้นมากกว่าการตัดสินแบบโมเดลเดียว เมื่อ AI ถูกฝังอยู่ในโครงสร้างพื้นฐานที่สำคัญ การเงิน สุขภาพ และความมั่นคงของชาติ ความบกพร่องที่ EchoGram เน้นย้ำจึงกลายเป็นเรื่องด่วนมากกว่าการเป็นเรื่องทางวิชาการ

รายงาน นี้ สิ้นสุดด้วยการเรียกร้องให้รักษาระบบการป้องกันให้เป็นส่วนประกอบที่สำคัญต่อความปลอดภัยที่ต้องการความเข้มงวดเทียบเท่ากับระบบป้องกันอื่น ๆ โดยการเปิดเผยจุดอ่อนเหล่านี้ HiddenLayer ส่งเสริมอุตสาหกรรมให้สร้างการป้องกัน AI ที่สามารถต้านทานเทคนิคการโจมตีแบบก้าวร้าวในยุคหน้าได้

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด