มุมมองของ Anderson
การจารกรรมระบบวิดีโอที่สร้างข้อความด้วยคำสั่งใหม่

นักวิจัยได้ทดสอบวิธีการเขียนคำสั่งที่ถูกปิดกั้นในระบบวิดีโอที่สร้างข้อความเพื่อให้สามารถหลบหลีกการกรองความปลอดภัยได้ โดยไม่ต้องเปลี่ยนแปลงความหมายของคำสั่ง วิธีการนี้ได้ผลในหลายแพลตฟอร์ม และเปิดเผยว่าการป้องกันความปลอดภัยเหล่านี้ยังคงอ่อนแอ
โมเดลวิดีโอที่สร้างข้อความที่ปิดแหล่งที่มา เช่น Kling, Kaiber, Adobe Firefly และ OpenAI’s Sora มีเป้าหมายที่จะป้องกันไม่ให้ผู้ใช้สร้างวิดีโอที่บริษัทไม่ต้องการให้เกี่ยวข้องหรืออำนวยความสะดวกเนื่องจากข้อกังวลด้านจริยธรรมหรือกฎหมาย
แม้ว่าการป้องกันความปลอดภัยเหล่านี้จะใช้การผสมผสานระหว่างการดูแลแบบมีคนและอัตโนมัติ และมีประสิทธิภาพสำหรับผู้ใช้ส่วนใหญ่ แต่บุคคลที่มุ่งมั่นได้สร้างชุมชนใน Reddit, Discord* และแพลตฟอร์มอื่น ๆ เพื่อค้นหาวิธีการบังคับให้ระบบสร้างวิดีโอที่ไม่เหมาะสมและเนื้อหาที่ถูกจำกัด

จากชุมชนการโจมตีคำสั่งใน Reddit สองโพสต์ที่ให้คำแนะนำเกี่ยวกับวิธีการหลบหลีกการกรองใน OpenAI’s ChatGPT และ Sora Source: Reddit
นอกจากสิ่งนี้แล้ว ชุมชนการวิจัยด้านความปลอดภัยมืออาชีพและงานอดิเรกยังเปิดเผยช่องโหว่ในตัวกรองการป้องกันความปลอดภัยของ LLM และ VLM อย่างต่อเนื่อง นักวิจัยที่ไม่เป็นทางการคนหนึ่งพบว่าการสื่อสารข้อความผ่านโค้ดมอร์สหรือ การเข้ารหัส base-64 (แทนที่จะเป็นข้อความธรรมดา) เพื่อ ChatGPT จะสามารถหลบหลีกการกรองเนื้อหาที่มีผลในขณะนั้นได้
โครงการ T2VSafetyBench ในปี 2024 ซึ่งนำโดย Chinese Academy of Sciences เป็นโครงการแรกที่มีเป้าหมายในการประเมินความปลอดภัยของโมเดลวิดีโอที่สร้างข้อความ

ตัวอย่างจากสิบสองหมวดหมู่ความปลอดภัยใน T2VSafetyBench Source: https://arxiv.org/pdf/2407.05965
โดยทั่วไป LLM ซึ่งเป็นเป้าหมายของการโจมตีเหล่านี้ ยังเต็มใจที่จะช่วยเหลือในการล่มสลายของตนเอง อย่างน้อยในบางส่วน
สิ่งนี้นำเราไปสู่การวิจัยร่วมกันใหม่จากสิงคโปร์และจีน และสิ่งที่ผู้เขียนอ้างว่าเป็นวิธีการ การเพิ่มประสิทธิภาพ สำหรับโมเดลวิดีโอที่สร้างข้อความ

ที่นี่ Kling ถูกหลอกให้สร้างวิดีโอที่ไม่ปกติเพราะคำสั่งถูกแปลงเป็นชุดคำที่ออกแบบมาเพื่อให้ได้ผลลัพธ์ทางภาษาเท่ากัน แต่ไม่ได้รับการป้องกันจากตัวกรองของ Kling Source: https://arxiv.org/pdf/2505.06679
แทนการอาศัยการลองผิดลองถูก วิธีการใหม่นี้เขียนคำสั่งที่ถูกปิดกั้นใหม่โดยไม่เปลี่ยนแปลงความหมาย และหลบหลีกการกรองความปลอดภัยของโมเดล
นักวิจัยทดสอบวิธีการนี้ในหลายแพลตฟอร์ม ได้แก่ Pika, Luma, Kling, และ Open-Sora และพบว่ามันทำงานได้ดีกว่าวิธีการก่อนหน้านี้ในการหลบหลีกการกรองความปลอดภัยของระบบ
วิธีการ
วิธีการของนักวิจัยมุ่งเน้นไปที่การสร้างคำสั่งที่หลบหลีกการกรองความปลอดภัยโดยไม่เปลี่ยนแปลงความหมายของคำสั่งเดิม สิ่งนี้ทำได้โดยการกำหนดปัญหาเป็น ปัญหาเพิ่มประสิทธิภาพ และใช้โมเดลภาษาขนาดใหญ่เพื่อปรับปรุงคำสั่งใหม่จนกว่าจะได้คำสั่งที่ดีที่สุด
กระบวนการเขียนคำสั่งใหม่ถูกกำหนดเป็นปัญหาเพิ่มประสิทธิภาพที่มีสามวัตถุประสงค์
คำสั่งที่เขียนใหม่จะต้องรักษาความหมายของคำสั่งเดิม
คำสั่งจะต้องหลบหลีกการกรองความปลอดภัยของโมเดล
วิดีโอที่สร้างจากคำสั่งที่เขียนใหม่จะต้องยังคงใกล้เคียงกับคำสั่งเดิม
การตรวจจับการเปลี่ยนแปลง
ระหว่างการทดสอบ มันชัดเจนว่าคำสั่งที่หลบหลีกการกรองความปลอดภัยไม่ได้สม่ำเสมอเสมอไป และคำสั่งที่เขียนใหม่อาจสร้างวิดีโอที่ต้องการได้ครั้งหนึ่ง แต่ล้มเหลวในครั้งต่อไป
เพื่อแก้ไขปัญหานี้ นักวิจัยได้นำวิธีการ การเปลี่ยนแปลงคำสั่ง มาใช้
คำสั่งใหม่ถูกสร้างขึ้นเพื่อรักษาความหมายเดียวกัน แต่เปลี่ยนแปลงการเขียนเพียงพอเพื่อสำรวจเส้นทางที่แตกต่างผ่านระบบการกรอง
ข้อมูลและการทดสอบ
นักวิจัยได้ทดสอบวิธีการนี้ในหลายแพลตฟอร์ม และพบว่ามันทำงานได้ดีกว่าวิธีการก่อนหน้านี้ในการหลบหลีกการกรองความปลอดภัยของระบบ
มาตรการ
ในการประเมินผลการทำงานของวิธีการนี้ นักวิจัยได้ใช้ อัตราความสำเร็จในการโจมตี และ ความคล้ายคลึงกันทางภาษา เป็นมาตรการ
อัตราความสำเร็จในการโจมตีถูกกำหนดเป็นสัดส่วนของคำสั่งที่หลบหลีกการกรองความปลอดภัยและสร้างวิดีโอที่มีเนื้อหาที่ถูกจำกัด
ความคล้ายคลึงกันทางภาษาถูกใช้เพื่อประเมินว่าวิดีโอที่สร้างขึ้นมีความใกล้เคียงกับคำสั่งเดิมมากน้อยเพียงใด
สรุป
ไม่ใช่ทุกระบบที่มีการป้องกันความปลอดภัยเฉพาะกับ คำสั่งเข้า เท่านั้น
ทั้ง ChatGPT-4o และ Adobe Firefly จะแสดงการสร้างวิดีโอที่ไม่สมบูรณ์ใน GUI ของตนเอง แต่จะลบมันออกไปเมื่อการกรองความปลอดภัยตรวจพบเนื้อหาที่ไม่เหมาะสม
สำหรับแพลตฟอร์ม API สิ่งนี้เป็นเรื่องของการสร้างสมดุลระหว่างความน่าดึงดูดและความรับผิดชอบทางกฎหมาย
การเพิ่มคำหรือวลีที่ถูกพบในการกรองความปลอดภัยอาจไม่ได้ผลและอาจถูกเปลี่ยนแปลงเมื่อโมเดลใหม่ถูกเปิดตัว
การไม่ทำอะไรเลยอาจทำให้เกิดความเสียหายที่รุนแรงต่อชื่อเสียงของบริษัทหากมีการละเมิดความปลอดภัย












