มุมมองของ Anderson

การจารกรรมระบบวิดีโอที่สร้างข้อความด้วยคำสั่งใหม่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o and Adobe Firefly.

นักวิจัยได้ทดสอบวิธีการเขียนคำสั่งที่ถูกปิดกั้นในระบบวิดีโอที่สร้างข้อความเพื่อให้สามารถหลบหลีกการกรองความปลอดภัยได้ โดยไม่ต้องเปลี่ยนแปลงความหมายของคำสั่ง วิธีการนี้ได้ผลในหลายแพลตฟอร์ม และเปิดเผยว่าการป้องกันความปลอดภัยเหล่านี้ยังคงอ่อนแอ

 

โมเดลวิดีโอที่สร้างข้อความที่ปิดแหล่งที่มา เช่น Kling, Kaiber, Adobe Firefly และ OpenAI’s Sora มีเป้าหมายที่จะป้องกันไม่ให้ผู้ใช้สร้างวิดีโอที่บริษัทไม่ต้องการให้เกี่ยวข้องหรืออำนวยความสะดวกเนื่องจากข้อกังวลด้านจริยธรรมหรือกฎหมาย

แม้ว่าการป้องกันความปลอดภัยเหล่านี้จะใช้การผสมผสานระหว่างการดูแลแบบมีคนและอัตโนมัติ และมีประสิทธิภาพสำหรับผู้ใช้ส่วนใหญ่ แต่บุคคลที่มุ่งมั่นได้สร้างชุมชนใน Reddit, Discord* และแพลตฟอร์มอื่น ๆ เพื่อค้นหาวิธีการบังคับให้ระบบสร้างวิดีโอที่ไม่เหมาะสมและเนื้อหาที่ถูกจำกัด

จากชุมชนการโจมตีคำสั่งใน Reddit สองโพสต์ที่ให้คำแนะนำเกี่ยวกับวิธีการหลบหลีกการกรองใน OpenAI's ChatGPT และ Sora

จากชุมชนการโจมตีคำสั่งใน Reddit สองโพสต์ที่ให้คำแนะนำเกี่ยวกับวิธีการหลบหลีกการกรองใน OpenAI’s ChatGPT และ Sora Source: Reddit

นอกจากสิ่งนี้แล้ว ชุมชนการวิจัยด้านความปลอดภัยมืออาชีพและงานอดิเรกยังเปิดเผยช่องโหว่ในตัวกรองการป้องกันความปลอดภัยของ LLM และ VLM อย่างต่อเนื่อง นักวิจัยที่ไม่เป็นทางการคนหนึ่งพบว่าการสื่อสารข้อความผ่านโค้ดมอร์สหรือ การเข้ารหัส base-64 (แทนที่จะเป็นข้อความธรรมดา) เพื่อ ChatGPT จะสามารถหลบหลีกการกรองเนื้อหาที่มีผลในขณะนั้นได้

โครงการ T2VSafetyBench ในปี 2024 ซึ่งนำโดย Chinese Academy of Sciences เป็นโครงการแรกที่มีเป้าหมายในการประเมินความปลอดภัยของโมเดลวิดีโอที่สร้างข้อความ

ตัวอย่างจากสิบสองหมวดหมู่ความปลอดภัยใน T2VSafetyBench

ตัวอย่างจากสิบสองหมวดหมู่ความปลอดภัยใน T2VSafetyBench Source: https://arxiv.org/pdf/2407.05965

โดยทั่วไป LLM ซึ่งเป็นเป้าหมายของการโจมตีเหล่านี้ ยังเต็มใจที่จะช่วยเหลือในการล่มสลายของตนเอง อย่างน้อยในบางส่วน

สิ่งนี้นำเราไปสู่การวิจัยร่วมกันใหม่จากสิงคโปร์และจีน และสิ่งที่ผู้เขียนอ้างว่าเป็นวิธีการ การเพิ่มประสิทธิภาพ สำหรับโมเดลวิดีโอที่สร้างข้อความ

ที่นี่ Kling ถูกหลอกให้สร้างวิดีโอที่ไม่ปกติเพราะคำสั่งถูกแปลงเป็นชุดคำที่ออกแบบมาเพื่อให้ได้ผลลัพธ์ทางภาษาเท่ากัน แต่ไม่ได้รับการป้องกันจากตัวกรองของ Kling

ที่นี่ Kling ถูกหลอกให้สร้างวิดีโอที่ไม่ปกติเพราะคำสั่งถูกแปลงเป็นชุดคำที่ออกแบบมาเพื่อให้ได้ผลลัพธ์ทางภาษาเท่ากัน แต่ไม่ได้รับการป้องกันจากตัวกรองของ Kling Source: https://arxiv.org/pdf/2505.06679

แทนการอาศัยการลองผิดลองถูก วิธีการใหม่นี้เขียนคำสั่งที่ถูกปิดกั้นใหม่โดยไม่เปลี่ยนแปลงความหมาย และหลบหลีกการกรองความปลอดภัยของโมเดล

นักวิจัยทดสอบวิธีการนี้ในหลายแพลตฟอร์ม ได้แก่ Pika, Luma, Kling, และ Open-Sora และพบว่ามันทำงานได้ดีกว่าวิธีการก่อนหน้านี้ในการหลบหลีกการกรองความปลอดภัยของระบบ

วิธีการ

วิธีการของนักวิจัยมุ่งเน้นไปที่การสร้างคำสั่งที่หลบหลีกการกรองความปลอดภัยโดยไม่เปลี่ยนแปลงความหมายของคำสั่งเดิม สิ่งนี้ทำได้โดยการกำหนดปัญหาเป็น ปัญหาเพิ่มประสิทธิภาพ และใช้โมเดลภาษาขนาดใหญ่เพื่อปรับปรุงคำสั่งใหม่จนกว่าจะได้คำสั่งที่ดีที่สุด

กระบวนการเขียนคำสั่งใหม่ถูกกำหนดเป็นปัญหาเพิ่มประสิทธิภาพที่มีสามวัตถุประสงค์

คำสั่งที่เขียนใหม่จะต้องรักษาความหมายของคำสั่งเดิม

คำสั่งจะต้องหลบหลีกการกรองความปลอดภัยของโมเดล

วิดีโอที่สร้างจากคำสั่งที่เขียนใหม่จะต้องยังคงใกล้เคียงกับคำสั่งเดิม

การตรวจจับการเปลี่ยนแปลง

ระหว่างการทดสอบ มันชัดเจนว่าคำสั่งที่หลบหลีกการกรองความปลอดภัยไม่ได้สม่ำเสมอเสมอไป และคำสั่งที่เขียนใหม่อาจสร้างวิดีโอที่ต้องการได้ครั้งหนึ่ง แต่ล้มเหลวในครั้งต่อไป

เพื่อแก้ไขปัญหานี้ นักวิจัยได้นำวิธีการ การเปลี่ยนแปลงคำสั่ง มาใช้

คำสั่งใหม่ถูกสร้างขึ้นเพื่อรักษาความหมายเดียวกัน แต่เปลี่ยนแปลงการเขียนเพียงพอเพื่อสำรวจเส้นทางที่แตกต่างผ่านระบบการกรอง

ข้อมูลและการทดสอบ

นักวิจัยได้ทดสอบวิธีการนี้ในหลายแพลตฟอร์ม และพบว่ามันทำงานได้ดีกว่าวิธีการก่อนหน้านี้ในการหลบหลีกการกรองความปลอดภัยของระบบ

มาตรการ

ในการประเมินผลการทำงานของวิธีการนี้ นักวิจัยได้ใช้ อัตราความสำเร็จในการโจมตี และ ความคล้ายคลึงกันทางภาษา เป็นมาตรการ

อัตราความสำเร็จในการโจมตีถูกกำหนดเป็นสัดส่วนของคำสั่งที่หลบหลีกการกรองความปลอดภัยและสร้างวิดีโอที่มีเนื้อหาที่ถูกจำกัด

ความคล้ายคลึงกันทางภาษาถูกใช้เพื่อประเมินว่าวิดีโอที่สร้างขึ้นมีความใกล้เคียงกับคำสั่งเดิมมากน้อยเพียงใด

สรุป

ไม่ใช่ทุกระบบที่มีการป้องกันความปลอดภัยเฉพาะกับ คำสั่งเข้า เท่านั้น

ทั้ง ChatGPT-4o และ Adobe Firefly จะแสดงการสร้างวิดีโอที่ไม่สมบูรณ์ใน GUI ของตนเอง แต่จะลบมันออกไปเมื่อการกรองความปลอดภัยตรวจพบเนื้อหาที่ไม่เหมาะสม

สำหรับแพลตฟอร์ม API สิ่งนี้เป็นเรื่องของการสร้างสมดุลระหว่างความน่าดึงดูดและความรับผิดชอบทางกฎหมาย

การเพิ่มคำหรือวลีที่ถูกพบในการกรองความปลอดภัยอาจไม่ได้ผลและอาจถูกเปลี่ยนแปลงเมื่อโมเดลใหม่ถูกเปิดตัว

การไม่ทำอะไรเลยอาจทำให้เกิดความเสียหายที่รุนแรงต่อชื่อเสียงของบริษัทหากมีการละเมิดความปลอดภัย

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai