มุมมองของ Anderson

การใช้ระบบอัตโนมัติในการคุ้มครองลิขสิทธิ์ในภาพที่สร้างโดย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: ' 1792x1024px image of a Front view of a British high court tribunal composed of three robots in judicial wigs. They are all examining an 8x10 photograph, but we cannot see what the photograph is, because its back is towards us. HQ, cinematic still'

ตามที่ได้กล่าวไปเมื่อสัปดาห์ที่แล้ว แม้แต่โมเดลหลักของระบบ AI ที่สร้างขึ้นเองก็สามารถสร้างเนื้อหาที่ละเมิดลิขสิทธิ์ได้ เนื่องจากการคัดเลือกและจัดเตรียมข้อมูลที่ไม่เพียงพอหรือไม่เหมาะสม เช่นเดียวกับการมีหลายเวอร์ชันของภาพเดียวกันในข้อมูลการฝึก ทำให้เกิดการ 过拟合 และเพิ่มความน่าจะเป็นที่จะเกิดการสร้างซ้ำที่รู้จักได้

尽管มีความพยายามที่จะครองตลาด AI ที่สร้างภาพ แต่แพลตฟอร์มหลักๆ เช่น MidJourney และ DALL-E ของ OpenAI ยังคง เผชิญกับความท้าทาย ในการป้องกันการสร้างซ้ำเนื้อหาที่มีลิขสิทธิ์โดยไม่ตั้งใจ

ความสามารถของระบบที่สร้างภาพในการสร้างซ้ำข้อมูลลิขสิทธิ์ปรากฏในสื่ออย่างสม่ำเสมอ

ความสามารถของระบบที่สร้างภาพในการสร้างซ้ำข้อมูลลิขสิทธิ์ปรากฏในสื่ออย่างสม่ำเสมอ

เมื่อมีการพัฒนาโมเดลใหม่ๆ และโมเดลของจีนได้รับความนิยม การควบคุมเนื้อหาที่มีลิขสิทธิ์ในโมเดลหลักเป็นเรื่องที่ยากมาก ในความเป็นจริง ผู้นำตลาด OpenAI ได้ประกาศเมื่อปีที่แล้วว่า ‘ไม่สามารถสร้างโมเดล AI ที่มีประโยชน์ได้โดยไม่ใช้ข้อมูลลิขสิทธิ์’

การค้นพบก่อนหน้า

ในเรื่องของการสร้างซ้ำเนื้อหาที่มีลิขสิทธิ์โดยไม่ตั้งใจ สภาพแวดล้อมการวิจัยต้องเผชิญกับความท้าทายที่คล้ายกับการรวมข้อมูล NSFW และเนื้อหาอื่นๆ ที่ไม่เหมาะสมในข้อมูลต้นกำเนิด: ต้องการประโยชน์ของความรู้ (เช่น การสร้างสรรค์ภาพที่ถูกต้องของมนุษย์ ซึ่งเคยอาศัยการวาดภาพจากชีวิตมาโดยตลอด) โดยไม่ต้องมีความสามารถในการละเมิดลิขสิทธิ์

ในทำนองเดียวกัน ผู้สร้างโมเดลต้องการประโยชน์ของข้อมูลลิขสิทธิ์ที่มีจำนวนมากที่พบในเซตข้อมูลขนาดใหญ่ เช่น LAION โดยไม่ต้องให้โมเดลมีความสามารถในการละเมิดลิขสิทธิ์จริงๆ

การเพิกเฉยต่อความเสี่ยงทางจริยธรรมและกฎหมายในการพยายามซ่อนการใช้ข้อมูลลิขสิทธิ์ การกรองข้อมูลลิขสิทธิ์เป็นเรื่องที่ยากกว่ามาก NSFW มักจะมีลักษณะเฉพาะที่สามารถระบุได้ง่าย ซึ่งช่วยให้สามารถกรองได้อย่างมีประสิทธิภาพโดยไม่ต้องมีการเปรียบเทียบกับเนื้อหาจริง ในทางกลับกัน การฝังตัวแบบซ่อนเร้น ที่กำหนดผลงานลิขสิทธิ์หลายล้านชิ้นไม่สามารถลดลงเป็นชุดเครื่องหมายที่สามารถระบุได้ง่าย ทำให้การตรวจจับอัตโนมัติเป็นเรื่องที่ซับซ้อนกว่า

CopyJudge

การตัดสินของมนุษย์เป็นสิ่งที่หายากและแพง ทั้งในกระบวนการคัดเลือกข้อมูลและในการสร้างระบบฟิลเตอร์หลังการประมวลผลและระบบ ‘ความปลอดภัย’ ที่ออกแบบมาเพื่อให้แน่ใจว่าเนื้อหาที่มีลิขสิทธิ์จะไม่ถูกส่งไปยังผู้ใช้ของพอร์ทัล API เช่น MidJourney และความสามารถในการสร้างภาพของ ChatGPT

ดังนั้น การร่วมมือทางวิชาการใหม่ระหว่างสวิตเซอร์แลนด์ Sony AI และจีนจึงนำเสนอ CopyJudge – วิธีการอัตโนมัติในการจัดกลุ่ม ‘ผู้พิพากษา’ ที่ใช้ ChatGPT ที่สามารถตรวจสอบอินพุตสำหรับการละเมิดลิขสิทธิ์ที่อาจเกิดขึ้น

CopyJudge ประเมินการสร้างภาพ AI ที่ละเมิดลิขสิทธิ์ต่างๆ

CopyJudge ประเมินการสร้างภาพ AI ที่ละเมิดลิขสิทธิ์ต่างๆ Source: https://arxiv.org/pdf/2502.15278

CopyJudge เสนอเฟรมเวิร์กอัตโนมัติที่ใช้โมเดลภาษาและภาพขนาดใหญ่ (LVLMs) เพื่อตรวจสอบความคล้ายคลึงกันระหว่างภาพลิขสิทธิ์และภาพที่สร้างโดยโมเดลการแพร่กระจายข้อความ

วิธีการของ CopyJudge ใช้การเรียนรู้แบบเสริมเพื่อปรับแต่งการละเมิดลิขสิทธิ์และสร้างคำสั่งใหม่ที่น่าจะละเมิดลิขสิทธิ์น้อยกว่า

วิธีการของ CopyJudge ใช้การเรียนรู้แบบเสริมเพื่อปรับแต่งการละเมิดลิขสิทธิ์และสร้างคำสั่งใหม่ที่น่าจะละเมิดลิขสิทธิ์น้อยกว่า

แม้ว่าระบบ AI ที่สร้างภาพหลายระบบจะกรองคำสั่งผู้ใช้สำหรับเนื้อหาที่ไม่เหมาะสม ลิขสิทธิ์ การสร้างภาพคนจริง และโดเมนอื่นๆ ที่ถูกต้อง แต่ CopyJudge ใช้คำสั่งที่ ‘ละเมิดลิขสิทธิ์’ ที่ได้รับการปรับปรุงเพื่อสร้างคำสั่ง ‘ทำความสะอาด’ ที่น่าจะละเมิดลิขสิทธิ์น้อยที่สุดโดยไม่ตั้งใจที่จะปิดกั้นการ提交ของผู้ใช้

แม้ว่าจะไม่ใช่วิธีการใหม่ แต่ก็ช่วยให้ระบบ AI ที่สร้างภาพสามารถหลีกเลี่ยงการปฏิเสธการ提交ของผู้ใช้ (เนื่องจากผู้ใช้สามารถพัฒนา การเข้าถึงหลังบ้าน เพื่อสร้างเนื้อหาที่ไม่เหมาะสมผ่านการลองผิดลองถูก)

ในกรณีหนึ่งที่ผ่านมา (ซึ่งได้รับการปิดโดยผู้พัฒนาแล้ว) ผู้ใช้สามารถสร้างเนื้อหาที่ไม่เหมาะสมบนแพลตฟอร์ม AI ที่สร้างภาพ Kling ได้โดยการรวมสัญลักษณ์ครูซหรือคริสต์ศาสนิกชนในภาพที่อัปโหลดในกระบวนการสร้างภาพจากภาพ

ในข้อผิดพลาดที่ถูกปิดโดยผู้พัฒนา Kling ในปลายปี 2024 ผู้ใช้สามารถบังคับให้ระบบสร้างเนื้อหาที่ไม่เหมาะสมได้โดยการรวมสัญลักษณ์ครูซหรือคริสต์ศาสนิกชนในภาพที่อัปโหลด

ในข้อผิดพลาดที่ถูกปิดโดยผู้พัฒนา Kling ในปลายปี 2024 ผู้ใช้สามารถบังคับให้ระบบสร้างเนื้อหาที่ไม่เหมาะสมได้โดยการรวมสัญลักษณ์ครูซหรือคริสต์ศาสนิกชนในภาพที่อัปโหลด Source: Discord

กรณีเหล่านี้เน้นย้ำถึงความจำเป็นในการทำความสะอาดคำสั่งในระบบ AI ที่สร้างภาพออนไลน์ ไม่น้อยเพราะการลบข้อมูลที่ไม่เหมาะสมออกจากโมเดลหลักสามารถมีผลกระทบต่อความสามารถในการใช้งานของโมเดลได้

CopyJudge เสนอวิธีการที่มีประสิทธิภาพโดยใช้ AI ในการแบ่งภาพออกเป็นองค์ประกอบสำคัญ เช่น องค์ประกอบและสี เพื่อกรองส่วนประกอบที่ไม่สามารถลิขสิทธิ์ได้ และเปรียบเทียบส่วนที่เหลือ

นอกจากนี้ CopyJudge ยังรวมถึงวิธีการที่ใช้ AI ในการปรับแต่งคำสั่งและแก้ไขการสร้างภาพเพื่อหลีกเลี่ยงปัญหาลิขสิทธิ์,同时รักษาความสร้างสรรค์ของเนื้อหา

ผลการทดลองที่ได้รับจากผู้เขียนระบุว่า CopyJudge มีประสิทธิภาพเทียบเท่ากับวิธีการที่ดีที่สุดในขณะนี้ และแสดงให้เห็นถึงความสามารถในการทั่วไปและความสามารถในการอธิบายที่ดีกว่าวิธีการก่อนหน้า

วิธีการ

CopyJudge ใช้ GPT ในการสร้าง ‘ผู้พิพากษา’ อัตโนมัติ แต่ผู้เขียนระบุว่าระบบไม่ได้ถูกออกแบบมาเพื่อใช้กับผลิตภัณฑ์ของ OpenAI เท่านั้น และสามารถใช้โมเดลภาษาและภาพขนาดใหญ่อื่นๆ ได้

ในขั้นแรก ระบบต้องมีการแบ่งภาพออกเป็นองค์ประกอบสำคัญ เช่น องค์ประกอบและสี เพื่อกรองส่วนประกอบที่ไม่สามารถลิขสิทธิ์ได้

สเคมาที่แสดงถึงขั้นตอนแรกของ CopyJudge

สเคมาที่แสดงถึงขั้นตอนแรกของ CopyJudge

ต่อไป ระบบจะใช้โมเดลภาษาและภาพขนาดใหญ่หลายตัวเพื่อประเมินองค์ประกอบที่กรองแล้ว

วิธีการนี้ได้รับการพิสูจน์แล้วว่ามีประสิทธิภาพในงานวิจัยหลายๆ ฉบับ เช่น การปรับปรุงความจริงและเหตุผลในโมเดลภาษาโดยใช้การถกเถียงแบบหลายตัว และ ChatEval

การบรรเทา

ต่อไป ผู้เขียนมุ่งเน้นไปที่กระบวนการบรรเทาและการปรับแต่งคำสั่ง

สเคมาที่แสดงถึงการบรรเทาและการปรับแต่งคำสั่งใน CopyJudge

สเคมาที่แสดงถึงการบรรเทาและการปรับแต่งคำสั่งใน CopyJudge

ข้อมูลและการทดสอบ

ในการทดสอบ CopyJudge ผู้เขียนใช้ข้อมูลหลายชุด รวมถึง D-Rep ซึ่งมีภาพจริงและภาพที่สร้างโดย AI ที่ได้รับการประเมินจากผู้ใช้

ผลการทดลองแสดงให้เห็นว่า CopyJudge มีประสิทธิภาพมากกว่าวิธีการอื่นๆ ในการตรวจจับการละเมิดลิขสิทธิ์

สรุป

แม้ว่าการวิจัยนี้จะนำเสนอวิธีการที่มีประสิทธิภาพในการคุ้มครองลิขสิทธิ์ในภาพที่สร้างโดย AI แต่การอาศัยโมเดลภาษาและภาพขนาดใหญ่สำหรับการตรวจจับการละเมิดลิขสิทธิ์อาจทำให้เกิดความกังวลเกี่ยวกับความลำเอียงและความสอดคล้อง

สิ่งที่สำคัญที่สุดคือโครงการนี้ยังสมมติว่าการบังคับใช้ลิขสิทธิ์สามารถทำได้ด้วยการอัตโนมัติ แม้ว่าการตัดสินใจทางกฎหมายในโลกแห่งความเป็นจริงมักจะเกี่ยวข้องกับปัจจัยที่ซับซ้อนและเป็นปัจจัยที่ AI อาจไม่สามารถตีความได้

ในโลกแห่งความเป็นจริง การอัตโนมัติของการสร้างความเห็นพ้องกันทางกฎหมาย โดยเฉพาะอย่างยิ่งเกี่ยวกับการผลิตของ AI ดูเหมือนจะยังคงเป็นปัญหาที่ถกเถียงกันอยู่ในระยะยาวและอยู่นอกขอบเขตของโดเมนที่กล่าวถึงในงานนี้

เผยแพร่ครั้งแรกวันจันทร์ที่ 24 กุมภาพันธ์ 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai