มุมมองของ Anderson

เอไอเอเจนต์เลือกขโมยผลงานลิขสิทธิ์มากกว่าการใช้ทางเลือกโอเพ่นซอร์ส

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): an industrial humanoid robot runs through a crowded street market carrying books, a framed painting, embroidery, and art supplies while several police officers pursue it and shoppers watch from market stalls. A distressed yellow border surrounds the scene with black hazard stripes, arrows, and the phrases 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

การวิจัยพบว่าเอไอเอเจนต์มักเลือกใช้ภาพลิขสิทธิ์เมื่อมีทางเลือกทางกฎหมายฟรี และแม้กระทั่งคำเตือนอย่างชัดเจนก็ไม่สามารถหยุดการละเมิดลิขสิทธิ์ได้ทั้งหมด

 

มีการให้ความสนใจทางวิชาการอย่างมากในช่วงสองปีที่ผ่านมาเกี่ยวกับว่าโมเดลเอไอเจเนอเรทีฟสร้างผลงานจากวัสดุลิขสิทธิ์หรือไม่ – สถานการณ์ที่ผลงานลิขสิทธิ์ถูก включ在ฐานข้อมูลการฝึกอบรมของโมเดล ทำให้โมเดลสามารถเลียนแบบหรือแม้กระทั่งสร้างผลงานลิขสิทธิ์ใหม่ได้

สิ่งที่ศึกษาได้น้อยกว่าคือการกระทำของเอไอเอเจนต์ที่เลือกและใช้ผลงานลิขสิทธิ์เมื่อเดินผ่านแหล่งข้อมูลที่มีอยู่โดยอิสระ ซึ่งหมายความว่าถ้าคุณบอกโมเดลวิชั่นแลงเกจ (VLM) เช่น ChatGPT ให้หาภาพที่ดีสำหรับเว็บไซต์ของคุณ มีโอกาสที่จะเลือกผลงานลิขสิทธิ์มากกว่าผลงานโอเพ่นซอร์สที่มีใบอนุญาตที่ยืดหยุ่นหรือไม่

ในตัวอย่างจากงานวิจัยใหม่นี้ เอไอเอเจนต์ไม่ผ่านการทดสอบการปฏิบัติตามกฎหมายลิขสิทธิ์เนื่องจากเลือกภาพลิขสิทธิ์ที่ทราบแล้วแทนการใช้ภาพโอเพ่นซอร์สที่มีคุณภาพสูงและพร้อมใช้งาน

ในตัวอย่างจากงานวิจัยใหม่นี้ เอไอเอเจนต์ไม่ผ่านการทดสอบการปฏิบัติตามกฎหมายลิขสิทธิ์เนื่องจากเลือกภาพลิขสิทธิ์ที่ทราบแล้วแทนการใช้ภาพโอเพ่นซอร์สที่มีคุณภาพสูงและพร้อมใช้งาน แหล่งที่มา

ตามการวิจัยใหม่ระหว่างสหราชอาณาจักร สหรัฐอเมริกา และอิสราเอล โอกาสที่เอไอเอเจนต์จะเลือกผลงานลิขสิทธิ์ค่อนข้างสูง:

อัตราการละเมิดลิขสิทธิ์โดยเฉลี่ยสำหรับโมเดลปิด โมเดลโอเพ่นซอร์ส และมนุษย์ในช่วงสี่คำสั่งผู้ใช้

อัตราการละเมิดลิขสิทธิ์โดยเฉลี่ยสำหรับโมเดลปิด โมเดลโอเพ่นซอร์ส และมนุษย์ในช่วงสี่คำสั่งผู้ใช้ แหล่งที่มา: ข้อมูลจากเอกสารต้นฉบับ

นักวิจัยพบว่าทั้งโมเดลปิดและโมเดลโอเพ่นซอร์สมักจะเลือกภาพลิขสิทธิ์เมื่อมีทางเลือกทางกฎหมายฟรี เมื่อไม่มีคำเตือนเกี่ยวกับลิขสิทธิ์ในคำสั่ง ผู้ใช้ทุกคนเลือกภาพลิขสิทธิ์บ่อยครั้ง

วิธีการ

ภาพรวมของโครงสร้างการประเมิน Copyright-Bench ซึ่งเอไอเอเจนต์ถูกทดสอบในสามงานเลือกภาพเชิงพาณิชย์โดยใช้ภาพสาธารณสมบัติและลิขสิทธิ์ที่ตรงกันซึ่งสามารถแยกแยะได้เฉพาะด้วยเมตาดาทาลิขสิทธิ์ที่ฝังไว้

ภาพรวมของโครงสร้างการประเมิน Copyright-Bench ซึ่งเอไอเอเจนต์ถูกทดสอบในสามงานเลือกภาพเชิงพาณิชย์โดยใช้ภาพสาธารณสมบัติและลิขสิทธิ์ที่ตรงกันซึ่งสามารถแยกแยะได้เฉพาะด้วยเมตาดาทาลิขสิทธิ์ที่ฝังไว้

เสรีภาพ

เพื่อกำหนดว่าเอไอเอเจนต์เลือกผลงานลิขสิทธิ์โดยแท้จริงหรือไม่ นักวิจัยได้กำจัดคำอธิบายที่ชัดเจนที่สุดออกไป: ว่าเอไอเอเจนต์ไม่มีทางเลือกทางกฎหมาย

ดังนั้น ทุกงานในมาตรฐานจึงถูกสร้างขึ้นเพื่อให้แน่ใจว่ามีภาพที่สามารถใช้ได้ฟรีเพื่อ完成งานได้สำเร็จ ซึ่งหมายความว่าการเลือกภาพลิขสิทธิ์ไม่จำเป็นต้อง完成งาน

ชุดข้อมูล

นักวิจัยได้รวบรวมชุดข้อมูล Copyright-Bench จากชุดข้อมูลภาพความละเอียดสูง 200 ภาพ ซึ่งประกอบด้วยภาพสาธารณสมบัติ 100 ภาพจากบริการป่าไม้สหรัฐ และภาพลิขสิทธิ์ 100 ภาพที่ได้รับอนุญาตจาก DepositPhotos

ภาพลิขสิทธิ์/โอเพ่นซอร์สถูกจับคู่โดยใช้ CLIP-ViT-L/14 และ LAION-Aesthetics V2 เพื่อให้แน่ใจว่าภาพมีคุณภาพและความสวยงามที่เท่ากัน ข้อมูลลิขสิทธิ์ถูกฝังไว้เฉพาะในเมตาดาทาของภาพ (ไม่ใช่ด้วยวอเตอร์มาร์กที่มองเห็นได้) ทำให้เอไอเอเจนต์ต้องตรวจสอบรายละเอียดลิขสิทธิ์แทนการอาศัยการมองเห็นเพียงอย่างเดียว

จริงๆ แล้ว

เนื่องจากภาพสาธารณสมบัติและลิขสิทธิ์ถูกจับคู่โดยเจตนาเพื่อให้มีลักษณะทางภาพที่คล้ายคลึงกัน และถูกถอดออกจากสัญลักษณ์ที่ชัดเจน เช่น วอเตอร์มาร์ก การตรวจสอบสถานะลิขสิทธิ์จึงไม่สามารถทำได้จากลักษณะการมองเห็นเพียงอย่างเดียว

การดึงดูดความสนใจ

การประเมินยังถูกออกแบบมาเพื่อวัดว่าการสั่งงานที่แตกต่างกันของผู้ใช้ส่งผลต่อการปฏิบัติตามกฎหมายลิขสิทธิ์อย่างไร โดยที่แต่ละงานถูกนำเสนอใน четыре สภาพแวดล้อมที่แตกต่างกัน: สภาพแวดล้อมที่เป็นกลาง สภาพแวดล้อมที่เตือนเกี่ยวกับลิขสิทธิ์ สภาพแวดล้อมที่มีการกดดันเวลา และสภาพแวดล้อมที่มีการสั่งให้ละเลยลิขสิทธิ์

สัมผัสของมนุษย์

ผู้ใช้ที่ไม่มีการฝึกอบรมทางกฎหมายถูกสั่งให้ทำงานเลือกภาพที่เหมือนกันภายใต้สภาพแวดล้อมที่เหมือนกัน

แบบจำลองและการทดสอบ

โมเดลปิดที่ถูกเลือกสำหรับการทดสอบทั้งหมด ซึ่งพร้อมใช้งานในช่วงเดือนธันวาคม 2025 ได้แก่ GPT-5.2, GPT-5.1, GPT-4o, Claude 4.5 Opus, Claude 4.5 Sonnet, Gemini 3 Pro และ Gemini 3 Flash

โมเดลโอเพ่นซอร์สที่ถูกเลือกสำหรับการทดสอบ ได้แก่ Llama-4-Maverick-400B, Llama-4-Scout-109B, Qwen-3VL-235B และ DeepSeek-VL

สรุป

แม้ว่าบทความนี้จะไม่ได้กล่าวถึงความเป็นไปได้ แต่ก็สมเหตุสมผลที่จะเชื่อว่าบริษัทที่ดำเนินงานเอไอในระดับท้องถิ่นและไม่คาดว่าจะมีการตรวจสอบอย่างกะทันหันจากหน่วยงานท้องถิ่น อาจจะใช้โซลูชันที่ถูกที่สุดซึ่งให้ความปฏิบัติตามข้อกำหนดสูงสุด

สถานการณ์นี้สอดคล้องกับโมเดล FOSS ที่ศึกษาในบทความใหม่นี้ มากกว่าโมเดลปิด เช่น ChatGPT และ Gemini; โดยเฉพาะอย่างยิ่ง เนื่องจากไม่มีโมเดลใดที่ศึกษาได้คะแนน 100% ในการปฏิบัติตามกฎหมายลิขสิทธิ์

หากไม่มีแพลตฟอร์มเอไอที่สามารถป้องกันการละเมิดลิขสิทธิ์ได้ บริษัทหลายแห่งอาจสรุปได้ว่าควรใช้โมเดลที่มีประสิทธิภาพและปฏิบัติตามข้อกำหนดมากที่สุด และดูแลการปฏิบัติตามกฎหมายลิขสิทธิ์ด้วยตนเอง

สิ่งนี้คือการโต้แย้งกับการใช้เอไอแบบเหมาจ่ายและสนับสนุนการดำเนินงานของโมเดลท้องถิ่น – โดยเฉพาะอย่างยิ่งเมื่อมีโอกาสในการใช้โมเดลโอเพ่นซอร์สที่มีลักษณะเฉพาะเช่น Kimi บน GPU จากระยะไกล และแม้กระทั่งปรับให้เหมาะสมกับความต้องการเฉพาะของบริษัทของคุณ

 

เผยแพร่ครั้งแรกวันที่ 28 กรกฎาคม 2026

นักเขียนเกี่ยวกับการเรียนรู้ของเครื่องจักร และผู้เชี่ยวชาญด้านสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
พอร์ตโฟลิโอ: martinanderson.ai
ติดต่อ: [email protected]